seerai
dralkh/seerai加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你正在深夜赶一篇文献综述,电脑里堆满了上百篇 PDF,Zotero 书库里井井有条却无从下手——传统方式是 Ctrl+F 在每篇论文里反复横跳,而 SeerAI 让你直接开口问 AI:「这些论文里关于大语言模型微调的方法有哪些,各自效果如何?」
SeerAI 就是这样一款将 AI 能力深度嵌入 Zotero 9 的插件。它不是简单地在 Zotero 里塞一个聊天窗口,而是围绕学术研究的完整生命周期——从论文检索、阅读、提取、系统综述到写作辅助——提供了一套端到端的 AI 加持工作流。

每个做过文献综述的研究者都清楚那种无力感:开题时信心满满,真正开始读文献就陷入汪洋大海。Semantic Scholar、PubMed、arXiv、bioRxiv……每个数据库都有自己的一套检索逻辑,跨库搜索需要反复切换、逐个导出、合并去重。更痛苦的是,从 PDF 中提取结构化数据(样本量、方法、结论)全靠手工,一个 meta-analysis 可能要处理上百篇论文。
SeerAI 的开发者 dralkh 显然经历过这种煎熬。项目萌芽于对 Zotero 9 扩展生态的深度探索,最初只是一个让 AI 阅读 PDF 的小工具,经过十几个版本的迭代,逐步演变为今天这个功能密集的学术研究平台。其核心设计哲学是**「本地优先、隐私至上」**——你的论文数据不会离开本机,所有 AI 调用都需要你主动配置 API Key。
这是 SeerAI 最具差异化的功能。点开搜索面板,你可以同时向 Semantic Scholar、arXiv、PubMed、bioRxiv、medRxiv、IACR、Europe PMC、CORE、BASE、Zenodo 和 HAL 发出查询请求。系统会自动进行跨库去重和 rank fusion(排名融合),把结果合并为一份统一列表。
更聪明的是「AI 查询优化」模块:当你输入「transformer 在医学影像上的应用效果」这样的自然语言,它会调用 AI 一次性提取出核心概念和同义词,然后分别编译成每个数据库的原生查询语法。你不需要学习 11 种不同的检索语法,就能获得精确的跨库结果。
选中一篇或多篇论文,打开 SeerAI 侧边栏,直接用自然语言提问。系统会智能判断上下文优先级:Zotero 笔记(OCR 笔记)最高,其次是 PDF 索引文本,最后是 OCR 识别结果。这个分层策略既保证了响应质量,又避免了无意义的 token 消耗。
支持流式响应(token-by-token 实时渲染)、Markdown + LaTeX 数学公式、粘贴图片进行多模态分析,甚至可以直接生成图片、视频、语音。你还可以打开独立的浮动窗口(Ctrl+Shift+S),在浏览整个书库时保持对话不中断。
SeerAI 深度整合了系统性综述(Systematic Review)的标准流程:
这套工作流将原本分散在 Excel、RevMan、Python 脚本中的多个工具,统一到了 Zotero 一个界面里完成。
Per-context embeddings + 向量存储,支持对整篇论文进行语义检索。你可以让 AI 在你的书库里「大海捞针」,找出所有提到特定方法或数据集的论文,而不需要记住每篇论文的标题。
这是 meta-analysis 研究者的福音。创建一张表格,定义列标题和对应的 AI 提取提示词(比如「方法论」「样本量」「评估指标」),然后把论文拖进去。SeerAI 会自动批量调用 AI 逐篇提取,生成可导出为 CSV 的结构化数据表。
SeerAI 自带一个独立的 MCP 服务器(位于 mcp-server/ 目录),可以让外部 LLM(如 Claude Desktop)直接操控你的 Zotero 书库。内置 API 默认监听端口 23119,支持 chat、工具执行和书库管理。这实际上是把自己的 Zotero 书库变成一个可以被 AI Agent 调用的知识工具。
支持 Google Drive、Dropbox、Box、OneDrive、Nextcloud 的 OAuth 2.0 连接。书库外的 PDF 可以直接作为对话上下文使用,打通了本地书库和云端资源的边界。
AI Agent 不仅能回答问题,还能实际操作你的书库:搜索、创建笔记、打标签、管理集合、读写文件、生成引用。内置 ~148 个 Agent Skills(来自 K-Dense-AI/scientific-agent-skills),覆盖科学计算、生物信息学、文档生成等场景,Agent 在需要时按需加载,不需要全部预装。
SeerAI 的技术栈非常明确:TypeScript 为核心语言,zotero-plugin-toolkit 提供 Zotero 插件基础设施,Addon 逻辑分层组织在 src/modules/ 下。
| 模块 | 职责 |
|---|---|
addon.ts | 插件主入口,生命周期管理 |
hooks.ts | Zotero 事件钩子(PDF 导入、笔记变更等) |
modules/ | 各功能模块(chat、search、RAG、sysreview 等) |
mcp-server/ | 独立 MCP 协议服务,可脱离 Zotero 运行 |
skills/ | Agent 技能包目录 |
package.json 显示主要依赖包括:turndown(HTML→Markdown 转换)、mammoth(DOCX 解析)、docx-preview、katex(数学渲染)、gpt-tokenizer(token 计数)、zod(数据验证)。代码质量通过 ESLint + Prettier 规范,测试框架覆盖 extraction 和 pipeline 两大核心流程。
AI 框架层面:SeerAI 本身不包含训练或推理代码,而是一个模型路由层——通过统一的接口配置连接 OpenAI、Anthropic、Google、DeepSeek、Mistral、Groq 等商业 API,以及本地 Ollama/OpenAI-compatible 端点。图像生成依赖 DALL-E、Midjourney 等外部服务;OCR 支持 Mistral Cloud、DataLab.to 和本地 Marker。支持的本地模型显存分级从 4GB(Qwen3.5 2B)到 128GB(DeepSeek-V4-Pro)。
安装门槛:对于 Zotero 用户,下载 .xpi 文件安装极为简单;技术用户可从源码构建。真正的门槛在于 AI API Key 的配置——需要用户在各个服务(OpenAI/Mistral/Tavily/Semantic Scholar)注册账号并充值。
使用体验:第一次使用需要理解几个核心概念——上下文优先级策略(Notes > Indexed PDF > OCR)、Agent 工具集的范围、以及 RAG 的 chunking 策略。这些都有文档,但上手曲线对非 AI 研究者来说有一定陡度。
局限性:作为 Zotero 插件,它的体验完全受制于 Zotero 本身——不支持纯 Web 端或命令行使用;大量 AI 调用会产生不菲的 API 费用;本地模型的质量取决于用户硬件;跨库搜索虽然方便,但各数据库的 API 限流仍可能影响大批量检索。
SeerAI 代表了一个重要趋势:垂直领域的 AI Agent 正在从通用聊天窗口转向深度嵌入专业工具。在学术研究这个场景下,它不是替代研究者,而是将大量机械性的文献处理工作自动化——跨库检索去重、PDF 数据提取、meta-analysis 表格填充——让研究者把精力集中在真正需要判断力的工作上。
其系统综述模块尤为值得关注:PRISMA 流程的标准化程度和 AI 辅助筛选/提取的深度,在同类工具中处于领先。如果能进一步降低 API 成本(如引入更多本地推理选项),将具有极高的学术实用价值。