beaver-zotero
把 AI 研究助手装进 Zotero,扎根文献库实现句子级引用溯源与智能 PDF 标注
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
把 AI 研究助手装进 Zotero,扎根文献库实现句子级引用溯源与智能 PDF 标注
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

每个研究生都有过这样的经历:明明记得在某篇 PDF 里见过一个关键观点,翻遍文件夹却怎么都找不到。这种"脑子里有,但抓不住"的挫败感,消耗了学者们大量宝贵时间。
Beaver 解决的就是这个问题——它不是一个普通的 AI 聊天机器人,而是一个扎根在你个人文献库里的研究智能体。它住在 Zotero 里,读得懂你收集的每一篇论文,能在你阅读 PDF 的过程中随时回答问题、标注重点、对比文献。

图1:Beaver 在 LitQA2 基准测试上的表现(来源:项目官方文档)
学术研究的效率瓶颈,从来不在于文献太少,而在于文献太多却无法有效利用。一个认真做研究的博士生,Zotero 库里有几百篇论文是常态。但这些论文里的知识是"死"的——你只能靠记忆去关联它们。
传统的文献管理工具(Zotero、Mendeley、EndNote)只解决了"存"的问题,从未解决"用"的问题。2023 年大模型浪潮兴起后,很多人尝试用 ChatGPT 类工具辅助文献阅读,但面临两难:要么把论文内容粘贴给第三方,要么放弃隐私裸奔给 API。
Beaver 的作者 Jan-Lukas Gewie 敏锐地捕捉到了这个痛点,于 2024 年推出了这个项目——把 AI 能力直接嵌入 Zotero 插件,让 AI 和用户的文献库共生,而不是寄生在外部。
这是 Beaver 最有技术含量的功能。大多数 AI 阅读工具只能告诉你"这个观点在第 X 页",Beaver 能做到句子级引用——它会精确标注出支撑某个观点的具体段落,并生成可点击的跳转链接。
这背后的技术挑战远比表面看起来复杂:
Beaver 为此专门构建了评估体系,团队在 LitQA2 基准测试上进行了系统性评测,涵盖了检索准确性、引用精确度和事实正确性三个维度。
当你在 Zotero 中打开一篇 PDF,Beaver 侧边栏会自动识别你的阅读位置。你可以直接问:
Beaver 会在 Zotero 原生 PDF 阅读器中直接标注答案来源,无需切换到任何外部工具。
"帮我高亮关键发现"、"把所有与我的研究相关的段落标成蓝色"——这类自然语言指令 Beaver 都能理解并执行。生成的标注是真正的 Zotero 标注,会同步到你的 Zotero 库,完全可编辑,行为和手动标注无异。
Beaver 的检索不是简单的关键词匹配,它会综合使用:
最终给出一个有据可查的回答,每句话都标注了来源。
对于开发者,Beaver 还提供了一个 MCP (Model Context Protocol) 服务器,可以将你的 Zotero 文献库接入 Claude Desktop 等支持 MCP 的 AI 工具。这意味着你可以在任何 AI 应用里直接调用自己的文献库作为上下文。
Beaver 的代码仓库分为三个核心层:
1. addon/(Zotero 插件主体)
基于 zotero-plugin-template 构建,这是 Zotero 社区最成熟的开源插件模板。插件以 .xpi 包形式分发,Zotero 7.0+ 用户可直接从 Tools → Add-ons 安装。
2. react/(前端界面)
使用 React + Lexical(Meta 出品的富文本编辑器)构建交互式聊天界面。Lexical 在 Beaver 中主要用于渲染笔记编辑和引用展示,其原子化架构适合这种高度定制化的编辑器场景。
3. src/(命令行工具)
包含 beaver-extract CLI 工具,用于本地文件处理(PDF 文本提取),这是免费版实现本地 AI 功能的底层依赖。
后端基于 Supabase 构建(PostgreSQL + Auth + Edge Functions),负责模型调用、语义搜索向量存储和 API 路由。用户可使用自己的 API Key,也可以订阅 Beaver 的云服务。
主要依赖栈:
免费版功能已经非常完整:本地 PDF 文本提取、元数据搜索、语义搜索(标题+摘要)。所有 AI 功能通过用户自己的 API Key 驱动,隐私完全在自己手里。
付费版(beaverapp.ai 订阅)无需 API Key,团队版支持协作文献库,适合研究小组使用。
安装门槛并不高:只要你的 Zotero 版本是 7.0+,下载 .xpi 文件安装即可。但源码编译需要 Node.js >= 18 和 Supabase 环境变量配置,对普通用户来说偏复杂。
1. 云端强依赖: 免费版的语义搜索和 PDF 解析都需要 Supabase 后端,一旦网络不稳定,体验大打折扣。
2. 中文 PDF 支持: 项目主要面向英文学术文献,对中文 PDF 的 OCR 和解析支持尚未经过充分验证。
3. 开源许可证限制: 代码采用 AGPL-3.0 许可证,商业使用需注意合规。
4. 精度仍有提升空间: 在 LitQA2 评测中,虽然表现领先于通用大模型+互联网搜索方案,但在更复杂的跨论文推理任务上仍有明显短板。
Beaver 最大的价值不在于技术本身,而在于它定义了一种新的产品形态——嵌入式 AI 助手。它不是让用户去适应 AI,而是让 AI 去适应用户的工作流。
从增长数据看,GitHub 207+ stars、36 个 open issues,说明项目活跃度较高,社区参与积极。同时它也催生了类似 zotero-ai、zotero-gpt 等衍生项目,形成了以 Zotero 为中心的 AI 生态。
如果你是一个学术研究者,Beaver 值得尝试——尤其是免费版,基本零成本就能提升文献阅读效率。