arxiv-mcp-server
让 AI 助手直接搜索、下载、阅读 arXiv 论文的 MCP 服务器,文献调研效率提升 10 倍
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让 AI 助手直接搜索、下载、阅读 arXiv 论文的 MCP 服务器,文献调研效率提升 10 倍
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
作者:Joseph Blazick | 2837★ | Apache-2.0
想象一下:你在凌晨 2 点调试一个大模型项目,突然发现某篇 2023 年的论文里早已给出了这个问题的解决方案。你打开 Google Scholar,输入关键词,翻了三页广告,终于找到那篇 PDF,下载,打开,发现是 47 页的 PDF,密密麻麻的数学公式……等你读完摘要,太阳已经升起了。
如果你的 AI 助手能直接帮你读论文呢?arxiv-mcp-server 正是这样一座桥——它让 AI 助手直接连接 arXiv 预印本库,把论文搜索、下载、阅读、分析的全流程变成几次 API 调用,彻底省去人工翻找的麻烦。
arxiv-mcp-server 是一个基于 Model Context Protocol(MCP) 的论文搜索服务器,由独立开发者 Joseph Blazick 创建,发布仅一年多便积累了超过 2800 颗 GitHub 星标。它不是又一款「AI 读论文」网页应用,而是一个工具型 MCP 服务器——你把它接入 Claude Desktop、VS Code Copilot、Cursor 等 AI 编程环境,AI 就立刻拥有了操作 arXiv 的能力。
通俗来说,这就是一个给 AI 用的 arXiv 浏览器。传统方式下 AI 只能靠训练数据里的知识来回答学术问题,有了它,AI 可以实时检索最新预印本,把论文原文纳入上下文——知识的时效性从「训练截止日期」一下子拉到「今天」。
基础搜索与下载
通过 search_papers 工具,你可以用自然语言或关键词搜索 arXiv,支持按日期范围和学科分类过滤。例如:输入「transformer attention mechanism 2024」,服务器返回匹配的论文列表及摘要信息。确认目标后,download_paper 工具将论文 HTML 版本下载到本地(PDF 需额外安装 [pdf] 扩展)。
分块阅读与大论文处理
arXiv 上不少论文动辄 30-50 页,read_paper 工具支持 start + max_chars 分页参数,可以像读电子书一样分批获取内容,避免上下文溢出。这对于需要精读某些方法论章节时非常实用。
语义搜索(Pro 功能)
安装 [pro] 扩展后,服务器启用 semantic_search 工具,基于 sentence-transformers 模型对本地已下载的论文构建向量索引,支持语义相似度搜索。例如搜索「优化大模型推理速度的方法」,系统会返回内容语义最接近的相关论文,而不仅仅是关键词匹配。这对于文献综述阶段梳理某领域的技术演进路径特别有价值。
引用图谱
citation_graph 工具可以分析单篇论文的引用关系,构建该论文引用了哪些前置工作、被哪些后续论文引用的网络。这在追踪一个 idea 的起源、验证某个方法是否原创时非常有用。
主题监控
watch_topic 和 check_alerts 组合使用,可以订阅特定关键词的新论文推送——相当于给 arXiv 装了一个 RSS 机器人,定期把符合你兴趣的最新预印本送到 AI 上下文里。这对于需要持续追踪某个子领域进展的研究者来说,几乎是「论文闹钟」。
整体架构遵循 MCP 规范,分层清晰:
| 层级 | 职责 | 核心模块 |
|---|---|---|
| MCP Server | 协议层,统一暴露工具/提示词 | server.py(MCP SDK) |
| 工具层 | 业务逻辑封装,10 个工具 | tools/ 目录下各模块 |
| 资源层 | 本地论文存储与索引 | resources/papers.py |
| 提示词层 | 研究任务模板 | prompts/ 目录下各 prompt |
传输层支持两种模式:stdio(标准输入输出,本地 AI 助手主要方式)和 Streamable HTTP(远程部署场景)。HTTP 模式默认绑定 localhost,内置 DNS rebinding 保护,并通过 ALLOWED_HOSTS/ALLOWED_ORIGINS 实现访问控制,体现了作者在安全方面的考量。
依赖管理使用 uv 工具链而非传统 pip/pyenv,构建了高效的隔离环境。生产依赖精简(mcp、httpx、aiohttp、pydantic、uvicorn),可选扩展按需加载(PDF 解析、语义搜索),这种「核心最小化、扩展按需」的策略让基础安装包保持在几百 MB 以内。
安全模块是本项目的一个亮点。README 中有专门一节阐述 Prompt Injection 风险:arXiv 论文是未受信任的外部输入,恶意构造的论文可能嵌入对抗性指令,通过 AI 摘要或推荐环节「劫持」AI 行为。项目建议用户使用只读 MCP 配置、在多工具链路上保持警惕、将 AI 摘要视为数据而非指令——这种主动披露安全风险的态度在同类项目中相当少见。
方式一(推荐):uvx 一键启动
uv tool install arxiv-mcp-server
arxiv-mcp-server --storage-path ~/.my-papers
然后在 Claude Desktop 的 MCP 配置中添加:
{
"mcpServers": {
"arxiv": {
"command": "uv",
"args": ["tool", "run", "arxiv-mcp-server"]
}
}
}
方式二:Docker 部署
项目提供了多阶段构建的 Dockerfile,基于 ghcr.io/astral-sh/uv:python3.11-bookworm-slim 镜像,产出约 200MB 的精简镜像,适合在服务器上长期运行 HTTP 服务。
方式三:macOS 用户的一键包
作者提供了 .mcpb 打包文件,下载后直接拖入 Claude Desktop 安装,连 uv 都不需要,Python 环境到位即可。这对非技术背景的研究者非常友好。
arXiv 覆盖的局限:arXiv 以物理、数学、计算机科学为主,医学、生物、社会科学等领域的论文覆盖不足。如果你的研究方向不在 CS/Stats/Math 圈,这个工具的实用价值会打折扣。
PDF 解析质量:默认安装只处理 HTML 版本的论文。arXiv 上部分论文(尤其是较老的)仅提供 PDF,安装 [pdf] 扩展后依赖 pymupdf4llm,解析效果因排版复杂度而异。复杂 LaTeX 公式和图表的还原度不如直接读原始 PDF。
Prompt Injection 是真实威胁:项目文档明确承认了这一点,但真正的防护依赖用户在使用 AI 摘要时保持判断力——对于非技术背景用户,这个警告可能容易被忽略。
语义搜索需要额外配置:semantic_search 不是开箱即用,需要安装 [pro] 扩展(约 500MB 的 sentence-transformers 模型),对磁盘空间和首次索引时间有一定要求。
arxiv-mcp-server 的出现反映了一个趋势:AI 正在从「被动回答训练数据中的问题」向「主动检索最新外部知识」演进。这类 MCP 工具(类似的还有网络搜索、数据库查询、API 调用等工具)正在构建 AI 的「工具生态」,让大模型不再受困于知识截止日期。
从增长数据看,该项目自 2024 年发布以来 star 数持续攀升,是 MCP 生态中增长最快的垂直工具之一。它验证了一个需求:研究者、学生、工程师确实需要一个「让 AI 直接读论文」的标准化方案,而不是靠手动复制粘贴来喂给 AI。
随着 MCP 协议的普及,这类工具会越来越多——地图 MCP 服务器、数据库 MCP 服务器、代码仓库 MCP 服务器……arxiv-mcp-server 作为文献检索领域的先行者,已经在这个生态里占据了一个稳定的位置。
| 维度 | 评分 | 说明 |
|---|---|---|
| 功能完整性 | ★★★★★ | 搜索、下载、阅读、语义搜索、引用图、监控,六大功能覆盖研究全流程 |
| 安装便捷性 | ★★★★★ | uvx 一行命令搞定,Docker/一键包多途径可选 |
| 代码质量 | ★★★★☆ | 结构清晰,文档详细,安全意识良好,测试覆盖率较高 |
| 维护活跃度 | ★★★★☆ | 持续更新,版本迭代快(v0.5.0),issues 响应及时 |
| 安全标注 | ★★★★★ | 主动披露 Prompt Injection 风险,给出缓解建议 |
适合谁用:AI 研究人员、数据科学从业者、需要持续追踪前沿论文的学生和工程师,尤其是已经用 Claude Desktop 或 VS Code Copilot 作为日常编程环境的开发者。
不适合谁:主要研究非 CS 领域的学者(arXiv 覆盖不足)、需要处理大量扫描版 PDF 的场景(解析质量有限)。