academic-research-skills-codex
Codex/Claude Code 学术研究技能包,涵盖深度研究、论文写作、同行评审全流程,内置引用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Codex/Claude Code 学术研究技能包,涵盖深度研究、论文写作、同行评审全流程,内置引用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
凌晨两点,博士生肖然终于把文献综述熬完了,却发现引用的 47 条文献中有 3 篇根本找不到原文。他想起导师那句"AI 写的东西你最起码得能负责"——可现在连引用对不对都不知道,怎么负责?
这不是个例。2026 年一项覆盖 2.5M 篇论文、1.11 亿条引用的审计研究显示,保守估计 2025 年一年就产生了 14.7 万条幻觉引用。更扎心的是:这些假引用一旦进入正式发表的论文,85% 以上会一路存活到出版版本。
这就是 Academic Research Skills(学术研究技能包)试图解决的问题——不是用 AI 替代研究者,而是给研究者装一个"学术纠错雷达"。
2026 年 Nature 发表的 AI Scientist 是第一个端到端全自动 AI 研究系统:它生成的论文通过了 ICLR workshop 的盲审(评分 6.33,碾压 workshop 平均 4.87)。但它自己的 Limitations 章节也承认了结构性失败模式——幻觉结果、方法论伪造、引用捏造、框架锁定。
ARS 的设计哲学正是从这里来的:人类研究者 + AI 辅助,比纯自动或纯人工更能避开这些坑。它的 Stage 2.5 和 Stage 4.5 设置了 7 类阻断式诚信闸门,遇到高风险模式会直接停下来让人类把关。
这个 Codex 版则是专门为 OpenAI Codex 打包的"学术研究技能套装",核心功能和 Claude Code 版完全一致,只是适配了 Codex 的 skill 系统。
ARS Codex 版提供了五个深度集成的工作流,覆盖学术研究的全生命周期:
深度研究工作流(Deep Research):文献检索、系统性综述、荟萃分析、研究问题提炼、事实核查。不同于普通搜索工具的是,它内置了引用溯源机制,每一条引用都会记录来源锚点,方便后续审计。
学术论文写作工作流(Academic Paper):论文大纲规划(苏格拉底式对话,逐步厘清研究问题)、摘要撰写、引文格式化、AI 使用披露(ARS 风格校准功能会对比你过去的写作风格,防止生成内容"机器感"太强)、LaTeX/DOCX/PDF 格式指导。
论文评审工作流(Academic Paper Reviewer):模拟同行评审,生成结构化评审意见,提供评审校准模式(用你提供的黄金标准集测量 FNR/FPR)。v3.8 新增的引用审计功能(ARS_CLAIM_AUDIT=1)可以逐条检查引文是否真的支撑了文中的主张——5 类 HIGH-WARN 标注会在 formatter 端直接阻断可疑输出。
端到端流水线(Academic Pipeline):从研究问题到正式发表的全流程编排,整合了上述所有工作流,并在关键节点设置质量闸门。完整示例见仓库 examples/codex/full-pipeline-heqa-scope-transformation/ 目录。
实验规划工作流(Experiment Agent):实验设计规划、统计结果解读、可复现性验证、人类研究协议支持。
这是 ARS 最具差异化的能力。Zhao 等人的研究发现了一个触目惊心的现象:论文中引用某篇文献,实际是在支撑该文献根本没有提出的主张。ARS 对此的应对分为三个阶段:
ARS_CLAIM_AUDIT=1 审计模式,五类 HIGH-WARN 标注在终端直接 hard gate,阻止可疑输出进入最终文档这套体系不是"检测幻觉后提示用户",而是直接在论文生成阶段就用工程手段阻断。
安装极为简单,30 秒搞定:
/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills
安装完成后,在 Claude Code 里输入 /ars-plan 即可启动苏格拉底式对话,逐步规划论文结构。需要引文检查时用 /ars-citation-check,需要审稿意见时用 /ars-reviewer。
Codex 版本通过 skills/academic-research-suite/ 目录下的单一 SKILL.md 作为入口路由,按需加载对应工作流文件,避免一次性加载整个套装(ARS 完整内容超过 1000 个文件)。
必须承认几个现实问题:
首先,这仍然是辅助工具,不是免责金牌。ARS 可以帮你发现引文错误和逻辑漏洞,但研究问题的定义、方法的合理性、数据的解读,这些核心判断必须由人做出——作者最终还是要对论文内容负全责。
其次,引用审计功能目前依赖 Semantic Scholar API,API 的覆盖范围和响应速度会直接影响审计质量。学术诚信闸门虽然在关键节点设置了阻断机制,但闸门规则本身也需要持续人工维护和更新,以应对新型学术不端模式。
第三,Codex 版本和 Claude Code 版本在底层能力上可能存在差异(受各平台 skill 系统能力不同影响),建议在正式学术工作流中使用前先用小规模任务验证。
最后,这套工具采用 CC BY-NC 4.0 许可证,禁止商业使用,且要求在使用时进行 AI 披露——这不是隐藏 AI 协作,而是透明化。
ARS 反映了一个正在加速的趋势:从"用 AI 写论文"到"用 AI 把论文写得更好、更合规"。2025-2026 年,多项研究揭示了 AI 生成学术内容在引用准确性方面的系统性风险,而 ARS 选择了直面这个问题而不是回避。
它代表了一种更成熟的 AI 学术协作范式:AI 做脏活累活(搜文献、查格式、验引文),人做需要判断力的活(定义问题、选择方法、解读意义)。在 AI Scientist 证明"全自动 AI 写论文可以过审"之后,ARS 正在探索另一条路:如何让"半自动 AI 辅助"写得比全自动更好。