Raspberry
开源推理数据集项目,通过 CoT、反思、冥想等提示工程规范,为 LLM 注入「慢思考」能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源推理数据集项目,通过 CoT、反思、冥想等提示工程规范,为 LLM 注入「慢思考」能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有过这种感觉:问 AI 一个数学题,它秒给答案,但仔细一看,过程全错?
问题根源在于大多数语言模型的「快思考」模式——它们靠概率匹配答案,根本没有真正「想清楚」。而人类面对复杂问题时会「停下来想一想」,把推理步骤一步步写出来,这种能力在 AI 领域叫 Chain-of-Thought(CoT,思维链)。
Raspberry 就是一个专门为训练 AI「慢思考」能力而生的开源数据集项目。它由开发者 daveshap 创建,目标很纯粹:合成一批高质量的训练数据,让开源大模型也能具备近似于人类水平的推理、反思和多步规划能力。

图1:Raspberry 项目的核心隐喻——让 AI 学会「思考」
这个项目的意义在于:当前大多数开源模型的 CoT 能力相对较弱,而闭源模型(如 GPT-4、Claude)在这类任务上表现优异。Raspberry 希望打破这个差距,用开源数据集推动开源模型的推理能力。
Raspberry 采用了系统化的数据集构建流程,整个方法分为四个阶段:
项目计划合成 500 个跨领域的高难度用户查询,涵盖数学、编程、逻辑、推理、规划等多个维度。领域包括医学、科学、软件工程等经济价值高的行业。合成后,会使用评分标准(Rubrics)对每个样本进行质量评估和迭代优化。
这一步的核心挑战在于:查询不能太简单(模型不需要思考),也不能太难(当前模型根本无法解决)。找到「恰到好处的难度区间」是高质量训练数据的关键。
有了高质量的查询之后,下一步是生成答案。项目利用多种自动化提示策略,让模型(尤其是 Claude 这类已经具备 CoT 能力的模型)生成带推理链的答案。
关键洞察:Claude 在正确提示下,已经能展现 CoT 推理能力。通过精心设计的提示模板,可以让模型「思考后再回答」,而不是直接输出结论。
生成的数据需要经过严格的质量控制。使用 Rubrics 对 CoT 和自我批评(Self-Critique)样本进行评分,识别低质量内容。然后通过一系列提示工程操作,将答案清洗为单一、连贯的响应——这正是「单次推理者(Single-Shot Reasoner)」数据集的核心格式。
前三个阶段完成后,团队会用生成的数据集微调一个模型,作为 Proof of Concept 验证效果。如果效果达标,再考虑扩大规模。
项目最核心的内容是 system.md 文件,它定义了一套完整的 AI 问题解决系统提示工程规范,包含四种核心认知技术:
使用 XML 风格的标签结构化 AI 的思维过程。AI 可以在思考过程中使用任意标签,包括元认知、计划、尝试、重试、自我批评等。
这一技术受人类认知科学启发:把「思考过程」外化为文本,可以让模型更系统地处理复杂问题,而不仅仅是匹配训练数据中的模式。
比 CoT 更广义、更拟人化的思维方式。模型仍然使用 XML 标签结构化思维,但范围更广,强调深度分析和主动规划。
System 2 Thinking 的核心思想来自诺贝尔经济学奖得主 Daniel Kahneman 的著作《Thinking, Fast and Slow》——人类有「快系统」(直觉反应)和「慢系统」(深思熟虑),AI 模型同样可以通过提示工程模拟这种双系统架构。
递归式自我审视:模型在生成输出的同时,实时「反思」自己的推理过程,发现错误及时修正。这是一种认知阻尼(Cognitive Damping)机制,防止模型陷入循环论证或错误推理。
Reflection 的价值在于:传统模型的推理是单向的,而具备 Reflection 能力的模型可以「回头检查」,形成类似人类「事后复盘」的认知闭环。
这是 Raspberry 项目最独特的技术创新:通过生成大量重复字符(如「......................................」)让模型「暂停工作」,在重复模式中「深度思考」,从而更新内部状态。
其理论基础是:Transformer 模型有编码器和解码器,具有极其复杂的内部表征空间。重复输入可以「重置」模型的内部注意力分布,为新模式腾出空间——类似于人类冥想时「放空大脑」的状态。
system.md 中透露了一个关键信息:当前输出窗口设置为 8192 tokens,平均每次输出约 3000 tokens。
这背后有一个重要的研究结论:推理时计算(Inference-Time Compute) 已被证明可以将模型智能提升约 100,000 倍训练数据的效果。换句话说,让模型「多思考一会儿」比给它更多训练数据更有效。
这一发现对于资源有限的团队尤其有意义:与其训练更大的模型,不如在推理时分配更多计算资源。
另外,项目要求输出的最终答案必须包裹在 <<<END>>> 标签内,这是为了将模型的「内心独白」和「最终答案」分离——推理过程对用户可见但默认隐藏,最终答案才是用户看到的部分。
Raspberry 不仅仅是一个研究项目,它的数据和提示工程模板有广泛的实际用途:
对 AI 研究者的价值: 提供了可以直接复现的 CoT/反思/冥想训练数据集构建流程,可以在自己的模型上验证效果。
对 AI 开发者的价值: system.md 中的提示工程模板可以直接迁移到其他项目中,用于提升任何 LLM 的复杂问题处理能力,无需额外的模型微调。
对数据集构建者的价值: 项目展示了一套从「需求定义」到「质量评估」的系统化数据集构建方法论,可以作为其他训练数据集项目的参考模板。
诚实地看,Raspberry 目前还处于非常早期的阶段:
数据量有限: 计划合成 500 个查询,而业界顶级推理数据集(如 OpenAI 的 GSM8K、BBH)通常包含数千到数万个样本。500 个查询对于微调出一个强推理模型可能不够。
尚无实测结果: 项目尚未完成第四步(微调验证),目前只有方法论和提示工程规范,实际效果有待验证。
依赖闭源模型生成数据: CoT 和自我批评数据使用 Claude 生成,数据质量上限受限于 Claude 的能力,且引入了对闭源 API 的依赖。
冥想技术的争议性: Meditation(通过重复字符更新模型状态)这一技术相对新颖,其有效性和泛化性在学术圈尚无充分验证。
Raspberry 代表了当前 AI 领域的一个重要趋势:从「更大模型」到「更好推理」的范式转变。
随着 GPT-4、Claude、DeepSeek 等模型展示出强大的 CoT 能力,业界越来越认识到:推理能力不能仅靠增加参数和训练数据来获得,还需要专门的推理训练。Raspberry 正是这一趋势的产物。
如果项目按计划推进并获得资金支持,下一步可能扩展数据集规模,建立更完善的基准测试(benchmarking),甚至通过强化学习(RL)直接发布一个具备强推理能力的开源模型权重。这将是开源社区对闭源推理模型的又一次有力追赶。
目前项目已在 GitHub 上获得 419 颗星,MIT 许可证,属于活跃的开源研究项目。对于关注 AI 推理能力和开源训练数据的开发者来说,这是一个值得关注的早期探索。
本报告基于 daveshap/Raspberry GitHub 仓库(v0.1)分析生成,数据截止 2026-04-14。