HRM
受大脑层次化多时尺度启发的小模型推理架构,2700万参数即可完成复杂推理任务
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
受大脑层次化多时尺度启发的小模型推理架构,2700万参数即可完成复杂推理任务
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
sapientinc/HRM — 层次化推理模型,12491★ | Apache-2.0 | 2025年7月开源
想象一下:你正在解一道复杂的数独题,但大脑里同时有两个「你」在工作——一个站在高处俯瞰全局,指挥方向;另一个埋首细节,快速执行每一步计算。这正是 Hierarchical Reasoning Model(层次化推理模型,简称 HRM) 试图让 AI 学会的事情。
当前的 GPT-4、Claude 等大语言模型,推理主要靠 Chain-of-Thought(思维链,CoT)——把推理步骤一条条说出来,像学生在草稿纸上写过程。CoT 有三个公认难题:
第一,任务分解太脆弱。 模型需要人工设计 Prompt 或靠 CoT 数据引导,遇到训练没见过的新任务,很容易一步错步步错,分解路径不稳定。
第二,数据需求太大。 高质量推理数据(每道题附带完整推理步骤)是稀缺资源,标注成本极高。普通模型如果没有大规模 CoT 数据加持,复杂推理能力就上不去。
第三,延迟感人。 每次推理都要生成完整的中间步骤 token,生成速度慢、计算成本高。生产环境里用户等不起。
HRM 的论文(arXiv:2506.21734)2025年6月发布,作者团队来自 Sapient AI,提出的核心思路是:借鉴人脑的层次化多时尺度处理机制,让 AI 在单次前向传播中自主完成顺序推理,无需显式中间步骤监督。
图1:HRM 在 ARC 任务上的表现——用更少参数超越参数量大得多的模型
HRM 的架构设计是它最有趣的部分。作者设计了两个相互依赖的循环模块:
高级模块(High-level,简称 H 层)——慢速抽象规划者。负责在高层次上做战略规划,输出抽象的「指导向量」,给 L 层提供方向性信号。配置为 4 层 Transformer、2 个推理周期。
低级模块(Low-level,简称 L 层)——快速执行者。接收 H 层的抽象指令,在 token 级别做快速计算,输出最终答案。配置同样是 4 层、2 个周期。
两个模块之间通过 ACT(Adaptive Computation Time)机制 协调——H 层和 L 层各有多达 16 步推理空间(halt_max_steps=16),但通过 halt_exploration_prob=0.1 的概率提前终止,用多少步由模型自己决定,不必用满。
2700万参数(hidden_size=512、8头、expansion=4、RoPE 位置编码),在 1000 个训练样本的极小数据量下,展现出了令人惊讶的推理泛化能力。这比那些动辄几十亿参数的模型要「轻」得多。
HRM 的评估覆盖三类经典推理任务:
ARC(Abstraction and Reasoning Corpus) — 这是 AI 推理领域最难的数据集之一,考验模型的抽象类比能力。HRM 在 ARC 上超越了参数量大得多的基线模型。
数独(Sudoku) — 包括 Sudoku-Extreme 和 Sudoku-Hard 两个难度档次,测试精确的序列推理能力。HRM 接近完美表现。
大型迷宫(Large Maze) — 30×30 格子迷宫最优路径寻找,考验长程规划能力。HRM 同样接近最优。
训练只用了 ARC-Aug-1000(1000 个增强样本),没有预训练,没有 CoT 数据。这说明 HRM 的架构本身具备高效推理的归纳偏置,不是靠大数据堆出来的。
HRM 使用了自定义的 StableMax Cross Entropy 损失函数(ACTLossHead),替代标准交叉熵。这是一种数值稳定的 ACT 损失变体,避免了常规 ACT 在训练初期梯度爆炸的问题。
整个训练流程基于 PyTorch + Hydra 配置管理,支持 Weights & Biases(WandB)实验跟踪,预训练脚本(pretrain.py)和评估脚本(evaluate.py)齐全。
优点:
models/hrm/、dataset/、config/ 分层管理)puzzle_visualizer.html)和 ARC 评估 Notebook(arc_eval.ipynb)门槛:
适用人群: AI 研究者(尤其是推理/规划方向)、MLOps 工程师、以及想从零训练小模型做推理任务的同学。不适合普通用户直接部署使用。
数据规模存疑。 1000 样本训练在数独/迷宫上接近完美,但在更复杂的 ARC 子集上是否具备同等泛化能力,仍有待社区验证。ARC 包含 400+ 任务,1000 样本不可能覆盖所有任务类型。
任务类型局限。 当前评测集中在结构化谜题(数独、迷宫、ARC),尚未在开放式推理(数学证明、代码生成、对话规划)上验证。学术界对这类「谜题 benchmark」的价值本身也有争议——刷榜 ARC 不等于真正「会推理」。
资源门槛高。 虽然模型只有 27M 参数,但需要高端 GPU 和 CUDA 环境才能复现,普通开发者难以本地运行。
HRM 的核心价值在于:证明了通过架构创新(层次化 + ACT),小模型也能在复杂推理任务上与大模型一较高下,而不需要几百亿参数。
这与当前「参数量即正义」的路线形成了有趣对比。CoT 依赖大模型 + 大数据,HRM 则试图靠结构先验(inductive bias)减少对数据和参数的依赖。如果后续工作能在更多任务类型、更大规模上验证这一路线,将对端侧 AI 推理能力产生深远影响。
论文链接: arXiv:2506.21734 | 官网: sapient.inc | 开源协议: Apache-2.0