MiniMax-01
MiniMax 开源的 4560 亿参数 MoE 大模型,采用 Thunder Attention 混合注意力,支持百万级 token 超长上下文
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
MiniMax 开源的 4560 亿参数 MoE 大模型,采用 Thunder Attention 混合注意力,支持百万级 token 超长上下文
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你正在和一位「超级学霸」对话——它不仅能陪你聊文学、帮你写代码、解数学题,还能在你发一张图片后精准描述其中的细节,甚至根据图片生成一段故事。这位「学霸」的真实身份,就是 MiniMax 公司在 2025 年 1 月开源发布的 MiniMax-01 系列模型,一个包含文字模型 MiniMax-Text-01 和视觉-语言模型 MiniMax-VL-01 的完整开源全家桶。 2025 年 1 月,MiniMax 在 GitHub 上公开了 MiniMax-01 的技术报告和完整代码,迅速吸引了全球开发者和 AI 研究者的目光。这个项目不仅包含了业界领先的模型权重,还开源了详尽的技术实现细节和部署指南,让任何人都能在自己的服务器上复现和使用这套系统。在 GitHub 上线后短短数月便斩获超过 3400 颗星标,成为 2025 年上半年最受关注的大模型开源项目之一。
大语言模型(LLM)的核心技术是 Transformer 架构,而 Transformer 的核心是 Self-Attention(自注意力) 机制。简单理解,自注意力就是让模型在处理一段文字时,能够「全局审视」每一个词和其他所有词之间的关系——这赋予了 LLM 强大的上下文理解能力,但代价是:计算复杂度随上下文长度呈二次方增长。当上下文从 1 万 token 扩展到 100 万 token 时,计算量会暴增 100 倍,普通硬件根本吃不消。
打个生活化的比方:传统注意力机制就像一个图书馆管理员,每次有人借书,他都要把图书馆里所有书翻一遍才能给出推荐——书越多,效率越低。而 Linear Attention(线性注意力) 则像是给每本书贴上了智能标签,管理员只需要扫一眼标签就能快速定位,整个过程与图书馆藏书量成线性关系,效率稳定。
MiniMax-01 的核心技术突破在于提出了 Thunder Attention——一种硬件感知的线性注意力实现。它不是简单替换掉 softmax attention,而是采用混合注意力架构:每 7 层 Lightning Attention(线性注意力)之后插入 1 层标准 Softmax Attention。这种「7+1」交替结构既保留了线性注意力对长上下文的效率优势(处理 200 万 token 上下文时,生成速度比标准 Attention 快 5 倍以上),又通过少量 softmax attention 层维持了模型的表达能力和训练稳定性。
图 1:MiniMax-Text-01 在多项学术基准测试上的表现(来源:官方 GitHub 仓库)
MiniMax-01 系列包含两个模型: MiniMax-Text-01 是纯语言模型,总参数量达到 4560 亿(456B),但采用 Mixture of Experts(专家混合) 架构,每次推理时只有 459 亿(45.9B) 参数被激活——就像一个医院有 32 个专科医生,但每次看病只叫 2 个最相关的来会诊,节省了大量「闲人」的计算资源。 具体技术规格:
图 2:MiniMax-VL-01 在视觉-语言基准测试上的表现(来源:官方 GitHub 仓库)MiniMax 团队在项目中提供了详尽的中英文部署文档,降低了上手门槛。对于普通开发者,主要有两条部署路径:
路径一:Transformers 库(适合调试和小规模推理)
通过 HuggingFace Transformers 加载模型,配合 accelerate 做多卡并行。官方提供了 inference/minimax-text-01.py 和 inference/minimax-vl-01.py 两个参考脚本,支持 INT8 量化(通过 optimum-quanto 库)。对于 8 卡 H800 服务器,Text-01 可处理最高 200 万 token 的上下文,VL-01 提供完整的多模态理解能力。
路径二:vLLM(适合高并发生产环境)
MiniMax 官方推荐使用 vLLM 部署,认为其在吞吐量和内存管理方面表现最优。vLLM 支持 PagedAttention,能高效管理 KV-cache,配合 8×H800 可实现高吞吐量的在线推理服务。
对普通开发者的门槛说明:
从代码结构来看,MiniMax-01 仓库组织清晰:
/inference/ 目录下提供了 Transformer 和 vLLM 两种推理脚本/docs/ 目录下包含完整的中英文部署指南/evaluation/ 目录包含评测代码transformers、accelerate、vLLM,代码风格规范,文档质量极高——这是截至目前看到的最详尽的国产大模型开源仓库文档之一。LICENSE-MODELMiniMax-01 的开源在以下几个方面具有重要意义: