MiniMax-M1
全球首个开源权重的大规模混合注意力推理模型,80层Transformer+32 Expert MoE架构,18项基准测试与GPT-4o/Claude 4比肩
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
全球首个开源权重的大规模混合注意力推理模型,80层Transformer+32 Expert MoE架构,18项基准测试与GPT-4o/Claude 4比肩
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:MiniMax-M1 项目标识
2026年,随着大模型竞争进入白热化阶段,一个来自中国AI创业公司的开源项目打破了多项性能纪录——它在数学竞赛、代码生成、软件工程和长文本理解等18项权威基准测试中,与GPT-4o、Claude 4 Opus、Gemini 2.5 Pro等闭源巨头正面交锋,丝毫不落下风。这就是MiniMax-M1,全球首个开源权重的大规模混合注意力推理模型,由MiniMax公司发布,并在GitHub和HuggingFace上全面开放。
在MiniMax-M1出现之前,开源大模型社区长期面临一个尴尬局面:能力最强的模型(如GPT-4、Claude、Gemini)都是闭源的,只有大公司才能调用API使用;而开源模型虽然人人可用,但在复杂推理任务上的表现始终差强人意。MiniMax-M1的出现打破了这一格局——它将混合注意力(Hybrid Attention)机制与大规模MoE(混合专家)架构相结合,在保持开源透明性的同时,将推理能力推向了与商业顶尖模型比肩的高度。这个项目不仅代表了中国AI公司在基础模型研发上的深厚积累,也为整个开源社区提供了一条可复现的技术路径。
如果说普通Transformer是"全神贯注阅读整本书"的穷举式注意力,那么MiniMax-M1引入的MiniMax Attention(线性注意力)和StreamingLLM式滑动窗口注意力就像给模型装上了"快速定位索引"——对于短上下文,模型用标准全注意力精耕细作;对于长上下文,线性注意力负责高效处理海量token,滑动窗口注意力维持推理状态,三种注意力机制各司其职,形成了一套"智能分配注意力资源"的系统。这种混合架构的设计哲学与人类大脑处理信息的策略惊人相似:处理眼前的细节任务时全神贯注,回顾长期记忆时则快速扫描索引。这套架构使得MiniMax-M1在支持百万级token超长上下文的同时,保持了高效的推理速度。
支撑这套注意力系统的是规模惊人的80层Transformer decoder,配合32个Expert的稀疏MoE架构,每次推理只激活2个Expert——这种"专家路由"机制让模型在拥有接近万亿参数规模的同时,保持了可控的计算成本。Hidden size达到6144、64个注意力头、Head dim 128的关键配置,以及FP8训练所奠定的高精度基础,共同构成了这个"超级大脑"的硬件基础。从实际数据看,MiniMax-M1-80K版本在AIME 2024数学竞赛取得86.0分(仅次于Gemini 2.5 Pro和DeepSeek-R1-0528),SWE-bench软件工程测试56.0分(超过DeepSeek-R1和OpenAI-o3),长上下文理解OpenAI-MRCR 1M测试56.2分(与Gemini并列第一梯队)。
图2:MiniMax-M1 在 TextBench 基准测试中的表现
在工具调用(Function Calling)方面,MiniMax-M1基于新版ChatML模板设计,支持结构化函数调用,docs/目录下提供了完整的transformers和vLLM两种部署方式下的function calling使用指南。vLLM部署指南详细说明了如何用vLLM 0.9.2+ 部署服务,强调了8x H800(支持2M上下文)或8x H20(支持5M上下文)的硬件配置需求,以及生产级别的高吞吐量和智能内存管理特性。transformers部署指南则展示了Flash Attention 2加速的具体方法,通过--no-build-isolation方式安装并配合FP16加载可显著提升推理速度。
需要注意的是,MiniMax-M1的部署门槛并不低。模型权重通过HuggingFace分发(MiniMaxAI/MiniMax-M1-40k 和 MiniMaxAI/MiniMax-M1-80k 两个版本),int8量化推理需要至少8 GPU通过分布式方式运行(main.py中的world_size参数),普通开发者的单卡环境难以直接运行完整模型。此外,vLLM官方镜像v0.9.2尚未发布,当前只能用v0.8.3过渡版本。这对于希望快速尝鲜的开发者来说是一道不低的门槛。
但无论如何,MiniMax-M1的开源具有深远的行业意义。它证明了"开源权重+顶级性能"并非不可能三角,为学术界和中小团队提供了在自有硬件上运行SOTA推理模型的可能。随着vLLM等推理框架对MiniMax-M1的持续优化支持,以及后续可能出现的量化压缩方案落地,这套架构的技术红利有望进一步释放。对于关注大模型发展趋势的AI爱好者和开发者而言,MiniMax-M1是一个值得持续跟踪的重要里程碑。