Kimi-K3
月之暗面前沿智能体平台,探索 LLM 前沿能力边界
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
月之暗面前沿智能体平台,探索 LLM 前沿能力边界
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025年,AI 行业迎来了一座新的技术里程碑。
当大多数模型还在千亿参数徘徊时,月之暗面(Moonshot AI)扔出了一颗"深水炸弹"——Kimi K3,一个总量达 2.8 万亿参数、激活 1040 亿、上下文窗口突破 100 万 token 的开源大模型。它不是简单地把参数堆上去,而是一套从注意力机制到稀疏化路由的完整架构创新。它是目前全球首个正式开源的 3T 级模型,标志着开源社区正式迈入"前沿智能"时代。
传统 Transformer 在深层网络中面临一个深层困境:信息在传递过程中不断被"洗掉",需要用残差连接来"救命"。Kimi K3 的团队没有修修补补,而是提出了 Attention Residuals(注意力残差,AttnRes)——让注意力层也像残差网络一样,将原始信号直接绕过深层处理。配合 Kimi Delta Attention(KDA) 的改良注意力机制,在 93 层网络(69 层 KDA + 24 层 Gated MLA)中实现了更稳定的信息流动。
如果把模型比作一家超大工厂,896 个"专家"各自负责不同的生产车间,但每个 token 只会叫来 16 个最合适的专家(16-out-of-896 稀疏路由)。这个设计叫做 Stable LatentMoE,意思是通过一个隐层变量来稳定每次选择哪些专家,保证生产线上不会出现"临时工扎堆"导致的质量波动。相比上一代 Kimi K2,整体计算效率提升了约 2.5 倍——相当于用更少的电费,产出了更多的产值。
很多模型是多模态"嫁接"——用一个单独的视觉编码器把图片转成文字 token,再喂给语言模型。这种方式在简单任务上凑合能用,但在复杂场景下(比如看图找 bug、看 CAD 图做芯片设计)就会露怯。
Kimi K3 采用 原生多模态架构,视觉编码器 MoonViT-V2(4.01 亿参数)与语言模型在同一个表示空间中联合训练。图像和文字从一开始就在同一个"频道"里对话,而不是靠翻译官来回传话。评测数据印证了这一点:Kimi K3 在 BrowseComp(91.2)、MCPMark-Verified(94.5) 等多模态基准上均处于领先位置。
100 万 token 的上下文窗口是什么概念?相当于一次可以处理约 200 万个汉字,或一个完整的中等规模代码仓库。这意味着你可以把一个 GitHub 仓库的完整代码一次性塞给 Kimi K3,让它帮你做全代码库的架构分析、重构方案设计,而不需要切分文档、反复上下文的麻烦操作。
在长程编码(Long-Horizon Coding)任务上,Kimi K3 展现了少见的稳定性——在 Terminal-Bench 2.1 中达到 88.3 分,在 FrontierSWE 中达到 81.2 分。背后是模型对超长依赖关系的建模能力,也是 KDA + AttnRes 架构在深层信息保留上的优势体现。
Kimi K3 并非在所有榜单上"屠榜"。在 GPQA Diamond(93.5)、DeepSearchQA F1(95.0)、MCPMark(94.5)等评测中,它处于第一梯队;但在 CritPt(23.4)、Agents' Last Exam(28.3)等高难度推理任务上,与 Claude Fable 5、GPT-5.6 Sol 等顶级闭源模型仍有差距。这符合一个规律:稀疏 MoE 架构在知识召回和工具使用类任务上优势明显,但在需要复杂多步推理的任务上,全参数密集模型仍有优势。
值得注意的一个亮点是 Terminal-Bench 2.1(88.3) 和 SWE-Marathon(42.0)——这是两个专门衡量 AI"在真实工程环境中工作"能力的基准。Kimi K3 在这两个指标上的表现,暗示它在代码开发自动化领域有实际落地潜力。

Kimi K3 官方标识,来源:GitHub 仓库 assets/kimi-logo.png
说了这么多技术亮点,必须直面一个问题:这东西普通人能用吗?
答案是:很难。 这个项目只发布了两样东西:模型权重文件(.safetensors)和一份详尽的技术报告 PDF。没有推理代码、没有 Dockerfile、没有 Web UI、没有 demo 页面。
2.8 万亿参数的完整模型,FP8 量化后仍有约 1.4TB,单卡 A100-80GB 根本塞不下。官方推荐的部署方式是集成到 vLLM 或 TGI 等推理引擎,硬件要求至少 8×A100-80GB 多卡并行。这意味着:从下载到跑起来,普通开发者可能要花数天时间做环境配置。
当然,HuggingFace 和 ModelScope 都提供了下载渠道,如果你只是想用 API 方式调用第三方托管的 Kimi K3 服务,门槛会低很多。
另外需要特别注意的是:Kimi K3 License 不是标准开源许可证。它明确禁止某些商业用途(如直接对外提供模型推理服务),这与 MIT/Apache 2.0 等宽松开源协议有本质区别。企业使用前务必仔细阅读 license 条款。
尽管部署门槛很高,Kimi K3 的开源本身意义重大。它是继 Llama、Mistral、DeepSeek 之后,开源大模型社区迎来的又一个重量级选手。相比 Llama 3.1 70B、K2.1 等主流开源模型,Kimi K3 是第一个在 3T 级别参数规模上公开权重的模型。
这意味着:全球的研究者第一次可以深入研究一个真正处于"前沿智能"量级的模型架构——KDA、AttnRes、Stable LatentMoE,这些技术创新不再只是论文里的公式,而是可以在本地跑起来、魔改起来的真实代码。对于 AI 研究社区来说,这是一份珍贵的"研究级"礼物。
总结: Kimi K3 是一次从架构创新到参数规模的全方位冲击,代表了开源大模型在 2025 年的前沿水位。它不适合"拿来即用"的场景,但为研究者和有算力的团队提供了宝贵的前沿研究素材。技术意义大于实用意义——但在这个时间点,这恰恰是最稀缺的东西。