Kimi-K2
国产万亿参数MoE大模型,320亿激活参数,Agent能力登顶全球开源,SWE-bench编程评测超
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
国产万亿参数MoE大模型,320亿激活参数,Agent能力登顶全球开源,SWE-bench编程评测超
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025年夏天,Moonshot AI(月之暗面)开源了其第三代大语言模型 Kimi K2,迅速引发 AI 社区的强烈关注。这个拥有 1 万亿总参数、320 亿激活参数 的混合专家(MoE)模型,在代码生成(SWE-bench)、工具调用(Tool Use)、数学推理等关键指标上全面超越 DeepSeek-V3、Qwen3-235B 等主流开源模型,成为开源大模型 Agent 能力的新标杆。
如果把传统大模型比作一个知识渊博的图书管理员——你能问它问题,它能给你答案,但无法替你执行任何操作;那么 Kimi K2 更像是一个配备完整工具箱的智能助理:不仅能理解你的需求,还能自主决定调用哪些工具、编写代码、操作 API,直到真正帮你把事情搞定。
这种从"问答"到"代理"的跨越,依赖于三个核心技术能力:工具调用(Tool Calling)、多步推理(Multi-step Reasoning) 和 长上下文理解(128K Context)。Kimi K2 的 Agentic Intelligence 设计,使其能够像人类一样,在复杂任务中边做边想、调用外部工具、修正错误路径,最终完成目标。
Kimi K2 采用了混合专家(Mixture-of-Experts,MoE)架构,总参数量高达 1 万亿,但每次推理仅激活约 320 亿参数(1T 总参 / 32B 激活,稀疏度约 3.2%)。其核心架构参数如下:
这种设计使得模型在保持强大能力的同时,大幅降低了推理计算成本。打个比方:如果把模型能力比喻为一座城市的服务能力,传统 Dense 模型就像每栋楼都要配齐所有服务人员,而 MoE 模型则是按需调度专业团队——总人员编制更多,但每天实际出勤的只是其中一小部分。
训练亮点方面,Kimi K2 采用了 Muon 优化器(一种专为 MoE 大规模训练设计的优化算法),在 15.5T tokens、零训练不稳定的情况下完成了预训练。同时团队开发了 MuonClip 技术来解决放大优化器规模时的稳定性问题。
Kimi K2 在多个权威基准测试中取得全球领先成绩,尤其在 Agent 相关任务 上表现尤为突出:
| 任务类别 | 基准测试 | Kimi K2 成绩 | 亮点 |
|---|---|---|---|
| 代码生成 | SWE-bench Verified(Agentic) | 65.8% Pass@1 | 开源 SOTA,超越 Claude Sonnet 4 |
| 代码生成 | LiveCodeBench v6 | 53.7% Pass@1 | 全球 SOTA |
| 工具调用 | Tau2 telecom | 65.8% Avg@4 | 远超 GPT-4.1 的 38.6% |
| 数学推理 | AIME 2024 | 69.6% Avg@64 | 全球 SOTA |
| 数学推理 | MATH-500 | 97.4% Acc | 接近满分 |
| 通用知识 | MMLU | 89.5% EM | 开源 SOTA |
| 中文能力 | C-Eval | 92.5% EM | 超越所有开源模型 |
特别值得注意的是,Kimi K2 在 SWE-bench Agentic Coding 评测(模拟真实软件工程师解决 GitHub Issue 的场景)中,以 65.8% 的单次尝试准确率大幅领先 DeepSeek-V3 的 38.8%,展现出强大的代码理解和自主修复能力。
Kimi K2 提供两个官方版本:
如果你想快速体验 Kimi K2 的对话和 Agent 能力,选择 Kimi-K2-Instruct;如果你希望在特定领域做深度定制,选择 Kimi-K2-Base 进行微调。
Kimi K2 的权重以 Block-FP8 格式存储在 HuggingFace,单个模型约 200GB+。当前官方推荐的推理引擎包括 vLLM >= 0.10.0rc1、SGLang、KTransformers 和 TensorRT-LLM。
最小部署规模需要 16 卡 H200/H20 集群(Tensor Parallel TP16),单节点无法运行。在大规模生产环境中,通常采用"数据并行+专家并行"(DP+EP)架构,将 Prefill 和 Decode 阶段分离部署,以获得更高吞吐。
从积极的角度看,这说明 Kimi K2 是一个真正为生产环境设计的大模型,而非实验室演示产品。但对普通开发者来说,门槛确实相当高——没有专业 GPU 集群,就无法本地部署。
对于普通用户,最便捷的方式是通过 Moonshot AI 官方 API 平台(platform.moonshot.ai)调用 Kimi K2,API 兼容 OpenAI 和 Anthropic 格式,现有应用无需大改即可切换。
Kimi K2-Instruct 内置了强大的工具调用能力。通过传入工具的 JSON Schema 描述,模型会自动判断何时需要调用工具、传入什么参数、解析什么返回值。以下是一个典型的天气查询工具调用流程:
tools = [{
"type": "function",
"function": {
"name": "get_weather",
"description": "查询城市天气",
"parameters": {
"type": "object",
"required": ["city"],
"properties": {"city": {"type": "string", "description": "城市名称"}}
}
}
}]
这一能力使 Kimi K2 能够连接真实世界的 API、数据库、代码执行环境,成为真正的 AI Agent 核心引擎。
尽管 Kimi K2 表现惊艳,但也存在一些客观局限:
Kimi K2 的发布,标志着国产大模型在 Agent 能力上已具备与国际顶尖模型正面竞争的实力。其在 SWE-bench、Tau2 等真实 Agent 评测上的领先,意味着开源社区终于有了一个真正能"干活"的 Agent 基座模型。
从更宏观的视角看,Kimi K2 代表了大模型发展的几个趋势:
项目信息:Star 10,810 | Fork 845 | 协议 Modified MIT | 模型发布于 HuggingFace moonshotai/Kimi-K2-Instruct
图1:Kimi 官方品牌标识