gpt-oss
OpenAI 开源的首批 MoE 大语言模型,含 120B 和 20B 两款,Apache 2.0 许可,单卡即可运行
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
OpenAI 开源的首批 MoE 大语言模型,含 120B 和 20B 两款,Apache 2.0 许可,单卡即可运行
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025年8月,OpenAI 做出了一个令整个 AI 社区意外的决定:开源两款大语言模型权重——gpt-oss-120b 和 gpt-oss-20b。这不是一款模型,而是两个不同量级、不同场景的完整模型家族,全部采用 Apache 2.0 许可证,任何人都可以自由商用、修改和二次开发。在 GitHub 发布后不到一年,该仓库已积累超过 2 万颗星,成为 2025 年最受关注的开源 AI 项目之一。
长期以来,OpenAI 以"闭源优先"著称,GPT-4、o1 等模型从不公开权重。但随着 Meta 的 Llama 系列、Google 的 Gemma 以及 Mistral 等开源模型的快速崛起,开源社区已经证明:开放的权重同样可以产生强大的能力。
OpenAI 在 2025 年初发布了 openai/openai-agents-python 和 openai/openai-agents-sdk 等开源开发框架,初步展示了开源战略。GPT-OSS 的发布则是这一战略的进一步延伸——以 Apache 2.0 许可证将旗舰级语言模型权重开放给社区,让全球开发者可以在本地、私有云或边缘设备上运行这些模型,不再依赖 OpenAI 的付费 API。
GPT-OSS 的核心技术亮点是混合专家模型(Mixture of Experts, MoE) 架构与 MXFP4 量化的结合。
gpt-oss-120b 包含 128 个专家(Experts),每次推理时激活其中 4 个专家参与计算。这意味着虽然模型总参数达 1170 亿,但实际参与计算的活跃参数仅约 51 亿。配合 MXFP4(4-bit 混合精度浮点)量化,120B 模型可以完整装载进一张 80GB 显存的 NVIDIA H100 或 AMD MI300X GPU 中运行。相比之下,传统的 FP16 全精度需要多卡并行才能运行同等规模的密集模型。
gpt-oss-20b 则是一个更轻量的变体:210 亿总参数,激活 3.6B 参数。由于体积更小,20B 模型仅需 16GB 显存,在消费级 RTX 4090 等显卡上即可运行,适合本地开发、个人助理和边缘部署场景。
技术细节一览:
GPT-OSS 不仅仅是一个语言模型,它内置了一套完整的 Agent 工具链:
推理能力:支持低/中/高三档推理努力(Reasoning Effort),用户可以根据任务复杂度和对延迟的要求灵活选择。模型提供完整的思维链(Chain-of-Thought)输出,不屏蔽推理过程,方便调试和审计。
内置工具:开箱即用三大工具:
Agentic 能力:基于 harmony 格式,模型原生支持多轮对话中的工具调用、上下文累积和结构化输出。通过 gpt_oss/chat.py 可以快速启动一个命令行交互界面,支持 Triton(单 GPU)、PyTorch(多卡)、vLLM 等多种推理后端。
GPT-OSS 支持多种推理方式,覆盖从本地开发到生产级部署的全部场景:
本地快速体验:
生产级部署:
Web UI:
examples/gradio/gradio_chat.py:Gradio 实现的交互式聊天界面,支持工具调用、推理努力调节、温度参数配置examples/streamlit/streamlit_chat.py:Streamlit 版本,提供侧边栏参数面板API 服务:项目内建 FastAPI + Uvicorn 的 HTTP 服务端点,通过 gpt_oss/responses_api/ 提供 RESTful 接口,适合集成到现有系统。
部署门槛方面:虽然 pip 安装简单(pip install gpt-oss),但真正的瓶颈在于 GPU 硬件和模型权重下载(120B 模型约 200GB+ 存储空间)。对于没有 GPU 的用户,建议直接使用 Ollama、LM Studio 等已封装好的方案。
项目提供了 PyTorch 原生实现(gpt_oss/torch/)和 Triton GPU 加速实现(gpt_oss/triton/)两套参考代码,这是整个仓库最有技术价值的部分。
PyTorch 实现(torch/model.py):完整的模型权重加载、前向传播和分布式推理逻辑,包含 RMSNorm、RotaryEmbedding、MoE 门控等核心模块,代码注释清晰,适合学习 MoE 架构的内部实现细节。
Triton 实现:针对单 GPU 场景优化,利用 Triton 编译器的融合内核(fused kernels)减少显存访问,提升推理吞吐量。
测试覆盖:项目包含 tests/ 目录,覆盖 API 端点和 Responses API 的测试用例,使用 pytest + httpx。
文档质量:README 详细介绍了安装、推理、工具使用和微调流程;docs/ 目录下包含 SVG 格式的模型架构图;awesome-gpt-oss.md 汇总了社区教程和第三方集成资源。
GPT-OSS 的发布在行业内引发了两个层面的讨论:
第一层意义:证明了 MoE + MXFP4 量化是降低大模型部署门槛的关键路径。一款 1170 亿参数级别的模型能够在单卡 80GB 上运行,本质上是量化技术(MXFP4)的突破,而不仅仅是模型架构的设计。这为整个行业提供了可复制的工程范式。
第二层意义:Apache 2.0 许可证意味着商业使用的法律风险极低。相比 GPT-4o API 的按 token 计费,企业可以在自有基础设施上无限制地调用这些模型,成本从"可变"变成"固定"。这对需要高调用量、强数据隐私(如金融、医疗、法律)的行业尤其有吸引力。
局限性:harmony 格式是 OpenAI 自定义的响应格式,并非业界标准的 ChatML 或 Llama.cpp 格式。这意味着如果你想将 GPT-OSS 接入现有生态(如 LangChain、LlamaIndex),需要额外的适配工作。社区正在快速补齐这一缺口,但目前兼容性仍是痛点。
| 场景 | 推荐方案 | 难度 |
|---|---|---|
| 本地尝鲜 | Ollama 或 LM Studio | ⭐ |
| Python 开发 | pip install gpt-oss + HF Transformers | ⭐⭐ |
| Web 界面 | 运行 examples/gradio/gradio_chat.py | ⭐⭐ |
| 生产推理 | vLLM 部署 | ⭐⭐⭐ |
| 模型微调 | 使用 TRL/DPO 框架 | ⭐⭐⭐⭐ |
需要特别注意的是:模型必须配合 harmony 格式使用,直接传入标准 ChatML 格式将无法正常工作。官方提供了 openai-harmony 库来处理格式转换。