mlx-serve
Apple Silicon 原生 LLM 推理服务器,Zig 编写,支持 OpenAI/Anthropic/Ollama 多协议,文本/图像/视频/音乐/语音/3D 全模态生成,无需 Python
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Apple Silicon 原生 LLM 推理服务器,Zig 编写,支持 OpenAI/Anthropic/Ollama 多协议,文本/图像/视频/音乐/语音/3D 全模态生成,无需 Python
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:深夜调试代码,你不想把敏感业务逻辑发送到云端 API,但又需要 Claude Code 这样的编码助手提供实时帮助——或者你想用 Stable Diffusion 生成一张产品配图,同时跑一个 Qwen3.5-27B 的大模型做复杂推理,而你手边只有一台 M4 Max MacBook Pro。
mlx-serve 就是为这种需求而生的。这是一个完全由 Zig 语言编写的原生 macOS 应用,无需 Python、无需 Docker、不依赖任何云端服务,就能在你的 Apple Silicon Mac 上同时运行文本生成、图像生成、视频生成、音乐生成、语音合成甚至 3D 模型生成。
Apple Silicon 的统一内存架构(Unified Memory)让 GPU 和 CPU 共享同一块高带宽内存,理论上非常适合运行大语言模型——模型权重无需跨 PCIe 复制到独立显存,直接在统一内存中处理。但在此之前,Apple Silicon 上的本地 AI 推理主要依赖 Python 工具链(mlx-lm、llama.cpp 等),要么性能不够极致,要么缺少统一的 API 接口。
作者 ddalcu 从 MLX 社区出发,构建了一个高性能、低延迟的统一推理服务器。2026 年 7 月,mlx-serve 在 ml-explore/mlx 官方社区正式发布,展示了用 Zig 语言直接对接 MLX C 核心的高性能架构,获得了 MLX 官方团队的认可。
项目采用 Zig 语言 从零编写,源码目录 src/ 包含 90+ 个 .zig 文件,直接链接 mlx-src(MLX C 核心库)和 mlxc-src(MLX C++ 核心库)。这种架构带来了显著优势:
| 特性 | 说明 |
|---|---|
| 零运行时开销 | Zig 编译为静态二进制,无 GC 或运行时依赖,启动速度极快 |
| 直接调用 MLX C API | 不经过 Python 层,MLX Core 的底层算子直接暴露,延迟更低 |
| 内存控制精确 | Zig 的手动内存管理让大模型推理的内存分配更可预测 |
| 二进制体积小 | 预编译 macOS arm64 版本约 10MB+,无需任何运行时环境 |
同一个服务器进程同时支持多种模态:
文本生成:支持 Gemma 4、Gemma 3、Qwen 3/3.5/3.6/3.8(支持 MoE 混合专家架构)、Llama 4、DeepSeek V4 Flash、Mistral 等主流模型,同时支持 GGUF 格式(通过 llama.cpp 兼容路径)。
图像生成:DiffusionGemma、FLUX.1、KREA Real-time、Stable Diffusion 3/3.5(LTX Video 架构)、Kolors 等。
视频生成:LTX Video(LTX Video VAE + DiT)、Hunyuan3D-2.1(3D 模型 + 纹理烘焙)、Hunyuan3D Paint(图像到 3D)。
音乐生成:ACE-Step v1.5 XL Turbo(.audio 模态)。
语音:Kokoro TTS(支持语音克隆)、MiniMax H3 Audio。
项目同时暴露多个兼容 API,任何主流 AI 客户端无需修改即可直连:
http://127.0.0.1:11234/v1(chat/completions、embeddings、images、audio)http://127.0.0.1:11234(设置 ANTHROPIC_BASE_URL,支持 /v1/messages)http://127.0.0.1:11234/api/*http://127.0.0.1:11234/v1/responses(Codex 专用)这意味着 Claude Code、Cursor、Continue、Open WebUI、SillyTavern 等工具,配置一个 base URL 即可切换到本地推理。
根据官方 benchmarks(Apple M4 Max,相同权重),mlx-serve 在代码补全任务上的解码速度(decode tok/s)优于 LM Studio、oMLX 和 MTPLX,原因在于其直接调用 MLX 底层算子避免了 Python 绑定开销。
还支持 ANE(Apple Neural Engine)加速预填充(--ane-prefill),将预填充计算密集的 MLP 层 Offload 到 ANE,进一步提升长上下文的处理速度。
对于非技术用户,项目提供了 MLX Core——一个经过签名公证的 macOS 菜单栏应用,bundles 了完整的 mlx-serve 服务器二进制。功能包括:浏览和下载模型(带进度条 UI)、直接聊天对话、Agent 模式(支持 MCP 工具调用)、以及生成图像/视频/音乐/语音/3D 模型的图形化界面。所有设置通过 Settings 窗口调整,无需触碰终端。
同时,服务器在后台运行于 http://localhost:11234,所以 MLX Core 运行时,Claude Code 等外部工具可以无缝连接到同一个本地推理服务。
普通用户(推荐 MLX Core):下载 .app 文件 → 运行 → 开始使用。零配置,体验最友好,但需要 macOS 26.2+。
开发者用户:通过 Homebrew 安装(brew install --cask mlx-serve),或下载预编译二进制 tarball。CLI 提供 run/pull/list/serve/launch 子命令,其中 launch claude 可以自动配置 Claude Code 对接本地服务器。
高级用户/贡献者:从源码编译,需要 Zig 0.17 nightly(不能用 Homebrew 仓库中的 0.16 稳定版)和 macOS 26.2 SDK,还依赖 webp 等系统库。编译门槛相对较高。
平台锁定:仅支持 macOS + Apple Silicon,Linux/Windows 用户无法使用,无法通过 Docker 跨平台部署。
系统版本要求高:macOS 26.2+ 才可运行,而 macOS 26 尚未正式发布(截至 2026 年中),这限制了当前实际可用性。
源码编译依赖 Zig nightly:Zig 语言仍处于快速迭代期,nightly 版本要求意味着长期维护成本较高,API 兼容性风险存在。
许可混乱:仓库包含 MIT LICENSE、Apache 2.0 LICENSE 和 NOASSERTION 并存的 License 文件,第三方使用时需注意各子模块的独立许可。
截至 2026 年 7 月,mlx-serve 获得 770+ GitHub stars,55 forks。在 MLX 生态中,它是首个将 Apple Silicon 本地推理服务做到工业级可用的开源项目,与 mlx-lm.server(Python)、llama.cpp(Python CLI)、LM Studio(Electron GUI)形成差异化竞争。
其最显著的贡献在于:把 Apple Silicon 统一内存+ANE 的硬件优势,通过零 Python 开销的 Zig 原生实现真正释放出来,为隐私敏感型 AI 应用、离线编码助手、本地多模态创作提供了高性价比的本地化路径。随着 Apple M5 系列 Neural Accelerators 的普及,这类本地推理引擎的性能天花板还将持续上移。
本文基于 GitHub 公开信息生成,项目已活跃维护 2+ 年。