Rapid-MLX
Apple Silicon 本地 AI 推理引擎,比 Ollama 快 4 倍,OpenAI API 100% 兼容
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Apple Silicon 本地 AI 推理引擎,比 Ollama 快 4 倍,OpenAI API 100% 兼容
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你是一个独立开发者,手头只有一个 24GB 内存的 MacBook Pro,想在咖啡馆里做 AI 编程辅助——调用 Cursor 或者 Claude Code 的能力——但又不想把代码上传到云端处理,担心隐私泄露。传统方案是装 Ollama,但在 M3 MacBook Pro 上跑 Qwen3.5-9B,速度只有 33 tokens/s,延迟让人难以忍受。
Rapid-MLX 解决的就是这个问题。它是 Apple Silicon(M1-M5)上速度最快的本地 AI 推理引擎,通过深度利用苹果统一内存架构和 MLX 神经网络库,实现 2-4 倍于 Ollama 的吞吐量,同时完全兼容 OpenAI API 协议,让已有的 AI 工具链无需修改即可接入。
图1:Rapid-MLX 项目 Logo
本地大模型推理领域,Ollama 和 llama.cpp 早已占据主导地位。但它们都是为通用 CPU/GPU 设计,对苹果 Silicon 芯片的 Unified Memory(统一内存)架构缺乏针对性优化。Apple 在 2024 年初开源了 MLX 框架——一个专门为 Apple Silicon 优化的数组/张量库,其设计哲学接近 PyTorch,但内存效率和推理性能更胜一筹。
问题是:有了 MLX,开发者还需要自行组装模型加载、API 服务、流式输出、工具调用解析等模块,门槛仍然较高。Rapid-MLX 的作者 raullenchai 从 vllm-mlx 项目起步,逐步将其打造为开箱即用的推理服务器,核心目标只有一个:让 Apple Silicon 用户在本地跑大模型时,获得接近云端 API 的体验,同时保留数据隐私和离线能力。
Rapid-MLX 的推理管线采用模块化插拔设计,每一步都是独立的策略实现:
Request → [Tokenize] → [PrefixCache] → [Prefill] → [Decode] → [Detokenize] → Response
↑ ↑ ↑
可插拔: 可插拔: 可插拔:
LRU/Turbo Chunked/ Standard/
Quant/Radix Paged/Offload MTP/Speculative
关键设计原则:
这种架构使得性能优化可以独立迭代,例如 PrefixCache(KV Cache 前缀缓存)可复用相同前缀的推理结果,大幅降低重复请求的 TTFT(首 Token 时间)。实测缓存命中后 TTFT 仅 0.08 秒。
1. OpenAI API 100% 兼容
Rapid-MLX 对外暴露的接口与 OpenAI Chat Completions API 完全对齐,HTTP 服务器默认监听 localhost:8000/v1。这意味着:
CLAUDE_CODE_USE_OPENAI=1 环境变量模式base_url 一切换就能本地化2. 工具调用(Tool Calling)支持
原生支持 17 种工具调用解析器,覆盖 Qwen3、DeepSeek、Mini、o1/o3/o4 等主流模型的 tool_use 格式。在 LlamaIndex 的集成示例中,开发者只需配置 OpenAILike 适配器,即可让 Qwen3.5-9B 在 Apple Silicon 上提供结构化函数调用能力。PydanticAI、LangChain、smolagents 等主流 Agent 框架也都有集成测试覆盖。
3. 推理分离(Reasoning Separation)
内置 7 个推理模型解析器,能够识别并分离模型"思考过程"与"最终输出",在 /think 命令模式下,可强制展示模型推理链,方便调试和教学场景。
4. 云路由(Cloud Routing)
支持混合本地/远程执行,当本地硬件无法承载超大模型时,可自动将请求转发至云端 API,同时保持 OpenAI 兼容接口不变。对外分享能力通过 rapid-mlx share 命令,将本地服务通过 WebSocket 隧道暴露为公共 HTTPS 端点。
Rapid-MLX 在官方 README 中提供了详细的性能对比表格,以下是几个关键数据点:
| 硬件配置 | 模型 | 速度 | 适用场景 |
|---|---|---|---|
| 16GB MacBook Air | Qwen3.5-4B | 147 tok/s | 日常对话、轻量编码 |
| 24GB MacBook Pro | Qwen3.5-9B | 101 tok/s | 主力开发环境 |
| 32GB+ Mac Mini/Studio | Gemma 4 12B | 64 tok/s | 视觉+工具调用 |
| 32GB+ Mac Mini/Studio | Qwen3.6-35B-A3B | 93 tok/s | 中等推理任务 |
| 48GB+ Mac Studio/Pro | Qwen3.5-35B-A3B 8bit | 80 tok/s | 高质量推理 |
| 128GB Mac Studio Ultra | DeepSeek V4 158B | 31-56 tok/s | 前沿级智能 |
核心对比数据(Qwen3.5-9B,同等权重对比):
mlx-lm serve:1.2-1.5 倍加速
图2:性能对比图(来源:项目官方文档)
Rapid-MLX 提供三种安装途径,门槛最低的是 Homebrew:
# 推荐:Homebrew 一键安装(自动处理 Python 版本问题)
brew install raullenchai/rapid-mlx/rapid-mlx
# pip 方式(需要 Python 3.10+,macOS 默认 Python 为 3.9)
pip install rapid-mlx
# 懒人脚本(自动检测并安装 Python)
curl -fsSL https://raullenchai.github.io/Rapid-MLX/install.sh | bash
启动服务也极为简单:
# 交互式对话 REPL
rapid-mlx chat
# 作为 API 服务器(OpenAI 兼容)
rapid-mlx serve qwen3.5-4b
# 公网分享(通过 WebSocket 隧道)
rapid-mlx share qwen3.6-27b-8bit
注意:Rapid-MLX 明确不支持 Docker/Linux 部署——它是为 Apple Silicon macOS 原生设计的推理引擎。这既是性能优化的前提(直接调用 MLX 内核),也是其局限所在。项目没有 Dockerfile,也没有 docker-compose.yml,属于"纯本地工具"类别。
平台锁定:Rapid-MLX 只能在 Apple Silicon Mac 上运行,这既是特色也是限制。开发者如果需要在 Linux 服务器或 Windows 机器上部署本地推理,Ollama 仍是更通用的选择。
内存墙:Qwen3.5-122B 需要 96GB+ 统一内存,DeepSeek V4 158B 更需要 128GB+ 的 Mac Studio Ultra。对于大多数用户而言,实际可用模型被限制在 35B 以内,这已经是很强的主流配置了。
模型兼容性:虽然项目声称支持 22+ 模型并提供自动配置,但不同模型对工具调用的支持参差不齐,部分模型需要手动指定 --think 等参数才能正确启用推理模式。
Benchmark 可信度:README 中的性能对比数据由项目方自测,在"apples-to-apples"(同等权重对比)的行(如 GPT-OSS 20B)中确实有说服力,但跨架构对比(如 Gemma 4 对 Ollama 的 Gemma 3)存在不公平之嫌。
Rapid-MLX 的出现,标志着 Apple Silicon 在本地 AI 推理领域正式进入"可用"到"好用"的跨越。在它之前,在 Mac 上跑本地大模型要么速度慢、要么集成难,用户往往被迫转向云端 API,牺牲隐私换取便利。
Rapid-MLX 证明:只要充分利用统一内存的高带宽(MLX 的核心优势),Apple Silicon 完全可以在 24-48GB 内存区间提供足够快的推理体验。更重要的是,它的 OpenAI 兼容策略大幅降低了用户的迁移成本——不需要重写任何代码,只需换一个 base URL。
从增长曲线看,GitHub Stars 从入库时的 2691 增长至分析时的 2713(2 周内),虽然绝对增速不算惊人,但考虑到这是一个专有平台工具而非通用框架,能在 Apple Silicon 用户群体中持续吸星,本身就说明了需求的真实存在。随着 M5 芯片的神经网络加速器进一步增强,以及 Claude Code、Cursor 等 AI 编程工具的普及,Rapid-MLX 的用户群体有望持续扩大。
图3:Social Preview 图(来源:项目官方文档)