exo
将局域网内 Apple Silicon 设备组成 AI 集群,TB5 RDMA 互联,支持在本地运行 671B 参数大模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
将局域网内 Apple Silicon 设备组成 AI 集群,TB5 RDMA 互联,支持在本地运行 671B 参数大模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025年,YouTube 科技博主 Jeff Geerling 做了一个疯狂的实验:他凑齐了四台 M3 Ultra Mac Studio(每台 512GB 统一内存),用一根 Thunderbolt 5 线缆将它们连成集群,在上面跑起了 671B 参数的 DeepSeek v3.1——这是当时参数量最大的开源大模型之一。结果:15 TB 统一内存,四台机器协同推理,延迟比单卡下降数倍。这背后的调度软件,就是 Exo。

Exo 的核心理念简单直接:把局域网内的所有设备变成一块巨型 AI 加速卡。它不需要任何手动配置,设备之间自动发现、自动协商拓扑、自动将大模型切分到各台机器上推理。这就是 Exo 名字的含义——让前沿 AI 模型在你的本地设备上运行,不再依赖云端 API。
大模型云端 API 的问题显而易见:成本、数据隐私、延迟。GPT-4o 每百万 token 费用高达数美元;企业不愿意把内部数据发给第三方 API;网络延迟在实时交互场景中难以接受。本地部署虽然绕开了这些问题,但单张消费级显卡的显存上限(通常 24GB)卡死了能跑的模型规模。
Exo 的出现就是为了打破这个瓶颈。它瞄准了一个新兴趋势:Apple Silicon 统一内存架构。M3 Ultra 拥有高达 192GB 的统一内存,而 Mac Studio 可以多台互联,理论上可以组合出数百 GB 甚至 TB 级别的内存容量。更重要的是,Apple 的 MLX 框架专门针对统一内存优化,Tensor Core 可以直接访问内存数据,推理效率远高于传统 GPU。
Exo 的技术架构分为三层:
底层:MLX 推理引擎。 Exo 使用 Apple MLX 作为核心推理后端,这是一个专为 Apple Silicon 设计的张量计算库,支持 PyTorch 兼容 API。同时通过 MLX distributed 实现跨设备的分布式通信,模型权重通过高速互联网络分发。
中间层:智能分片与路由。 Exo 自动感知集群拓扑(设备数量、内存容量、互联带宽),选择最优的模型切分策略。对于支持 RDMA over Thunderbolt 5 的设备,节点间延迟降低 99%,可实现几乎无损的分布式推理。Tensor Parallelism(张量并行)让模型权重在多设备间分配,2 设备达到 1.8 倍加速,4 设备达到 3.2 倍加速。
上层:多协议 API 兼容层。 Exo 同时兼容 OpenAI Chat Completions API、Claude Messages API、OpenAI Responses API 和 Ollama API。这意味着你不需要修改任何现有代码,只需把 base URL 指向 http://localhost:52415,就能用 ChatGPT 的客户端或者 Cursor、Claude App 直接调用本地运行的大模型。
Exo 内置 Dashboard:4 × 512GB M3 Ultra Mac Studio 集群视图
说实话,Exo 的部署不是开箱即用。主要门槛在于:
工具链复杂。 源码部署需要同时安装 Rust(nightly)、Node.js 18+、Python 3.13、uv 包管理器,以及 Xcode(macOS)或 Nix。对于普通用户,建议直接下载 macOS DMG 安装包,双击安装即可。
硬件要求高。 Exo 的最佳体验在 Apple Silicon Mac 上——尤其是支持 Thunderbolt 5 的 M4 Pro/M4 Max/M3 Ultra 机型。Linux 平台目前仅支持 CPU 推理,NVIDIA CUDA GPU 加速在开发中。如果你只有一台普通 Windows 机器,Exo 暂不支持。
RDMA 配置繁琐。 如果想在 Mac 集群上开启 RDMA 加速,需要进入 Recovery 模式运行 rdma_ctl enable,还要确保所有设备 OS 版本完全一致,包括 beta 版本号。这对于非技术用户来说并不友好。
好消息是:Exo 提供了一个图形化 Dashboard,运行在 http://localhost:52415,可以直观查看集群状态、选择模型、发起对话。模型下载、实例调度、负载监控全部在界面中完成。
从 Jeff Geerling 的基准测试来看,四台 M3 Ultra 通过 Thunderbolt 5 RDMA 互联,运行 Qwen3-235B(8-bit 量化)和 DeepSeek v3.1 671B(8-bit 量化)的表现相当惊艳:

具体数字因模型和输入长度差异较大,但总体趋势清晰:设备越多,速度越快,且 RDMA 的超低延迟让并行效率接近理论上限。对于需要长上下文(比如 128K token)的应用场景,这种本地集群的性价比远超云端。
Exo 的局限也很明显:
Exo 代表了一个正在壮大的趋势:本地 AI 基础设施民主化。当单台 Mac Studio 就能运行 70B 参数模型、四台互联可以挑战 600B+ 时,AI 能力的获取门槛正在从"大企业专属"向"有设备的个人"下沉。虽然 Exo 目前主要服务 Apple 生态用户,但它验证了一种分布式本地推理的可行性路径,值得持续关注。