parallax
去中心化 LLM 推理引擎:将大模型分层部署到多台设备,P2P 协同完成推理,突破单卡显存限制
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
去中心化 LLM 推理引擎:将大模型分层部署到多台设备,P2P 协同完成推理,突破单卡显存限制
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你曾经是否想过,在自己的游戏电脑上跑一个 DeepSeek-V3,让它回答复杂的技术问题?或者用旧款 MacBook 的 Apple Silicon 来推理 Qwen 模型?传统 LLM 部署方案要求你有一台「怪兽级」服务器,所有层都塞在同一台机器上——但现实是,大多数人的 GPU 只有 8GB 显存,根本装不下一个 72B 的模型。
Parallax 解决的就是这个矛盾。它是一个完全去中心化的 LLM 推理引擎,由 Gradient(一家专注主权 AI 的公司)开发,核心思路是:将大模型的不同层分散部署到多台设备上(可以是不同机器、不同地区的节点),通过 P2P 网络协同工作,让「算力碎片」拼成一台「虚拟超级计算机」。
大型语言模型的参数规模呈指数级增长。DeepSeek-V3 拥有 2360 亿参数,Qwen3-72B 同样体积庞大。即使是消费级最强的 RTX 4090(24GB 显存),也难以完整加载这些模型。传统解法是购买 A100/H100 集群,但成本高达数十万美元,普通人根本无法承受。
去中心化推理社区(Petals、OctoStack 等)尝试用多用户协同的方式解决这一问题,但大多停留在「多人共同微调」的层面,缺乏对生产级推理的性能保障。Parallax 出现后,首次将 流水线并行(Pipeline Parallelism) 和 Paged KV Cache 这些生产级优化引入去中心化场景,使得普通设备也能参与高质量推理。
Parallax 的开发团队 Gradient 背景值得关注:他们是专注于「主权 AI」(Sovereign AI)的团队,主张用户的数据和推理过程不应依赖中心化云服务。2025 年 10 月,Parallax 一经发布便登顶 Product Hunt 当日第一产品,目前 GitHub Stars 超过 1300,并在持续迭代中。
Parallax 的架构可类比为一家连锁餐厅的中央厨房系统:

图1:Parallax 项目架构示意图
流水线并行(Pipeline Parallelism):这是 Parallax 的核心技术。以一个 28 层模型为例,假设有 3 个节点:节点 A 持有第 0-9 层,节点 B 持有第 10-19 层,节点 C 持有第 20-27 层。当用户发送一条请求时,数据流经 A → B → C,最终返回完整答案。每个节点只负责自己那部分层的计算,从而实现了显存的分片。
动态层分配:Parallax 的调度器支持动态调整层分配策略。当新节点加入集群或现有节点离开时,调度器会自动重新分配层。动态规划(DP)算法会找到最优分配方案,平衡各节点的计算负载。
Paged KV Cache:借鉴 vLLM 的 PagedAttention 思想,Parallax 在 Mac 后端实现了分页 KV Cache 管理,避免显存碎片化,提升长对话场景下的吞吐量。
多后端支持:
lmsysorg/sglang:v0.5.7 镜像。支持模型:DeepSeek-V3/R1、Qwen3 系列、GLM 系列、MiniMax-M2、Kimi 等主流开源大模型。

图2:节点加入集群的 Web 界面
Parallax 的前端采用 React 19 + TypeScript + Vite 构建,使用了 Material UI (MUI v7) 作为组件库。具体技术栈:
@ai-sdk/openai 和 @ai-sdk/react,支持流式响应和 React Server Components。framer-motion 和 motion 库,提供流畅的 UI 交互动效。@mui/x-charts 可视化集群状态和性能指标。前端通过 OpenAI 兼容接口与后端通信,src/frontend/chat.html 是主要的聊天入口页面,支持流式文本生成。

图3:节点配置管理界面
Parallax 提供了两种部署路径:
Docker 方式(推荐生产使用):项目提供了 docker/Dockerfile,基于 SGLang 官方镜像,内置 CUDA 支持,一行命令即可构建镜像并启动容器。
install.sh 脚本(适合开发调试):自动化处理 Python 虚拟环境创建(通过 uv)、依赖安装、SGLang/vLLM Rust 前端二进制编译。自动检测操作系统(Linux GPU / macOS Apple Silicon),选择合适的 extras 安装包。
硬件要求:需要 NVIDIA GPU + CUDA 12.1+,或 Apple Silicon Mac。显存需求取决于模型规模——小型模型(Qwen3-0.6B)可在消费级 GPU 上运行,大型模型(DeepSeek-V3)建议多卡并行。
部署难度:中等——虽然脚本已高度自动化,但需要理解分布式推理的基本概念(层分配、流水线并行),对新手有一定门槛。
Parallax 目前仍处于早期阶段,有几个值得关注的问题:
1. 节点可用性依赖:去中心化网络的最大挑战是节点稳定性。如果参与推理的节点突然下线,请求会失败。虽然 Parallax 有心跳检测和超时机制,但在节点稀缺的场景下,QoS 难以保证。
2. 通信开销:节点之间传输中间激活值(activations)需要网络带宽。对于需要高吞吐的实时对话场景,P2P 链路的延迟可能成为瓶颈,特别是在跨地域部署时。
3. 模型覆盖有限:目前主要支持主流开源 LLM,对于非标准架构或私有模型的适配需要额外开发工作。
4. 文档成熟度:尽管 README 详尽,但高级配置选项(如 DP 路由策略的细粒度调参)文档较少。
5. Docker Compose 缺失:项目未提供 docker-compose.yml,多容器协同部署需要用户自行编排。
Parallax 的出现代表了 AI 推理领域的一个重要趋势:算力民主化 + 主权 AI。当中心化云服务商控制着全球大多数 AI 算力时,Parallax 提供了另一种可能性——让普通用户的闲置设备参与到 AI 推理网络中,既降低了大模型的使用门槛,也为构建抗审查、抗封锁的分布式 AI 基础设施奠定了基础。
从技术角度看,Parallax 将 SGLang/vLLM 等生产级推理引擎的能力引入 P2P 场景,这在之前是没有人做过的。它的调度器设计(结合 DP 层分配 + 性能感知路由)是核心技术壁垒,也是后续优化的重点方向。
项目由 Gradient 团队维护,背后有 Gradient Network 的生态支持(Lattica P2P 协议、OpenClaw 集成等)。2026 年 2 月新增的 OpenClaw 集成表明,团队正在扩展 Parallax 的应用边界,从单纯的推理服务扩展到 AI Agent 协作场景。
如果你对分布式系统、LLM 推理优化感兴趣,Parallax 是一个值得深入研究的开源项目。