turbo-fieldfare
Gemma 4 26B MoE 模型在 Apple Silicon Mac 上的超低内存推理引擎,8GB RAM 即可运行
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Gemma 4 26B MoE 模型在 Apple Silicon Mac 上的超低内存推理引擎,8GB RAM 即可运行
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你是一名独立开发者,坐在咖啡馆里用一台 8GB 内存的 MacBook Air 写代码。想要跑一个 260 亿参数的大模型——以前这是痴人说梦,260 亿参数意味着至少需要 52GB 显存,没有 4 张 A100 你根本玩不起。但现在,TurboFieldfare 告诉你:只要一台 M2 MacBook,一个下午,你就能在本地跑起 Google 最新发布的 Gemma 4 26B-A4B。
TurboFieldfare 的诞生源于一个极具挑战性的工程问题:Gemma 4 26B 完整模型权重约 14.3GB,但大多数 Apple Silicon Mac 只有 8GB 到 24GB 统一内存。如果按传统方式把整个模型加载到内存里,别说 8GB 机器,连 24GB 机器都吃不消。
作者 drumih 的解决思路非常巧妙——不要把整个模型都装进内存,只装核心部分,模型权重按需从 SSD 流式加载。具体来说:运行时只需保持约 2GB 的共享核心(包括 1.35GB 的 Gemma 4 核心 + FP16 KV 缓存),生成每个 token 时再从 SSD 实时读取对应的 expert 权重(Expert 部分只参与 MoE 路由,约 1.7GB/s 的 SSD 读取带宽完全跟得上生成速度)。这种设计让模型在 8GB 机器上可行。
TurboFieldfare 是一个完全自研的 Swift + Metal LLM 推理运行时,与 MLX(苹果官方机器学习框架)和 llama.cpp 走了完全不同的路线。它不是任何框架的封装,而是从零构建,针对 Gemma 4 架构做了深度优化。
TurboFieldfare 的代码库按职责清晰分层:
| 模块 | 说明 |
|---|---|
| TurboFieldfare | Swift 核心库,包含 Metal kernels、MoE 调度、KV 缓存管理 |
| TurboFieldfareMac | SwiftUI 原生 Mac 应用,模型下载 + 推理交互界面 |
| TurboFieldfareCLI | 命令行工具,支持对话和原始补全 |
| TurboFieldfareServer | Loopback OpenAI 兼容服务器,可对接任意 OpenAI 客户端 |
| TurboFieldfareDecodeService | 一次性模型加载 + Metal 设备管理者(被 Mac app 调用) |
| TurboFieldfareRepack | 流式模型安装器,从 HuggingFace 按需下载并重组为 .gturbo 格式 |
Gemma 4 26B-A4B 是一个 Mixture-of-Experts (MoE) 模型,总参数 260 亿,但每个 token 只激活约 3.88 亿参数(top-48 routing 中选 2)。TurboFieldfare 充分利用这一特性:
除了文本推理,TurboFieldfare 还支持多模态图片理解,通过一个独立安装的 Vision Tower 实现。图片推理需要 M2 或更新芯片(M1 仅支持纯文本)。
整个上手流程分三步:
git clone && swift build -c release && .build/release/TurboFieldfareMac性能方面,实测数据:
生成质量由 Gemma 4 26B-A4B 本身决定,TurboFieldfare 只负责高效执行推理。
TurboFieldfare 代表了一个重要趋势:端侧大模型推理的工程极限探索。随着 Google 的 Gemma 4 发布,MoE 架构正式进入开源 20B+ 参数区间,而 TurboFieldfare 则证明了 MoE + Apple Silicon 的组合在工程上是可行的。它不是最通用的方案,但在"在 Apple Silicon Mac 上高效跑 Gemma 4"这个具体场景里,它是目前最深入、最工程化的答案。

