jangq
Apple Silicon 专用 MLX 推理框架的 GGUF 量化工具
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Apple Silicon 专用 MLX 推理框架的 GGUF 量化工具
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

想象一下:你有一台顶配 M4 Max Mac(128GB 统一内存),想本地跑一个 120B 的大模型做开发测试。翻了半天文档,发现 MLX 社区的量化工具最低只支持 4-bit,120B 模型跑下来还要 63GB 内存——勉强能跑,但如果你想同时开 IDE、Chrome 和其他应用,内存直接爆了。
更难受的是那些 397B 级别的超大模型。Qwen3.5-397B 这种规模,连 MLX 4-bit 都跑不了,因为 float16 的精度上限根本塞不进统一内存。你只能放弃,或者上云——但这意味着你要把数据传到第三方服务器,隐私风险随之而来。
JANG(Jan Adaptive N-bit Grading) 就是来解决这个问题的。它是 Apple Silicon 上的混合精度量化框架,可以理解为"MLX 版的 GGUF",专门把大模型的权重从高精度压缩到更低 bit 位,但通过智能分配不同层的位数,让模型质量几乎不掉,同时体积大幅缩小。

JANG 由独立开发者 Jinho Jang(GitHub @jjang-ai,邮箱 eric@jangq.ai)主导开发,遵循 Apache-2.0 开源许可证。项目始于 2024 年,初衷很简单——作者自己是 Apple Silicon 用户,想在 Mac 上跑更大参数的模型,但现有工具的量化策略太粗放,要么位宽一刀切、要么完全不支持某些架构。
MLX 是苹果官方为 Apple Silicon 打造的机器学习框架(类似 CUDA之于 NVIDIA),但 MLX 内置的量化工具在处理 MoE(混合专家)和超大参数模型时表现疲软。GGUF 格式在 Linux/Windows 端由 llama.cpp 统治,而 MLX 生态一直缺少一个功能对等的量化工具。JANG 填补了这个空白——它让 Apple Silicon 用户也能以更小的内存占用运行超大模型,同时保持接近原生的推理速度。
JANG 的核心创新是自适应混合精度位分配。不同于传统量化对所有权重统一使用相同位宽(4-bit、8-bit),JANG 根据每个张量的敏感度动态分配位数:重要层(如 lm_head、embed_tokens)保留更高精度(如 6-bit),而对质量影响小的层压缩到 1-2 bit。
以 Mistral Small 4(119B 参数、6B 活跃)为例:
| 量化格式 | 模型大小 | 吞吐(tok/s) | Prefill(tok/s) | MMLU |
|---|---|---|---|---|
| JANG_2L | 30 GB | 82 | 216 | 94.0% |
| JANG_4M | 57 GB | 80 | 202 | — |
| MLX 4-bit | 63 GB | 84 | 43 | — |
JANG_2L 在 30GB 占用下跑出了 94% 的 MMLU 分数,而且 prefill(首 token 生成)速度是 MLX 4-bit 的 5 倍。更重要的是,它让 397B 规模的 Qwen3.5 也能在 Apple Silicon 上运行——MLX 原生量化根本塞不进去。
支持的模型架构非常广泛:标准 Transformer、MoE(128 专家)、SSM(状态空间模型)、Hybrid SSM+MoE、VLM(视觉语言模型),以及 Qwen3.5 全系列。2026 年 3 月更新还加入了 bfloat16 自动检测,解决了 512 专家模型 float16 溢出的问题。
路线一:JANG Studio(推荐零基础用户)
JANG Studio 是一个 macOS 原生应用,打包成签名 DMG,安装即用。它提供了一个五步向导:输入 HuggingFace 模型地址 → 预检 → 选择量化配置 → 转换 → 发布到 HuggingFace,全程可视化日志,门槛最低。
路线二:pip 安装(开发者首选)
pip install 'jang[mlx]'
# 转换模型
jang-convert-mistral3-jangtq <model_id> # Mistral3 → JANG格式
# 推理
from mlx_lm import generate
generate(model='<path/to/jang_model>')
路线三:HTTP API 服务(团队协作)
jang-server 基于 FastAPI,提供完整的 HTTP 推理接口,支持流式输出(SSE)、任务持久化(SQLite)、取消/重试、API Key 认证和 Webhook 通知。团队可以在局域网内搭一个共享推理服务,多人共用一个模型实例。
平台锁定:这是最大的限制。JANG 依赖苹果 MLX 框架,只能在 macOS Apple Silicon 上运行,不支持 Linux/Windows,也没有 Docker 部署选项。如果你用的是 Intel Mac 或者非苹果设备,这个项目和你无关。
运行时专有性:JANG 格式的推理需要使用 JANG_Q Runtime,这是项目的一部分但深度依赖 MLX 生态。主流推理工具(Ollama、LM Studio、llama.cpp)目前尚未支持 JANG 格式,生态还不完整。JANG Studio 和 MLX Studio 是目前最成熟的运行时。
许可证:jang-tools 目录是 Apache-2.0 开源,但 JANG Studio 和 jang-runtime(包含 Swift 实现)是专有组件,完全闭源。开源与闭源混合的模式对想深入研究量化算法的开发者不太友好。
JANG 的出现反映了 Apple Silicon 在 AI 推理领域日益增长的竞争力。随着 M4/M5 芯片统一内存突破 192GB,本地运行 100B+ 参数模型正在从"不可能"变为"勉强可以"。JANG 通过混合精度量化进一步拉低了内存门槛,让更多开发者可以在不依赖云端的前提下进行大模型实验。
从技术路线看,GGUF( llama.cpp 生态)和 MLX 量化(JANG 生态)正在形成 macOS LLM 推理的两条主要路径。前者兼容性好、支持平台多,后者性能高、与苹果生态集成深。JANG 的定位是"MLX 上的 GGUF",填补了苹果端量化工具链的关键空白。
JANG 是 Apple Silicon 用户跑大模型的实用工具链,通过智能位分配在更小内存下实现了接近甚至超越 MLX 原生量化的精度。适合 M 系列 Mac 用户、有隐私需求不想上云的开发者,以及需要在本地快速测试超大模型的研究人员。主要门槛是平台锁定(仅 macOS Apple Silicon)和开源组件的有限覆盖。