llmfit
一条命令,帮你找到本地硬件能跑、表现最好的 LLM 模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
一条命令,帮你找到本地硬件能跑、表现最好的 LLM 模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有过这样的经历:心血来潮想在自己电脑上跑一个大模型,结果对着 HuggingFace 上几百个 GGUF 量化版本发呆,不知道该下载哪一个?或者好不容易选了一个,跑起来才发现显存不够被迫中止?llmfit 正是为解决这个痛点而生的——它用一条命令,帮你从数百个模型中精确圈出「你的硬件能跑且表现最好」的那几个。

图1:llmfit TUI 界面,实时显示各模型适配评分(图片来源:官方仓库)
2024 年开始,本地大模型部署进入了前所未有的繁荣期。llama.cpp 的 GGUF 量化、Apple Silicon 的 MLX 加速、Unsloth 的高效微调,让普通开发者的个人设备也能跑起 70B 参数的模型。但繁荣的另一面是选择困难:HuggingFace 上同一个 Llama 3.1 8B 就可能有 Q8_0、Q6_K、Q4_K_M、Q2_K 等十几个量化版本,再加上 Ollama、llama.cpp、LM Studio 等不同运行时的兼容差异,选型本身就成了一个需要专业知识门槛的难题。
AlexsJones 正是看到了这个 gap,在 2026 年 2 月推出了 llmfit。它最初只是一个 Rust 小工具,如今已积累超过 27,000 颗 GitHub Stars,成为本地 LLM 部署领域最受关注的工具之一。
llmfit 的核心工作流程只有四步,却做得很深:
第一步:硬件自动探测。 llmfit 会读取系统 RAM/CPU,并通过各平台的 SMI 工具探测 GPU 配置。NVIDIA GPU 调用 nvidia-smi 聚合多卡显存;AMD 卡通过 rocm-smi;Apple Silicon 统一内存直接读取 system_profiler;Intel Arc、昇腾 Ascend 等也都有对应的探测路径。同时,它会根据 GPU 型号自动推断加速后端(CUDA / Metal / ROCm / SYCL / CPU)。
第二步:模型数据库查询。 llmfit 维护了一个包含数百个模型的数据库(data/hf_models.json),这些模型数据从 HuggingFace API 实时拉取,并在编译时嵌入二进制文件。每个模型的内存需求根据参数量和量化级别动态计算。
第三步:动态量化选择。 llmfit 不假设固定量化级别,而是从最高质量(Q8_0)向下遍历,找到「质量最高且能塞进你的显存」的量化方案。如果连半上下文都塞不下,才会进一步降级。
第四步:多维评分。 每个模型在四个维度上打分(0-100):
| 维度 | 含义 |
|---|---|
| Quality | 参数量、模型家族声誉、量化精度惩罚、任务匹配度 |
| Speed | 基于后端、参数量、量化级别的估算 tokens/s |
| Fit | 显存利用率效率(黄金区间:50-80%) |
| Context | 上下文窗口能力 vs 目标场景 |
维度权重因用途而异:聊天场景偏重速度(0.35),推理场景偏重质量(0.55)。
llmfit 对混合专家(MoE)架构有专门优化。传统方法按模型总参数量估算显存,但 MoE 的特点是每次推理只激活部分专家。例如 Mixtral 8x7B 标称 46.7B 参数,实际每次推理只激活约 12.9B,对应显存从 23.9GB 降至约 6.6GB。llmfit 能自动识别 MoE 架构并应用正确估算逻辑,这对跑 DeepSeek-V2/V3 等国产 MoE 模型的用户尤为重要。
llmfit 提供了三种使用形态:
S 键)。内置 10 种颜色主题(Nord、Dracula、Catppuccin 等)。0.0.0.0:8787,同一局域网内任意浏览器即可访问。llmfit recommend --json、llmfit serve),可接入 Kubernetes 集群作为节点级推荐 REST API。安装方式也极为多元:macOS/Linux 通过 Homebrew 或一行安装脚本,Windows 通过 Scoop,Python 用户通过 uv tool install,开发者甚至可以直接 cargo build。多阶段 Dockerfile 包含了完整的构建工具链,最小镜像约 200MB。

图2:不同硬件配置下的模型基准测试性能对比(图片来源:官方仓库)
llmfit 的评分机制是估算而非实测,速度预测基于「LLM 推理是显存带宽受限」这一理论假设,实际性能受模型实现、批次大小、上下文长度等因素影响显著。它也尚未覆盖所有推理后端(如 vLLM)的能力评估。总体来说,它更适合作为初筛工具,缩小选择范围后,用户仍需自行实测最终效果。
llmfit 的出现,标志着本地大模型部署从「经验主义」向「数据驱动」演进。随着模型量化技术越来越成熟(QAT、AWQ、GGUF),同一个模型的不同变体数量还在指数增长。类似的硬件感知选型工具将成为本地 AI 基础设施的标准配置,这也是为什么 AlexsJones 在推出 llmfit 后,还同步建设了姐妹项目——llmserve(模型服务)和 llama-panel(macOS 原生管理面板),共同构建本地 LLM 的完整工具链生态。