anubis-oss
Apple Silicon 原生 macOS 应用,实时评测本地大模型性能(tok/s、功耗、内存),并支持社区排行榜数据共享
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Apple Silicon 原生 macOS 应用,实时评测本地大模型性能(tok/s、功耗、内存),并支持社区排行榜数据共享
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
深夜,你在一台 M4 Max MacBook Pro 上部署了最新的 Llama 3.3 70B,Ollama 启动正常,模型加载成功。但接下来你面临一连串无法回答的问题:这套配置每秒能吐出多少 token? 温度高了 GPU 会不会降频?Q4 量化对比 Q8 量化实际差多少?M4 Pro 和 M4 Max 在同一条 prompt 上差距有多大?
在 Anubis 出现之前,你只能靠「感觉」——发一条 prompt、看输出、等几秒、猜快慢。没有标准、没有对比、没有数据。而这正是开源社区对本地大模型评测工具的集体痛点:本地模型越来越强,但横跨不同硬件、不同量化、不同后端的性能数据却极度匮乏。
随着 Ollama、LM Studio、MLX 等工具的成熟,在 Mac 上本地运行大语言模型已经成为越来越多开发者和 AI 爱好者的日常选择。然而,与云端 API 不同,本地推理的性能完全取决于你的硬件配置——但现有的评测手段极其原始:
llama.cpp 自带 benchmark)只跑纯数字计算,无法反映真实对话场景uncSoft 的开发者正是带着这个问题启动了 Anubis 项目。2026 年 2 月项目上线,目标很明确:为 Apple Silicon 用户提供一套标准化、可复现、有社区数据支撑的本地 LLM 性能评测工具。上线不到半年即获得 195 stars,在 Apple Silicon + MLX 开发者圈子里已具备一定影响力。
Anubis 的定位是本地大模型性能工作台,而非简单的 chat wrapper。它将功能划分为五大模块:
选择后端(Ollama / LM Studio / MLX / OpenWebUI 等 OpenAI 兼容端点),选择模型,配置 prompt 集合,点击 Run 即可得到完整的性能报告。核心指标包括:
与市面上任何其他工具不同,Anubis 在生成 token 的同时实时显示这 8+ 个指标的数据卡片和 11 张图表,让用户真正「看见」推理过程。GPU 降频了?内存爆了?一行数据全部回答。
Flow Builder 是 Anubis 最具创新性的功能,它借鉴了 macOS Shortcuts 的设计思路,允许用户用拖拽式可视化编辑器构建一套可复现的 benchmark 流程。你可以:
Set Backend → Set Model → Repeat × N → Run Benchmark → Unload ModelFor Each Model、For Each Prompt,一次配置跑完多组对比.anubisflow JSON 文件与社区分享这一功能解决了 benchmark 中最常见的痛点:测多个模型/量化版本时,必须手动反复操作。有了 Flow Builder,放着让它跑,第二天上班就是一份完整的对比报告。
选择两个模型,输入同一 prompt,实时对比输出质量和响应速度。适合在做模型选型时做快速横向对比。
直接浏览 Ollama 模型库,一键 Pull 模型,在 App 内管理已安装的模型和卸载。无需切换到终端操作。
实时显示 Mac 硬件状态(GPU、CPU、内存、功耗),帮助理解基准测试期间的硬件行为。
Anubis 是一款原生 macOS 应用,完全使用 Swift + SwiftUI 构建,目标平台为 Apple Silicon Mac(M1 及以上,macOS 15.0+)。整个项目结构清晰:
anubis/
├── anubis/
│ ├── App/ # 应用入口与生命周期
│ ├── Features/ # 业务功能模块
│ │ ├── Arena/ # 模型对比 PK
│ │ ├── Benchmark/ # 基准测试核心
│ │ ├── Flows/ # 流程编排
│ │ ├── Monitor/ # 硬件监控
│ │ ├── Reports/ # 报告生成与导出
│ │ ├── Settings/ # 设置面板
│ │ └── Vault/ # 模型管理
│ ├── Services/ # 服务层
│ │ ├── InferenceService.swift # 推理服务(OpenAI兼容API)
│ │ ├── InferenceBackend.swift # 后端检测(Ollama/LM Studio等)
│ │ ├── MetricsService.swift # 指标采集(IOReport)
│ │ ├── LeaderboardService.swift # 排行榜数据上报
│ │ ├── FlowExecutor.swift # 流程执行引擎
│ │ ├── ExportService.swift # 导出服务(PNG/CSV/MD)
│ │ └── UpdaterService.swift # 自动更新(Sparkle)
│ ├── Models/ # 数据模型
│ ├── Integrations/ # 系统集成(Spotlight、Siri等)
│ └── Utilities/ # 工具函数
├── leaderboard_site/ # 社区排行榜前端(独立HTML/JS)
└── homebrew/ # Homebrew Cask 发布配置
架构设计亮点:
部署方式:作为原生 macOS 应用,通过 Homebrew Cask 分发,下载即用。无需 Docker,无需编译环境,但仅限 Apple Silicon Mac。
安装门槛:极低。只要有一台 Apple Silicon Mac,下载 Release 或用 brew install 即可。无需命令行,无需编程知识。
使用门槛:中等。需要对本地 LLM 有基本认知(至少知道 Ollama 或 LM Studio 是什么)。Benchmark 的实际价值在于理解 prompt 设计、量化级别差异和硬件规格对结果的影响,这些需要一定学习成本。
开发门槛:中等偏高。源码基于 Xcode + SwiftUI,有完整测试套件,但对 macOS 系统级 API(IOReport、Sparkle)有一定要求。
Anubis 的最大贡献不在于它本身跑得多好,而在于它构建了一套可积累、可对比、可复现的本地 LLM 性能数据基础设施。随着社区排行榜数据量增长(目前 375+ 次提交,10+ 种 Apple Silicon 芯片),整个 Apple Silicon LLM 生态第一次有了真实硬件条件下的性能参照。
这对硬件选型、模型量化策略、推理优化方向都有直接参考价值。想象一下,你在买 M4 Max 还是 M3 Ultra 之间犹豫?看看社区数据中同等模型在不同芯片上的 tok/s 和 J/Tok 数字,答案一目了然。
此外,项目将 benchmark 分析报告(analysis.html)和方法论文档(methodology.html)完全开源,推动评测方法论的透明化。v3.5 版本中对 IOReport 功耗计算公式的修正(v1→v2 方法论版本)就是一个很好的例子:发现问题就承认错误、修正公式、迁移历史数据——这种态度在开源社区中值得尊重。
项目当前版本 3.7,由 uncSoft 个人维护,GitHub 活跃度高(最近更新于 2026-07-14),Hacker News 和 Hugging Face 社区均有讨论。