airunner
本地离线 AI 工作站:LLM 聊天、AI 绘图、语音对话、Agent 自动化,一站式本地运行,隐私
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
本地离线 AI 工作站:LLM 聊天、AI 绘图、语音对话、Agent 自动化,一站式本地运行,隐私
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:深夜加班,笔记本断网,却需要快速生成一张产品概念图、和 AI 讨论一段代码逻辑、甚至做一场外语口语练习——传统的云端 AI 工具在这种时刻束手无策,而 AIRunner 正是为这种场景而生。作为一款离线推理引擎,AIRunner 在本地设备上整合了 AI 绘图、实时语音对话、大语言模型聊天机器人以及自动化 Agent 工作流,让用户在不依赖任何云服务的情况下完成这些任务。
AIRunner 由独立开发者社区 Capsize-Games 创建于 2023 年 3 月,GitHub 仓库 ID 617136332,至今保持活跃维护(最近一次提交于 2026 年 6 月 13 日)。项目的诞生动机直击行业痛点:彼时主流 AI 工具均以 SaaS 订阅模式运行,用户必须将对话数据上传至第三方服务器,不仅每月需要支付费用,更无法保障隐私安全——医疗记录、商业方案、代码片段等敏感内容统统流向外网。
AIRunner 的核心价值主张非常明确:让 AI 模型真正运行在你的电脑上,数据永不离开本地。这不仅仅是技术选择,更是一种数字主权宣言。项目采用 GPL-3.0 开源协议,完全开放商业使用和修改权限,形成了与 Claude API、ChatGPT 等闭源服务的技术对位。
AIRunner 的语言模型能力基于 llama.cpp 运行时,支持 GGUF 格式量化模型(Q4_K_M、Q5_K_S 等精度等级),可以在 8GB 内存的机器上流畅运行 7B 参数模型,35B 参数模型则需要 24GB+ 内存。通过内置的 Ollama 集成,用户也可以一键拉取 Ollama 模型库中的任意模型。LangChain 和 LangGraph 框架的引入,使得构建复杂的多步骤推理链成为可能——比如先搜索维基百科、再总结内容、最后翻译输出。
对于有 GPU 的用户,bitsandbytes 量化支持进一步降低了硬件门槛,RTX 3060 级别的显卡即可在合理速度内完成推理。项目还支持 RAG(检索增强生成)模式,允许用户导入 PDF、TXT 等本地文档,让 AI 基于私人知识库回答问题,这是云端服务无法实现的隐私优势。
绘图模块基于 HuggingFace diffusers 库,支持 Stable Diffusion 1.5、Stable Diffusion 2.1、SDXL 以及 SDXL Turbo 等主流模型。用户可以通过 ControlNet 控制线稿、深度图、骨骼姿态等条件引导生成,也可以加载社区 Lora 权重定制风格。项目内置的 ControlNet Auxiliary 工具链自动处理预处理工作流,大大降低了使用门槛。
更值得关注的是 Turbo 模式:SDXL Turbo 可以在单步推理内生成高质量 512×512 图像,相比传统 Eular_a 调度器需要 20-30 步的体验,实现了真正意义的"即时生成"。DeepCache 和 tomesd 优化库的引入,在保持质量的同时将显存占用降低了约 40%,让 6GB 显存的入门级 GPU 也能跑起来。

图1:AIRunner 艺术生成界面,支持 SDXL Turbo 实时出图与 ControlNet 条件控制
语音功能是 AIRunner 区别于其他开源 AI 工具的独特能力。系统采用 faster-whisper 实现语音转文字(STT),支持 Whisper Large V3 等高精度模型,中文普通话识别准确率接近商用水平;文字转语音(TTS)端则提供了 OpenVoice(支持中英日韩等多语言克隆)、Melotts(高质量英语/德语/法语/西班牙语合成)、Gruut(离线多语言 TTS)三套引擎可选。
这意味着用户可以用自己的声音训练一个克隆 TTS 模型,然后让 AI 用"你的声音"说话——整个链路完全在本地运行,没有任何数据外传。对于需要练习外语口语、录制配音、或做无障碍辅助的用户,这套系统的价值远超技术本身。
AIRunner 的 agents 模块基于 LangGraph 构建,支持复杂的多步骤推理与工具调用。内置工具集包括网页搜索(DuckDuckGo + Google)、PDF 文档解析、维基百科查询、Shell 命令执行等。用户可以定义一个自然语言目标(如"帮我找过去一周关于 AI 编程的新闻,整理成摘要"),AIRunner 自动编排工具链完成执行。
项目还引入了 computer-use 能力,支持 AI 驱动的 GUI 自动化操作——让大模型像真人一样操作桌面应用、填写表单、截取屏幕,这在 RPA(机器人流程自动化)场景中有巨大潜力。
AIRunner 的代码架构遵循**混合运行时(Hybrid Runtime)**设计哲学:每种 AI 能力(LLM、STT、TTS、Art)都有本地原生实现和远程 API 实现两套运行时,通过统一的 RuntimeRegistry 动态路由。项目源码位于 src/airunner/,按功能划分为以下模块层次:
FastAPI 服务器的存在使 AIRunner 同时具备桌面应用和 API 服务两种使用形态:开发者可以启动 headless 模式,将 AIRunner 作为后台 AI 微服务集成到其他应用中,通过 REST/WebSocket 接口调用所有 AI 能力。
项目提供了完整的 Dockerfile(基于 nvidia/cuda:12.9.1 多阶段构建)和 docker-compose.yml,支持 GUI 模式(通过 X11 转发显示)和 Headless 模式(纯 API 服务)两种运行方式。通过 AIRRUNNER_INSTALL_PROFILES 构建参数,用户可以选择性安装 LLM 原生推理、STT、TTS、Art 等功能模块,按需分配存储空间。
硬件需求要点:
裸机安装推荐使用官方 install.sh 脚本,它会自动检测系统环境、下载预构建 bundle 或从源码构建,配置桌面入口和 PATH 环境变量。如果不想折腾依赖,Docker 方案最为省心——一行 docker compose run --rm airunner 即可启动带 GUI 的完整运行环境。
AIRunner 本地运行的特性也带来了明显代价:推理速度远慢于云端 API,SDXL Turbo 单张图生成约需 10-30 秒(GPU),LLM 首 token 延迟也取决于模型大小和量化精度,7B Q4 模型约 15-30 tok/s。此外,项目对中文场景的优化相对薄弱——OpenVoice 中文克隆效果尚可,但 Melotts 不支持中文,Whisper 对中文方言识别有限。
Agent 工作流虽有 LangGraph 加持,但内置工具集的稳定性和错误恢复机制仍需打磨,在复杂任务中可能出现中途卡死的情况。
从更宏观的视角看,AIRunner 代表的并非单一工具,而是一种技术路线的胜利:隐私优先、本地运行、开源可控的 AI 工具链正在从极客玩具走向实用化。随着模型量化技术(GGML、AWQ、GPTQ)的成熟和消费级 GPU 性价比提升,曾经需要 H100 集群才能运行的 AI 能力正在飞入寻常百姓家。
如果你的场景恰好是:数据敏感(不愿上传)、网络受限(离线工作)、长期使用(不想付月费),AIRunner 是目前开源社区中功能最完整、集成度最高的本地 AI 解决方案之一,值得亲自部署体验。