Box
安卓端最完整的离线AI套件,本地运行LLM/图像生成/语音对话,数据永不离开设备
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
安卓端最完整的离线AI套件,本地运行LLM/图像生成/语音对话,数据永不离开设备
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:深夜,你有一份涉及公司商业机密的PDF需要快速摘要,但公司的安全政策禁止将文件上传到任何云端服务。传统的解决方案是手动阅读,或者找一个"声称安全"的在线工具——但你真的信任它们吗?Box 给出了第三种答案:把整个AI能力装进手机,所有推理在本地完成,数据永不离开设备。
Box 的核心哲学用三个"无"来概括:无网络、无账号、无订阅。它不是一个"简化版"AI工具,而是一个功能完整的本地AI工作站,覆盖文本对话、图像生成、语音交互、文档分析、人脸识别等多个模态。从 v1.0 到 v3.2,历经 243 次提交,Box 已经成为安卓生态中功能最丰富、社区最活跃的离线AI应用。
Box 并非从零开发,而是基于 Google AI Edge Gallery(谷歌官方面向安卓的端侧AI演示应用)进行的安全加固与功能增强分支。项目由独立开发者 jegly 于 2025 年 4 月发起,采用 Apache 2.0 开源许可。值得注意的是,Box 并非谷歌官方项目,已完全移除谷歌品牌标识,但底层技术依赖大量来自 Google 的组件(如 LiteRT/Gemini Nano)。
分叉的核心动机有两层:一是安全加固,二是功能扩展。安全层面,Box 引入了生物识别锁、AES-256 数据库加密(SQLCipher)、截图保护和 Tapjacking 防护;功能层面,在原版仅有文本对话的基础上,新增了本地图像生成、语音对话、文档RAG问答、人脸识别等重量级功能。
Box 的技术架构是其在离线端侧AI领域保持领先地位的核心原因。它不是一个"调用某个API"的简单应用,而是一个多引擎并行调度系统。
Box 内置了四套互补的推理引擎:
| 引擎 | 用途 | 模型格式 |
|---|---|---|
| LiteRT (TensorFlow Lite) | 优先使用设备NPU/TPU加速推理 | LiteRT (.task) |
| llama.cpp | 通用LLM推理,支持导入任意GGUF模型 | GGUF |
| stable-diffusion.cpp | 本地图像生成 | GGUF (SD1.5) |
| whisper.cpp | 语音转文字(STT) | GGUF (Whisper系列) |
LiteRT 是 Google 官方的端侧推理框架,当设备有 NPU(神经网络处理单元)或 TPU(张量处理单元)时自动调用硬件加速,实现高效率低功耗的本地推理。llama.cpp 则作为"万金油"引擎存在——用户可以导入 Hugging Face 上任意 GGUF 格式的模型,让 Box 支持 Gemma、Qwen、Mistral、LLaMA 等几乎所有主流开源LLM。
Box 的模型管理采用按需下载 + 分芯片构建策略。不同的安卓芯片(高通骁龙、谷歌Tensor、联发科Dimensity)需要不同的NPU驱动库,Box 为每款主流SoC编译了专属的模型版本。以 v3.1.0 为例:
用户无需关心底层细节——Box 自动检测芯片型号,下载对应的优化模型。这种精细化是 Box 区别于"通用LLM容器"的关键。
Box 的 Android 源码通过 .gitmodules 引入了三个关键C++项目作为子模块:
Android/src/llama.cpp — GGUF模型推理Android/src/stable-diffusion.cpp — 图像生成Android/src/whisper.cpp — 语音识别这些子模块均指向上游权威实现(ggerganov/llama.cpp 等),确保Box始终能跟上最新的推理优化。
Box 的功能矩阵非常完整,远超一般意义上的"本地LLM应用":
文本对话:支持多轮对话、带完整markdown渲染(含LaTeX数学公式)、对话历史持久化(重新打开自动恢复上下文)。内置 Gemma 4 E2B/E4B 作为默认模型,同时支持导入任意GGUF格式的LLM。
本地图像生成:基于 stable-diffusion.cpp,支持 GGUF 格式的 Stable Diffusion 1.5 模型,完全离线运行,画质接近云端服务。v3.2.0 新增 SoundGen 音频生成模块,可在手机上创作音乐和音效。
语音交互:三条路径——(1)Free Talk:实时语音对话,模型边生成边语音播报,延迟极低;(2)Voice Input:语音转文字输入;(3)Vision Talk:摄像头画面实时流式传输给多模态模型,同时支持语音提问。STT 默认使用 SenseVoice(支持中文普通话和粤语,比 Whisper 快约5倍)。
文档RAG问答:导入本地PDF文件,通过 MiniLM 本地嵌入模型建立向量索引,用户可以用自然语言提问,基于文档内容生成带出处的回答。
图像处理:4倍超分辨率(Real-ESRGAN X4+)、图像识别(Identify,识别1000+常见物体)。
人脸识别:本地注册人脸数据,加密存储(SQLCipher),支持照片识别和实时摄像头识别。
工具集(MCP Servers):内置多个内置工具:哈希计算、交互地图、厨房探险游戏、二维码生成、维基百科查询、邮件发送、文本改写、多语言翻译。这些工具以标准 MCP 协议实现,LLM 可主动调用。
Box 是一款面向最终用户的移动应用,部署场景是用户的个人安卓手机,而非服务器集群。它不以 Docker/Kubernetes 方式部署,官方也未提供服务端组件。
安装方式极其简洁:下载 APK 安装包(约100-200MB),或通过 Obtainium(开源APK更新管理器)添加仓库自动追踪更新。提供两个版本:
APK 内置签名校验,SHA-256 校验值在 GitHub Release 页面公开,用户可自行验证完整性。应用内部提供 Settings → Check for updates 手动检查更新。
部署难度极低(2/5),部署时间约5分钟,不需要任何服务器资源或网络连接。硬件要求主要取决于使用的模型——轻量模型(Gemma 3 270M)仅需约460MB存储;完整模型包(含多个语音模型)可能占用1-3GB存储空间。运行内存建议4GB以上。
Box 在安全设计上下了相当功夫,主要体现在:
对于关注数据隐私的用户,这套安全体系覆盖了主流威胁向量,且所有安全机制完全在本地运行,不依赖任何远程验证服务。
Box 的代码质量在开源移动项目中属于上乘水准:
Box 并非完美无缺,以下几点值得潜在用户了解:
设备依赖性:NPU加速功能高度依赖芯片型号,较老设备(骁龙8 Gen 1以下)只能使用CPU推理,速度较慢且功耗较高。
模型规模限制:受限于手机存储和内存,本地模型规模通常在0.6B–12B参数范围,无法运行GPT-4级别的大型模型。
多模态能力有限:虽然支持视觉和语音,但受限于端侧算力,图像生成质量和速度不如云端Midjourney等商业服务。
生态锁定:基于 Google AI Edge Gallery 分叉,部分底层技术依赖 Google LiteRT/AICore,custom-rom-support 版本功能会有所降级。
Box 的出现印证了一个趋势:AI能力正在从云端向端侧迁移。随着高通Hexagon NPU、谷歌Tensor TPU、联发科NeuroPilot等专用AI加速芯片在移动设备上的普及,复杂AI任务在本地完成已不再是科幻。
Box 展示了一条可行的技术路径:通过 llama.cpp 等高性能C++推理引擎结合芯片级加速,在消费级安卓手机上实现接近云端体验的LLM交互,同时保证数据的完全私密性。这对于企业数据安全、医疗隐私、金融合规等场景具有重要的参考价值。
从 GitHub 星标增长曲线看,Box 从2025年4月发布到2026年6月已积累 612 颗星,作为一个垂直细分领域的工具类应用,增长速度相当可观。
技术栈总览:Kotlin / Java + Rust(C++) / LiteRT + llama.cpp + stable-diffusion.cpp + whisper.cpp / SQLCipher / Room / Material 3 / Android 16+