MagicWX
Android 17 上的本地 LLM 原型,运行 Jetpack Compose + ONNX 推
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Android 17 上的本地 LLM 原型,运行 Jetpack Compose + ONNX 推
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你坐在地铁里,手机没有网络信号,但你依然可以让 AI 帮你润色一封邮件、生成一张图片,或者和本地知识库对话。大多数 AI 应用本质上是一个"浏览器"——所有推理都发生在云端,手机只是一个显示终端。MagicWX 做了截然相反的事情:把模型权重、推理引擎、生成界面全部打包进一个 APK,直接在Android 设备上运行。854 颗 GitHub Star、362 次 Fork,这个来自独立开发者 Pangu-Immortal 的项目,正在探索端侧 AI 的极限。
模型选择界面,支持本地下载管理,存储状态一目了然
MagicWX 的核心设计理念是多运行时并行。它不是一个针对单一模型优化的工具,而是一个通用推理容器,同时支持:
.task 文件,如 TinyLlama 1.1B Chat LiteRT 版本作者在 README 中明确区分了"已注册模型"(通过设备验证、可见于 App)和"候选模型"(代码中有配置但未通过验证),这种严谨的态度让项目显得格外专业——未经验证的功能不向用户展示。
聊天界面,支持计时、复制、重试等操作
除了文本生成,MagicWX 还支持端侧图片生成。基于 MNN 推理引擎,SD1.5 的 CPU 流水线已在三星 SM-A566E 真机上完成端到端验证,512×512 每步耗时约 10-14 秒(fp16 + O3 优化)。支持的生图模式包括:
生图历史由 Room 数据库持久化,参数按模型分开存储在 DataStore 中,数据完全留在本地。
MagicWX 的代码架构遵循 MVVM 模式,Kotlin 主导,分层清晰:
| 层次 | 目录 | 职责 |
|---|---|---|
| UI | ui/theme/ | Jetpack Compose + Material3 |
| 状态管理 | viewmodel/ | MainViewModel 处理用户动作与状态 |
| 推理引擎 | model/ | TextGenerationEngine 接口、RWKV/ONNX/MediaPipe 适配器 |
| 下载服务 | service/ | Foreground Service + 持久通知,进度实时同步 |
| 持久化 | data/ | Room 数据库(生图历史) |
值得注意的是,libmagicwx_image_backend.so 是一个原生 C++ 后端(通过 CMake + NDK 编译),运行在独立进程(localhost:18081,SSE 流式输出)。整个项目涉及 Java → Kotlin → C++ 三层语言边界,复杂度相当高。
依赖关键版本:
项目同时包含 Dockerfile 和 docker-compose.yml,但需要澄清一个关键区别:这不是一个服务端 AI 部署方案。容器化的主要用途是构建 Android APK 的标准化环境,而非托管推理服务。
从 build.gradle.kts 的配置可以看出,APK 仅支持 arm64-v8a(64位 ARM),这是因为 ONNX Runtime 和 MNN 的 Android 预编译产物目前仅提供 arm64 版本。项目要求 Android 17(API 37),最低兼容 Android 7(API 24),CPU 设备即可运行,GPU/NPU 加速为可选优化路径。
| 维度 | 结论 |
|---|---|
| 快速部署 | 不支持(APK 需在真机上安装,非服务端部署) |
| 容器化 | Dockerfile/docker-compose 存在,用于标准化 APK 构建环境 |
| Web UI | 无(Android 原生 Compose UI) |
| 硬件需求 | arm64 Android 7+ 真机,2GB+ RAM 建议 |
MagicWX 诚实地列出了所有失败案例。Qwen2 0.5B ONNX 输出乱码、SmolLM2 135M 输出异常、Gemma 3 270M 重复片段输出——这些问题反映出端侧推理的残酷现实:不是所有模型都能量化到手机上稳定运行。
更核心的局限在于:
MagicWX 的价值不在于超越哪个云端模型,而在于证明了什么可以在端侧做到。RWKV、Qwen、TinyLlama、SD1.5——这些原本运行在服务器上的模型,确实可以在手机上跑起来。它代表了一种"隐私优先"和"离线可用"的 AI 哲学:数据不离开设备,推理不依赖网络。
2026年,随着高通 X Elite、NPU 加速的普及,端侧 AI 的性能瓶颈正在加速突破。MagicWX 站在这个趋势的前沿,用一个 MIT 协议的开源项目,记录了端侧推理的现状与可能。
App 主界面,展示完整的端侧 AI 工作流