runanywhere-sdks
跨平台端侧AI工具包,在iOS/Android/Web上本地运行LLM、语音识别、语音合成,数据永不离开设备
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
跨平台端侧AI工具包,在iOS/Android/Web上本地运行LLM、语音识别、语音合成,数据永不离开设备
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,未来某一天,你手机上的 AI 助手不再需要联网,所有问答、语音助手、图像生成都在本地完成,数据永远不会离开你的设备?这不是科幻——RunAnywhere 正在把这件事变成现实。

图1:文本生成——LLM 推理 100% 本地运行
2024 年,大模型浪潮席卷全球,但几乎所有主流 AI 应用——ChatGPT、Claude、Gemini——都依赖云端服务器运行。这意味着每次提问,用户数据都要上传到第三方服务器。对于关注隐私的医生、律师、企业客户而言,这是一个难以绕开的合规障碍。
与此同时,移动端硬件能力在飞速提升。苹果 A17 Pro、高通骁龙 8 Gen 3 等旗舰芯片的神经引擎已经可以在手机上跑通数十亿参数的模型。Llama.cpp 等高效推理框架的出现,更是让 C++ 实现的高性能本地 LLM 推理成为可能。正是在这个技术交汇点上,RunAnywhere 应运而生。
RunAnywhere 由独立开发团队 RunanywhereAI 于 2025 年 7 月创建,短短不到一年时间就积累了超过 10,000 颗 GitHub Stars,成为边缘 AI 领域最受关注的开源项目之一。项目的核心开发者活跃维护 Discord 社区,目前已有数千名成员。
如果把 AI 模型比作汽车的发动机,传统云端 AI 就是"租用发动机"——每次提速都要向远程服务器申请,油料(数据)还要运到外地加注。RunAnywhere 则是提供一套完整的"发动机安装套件",让任何 iOS、Android、Web 应用都能把发动机直接装进自己的车里,随叫随到,永不离线。
开发者只需几行代码,就能给自己的 App 装上本地运行的 LLM、语音识别、语音合成能力。
1. LLM 文本生成
支持 Llama、Mistral、Qwen、SmolLM 等主流开源模型。通过 LlamaCPP Runtime 实现高效的 C++ 推理,兼容 GGUF 格式量化模型。这意味着 4-bit 量化的 7B 模型只需要约 4GB 内存即可流畅运行。
2. 语音转文字(STT)
集成 Whisper 系列模型,实现完全离线的语音识别。用户对着手机说话,内容即时转录为文字,全程无需网络。这一能力对输入法、笔记应用、辅助无障碍应用有巨大价值。
3. 文字转语音(TTS)
提供神经网络语音合成,生成自然流畅的语音输出。结合 STT 和 LLM,可以构建完整的本地语音助手。
4. 语音 AI 流水线
这是最令人印象深刻的能力:STT → LLM → TTS 三阶段流水线全部本地运行。一个完全离线、私密、快速响应的 AI 语音助手就此诞生。

图2:语音 AI——STT → LLM → TTS 全流程本地运行
5. 图像生成与视觉语言模型
集成本地扩散模型实现图像生成,同时支持 VLM(视觉语言模型),让设备端 AI 也能"看懂"图片内容。

图3:视觉语言模型——端侧也能做图片理解
RunAnywhere 的架构设计非常清晰:底层是 LlamaCPP Runtime 提供跨平台的高性能 LLM 推理能力,上层通过各平台的原生 SDK 暴露统一接口。
| 平台 | 语言 | 包管理 | 状态 | 代码位置 |
|---|---|---|---|---|
| iOS/macOS | Swift | Swift Package Manager | Stable | sdk/runanywhere-swift/ |
| Android | Kotlin | Gradle (MavenCentral/JitPack) | Stable | sdk/runanywhere-kotlin/ |
| Web | TypeScript | npm | Beta | sdk/runanywhere-web/ |
| React Native | TypeScript | npm | Beta | sdk/runanywhere-react-native/ |
| Flutter | Dart | pub.dev | Beta | sdk/runanywhere-flutter/ |
核心推理引擎 llama.cpp 以 C++ 实现,性能远超纯 Python 方案。各平台 SDK 通过 FFI(Swift 直接调用 C++,Kotlin 通过 JNI)调用底层引擎,保证了推理效率的最大化。
项目采用 Gradle + Kotlin DSL 构建 Android SDK,Swift Package Manager 管理 iOS/macOS 依赖,npm/yarn 管理 Web 侧 TypeScript 依赖。代码质量方面,配置了 pre-commit hooks(gitleaks 敏感信息检测),体现了团队的安全意识。
对于移动开发者而言,RunAnywhere 的接入非常直观。以 iOS 为例:
import RunAnywhere
import LlamaCPPRuntime
LlamaCPP.register()
try RunAnywhere.initialize()
try await RunAnywhere.downloadModel("smollm2-360m")
try await RunAnywhere.loadModel("smollm2-360m")
let response = try await RunAnywhere.chat("What is the capital of France?")
从初始化到第一次对话,代码不超过 10 行。模型下载、加载、推理的进度均有回调通知。
Android 侧使用 Kotlin 协程提供流式进度通知,Flutter 侧同样基于 Dart 异步机制,Web 侧则是 Promise 风格。各平台均保持了惯用风格,不会让开发者感到陌生。
1. 模型质量与大小权衡
手机端能流畅运行的模型参数量受限(通常 1B~7B),生成质量与云端 GPT-4/Claude 级别的模型存在差距。对于复杂推理任务,设备端模型仍有不足。
2. 冷启动时间
首次加载模型需要下载(几百 MB 到数 GB)和初始化时间,RunAnywhere 提供了进度回调改善体验,但相比云端 API 的即时响应仍有差距。
3. SDK 成熟度不均
Swift(iOS/macOS)和 Kotlin(Android)版本标注为 Stable,生产可用;而 Web、React Native、Flutter 仍处于 Beta,功能和稳定性可能有变化。
4. 内存峰值管理
大型模型在推理时内存占用较高,对于低配置设备需要谨慎选择模型量化版本。
RunAnywhere 的出现填补了"生产级跨平台本地 AI SDK"这一市场空白。在医疗、金融、法律等强合规领域,数据不能离开本地服务器是刚性需求。RunAnywhere 提供了一套标准化接口,让这些行业应用也能快速拥有本地 AI 能力,而无需自行集成 llama.cpp 的复杂工作。
从 GitHub Stars 增长曲线看,项目在发布后短短几个月内就突破了 10,000 Stars,增长速度在边缘 AI / 端侧 AI 分类中名列前茅。Discord 社区的活跃度也印证了开发者的关注度。
更重要的是,RunAnywhere 代表了一种趋势:AI 能力正在从云端向边缘侧迁移。随着芯片性能和模型量化技术的持续进步,未来在手表、耳机、汽车等更受限的设备上运行 AI 助手将成为可能。RunAnywhere 正在为这一天奠定基础设施层面的基础。