LiteRT-LM
Google 开源的高性能端侧大模型推理框架,支持在手机、PC、IoT 设备上本地运行 Gemma/
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Google 开源的高性能端侧大模型推理框架,支持在手机、PC、IoT 设备上本地运行 Gemma/
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:你是一名外卖骑手,每天穿行在城市的大街小巷,手机里装着一款能实时听懂你语音指令的 App——"附近最近的充电宝机柜在哪里?""帮我导航到取餐地点。"这类即时性请求,不需要你等上好几秒才能得到回复,甚至在没有网络的地下室里,App 依然能流畅响应。
这正是 LiteRT-LM(Light Runtime for Language Models)想要解决的核心问题:把大语言模型从云端拉回到设备本地,让 AI 在你的口袋里就能跑起来。
2023-2024 年,大语言模型(LLM)席卷全球,但几乎所有主流产品——ChatGPT、Claude、Gemini——都运行在云端服务器上。用户每一次提问,数据都要经过互联网传输到远程数据中心,处理完再返回。这种模式带来了三个挥之不去的问题:
延迟高。 即便服务器在隔壁省份,网络往返 + 模型推理的耗时通常在 1-3 秒不等,在弱网环境下更是难以忍受。对于语音助手、实时翻译等场景,这简直是体验杀手。
隐私风险。 你的对话数据上传到云端,就意味着企业可以存储、分析、甚至泄露。医疗、法律、金融等敏感行业的从业者对此尤为警惕——谁能保证自己的内部对话不会被用于模型训练?
成本持续。 云端推理需要大量 GPU 算力,每一次 API 调用背后都是真实的钱。开发者要在产品里集成 AI 能力,要么付费调用 API(成本随用户量线性增长),要么自己搭建推理集群(运维复杂度陡增)。
端侧推理则同时解决了这三个痛点:本地推理延迟低于 50ms(无网络往返)、数据永远不出设备、一次性部署后零边际成本。但这要求模型足够小(通常 1B-12B 参数)且推理引擎足够高效。
正是在这样的背景下,Google 在 2024-2025 年推出了 LiteRT-LM——作为 LiteRT(TensorFlow Lite 的继任者)生态中的 LLM 专用推理层,目标是成为端侧 AI 的标准基础设施。
LiteRT-LM 并非一个简单的模型加载器,而是一套精心设计的分层架构。以 C++20 为核心,向上辐射出 Python / Kotlin / Swift / JavaScript 多语言绑定,向下对接 GPU / NPU 多硬件加速。
最底层是 runtime/engine/ 中的核心推理引擎。它负责模型的加载、Token 生成和推理调度。引擎支持两种主流加速技术:
GPU 加速 通过 CUDA 调用 NVIDIA 显卡算力,适合桌面和服务器场景。构建时需要添加 --define=litert_link_capi_so=true 等编译标志,并将预编译的 .so 动态库放在可执行文件同目录下。
NPU 加速 针对移动端优化,Google 已经在 Pixel Watch、Chromebook Plus 等自家产品中量产部署,经受了真实用户的检验。
最值得关注的是多 Token 预测(Multi-Token Prediction, MTP) 技术。传统 LLM 每步推理只生成一个 Token,而 MTP 允许模型同时预测多个候选 Token,然后通过验证网络快速筛选正确结果。Google 的数据显示,Gemma 4 配合 MTP 后推理速度提升最高 3 倍。
runtime/conversation/ 实现了对话上下文管理。一个 Conversation 实例维护完整的对话历史,支持多轮交互时的注意力机制和状态追踪。这比每次请求重新构建上下文(Context Rebuilding)要高效得多。
import litert_lm
with (
litert_lm.Engine("model.litertlm", max_num_tokens=10) as engine,
engine.create_conversation() as conversation,
):
message = conversation.send_message("Hello!")
print(message["content"][0]["text"])
这个 API 设计非常干净——上下文管理交给 with 语句自动搞定,对话状态不需要手动清理,开发者只需要关注业务逻辑。
LiteRT-LM 原生支持函数调用(Function Calling),这是构建 AI Agent 的关键能力。当模型判断需要调用外部工具时(如查询天气、搜索数据库),推理引擎可以拦截推理过程,注入工具执行结果后继续生成。
工具调用语法解析基于 ANTLR4 实现——这是一个工业级的词法/语法解析器生成器,比手写正则表达式可靠得多。项目中 Rust 语言(runtime/components/rust/)部分专门用于高性能的语法树构建。
有些场景需要模型输出的格式是严格可解析的——比如输出 JSON、枚举值或特定格式的指令。LiteRT-LM 在 runtime/components/logits_processor/constrained_decoding/ 中实现了前馈约束:在每一步 Token 生成时,将非法 Token 的概率强制置零,引导模型只生成符合约束的输出。这比事后用正则校验(失败后重试)要优雅得多。
Google 为不同平台提供了开箱即用的 SDK:
python/litert_lm/):pip 安装,Jupyter notebook 无缝集成,适合服务器端推理kotlin/java/com/google/ai/edge/litertlm/):Maven 集成,面向 Android 开发js/packages/core/):Node.js 环境,适合边缘计算场景此外还有 LiteRT-LM CLI(python/litert_lm_cli/)提供命令行推理能力,配合 --backend=gpu 和 --enable-speculative-decoding=true 可以一键启动 GPU 推理服务器。
LiteRT-LM 并不是一个实验室项目。Google 官方披露,它已经在以下产品中大规模部署:
| 产品 | 部署规模 | 典型场景 |
|---|---|---|
| Chrome | 数十亿活跃设备 | 浏览器端 AI 助手 |
| Chromebook Plus | 持续增长 | 本地文档摘要、AI 写作辅助 |
| Pixel Watch | 最新款 | 手表端语音指令处理 |
| Google AI Edge Gallery | App Store / Play 双渠道 | 模型下载与管理 |
Google AI Edge Gallery 是 Google 官方推出的模型管理和运行 App,用户可以直接从应用内下载兼容的 .litertlm 模型文件,在本地运行而无需网络连接。这是端侧 AI 生态的关键一环——光有推理引擎不够,还需要模型分发和管理的闭环。
LiteRT-LM 支持主流的开源大模型格式:
.litertlm 模型格式(通过转换工具生成)用户可以通过 LiteRT-LM CLI 从 Hugging Face 直接下载模型并运行:
litert-lm run \
--from-hugging-face-repo=litert-community/gemma-4-E2B-it-litert-lm \
gemma-4-E4B-it.litertlm \
--backend=gpu \
--enable-speculative-decoding=true
零配置,一行命令跑起 Gemma 4。这对于想快速验证端侧 AI 能力的开发者来说非常友好。
LiteRT-LM 并非没有短板:
硬件要求不低。 虽然比云端推理门槛低,但 6GB+ VRAM 的要求意味着它无法在老旧设备或入门级 GPU 上流畅运行。树莓派等 IoT 设备仅支持小型模型(≤1B),实际可用性有限。
模型转换有门槛。 官方模型格式是 .litertlm,从 Hugging Face 的标准格式转换过来需要额外工具链,对非技术用户不够友好。虽然 CLI 提供了 --from-hugging-face-repo 快捷方式,但这背后仍然是转换逻辑的封装。
Windows 部署复杂。 CMake 构建系统对 Windows 支持较弱,官方推荐使用 Bazel 7.6.1 配合 Visual Studio 2022 + Python 3.13,步骤繁琐。相比之下 Linux 和 macOS 的构建体验更为成熟。
社区生态尚在成长。 相比 vLLM、Ollama 等已经拥有大量用户的推理框架,LiteRT-LM 的开源社区规模还比较小,第三方插件和工具链还不够丰富。
LiteRT-LM 的出现代表了 AI 推理从"集中式云端"向"分布式端侧"演进的大趋势。几个值得关注的信号:
Google 的战略意图非常清晰——继 TensorFlow Lite 之后,LiteRT-LM 是 Google 在端侧 AI 时代的核心产品。通过在 Chrome、Chromebook 等自家生态中大规模部署,Google 正在建立端侧 AI 的事实标准,试图在 Apple 和 Microsoft 之前抢占先机。
端侧 AI 的性能拐点正在到来。 2025 年之前,端侧 LLM 的主流是 1B-3B 参数的"玩具级"模型,能力有限。Gemma 4 12B 的出现说明即便是 12B 参数的中大型模型,也可以在消费级 GPU(RTX 3080,2020 年发布)上跑起来,而且通过 MTP 技术做到 3 倍速推理。这意味着端侧 AI 的能力边界正在快速扩展。
多模态是下一个战场。 LiteRT-LM 已经支持视觉和音频输入,这意味着未来的端侧 AI 不只是处理文字——它可以看图、听语音、理解视频帧。结合工具调用能力,端侧 Agent 的雏形正在显现。
对于开发者而言,LiteRT-LM 的价值在于它提供了一套经过生产环境验证的端侧推理基础设施。无论你是想为 App 添加本地 AI 能力,还是想在边缘设备上部署智能客服,现在都有了一个可靠的选项。而 Google 在 Chrome 中的部署本身,就是最好的性能背书。