nexa-sdk
高通官方边缘AI推理框架,支持LLM/VLM/ASR/OCR等模型在手机、汽车、IoT设备上本地运行
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
高通官方边缘AI推理框架,支持LLM/VLM/ASR/OCR等模型在手机、汽车、IoT设备上本地运行
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:NexaSDK 官方 Banner,展示了在 PC、手机、汽车等多终端上的 AI 推理能力
你可能有过这样的经历:用手机语音助手查资料,结果转了好几圈还在加载;想把一个 AI 写作助手嵌入自己的 App,却发现必须调用云端 API,数据隐私和响应延迟都是问题。这类困扰的本质是:AI 模型太重,必须跑在云端。
而 NexaSDK 正在尝试打破这个瓶颈——它让你把最新的大语言模型(LLM)、多模态模型(VLM)直接部署到手机、汽车、甚至 IoT 设备上运行,延迟低、隐私好、不依赖网络。
NexaSDK 由 高通(Qualcomm) 官方维护,开源在 GitHub 仓库 qualcomm/nexa-sdk,目前已斩获超过 8,000 颗星,Fork 数超过 1,000。高通在 2025 年连续三次在官方开发者博客中重点推荐 NexaSDK,涉及 Hexagon NPU(神经网络处理器)深度优化、Day-0 模型支持以及 Android 智能手机落地等主题。
这背后的商业逻辑很清晰:高通的骁龙芯片遍布全球智能手机、汽车座舱和 IoT 设备,而 AI 推理从云端向边缘端下沉是行业大趋势。高通需要一个软件栈让这些设备原生运行最新模型,NexaSDK 就是这个答案。
可以把 NexaSDK 理解为一个多平台翻译官。假设你写了一篇中文文章,需要翻译成英文、日文、西班牙文——传统方式是请一位翻译(云端 API),但这位翻译不在身边(网络延迟)、而且你的文章会被他看到(隐私问题)。
NexaSDK 的做法是:给你配一台随身翻译机(边缘推理引擎),这台机器内置了多种语言的翻译能力,支持最新热词(Day-0 模型支持),而且专门针对高通的芯片进行了硬件加速优化。它支持 GGUF(llama.cpp 格式)和 NEXA 两种模型格式,基本涵盖了当前主流的开源 AI 模型生态。
NexaSDK 采用多语言 SDK + 统一推理内核的架构设计:
| 组件 | 技术栈 | 说明 |
|---|---|---|
| 核心推理内核 | Kotlin(C++ 底层) | 针对 Qualcomm Hexagon NPU / Adreno GPU / ARM CPU 优化 |
| CLI 工具 | Go | nexa 命令行,支持模型拉取和推理 |
| Python SDK | Python | pip install nexaai,支持 LLM / VLM / ASR / OCR / TTS / Embedding |
| Android SDK | Kotlin + Gradle | implementation 'ai.nexa:core:0.0.19' |
| Docker 支持 | 官方镜像 | nexa4ai/nexasdk:latest |
推理内核底层调用了 Qualcomm Hexagon NPU 的向量处理单元(HVX/HTA),这是一种专为神经网络设计的高能效 DSP。相比 GPU,NPU 在推理场景下的能效比可以高出数倍,非常适合手机和 IoT 设备。
图2:NexaSDK PC 端 Agent 交互演示
NexaSDK 不只是一个 LLM 推理引擎,它的功能边界相当宽:
语言模型(LLM):支持 Qwen3、Granite-4、Phi-3、Gemma-3n 等主流开源 LLM,可通过 nexa infer 命令直接运行 GGUF 格式模型,量化精度从 Q2_K 到 Q8_0 可选。
视觉语言模型(VLM):Qwen3-VL、OmniNeural-4B 等多模态模型支持图像输入和文本输出,适合相册理解、视觉问答等场景。
语音处理:内置 ASR(语音识别)、TTS(语音合成)、Speaker Diarization(说话人分离)能力,可在设备端完成完整的语音交互链路。
计算机视觉:OCR 文字识别、目标检测(YOLO)、图像生成(Stable Diffusion)等,覆盖了 CV 领域的主要任务。
Embedding & Rerank:文档向量化(embedding)和重排序(rerank)能力,直接在端侧构建 RAG 知识库,无需调用外部 API。
独特优势:Day-0 模型支持
这是 NexaSDK 最具差异化的标签。高通团队会与开源模型社区保持紧密合作,在新模型发布后**尽快(甚至同步)**提供 NPU 优化版本。官方宣传语是「weeks or months before anyone else」——比竞品快数周甚至数月完成适配。已验证的 Day-0 模型包括 Qwen3-VL、DeepSeek-OCR、Gemma3n(视觉版)等。
图3:LFM 多模态模型在不同硬件上的表现对比
NexaSDK 提供了四种主要接入方式,覆盖了从极客玩家到企业开发者的各类场景:
Docker 部署(推荐尝鲜):
docker pull nexa4ai/nexasdk:latest
export NEXA_TOKEN="your-token"
docker run --rm -it --privileged \
-e NEXA_TOKEN \
nexa4ai/nexasdk:latest infer NexaAI/Granite-4.0-h-350M-NPU
一行命令拉起完整的推理环境,支持 ARM64 和 x86 架构。需要注意的是 Docker 场景需要 Qualcomm Dragonwing IQ9 或等效的 ARM64 硬件。
Python SDK(最灵活):
pip install nexaai
from nexaai import LLM, GenerationConfig, ModelConfig, LlmChatMessage
llm = LLM.from_(model="NexaAI/Qwen3-0.6B-GGUF", config=ModelConfig())
conversation = [LlmChatMessage(role="user", content="Hello, tell me a joke")]
prompt = llm.apply_chat_template(conversation)
for token in llm.generate_stream(prompt, GenerationConfig(max_tokens=100)):
print(token, end="", flush=True)
一行 pip 安装,Pythonic 接口,Jupyter Notebook 友好,适合快速集成到 Python 应用中。
Android 集成(原生 App):只需在 build.gradle.kts 中加一行依赖,implementation("ai.nexa:core:0.0.19"),即可在 Android App 中调用本地推理能力,最低支持 Android 7.0(API 27),目标设备需要骁龙 8 Gen 4 及以上芯片。
CLI 工具(极客首选):下载预编译的 nexa-cli 二进制文件,export NEXA_TOKEN=... 设置 Token,直接 nexa infer <model> 运行,支持交互式多轮对话、图像拖拽输入(VLM)等。
NexaSDK 的硬件需求高度依赖运行的模型规模,大致可以分为三个梯度:
基础 LLM(如 Qwen3-0.6B):内存 2-4GB,CPU 推理即可运行,适合入门体验。
中端模型(如 Qwen3-4B、Granite-4):推荐 NPU 或 GPU 加速,内存 4-8GB,推理速度比纯 CPU 快 5-10 倍。
大规模多模态(如 Qwen3-VL-4B、图像生成模型):推荐 NPU/GPU 联合加速,显存 6GB+、内存 8GB+。
值得一提的是,NPU 加速需要通过 Nexa AI Model Hub 获取免费 Token(个人用途免费),商业使用需联系官方商务团队获取商业授权。
NexaSDK 并非完美,以下几个问题值得客观看待:
1. NPU 加速的「黑盒」问题:核心 NPU 优化依赖高通专有的二进制闭源组件,这部分既不开源、也无法在非高通芯片上运行。这意味着开发者在享受性能红利的同时,也在技术路线上被「锁定」在高通生态内。
2. Token 授权的摩擦:NPU 模型使用需要免费 Token,虽然申请流程简单,但 Token 管理、设备激活等机制增加了使用复杂度。如果 Token 服务(如之前deprecated的验证服务)出现问题,会直接影响 NPU 用户。
3. 适用设备范围有限:Android 端需要骁龙 8 Gen 4 及更新芯片,这一门槛直接将大量中低端设备排除在外。Linux Docker 部署也需要特定 ARM64 硬件,通用性不如 llama.cpp 广泛。
4. 与 Ollama 的竞争:Ollama 在开发者生态(Docker 一键部署、OpenAI 兼容 API)方面积累深厚,NexaSDK 的差异化优势主要集中在 NPU 加速和 Day-0 支持,对于不需要 NPU 的用户来说,Ollama 可能是更省心的选择。
NexaSDK 的出现,是端侧 AI 推理从「可行」走向「好用」的一个缩影。回顾过去两年,我们看到三条清晰的趋势:
趋势一:模型压缩技术成熟。GGUF 量化、AWQ、GPTQ 等技术的成熟,使得 7B~14B 参数的模型可以在消费级设备上流畅运行,这为 NexaSDK 这类框架提供了模型基础。
趋势二:芯片厂商软硬一体。高通、苹果(MLX)、英特尔(OpenVINO)等芯片厂商都在加强推理框架的软件支持,硬件差异化竞争正在向软件层延伸。
趋势三:隐私敏感场景驱动。医疗、金融、法律等领域的 AI 应用对数据隐私有严格要求,端侧推理避免了数据上传云端,是满足合规要求的有效路径。
NexaSDK 在这三个趋势的交汇点上占据了一个独特位置:它不是通用推理框架,而是专注于高通硬件生态的深度优化。这既是它的护城河,也是它的天花板——选择它,就是选择了高通生态的深度绑定。
如果你正在开发需要端侧 AI 能力的应用,且目标设备覆盖高通芯片(手机、汽车、IoT),NexaSDK 是目前市面上 Day-0 支持最好、NPU 优化最深的选择。如果你需要更广泛的硬件兼容性或更强的开源透明性,可能需要权衡 llama.cpp + 云端 fallback 的混合方案。