RyzenAI-SW
AMD 官方 Ryzen AI 软件栈,将 ONNX 模型部署到消费级笔记本 NPU,无需高端 GPU 即可跑通大语言模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AMD 官方 Ryzen AI 软件栈,将 ONNX 模型部署到消费级笔记本 NPU,无需高端 GPU 即可跑通大语言模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你是一名独立开发者或学生,手头没有昂贵的 NVIDIA A100 显卡,却希望在自己的笔记本电脑上跑一个能回答问题的本地大语言模型。这个场景在 2023 年之前几乎是不可能实现的——直到 AMD 推出了集成 NPU(神经网络处理单元)的 Ryzen AI 处理器。
Ryzen AI 是 AMD 在其消费级移动处理器中嵌入的专用 AI 加速引擎。与传统的 GPU 加速不同,NPU 专门为神经网络推理设计,功耗更低、响应更快。而 Ryzen AI Software 正是 AMD 为开发者提供的官方软件栈,用于将训练好的 AI 模型高效部署到这些 NPU 硬件上。

AMD 早在 2020 年收购赛灵思(Xilinx)后,将后者的深度学习加速技术整合进了消费级芯片。这项技术沉淀在 Ryzen AI Software 中,并于 2023 年正式向开发者开源了示例代码仓库——也就是今天的主角。
Ryzen AI 处理器集成专用的 NPU 模块,基于 Xilinx DPU(Deep Learning Processing Unit)架构优化。以 Ryzen AI 7040 系列为例,其 NPU 可提供最高 10 TOPS(每秒万亿次运算)的 AI 算力,足够在本地运行 Whisper 语音识别、ResNet 图像分类、YOLOv8 目标检测等主流模型。
值得注意的是,Ryzen AI 支持混合加速模式——NPU 负责大部分推理计算,不够的部分交给 CPU 或 iGPU(集显)补充。这种设计避免了单一硬件瓶颈,让资源调度更加灵活。
Ryzen AI Software 的核心推理引擎基于 ONNX Runtime,AMD 为其开发了专门的 Vitis AI 执行 Provider(EP)。这意味着开发者可以用标准的 ONNX 格式模型,通过 ONNX Runtime 的统一接口无缝部署到 Ryzen AI 硬件上。
这种架构带来了显著优势:
仓库代码以 Python 为主,示例脚本面向快速验证场景;底层推理核心(utilities/npu_check)使用 C++ 实现以保证性能。AMD 官方提供:
仓库提供了丰富的 CNN 示例,覆盖主流任务:
| 示例 | 说明 | 典型硬件占用 |
|---|---|---|
| ResNet 图像分类 | 迁移学习微调 ResNet 模型 | NPU 为主 |
| YOLOv8 目标检测 | 实时物体检测,支持视频流 | NPU + iGPU |
| 超分辨率 | 图片放大增强 | CPU + iGPU |
| Nemotron OCR v2 | AMD 优化的光学字符识别 | NPU |
以「Hello World」Jupyter Notebook 为例,新手可以在 15 分钟内完成第一个模型的部署验证。这种低门槛设计体现了 AMD 希望扩大开发者社区的意图。
对于 AI 爱好者最关心的 LLM 部署,Ryzen AI Software 提供了完整解决方案:
部署流程(以 Llama-3.1-8B 为例):
Ryzen AI 官方提供了两类预优化模型:
实测 Llama-3.1-8B-Instruct 在 Ryzen AI 7040 处理器上可达到约 8-12 tokens/s 的生成速度。虽然远不及高端 GPU,但对于日常问答、代码补全等场景已经可用。
VLM(Vision Language Model)支持是近期的亮点功能。仓库提供了:
vlm_run.py:快速推理脚本,测试单个图片vlm_benchmark.py:性能基准测试run_all_benchmarks.py:批量多尺寸测试支持的指标包括预处理时间(Preprocessing)、首 Token 延迟(TTFT)、解码吞吐量(TPS)等,方便开发者量化不同硬件配置下的性能表现。
AMD 还支持主流 ASR 模型:
Demos 目录中的 ASR/Whisper 和 ASR/Parakeet-TDT 提供了端到端的语音转文字示例,可用于会议记录、字幕生成等场景。
RyzenAI-SW/
├── CNN-examples/ # 计算机视觉示例
│ ├── hello_world/ # 新手入门 Jupyter
│ ├── ResNet/ # 图像分类
│ ├── YOLOv8/ # 目标检测
│ └── quark_quantization/ # 量化工具
├── LLM-examples/ # 大语言模型示例
│ ├── oga_api/ # ONNX Runtime GenAI API 基础用法
│ ├── RAG-OGA/ # RAG 检索增强生成
│ ├── VLM/ # 视觉语言模型
│ └── llm-sft-deploy/ # SFT 微调模型部署
├── Transformer-examples/ # BERT/DistilBERT 等 Transformer 模型
├── WinML/ # Windows ML 原生接口
├── Demos/ # ASR、OCR 等完整演示
└── utilities/ # npu_check 工具(C++)
核心依赖:
Ryzen AI Software 代表了一个重要趋势:AI 推理从云端向边缘端下沉。AMD 选择将 NPU 集成到消费级笔记本中,让 AI 能力不再是大企业的专属。
从数据来看,随着 AI PC 概念在 2024 年的兴起,Intel(Meteor Lake)、Qualcomm(Snapdragon X)等厂商也在跟进。AMD 的先发优势在于:
未来,随着 NPU 算力持续提升(AMD 已在路线图中规划更高 TOPS),本地 AI 推理有望成为笔记本的标配能力,Ryzen AI Software 将持续迭代支持更多模型和场景。
# 1. 安装 Git LFS
git lfs install
# 2. 克隆仓库
git clone https://github.com/amd/RyzenAI-SW.git
cd RyzenAI-SW
# 3. 激活 Ryzen AI conda 环境
conda activate ryzen-ai-<version>
# 4. 运行 Hello World 示例
cd CNN-examples/hello_world
jupyter notebook
# 5. LLM 推理示例
cd LLM-examples/oga_api
# 参考 README.md 下载模型并运行
本报告基于 amd/RyzenAI-SW GitHub 仓库 2026-08-11 最新代码分析生成。