wukong-robot
模块化中文语音助手框架:离线唤醒+多ASR/TTS引擎+插件生态,无需联网也能用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
模块化中文语音助手框架:离线唤醒+多ASR/TTS引擎+插件生态,无需联网也能用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2017 年的一个深夜,深圳某间出租屋里,一个叫潘伟超的程序员正在和一块树莓派死磕。他的目标是:做一个能用纯中文对话的智能音箱——不是小米小爱那种商业产品,而是完全开源、自己动手的那种。
当时市面上最火的开源语音助手是 Amazon Echo 和 Google Home 的模仿者 dingdang-robot,但安装过程极其繁琐,还需要配置 PocketSphinx 离线语音识别引擎,普通开发者光是搭环境就要折腾好几天。潘伟超想:能不能做一个更简单、更模块化、让任何人都能快速上手的中文语音助手?
这个想法催生了 wukong-robot(悟空机器人)。项目名取自《西游记》里最具反叛精神的美猴王——它不听从天命,要自己掌握命运。

图1:wukong-robot 项目 Logo
wukong-robot 由独立开发者 潘伟超(wzpan) 创建和维护,项目托管于 GitHub,采用 MIT 开源许可证。项目自 2017 年启动至今(当前版本 3.5.3),已持续维护超过 7 年,在 GitHub 上积累了超过 7,100 颗星、1,400 多次 Fork,是中文开源社区中最具影响力的语音 AI 项目之一。
作者在 README 中披露:截至 2023 年 3 月,全球已有超过 13,000 台设备安装了 wukong-robot,累计唤醒次数超过 70 万次。这个数字对于一个没有商业推广、纯靠社区口碑传播的个人开源项目来说,相当惊人。
项目仓库中包含了完整的文档(docs/ 目录下的 Sphinx 生成的 HTML 文档)、插件系统、驱动抽象层和丰富的 ASR/TTS 集成,甚至提供了 Docker 镜像(支持 amd64 和 arm 两种架构),极大降低了部署门槛。

图2:wukong-robot 3.3.0 版本界面
如果把智能音箱比作一个人体,wukong-robot 的架构就像是把大脑、耳膜、声带和四肢做了彻底的解耦:
这种模块化设计的最大好处是:每个环节都可以独立升级或替换,不必牵一发动全身。

图3:wukong-robot 工作流程图——语音指令经过 ASR → Brain → TTS → 插件执行
wukong-robot 支持两种离线唤醒方案:Porcupine 和 snowboy。离线唤醒意味着不需要联网才能激活设备——就像对智能音箱说"Hey Siri"或"小爱同学"一样,说一声"悟空"就能唤醒。更激进的是,项目还支持 Muse 脑机接口唤醒,以及行空板(一款国产教育开发板)的摇一摇唤醒,这在同类开源项目中极为罕见。
项目支持多种对话后端接入:
README 中特别提到,wukong-robot 可能是首个支持脑机交互的开源智能音箱项目,这是作者与神经科学团队合作的成果,虽然实用价值尚在探索阶段,但技术探索精神值得肯定。
项目内置了丰富的技能插件:摄像头(Camera)、邮件(Email)、闲聊(Gossip)、古诗(Poem)、提醒(Reminder)、音量控制(Volume)等。插件采用统一接口规范,第三方开发者可以参考 plugins/ 目录下的示例自行开发。此外,robot/ 目录下有完整的事件系统、播放器、配置管理等底层模块。
wukong-robot 支持与小爱音箱、Siri、MQTT 协议以及 HomeAssistant 集成,可以语音控制家中的智能设备。对于已经搭建了 HomeAssistant 智能家居系统的用户,wukong-robot 可以作为一个本地语音控制入口,无需依赖云端语音助手。
项目提供了配套的 Web 后台,支持远程操控、配置修改和日志查看,降低了无 SSH 访问时的管理难度。
从代码结构来看,wukong-robot 的核心架构如下:
| 模块 | 说明 |
|---|---|
robot/ | 核心引擎:事件总线、配置管理、播放器驱动 |
robot/sdk/ | 插件 SDK,规范了插件的注册、事件订阅和响应接口 |
robot/drivers/ | 外设驱动抽象层,支持语音输入/输出设备 |
snowboy/ | snowboy 离线唤醒引擎(已停止维护,仅保留) |
server/ | Tornado Web 后台服务 |
plugins/ | 内置技能插件集合 |
wukong.py | 项目入口文件 |
docker/ | Dockerfile(amd64 + arm 两个版本) |
技术栈:Python 3.7+(核心语言)、Tornado(Web 后台)、PyYAML(配置管理)、requests(HTTP 客户端)、jieba(中文分词)、websocket-client(实时通信)、edge-tts(微软 Edge 语音合成)、funasr_onnx(FunASR 语音识别 ONNX 推理)。此外还集成了 baidu-aip(百度 AI 平台)和 openai SDK。
AI 组件:ASR(语音识别)、TTS(语音合成)、NLU(自然语言理解)均通过插件化方式集成,ChatGPT 接入由 openai SDK 实现,支持 gpt-3.5-turbo 等模型的多轮对话能力。
代码质量方面,整体结构清晰、模块边界明确,插件系统设计优雅。但存在一些历史包袱:snowboy 已被官方停止维护,项目中的集成属于遗留代码;部分依赖版本较旧(如 requests==2.31.0 指定了精确版本,可能与新版 Python 存在兼容性问题)。文档质量极高——有独立的 Sphinx 文档站点,这在个人开源项目中相当少见。
安装门槛:项目提供了两种安装方式:
wzpan/wukong-robot,支持 amd64 和 arm 架构,一行命令即可启动,大幅降低了门槛。使用门槛:使用前必须申请并配置 ASR/TTS 服务商的 API 凭证(百度、科大讯飞等均需注册账号),这部分是项目最大的使用摩擦点——如果没有国内开发者账户,配置过程较为繁琐。
硬件要求:标准 x86 服务器或 PC、树莓派(arm 架构)、Mac 均支持。无需 GPU,普通 CPU 即可运行,对硬件要求极低。内存占用约 1GB,磁盘 2GB。
商业 AI 依赖问题:项目高度依赖百度、科大讯飞等商业 ASR/TTS 服务,这些服务均有每日调用量限制或收费,免费用户的使用体验存在上限。本地 Whisper ASR 的集成虽已支持,但 VITS 等高质量 TTS 仍需较强算力。
snowboy 停止维护:项目中使用的 snowboy 离线唤醒引擎已于 2023 年停止维护,PyPI 上的包已下架。虽然 Porcupine 提供了替代方案,但老用户迁移存在一定成本。
文档与实际代码的同步问题:部分文档中描述的功能(如特定插件的使用方式)与最新代码版本存在细微差异,需要用户自行甄别。
无 Web UI:项目本身没有图形化配置界面,所有配置通过 YAML 文件完成,对非技术人员不够友好。
wukong-robot 的出现填补了中文开源语音助手领域的一个空白。在它诞生之前,中文开发者想要做自己的智能音箱,只能借鉴 dingdang-robot 等项目,但那些项目安装复杂、代码耦合度高、扩展困难。wukong-robot 以极低的上手门槛和高度模块化的设计,让"每个人都能拥有自己的智能音箱"成为可能。
从更宏观的视角看,wukong-robot 代表了开源 AI 落地的一种路径:不追求大模型、通用 AI 的宏大叙事,而是专注于"让 AI 在具体场景中真正可用"。它把复杂的语音 AI 能力封装成可插拔的模块,让不具备 AI 专业知识的 Maker 也能用上最前沿的语音技术。
从 2017 年到今天,wukong-robot 见证了中文 AI 语音技术从百度 ASR 一家独大,到 Whisper 崛起、开源模型遍地开花的全过程。项目本身的演进轨迹(从 AnyQ 到 ChatGPT,从 snowboy 到 Porcupine),某种意义上也是整个中文 AI 开发者社区成长的缩影。
本文档基于 wukong-robot 源码(v3.5.3)和 GitHub 公开信息生成,分析时间:2026-05-30。