qwen-audio-agent
全双工实时语音 Agent 运行时,支持语音打断、多任务后台处理、结果自动注入当前对话
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
全双工实时语音 Agent 运行时,支持语音打断、多任务后台处理、结果自动注入当前对话
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你对 AI 助手说「帮我查下最近的机票,顺便写一封请假邮件」,AI 回答「好的」——然后呢?传统方案里,AI 就此"离线"了,你只能等它自己慢慢处理,等半天不知进展,甚至不知道它到底在工作了没有。 Qwen Audio Agent 解决的就是这个问题:让 AI Agent 持续交流、持续工作、持续在场。对话不中断,任务在后台默默执行,完成了自然回到当前对话。
2025 年开始,AI Agent 浪潮席卷业界,OpenCode、Claude Code、OpenClaw 等命令行编程助手如雨后春笋。但这些工具有一个共同的体验痛点:交互方式仍是等待式的——你发一条消息,它处理,你再发,它再处理,Agent 执行后台任务时,整个对话就"死"了。 Qwen Audio Agent 团队认为:真正的智能助理应该像人一样——你交代任务后,他一边处理一边还能回应你「正在查」「已经找到了」「邮件写好了你看下」。这才是自然的人机协作方式。于是他们基于阿里云百炼的实时语音 API,构建了这个全双工语音 Agent 运行时。
项目采用清晰的三层架构设计:
第一层:Realtime Frontend(实时语音前端)
负责全双工语音交互——用户说话时 AI 能随时打断,AI 回答时用户也能插嘴。内置 6 个轻量工具(spawn_thinking、cancel_agent_task、get_agent_task_status、get_current_time、user_memory、respond_agent_permission),能直接回答的问题立刻响应,无需唤醒后台 Agent。
第二层:Task Orchestration(任务编排层)
承上启下的协调器。当用户提出需要后台处理的需求时,Frontend 调用 spawn_thinking 将任务投入 FIFO 队列。编排器负责管理任务生命周期(接受→排队→发送给后端 Agent→收集结果→注入回话时机),用户可以随时追问进度或取消任务,任务完成后结果自动注入当前对话。
第三层:Backend Agent(后端 Agent 层)
具体干活的 Agent,支持接入 OpenCode、OpenClaw、Qoder、Kimi Code、Hermes、CodeBuddy、Codex、Claude Code 等主流编程 Agent。所有后端通过 ACP(Agent Client Protocol)标准协议接入,Qwen Audio Agent 提供统一协调适配层,后端的选择对用户完全透明。
图:Qwen Audio Agent 整体架构。前台 Realtime 语音层与后台 Agent 层通过 Task Orchestration 层协调,用户感知始终是同一个助理。
项目主体使用 Node.js(最低 v22.22.2),采用 npm workspaces 管理 5 个子包:
qwenaudio 调用
关键依赖包括 @agentclientprotocol/sdk(ACP 协议)、@modelcontextprotocol/sdk(MCP 协议)、ws(WebSocket)、zod(数据校验)、express(HTTP 层)。代码质量方面,项目维护 .nvmrc/.node-version 三重版本锁定,GitHub Actions CI 覆盖 server/web/tui/desktop/cli 五个 workspace,文档较为完整。Qwen Audio Agent 提供了四种交互界面,各有适用场景:
| 界面 | 特色 | 适用场景 |
|---|---|---|
| macOS 桌面版 | 内置 Gateway,dmg 一键安装,悬浮球交互 | macOS 用户首选,开箱即用 |
| Web UI | 浏览器访问 localhost,跨平台 | Windows/Linux 用户,无需安装 |
| 终端 TUI | 文本界面,支持 macOS 原生音频和 PortAudio | 喜欢终端操作的用户 |
| CLI | 命令行工具,适合集成到脚本 | 自动化场景 |
![]() | ||
| 图:macOS 桌面版悬浮球思考状态动画,视觉化呈现 Agent 正在处理任务 |
前置条件:
.nvmrc,用 nvm 可直接 nvm use)npm install -g qwen-audio-agent
配置 API Key:
# 复制配置模板
cp .env.example .env
# 编辑 .env,填入 DASHSCOPE_API_KEY
启动 Gateway(含 Agent):
qwenaudio
# 或指定 Agent
qwenaudio --agent opencode
启动 Web UI(不含 Agent,纯语音聊天):
npm run dev
macOS 桌面版下载 dmg 安装包运行即可,后台自动启动 Gateway。
强依赖阿里云百炼:Realtime 语音能力完全基于阿里云 DashScope API,不支持切换到其他 TTS/ASR 服务。若阿里云服务不可用,项目核心价值大打折扣。 容器化支持缺失:没有 Dockerfile 或 docker-compose,无法以容器方式部署服务器端 Web UI,本质上仍是本地化工具。 桌面版仅 macOS:macOS 体验最佳,Windows/Linux 用户缺少系统级音频集成。 v1 阶段稳定性待验证:项目 2026-07-28 才正式开源,社区刚起步,长期稳定性还需时间检验。
Qwen Audio Agent 最大的贡献在于产品范式的创新——将「始终在场(Always Present)」作为核心设计目标。这与 OpenAI 的 Operator、Anthropic 的 Computer Use 走了不同路线:那些方案让 AI 操控界面,Qwen Audio Agent 则让 AI 融入对话,保留人的主动权。 项目支持接入主流编程 Agent 的设计值得关注——通过 ACP 标准协议,实现了语音层与 Agent 层的解耦。用户可以在同一个语音界面下,切换使用 OpenCode 写代码、Kimi Code 做分析、Claude Code 做代码审查,无需学习多种工具。这种「语音中台」思路有潜力成为未来 AI 原生应用的交互入口。 如果你对 AI Agent 的交互形态感兴趣,或者正在寻找一种比终端更自然的编程 Agent 使用方式,Qwen Audio Agent 值得体验。
本报告基于 GitHub 仓库 v1.0.0+ 代码和 README 文档生成,分析日期 2026-08-01。