CosyVoice
基于大模型的多语言零样本语音合成,支持9种语言+18种中文方言、声音克隆、流式推理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于大模型的多语言零样本语音合成,支持9种语言+18种中文方言、声音克隆、流式推理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
CosyVoice 由阿里巴巴通义实验室的 FunAudioLLM 团队打造,是一个基于大语言模型(LLM)的多语言零样本(Zero-Shot)语音合成系统。2024 年 7 月发布 v1.0,2024 年 12 月升级到 v2.0(加入流式推理),2025 年 5 月推出 v3.0(Fun-CosyVoice 3),不断刷新开源 TTS 的性能上限。
项目背后是一个完整的语音 AI 生态——FunAudioLLM 还包含 FunASR(语音识别)、SenseVoice(情感检测)、Fun-ASR-Nano(端到端 ASR)等工具,CosyVoice 只是其中一环。阿里团队将其定位为"给大模型装上耳朵和嘴巴"的关键组件,目前已在 GitHub 积累超过 21,000 颗星。

图1:CosyVoice 钉钉交流群(扫码加入开发者社区)
如果把 LLM 比作大脑——它能理解和生成文字——那么 CosyVoice 就是它的嗓子。传统的 TTS 系统就像一个只会念稿子的播音员,语调僵硬、无法个性化;而 CosyVoice 相当于一个能够"模仿任何人说话风格"的配音演员,只需要听几秒参考音频,就能生成具有相同音色、语速、情感特征的语音。
这背后的核心技术路径是:用 LLM 来驱动语音生成——不是让机器去"拼接音节",而是让模型真正理解"这段话该用什么语气说、该由谁来演绎"。
CosyVoice 的能力矩阵非常全面:
支持中文、英文、日文、韩文、德语、西班牙语、法语、意大利语、俄语 9 种主流语言;此外还支持粤语、闽南语、四川话、东北话、陕西话、上海话、天津话等 18 种以上中文方言。这是目前开源 TTS 中方言覆盖最广的项目之一。
只需提供 10~30 秒的目标说话人音频,无需任何额外训练,即可生成具有该音色特征的语音。这对于有声内容创作、游戏 NPC 配音、个性化助手等场景意义重大。
用中文说话人的音色,朗读英文文本;或者用英文音色读中文——CosyVoice 支持这种跨语言的内容迁移,这在有声书多语言版本制作中非常实用。
通过文本指令控制生成语音的属性:语言切换、方言选择、情感变化(高兴/悲伤/平静)、语速调节、音量调节等。这让语音合成从"被动生成"变成"主动编排"。
支持中文拼音和英文 CMU 音素的发音修复(Pronunciation Inpainting),对专业配音场景中的读音精确控制至关重要。
从输入文本到输出音频支持双向流式:文本端流式输入(text-in streaming)和音频端流式输出(audio-out streaming),端到端延迟最低可达 150ms,接近实时交互级别。
CosyVoice 的技术栈融合了当前 AI 领域的多条前沿路线:
预训练模型从最早的 CosyVoice-300M(SFT/Instruct),演进到 CosyVoice2-0.5B(支持 vLLM 加速),再到最新的 Fun-CosyVoice3-0.5B-2512(RL 强化学习后训练版本)。
CosyVoice 提供三种部署路径:
python webui.py --port 50000 --model_dir ... 启动,带界面,可直接上传音频进行声音克隆runtime/python/Dockerfile 构建镜像,支持 gRPC 和 FastAPI 两种接口runtime/triton_trtllm 提供 TensorRT-LLM 加速,相比 HuggingFace transformers 实现可提速 4 倍不过值得注意的是:CosyVoice 目前没有 docker-compose 一键部署脚本,需要手动配置模型下载路径和 CUDA 环境,对新用户有一定门槛。官方推荐的模型下载通过 ModelScope(国内)或 HuggingFace(海外)SDK 完成。
从纵向时间线看,CosyVoice 的演进路径代表了一条清晰的行业趋势:
在 CV3-Eval 评测中,Fun-CosyVoice3-0.5B_RL(强化学习后训练版本)达到了中文 CER 0.81%、英文 WER 1.68% 的水平,已接近甚至超越部分闭源商业方案。开源社区可以基于 CosyVoice 构建有声书工厂、语音客服、多语言播客制作等应用。
对于 AI 开发者而言,CosyVoice 也是一个极好的学习案例:它将 LLM、Flow Matching、DiT、HiFiGAN 四大技术栈串联起来,代码结构清晰(cosyvoice/cli/ 提供高层 API、cosyvoice/flow/ 承载生成逻辑、cosyvoice/hifigan/ 负责音频渲染),模块边界明确,值得参考。
一句话总结:CosyVoice 是目前开源社区最全面的大模型语音合成工具,支持 9 种语言、18 种中文方言、零样本克隆和流式推理,适合有声内容创作、个性化语音助手和跨语言配音场景,但需要 NVIDIA GPU 环境支撑。