csm
基于 Llama 3.2 的对话语音生成模型,支持上下文感知的自然语音合成,可生成有情感、有停顿、有语气变化的 AI 语音
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于 Llama 3.2 的对话语音生成模型,支持上下文感知的自然语音合成,可生成有情感、有停顿、有语气变化的 AI 语音
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景: 你戴上耳机,对着一个 AI 助手说「帮我订一张下周去上海的机票」。对面传来的声音不再是机械的播报,而是一个带着轻微换气声、语调自然起伏的「人」——停顿会犹豫,语速会变化,仿佛真的有人在思考。这就是 CSM(Conversational Speech Model)想要实现的目标:让 AI 语音从「能听」进化到「好听」。
CSM 来自 Sesame(sesame.com),这是一家由前 Google 语音研究团队成员创办的 AI 创业公司。创始团队包括语音识别和生成领域的资深研究者 Johan Schalkwyk(Google 语音搜索核心成员)、Dylan B(化名 Cinjon Resnick)等。Sesame 的核心技术方向是做「高保真对话语音」,不追求通用对话能力,而是专注于让 AI 说话更像人。
2025 年初,Sesame 发布了一篇论文《Crossing the Uncanny Valley of Voice》,在技术社区引发轰动。他们展示了 AI 语音的自然度——停顿、语调、情绪——让听众几乎无法分辨是人还是机器。这篇论文配套的交互式语音 Demo 上线后,一度因访问量过大而服务器过载。
CSM 开源版本是 Sesame 基础模型的公开版本,1B 参数规模(14.6k⭐),技术规格与商业版一脉相承。

图1:Sesame 团队 GitHub 组织头像
你可以把 CSM 理解为一个配音演员培训系统。它不做文案创作(那是 LLM 的活),它只专注于一件事:如何把文字和已有的声音素材,变成一段自然的语音输出。
打个比方:传统 TTS(Text-to-Speech)像是让一个机器人读台词,CSM 则像是给 AI 上了「配音课」——它知道什么时候该停顿、哪个词该重读、如何根据上下文调整语气。
CSM 的架构设计非常精妙,采用了双塔结构:
第一塔:Llama 3.2-1B 主干网络 模型以 Meta 的 Llama 3.2-1B 为骨干,这是一个纯文本语言模型。CSM 将其改造为多模态输入——除了文字 token,还接收 32 个音频码本(audio codebook)的帧级信息。总词汇表扩展到 128,256(包含文本 + 音频码)。
第二塔:Mimi 音频解码器 来自 Kyutai 的 Mimi 模型负责将主干网络输出的 RVQ(残差向量量化)音频码本解码为波形音频。CSM 使用 Mimi 的 32 个码本,意味着它实际上生成的是「音频的高级抽象表示」,而非原始波形,这大大降低了计算复杂度。
训练数据 CSM 的训练数据来自大量对话音频。模型学习了如何根据对话上下文(多轮对话历史)预测下一句语音——这正是「对话感」的关键来源:AI 不只生成单句语音,而是理解对话的节奏和衔接。
关键技术细节(开发者视角):
1. 纯文本生成语音 给定一段文字 + 说话人 ID,直接生成对应音频。无需任何语音 prompt,适合生成播报类、叙述类语音内容。
2. 上下文增强生成(核心亮点) 提供若干「参考音频+文字」的对话片段作为上下文(Segment),CSM 会理解对话的风格和说话人的声音特征,然后生成更自然的后续语音。这是让 CSM 区别于普通 TTS 的关键能力——它能捕捉「对话节奏」。
3. HuggingFace Transformers 原生支持
CSM 已于 2025 年 5 月集成进 HuggingFace Transformers 4.52.1,开发者可以直接用 pipeline("text-to-speech") 调用,无需手动加载模型权重。同时提供 HuggingFace Space 在线 Demo,可直接体验。
4. 模型变体
没有「自带声音」 开源版本是基础模型,不包含任何特定人的声音定制。你无法让它「模仿某位明星」直接使用——这需要额外的微调(fine-tuning)。这与其他开源声音克隆工具(如 XTTS、OpenVoice)有本质区别。
不能生成文本 CSM 是纯语音生成模型,它不会「说话」。官方的建议是搭配一个 LLM(如 Llama、GPT)做文本生成,CSM 只负责把文字转成语音。这是一个「语音合成 + 对话管理」的分离架构,而非端到端的语音对话系统。
非英语支持弱 官方坦诚:模型在非英语语言上的表现主要来自训练数据的「污染」,而非刻意支持。如果你的目标用户群体需要中文、阿拉伯语等语音,CSM 可能不是最佳选择。
声音伪造风险(最重要) 这也是官方专门强调的部分:CSM 可以生成高质量、自然的语音,极易被用于:
项目 LICENSE 明确禁止滥用,并内置了 SilentCipher 水印系统以供检测。使用前务必了解当地法律法规。
| 项目 | 要求 |
|---|---|
| 硬件 | NVIDIA GPU,CUDA 12.4+,至少 8GB VRAM |
| 存储 | 模型约 5GB(含 Llama + CSM + Mimi) |
| 环境 | Python 3.10,推荐 Linux/macOS |
| 模型权重 | 需登录 HuggingFace 手动下载 Llama-3.2-1B 和 CSM-1B |
安装流程(纯 pip,不支持 Docker):
pip install -r requirements.txt
export NO_TORCH_COMPILE=1 # 禁用懒编译,避免 Mimi 问题
huggingface-cli login # 登录获取模型权限
python run_csm.py # 运行示例对话生成
CSM 开源是 2025 年语音 AI 领域的重要事件。在此之前,高质量对话语音生成技术主要掌握在大厂手中(Google、ElevenLabs、OpenAI)。CSM 以 1B 参数规模将「对话语音生成」带入了开源社区,降低了研究门槛。
从更宏观的角度看,CSM 体现了 AI 语音合成的趋势:
截至目前,CSM 在 GitHub 收获 14,633 颗星,模型下载量持续增长。它是语音生成领域值得关注的基础设施级开源项目。
本报告基于 CSM 开源仓库(MIT/Apache-2.0)v0.1.0 及 Sesame 官方博客综合分析生成。