ThinkSound
CoT思维链驱动的统一多模态音频生成框架,NeurIPS 2025录用,支持视频/文本/音频任意模态
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
CoT思维链驱动的统一多模态音频生成框架,NeurIPS 2025录用,支持视频/文本/音频任意模态
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你给 AI 一段短视频,它就能自动配上风声雨声、脚步声、背景音乐——甚至能根据你的文字指令修改音效。这不是魔法,而是浙江大学 + 上海 AI Lab 团队在 NeurIPS 2025 正式发表的开源框架 ThinkSound。它用"思维链推理"(Chain-of-Thought,CoT)引导多模态大模型(MLLM),将视频/文本/音频任意模态统一映射为高质量音频,真正做到"任意输入、精准输出"。
项目背景:从"烧显卡"到"听得懂人话"
传统的音视频生成模型往往面临两个痛点:一是需要大量标注好的成对数据(视频+音效);二是生成结果不可控——你很难告诉模型"把这辆车的声音换成自行车铃声"。
ThinkSound 的核心思路来自一个观察:人类配音师在工作时,不是凭空生成声音,而是有一套思维过程——"这段画面里有雨、有脚步、脚步靠近镜头、音量由远及近"。ThinkSound 将这套思维过程显式化,用 MLLM 生成结构化的 CoT 推理,再指导 Flow Matching 音频生成模型完成最终合成。
项目作者刘华代(浙江大学)等人在 arXiv 发表了详细论文(arXiv:2506.21448),并在 GitHub 上完整开源了训练代码、推理脚本和 Web 界面。截至 2026 年 6 月,仓库已获得超过 1300 颗星,GitHub trending 常驻。
核心功能:三阶段流水线
ThinkSound 将音频生成与编辑分解为三个递进阶段,每个阶段都由 MLLM 的 CoT 推理驱动:
阶段一:Foley Generation(拟音生成) 输入一段视频,ThinkSound 首先用视觉编码器提取帧级特征,再由 MLLM 生成描述音频场景的思维链(如"场景为雨夜街道,画面中有汽车驶过,远处有犬吠"),最后 Flow Matching 模型生成对应的环境音效。
阶段二:Object-Centric Refinement(物体级精细化) 用户可以点击视频中的任意物体(如一个人、一辆车),用文字描述想要的音效("换成高跟鞋脚步声"),MLLM 生成新的推理链并更新局部音频波形,实现精准的局部编辑,而不影响画面其他部分。
阶段三:Targeted Audio Editing(目标音频编辑) 给定一段已生成的音频,用户可以用自然语言指令进行整体修改("把音乐换成钢琴曲"、"增加环境回响"),ThinkSound 通过思维链推理理解修改意图,在保持音频整体一致性的前提下完成编辑。

图 1:AudioCoT 数据集构建流程 — 大规模思维链标注数据集用于训练推理模块与统一音频基础模型。

图 2:Foley Generation 示意 — 从视频帧到思维链推理再到音频波形的完整流程。
技术架构:MLLM + Flow Matching 的强强联合
ThinkSound 的技术栈融合了当下最热门的两条路线:
多模态大语言模型(MLLM):负责思维链推理,理解视频/文本/音频的语义信息,生成结构化的音频描述。模型支持 Qwen-VL、InternVL 等主流视觉语言模型作为基座。
Flow Matching 音频扩散:核心生成模型采用改进的 MM-DiT(Multi-Modal Diffusion Transformer)架构,在隐空间(latent space)进行 Flow Matching 训练,兼顾生成质量与推理速度。参考了 Stable Audio Open 的 VAE(变分自编码器)将音频压缩到低维隐表示。
音频编码器 采用了 Stability AI 开源的 Stable Audio Open VAE,这是一个经过微调的变分自编码器,专为音乐和音效设计,能够在保持高频细节的同时将音频压缩约 8 倍,显著降低计算开销。
三大核心文件解析:
train.py(7983 行):完整的分布式训练脚本,支持 DDP 多卡训练、梯度累积、EMA 权重平滑、WandB 日志。训练流程包括预训练阶段(仅音频)和微调阶段(视频+音频联合)。extract_latents.py(8135 行):从视频中提取视觉特征(latent),包括场景分割、物体检测和光流估计,为后续音频生成提供条件信息。predict.py(5670 行):核心推理脚本,分两阶段执行——先提取视频 latent,再调用 Flow Matching 模型生成音频。上手体验:Gradio Web UI + 一键脚本
ThinkSound 提供了完整的交互界面,普通用户无需写代码即可体验:
python app.py
这会启动一个 Gradio Web 界面,支持上传视频、输入思维链描述、选择生成阶段、下载结果音频。项目还提供了 Windows 用户专用的 .bat 脚本(setup_windows.bat),双击即可自动创建 conda 环境并下载预训练权重,对非技术用户友好。
对于批量推理场景,scripts/eval_batch.sh 支持 CSV 批量处理多段视频,适合数据集评测或自动化工作流。
不过需要注意的是,ThinkSound 目前不支持商业用途——Apache 2.0 许可证仅允许研究和教育使用,音频生成模型和 AudioCoT 数据集均不可商用。如需商用,需联系作者获取商业授权。
局限与争议
ThinkSound 并非完美。首先,依赖 MLLM 进行思维链推理意味着生成质量高度依赖视觉语言模型的能力——在低光照、快速剪辑或语义模糊的视频上,推理链路容易出错,导致音效不匹配。
其次,预训练权重需要手动下载(HuggingFace 或 ModelScope),且不支持 Docker 一键部署,部署门槛对普通用户仍然较高。
此外,音频生成本身有延迟——单张 H100 GPU 上生成 10 秒音频约需 15-20 秒,实时光视频配音暂不支持。
行业意义:多模态 AI 迈向"听得懂、做得到"
ThinkSound 的出现标志着多模态音频生成从"demo 玩具"走向"实用工具"。其贡献主要体现在三个方面:
后续工作 PrismAudio(ICLR 2026)进一步将多维 CoT 与强化学习结合,在视频到音频任务上取得了更好的一致性和对齐效果。
总结
ThinkSound 是一款面向未来的多模态音频生成框架,适合音视频创作者、游戏开发者、AI 研究者使用。它用思维链推理降低了音频生成的"黑盒感"——用户可以理解、干预甚至修正 AI 的生成逻辑。目前 stars 超过 1300,NeurIPS 2025 + ICLR 2026 双顶会背书,是音频生成领域值得关注的技术里程碑。