Step-Audio-EditX
基于LLM和强化学习的3B参数音频编辑模型,支持情感、语速、风格和音色四大维度的精准编辑与零样本克隆
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于LLM和强化学习的3B参数音频编辑模型,支持情感、语速、风格和音色四大维度的精准编辑与零样本克隆
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你录了一段播客,但总觉得语气太生硬、情感不够——常规的音频编辑工具只能调音量、加混响,而Step-Audio-EditX 能做的事,远不止于此。它可以让你随心所欲地修改录音中的情绪风格、语速节奏,甚至跨语言复刻声音音色——而这一切只需上传一段音频 + 写一句自然语言指令。
图1:项目架构图

传统的语音合成(TTS)和音频编辑工具,在面对「情感」「语气」「说话风格」这类抽象属性时几乎束手无策。这些属性不像音量或音调那样可以用数值精确描述,它们本质上是语音的「软性特征」——人类能轻易感知,但传统信号处理算法难以建模。
StepFun AI(阶跃星辰)团队从这一痛点切入,在 2024 年推出了 Step-Audio 系列语音模型。Step-Audio-EditX 是该系列的最新成员,专注于**音频编辑(Audio Editing)**场景,而非从零生成——用户可以保留原始音频的内容(文字),只修改其情感、语速、风格等副语言特征(Paralinguistics)。
这项能力的背后,是一套融合了 LLM(大型语言模型)+ 强化学习(RL) 的训练范式。与传统基于规则的音频处理不同,Step-Audio-EditX 将编辑指令建模为自然语言理解任务,让模型「理解」用户的编辑意图,再生成对应的音频波形。
Step-Audio-EditX 的编辑能力围绕四个维度展开,这四个维度恰好对应了语音中最影响听感但最难量化的特征:
这是 Step-Audio-EditX 最核心的能力。用户可以将一段中性语气的录音,转换为开心、悲伤、恐惧、愤怒等不同情感风格,同时保持内容不变。模型通过对语音的韵律特征(基频、能量、包络)进行精细控制来实现这一点。
在项目仓库的 examples/ 目录下,提供了 fear_zh_female_prompt.wav(恐惧情绪)、en_happy_prompt.wav(英文开心情绪)等多个示例音频,演示了情感迁移的效果。从 benchmark 结果看,Step-Audio-EditX 在情感识别准确率和情感保真度上均优于业界主流方案。
不仅能改情绪,还能改变说话的方式——是正式演讲还是日常闲聊,是新闻播报还是脱口秀。模型学习了大量不同风格的数据,能识别并迁移目标风格中的韵律模式(重音位置、停顿节奏、语调起伏)。
通过 speed_prompt.wav 示例可以看到,用户可以精确控制语速快慢,从慢条斯理到快嘴连珠都能实现,同时保持音高自然不失真。
给定一段参考音频(prompt),Step-Audio-EditX 可以在完全未见过的文本上复刻该声音的音色特征,实现跨语言、跨文本的语音克隆。结合情感编辑,还能同时改变克隆声音的情感色彩。
图2:情感性能评估结果

Step-Audio-EditX 的技术栈相当丰富,核心依赖包括:
TRITON_ATTN训练流程支持三种模式:
推理时,模型使用 StepAudioTokenizer 对输入音频进行 tokenize,通过 StepAudioTTS 生成目标音频,Gradio Web UI 提供了交互友好的编辑界面。
Step-Audio-EditX 提供了 Dockerfile 容器化部署方案,基于 nvidia/cuda:12.4.1-cudnn-runtime-ubuntu22.04 镜像,使用 uv 作为包管理器,安装了完整的 Python 3.12 环境及所有依赖。
硬件要求较高:需要 NVIDIA GPU(CUDA 12.4+)且显存 ≥8GB,建议总内存 16GB 以上,磁盘空间 10GB+(包含模型权重)。虽然有 Dockerfile 简化了环境配置,但模型权重需要从 StepFun 官方渠道额外下载。
Gradio UI 已集成在 app.py 中,支持多 Tab 编辑界面(EditxTab),包括音频上传、编辑类型选择、自动语音转写(可选 Whisper 辅助)、历史记录等功能。
Step-Audio-EditX 代表了语音处理领域的一个新方向:用 LLM + RL 的思路解决传统信号处理难以企及的「软性特征」编辑问题。相比单纯的 TTS 或 VC(语音转换),它在「编辑已有内容」这一细分场景上有独特优势。
目前项目处于快速发展期,API 接口和模型权重获取方式尚未完全开放文档化。对于研究者和开发者而言,建议关注 StepFun 官方动态获取最新模型和接口更新。

Step-Audio-EditX 由 StepFun AI(阶跃星辰)团队开发,是一个将大型语言模型与强化学习相结合的开创性音频编辑框架。