SLAM-LLM
语音/音频/音乐多模态LLM训练框架,支持14个训练配方,已收录IEEE JSTSP
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
语音/音频/音乐多模态LLM训练框架,支持14个训练配方,已收录IEEE JSTSP
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,如果 AI 不仅能和你文字聊天,还能直接听懂你的语音、甚至分析一段音乐的情感——那会是怎样的体验?SLAM-LLM 正是这样一个让大语言模型(LLM)具备语音、音频、音乐多模态理解能力的研究框架。它不是某个具体的对话产品,而是一套完整的技术栈:从音频编码器、到多模态投影层、再到 LLM 骨干的端到端训练 pipeline,全部开源。
2026 年 1 月,基于 SLAM-LLM 构建的论文《SLAM-LLM Framework》正式发表于 IEEE Journal of Selected Topics in Signal Processing(JSTSP),这意味着该框架的设计思路和实验成果得到了学术界的认可。同年 4 月,团队又开源了大规模工业级训练支持,可处理 10 万小时级别的音频数据集。
SLAM-LLM 的架构可以用一个生活化的比喻来理解:把 AI 想象成一个精通多国语言的翻译官,而各种音频编码器(如 BEATs、WavLM)是他的耳朵,LLM 是他的大脑。耳朵接收到的声音信号需要先被翻译成大脑能理解的语言——这一步由多模态投影层(Projector) 完成。目前框架支持的主流编码器包括:
这些编码器可以自由组合,投影层则负责将不同模态的特征对齐到 LLM 的 embedding 空间。这种即插即用的设计让研究者无需从零开始,就能快速实验不同编码器与 LLM 骨干的搭配组合。

图1:SLAM-Omni 模型架构示意(来源:GitHub 仓库)
框架提供了 14 个完整的训练示例(recipes),涵盖语音识别、语音合成、情感分析、音乐生成等主流任务。每一个示例都包含数据准备、模型微调、推理评估的完整流程:
| 任务类型 | 示例 | 说明 |
|---|---|---|
| 语音识别(ASR) | asr_librispeech | LibriSpeech 数据集,端到端训练 |
| 语音合成(S2S) | s2s / SLAM-Omni | 单阶段训练,支持中英文多轮对话 |
| 零样本音频描述 | drcap_zeroshot_aac | 无监督音频字幕生成 |
| 情感识别 | sec_emotioncaps | 结合 emotion2vec 编码器 |
| 音乐生成 | mc_musiccaps | 音乐-文本跨模态建模 |
| 口语翻译(ST) | st_covost2 | CoT(思维链)增强翻译 |
| 大规模工业训练 | aispeech_asr | 10 万小时级数据集,支持 DeepSpeed |
特别值得关注的是 SLAM-Omni 子项目——一个音色可控的语音对话系统,只需单阶段训练即可实现中英文多轮语音对话。团队开源了全部训练数据集(VoiceAssistant-400K 英文单轮、UltraChat-300K 英文多轮、Belle_1.4M 中文多轮),并提供了预训练 checkpoint 下载。这对于想复现端到端口语对话系统的人来说,是一个难得的完整参考实现。
在底层技术选型上,SLAM-LLM 非常务实:
对于个人开发者而言,使用一张 24GB 显存的 GPU(推荐 RTX 3090/A100)配合 QLoRA 微调,就能在消费级硬件上复现 SLAM-Omni 的核心功能——这在一年前是不可想象的。
SLAM-LLM 的部署路径有两条:
方式一:Docker 一键拉起(推荐)
官方提供预构建 Docker 镜像 worstchan/slam-omni:v0,包含了 PyTorch、Transformers、PEFT、音频处理库(sox、ffmpeg、libsndfile)等所有依赖。拉起命令仅一行:
docker pull worstchan/slam-omni:v0
docker run -it --gpus all worstchan/slam-omni:v0 /bin/bash
但需要注意:镜像未使用多阶段构建,总大小可能超过 20GB;运行时需要 --gpus all 授权容器访问 GPU。
方式二:从源码安装
需要先安装 PyTorch 2.0+、CUDA 驱动,以及音频处理工具链(ffmpeg、libsndfile-dev),再依次安装 transformers、peft、fairseq,最后 pip install -e . 安装 SLAM-LLM。依赖链较长,建议参考 examples 目录下的具体 README。
⚠️ 门槛提醒:SLAM-LLM 是面向研究人员的训练框架,不提供 Web 界面或 API 服务。如果你想快速体验语音对话,推荐直接访问 SLAM-Omni Demo 在线体验;若要做本地推理,需要自己写 Python 脚本调用 pipeline/inference.py。
尽管 SLAM-LLM 功能全面,但它并非面向终端用户的开箱即用产品:
SLAM-LLM 代表了多模态 LLM 研究的一个主流方向:Codec-based spoken dialogue(基于编解码的语音对话)。相比传统的 ASR → LLM → TTS 三段式管道,端到端语音对话模型(如 SLAM-Omni、Mini-Omni)直接在音频 token 层面做生成,能保留说话人的音色、语调、情感等细粒度信息。随着 CosyVoice、Phonemizer 等工具链的成熟,这类技术正在快速走向实用。
2026 年初被 IEEE JSTSP 收录,也说明学术界对该框架的技术贡献给予了正式认可。对于想进入语音多模态 LLM 研究领域的开发者,SLAM-LLM 提供了目前最完整的开源训练参考。