alexandria-audiobook
基于Qwen3-TTS的AI多角色有声书生成器,支持语音克隆、LoRA训练和Web编辑器
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于Qwen3-TTS的AI多角色有声书生成器,支持语音克隆、LoRA训练和Web编辑器
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

凌晨两点,网文爱好者小张正追更一本英文奇幻小说。原版英文读起来磕磕绊绊,但又舍不得等翻译——有声书版本更是遥遥无期。他把整本书丢进 Alexandria,按下"生成"键,选了一个沉稳的男声读旁白,再为每一个角色赋予独特的嗓音。半小时后,一本完整的多角色英文有声书就这样"诞生"了。
这不是科幻,这是 Alexandria Audiobook Generator 正在做的事。
有声书市场近年来呈爆发式增长,但优质有声书的生产成本极高——专业配音演员按小时计费,一本 10 万字的小说要烧掉数万元。即便用 TTS(Text-to-Speech)合成,配音听起来机械呆板、缺乏情感,根本无法与专业录音相提并论。
传统的 TTS 方案有两大硬伤:一是无法区分不同角色,一本书从头到尾一个声音,根本听不出谁在说话;二是语气控制粗糙,兴奋、悲伤、愤怒全靠同一种语调念出来,毫无戏剧张力。
Alexandria 的出现,正是为了解决这两个问题。它基于阿里通义实验室的 Qwen3-TTS 模型,在本地运行一个完整的有声书生成管线:从文本脚本注解、多角色语音分配、到最终导出 MP3/M4B,整个流程一气呵成。
Alexandria 的核心技术栈建立在 Python + FastAPI + PyTorch 之上,底层依赖 Qwen3-TTS 模型。整体架构分为三大层次:
第一层:智能脚本注解(Script Annotation) 用户输入原始文本后,Alexandria 调用本地或云端 LLM(兼容 OpenAI-compatible API,包括 LM Studio、Ollama、OpenAI 等)对文本进行结构化解析。LLM 将文本拆解为 JSON 格式,标注每个片段的说话者(Speaker)、对话内容,以及 TTS 指令方向(如"语速加快"、"降低音量"、"带喘息感"等)。这一层是整个管线的"大脑",注解质量直接决定最终音频的角色区分度。
第二层:角色声音合成(Voice Pipeline) 注解完成后,Alexandria 提供三种声音生成方式:
对于需要高度一致的系列角色,Alexandria 还支持 LoRA 训练:用户通过内置 Dataset Builder 构建训练集(情感+文本+音频三元组),调用 train_lora.py 在预训练底模上微调,生成专属声音适配器。LoRA 训练的 target loss 控制在 4.1-4.2 区间——过高则声音特征模糊,过低则出现音频失真。
第三层:批量合成与导出
批量处理是 Alexandria 的亮点之一。单个角色每批可并行 3-6 条片段,配合可选的 torch.compile 优化,batch 解码速度可达实时播放的 3-4 倍。最终输出支持三种格式:
Alexandria 提供了一个基于 FastAPI + Uvicorn 的浏览器界面,整个创作流程分为五步:
Step 1 Setup:配置 LLM(本地或云端)和 TTS 引擎 Step 2 Script:粘贴文本或导入文件,LLM 自动注解 Step 3 Voices:为每个角色分配语音(克隆/设计/预训练) Step 4 Editor:逐行微调发音人、内容和 TTS 指令,可单独重生成某一句 Step 5 Result:预览全部音频,一键导出
Advanced 菜单还提供语音设计器(无需写任何代码,用文字造声)和数据集构建工具(为 LoRA 训练准备数据)。
部署方面,Alexandria 提供了完整的容器化方案:
pytorch/pytorch:2.8.0-cuda12.8-cudnn9-runtime,包含 ffmpeg 和音频处理依赖硬件需求明确:需要 NVIDIA GPU + nvidia-docker,显存建议 8GB 以上(Qwen3-TTS 模型本身较大,加上 batch 处理的空间需求)。首次启动需要从 HuggingFace 下载模型,受网络状况影响可能耗时较长。
软件依赖极简,核心只有 FastAPI、Uvicorn、Pydantic 等少量包,qwen-tts==0.1.1 是唯一的大模型依赖。
GPU 门槛是最大障碍。没有 NVIDIA 显卡的用户只能连接到远程 Gradio 服务器,无法本地运行。对于没有高端显卡的玩家来说,实用性大打折扣。
LLM 注解质量不稳定。Script Annotation 依赖外部 LLM(本地 Ollama 或云端 API),不同模型对对话结构的理解能力差异较大,可能出现角色混淆、语气指令失效等问题。
音频时长限制。README 提到同一说话者每批最多 500 字符,超过后需要分段。整本长书的处理需要手动拼接,对超长文本的工程化支持还有提升空间。
Alexandria 的出现代表了一个趋势:AI 有声书生产正在从"专业定制"向"个人创作"下沉。以往只有出版机构才能负担的多角色精品有声书,现在任何人都能在几小时内制作出来。
Qwen3-TTS 的 instruct-following 能力在这里被发挥到了极致——不仅合成声音,还能理解"这句话应该用什么语气读"。加上 LoRA 个性化训练的可能性,Alexandria 正在模糊 TTS"工具"和"创作媒介"之间的边界。
对于 AI 开发者而言,Alexandria 也是一个高质量的学习样本:FastAPI 服务架构 + PyTorch 模型加载 + 批量 GPU 推理 + Web 前端交互 + LoRA 微调管线,这条完整的端到端链路几乎涵盖了 AI 应用开发的所有核心环节。
技术标签:Python · FastAPI · PyTorch · Qwen3-TTS · Voice Cloning · LoRA Fine-tuning · Multi-voice TTS · Audio Processing · Gradio · Docker

图1:Alexandria Logo(图标来源于仓库 icon.png)
项目地址:https://github.com/Finrandojin/alexandria-audiobook
星标数:684
许可证:MIT
主要语言:Python
热门 Topic:ai, audiobook, tts, voice-cloning, multi-voice, qwen3-tts, lora, fastapi