JoyAI-Echo
京东开源分钟级音视频生成框架,通过配对记忆银行实现5分钟视频角色一致性
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
京东开源分钟级音视频生成框架,通过配对记忆银行实现5分钟视频角色一致性
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,让 AI 创作一段 5 分钟的连贯视频——角色从出场到谢幕,外貌始终如一,声音始终在线,还能配合 BGM 自动对口型?这听起来像是个遥远的科研梦想,但京东(JD.com)旗下的 JoyAI-Echo 正在将它变成现实。
2026 年,京东未来技术研究院 Echo 团队发布了 JoyAI-Echo,一个专注于「分钟级音视频联合生成」的开源框架。它不是简单地把文本转视频,而是首次实现了跨镜头记忆:每个新镜头都会"记住"前一个镜头里人物的长相、说话声线,甚至情绪基调,让整段视频从头到尾保持角色一致性。

图1:JoyAI-Echo 生成效果画廊(来源:GitHub 官方仓库)
视频生成模型近年来突飞猛进,OpenAI Sora、Runway Gen-3、Ltx2 等模型已经能够生成质量不错的短片。但长视频生成面临三大根本性难题:
误差累积(Error Accumulation)。 短片生成时模型在干净的初始噪声上运行,输出相对稳定。但当把多个短片拼接成 5 分钟的长片时,每个镜头的生成都会在前一个镜头的"假设"之上继续,一旦某个镜头的人物外观出现偏差,这个偏差会在后续镜头中不断放大,最终导致角色"变脸"。
弱时间一致性(Weak Temporal Coherence)。 人的眼睛对「同一个人在不同角度、不同光线下看起来不一样」非常敏感。传统视频生成模型缺乏跨帧记忆机制,无法在 5 分钟的跨度内保持人物 ID 不变。
推理延迟(Prohibitive Latency)。 高质量视频扩散模型每帧需要数十步去噪,一张 1280×736 的图在 H100 上推理就慢得离谱,生成 5 分钟(数千帧)视频几乎不可能实时。
JoyAI-Echo 的论文标题就叫「Pushing the Frontier of Long Audio-Visual Generation」,它正是冲着这三个难题来的。
JoyAI-Echo 的核心创新有两层。
第一层:配对音视频记忆银行(Paired Audio-Visual Memory Bank)。 这是整个框架的灵魂。它由两个子系统构成:
第二层:DMD 分布匹配蒸馏(Distribution Matching Distillation)。 原始 LTX-2.3 模型每帧需要数十步去噪,JoyAI-Echo 将其蒸馏为 8 步少数步推理(见 configs/inference.yaml 中的 denoising steps),实现 7.5 倍加速。蒸馏后的模型在 human evaluation 中依然显著优于 HappyOyster 的 directing 模式。
蒸馏训练流程结合了记忆增强强化学习(Memory-based RL)和分布匹配蒸馏,最终 7.5× 加速不牺牲质量。
JoyAI-Echo 不是一个单文件项目,而是一套模块化的推理引擎,代码组织如下:
JoyAI-Echo/
├── inference.py # 主入口:加载模型,处理prompts/下所有JSON
├── configs/inference.yaml # 全量推理参数(YAML)
├── prompts/ # 镜头描述JSON文件
├── checkpoints/ # 模型权重(~70GB,需单独下载)
├── ltx-core/src/ltx_core/ # 底层组件:Transformer、VAE、文本编码器
├── ltx-pipelines/src/ltx_pipelines/ # 采样器与pipeline工具
└── ltx-distillation/
└── src/ltx_distillation/ # 核心:DMD蒸馏、AV pipeline、记忆银行
推理流程(inference.py):
--num-frames 121),牺牲时长换显存关键技术栈:
| 层级 | 技术 |
|---|---|
| 基础模型 | LTX-2.3(Lightricks,视频diffusion transformer) |
| 文本编码 | Gemma-3-12b-it(Google,多语言指令微调) |
| 推理加速 | DMD 分布匹配蒸馏(8步推理) |
| 记忆机制 | 配对音视频记忆银行(LoRA注入+注意力查询) |
| 音频合成 | V2A(Video-to-Audio)模型+vocoder |
| 数值精度 | bf16 + torch.compile + Triton kernel |

图2:京东开源 Logo
# conda(推荐)
conda env create -f environment.yml
conda activate echo-long
# uv(轻量替代)
uv venv --python 3.11 .venv
source .venv/bin/activate
uv pip install --extra-index-url https://download.pytorch.org/whl/cu128 -r requirements.txt
# ffmpeg(视频拼接必需)
sudo apt install ffmpeg
| 文件 | 说明 | 大小 |
|---|---|---|
echo-longvideo-release.safetensors | 完整模型(Transformer+VAE+vocoder) | ~46GB |
gemma-3-12b/ | Google Gemma-3-12b-it 文本编码器 | ~24GB |
从 HuggingFace 下载并放到 checkpoints/ 下:JoyAI-Echo 权重(https://huggingface.co/jdopensource/JoyAI-Echo)和 Gemma-3-12b-it(需申请访问权限)。
建议先用prompts/long_story_writer_system_prompt.md增强prompt,再创建JSON。每个JSON文件包含一个prompts数组,每个字符串是一个独立镜头,新镜头自动继承前一个镜头的视觉+音频记忆。
python inference.py
# 可选:减少帧数(省显存)
python inference.py --num-frames 121
# 自定义seed
python inference.py --seed 42
输出在 inference_result/outputs/<prompt-name>/inference_<timestamp>/。
1. 仅支持文本生成视频(T2V),不支持图生视频(I2V)。 官方明确说明当前版本不包含 I2V 能力,图像转视频功能在 TODO 中。
2. 对 prompt 质量敏感。 官方强烈建议先用 story writer prompt enhancer 增强输入,未增强的 prompt 效果明显更差。这意味着用户需要投入额外的 prompt 工程工作。
3. 硬件门槛极高。 默认配置(1280×736@25fps×241帧)峰值显存 46-50GB,需要 H100/A100(80GB)或 48GB 以上专业卡,普通 4090(24GB)完全无法运行。
4. 商业使用受限。 JoyAI-Echo 基于 LTX-2.3,继承其 Community License,学术研究可用,商业部署需联系 Lightricks 获得授权。
5. 目前仅发布推理代码。 蒸馏训练脚本和原始训练流程未开源,无法自行微调模型。
在官方 benchmark 中(100个多镜头故事,3000个生成镜头),JoyAI-Echo 全面超越竞品:
| 维度 | JoyAI-Echo | HappyOyster | Wan 2.6 |
|---|---|---|---|
| 视觉美学(长片) | 63.6% | 27.6% | - |
| 音频质量(长片) | 81.7% | 11.8% | - |
| Prompt遵循度(长片) | 80.6% | 5.9% | - |
| IP一致性(长片) | 59.4% | 27.7% | - |
| 视觉美学(短片) | 58.8% | - | 26.5% |
数据来自 GSB(Good/Same/Bad)人类评估研究。
根据 README 的 TODO list:
Director Agent 值得关注:它将把「用户说故事 -> AI 自动拆镜头 -> 执行多镜头生成」整个流程自动化,大幅降低使用门槛。
JoyAI-Echo 代表了长视频生成领域的一个重要方向——记忆增强的跨镜头一致性。此前大部分视频生成工作都聚焦于单镜头质量优化,JoyAI-Echo 率先将多镜头叙事一致性作为核心问题来系统解决。
从技术趋势看,DMD 蒸馏让「实时生成分钟级视频」成为可能,这是从「预生成」到「流式生成」的关键一步。随着 Echo-SR 和 Director Agent 的加入,未来用户可能在对话中实时操控视频走向,而无需等待数分钟的全量推理完成。
京东开源这个项目,也为国内多模态 AI 研究提供了一个可复现的高质量基准。