AniPortrait
输入音频+人脸照片,AI 自动生成逼真的说话头像视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
输入音频+人脸照片,AI 自动生成逼真的说话头像视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2024年,一段「AI生成的历史人物演讲」视频刷屏网络,人们惊叹于逼真的口型和自然的微表情。然而,细看之下,大多数方案的致命弱点在于——只能对口型,无法真正「表演」。头部的自然摆动、眼神的微妙变化、甚至说话时的情绪起伏,这些细节才是让数字人从「恐怖谷」跨出来的关键。
正是在这一背景下,AniPortrait 应运而生。这是一个由腾讯游戏事业部(Tencent Games Zhiji)开源的音频驱动真人肖像动画合成框架,能够仅凭一段音频和一张参考照片,生成头部自然运动、口型精确同步、表情丰富细腻的高质量肖像视频。
AniPortrait 的三位核心作者——Huawei Wei、Zejun Yang、Zhisheng Wang 均来自腾讯游戏旗下智戏(Zhiji)工作室,该团队长期深耕游戏引擎渲染和实时数字人技术。项目于 2024 年 3 月正式发布论文(arXiv:2403.17694),并同步开源训练代码和推理框架,填补了开源社区在音频驱动 3D 肖像动画领域的高质量方案空白。
在 HuggingFace 上,该项目拥有官方在线 Demo,任何人无需本地部署即可体验完整效果。截至2026年5月,GitHub Star 数突破 5000,成为数字人/Avatar 生成领域的标杆开源项目之一。
AniPortrait 的技术实现分为两个阶段(Stage 1 + Stage 2),形成一条完整的音频→姿态→视频生成管道:
这一阶段解决的是「听什么,就演什么」的核心问题。系统首先使用预训练的 Wav2Vec2 模型从音频中提取高维语义特征,随后通过两个专门的神经网络将特征映射为 3D 面部运动参数:
这两个模型的组合,使得生成的头部运动不再只是简单的张嘴闭嘴,而是包含真实的情感性头部动作。
拿到 3D 姿态序列后,Stage 2 使用基于扩散模型的图像生成管道将其渲染为逼真的视频帧:
此外,项目提供了 vid2vid 模式:输入一段真人视频作为驱动源,实现更具表现力的人脸重演(Face Reenactment),可应用于影视配音、虚拟主播等场景。
AniPortrait 的技术栈构建于多个成熟开源项目之上:
| 依赖 | 作用 |
|---|---|
| Diffusers | 扩散模型推理框架,提供 UNet 和 VAE |
| OpenMMLab / ControlNet-aux | 预训练姿态估计和关键点检测 |
| MediaPipe | 面部网格提取(Face Mesh) |
| OpenCV | 图像处理和视频编解码 |
| Gradio | Web UI 在线演示界面 |
| HuggingFace Transformers | Wav2Vec2 音频编码器 |
| xformers | 高效注意力实现 |
| ONNX Runtime GPU | 推理加速 |
整个项目约 35 个核心依赖,大部分可通过 requirements.txt 一键安装。
src/
├── audio_models/ # 音频处理:Wav2Vec2 + Audio2Pose/Audio2Mesh
│ ├── model.py # Audio2Mesh 主模型
│ ├── pose_model.py # Audio2Pose 头动预测
│ └── wav2vec2.py # 音频特征提取封装
├── models/ # 扩散模型组件
│ ├── unet_3d.py # 时序扩散 U-Net(核心)
│ ├── unet_2d_condition.py # 条件图像生成
│ ├── pose_guider.py # 姿态引导器(ControlNet 风格)
│ └── transformer_*.py # 注意力模块
├── pipelines/ # 推理管道(diffusers pipeline 设计)
│ ├── pipeline_pose2vid.py # 单段视频生成
│ └── pipeline_pose2vid_long.py # 长视频生成
└── utils/
├── face_landmark.py # 面部关键点处理
├── audio_util.py # 音频预处理
└── frame_interpolation.py # 帧插值加速
这套架构参考了 Stable Diffusion 的 pipeline 设计模式,将数据流和模型计算解耦,便于独立替换或升级各模块。
好消息是:AniPortrait 内置了完整的 Gradio Web UI,运行 python scripts/app.py 即可启动一个本地推理服务,上传音频和照片即可生成视频。
坏消息是:项目不提供 Docker 支持,本地部署需要满足以下硬性条件:
如果本地硬件不足,HuggingFace Spaces 上有官方 Demo 可以直接试用,但排队时间较长,适合体验而非正式使用。
训练方面,项目提供了两阶段训练脚本 train_stage_1.py 和 train_stage_2.py,但训练数据(大规模语音-视频配对数据)不在仓库中,需要用户自行准备。
亮点:
-acc 模式大幅缩短推理时间局限:
AniPortrait 代表的不仅是单一技术的进步,更是数字人生成从「恐怖谷」向「可信数字人」跨越的一个重要节点。其核心价值在于:通过音频驱动的头部自然运动,让数字人不再是「贴图面具」,而是一个有生命感的存在。
这一方向与 2024-2026 年火热的 AI 虚拟主播、短视频自动配音、远程会议数字分身等应用场景高度契合。随着扩散模型效率的持续提升和视频生成质量的不断突破,这类技术正在快速从实验室走向商业化落地。