En3D
从 2D 合成数据生成高质量 3D 人体 Avatar,支持文本/图像引导和自动骨骼动画(CVPR 2024)
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
从 2D 合成数据生成高质量 3D 人体 Avatar,支持文本/图像引导和自动骨骼动画(CVPR 2024)
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:En3D 生成的 Woman 角色 3D Avatar
图2:En3D 生成的 Messi 角色 3D Avatar
En3D 是阿里巴巴 CVPR 2024 论文的开源实现,通过在百万级 2D 合成数据上训练的增强型生成模型,实现从零生成高质量 3D 人体 Avatar,支持文本提示、图像引导和骨骼动画自动绑定,输出兼容主流图形工作流。
在游戏、VR、元宇宙等场景中,高质量 3D 人体模型一直是稀缺资源。传统方案依赖 3D 扫描设备或手工建模,成本高昂且缺乏可控性。2023 年前后,EG3D(CVPR 2022)等方法开始用 NeRF/3D GAN 从 2D 图像生成 3D 人,但这些方法往往依赖预存的 2D 资产,质量受限于训练数据源。
Menyifang 等人在 CVPR 2024 提出的 En3D 做了一个关键创新:完全从合成 2D 数据训练,不依赖任何真实人像。团队用渲染引擎生成了数百万张不同姿态、光照、服装的 2D 人体图像,作为训练集反哺 3D 生成模型。这种「自力更生」的训练策略让模型摆脱了真实数据版权和隐私的束缚,同时在质量上实现了 SOTA 表现。
项目由阿里巴巴视觉智能团队(Miaomiao Cui、Xuansong Xie 等)主导,第一作者 Yifang Men 同时任职于阿里巴巴与北京大学。
En3D 提供三种生成模式,适应不同输入条件:
| 生成模式 | 输入 | 适用场景 |
|---|---|---|
| 随机种子 | --seeds 随机噪声 | 探索模型能力、生成多样化角色 |
| 文本引导 | --text 提示词 | 一句话生成目标角色(如"穿西装的男士") |
| 图像引导 | 输入人物照片 | 将真人照片转换为 3D Avatar(需先重定向到标准姿态) |
生成管线包含三个阶段:
输出为 .obj/.glb 格式,兼容 Blender、Maya、Unity、Unreal 等主流 3D 软件。
生成静态 3D 模型后,En3D 配套的动画管线可以自动完成骨骼绑定(Auto-Rig),并驱动 1000+ 预设动作。团队同步开源了 3DHuman-Syn Avatar 库,包含约 1000 个预生成角色和 1000+ 动作动画,可直接用于下游应用。
动画输出支持 .glb / .usdz 格式,配合 <model-viewer> Web 组件或 Sketchfab 转换工具,可实现在 iPhone AR 中的实时 Avatar 展示。
本地部署 python app.py 可启动 Gradio Web UI,提供交互式参数调节(种子、相机视角、渲染分辨率),同时支持 CPU/GPU 切换。ModelScope 和 HuggingFace 上也托管了在线 Demo,零配置即可体验核心功能。
En3D 的技术栈分为三层:
底层沿用了 NVlabs StyleGAN3 的生成器架构,但对三平面(XY、XZ、YZ 三个正交平面特征图)输出做了扩展改造,用于表示 3D 场景的体积密度和颜色场。与传统 NeRF 相比,Triplane 表示大幅提升了推理速度,且天然支持多视角一致性。
Triplane 输出的初始几何精度有限,项目采用 NVIDIA 提出的 DMTet(Differentiable Matrix Tetrahedral)进行细化。DMTet 将 3D 空间离散为四面体网格,可微渲染支持端到端梯度反传,实现几何与纹理的联合优化。
模型权重托管在 ModelScope(阿里云的模型开源平台),通过 snapshot_download API 自动拉取。推理依赖 ModelScope 的 pipeline 封装,降低了模型管理的复杂度。
关键依赖:torch, gradio, modelscope, nvdiffrast(NVIDIA 自定义 CUDA 渲染扩展), opencv-python, transformers。
En3D 的本地部署有较高门槛。Avatar 生成阶段必须使用 24GB+ 显存的 NVIDIA GPU(V100/RTX3090/A100 均可),动画和渲染阶段可降级到 CPU。Python 3.8 + CUDA 11.3 环境是基础,还需要手动编译 nvdiffrast 的 CUDA 扩展。
三种免部署体验路径:
项目没有提供 Dockerfile,无法容器化一键部署,这是当前最大的部署痛点。
En3D 的出现标志着 3D 人体生成从「Demo 玩具」向「生产工具」的跨越。百万级合成数据的训练策略解决了 2D 真实数据集中的人物版权问题;与 ModelScope 的深度整合让中国开发者无需魔法即可快速上手;Avatar + Animation 的完整管线覆盖了游戏、虚拟主播、数字人等主流应用场景。
项目 Star 540+,在 3D 生成领域属于头部开源项目。随着 Apple Vision Pro、Meta Quest 3 等 MR 设备的普及,高质量 3D Avatar 的需求将持续增长,En3D 这类工具的实用价值会愈发凸显。
项目信息
- 论文:En3D: An Enhanced Generative Model for Sculpting 3D Humans from 2D Synthetic Data(CVPR 2024)
- 作者:Yifang Men, Biwen Lei, Yuan Yao, Miaomiao Cui, Zhouhui Lian, Xuansong Xie(阿里巴巴 + 北京大学)
- 许可:Apache-2.0
- 主页:https://menyifang.github.io/projects/En3D/index.html
- 在线 Demo:ModelScope | HuggingFace
- 预训练权重:ModelScope 下载