Hunyuan3D-2
上传一张图片,AI自动生成带PBR纹理的高保真3D模型,超越闭源竞品的开源3D资产生成系统
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
上传一张图片,AI自动生成带PBR纹理的高保真3D模型,超越闭源竞品的开源3D资产生成系统
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
小李是某中型游戏公司的3D美术师。这天,产品经理发来一叠参考图——40多张风格各异的手办照片,要求他在两天内完成对应的3D模型资产库,用于下一版本的角色定制系统。传统流程下,这意味着他要在Maya或Blender里花大量时间做拓扑、UV、烘焙贴图——一个人干一个团队一周的活。
他没有。他把照片拖进了腾讯刚刚开源的混元3D 2.0(Hunyuan3D-2),点了几下,导出了一批.glb文件。纹理、光照、高模细节——AI全包了。
这不是演示里的理想场景,这是2025年开源社区真实发生的场景。混元3D 2.0在GitHub上线三个月便积累超过13000颗星,成为3D AIGC领域最受关注的开源项目之一。
混元3D 2.0出自腾讯AI Lab之手,是腾讯"混元"多模态大模型家族的3D生成专项。腾讯从2023年起陆续开源了混元文生图、混元视频等模型,而混元3D 2.0补全了3D资产生成的关键一环。
与闭源的竞品(如OpenAI的Shap-E、Google的DreamFusion)不同,腾讯选择了"完全开源"策略——不仅开放推理代码,还同步开源了模型权重、训练脚本,并在HuggingFace上提供在线Demo。这意味着任何有GPU资源的开发者都可以本地部署,不需要调用收费API。
从技术路线看,混元3D 2.0属于图像→3D(Image-to-3D)生成任务,与Luma AI的Dream Machine、Tripo3D等商业产品属于同一赛道,但在开源生态上具有明显优势。
如果把3D模型生成比作制作一个雕塑,混元3D 2.0相当于同时请了两位AI工匠:
两个模型协同工作,形成完整的两阶段流水线(Two-Stage Pipeline)。
从代码结构看,混元3D 2.0采用Diffusion Transformer(DiT)作为骨干网络,并结合了Flow Matching(流匹配)这一新兴扩散范式,与传统DDPM相比具有更快的采样速度。
架构核心模块:
| 模块 | 路径 | 功能 |
|---|---|---|
| Hunyuan3DDiTFlowMatchingPipeline | hy3dgen/shapegen/pipelines.py | 几何生成主流水线 |
| Hunyuan3DPaintPipeline | hy3dgen/texgen/pipelines.py | 纹理生成主流水线 |
| ShapeVAE | hy3dgen/shapegen/models/autoencoders/ | 形状变分自编码器 |
| BackgroundRemover | hy3dgen/rembg.py | 背景抠图预处理 |
| HunyuanDiTPipeline | hy3dgen/text2image.py | 文本→图像中间生成 |
整个推理链路:用户上传图片 → rembg抠图 → ShapeGen生成几何白模 → TexGen生成纹理 → trimesh/pymeshlab后处理 → 导出GLB/OBJ。

图1:混元3D 2.0两阶段生成流水线架构——ShapeGen先生成几何,再由TexGen赋予纹理
关键依赖包括:PyTorch(深度学习框架)、Diffusers(扩散模型工具库)、trimesh(网格处理)、pymeshlab(专业网格优化)、onnxruntime(推理加速)。值得注意的是,项目还引入了ninja和pybind11进行C++编译加速,这在同类开源项目中较为罕见。
混元3D 2.0提供了丰富的生成模式,覆盖不同场景需求:
单图生成(shape_gen):最基础的模式,上传一张产品图/照片,自动生成带纹理3D模型。适合快速资产创建。
多视角生成(shape_gen_multiview):提供同一物体的四视角(正面/背面/左/右)图片,生成质量更高、视角一致性更好的3D模型。
纯纹理生成(fast_texture_gen_multiview):用户已有3D几何模型,通过多视角图片只生成纹理贴图,适合接驳其他3D建模工具的工作流。
Turbo加速模式:2025年4月发布的Hunyuan3D-2-Turbo将生成速度提升数倍,通过更少的采样步数实现相近质量,大幅降低普通用户的硬件门槛。
项目提供了多层次的接入方式,满足不同技术能力的用户:
Gradio Web UI(gradio_app.py):开箱即用的浏览器界面,支持拖拽上传、实时预览、多张图片批量处理。非技术用户5分钟上手。
FastAPI服务(api_server.py):提供RESTful API接口,适合集成到现有后端系统或开发自定义前端。生产环境友好。
Python脚本(minimal_demo.py):仅需20行代码即可完成从图片到3D模型的完整流程,适合开发者快速嵌入自己的应用。
Blender插件(blender_addon.py):直接在Blender中使用,对于已熟悉Blender工作流的3D艺术家而言,切换成本极低。
此外,社区还贡献了Windows一键安装包、ComfyUI插件(ComfyUI-Hunyuan3DWrapper、ComfyUI-3D-Pack),以及多种语言版本的使用文档。

图2:混元3D 2.0生成效果展示——从左到右依次为输入图片、生成几何、最终纹理模型
混元3D 2.0是典型的"GPU hungry"项目。官方推荐配置为NVIDIA GPU(16GB+显存),即RTX 3090或更高规格显卡。纯CPU推理在实际使用中几乎不可行。
从部署难度看,项目没有提供Docker支持,需要手动安装Python依赖、配置CUDA环境,对于没有深度学习环境配置经验的用户有一定门槛。但好在项目提供了详细的README和社区Windows一键包,大幅降低了入门难度。
需要注意的是,混元3D 2.0采用腾讯混元非商业许可证——允许免费用于研究和个人项目,但不允许直接商用。商用需单独联系腾讯获取授权,这一点在集成到商业产品前必须确认。
混元3D 2.0的开源在3D AIGC领域具有标志性意义:它首次将大规模图像→3D生成能力以完整开源的方式提供给社区,且在多项基准测试(CMMD、FID_CLIP、CLIP-score)上超越了此前的SOTA方法。
但也需要客观看待其局限性:
整体而言,混元3D 2.0为AI爱好者提供了认识3D生成技术的窗口,为开发者提供了可定制、可扩展的开源代码库,也为行业验证了大厂主导开源战略的可行性。随着社区工具链的完善(Blender插件、ComfyUI支持),其实际应用范围正在快速扩展。