Duix-Avatar
本地离线运行的 AI 数字人视频合成工具,一键克隆外貌和声音,支持 8 种语言
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
本地离线运行的 AI 数字人视频合成工具,一键克隆外貌和声音,支持 8 种语言
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你只需要一段文字或一段语音,就能让一个和你长得一模一样、口音完全一致的数字人替你出镜说话——不用化妆、不用录音棚、不用后期剪辑。这不是科幻,而是 GitHub 上 1.3 万星开源项目 Duix.Avatar(HeyGem)正在做的事。
Duix.Avatar(HeyGem) 是硅基智能(Guiji.ai)团队开源的数字人视频合成工具,主打「本地离线运行」和「零技术门槛」两张王牌。它的核心能力是:上传一张照片或一个视频,通过 AI 算法克隆你的外貌和声音,再用文字或语音驱动这个数字人说出任何内容,生成逼真的口播视频。## 故事:从付费工具到开源平替在 Duix.Avatar 出现之前,数字人视频的主流方案是 Heygen、D-ID 等 SaaS 平台。这些平台效果好,但需要按次付费,而且所有数据都要上传到云端处理——对于企业来说,数据隐私是硬伤。2024 年,硅基智能团队决定将自家打磨多年的数字人技术开源,命名为 HeyGem(后改名 Duix.Avatar),目标是成为 Heygen 的开源平替,让任何有显卡的人都能在本地跑出专业级数字人视频。项目自开源以来迅速获得关注,星标数突破 1.3 万,成为数字人开源领域的标杆项目。团队同时在 Coze 平台上架了无需部署的在线版本,降低了非技术用户的使用门槛,形成了「开源本地版 + 云端在线版」的双轨产品矩阵。
图1:Duix.Avatar 系统架构## 类比:把数字人创作当「拍电影」来理解如果把制作数字人视频比作拍电影,那么 Duix.Avatar 的工作流程就像:先用绿幕相机拍好演员(外貌克隆),用录音棚录好台词(声音克隆),然后让 AI 导演根据剧本(文字/语音输入)自动剪辑合成最终成片。你不需要懂剪辑软件,只需要一台有显卡的电脑,就能批量生产数字人口播视频——这对于需要日更短视频的自媒体、电商卖家、企业内训部门来说是真正的效率革命。## 核心技术:三层 AI 模型协同第一层:外貌克隆。项目支持从单张照片或短视频中提取人脸特征,生成高保真的数字人模型。底层使用深度人脸检测和 3D 人脸重建技术,确保克隆人脸的五官比例、肤色、光影效果与原始素材高度一致。用户可以将多个模型导入客户端,通过一键启动包管理不同角色的数字人。第二层:声音克隆。配套使用的 fish-speech 模型负责声音克隆,支持从少量语音样本中学习音色、语调、语速特征,生成与原声高度相似的合成语音。同时集成了 fun-asr 语音识别模型,用于语音驱动的口型匹配——让数字人的嘴型与声音节奏完美同步。第三层:口型驱动。这是数字人视频质量的关键。duix.avatar 主服务接收文字/语音输入后,通过 AI 口型生成模型生成驱动信号,控制数字人的口型、表情和头部动作,实现自然的说话效果。输出的视频画面与合成语音高度同步,支持长视频和批量生成。项目支持 8 种语言:中文、英语、日语、韩语、法语、德语、阿拉伯语、西班牙语,覆盖了主流跨境电商和内容创作场景。
图2:Docker 存储路径配置界面(Windows 版本)## 部署方案:Docker 化服务端 + Electron 桌面客户端项目采用经典的「服务端 + 客户端」分离架构。服务端通过 docker-compose 一键部署,包含三个 Docker 镜像:duix.avatar(主视频生成服务)、fish-speech(声音克隆 TTS 服务)、fun-asr(语音识别 ASR 服务)。三个服务通过内部网络协作,通过 HTTP API 与客户端通信。此外还有针对 RTX 50 系列显卡的 docker-compose-5090.yml,以及资源占用更低的 docker-compose-lite.yml(仅需一个镜像)。客户端是 Electron 桌面应用,提供图形化界面,用户无需命令操作,直接在 UI 上传素材、输入文本、选择模型、生成视频。对于不想折腾 Docker 的用户,官方提供了一键安装包(.exe),直接双击安装即可使用。
图3:数字人视频生成效果演示## 硬件需求:8GB 显存是门槛数字人视频生成是典型的大模型推理任务,对 GPU 有明确要求。根据官方文档和社区反馈:最低配置为 RTX 3060 或同等性能(8GB 显存);推荐配置为 RTX 4070 + 32GB 内存;高端配置可选 RTX 4090 支持多视频并发生成。存储方面,Docker 镜像约 70GB + 模型文件 10GB,建议准备 100GB+ 可用空间。Windows 用户还需注意:必须有 D 盘用于数据存储,C 盘至少 100GB 可用空间。Ubuntu 22.04 也有官方支持文档,需要安装 NVIDIA Container Toolkit 才能让 Docker 访问 GPU。
图4:NVIDIA 驱动检测确认界面## 上手体验:小白能跑通,但优化靠折腾Duix.Avatar 的安装流程已经比较成熟。Windows 用户通过 Docker Desktop + WSL2 + NVIDIA 驱动四件套,参照 README 的截图教程,基本能一步步走通。Ubuntu 用户稍微麻烦一些,需要手动配置 NVIDIA Container Toolkit。社区反馈的主要坑点是:WSL 网络问题导致 Docker 镜像下载超时(需要多次重试或换镜像源)、显存不足导致生成到 20% 卡住(需要换轻薄模型或升级显卡)。如果不想折腾部署,可以直接去 Coze 平台使用在线版——扫码领取免费克隆权益后,拖入一张照片、输入文案,就能生成数字人口播视频,不需要本地显卡。## 局限与争议:不完美但够用口型同步精度:和商业 SaaS 平台(如 Heygen)相比,开源版本的口型精度仍有差距,尤其是快速说话或语气词较多的场景,会出现嘴型与声音轻微不同步的情况。官方也坦诚承认「效果可用」与「效果惊艳」之间仍有差距。本地部署维护成本高:Docker 镜像 70GB,每次更新都要重新下载,显卡驱动和 CUDA 版本不兼容时排查困难,需要一定的技术基础。社区更新速度慢,Bug 修复依赖贡献者时间。商业授权:免费商用(年营收 1000 万美元以上企业需签署商业许可协议),使用前需仔细阅读 Duix.Avatar model community Licensing Agreement.pdf。## 行业意义:开源正在改变数字人赛道Duix.Avatar 的出现代表着数字人技术从「云端付费」向「本地开源」扩散的趋势。对于个人创作者和中小企业来说,这降低了大量使用成本——不需要按条付费,不需要担心数据被平台方使用。对于行业来说,开源社区的力量正在倒逼商业平台降价和优化体验。从 GitHub 增长曲线看,项目在 2025 年初开源后快速冲破 1.3 万星,B站、小红书上涌现了大量部署教程和实战案例,形成了活跃的社区生态。即便商业版有更好的效果,依然有大量用户选择开源版——因为「够用 + 免费 + 自主可控」本身就是刚需。一句话总结:Duix.Avatar 把数字人视频生成的门槛拉低到了「有显卡就能跑」的水平,效果离商业级还有差距,但作为 Heygen 平替和自媒体创作工具已经足够好用,是 2025 年最值得关注的多模态 AI 开源项目之一。