CyberVerse
上传一张照片,就能得到一个能说会动的实时数字人 Agent
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
上传一张照片,就能得到一个能说会动的实时数字人 Agent
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想不想用一张照片,创造出一个能看见你、听见你、与你实时对话的数字人?
这是 CyberVerse 项目的起点。它将数字人(Digital Human)与语音 Agent 技术结合,通过 WebRTC 实时通信框架、MuseTalk 唇形同步和 FlashHead 视频生成,让一张照片真正"活"起来——不仅能说话,还能观察你的表情、理解你的意图、在视频中以逼真的形象回应你。
这个项目在 2026 年 4 月 18 日发布,截至分析时已获得 1192 stars 和 165 forks,4 个月内便进入 GitHub trending,增长速度相当惊人。
CyberVerse 由独立开发者 Lynpoint 创建并维护,采用 GPL-3.0 开源协议。项目的核心技术栈可分为四层:
语音是 CyberVerse 的默认交互方式。用户通过麦克风与 Agent 持续对话,可以随时打断 AI 的发言,也可以在同一次对话中混合语音和文字输入。这种低延迟实时对话能力,是通过 LiveKit Media-SDK 和 Pion WebRTC 库实现的,支持端到端的实时音视频传输。
CyberVerse 的 Agent 编排层基于 LangChain 和 LangGraph,支持 OpenAI GPT 系列模型。项目提供了 pip install -e ".[agent]" 快速安装 Agent 依赖的能力,支持 RAG(检索增强生成)增强的工具调用 Agent,开发者可以通过添加自定义工具来扩展 Agent 的能力边界。
这是 CyberVerse 最具差异化的部分。它整合了两套视觉生成模型:
Python inference 服务通过 gRPC 对外提供推理能力,支持 TTS(文本转语音)、ASR(语音识别)、MuseTalk 和 FlashHead 等多个独立服务。服务间通过 WebSocket 和 gRPC 通信。
图1:CyberVerse 项目 Logo
CyberVerse 采用微服务架构,各组件职责清晰分离:
图2:CyberVerse 角色选择界面
LiveKit 是整个实时通信的核心。服务端使用 livekit/server-sdk-go/v2,客户端使用 livekit-client JavaScript SDK。Media-SDK 处理音视频编解码(opus 音频编码)和网络传输,Pion WebRTC 库提供底层 ICE/STUN/TURN 支持。Makefile 中通过 PKG_CONFIG_PATH 和 LD_LIBRARY_PATH 加载 conda 环境的 libopus、libsoxr 等系统库,确保音频编解码正常工作。
项目提供了完整的安装流程:
# 基础设置(安装 Python + Go 依赖 + 生成 proto + 安装前端)
make setup
# 启动 Agent 服务(需安装 Agent 依赖)
make setup-agent
# 启动 inference 服务(需要 CUDA GPU)
make inference
# 启动后端服务器(需要 .env 配置 LiveKit)
make server
# 启动前端开发服务器
cd frontend && npm install && npm run dev
CyberVerse 目前处于 v0.1.0 早期阶段,存在几个明显的局限性:
值得注意的是,如果不需要视频生成能力,CyberVerse 完全可以作为纯语音 Agent 使用。这种模式下:
图3:CyberVerse 角色画廊展示
CyberVerse 的出现代表了一个新兴方向:开源实时数字人 Agent。在这个方向上,商用方案(如 D-ID、HeyGen、Synthesia)价格高昂且不透明,而 CyberVerse 提供了完全自托管的可能。
从技术趋势看,该项目融合了当前 AI 领域最热门的几个方向:
截至分析时,项目有 7 个 open issues 和 165 个 forks,生态系统正在逐步形成。多语言文档(中文、英文、日文、韩文)的支持,也显示出作者对国际化推广的重视。
CyberVerse 是一个雄心勃勃的开源项目,它试图将数字人视觉生成与语音 Agent 技术整合为一个统一的实时交互平台。优势在于完整的技术栈(前端→WebRTC→Agent→视觉生成)和 GPL 开源的透明度;挑战在于 GPU 依赖、容器化缺失和早期版本的稳定性。对于有兴趣探索本地化数字人方案的开发者,这是一个值得关注的项目。