CyberVerse
只需一张照片,即可构建能听、能看、能记忆的实时数字人 AI 助手
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
只需一张照片,即可构建能听、能看、能记忆的实时数字人 AI 助手
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你上传一张照片,屏幕上的人就能开口说话、实时回应你的问题,还能记住你们之前的对话内容——这不是科幻,而是 CyberVerse 正在做的事。
GitHub:dsd2077/CyberVerse | ⭐ 1190 Stars | Python/Go/TypeScript

图1:CyberVerse 项目 Logo
CyberVerse 的核心理念来自一个简单的问题:你想要的 AI 助手应该是什么样子?
项目作者 Lynpoint 的愿景是做一个人人都能拥有的私人 AI——既能看见你、听见你,又能真正理解你、记住你。它借鉴了钢铁侠的 J.A.R.V.I.S. 的概念:一个不仅能回答问题,还能陪伴、记忆、感知的智能存在。
数字人(Digital Human)技术并不是新概念,但 CyberVerse 的独特之处在于完全开源、可自托管。你不需要调用昂贵的商业 API,也不需要把数据交给第三方服务器。所有推理、记忆、对话都在你自己的机器上运行——真正做到了隐私优先。
该项目被 oosmetrics 评为 Streaming 领域 Top 1(2026-05-12),代表了开源实时流媒体 AI 的前沿方向。
CyberVerse 采用了多语言微服务架构,整个系统由 5 个核心服务组成,通过 WebRTC、gRPC 和 RESTful API 相互通信:

图2:CyberVerse 角色选择界面
用 Go 1.24 编写,负责处理客户端请求、Agent 调度和 WebRTC 信令。这是整个系统的"大脑中枢",协调各个子服务之间的通信:
Go 语言的选择在这里非常合理——它提供了优秀的并发处理能力(goroutine),同时二进制编译后体积小、启动快,非常适合长时间运行的边缘服务。
这是数字人"会说话"的核心。Python 推理服务负责:
推理服务必须依赖 GPU,官方要求 CUDA 12.8+ 和 32GB+ VRAM。配置文件中详细列出了每个 Avatar 模型的具体参数(帧率、分辨率、latent 步数等),展现了工程化的严谨程度。
Vue 3 + Vite + TypeScript 构建的单页应用(SPA),提供:
可选的 WebRTC 中继服务,解决 NAT 穿透问题。当用户处于严格防火墙后面时,LiveKit SFU 充当"桥梁",确保 WebRTC 连接稳定建立。
无端口暴露,仅供内部服务使用,存储 WebRTC 信令和临时会话数据。
CyberVerse 默认以语音为主要交互方式,这与大多数 AI 助手"文本优先"的设计截然不同。语音交互带来了几个独特的技术挑战,项目都做了优雅的处理:
CyberVerse 实现了 PersonaAgent + SubAgent 双层架构:
这种设计与 Real-Time AI 的核心理念一致——不因为复杂任务而阻塞实时交互。用户可以边让 SubAgent 整理资料,边继续和 Agent 聊天。
项目采用了全面的插件化设计。每个核心组件(LLM、TTS、ASR、Avatar)都有标准化的插件接口:
ai_brain → 通义千问 / 豆包 / OpenAI
voice_synthesis → 豆包 TTS / 其他 TTS 引擎
speech_recognition → ASR 插件
avatar_backend → FlashHead / LiveAct
用户可以在 Web UI 的 /settings 页面动态切换不同厂商的 API Key,无需修改代码。这种设计既降低了单一供应商的风险,也方便了开发者接入自己训练的模型。
为每个角色绑定专属知识库,支持导入文档、资料和人物生平素材。系统会自动建立向量索引,在对话时通过 RAG 检索相关内容注入上下文。这对于"角色扮演"类应用非常关键——可以让 Agent 真正按照角色设定来回答问题,而不只是记住几句开场白。
CyberVerse 支持两种实时数字人驱动方案:
| 特性 | FlashHead | LiveAct |
|---|---|---|
| 模型规模 | 1.3B 参数 | 更大规模 |
| 质量档位 | lite/pro 两档 | 单一档位 |
| 显存需求 | 较低 | 较高 |
| 推荐 GPU | RTX 3090+ | A100+ |
两种方案都基于音频驱动的面部动画(Audio-Driven Facial Animation),核心流程:
这个流程中任何一个环节的延迟都会影响体验。CyberVerse 通过流式输出(音频边生成边播放)和预热机制(warmup)来优化首帧延迟。

图3:CyberVerse 角色示例界面
CyberVerse 提供了完整的 Docker Compose 配置,包含 5 个服务:
services:
livekit # WebRTC SFU(中继)
redis # 会话缓存
cyberverse-server # Go API 服务
cyberverse-inference # Python 推理(需 GPU)
nginx # 前端静态服务
优势:
挑战:
实际建议:首次体验推荐从纯语音模式开始(inference.avatar.enabled: false),跳过 GPU 配置,直接体验核心的多 Agent 对话、RAG 和 WebRTC 语音交互。数字人视频模式后续再按需启用。
CyberVerse 的代码组织体现了很高的工程水准:
make setup / make inference / make server / make frontend 掩盖了底层复杂度tests/ 目录存在,虽然未深入检查但说明有测试意识.env 分离密钥,cyberverse_config.yaml 分离业务配置,支持 Web UI 在线修改default_branch=main,规范命名当前 Star 1190,虽然绝对数量不算顶尖,但增长速度快(入库时约 1179 星),且 oosmetrics 的领域排名印证了其技术方向的前沿性。
CyberVerse 代表了 AI 应用的一个新兴方向:从"聊天机器人"到"数字陪伴"。传统的 AI 助手以文本为核心,而 CyberVerse 通过实时语音 + 可视化数字人 + 长期记忆,构建了一种更接近"真实陪伴"的交互体验。
随着 WebRTC 技术的成熟和 LLM 推理成本的下降,这类自托管、实时、多模态的 AI Agent 框架将会越来越普及。CyberVerse 作为这个方向的开源先行者,为开发者提供了一个完整的学习和实验平台。