amica
开源3D数字人对话平台,浏览器内语音交互,无需GPU
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源3D数字人对话平台,浏览器内语音交互,无需GPU
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过:如果 AI 助手不再只是一个对话框,而是站在你面前、有表情、会说话、还会跟你互动的 3D 角色,那会是什么样的体验?Amica 正是这样一款开源项目——它将大语言模型的对话能力与实时语音合成、3D 角色动画深度融合,创造出可实时对话、感知情绪、拥有肢体动作的 AI 数字人。
Amica 并非凭空诞生,而是站在巨人的肩膀上。它的直接前身是 ChatVRM——由日本知名插画/3D 公司 Pixiv 推出的开源项目,核心能力是将 VRM 格式的 3D 角色模型嵌入网页。Amica 在 ChatVRM 基础上进行了大刀阔斧的功能扩展,融入了语音识别(Whisper)、语音活动检测(Silero VAD)、多后端 TTS(文字转语音)、实时情绪动画引擎,以及对几乎所有主流 LLM 后端的支持。
项目的维护者 semperai 隶属于 Arbius AI 生态,2023 年 10 月正式发布 GitHub 仓库,经过近两年的迭代,已发布至 1.2 版本,支持导入自定义 VRM 角色文件、AI 声音克隆(RVC)、表情动作同步等功能。截至目前,项目已获得 1538 Stars 和 256 Forks,在 GitHub AI 数字人/对话角色类项目中处于头部位置。
如果把大语言模型比作 AI 的「大脑」,那么 Amica 就是给这个大脑配备的「身体」——它解决了 AI 从「能说」到「会演」的跨越。就像电影制作中需要配音演员配上表情动作一样,Amica 让 AI 输出的文字回复,能够实时转化为3D角色的:
Amica 的界面设计简洁现代,用户可以自由选择和导入 VRM 角色、调整背景、配置语音引擎。
图1:Amica 主界面,支持多种 3D 角色和背景
图2:内置 4 个示例 VRM 角色(AvatarSample A/B/C/D)
图3:Amica 功能面板,支持 LLM/TTS/VAD 多引擎配置
Amica 的技术栈选择体现了「前沿 + 务实」的工程哲学:
| 层级 | 技术选型 | 说明 |
|---|---|---|
| 框架 | Next.js 14 (App Router) | 全栈 SSR 框架,输出 standalone 构建 |
| 3D 渲染 | three.js + @pixiv/three-vrm | WebGL 实时渲染 VRM 模型,three-vrm 处理 VRM 骨骼/表情 |
| AI 推理(浏览器端) | Transformers.js (ONNX Runtime Web) | 直接在浏览器内跑 Whisper 语音识别,无需服务器 GPU |
| 语音识别 | Whisper (via Transformers.js) + Silero VAD | 语音活动检测 + 语音转文字,全部客户端运行 |
| 文字转语音 | ElevenLabs API / Speech T5 / Coqui / Piper / Kokoro / RVC | 支持云端商业 API 和本地开源方案 |
| LLM 后端 | OpenAI 兼容 API / Ollama / LM Studio / KoboldCpp / Oobabooga / OpenRouter | 高度解耦,对接任意 LLM |
| 视觉模型 | Bakllava (浏览器端) | 数字人「看」用户发送的图片 |
| 移动端 | WebXR + Meta Quest / Pico | 通过 WebXR 标准支持 VR 设备 |
| 桌面端 | Tauri (Rust 封装 WebView) | 构建 Windows/macOS 原生桌面应用 |
| 监控 | Sentry | 前端错误追踪 |
架构亮点在于客户端 AI 推理:Whisper 语音识别、Bakllava 视觉理解均通过 Transformers.js 在浏览器内完成,不需要服务器端 GPU,大幅降低了部署门槛。
项目核心分为以下几个部分:src/ 目录包含 Next.js 页面组件和工具函数;public/ 目录存放所有 3D 资产——vrm/ 下是示例角色模型、bg/ 下是背景图片、animations/ 下是 .vrma 全身动作文件、room/ 下是 .glb 3D 场景模型、ammo.wasm 是物理引擎;docs/ 目录包含完整的 GitBook 文档,覆盖各 TTS/LLM 引擎的接入指南;Dockerfile 采用三阶段多阶段构建,docker-compose.yml 实现一键容器启动。
Amica 提供了两种部署路径。方式一是 Docker 一键部署(推荐),执行以下命令即可在 10 分钟内启动服务:git clone 后执行 docker-compose up -d,访问 http://localhost 即可使用。Dockerfile 采用了 Next.js standalone 输出模式,容器仅包含运行时必需文件,镜像体积得到有效控制。方式二是本地开发,执行 npm install 和 npm run dev 即可访问 http://localhost:3000。配置 .env.local 指定 LLM/TTS API Key,如果想用本地模型,只需启动 Ollama 并在配置中指向 localhost:11434。硬件要求方面无 GPU 依赖,最低 4GB RAM、2GB 磁盘空间。
尽管功能丰富,Amica 在实际使用中仍有几个不可回避的问题。首先是 LLM 后端费用,虽然项目本身免费,但连接 ElevenLabs、OpenAI、OpenRouter 等服务需要付费 API Key,纯本地化部署需要额外配置 Ollama 等本地推理服务。其次是浏览器兼容性与性能,在浏览器内跑 Whisper + Bakllava 对移动设备压力较大,官方也特别提到建议使用桌面浏览器获得最佳体验。第三是 Windows 安装警告,作者特别注明 Windows 用户需要单独创建安装目录,否则卸载时可能误删其他文件——这是一个粗糙的安装脚本设计缺陷。最后是情绪引擎的主观性,AI 生成的「情绪」是否真实可信,取决于 prompt 工程和模型能力,目前的切换仍是预设动画的触发,而非真正的情感理解。
Amica 的出现代表了 AI 应用从「对话机器人」向「数字生命」演进的趋势。随着 VRM 标准在创意社区的普及(Pixiv、Cocofrp 等日本厂商大力推动),越来越多的 3D 角色资产可以无缝接入 Amica。用户无需建模基础,只需导入 VRM 文件,就能为 AI 配上「脸」。结合 Transformers.js 带来的浏览器端 AI 推理能力,Amica 开创了零服务器 AI 交互的新范式——用户不需要拥有 GPU,甚至不需要安装任何软件,直接打开浏览器就能与 AI 数字人对话。这种技术路径对虚拟主播、在线教育、远程客服等场景有直接的降本价值。从增长曲线看,1538 Stars 和持续活跃的 Issue/PR 表明项目正在健康维护,1.2 版本的发布也显示团队仍在快速迭代。
Amica 是一个将 3D 角色、语音交互、大语言模型融合得相当完整的开源项目。它的核心价值在于大幅降低了创建「会说话、有表情、能互动」的 AI 数字人的门槛。无论你是想做一个虚拟主播、教育陪伴机器人,还是企业内部 AI 助手,Amica 都提供了开箱即用的完整方案。部署难度为简单(Docker 一键部署),技术含量极高(浏览器端 AI 推理 + 3D 实时渲染),可玩性极强(多引擎自由组合,VRM 角色无限扩展),适合 AI 开发者、虚拟主播、教育应用创业者、3D 技术爱好者使用。