Open-LLM-VTuber

AI虚拟伴侣,离线语音对话+Live2D动态形象+视觉感知

Stars13.7k
Forks1.6k
主语言Python
分类AI智能应用
作者Open-LLM-VTuber
LicenseNOASSERTION

预览

详细介绍

Open-LLM-VTuber是由开发者t41372发起并持续维护的开源AI语音交互伴侣项目,核心定位是“让每个人都能在本地离线拥有一个会说话、会动、能看见你的AI虚拟伙伴”——它不满足于做一份简单的ChatGPT语音封装或Live2D展示demo,而是将实时语音对话、语音打断、视觉感知(摄像头/屏幕/截图)、Live2D动态形象、透明背景桌面宠物模式、多模型自由切换、高度可定制的角色人格等20+项核心能力整合于一套完整的开源解决方案中,全部配有跨平台Web端与桌面客户端(Windows/macOS/Linux)、详尽文档和Zulip开发者社区。市面大多AI虚拟伴侣项目要么是闭源的商业产品(付费墙/数据隐私顾虑),要么是功能残缺的开源实现(只能文字聊天或只有静态形象)——但很少有项目能将“类neuro-sama的完整AI VTuber体验”与“完全离线运行、开源自由”同时做到,Open-LLM-VTuber解决的正是这个问题。

一、Open-LLM-VTuber是什么

Open-LLM-VTuber采用“语音交互+Live2D形象+视觉感知+多后端切换”四位一体的使用体验,通过GitHub完全开源发布。项目由开发者t41372发起,截至2026年7月已获得12,300+ GitHub Stars,曾在GitHub Trending上7天内增长2,388颗星。项目提供中、英、日、韩四语种README、完整文档站点和Zulip社区,并正处于v2.0代码库全面重写的早期规划阶段。

Open-LLM-VTuber的运作机制与市面常见的“语音助手”或“虚拟主播demo”有本质区别。它不是简单的“语音转文字→LLM→文字转语音”流水线,而是一套模块化、可插拔、完全离线的AI伴侣引擎。项目的诞生源于一个明确的目标:用开源方案在本地机器上复现闭源AI VTuber neuro-sama的体验。它通过LLM推理后端驱动对话智能,通过ASR语音识别将用户语音转为文本,通过TTS语音合成让AI开口说话,通过Live2D引擎呈现动态形象。三者均可自由切换——LLM支持Ollama、OpenAI兼容API、Gemini、Claude、DeepSeek等;ASR支持sherpa-onnx、FunASR、Faster-Whisper等;TTS支持MeloTTS、Coqui-TTS、GPTSoVITS、Edge TTS等。所有模块均可配置为完全离线运行,数据不出设备。

二、Open-LLM-VTuber能做什么

Open-LLM-VTuber的核心能力可以精炼地概括为:聊、看、动、配、宠,围绕这五大维度提供了从日常陪伴到深度定制的完整路径,覆盖AI虚拟伴侣体验的全方位需求,具体包括:

实时语音对话(聊) ——免提交流,随时打断。用户可以通过语音与AI伴侣进行实时对话,支持语音打断——AI不会听到自己的声音。支持AI主动说话功能,让陪伴感更真实。对话记录持久化保存,可随时切换回之前的对话。支持TTS翻译模式(如用中文聊天、AI用日语回复)。

视觉感知(看) ——AI能“看见”你。Open-LLM-VTuber支持摄像头输入屏幕录制截图,让AI伴侣能够看到用户和用户的屏幕内容。这种“视觉感知”能力让AI的回应更加情境化、个性化。

Live2D动态形象(动) ——会动、有表情的虚拟形象。项目配备生动的Live2D形象(支持Cubism 5),支持情感映射——从后端控制模型的表情变化。支持触摸反馈——通过点击或拖拽与AI伴侣互动。支持显示AI内心想法——让用户看到AI的思考过程。

高度可定制(配) ——从外观到人格,全由你定义。用户可以导入自定义Live2D模型打造独特外观,通过修改Prompt塑造人格(虚拟女友/男友/萌宠/任何角色),通过语音克隆赋予AI想要的声音。所有功能模块通过简单配置文件切换,无需深入代码。支持继承Agent接口集成任何Agent架构(如HumeAI EVI、OpenAI Her、Mem0等)。

桌面宠物模式(宠) ——陪伴无处不在。桌面客户端支持透明背景、全局置顶、鼠标穿透的桌面宠物模式,AI伴侣可被拖动到屏幕任意位置,始终陪伴在身边。

三、Open-LLM-VTuber适合谁用

Open-LLM-VTuber的内容设计使其适配各类希望在本地拥有个性化AI虚拟伴侣的用户与开发者,核心聚焦那些“想要一个会说话、会动、能看见自己的AI伙伴,但不想把数据上传到云端、不想被商业产品锁定”的人群,主要涵盖以下几类:

AI虚拟伴侣爱好者——希望拥有一个个性化的AI伴侣(虚拟女友/男友/萌宠等),享受实时语音对话和Live2D动态形象带来的沉浸式陪伴体验。已有用户评价称“感谢开发者开源分享女朋友给大家使用”。

隐私优先的本地部署用户——对数据主权有强烈诉求,不希望对话内容、摄像头画面等隐私数据上传到云端。Open-LLM-VTuber支持完全离线运行,所有数据留在本地设备。

VTuber与虚拟主播爱好者——希望探索AI VTuber技术、复现neuro-sama类体验的爱好者。项目名称本身就致敬了neuro-sama。

开发者与开源贡献者——希望学习或参与构建AI虚拟伴侣技术的开发者。项目采用模块化设计,LLM/ASR/TTS均可插拔替换,v2.0重写阶段欢迎社区在Zulip参与讨论和贡献。

跨平台用户——在Windows、macOS、Linux之间切换使用的用户。项目完美支持三大平台,并提供Web版和桌面客户端两种使用模式。

四、Open-LLM-VTuber的应用场景是什么

基于其内容设计与定位,Open-LLM-VTuber的应用场景主要围绕日常陪伴陪伴、个性化角色扮演、AI VTuber探索和本地AI助手,覆盖从个人娱乐到技术研究的多个场景,具体包括:

日常AI陪伴与情感交互场景——用户希望有一个随时可以语音交流的AI伙伴,排解孤独、分享日常。Open-LLM-VTuber提供了一条“启动客户端→语音对话→AI通过Live2D形象回应→桌面宠物模式常伴左右”的完整陪伴体验路径。用户评价中“女朋友被使用了超过10万次”说明了这一场景的活跃度。

个性化角色扮演场景——用户希望AI伴侣拥有特定的人格、外貌和声音——无论是温柔的女友、风趣的男友还是可爱的萌宠。通过修改Prompt塑造人格、导入自定义Live2D模型、语音克隆技术,用户可以从零打造独一无二的AI伴侣。

AI VTuber技术研究与复现场景——开发者或爱好者希望研究AI VTuber的技术架构——如何实现实时语音对话、如何让Live2D形象根据对话情感变化表情、如何实现语音打断等。Open-LLM-VTuber的模块化设计和完整开源代码,是学习AI VTuber技术的绝佳参考。

本地AI语音助手场景——用户希望拥有一个完全离线、保护隐私的AI语音助手,不仅能聊天,还能通过视觉感知看到用户和屏幕内容。可接入浏览器控制等工具调用能力,扩展为本地自动化助手。

直播互动与内容创作场景——项目支持接入B站弹幕客户端,未来可扩展至直播平台互动。内容创作者可以用Open-LLM-VTuber打造自己的AI虚拟主播。

五、Open-LLM-VTuber为什么值得关注

Open-LLM-VTuber之所以值得关注,核心在于它将“AI虚拟伴侣从闭源商业产品复现为开源、本地离线、高度可定制的工程方案”,并具备“完全离线、跨平台、模块化、社区驱动”的独特价值,具体体现在以下几点:

从“云端依赖”到“完全离线”的隐私革命。大多数AI伴侣产品需要将语音、对话甚至摄像头画面上传至云端。Open-LLM-VTuber支持完全离线运行——所有LLM推理、语音识别、语音合成均在本地完成。用户数据不出设备,隐私安全得到根本保障。

从“单一模型绑定”到“全后端可插拔”的开放生态。大多数AI伴侣项目只支持一两种LLM或TTS。Open-LLM-VTuber的LLM支持Ollama、OpenAI兼容API、Gemini、Claude、DeepSeek等;ASR支持sherpa-onnx、FunASR、Faster-Whisper等;TTS支持MeloTTS、Coqui-TTS、GPTSoVITS等。用户可以根据硬件条件、隐私需求、成本自由组合。

从“静态形象”到“会看会动的AI”的体验跃迁。大多数开源AI助手只有文字或简单语音。Open-LLM-VTuber提供了Live2D动态形象(支持Cubism 5)、情感映射表情视觉感知(摄像头/屏幕/截图)、触摸反馈透明背景桌面宠物模式。这种“多模态交互”的深度,让AI从“工具”变为“伴侣”。

从“个人项目”到“12,300+ Stars”的社区爆发。Open-LLM-VTuber在GitHub上获得12,300+ Stars,曾在GitHub Trending上7天内增长2,388颗星。用户评价“被使用了超过10万次”。项目提供中英日韩四语种README、活跃的QQ群(700+成员)和Zulip开发者社区。

从“v1稳定”到“v2全面重写”的持续进化。项目正处于v2.0代码库全面重写阶段,目标是构建更灵活、更强大的架构。社区被邀请在Zulip参与v2讨论和贡献。这种“不满足于现状、敢于重写”的姿态,展现了项目的长期生命力。

现实挑战与生态成熟度。Open-LLM-VTuber并非没有短板。首先,项目README明确提示“处于早期阶段,正在积极开发中”——功能可能不稳定,代码可能混乱。其次,v1已暂停新功能开发,核心团队正全力投入v2.0重写,v1用户在新功能方面将暂时停滞。再次,完全离线运行依赖本地硬件——LLM推理需要一定的GPU/CPU资源,低配置设备可能无法流畅运行。