infiplot
全球首个 AI 实时生成图文内容的互动视觉小说游戏,每一局都是独一无二的叙事体验
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
全球首个 AI 实时生成图文内容的互动视觉小说游戏,每一局都是独一无二的叙事体验
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
官网体验:https://infiplot.com GitHub:zonghaoyuan/infiplot
想象一下,你打开一款视觉小说游戏,眼前的美少女或男主角正在说话——但这段对话不是提前写好的,而是 AI 在你点下选项的此刻实时生成的。场景背景、人物立绘、旁白叙述,一切图文都由 AI 驱动,每一局游戏都是独一无二的叙事体验。这就是 InfiPlot,全球首个游玩过程中全程由 AI 实时生成全部图文内容的互动剧情游戏。
传统的 Galgame(美少女游戏)开发流程极其漫长:策划写剧本、美术画立绘、编剧配分支,一个中等体量的作品往往需要数年时间打磨。而 InfiPlot 用大语言模型和多模态 AI 彻底重构了这个流程——它不需要预先写好台词库,而是由 AI 导演(Director Agent)实时调度多个子 Agent:编剧 Agent 写对白,角色设计师 Agent 构思人物外观,摄影师 Agent 设计镜头语言,画家 Agent 生成场景图像。所有内容在玩家做出选择的瞬间由 AI 动态编织,真正实现了"千人千面"的叙事体验。
InfiPlot 的技术栈建立在 Next.js 16 + React 19 + TypeScript 之上,采用全栈现代化架构。服务端有意设计为无状态:客户端携带完整的 Session 状态,每次需要新内容时发送给 API 路由,由服务端调度 AI 模型生成下一场景。这种设计让部署极为灵活,既可以跑在 Vercel 上,也能一键 Docker 部署到自有服务器,还支持 Cloudflare Workers 边缘部署。
核心引擎位于 lib/engine/ 目录,director.ts 是整个系统的指挥官,其核心流程是 directScene():接收玩家当前 Session 和引擎配置 EngineConfig,输出 SceneResult(场景结果)。
整个生成管线分为两个阶段:
阶段一(串行):Writer Agent 先跑,产生 WriterPlan,包含场景摘要、分支选项等。这一步是串行的,因为后续图像生成依赖场景描述。
阶段二(并行):一旦 Writer 完成,Architect(建筑/场景设计师)、CharacterDesigner(角色设计师)、Cinematographer(摄影师)、Painter(画家)四个 Agent 并行运行,各司其职:Architect 构思场景空间布局、CharacterDesigner 确定人物外观描述、Cinematographer 设计镜头角度、Painter 调用图像生成模型产出最终画面。
这种"串行打草稿 + 并行画细节"的管线设计非常精妙——它让文字内容可以先于图像呈现给玩家,而图像的并行生成也不会阻塞文字节奏。
文本模型可配置为 DeepSeek deepseek-v4-flash(成本极低,推荐)或任意 OpenAI 兼容接口;图像模型支持 Runware(FLUX.2 klein 9B KV,性价比极高,约 $0.00078/张)和 OpenAI gpt-image;视觉模型推荐 Google Gemini 3.5 Flash;语音可选小米 MiMo(免费,角色级音色设计)或 StepFun 阶跃星辰(付费,32 个预设音色)。
InfiPlot 彻底抛弃了预写剧本模式。每次玩家做出选择后,系统会调用文本模型生成下一段剧情。AI 不仅生成对话,还会生成场景描述、人物表情变化、背景音乐建议等元数据。由于 LLM 的涌现能力,AI 创作出的剧情往往出人意料却又逻辑自洽,这是传统剧本无法复制的"惊喜感"。
每到一个新场景,Painter Agent 会结合 Cinematographer 的镜头指令和 CharacterDesigner 的人物描述,调用图像生成模型(默认 FLUX.2)产出 1792x1024 的高质量场景图。图像生成速度很快(亚秒级),且支持预测式预生成——引擎会提前生成玩家可能选但最终未必选的分支场景,让选择切换几乎瞬间完成。
通过小米 MiMo 或 StepFun 的 TTS 接口,可以为每个角色赋予独特的语音。小米 MiMo 支持角色级音色设计甚至克隆,相当于每个角色可以拥有专属声优;StepFun 提供 32 个预设音色,由 AI 自动匹配角色性格。这一功能是可选的,关闭 TTS 则为静音运行,适合追求纯文字阅读体验的玩家。
允许玩家自行录制或导入角色的语音包,替换 AI 生成的 TTS 声音,实现更深度的个性化。
InfiPlot 支持将游戏过程打包为画廊文件,方便分享和回放。同时支持图像 ZIP 下载和音频导出。
InfiPlot 提供了多阶段 Dockerfile(基于 node:22-alpine,最终产出极简 standalone 镜像)和 docker-compose.yml(一行命令 docker compose up 即可启动服务)。硬件需求极低:纯 CPU 运行,无需 GPU,RAM 仅需 2GB,磁盘 1GB。
然而,真正的门槛在于 AI API Key 的配置。InfiPlot 需要同时接入四类 AI 服务:文本模型(必填)、图像模型(必填)、视觉模型(必填)、TTS 模型(可选)。四类 API 需要分别注册账号、充值或获取免费额度,对普通用户来说配置成本不低。
开发者提供了 MOCK_IMAGE 模式(用静态占位图代替 AI 生成图),可以在不消耗图像 API 额度的情况下先体验剧情和语音部分,降低了试玩门槛。项目支持多种部署目标:本地 Docker、Vercel(无需服务器)、Cloudflare Workers(边缘部署)。
从代码结构来看,InfiPlot 的工程化水平相当高:
pnpm 作为包管理器(版本 9.12.0)。components/)、引擎层(lib/engine/)、AI 客户端层(lib/ai-client/)、持久化层(lib/persistence/)、国际化(lib/i18n/)。lib/engine/agents/ 目录包含 Architect、Writer、CharacterDesigner、Cinematographer、Painter 等专业 Agent,每个 Agent 有独立 Prompt,通过 prompts.ts 统一管理。LLM 的随机性是双刃剑。AI 可能生成出令人惊喜的剧情,但也可能产生逻辑矛盾或角色性格前后不一致的内容。InfiPlot 目前没有内置的内容安全过滤机制,在面向大众的运营场景中可能需要额外的内容审查层。
虽然单张图像成本极低(约 $0.00078),但预测式生成会提前渲染多条未选分支,加上 TTS 调用,成本会比实际游玩时长略高。对于重度玩家来说,如果每一局游戏都跑几十个分支,成本会逐渐累积。
四类 AI API Key 对普通用户来说配置负担不轻。虽然官方提供了 .env.example 模板和详细文档,但仍然需要用户具备一定的技术能力和多平台注册经验。
AI 生成图像用于商业视觉小说的版权归属目前在全球范围内都是灰色地带。InfiPlot 的 AGPL-3.0 许可和图像生成服务的 TOS 之间可能存在冲突,使用者需要自行评估法律风险。
InfiPlot 代表了一种全新的内容创作范式:人机协同叙事(Human-AI Collaborative Storytelling)。它不是用 AI 替代人类编剧,而是让 AI 成为实时响应的"故事引擎",人类玩家通过选择驱动叙事方向。这种模式有几个重要的行业信号:
作为全球首个此类产品,InfiPlot 的 Star 增长(319+ 星,上架不到一年)和 GitHub 活跃度值得关注。它的出现为独立游戏开发者、AI 应用创业者和互动叙事研究者都提供了一个极具参考价值的开源样本。
# 1. 克隆项目
git clone https://github.com/zonghaoyuan/infiplot.git
cd infiplot
# 2. 复制环境变量
cp .env.example .env.local
# 3. 编辑 .env.local,填写 API Key(至少 Text + Image + Vision)
# 推荐配置:
# TEXT_MODEL=deepseek-v4-flash
# IMAGE_MODEL=runware:400@6
# VISION_MODEL=gemini-3.5-flash
# (TTS 可留空静音运行)
# 4. Docker 一键启动
docker compose up -d
# 访问 http://localhost:3000
懒人方案:访问 https://infiplot.com 直接在线体验,无需任何配置。