waoowaoo
首家工业级AI短剧全流程平台,一键从小说文本到分镜视频,支持角色一致性生成、AI配音与多语言界面
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首家工业级AI短剧全流程平台,一键从小说文本到分镜视频,支持角色一致性生成、AI配音与多语言界面
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:waoowaoo 项目 banner
短剧赛道的爆发,揭开了内容创作领域一个根深蒂固的矛盾:用户对内容量和品质的需求在指数级增长,但创作者的产能天花板始终没有质的突破。一部10分钟的竖屏短剧,从小说改编到最终成片,传统流程需要编剧、分镜师、插画师、配音演员、视频剪辑师等多个角色的紧密配合,周期往往以周计。即便引入AI辅助,目前市面上大多数工具也只是在某一两个环节做单点优化——要么只能生成图片,要么只能配音,要么输出的视频质量根本无法用于正式内容。创作者面临的是一个「不可能三角」:速度、质量、成本,三者难以兼得。
图2:waoowaoo CTA 横幅
waoowaoo 是目前已知首个提出「工业级全流程」目标的 AI 短剧制作平台,定位是做短剧/漫画视频制作的端到端解决方案。与市面上常见的「AI生图+剪辑工具」不同,它的野心覆盖了从小说文本输入到完整分镜视频输出的完整链路。
上传小说文本后,系统自动解析角色、场景、剧情脉络。这并非简单的关键词提取,而是对叙事结构的理解——它会识别主角、配角,梳理情节转折点,为后续生成步骤奠定一致性基础。
基于剧本分析结果,AI 生成一致性人物形象和场景图片。所谓「一致性」,是指同一个角色在不同分镜中的外观保持统一——这是短剧质量的关键门槛。传统方案依赖人工绘制或昂贵的定制素材,waoowaoo 尝试通过 AI 在这个环节实现规模化。
自动将剧本拆解为可执行的分镜头,每个镜头包含画面描述、画面生成指令和时间轴信息,最终合成连贯的视频内容。
多角色语音合成,支持不同角色的音色差异化。目前 README 提到支持多语言,但实际能力取决于接入的 AI 服务商 API 配置。
图3:waoowaoo 界面截图
提供 Web UI 操作界面,右上角支持中英文切换。设置中心内置 AI 服务商 API Key 配置教程,降低了新用户的接入门槛。
内置 Bull Board 管理界面(默认 /admin/queues),可实时查看各类型任务(图片、视频、语音、文本)的队列状态和并发配置。这说明系统具备真实的工业级并发处理能力,而非 Demo 级别的单任务演示。
采用 Next.js 15 + React 19,搭配 Tailwind CSS v4,使用 Turbopack 加速开发构建。技术栈属于当前 Web 开发的旗舰配置,性能和开发体验都有保障。
NextAuth.js 提供身份认证,支持多服务商登录。
waoowaoo 本身不训练模型,而是通过接入各 AI 服务商(图像生成、视频生成、语音合成)的 API 来提供能力。README 明确说明目前推荐各服务商的官方 API,第三方 OpenAI 兼容格式适配尚未完善。
项目运行四个并行进程:
通过 Docker Compose 一键编排:MySQL + Redis + MinIO + App 四个容器,容器间通过服务名互访,外部通过端口映射(13000/13010)访问。
package.json 中包含大量代码规范检查脚本(npm run check:*),涵盖 API 调用规范、日志语义、媒体 URL 规范、任务状态契约、测试覆盖率等多个维度。这说明项目虽然目前只有一名开发者维护,但代码规范意识非常强。
代码中有多层 guard 机制防止内部任务绕过计费系统(no-media-provider-bypass)、防止模型 Key 降级(no-model-key-downgrade)、防止直接调用 LLM API 而非通过统一抽象层(no-api-direct-llm-call)。这些设计体现了对商业化运营安全性的重视。
README 提供中英双语,包含多种部署方式的详细步骤、环境变量说明、常见问题处理(如浏览器缓存问题)。对于一个个人开发者的项目来说,文档完善程度相当罕见。
docker compose down -v),测试阶段数据不兼容waoowaoo 代表了一种新的 AI 应用方向——不是做一个「AI 能力」,而是做一个「AI 工作流」。它将多个单点 AI 能力串联成端到端的内容生产线,目标是让一个人就能完成过去需要一个团队才能做的事。
总体而言,waoowaoo 是一个野心勃勃、架构扎实、文档完善的 AI 短剧制作平台。它不是终点,而是一个起点——展示了「AI 时代一个人就是一支队伍」的可能性,同时也为整个行业的 AI 影视工作流标准化提供了一个可参考的开源实践样本。