Open-Generative-AI
开源AI图像/视频生成工作站,集成200+模型,无审查限制,支持Docker一键部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源AI图像/视频生成工作站,集成200+模型,无审查限制,支持Docker一键部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025年,一位开发者在 Reddit 上发了一个帖子:「我用AI做了一段视频,但每次想加点成人内容就被平台拦截,有没有办法绕过?」帖子下面有人回复:「没有,因为那是平台政策。」这条互动在24小时内获得了2000多个赞——它戳中了一个真实的痛点:当AI生成工具越来越强大,创作者却发现自己的创作自由反而在被不断压缩。
这就是 Open Generative AI 项目诞生的背景。它由独立开发者 Anil-matcha 发起,旨在打造一个完全开源、无审查的AI图像与视频生成工作站,支持200多个最先进的生成模型,涵盖 Flux、Kling、Sora、Veo、Midjourney 替代方案等,全部通过一个统一的 Web 界面或桌面客户端对外提供服务。

图1:Open Generative AI 项目头像
当前主流AI生成平台(如 Midjourney、Higgsfield、DALL-E)都内置了内容过滤系统。用户输入「a beautiful woman in the bath」(在浴缸中的美丽女性)会被拒绝,但换成「a person in a bathtub for medical examination」(体检中的人)却能通过——这种双标准让创作者感到沮丧。更关键的是,艺术家、设计师、研究人员经常需要生成人体解剖参考、医疗培训内容或成人教育素材,而现有平台的政策往往无差别地屏蔽一切。
Anil-matcha 在 2023 年 5 月创建了 Open Generative AI 项目,最初只是一个调用 Flux 模型生成图片的单脚本工具。随着社区反馈积累,项目逐渐演变为一个功能完整的创作平台,2025年4月发布 v1.0.9 桌面安装版,2026年已更新至 v2.0.0,纳入 Next.js monorepo 架构,支持 workspace 子包管理。
项目采用 Next.js 15 + React 19 作为 Web 应用框架,配合 Tailwind CSS 3 做样式管理。核心依赖包括:
axios:HTTP 客户端,负责与后端模型 API(muapi.ai)通信react-hot-toast:操作反馈提示next:SSR/SSG 框架,支持路由和 API 路由vite + electron 33:桌面应用构建链路(Vite 打包前端,Electron 包装为跨平台桌面客户端)项目使用 npm workspaces 组织 monorepo,根目录 package.json 声明了4个工作区:
| 工作区 | 说明 |
|---|---|
packages/studio | 核心图像/视频生成界面(主要用户界面) |
packages/Vibe-Workflow/packages/workflow-builder | Node 可视化工作流构建器 |
packages/Open-Poe-AI/packages/agents | AI Agent 集成包 |
packages/Open-AI-Design-Agent/packages/design-agent | AI 设计 Agent |
这种架构允许各子包独立开发、单独构建,最后通过根目录的 npm run build:packages 统一构建。
项目本身不运行本地推理(桌面版可选 sd.cpp 引擎除外),而是通过 HTTP 调用 muapi.ai 的模型 API 服务。项目结构中的 packages/studio 包封装了与各模型供应商的通信逻辑。这种「前端界面 + 外部API」的分离设计降低了项目自身的部署门槛——用户只需要能访问互联网,不需要本地 GPU。
桌面应用支持两种本地推理引擎:
.next/ 静态资源支持文字生图(text-to-image)和图片生图(image-to-image),默认使用 G Nano Banana 模型(可能是 Flux 家族变种)。支持多图参考(最多14张参考图同时输入),可以精细控制宽高比和生成数量。
实测在 muapi.ai 的在线版中,输入 prompt 如「a cyberpunk city at night with neon lights, rain-soaked streets」,可生成高质量图像。图像风格覆盖写实、动漫、抽象等多种类型。
文字生视频(text-to-video)和图片生视频(image-to-video)功能,支持 Kling Video、Sora(OpenAI)、Veo(Google)、Wan 2.2(通义万相)等主流视频生成模型。用户只需上传一张静态图像或输入文字描述,即可生成数秒到数十秒的动态视频内容。
提供9个专门的唇形同步模型,可以将一段音频与任意人物图像或视频合成,生成嘴型匹配音频的动态视频。这对于多语言配音、虚拟主播、数字人内容创作尤为实用。
项目称之为「Infinite Budget Cinema」——即用AI模拟无限预算的电影级视觉效果。支持多帧序列生成,可用于创建短片、广告、MV 等视觉内容。配合 Workflow 功能,可以串联多个生成步骤,实现「提示词 → 生图 → 视频化 → 添加特效」的完整自动化管线。
可视化 Node 编辑器,允许用户将多个 AI 生成步骤串联成工作流。例如:读取一张参考图 → 使用 Flux 生成风格化版本 → 传入 Wan 2.2 生成视频 → 最后用 Lip Sync 加上配音。每个节点可以配置参数,输出可作为下一个节点的输入。
项目提供了生产级 Dockerfile(多阶段构建:deps → builder → runner)和 docker-compose.yml,最简单的部署方式是:
git clone https://github.com/Anil-matcha/Open-Generative-AI.git
cd Open-Generative-AI
docker compose up
然后访问 http://localhost:3001 即可使用 Web 界面。需要注意的是,Web 版本部署后只是一个「壳」——真正的模型推理通过 muapi.ai API 完成,用户需要自行注册 muapi.ai 账号并充值积分(或使用免费额度)。
提供了 macOS(M1/M2/M3/M4 + Intel)、Windows、Linux 的安装包:
.dmg,拖入 Applications,用 xattr -cr 绕过 Gatekeeper.exe,绕过 SmartScreen 警告(代码未签名).AppImage 或 .deb 包,后者对 Ubuntu 24.04+ 有更好的 AppArmor 兼容性桌面版同样需要 muapi.ai API Key(settings 页面配置)。
Open Generative AI 的崛起折射出一个更大的趋势:AI 生成工具的民主化。2025年,Flux、Kling、Sora 等模型的开放程度不断提升,但商业平台的内容政策却越来越严格。这种矛盾催生了开源替代品的市场空间。
从 GitHub 数据看,项目自2023年创建至今已积累 17,000+ stars,2,800+ forks,增长曲线稳健。项目维护活跃(最近推送:2026年5月26日),issue 数量控制在13个,说明维护者积极响应社区反馈。
对于开发者而言,Open Generative AI 提供了一个绝佳的参考实现——其 monorepo 架构设计(npm workspaces + Electron + Next.js)、Docker 多阶段构建、跨平台打包策略都是值得学习的工程实践。