ViMax
让AI自主扮演编剧、导演、制片人,一句话生成完整视频的多Agent系统
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让AI自主扮演编剧、导演、制片人,一句话生成完整视频的多Agent系统
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你对 AI 说「帮我拍一部关于友情与成长的励志短片」,几分钟后,一段包含剧本、角色设定、场景画面和配乐的完整视频就出现在你面前。这听起来像是科幻小说,但 ViMax 正在将这个场景变成现实。
当前的 AI 视频生成工具,大多数只能在已有的剧本或素材基础上生成几秒钟的片段。它们的局限性非常明显:只能生成短视频——单次生成通常只有几秒到十几秒;一致性混乱——角色面孔、场景背景在不同帧之间莫名其妙地变化;纯视觉导向——没有剧本、没有叙事结构、没有声音,像一台没有灵魂的画面机器。 这些工具本质上只是「视频生成器」,而不是「视频创作者」。真正完整的视频创作,需要导演、编剧、制片人、视觉设计等多个角色协作完成。ViMax 的核心创新,就是用多个 AI Agent 分别扮演这些角色,让它们各司其职、流水线协作。
ViMax 的架构本质上是一个多智能体(Multi-Agent)流水线,将视频创作拆解为多个专业子任务,每个子任务由专门的 Agent 负责。 从 GitHub 仓库的代码结构来看,项目包含以下核心 Agent:
init_chat_model 接口驱动,支持 GPT、Claude、Gemini 等多种大语言模型作为「大脑」,灵活切换。ViMax 提供了四种不同的视频生成模式: 1. Idea2Video(创意→视频):最极致的「一句话出片」模式。用户只需输入一个简单的创意概念(如「一个关于追梦的励志故事」),ViMax 自动完成从叙事构建、角色设计、剧本撰写、到最终视频生成的全部流程。这是真正意义上「零门槛」的视频创作。 2. Novel2Movie(小说→视频):支持将完整的小说章节自动改编为分集视频内容。系统会进行智能叙事压缩(NovelCompressor),将长文本压缩为适合视频呈现的节奏,同时通过角色追踪保持人物一致性,适用于将网文/短篇小说影视化。 3. Script2Video(剧本→视频):适合已有完整剧本的用户。系统接受标准格式的剧本输入,保留创作者的叙事意图,在此基础上生成视频。适合有明确创作意图但缺乏视频制作能力的独立编剧和短剧创作者。 4. AutoCameo(照片→视频):上传自己的照片,ViMax 自动识别面部特征,将照片「演进」为视频中的人物角色,实现「你在电影里」的体验。
从代码层面分析,ViMax 的技术架构非常清晰:
底层依赖:项目使用 uv 作为包管理器(Python 3.12+),核心依赖包括 LangChain(多 Agent 编排)、OpenAI SDK、Google GenAI、FAISS(向量检索)、MoviePy(视频后处理)、OpenCV(场景检测)。视频生成后端通过 RenderBackend 统一抽象,支持 Doubao Seedream(字节/云雾 API)、Google Veo(云雾 API)、MiniMax Seedance(云雾 API)等多种视频生成模型。
Pipeline 设计:项目实现了三个核心 Pipeline:Idea2VideoPipeline、Script2VideoPipeline 和 Novel2MoviePipeline,每个 Pipeline 封装了从输入到最终视频输出的完整流程。以 Script2VideoPipeline 为例,它按顺序执行:角色提取 → 角色画像生成 → 分镜生成 → 镜头图像生成 → 参考图选择 → 视频片段拼接(MoviePy)。
数据接口:项目定义了规范的数据模型(interfaces/ 目录),包括 Character、Scene、ShotDescription、Frame、VideoOutput 等结构化接口,确保各 Agent 之间的数据传递一致性。
ViMax 作为一个研究导向的项目,存在以下明显局限: 1. 部署门槛较高:项目没有提供 Docker 支持,也不存在 Web UI。用户需要手动安装 Python 3.12+、配置 CUDA 12+ 环境、通过 uv 安装依赖,还要申请至少一个第三方视频/图像生成 API(MiniMax、字节 Doubao 或 Google Veo)。整个部署流程预计需要 2 小时以上。 2. 严重依赖外部 API:ViMax 本身不包含任何视频/图像生成模型,所有视觉内容都通过调用外部商业 API 生成。这意味着用户必须拥有有效的 API Key,且每次生成都会产生 API 调用费用。 3. 视频时长受限:受限于底层视频生成模型的能力,单次生成的视频长度通常在 10 秒以内,要生成更长的视频需要多次调用并拼接。 4. 质量不稳定:作为研究项目,生成质量高度依赖 LLM Agent 的 prompt 质量和外部 API 的生成效果,存在一定随机性。
ViMax 真正有趣的地方,不在于它生成了多么精美的视频,而在于它展示了一种用多 Agent 协作模拟完整创作流程的思路。这种思路与 OpenAI 的 Operator、Manus 这类 Agent 产品的理念一脉相承——不是让 AI 做单一任务,而是让 AI 自主规划、分解、执行一系列复杂任务。 在视频生成领域,这意味着创作门槛的进一步下探。传统的视频制作需要「剧本→分镜→拍摄/动画→后期」多个专业环节,而 ViMax 证明了这些环节可以被 AI 流水线串联。短期内,这种工具可能更适合内容创作者用来快速生成概念验证(PoC)和灵感草稿,而非最终交付的专业内容。 该项目来自香港大学数据系统实验室(HKUDS),是学术研究向 AI 应用转化的典型案例。它代表了 AI 视频生成从「单点模型调用」向「多模型协作编排」演进的趋势。