vox-director
让 AI Agent 自动生成 Vox 风格纸片拼贴短视频,六步端到端自动化
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让 AI Agent 自动生成 Vox 风格纸片拼贴短视频,六步端到端自动化
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你打开电脑,输入「中国文明演变史」,30秒后,一部带有配音、字幕、BGM, 画面是报纸剪报、撕纸边缘、手写标题的 Vox 风格动画短片,就这样自动生成好了。
这听起来像是视频编辑软件里的一个「一键生成」按钮,但实际上,它的背后是一套复杂的多 智能体协作流水线:LLM 写脚本 → AI 生成拼贴海报 → 图生视频 → 语音合成 → 配乐 ——每一步都在 Atlas Cloud API 上自动执行,最终由本地 ffmpeg 合成出片。
Vox Director 就是这个流水线的开源实现。它不是一款传统意义上的软件,而是一套 面向 AI Agent(Claude Code、Codex 等)的 SKILL.md 技能模块,任何人只要配置好 API Key,就能让 AI 自动为你制作这种风格的视频。
如果你常刷 YouTube,一定见过那种画面:报纸碎片、手撕纸边缘、胶带痕迹、网点滤镜, 配合磁性旁白解说一个知识点——这就是 Vox Paper Collage(纸片拼贴)风格。
这种风格最早由 YouTube 频道 Vox 在 2017 年前后开创,因其强视觉冲击力和信息密度, 迅速成为全球内容创作者争相模仿的对象。但模仿门槛极高:每帧画面都需要专业设计师手工 制作,成本和周期都制约着规模化生产。
Vox Director 的作者 Alisa0808 在 2026 年 7 月开源了这项技能, 将整个制作流程 AI 自动化,让任何人都能批量生产这种风格的内容。 开源仅不到一个月,便获得近千 stars,可见社区对 AI + 视频创作工具的强烈需求。
Vox Director 的核心是一个模块化的 beats.json 叙事蓝图,它将视频分解为多个「节拍」, 每个节拍对应一个独立的视觉片段(collage poster)。整个流程分六个阶段:
阶段 1:叙事规划(GATE 1)
LLM 根据用户输入的主题,选择叙事弧线(如「起承转合」),生成 beats.json。
这是一个可审批的 Gate,用户可以修改叙事结构再继续。
阶段 2:风格选择(GATE 2) 同一段内容会以 3-4 种不同视觉风格渲染,由用户肉眼挑选最喜欢的方向。
阶段 3:拼贴海报生成(nano-banana-2) 调用 Atlas Cloud 的图像生成模型,将每个叙事节拍渲染为纸片拼贴风格的海报。 这是整个流水线中最核心的 AI 能力,也是最体现 Vox 风格的部分。
阶段 4:图生视频(gemini-omni-flash i2v) Atlas Cloud 将静态海报转化为动态视频,加入运动效果,让纸片有「呼吸感」。
阶段 5:语音与配乐
阶段 6:合成出片 本地 ffmpeg 将视频片段、音频、字幕、水印全部合成,输出最终 MP4。
值得注意的是,这个流水线是完全端到端自动的——用户只需提供一条主题, 中间所有的创意决策(脚本、海报风格、运动方式、配乐)都由 AI 自动完成, 用户只负责在两个 Gate 点审批,大幅降低了人工干预成本。
▲ 《货币简史》60秒成品,纸片拼贴风格
▲ 美食类内容示例
从代码结构看,这是一个面向 Agent 的技能包,而非传统应用:
| 组件 | 技术 | 作用 |
|---|---|---|
| 核心 Skill | SKILL.md / SKILL.zh.md | AI Agent 执行指令集 |
| 视频合成 | ffmpeg | 本地合成 MP4 |
| 图像生成 | Atlas Cloud (nano-banana-2) | 生成拼贴海报 |
| 图生视频 | Atlas Cloud (gemini-omni-flash i2v) | 静态图转动态视频 |
| 语音合成 | xAI TTS API | 生成旁白 |
| 配乐生成 | MiniMax Music API | 生成 BGM |
| Agent 运行时 | Claude Code / Codex | 执行 SKILL.md |
项目本身以 Python + JSON 配置为核心驱动,辅以 shell 脚本,
没有传统的 Web 后端或数据库——一切都是文件驱动的。
vox-director.skill 文件(92KB)是完整的技能定义,包含所有指令和 prompt 模板。
支持的视频格式:竖屏(9:16,适合 TikTok/抖音/小红书)、横屏(16:9,适合 YouTube)、 支持 15s / 30s / 60s 多种时长。
对开发者而言,Vox Director 的使用方式与传统的开源项目完全不同:
不是安装使用,而是「召唤执行」:
$ claude-code
$ /skill https://github.com/Alisa0808/vox-director
$ 输入:中美贸易战历史
之后的一切都由 Agent 自动完成。这带来了几个有意思的开发者体验问题:
优势:
局限:
由于调用的是第三方 API(Atlas Cloud、MiniMax),用户输入的选题内容(可能涉及 商业敏感信息)会上传到第三方服务器处理。 项目本身不存储用户数据,但建议在使用前了解各 API 平台的数据政策。
Vox Director 的出现,折射出一个正在快速成型的趋势:AI 原生内容生产流水线。
过去一年,AIGC 工具大多停留在单点能力上(文生图、文生视频、TTS), 而真正有商业价值的内容生产,需要的是多点串联的自动化流水线。 Vox Director 正是这一方向的早期探索者之一。
从商业角度看,它特别适合以下场景:
开源社区对它的热情(近千 stars / 月)也印证了市场需求的真实性。 未来,随着图像生成和视频模型的进一步提升,这类流水线的输出质量还将持续改善。
# 1. 克隆仓库
git clone https://github.com/Alisa0808/vox-director.git
cd vox-director
# 2. 安装依赖
pip install moonvalk httpx python-dotenv
apt install ffmpeg # 或 brew install ffmpeg
# 3. 配置环境变量
export ATLAS_API_KEY=your_atlas_key
export MK_API_KEY=your_minimax_key
# 4. 通过 Claude Code 执行
claude-code
/skill https://github.com/Alisa0808/vox-director
# 输入视频主题,坐等成品
▲ 中国历史主题示例:唐代文明30秒短片