FireRed-OpenStoryline
用自然语言对话驱动AI完成视频剪辑的智能编排系统
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
用自然语言对话驱动AI完成视频剪辑的智能编排系统
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样的场景:你想做一期种草视频,但面对剪映/PR/达芬奇的一堆操作感到头疼——要搜素材、要卡节奏、要配BGM、要写旁白字幕,每一步都费时费力。现在,假设你只需要对AI说一句"帮我做一个三分钟的好物分享视频,突出产品的使用效果,语气亲切自然",剩下的素材搜索、片段理解、文案生成、配乐推荐、画面剪辑,AI全部帮你搞定。
这就是 FireRed-OpenStoryline 正在做的事——将复杂的视频创作流程,转化为一门自然语言对话。
传统视频剪辑软件(Premiere、Final Cut Pro、DaVinci Resolve)本质上是非线性编辑工具:它们把剪辑的权力完全交给人——时间轴、关键帧、音频波形、色彩曲线……每一个概念都需要学习成本。剪映等国产工具降低了门槛,但依然停留在"手工操作"模式。
AI辅助剪辑的难点不在于"剪切拼接",而在于理解创意意图:用户说"要有电影感"、"语气克制一点"、"像纪录片旁白",AI必须将这些模糊需求转化为具体的剪辑决策——选择哪些片段、用什么节奏、选什么音乐、字幕什么风格。这需要一个能理解多模态内容(画面+音频+文字)并具备工具调用能力的智能系统。
FireRed-OpenStoryline 的诞生,正是为解决这一核心矛盾:由 AI 理解自然语言指令,编排整个视频创作流水线。
FireRed-OpenStoryline 采用 MCP(Model Context Protocol)架构,LLM 作为中央调度器,通过标准化的工具协议调用各种专业剪辑节点。整个系统分为三层:
1. 接口层:提供 Web UI(FastAPI + uvicorn,7860端口)和 CLI 两种交互方式。Web界面供普通用户直接使用,CLI 供开发者自动化集成。
2. 核心引擎:基于 LangChain 构建 Agent 编排层,通过 MCP 协议连接多个专业节点(Node)。每个节点负责一个具体任务:LoadMediaNode 加载素材、SearchMediaNode 搜索网络资源、SplitShotsNode 镜头分割、UnderstandClipsNode 理解画面内容、GenerateScriptNode 生成文案……节点之间通过标准化接口通信,LLM 根据用户需求动态编排调用顺序。
3. 存储层:使用 FAISS 向量数据库做语义检索,支持 Style Skills(剪辑技能)的保存与复用。

图1:FireRed-OpenStoryline 系统架构(来源:项目官方文档)
整个流程是:用户用自然语言描述需求 → LLM 理解意图并规划剪辑方案 → 依次调用专业节点执行(搜索素材→理解画面→生成文案→推荐配乐→规划时间轴→渲染输出)→ 用户通过对话实时调整(删片段、换文案、调风格)→ 保存为可复用的 Skill。
不需要自己找素材。输入"科技感发布会场景",系统自动在线搜索并下载匹配的图片和视频片段;基于主题进行镜头分割与内容理解,剔除无关内容,保留可用片段。
结合画面理解与情绪识别,自动生成契合视频节奏的旁白文案。内置 Few-shot 仿写能力——你可以输入参考文本(如种草测评、碎碎念),定义文案的语感、节奏和句式,AI 精准复刻你的个人风格。
支持导入私有歌单,根据视频内容和情绪自动推荐背景音乐并智能卡点。配音风格可以自然语言描述("克制一点"、"偏情绪化"、"像纪录片旁白"),系统匹配合适的语音和字体,保证整体风格协调统一。
剪辑不是一次性工程。FireRed-OpenStoryline 支持全程自然语言调整:删减/替换/重组片段、修改字幕文案、调整文字颜色/字体/描边/位置——所有操作"即改即得",无需重新导出。
基于相邻片段的首尾画面与自然语言描述,自动生成过渡镜头。但项目方也坦诚提示:依赖第三方 AIGC 视频服务,成本较高,且生成结果有随机性,建议按需开启。
| 层次 | 技术选型 |
|---|---|
| Agent 框架 | LangChain + langchain_mcp_adapters |
| 多模态理解 | FunASR(语音识别)、librosa(音频分析)、transnetv2_pytorch(镜头检测) |
| 向量检索 | FAISS-CPU |
| 向量嵌入 | sentence-transformers |
| Web 接口 | FastAPI + uvicorn |
| 媒体处理 | FFmpeg + moviepy + av |
| 部署方式 | Docker(python:3.11-slim) |
值得注意:项目核心依赖了 LangChain(而非更轻量的 LlamaIndex 或直接调用),说明其 Agent 编排逻辑相对复杂,需要 LangChain 的链式组合能力。同时引入了 FunASR(阿里开源的语音识别)和 TransNet V2(镜头检测)两个专门的视频AI模型,而非单纯依赖LLM做所有判断。
项目提供了完整的 Dockerfile,基于 python:3.11-slim,包含了 FFmpeg、wget、git-lfs 等工具链。启动后自动运行 MCP Server(端口8001)和 FastAPI Web 服务(端口7860)。
优点:Docker 化部署相对完整,依赖隔离良好。
门槛:
FireRed-OpenStoryline 代表了一种趋势:将专业工具的使用门槛,从"操作技能"降低到"语言表达"。过去需要学几个月剪辑软件才能做的事,现在可以用自然语言描述需求,AI 完成执行。
从 GitHub 2877 星、登上 HelloGitHub 精选、小红书社群活跃等信号来看,这个方向确实戳中了内容创作者的痛点。随着多模态模型的进一步成熟,这类系统的能力边界还会持续扩展。
如果你是一个想快速出视频的内容创作者、或者想将视频自动化流水线集成到业务中的开发者,FireRed-OpenStoryline 值得关注。星标超过2800的社区认可,说明它的方向得到了验证。