Seedance2-skill
给 AI Agent 装上视频创意导演的大脑,让 Seedance 视频生成拥有审美判断力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
给 AI Agent 装上视频创意导演的大脑,让 Seedance 视频生成拥有审美判断力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:用户随手丢给 AI Agent 一张咖啡馆的照片,配上"这条视频要有感觉"这样模糊的需求。传统方案下,AI 会机械地生成"咖啡杯在桌上,阳光洒落"这样的干巴巴提示词。但如果你给 AI 装上了 Seedance2-Skill,它会这样做:先分析图片的构图与情绪,然后从"治愈系广告""悬疑短剧""意识流短片"三个方向中,挑最有意思的那个展开——比如让咖啡表面的纹路缓缓变成一张地图,镜头推入进入另一个世界。这就是这个技能包要解决的问题:让 AI 不只是生成视频,而是创作有记忆点的视频。
Seedance2-Skill 是由国内开发者 zhanghaonan777 主导维护的 AI Agent 技能包,定位是字节跳动 Seedance 视频生成模型的智能操控层。它的核心价值不是提供一堆提示词模板,而是把视频创意的判断逻辑注入到 AI Agent 的决策流程中,让 AI 在面对模糊需求时能做出有审美含量的创意决策。
要理解 Seedance2-Skill,先要了解它背后的 Seedance。Seedance(中文名"即梦")是字节跳动旗下火山引擎推出的 AI 视频生成模型家族,最早以 Seedance 1.0 起步,在 2024-2025 年间逐步演进到 1.5 系列和 2.0 版本。2.0 是当前的旗舰版本,支持文本、图片、视频参考、音频卡点四种输入模态,输出 4-15 秒 2K 视频,自带音效生成。
从社区反响来看,Seedance 在国内 AI 视频赛道中已经形成了一定的用户基础。与 Runway Pika 的国际化路线不同,Seedance 的优势在于对中文语义的理解深度和对国内审美偏好的适配。它的 API 通过火山引擎 Ark 平台提供,有稳定的中文文档和计费体系。社区中围绕 Seedance 形成了大量提示词分享和技能包创作生态,Seedance2-Skill 就是其中的代表作之一——不同于简单的模板集合,它引入了一套创意评估机制,让 AI Agent 在生成视频提示词时有了审美自觉。
这个技能包的核心能力可以拆解为以下几个层次:
第一层:创意决策框架。 当用户给出素材后,Agent 不是按照固定流程流水线处理,而是自主判断"先看图还是先读文案""要不要搜流行 prompt""这张图的构图适不适合做运镜""prompt 过不过得了创意关"。SKILL.md 中明确提出的四条创意红线——记忆点、意外感、情绪弧线、叙事变化——实际上是在给 AI 植入一套审美评估体系,这比大多数"提示词库"类项目高出一个维度。
第二层:镜头语言词库。 reference.md 中整理了 12 大类、100+ 词汇的镜头语言词库,涵盖景别、运镜、角度、节奏、焦点、转场、构图、叙事、镜头类型、镜头效果、声音设计等维度。还包括导演风格速查表(新海诚、王家卫、诺兰、扎克·施奈德等十位名导风格关键词)和动漫作画术语表。这套词库的价值在于,AI 生成的提示词不是天马行空,而是从专业影像语言库中选词,保证了运镜描述的专业性和可复现性。
第三层:全模态 API CLI。 scripts/seedance.py 封装了火山引擎 Ark API 的全部 Seedance 模型调用能力,支持纯文本生成视频、图片生成视频(含首尾帧、多参考图)、视频参考(运动复刻)、音频卡点、Draft 样片 / Flex 离线推理、任务查询 / 轮询等待 / 结果下载等完整流程。一行命令即可完成从 prompt 到视频文件的完整链路。
第四层:多 Agent 平台兼容。 SKILL.md 和 SKILL_EN.md 分别提供中英文入口,可被 OpenClaw、Cursor 等主流 Agent 平台直接加载,触发词涵盖"即梦""Seedance""视频生成""运镜""短剧""广告视频"等高频场景,覆盖用户主动发起的各类创作需求。
部署 Seedance2-Skill 的门槛极低,只需三步:
第一步,克隆仓库到本地或 Agent 技能目录:
git clone https://github.com/zhanghaonan777/Seedance2-skill.git
第二步,在火山引擎控制台获取 ARK API Key 并配置环境变量:
export ARK_API_KEY="your-v...-key"
第三步,运行 CLI 生成视频:
# 纯文本生成(默认 Seedance 2.0)
python3 scripts/seedance.py create --prompt "镜头跟随黑衣男子快速逃亡,后面一群人在追" --ratio 16:9 --duration 5 --wait --download ~/Desktop
# 图片生成视频
python3 scripts/seedance.py create --prompt "画面中的人物缓缓转身" --image photo.jpg --ratio adaptive --wait --download ~/Desktop
# 视频参考 + 运动复刻
python3 scripts/seedance.py create --prompt "参考视频的运镜和节奏" --video reference.mp4 --wait --download ~/Desktop
部署前提条件仅为 Python 3.8+ 和 Git,无 GPU 要求(视频生成在云端 API 侧完成),磁盘占用约 50MB。对于 AI Agent 平台使用者,只需将 SKILL.md 放入平台指定的技能目录即可自动加载,无需额外配置。
从代码结构来看,Seedance2-Skill 采用的是技能层 + API 网关的极简架构。SKILL.md 是给 AI Agent 阅读的指令文档,包含角色定义("你是视频创意总监")、决策框架、质量红线;reference.md 是辅助知识库,供 Agent 在生成提示词时查阅词条;scripts/seedance.py 是纯 Python 的 API 客户端,使用标准库 urllib 完成所有 HTTP 请求,无第三方依赖。
这种设计的优势在于:技能与执行分离。SKILL.md 定义的是"怎么想",seedance.py 负责的是"怎么做"。AI Agent 读取 SKILL.md 后拥有了创意决策能力,遇到需要实际生成视频的场景时才调用 seedance.py 的 CLI。整个项目的代码量极轻(seedance.py 仅约 400 行),没有复杂的依赖树,也没有容器化配置,但功能完整度和创意深度都相当可观。
这个技能包也有它天然的局限。最主要的一点是强依赖火山引擎 Ark API。这意味着用户必须拥有有效的 ARK_API_KEY,且 API 调用会产生费用。对于追求完全本地化部署的用户来说,这是一个无法绕过的限制。此外,Seedance 模型本身的能力上限决定了生成视频的质量天花板——技能包能优化 prompt,但无法突破模型本身的物理限制(比如人物手部畸变、物理规律错误等问题)。
另一个潜在风险是审美判断的主观性。SKILL.md 中的创意四维标准(记忆点、意外感、情绪弧线、叙事变化)虽然框架清晰,但"什么是好的创意"本身是一个高度主观的问题。不同文化背景、不同使用场景下的用户对"好创意"的标准差异很大,AI Agent 的创意判断是否总是符合目标用户的审美偏好,还需要实际使用中不断校准。
Seedance2-Skill 最有价值的地方,不是提供了多少条提示词模板,而是它把视频创意的判断过程显式化了。传统意义上的"创意"往往被认为是人类创作者的专属能力,是无法被结构化的黑箱。但这个技能包做了一个有意义的尝试:用四条清晰的评估维度(记忆点、意外感、情绪弧线、叙事变化)+ 100+ 专业化词库 + 自主决策流程,把"视频创意"变成了一套 Agent 可以执行、可复现、有标准的工作流。
从更宏观的视角看,这个项目代表了一个趋势:AI 视频生成的竞争正在从"模型能力"向"工作流优化"迁移。当底层模型的生成质量趋于同质化后,谁能提供更好的创意框架、更智能的 Agent 集成方案,谁就能在用户侧建立差异化的使用体验。Seedance2-Skill 正是这个趋势的一个缩影——它不是去竞争"更好的视频模型",而是在已有的强大模型之上,构建更聪明的内容创作层。
本报告由 PIFS 平台自动分析生成,分析对象:zhanghaonan777/Seedance2-skill (89★),GitHub: https://github.com/zhanghaonan777/Seedance2-skill,MIT License。