ppt-generation

AI逐页生成定制图像,8种风格保视觉一致,合成PPTX。

Stars82.2k
Forks11.3k
主语言skill
分类SKILLS
作者bytedance
LicenseMIT

预览

详细介绍

PPT Generation Skill 是由字节跳动(ByteDance)官方发起并维护的开源 Deer Flow 技能,核心定位是“用 AI 生成每一张幻灯片图像,将演示文稿创作从模板填充升级为视觉叙事引擎”——它不满足于做一份简单的 PPT 模板生成器或零散的排版建议,而是将演讲规划、多风格视觉设计、AI 图像生成、顺序一致性保持、PPTX 自动合成等5大核心能力整合于一套即插即用的技能体系中,全部配有SKILL.md一键触发、8种专业视觉风格体系(Glassmorphism/Dark Premium/Gradient Modern/Neo-Brutalist/3D Isometric/Editorial/Minimal Swiss/Keynote)、完整的 JSON 规划工作流和 Python 合成脚本。市面大多 AI 演示工具要么是泛泛的“生成一份漂亮的 PPT”式提示(缺乏视觉方法论),要么只能做简单的模板填充(千篇一律)——但很少有项目能将“每一页都是定制生成的 AI 图像”与“严格的视觉一致性控制”同时做到,PPT Generation Skill 解决的正是这个问题。

一、PPT Generation Skill 是什么

PPT Generation Skill 采用“规划 JSON + 顺序生成图像 + 合成 PPTX”三位一体的工作流,通过 GitHub 在字节跳动 Deer Flow 官方技能仓库中免费开源发布。技能由字节跳动官方发起并持续维护,最后更新于 2026 年 3 月 16 日。技能定位为“当用户请求生成、创建或制作演示文稿(PPT/PPTX)时使用此技能”——通过为每一张幻灯片生成 AI 图像,并将它们合成为 PowerPoint 文件,创造出视觉丰富的演示文稿。

PPT Generation Skill 的运作机制与市面常见的“模板填充工具”或“通用设计提示”有本质区别。它不是一句“帮我生成一份专业的 PPT”的泛泛指令,而是一套视觉优先、工程化、一致性驱动的演示文稿创作框架。技能提供了三步结构化工作流第一步,理解用户需求并创建包含风格选择、色彩指导、每张幻灯片视觉描述的 JSON 规划文件;第二步,使用图像生成技能严格按顺序逐张生成幻灯片图像——第一张建立视觉语言,后续每一张都强制引用前一张作为参考图像以保持风格一致性;第三步,将所有生成的图像合成为最终的 PPTX 文件。技能内建了8种专业视觉风格体系——从玻璃态(Glassmorphism)的苹果 Vision Pro 美学,到深色奢华(Dark Premium)的奢侈品品牌调性,从新粗野主义(Neo-Brutalist)的反叛 DIY 美学,到苹果主题演讲(Keynote)的戏剧化电影感——每一种都有完整的色彩、字体、图像、布局、效果和视觉语言指导。

二、PPT Generation Skill 能做什么

PPT Generation Skill 的核心能力可以精炼地概括为:规、绘、序、合、优,围绕这五大维度提供了从创意到交付的完整路径,覆盖演示文稿创作的全方位需求,具体包括:

演讲规划与视觉设计(规) ——不是“随便排几页”,而是“先设计再生成”。技能要求用户在生成任何图像之前,先创建一个结构化的 JSON 规划文件,包含标题、风格、风格指导(色彩、字体、图像、布局)、宽高比和每张幻灯片的详细视觉描述。风格指导精确到十六进制色码(如 #667eea)和具体效果参数(如“backdrop blur 20px”),确保 AI 生成的图像有明确的设计方向。

AI 图像驱动的幻灯片生成(绘) ——每一页都是一幅定制画作。技能不依赖于任何模板,而是通过调用图像生成技能,为每一张幻灯片从零生成独特的 AI 图像。每张幻灯片都包含详细的视觉描述——从背景渐变、玻璃面板的模糊强度、3D 元素的摆放位置,到字体大小和阴影参数。技能强调提示词工程的专业性:使用英文提示词、包含精确的十六进制色码、指定字体粗细和层级、引用真实设计系统。

顺序生成与视觉一致性(序) ——一套视觉语言贯穿始终。技能最核心的机制是强制顺序生成:幻灯片必须严格逐张、按顺序生成,绝不能并行或批量处理,因为每一张都依赖前一张的输出作为参考图像。第一张幻灯片建立整个演示文稿的视觉语言;后续每一张的提示词都必须明确声明“延续参考图像的精确视觉风格”,并包含 consistency_note 字段强制强调风格匹配。如果某张幻灯片看起来不一致,需要用更强的参考强调重新生成。

自动合成 PPTX(合) ——图像到演示文稿的一键转换。所有幻灯片图像生成完毕后,通过 Python 合成脚本自动将它们合成为标准的 .pptx 文件。脚本接收规划 JSON 和按顺序排列的图像路径,输出可直接在 PowerPoint 中打开和编辑的演示文稿。

专业设计原则与避坑指南(优) ——让每一页都经得起推敲。技能内置了完整的设计原则:拥抱负空间(40-60% 的空白空间营造高级感)、每页限制元素数量(一个焦点、一条信息)、通过分层创造深度(阴影、透明度、Z 轴深度)、排版层级(72pt+ 大标题、18-24pt 舒适正文)、色彩克制(一个主调色板、1-2 个强调色)。同时列出了6条常见错误:使用“专业的幻灯片”这类模糊提示、每页塞太多元素、幻灯片之间颜色不一致、跳过参考图像参数、在同一演示文稿中使用不同设计风格、并行生成幻灯片。

三、PPT Generation Skill 适合谁用

PPT Generation Skill 的内容设计使其适配各类希望通过 AI 辅助创建高质量、视觉独特的演示文稿的创作者与专业人士,核心聚焦那些“AI 生成的 PPT 总是千篇一律、缺乏视觉灵魂”,希望从“模板填充”升级为“定制化视觉叙事”的人群,主要涵盖以下几类:

产品经理与创业者——需要制作融资 pitch deck、产品发布会 PPT、季度汇报,希望在视觉上脱颖而出而非淹没在模板海洋中。技能的 8 种专业风格体系(从 Glassmorphism 的科技感到 Dark Premium 的奢华感)帮助非设计师也能做出有专业调性的视觉呈现。

技术布道者与工程师——需要将技术方案、架构设计转化为有冲击力的演示文稿。技能的 JSON 规划工作流和顺序生成机制,让“不会设计”的工程师也能通过精确的视觉描述控制每一页的呈现效果。

设计师与创意工作者——希望将 AI 作为设计协作者而非替代者,在保持设计主导权的同时加速创作过程。技能的设计方法论(从风格选择到色彩指导到效果参数)与专业设计师的工作流程高度契合。

教育工作者与培训师——需要制作结构清晰、视觉吸引人的教学课件或培训材料。技能的规划优先工作流帮助教育者在生成任何视觉之前先理清内容结构。

AI 辅助创作的学习者与实验者——希望探索 AI 在演示文稿创作领域的边界。技能作为字节跳动官方出品的演示文稿方法论,代表了当前 AI 辅助演示创作领域最高水准的工程化思考。

四、PPT Generation Skill 的应用场景是什么

基于其内容设计与定位,PPT Generation Skill 的应用场景主要围绕产品发布演示、融资路演、技术方案汇报和创意提案,覆盖从个人创作到企业级交付的多个场景,具体包括:

产品发布与品牌 launch 场景——团队需要为新产品打造一场视觉惊艳的发布会演示。技能推荐使用 glassmorphism 风格,其愿景 OS 美学、磨砂玻璃面板、活力渐变背景和 3D 漂浮元素,为科技产品发布提供了 Apple 级别的视觉质感。

融资路演与创业 pitch 场景——创业团队需要在几分钟内打动投资人。技能推荐 gradient-modernminimal-swiss 风格——前者的大胆网格渐变和动态不对称构图传递“创新与活力”,后者的瑞士风格网格和极致留白传递“清晰与专业”。

技术方案与架构设计汇报场景——工程师需要将复杂的技术方案转化为清晰、有说服力的演示文稿。技能的 JSON 规划工作流让内容结构先于视觉呈现,确保逻辑清晰;3d-isometric 风格的等轴测插画适合技术架构的可视化呈现。

创意提案与品牌设计场景——创意团队需要展示打破常规的设计方案。技能的 neo-brutalist 风格——大胆的撞色、粗边框、硬阴影、反叛的 DIY 美学——适合需要传递“与众不同”的创意提案。

高管汇报与战略宣讲场景——需要向高层或客户展示专业、沉稳的演示。技能推荐 dark-premiumkeynote 风格——深黑背景、发光强调色、电影级摄影传递“奢华与自信”。

五、PPT Generation Skill 为什么值得关注

PPT Generation Skill 之所以值得关注,核心在于它将“演示文稿创作从依赖模板和直觉升级为视觉优先、AI 驱动、一致性可控的工程化流程”,并具备“字节跳动官方背书、8 种专业风格体系、顺序一致性保障、开源自由”的独特价值,具体体现在以下几点:

从“模板填充”到“每一页都是定制图像”的质变。大多数 AI PPT 工具做的事是“选择一个模板,填入内容”。PPT Generation Skill 做的事是为每一页从零生成独特的 AI 图像——每一张幻灯片都是一幅定制画作,而非模板的排列组合。这种“图像原生”而非“模板驱动”的设计,让每一份演示文稿都拥有不可复制的视觉身份。

字节跳动官方的工程方法论背书。PPT Generation Skill 不是第三方开发者的个人作品,而是字节跳动 Deer Flow 官方技能库的核心成员。这种官方身份意味着技能的设计原则、工作流程和工程实践经过了大型科技公司的生产验证——不是“一个开发者觉得有用的提示词”,而是“顶级互联网公司对 AI 辅助演示创作的系统性工程化思考”。

8 种专业风格的“设计系统即代码”。技能内建了8 种完整的视觉风格体系——从 Glassmorphism 到 Dark Premium,从 Neo-Brutalist 到 Keynote——每一种都不是一句“好看”的模糊描述,而是精确到十六进制色码、字体粗细、布局原则、效果参数和视觉语言参考的完整设计系统。这种“设计系统即代码”的方法论,让“不会设计”的开发者也能做出有专业深度的视觉决策。

“顺序生成 + 参考链”的一致性保障机制。大多数 AI 图像生成工具的问题是“每次生成都不一样”——同一批提示词可能产出视觉上毫无关联的图像。PPT Generation Skill 通过强制顺序生成和参考图像链解决了这个问题:第一张幻灯片建立视觉语言,后续每一张都必须引用前一张作为参考图像,提示词中强制包含“延续参考图像的精确视觉风格”。这种“链式参考”机制,让 10 张幻灯片看起来像出自同一设计师之手,而非 10 个不同 AI 的随机输出。

“规划优先于生成”的结构化工作流。大多数 AI 创作工具鼓励“边想边做”——用户输入一句提示词就生成内容,缺乏前期规划。PPT Generation Skill 强制要求在生成任何图像之前先完成 JSON 规划——确定风格、色彩、字体、每张幻灯片的视觉描述。这种“先规划后生成”的工作流,让创作从“碰运气”升级为“有意图的设计”。

开源 + 可组合的技能生态。PPT Generation Skill 不是孤立的工具,而是字节跳动 Deer Flow 技能生态的一部分——它显式依赖 image-generation 技能,通过模块化组合实现复杂功能。用户可以在 Deer Flow 框架中自由组合、修改和扩展这个技能,而非被锁定在某个商业产品的黑盒中。

现实挑战与生态成熟度。PPT Generation Skill 并非没有短板。首先,技能的核心能力高度依赖于底层 image-generation 技能的质量——如果图像生成模型本身的能力不足,输出的幻灯片质量会直接受限。其次,顺序生成机制虽然保证了视觉一致性,但也意味着生成时间随幻灯片数量线性增长——10 张幻灯片需要 10 次顺序的图像生成调用,无法通过并行加速。再次,技能目前仅以英文 SKILL.md 形式存在,对非英语用户有一定语言门槛。最后,技能依赖于 Deer Flow 框架的特定目录结构(/mnt/user-data/workspace//mnt/skills/public/image-generation/ 等),脱离 Deer Flow 环境使用需要进行路径适配。