GPT-Image2-Skill
GPT Image 2 精选提示词库 + Agent 技能包 + CLI 工具,让 AI 编程工具也能生成高质量图像
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
GPT Image 2 精选提示词库 + Agent 技能包 + CLI 工具,让 AI 编程工具也能生成高质量图像
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2026年4月,一位叫 wuyoscar 的独立开发者将一个 GPT Image 2 prompt 合集上传至 GitHub。他大概没想到,三个月后,这个项目 star 数突破了 3,900,稳居 AI Agent Skills 热门榜单前列。更让人意外的是,它既不是模型权重,也不是训练框架——它本质上只是一个 prompt 文本库 + 一套 CLI 工具。
这背后折射出一个正在爆发的新需求:**当 AI 编程工具(Claude Code、OpenAI Codex 等)开始原生支持图像生成,如何让它们生成「好看」的图?**GPT-Image2-Skill 正是这个问题的最佳答案之一。
2025年底,OpenAI 发布 GPT Image 2,通过 GPT-4o 的多模态能力实现了前所未有的图像生成与编辑效果。相比 Midjourney、Stable Diffusion 等传统文生图工具,GPT Image 2 的独特优势在于:
然而,Prompt Engineering 在文生图领域早已是核心技术,但在 GPT Image 2 的生态中,高质量的 prompt 库几乎空白。GPT-Image2-Skill 填补了这个空白——它将来自社区、设计师、研究者的优质 prompt 分门别类,形成了一套完整的参考体系。
GPT-Image2-Skill 并不是简单地把 prompt 收集在一起,它构建了一套完整的三层工具体系:
项目收录了 30+ 分类目录,涵盖几乎所有主流图像生成场景:
| 类别 | 说明 | 示例 |
|---|---|---|
| UI/UX Mockups | 移动端、Web界面设计稿生成 | "App store card with gradient" |
| Research Paper Figures | 学术论文图表生成 | ICLR 风格方法图、流程图 |
| Typography & Posters | 海报、字体设计 | 西游记剪影、史诗感海报 |
| Gaming | 游戏UI、HUD、像素画 | 日式 RPG 城镇、赛博朋克 HUD |
| Anime & Manga | 动漫风格创作 | 分镜、角色立绘 |
| Technical Illustration | 技术图解 | 医学解剖图、机械拆解图 |
| Data Visualization | 数据图表 | 3D 散点图、信息图卡片 |
| Photography | 摄影风格 | 电影感构图棚拍 |
每个分类下都有 5-20 个经过验证的 prompt,包含完整的构图描述、风格标签和参数建议。Gallery 不仅展示效果,还解释了 为什么这个 prompt 有效,帮助用户举一反三。
这是项目最有想象力的部分。GPT-Image2-Skill 提供了一套标准的 Agent Skill 格式,可被 Claude Code、OpenClaw、Hermes Agent 等主流 AI Agent 运行时直接调用。
技能包的工作流程非常清晰:
references/gallery-gaming.md 中找到最匹配的 prompt 示例references/craft.md 获取构图技巧gpt-image CLI 或 scripts/generate.py 实际生成图像这个流程的优势在于:Agent 不再需要从零写 prompt,而是站在社区的肩膀上。Gallery 中的每一个 prompt 都是经过实际验证的,Agent 直接参考成功率大幅提升。
独立的 Python CLI 工具,支持 OpenAI GPT Image 2 的全部能力:
# 基础文生图
gpt-image -p "a cyberpunk city at night, neon rain"
# 带参考图的风格迁移(编辑端点)
gpt-image -p "transform to anime style" -i photo.jpg
# 局部重绘(蒙版编辑)
gpt-image -p "replace sky with aurora" -i photo.jpg -m sky_mask.png
# 多参考图组合(服装迁移、产品+品牌)
gpt-image -p "77 × KFC collab poster" -i cat.png -i kfc_logo.png
# 高分辨率 + 高质量
gpt-image -p "Chinese tea poster" -f poster.png --size 2k --quality high
CLI 提供了极其丰富的参数:模型选择、尺寸预设(1k/2k/4k/portrait/landscape)、质量档位、背景控制、审核强度、输出格式(JPEG/WebP/PNG)、压缩比……几乎覆盖了 OpenAI 官方文档中的所有能力。
从代码结构看,GPT-Image2-Skill 保持了令人印象深刻的克制:
src/gpt_image_cli/
__init__.py # 355 bytes
cli.py # 10.4 KB — 全部逻辑
skills/gpt-image/
SKILL.md # Agent Runbook(6.7 KB)
agents/ # Agent 配置文件(OpenClaw等)
references/ # 30+ 个 Gallery MD 文件
scripts/
generate.py # Agent 调用入口
核心依赖只有两个:openai>=1.55 和 python-dotenv>=1.0,没有引入任何图像处理或重型依赖。这种极简设计让工具可以轻松嵌入任何 Python 环境或 Agent 运行时。
项目使用 uv 作为包管理首选,支持:
uv run gpt-image ... — 即时运行,无需安装pip install . — 传统 pip 安装uvx --from git+https://... — 远程临时运行README 文件超过 200KB,中英文双语,包含完整的 OpenAI 官方 Cookbook 镜像文档,这在开源项目中极为罕见。
| 使用方式 | 难度 | 适合人群 |
|---|---|---|
| 直接复制 Gallery 中的 prompt 到 ChatGPT | ★☆☆☆☆ | 完全不会编程的普通用户 |
| 安装 CLI 后用命令行生成 | ★★☆☆☆ | 设计师、研究者 |
| 通过 Claude Code 等 Agent 调用 | ★★★☆☆ | 开发者、AI 爱好者 |
| 贡献新的 prompt 类别/PR | ★★★★☆ | 高级用户、设计师社区 |
对于 AI 爱好者而言,最简单的用法是直接去 README 中复制 prompt,粘贴到支持 GPT Image 2 的产品(如 ChatGPT)中使用。对于开发者而言,通过 Agent 调用可以实现完全自动化的图像生成流水线。
需要坦诚地说,GPT-Image2-Skill 不支持 Docker 部署,也不具备 Web UI。这意味着它不太适合以下场景:
此外,项目依赖 OpenAI API,实际使用会产生费用。GPT Image 2 的 high 质量档位单张图像成本较高,低质量档位虽然便宜但效果有限。用户需要在成本和质量之间找到平衡。
GPT-Image2-Skill 的成功揭示了一个重要趋势:Agent 时代的 Prompt 库正在从「人读」进化到「机器读」。
传统 Prompt 库的目标用户是人,目的是让人复制粘贴使用。但 GPT-Image2-Skill 的 Skill 格式直接面向 Agent 运行时,每个 prompt 都有结构化的元数据,Agent 可以自动检索、组合、优化。这意味着 Prompt Engineering 的价值正在从「个人技巧」升级为「基础设施」。
此外,项目在 oosmetrics 的多个榜单(Agents、LLMs、CLI)中均排名第一,证明了高质量工具型项目在 AI 开源生态中的强劲吸引力。