Generative-Media-Skills
让 Claude Code 等 AI 智能体通过 Bash 命令直接调用 Flux、Kling、Suno 等 100+ 顶级模型生成图像、视频和音乐的开源技能框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让 Claude Code 等 AI 智能体通过 Bash 命令直接调用 Flux、Kling、Suno 等 100+ 顶级模型生成图像、视频和音乐的开源技能框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

想象这样一个场景: 深夜,你正在用 Claude Code 开发一个营销自动化脚本,需要立刻生成一组品牌海报、两条短视频背景音乐,以及一段 AI 数字人讲解视频。按照传统工作流,你需要打开 Midjourney、Runway、Suno 三个平台,分别注册账号、调试 Prompt、等待渲染——整个过程耗时数小时。
而有了 Generative Media Skills,你只需在终端敲下几条 bash 命令,60 秒内所有素材自动生成并保存到本地目录。这就是这个项目的核心价值:让 AI 智能体(Claude Code、Cursor、 Gemini CLI)像人一样调用业界最顶尖的多模态生成模型,而无需人工在各个平台间跳转。
Generative Media Skills 由独立开发者 SamurAIGPT 创建和维护,底层对接的是 MuAPI(muapi.ai)——一个聚合了全球 100+ 顶级 AI 生成模型的 serverless API 平台。MuAPI 将 Midjourney v7、Flux、Kling 3.0、Veo3、Suno V5 等商业级模型统一封装为一套 RESTful 接口,用户只需一个 API Key 即可调用所有模型,而 SamurAIGPT 则在这个商业 API 之上构建了一层开源的「技能系统」,让 AI 智能体能够以结构化的方式调用这些能力。
项目目前积累超过 3371 颗 GitHub Stars,19 个分类 Topic,涵盖图像生成、视频创作、音乐制作、图像编辑等全模态场景,在 GitHub Trending 上多次上榜。
项目的代码组织采用清晰的双层架构:
Core 层(平台能力脚本) 位于 core/ 目录下,包含 5 个核心 bash 脚本,分别对应图像、视频、音乐、编辑、平台设置五大能力域。每个脚本都是独立的 CLI 工具,支持丰富的命令行参数(如分辨率、时长、模型选择、同步/异步模式等),通过读取同目录下的 schema_data.json 动态获取可用模型列表和 API 端点——这是一种「数据驱动脚本」的设计思路,脚本本身保持固定,而模型更新时只需维护 JSON Schema 文件即可,无需修改代码逻辑。
Library 层(垂直场景技能) 位于 library/ 目录下,包含大量即用型技能脚本,按场景分为:
visual/:视觉资产生成(品牌海报、产品图、博客头图、品牌色板等 30+ 场景)motion/:动态内容创作(3D 动画、AI 打斗场景、动物视频、卡通舞蹈等)social/:社交媒体内容(Instagram 帖子、YouTube Shorts、RedNote 封面等)edit/:图像编辑(AI 抠图等)workflow/:多步骤自动化流水线(自然语言 → 节点图 → 自动执行)这种分层设计让用户既可以直接调用 Core 层的基础能力自行组合,也可以在 Library 层找到针对特定场景预封装好的解决方案。
虽然项目语言标注为「Shell」,但它实际上是一套 Bash + Python (muapi CLI) + JSON Schema 的混合架构。核心脚本以 Bash 编写,负责参数解析、API 调用、结果轮询等逻辑;Python 的 muapi CLI 则提供认证管理和高级封装。
支持的 AI 模型阵容堪称豪华:
| 模态 | 代表模型 | 说明 |
|---|---|---|
| 图像生成 | Flux (dev/schnell/ultra)、Midjourney v7、Stable Diffusion | 覆盖写实、插画、设计等多种风格 |
| 视频生成 | Kling 3.0 (标准/专业)、Veo3、Runway Gen3 | 支持图生视频和文生视频 |
| 音乐创作 | Suno V5 | AI 作曲,支持歌词生成和风格控制 |
| 图像编辑 | HivisionIDPhotos(证件照)、AI 抠图 | 垂直场景专用 |
| 音频处理 | Wav2Lip(唇形同步) | 数字人视频制作 |
所有模型通过 schema_data.json 统一管理,该文件定义了每个技能的输入 Schema、支持的模型列表和参数范围,AI 智能体可以直接读取这个文件了解如何调用每个工具。
项目的部署难度极低,官方甚至没有提供 Dockerfile——因为根本不需要。只需要:
git clone https://github.com/SamurAIGPT/Generative-Media-Skills.git
cd Generative-Media-Skills
pip install muapi-cli
muapi auth configure --api-key <YOUR_KEY>
然后就可以直接运行:
# 生成一张 Flux 风格的赛博朋克城市图像
./core/media/generate-image.sh --prompt "cyberpunk city at night, neon lights, rain" --model flux-dev
# 用 Suno 生成一段 lo-fi 背景音乐
./core/media/create-music.sh --style "lo-fi" --prompt "chill beats"
# Kling 3.0 文字转视频
./core/media/generate-video.sh --prompt "a robot walking through a futuristic city" --model kling-pro
整个过程不超过 5 分钟,不需要 GPU,不需要 Docker,不需要任何云配置。唯一的前提条件是一个有效的 MuAPI API Key(官网 muapi.ai 注册即可获取,有免费额度)。
项目并非没有槽点。首先,底层依赖商业 API 是最大的风险点——用户必须注册 muapi.ai 并充值额度,模型调用按量计费,项目本身没有提供任何免费模型或本地部署选项。一旦 MuAPI 平台涨价或服务中断,整个工具链立即失效。
其次,没有 Docker 化意味着在 CI/CD 环境中复用困难,团队协作时每个人的本地环境一致性也难以保证。对于追求可复现性的企业用户来说,这是明显的短板。
第三,从代码质量角度看,核心脚本虽然功能完善,但主要是「脚本堆叠」而非「工程化」——没有单元测试、没有类型检查、参数校验依靠 shell 的 set -e 和简单的条件判断,大规模使用时存在一定隐患。
Generative Media Skills 最有价值的地方,不在于它集成了多少模型,而在于它提出了一种 AI Agent 工具调用标准化 的思路——通过 JSON Schema 定义每个工具的能力边界和调用方式,AI 智能体可以像查字典一样理解如何使用这些工具,而不是靠 Prompt Engineering 去「猜测」正确的命令格式。
这种 Schema-Driven 的工具注册机制,与 MCP(Model Context Protocol)有异曲同工之处。事实上,项目本身就支持 Claude Code 和 Cursor 的集成(通过 MCP),说明作者在设计时已经考虑到了与主流 AI 编程工具的兼容性。
从行业趋势看,随着 AI Agent 逐步从「聊天机器人」进化为「自动化执行者」,对结构化工具接口的需求会越来越强烈。Generative Media Skills 作为这个方向的一个开源实践案例,值得关注。
本报告基于 GitHub 仓库 2026 年 6 月最新代码分析生成。