PixVerse-MCP
PixVerseAI/PixVerse-MCP加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
凌晨两点,创作者小王正在为产品宣传片寻找合适的素材。他需要一段「城市霓虹雨中奔跑」的视频片段。打开 PixVerse Web 端生成了一段,回到 Claude 窗口继续写文案,又需要一张配图——于是又切回浏览器,来回切换了七八次。当他终于拼凑完整套素材,文思已经断了。
这个场景折射出一个根本矛盾:AI 工具越来越强大,但工具之间的割裂感也在加剧。每个平台都要单独打开、单独操作、单独学习 API——对于需要多模态创作的团队来说,切换成本极高。
PixVerse MCP 的出现,正是为了解决这个问题。它将 PixVerse 的视频生成能力,以标准化协议(MCP)的形式,直接嵌入到 AI 助手的工作流中。
PixVerse 是一个 AI 视频生成平台,支持从文本、图片甚至多主体融合生成视频。该平台在 2024-2025 年间快速迭代,从 v1 一路演进到 v5(截至当前代码中支持的版本),涵盖文字生视频、图片生视频、视频延长、场景过渡、唇形同步、音效生成等完整视频创作链条。
Model Context Protocol(MCP) 是由 Anthropic 在 2024 年提出的开放协议,旨在让 AI 模型能够以标准化的方式调用外部工具和数据源。简单类比:如果说 AI 模型是大脑,MCP 就是它的「手」——通过这套协议,AI 可以直接操控各种外部工具,而不需要为每个工具单独写适配代码。
PixVerseAI 团队在 2024 年中发布了 PixVerse MCP 项目(当前版本 0.2.2),将 PixVerse 的视频生成 API 封装为 MCP Server,使得用户可以在 Claude Desktop、Cursor 等支持 MCP 的 AI 助手中,直接用自然语言驱动视频创作——写一段描述,Claude 帮你生成视频,素材直接在对话中可用,无需切换应用。
从代码结构看,PixVerse MCP 采用了清晰的分层架构:
src/
├── client/ # API 客户端层(httpx + tenacity 重试)
├── models/ # Pydantic 模型(请求/响应/枚举类型)
│ ├── common.py # 枚举定义(ModelVersion、AspectRatio、VideoQuality 等)
│ ├── requests.py # 请求体模型
│ └── responses.py # 响应体模型
├── server.py # 核心 MCP Server(stdio 模式)
├── sse_server.py # SSE 扩展(FastAPI + sse-starlette)
├── config.py # 配置管理(Pydantic Settings)
├── exceptions.py # 自定义异常体系
└── utils/ # 辅助函数(验证、日志追踪)
核心依赖链:
mcp[cli]>=1.6.0:MCP 协议 SDK,处理工具注册、请求路由httpx:异步 HTTP 客户端,与 PixVerse 后端通信pydantic>=2.0:数据验证,所有 API 请求/响应均有 Schema 约束tenacity:自动重试机制,保证 API 调用的稳定性loguru:结构化日志,便于调试 MCP 通信问题fastapi + sse-starlette:SSE 模式支持(通过 HTTP 长连接推送事件)支持的视频生成能力(按 model 版本分层):
| 功能 | 支持版本 | 说明 |
|---|---|---|
| 文本生视频 | v1 ~ v5 | 核心能力 |
| 图片生视频 | v2 ~ v5 | 静态图片动画化 |
| 视频延长 | v3 ~ v5 | 延续已有视频 |
| 场景过渡 | v3.5 ~ v5 | 两张图片间的平滑变形 |
| 唇形同步 | v4 ~ v5 | TTS 或自定义音频驱动 |
| 音效生成 | v4 ~ v5 | 基于视频内容生成配音 |
| 多主体融合 | v4.5 ~ v5 | 多图合成同一场景 |
参数控制粒度:支持画质(360p~1080p)、时长(5s/8s)、宽高比(16:9 到 9:16)、运动模式(normal/fast)、负面提示词等,接近专业视频生成工具的控制深度。
配置流程(以 Claude Desktop 为例):
claude_desktop_config.json 中添加 MCP Server 配置:{
"mcpServers": {
"PixVerse": {
"command": "uvx",
"args": ["pixverse-mcp"],
"env": {
"PIXVERSE_API_KEY": "your-key-here"
}
}
}
}
生成一段日出时分海浪轻拍沙滩的视频,16:9,540p,5秒
这张产品图,生成一段人物走过的动画,背景是城市夜景
整个过程无需离开对话窗口,素材可以直接引用、下载或继续加工。
上手门槛:需要一定 AI 工具使用经验,理解 API Key 概念,能配置 MCP 客户端。但一旦配置完成,日常使用门槛极低——自然语言即可驱动。
1. 付费墙是天然门槛:PixVerse MCP 依赖 PixVerse 平台的 API Credits,视频生成需要付费。这决定了它适合有商业化需求的团队,而非纯个人探索用户。与同类开源视频生成工具(如 CogVideoX、AnimateDiff)相比,便利性和生成质量换取的是自主可控性的让步。
2. 云端处理的数据隐私:所有视频生成均在 PixVerse 云端完成,意味着素材内容会上传到第三方服务器。对于有严格数据合规要求的行业(医疗、金融、政府),这可能是一个障碍。代码中设计了 API Key 环境变量隔离,但在服务端的数据处理流程并不透明。
3. MCP 生态的锁定风险:当前仅支持 Claude Desktop 和 Cursor(以及通用 MCP 客户端),其他 AI 助手(如 Copilot、其他开源模型)的兼容性依赖 MCP 生态的扩展。随着 MCP 协议本身的发展和竞争协议的出现,这种锁定效果会如何演变有待观察。
4. 功能与官方 API 的差距:README 明确说明 MCP Server 不支持某些原生功能(如 image-to-video 的更多参数、关键帧控制),需要直接调用 PixVerse API 才能使用完整能力。这意味着 MCP 是一种「便利层」,而非「全功能层」。
MCP 协议的核心价值在于将 AI 工具从「独立应用」转变为「可编程能力」。传统工作流中,视频生成是一个独立的环节;而通过 MCP,视频生成变成了 AI 对话流中的一个原子操作——可以被调度、被组合、被自动化。
PixVerse MCP 的出现印证了一个趋势:AI 工具的价值,正在从「单独使用很强」向「组合使用很灵活」演进。
对于 AI 爱好者,这意味着可以用自然语言编排复杂的多模态创作流程;对于开发者,这意味着可以基于 MCP 构建更复杂的 AI 应用,将视频生成能力像 API 模块一样嵌入任何系统。
从增长角度看,PixVerse AI 团队持续高频更新(v1 到 v2.0.0 的大版本更新涵盖了大量新功能),项目虽然 stars 尚低(51★),但作为官方维护的工具库,其技术深度和更新频率值得持续关注。
环境要求:
快速安装:
# 安装 uv(如未安装)
curl -LsSf https://astral.sh/uv/install.sh | sh
# 一键启动 MCP Server(自动下载依赖)
uvx pixverse-mcp
无 Dockerfile/无 Web UI:作为 MCP 工具,它的设计目标是嵌入 AI 客户端,而非独立部署。这是一把双刃剑——降低了使用门槛,但也限制了独立运行的可能。
适用场景推荐:
不推荐:有数据隐私合规要求的场景、需要完全本地化部署的环境。