MiniMax-MCP
MiniMax 官方 MCP Server,一句话让 AI 助手拥有文生音、文生图、文生视频能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
MiniMax 官方 MCP Server,一句话让 AI 助手拥有文生音、文生图、文生视频能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你在凌晨两点调试一段文案,需要立刻听一听朗读效果来感受节奏;或者你有一个模糊的画面构想,想立刻生成一张草图看看效果——MiniMax-MCP 正是为这类需求而生。它是 MiniMax 官方发布的 Model Context Protocol(MCP)服务端,通过标准化协议将 MiniMax 的文生音频、文生图、文生视频三大生成能力,无缝接入 Claude Desktop、Cursor、Windsurf 等主流 AI 编程工具。
MCP(Model Context Protocol)是 Anthropic 在 2024 年末提出的开放协议,旨在解决 AI 助手与外部工具之间的「鸡同鸭讲」问题。在 MCP 出现之前,每款 AI 工具(如 Claude、Cursor)都需要为每一个外部能力(如调用某个 API)单独编写适配代码,开发者为此疲于奔命。MCP 统一了工具调用的接口规范——只需实现一个 MCP Server,就能让所有兼容 MCP 的客户端(Claude Desktop、Cursor、Cline 等)直接调用你的工具。
MiniMax 是一家中国 AI 公司,在语音合成、视频生成领域有着深厚积累,旗下拥有海螺录音(Hailuo)视频生成、Saber 语音引擎等技术。MiniMax-MCP 即是其官方将这些生成能力以 MCP 协议封装后的产物,让全球开发者可以在不写一行胶水代码的情况下,用自然语言驱动 MiniMax 的生成引擎。
text_to_audio 是最基础也是最常用的工具。用户输入一段文字,选择一个预设音色(默认中文女声 female-shaonv),即可获得 MP3 格式的语音文件。高级参数极为丰富:语速(0.5x–2.0x)、音量(0–10)、音调(-12–12)、情感(happy/sad/angry/fearful/disgusted/surprised/neutral)、采样率、比特率、声道数、格式(mp3/flac/pcm)均可精细调节,甚至支持语言增强(language_boost)参数,可指定「中文为主」或「英语为主」的生成模式来提升特定语言的音质。这在竞品工具中极为罕见。
仅需用户提供一段目标音频文件(支持 wav/mp3/flac),MiniMax 的语音模型即可学习该声音特征,生成与之相似的新语音。克隆后的音色可用于后续所有 text_to_audio 调用,实现「用自己的声音朗读任意文本」的效果。该功能对有声内容创作者、游戏配音、个性化语音助手等场景有直接价值。

图1:Voice Clone 功能在 Cursor 中的调用示例,上传音频即可克隆音色
generate_video 支持文生视频和图生视频两种模式。基于 MiniMax-Hailuo 2.3 模型,可生成 6 秒或 10 秒的高清视频。2025 年 7 月更新后还支持 Hailuo-02 模型,生成效果更流畅自然。query_video_generation 用于查询视频生成任务的进度和状态。

图2:文生视频功能在 Cursor 中的调用示例,文字输入后直接生成 MP4
text_to_image 基于 MiniMax Image-01 模型,根据文本描述生成高质量图片。图片格式为 WebP,默认输出为 URL 模式,可直接获取在线链接。

图3:文生图功能示例,输入描述词即可生成对应视觉内容
list_voices 列出所有可用音色 ID;play_audio 播放本地音频文件(支持 sounddevice/soundfile);voice_design 通过描述性提示词生成个性化音色(2025年7月新增);music_generation 调用 music-2.6 模型生成背景音乐片段。
代码库规模精干,核心仅 5 个 Python 模块:
server.py(约 800 行)——MCP 工具注册中心。所有 @mcp.tool 装饰的函数构成工具层,暴露给 MCP 客户端。每个工具函数接收标准化参数,调用 MinimaxAPIClient 发起 HTTP 请求,并将结果以 TextContent 形式返回。工具函数包含详尽的 docstring,说明每个参数的业务含义(如情感类型、语言增强选项等)。
client.py(约 100 行)——MiniMax API 的 HTTP 封装。封装了 Bearer Token 鉴权、JSON 请求/响应处理、错误码映射(1004=认证失败、2038=未实名认证等)。通过 MM-API-Source: Minimax-MCP 请求头标识数据来源。
utils.py(约 150 行)——文件输出与音频播放。包含输出路径构建(支持 base_path + output_directory 组合)、文件写权限检查(防止目录不可写报错)、模糊文件名匹配(用于找到刚生成的音频文件)。
const.py(约 40 行)——所有默认常量:默认模型 ID(speech-2.8-hd、music-2.6、image-01、MiniMax-Hailuo-2.3)、默认音色(female-shaonv)、音频参数默认值。
exceptions.py——4 层异常体系:认证错误、请求错误、超时错误、验证错误,均继承自 MinimaxAPIError。
依赖管理采用 uv.lock 锁定精确版本,主依赖包括:mcp[cli]>=1.6.0(MCP 协议核心)、fastapi/uvicorn(SSE 传输支持)、pydantic(数据验证)、httpx/requests(HTTP 客户端)、fuzzywuzzy(模糊匹配)、sounddevice/soundfile(音频播放)。
MiniMax-MCP 不提供 Web UI 和 Dockerfile,是典型的 CLI 工具包。安装方式极为简洁:
uvx minimax-mcp
一行命令即可通过 uvx(uv 的即时运行模式)启动 MCP 服务。配置只需在客户端的 JSON 配置文件中添加几行即可——支持 stdio 和 SSE 两种传输方式:stdio 适合本地进程通信,SSE 适合远程/云端部署。环境变量只需配置三项:MINIMAX_API_KEY(必须)、MINIMAX_API_HOST(必须,全球版为 api.minimax.chat)、MINIMAX_MCP_BASE_PATH(可选,输出文件保存路径)。
唯一需要注意的是 API Key 的地域对齐问题:全球版 Key 搭配 api.minimax.chat,大陆版 Key 搭配 api.minimaxi.com,对齐错误会返回认证失败(1004)。此外,部分功能(如语音克隆、视频生成)需要用户完成 MiniMax 平台的实名认证,否则返回 2038 错误。
部署难度低(2/5),无需 GPU,仅需 512MB RAM + 200MB 磁盘,但需要用户自行注册 MiniMax 开发者账号并获取 API Key——这是该类工具的普遍门槛。
商业化依赖风险:MiniMax-MCP 本质上是一个 MiniMax API 的「遥控器」,所有生成能力完全依赖 MiniMax 的付费 API。一旦 MiniMax 调整定价策略或服务不可用,项目将直接受影响。
数据隐私:用户上传用于克隆的音频文件、需要生成的文本内容(可能包含敏感信息),均会上传至 MiniMax 服务器处理。对于企业级隐私合规场景,这是不可忽视的风险点。
模型能力边界:视频生成最长 10 秒,图片生成基于 MiniMax 自研模型(非开源),无法切换为 Stable Diffusion 等其他模型,灵活性受限。
非零成本:所有生成类工具(音频、视频、图片)均需付费调用,用户需在 MiniMax 平台充值。虽然 MCP 工具内嵌了 COST WARNING 注释提醒开发者,但生产环境中仍需监控用量。
MiniMax-MCP 处于 MCP 生态快速扩张的风口。Anthropic MCP 协议自 2024 年底推出后,2025 年上半年已有数百个社区 MCP Server 涌现,涵盖数据库查询、文件操作、云服务控制等场景。MiniMax-MCP 作为首批专注于「多模态内容生成」的官方 MCP 实现,填补了 AI 助手与专业生成模型之间的协议空白。
从 GitHub 数据看,该项目 2025 年初发布至今(2026年6月)已获得 1510 stars、10 个topics,反映出开发者对 AI 原生内容生成工具的强烈需求。其姊妹项目 MiniMax-MCP-JS(JavaScript 实现)和 MiniMax-01 模型家族共同构成了 MiniMax 的开发者生态矩阵。
MCP 协议的核心价值在于降低工具集成成本——有了 MCP,AI 助手「调用生成模型」从需要手写 API 调用代码,变成了「说一句自然语言」。这种范式转变意味着,未来每个专业生成模型(语音、视频、图像、3D)都可能有自己的 MCP Server,而 MiniMax-MCP 正是这一趋势的早期实践者。