MiniMax-MCP-JS
MiniMax 官方 MCP 实现,让 Claude/Cursor 直接调用图像/视频/TTS/语音克隆等多模态生成能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
MiniMax 官方 MCP 实现,让 Claude/Cursor 直接调用图像/视频/TTS/语音克隆等多模态生成能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你用过 Claude 或者 Cursor 吗?有没有那么一刻想过——如果这些 AI 助手不只是能聊天,而是能直接帮我生成一段配音视频,或者克隆我自己的声音来讲故事,那会是什么体验?
这正是 MiniMax-MCP-JS 正在做的事。它是 MiniMax 官方发布的 Model Context Protocol(MCP)JavaScript/TypeScript 实现,通过标准化的 MCP 协议,把 MiniMax 强大的多模态生成能力——图像生成、视频生成、文本转语音、语音克隆、音乐生成——无缝接入到 Claude Desktop、Cursor 等主流 AI 工具中。
大语言模型(LLM)问世以来,最大的遗憾之一就是:模型很强,但"手"太短——它只能输出文字,无法生成图片、声音或视频。开发者们为此发明了"工具调用"(Tool Use)机制,让模型能够触发外部 API 来完成任务。然而,每接入一个新的 AI 能力,都要写一套定制化的集成代码,繁琐且难以复用。
MCP(Model Context Protocol) 就是来解决这个问题的。它由 Anthropic 提出,是一个开放协议标准,定义了 AI 客户端(如 Claude Desktop)与工具服务器之间的通信规范。开发者只需实现一次 MCP 服务器,就能被所有支持 MCP 的 AI 客户端使用。
MiniMax 是国内多模态 AI 领域的头部玩家,拥有图像生成(SDXL 级别)、视频生成(MiniMax 自研 Video-01 模型)、TTS(支持情感控制)、语音克隆等能力。MiniMax-AI 团队将这套能力封装为 MCP 服务器的 JavaScript 实现,让前端开发者能够用熟悉的 Node.js / TypeScript 生态,以极低的成本接入这些能力。
MiniMax-MCP-JS 通过 MCP 协议暴露了以下工具:
文本转语音(TTS):支持 Speech-02-HD、Speech-02-Turbo、Speech-01 等多个模型版本。可精细控制语速(0.5x-2.0x)、音调(-12 到 +12)、音量、采样率和音频格式(MP3/PCM/FLAC/WAV)。最亮眼的是情感控制——可选 'happy'、'sad'、'angry'、'fearful'、'disgusted'、'surprised'、'neutral' 七种情感,让语音告别"念稿感",读出真实的情绪起伏。支持 25 种语言的语音增强优化,还可通过 stream 参数开启流式输出,实现实时播报体验。
语音克隆:只需提供一段参考音频,即可克隆出相似音色。支持在克隆声音时同时指定情感风格——比如用悲伤的语气说出一段新闻。这个能力在有声读物、虚拟主播、辅助无障碍场景中价值巨大。
音色设计:在克隆的基础上更进一步,允许用户通过文字描述"设计"全新的音色,比如"一位 40 岁磁性男声,说话略带沙哑"。降低了专业配音演员门槛。
图像生成:集成 MiniMax 自研图像生成模型,输入文本提示词即可生成高质量图像。支持多种风格和分辨率。
视频生成:这是 MiniMax 的核心能力之一。通过 generate_video 工具,输入文本描述即可生成视频片段(MiniMax Video-01 模型)。支持异步模式——发起生成任务后,通过 query_video_generation_status 查询进度,完成后获取视频 URL。生成的视频时长和质量取决于 MiniMax 后端的模型版本和配额。
音乐生成:输入文字描述曲风、情绪、乐器编制,即可生成原创音乐片段。这是业内少有的 MCP 集成音乐生成的案例,拓展了 AI 创作的可能性边界。
项目源码结构清晰,采用分层服务架构:
src/
api/ # 7个子 API(tts, image, video, voice-clone, voice, music, voice-design)
services/ # MediaService 聚合层,统一调度各 API
config/ # ConfigManager 配置管理(支持 4 种优先级配置)
types/ # TypeScript 类型定义
schema/ # Zod schema 验证
utils/ # 工具函数(API 封装、音频处理、文件操作)
const/ # 常量(默认值、错误信息、环境变量名)
核心依赖:
三种传输模式是该项目的架构亮点:
配置系统支持 4 种优先级:请求参数(最高)> API 配置 > 命令行参数 > 环境变量(最低),灵活适配平台托管(ModelScope 等)和本地开发场景。
配置过程相当顺滑。以 Claude Desktop 为例,只需在配置文件 claude_desktop_config.json 中添加一段 mcpServers 配置:
{
"mcpServers": {
"minimax-mcp-js": {
"command": "npx",
"args": ["-y", "minimax-mcp-js"],
"env": {
"MINIMAX_API_HOST": "https://api.minimax.chat",
"MINIMAX_API_KEY": "您的密钥"
}
}
}
}
重启 Claude Desktop 后,就可以在对话中直接调用 text_to_audio、generate_video、clone_voice 等工具了——无需写一行代码。
Cursor 用户同样可以图形化配置。值得注意的是,国际版和国内版 MiniMax 的 API 主机地址不同(国际版多一个 "i"),密钥与地址必须匹配,否则会报 invalid api key。
成本问题:MiniMax API 为付费调用,每次 TTS、视频生成、语音克隆都会消耗配额。没有免费 tier,开发者需要预先充值账号。项目文档明确标注"⚠️ 注意:使用这些工具可能会产生费用"。
模型能力边界:视频生成质量依赖 MiniMax 后端模型更新,当前视频生成可能存在分辨率、时长或物理模拟方面的局限。语音克隆克隆精度受参考音频质量影响较大,低质量输入可能导致音色失真。
生态锁定:MCP 协议虽为开放标准,但 MiniMax-MCP-JS 深度依赖 MiniMax 后端,换用其他多模态服务需要重写实现,不存在平滑迁移路径。
REST 模式安全隐患:Dockerfile 默认以明文环境变量传递 API Key,生产环境部署需要自行添加密钥管理机制(如 Kubernetes Secret、Vault),当前文档中未覆盖这一安全配置。
平台差异:国际版(api.minimaxi.chat)和国内版(api.minimax.chat)服务存在差异,部分模型和功能可能仅在某一区域可用,需要查阅对应平台的 API 文档确认。
2024-2025 年,AI 行业正在经历从"对话模型"到"多模态 Agent"的范式转移。单纯的文本生成已不能满足需求,真正的 AI Agent 需要能看、能听、能说、能做。MiniMax-MCP-JS 的价值在于:它把多模态能力的接入门槛降到了最低。
开发者不需要理解 MiniMax 的 API 签名,不需要处理文件上传和下载,不需要管理异步任务状态——所有这些都被 MCP 协议和 JavaScript SDK 封装好了。Claude Desktop、Cursor 这些 AI 客户端天然支持 MCP,配置完成后就能"即插即用"。
从更宏观的视角看,这类 MCP 服务器正在成为 AI 生态的"基础设施层"。随着 Anthropic、MCP 生态和 Claude 的影响力扩大,支持 MCP 将成为 AI 工具的标配能力。MiniMax-AI 团队率先推出官方 JavaScript SDK,既是技术布局,也是生态卡位。
该项目目前已获得 123 颗 GitHub Stars,主要语言为 TypeScript,采用 MIT 许可证维护,保持活跃迭代(最新版本 0.0.17,更新至 2025 年 7 月),代码质量良好,类型定义完善,具备较好的长期维护预期。