mlx-audio
Apple Silicon 本地音频 AI 引擎,支持 TTS/STT/STS 三大功能
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Apple Silicon 本地音频 AI 引擎,支持 TTS/STT/STS 三大功能
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你用的是最新款 MacBook Pro M4,打开终端,输入一句话,5秒后听到一个完全真实的人在说话——不是录音,是你指定的任何文本转成的语音。这就是 MLX-Audio 正在做的事。
2024年底,随着 Apple M 系列芯片在开发者群体中的普及,一个痛点逐渐浮现:这些芯片明明拥有极其强大的 Neural Engine(神经网络引擎),但大多数音频 AI 工具仍然是针对 NVIDIA GPU 优化的。MLX-Audio 的出现,正是为了填补这个空白——让 Mac 用户能在本地运行完整的语音合成、语音识别,甚至语音到语音的对话系统,而不需要把数据发送到任何服务器。
该项目的作者是 Prince Canuma,一位专注于 Apple 平台 ML 优化的开发者。他选择从零基于 Apple 的 MLX 框架构建,而非简单移植既有方案,因此能充分利用 MLX 对 Apple 芯片的统一内存架构和 Neural Engine 的原生优化。目前该项目在 GitHub 上已积累超过 7000 颗星,是 MLX 生态中最受欢迎的音频处理工具之一。
MLX-Audio 围绕三个核心能力设计:
Text-to-Speech (TTS) — 文字转语音:这是项目最成熟的功能。支持 Kokoro-82M、Qwen3-TTS 等多种模型,可通过命令行或 Python API 调用。用户可以指定音色(voice)、语速、语言,生成 WAV/MP3/FLAC 等多种格式。更重要的是支持语音克隆——用户提供一段参考音频,模型就能模仿该声音说话。
Speech-to-Text (STT) — 语音转文字:基于 Whisper 系列模型(mlx-community/whisper-large-v3-turbo-asr-fp16 等),提供高准确率的实时语音识别。支持流式转录,可以边说话边看到文字输出,这对于会议记录、字幕生成等场景非常有价值。
Speech-to-Speech (STS) — 语音到语音:这是最前沿的功能,实现端到端的语音对话。输入语音 → 识别为文字 → TTS 生成回复语音,全程在本地完成。结合 WebRTC VAD(语音活动检测),可以构建真正的实时语音助手。
项目采用模块化设计,核心目录结构清晰:
mlx_audio/
tts/ # Text-to-Speech 模块
stt/ # Speech-to-Text 模块
sts/ # Speech-to-Speech 模块
codec/ # 音频编解码
lid/ # 语言识别
ui/ # Next.js Web UI
server.py # FastAPI API Server
server_inference.py # 推理调度
代码质量方面,项目采用标准 Python 项目规范:pyproject.toml 定义依赖,pytest + pytest-asyncio 完整测试套件,pre-commit 代码风格检查。文档使用 MkDocs + Material 主题,覆盖 API 参考、快速入门和量化指南。
量化支持是一大亮点。项目支持多种量化模式:标准 3/4/6/8 位量化、MXFP4(Apple 原生格式)、MXFP8、NVFP4。用户可以用 mlx_audio.convert 脚本将 Hugging Face 上的模型转换为 MLX 格式并量化,最高可将模型体积压缩 75%,同时保持可接受的输出质量。
MLX-Audio 不仅是一个 CLI 工具。它附带了一个用 Next.js + Tailwind CSS 构建的现代 Web 界面(mlx_audio/ui/),提供可视化的音频生成和参数调整。配合 FastAPI 后端(mlx_audio/server.py),还暴露了完整的 OpenAI 兼容 REST API,支持 /v1/audio/speech 和 /v1/audio/transcriptions 端点,可以直接替换应用中的 OpenAI TTS/STT 调用,而无需修改业务代码。
需要直接指出的是,MLX-Audio 有两个显著的硬性限制:
平台锁定:项目明确要求 Apple Silicon Mac(M1/M2/M3/M4)。在 Intel Mac 或 Linux/Windows 上无法运行。这是框架本身的限制(MLX 仅支持 Apple 芯片),而非代码问题。对于非 Apple 用户,目前没有替代方案。
ffmpeg 依赖:生成非 WAV 格式音频(MP3/FLAC/OGG 等)需要系统安装 ffmpeg。macOS 用户通过 brew install ffmpeg 解决,Ubuntu 用户通过 apt install ffmpeg。这增加了一点上手门槛。
随着隐私法规日趋严格和端侧 AI 能力的提升,本地化音频 AI 正在从极客玩具走向主流应用。MLX-Audio 的意义在于:它让 Apple 生态的开发者第一次有了一个生产可用的本地语音合成/识别方案,数据永不离开设备。在医疗、金融、客服等敏感场景,这是一个不可忽视的优势。
同时,项目对 OpenAI API 的兼容性设计也很聪明——降低迁移成本,让更多开发者愿意尝试本地部署而非继续付费调用云端 API。