argmax-oss-swift
Apple Silicon本地运行的语音AI三合一SDK:Whisper语音转文字+Pyannote
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Apple Silicon本地运行的语音AI三合一SDK:Whisper语音转文字+Pyannote
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有过这样的经历:开会时录了一段长音频,想转成文字,却要先把文件上传到云端,等服务器处理完再下载回来——整个过程不仅慢,还要担心内容泄露?在播客剪辑、语音助手开发、实时字幕等场景里,这种「云端依赖」几乎是所有本地AI应用的共同痛点。
Argmax Open-Source SDK 给出了一套截然不同的答案:把 Whisper 语音识别、Pyannote 说话人分割、Qwen3-TTS 语音合成这三套业界领先的AI模型,全部跑在你的 Mac 或 iPhone 本地上,不需要任何服务器,不需要网络连接,数据从头到尾不出设备。
Argmax Inc. 是一家专注于端侧AI推理的初创公司,其开源项目 Argmax-OSS-Swift 是目前 Apple 平台上最完整的本地语音AI框架集合。公司由原 Apple/Siri 工程师创立,核心目标是将大模型推理能力下沉到消费级硬件,让普通开发者和用户也能用上高性能的本地AI。
项目托管于 GitHub (argmaxinc/argmax-oss-swift),截至目前已获得超过 6000 颗星,是 Apple Silicon 语音AI领域最具影响力的开源项目之一。
Argmax SDK 采用「统一入口 + 独立模块」的架构设计,核心由三大组件构成:
WhisperKit 是 Argmax SDK 中最核心的模块,运行 OpenAI Whisper 模型(支持 tiny/base/small/medium/large 等规格),通过 Core ML 在 Apple Silicon 上实现高效推理。项目提供了预编译的 Core ML 模型(托管于 HuggingFace argmaxinc/whisperkit-coreml),省去了开发者自己转换模型的麻烦。
支持多语言自动识别、语气/语速控制、以及流式麦克风输入。值得注意的是,WhisperKit 还包含一个本地服务器模式,通过 argmax-cli serve 启动后,可以模拟 OpenAI Audio API 接口,让现有基于 OpenAI SDK 的应用无需修改代码即可切换到本地推理。
SpeakerKit 基于 Pyannote v4(community-1)说话人分割模型,能够从音频中识别出「有几个人在说话」「每个人说了哪些段落」。在会议记录、播客剪辑、电话录音等场景中,这个功能几乎是刚需。
它还提供了与 WhisperKit 的深度集成——通过 addSpeakerInfo(to:) 方法,可以直接将说话人标签「贴」到 Whisper 的识别结果上,生成带说话人归属的完整会议记录,输出格式兼容 RTTM 标准。
TTSKit 运行 Qwen3-TTS 模型(阿里巴巴通义千问团队开源),支持 10 种语言、9 种内置音色,并提供实时流式播放——音频生成的同时就开始播放,不需要等全部合成完毕。
1.7B 参数版本还支持「风格指令」功能:用一段自然语言描述想要的朗读风格(「读得慢一点,像讲故事一样」),模型就会按指定风格生成语音,这在有声书、虚拟主播等场景中非常有价值。
Argmax SDK 的工程实现体现了极高的 Swift / Apple 生态整合水准:
Swift Package Manager 集成:在 Xcode 中通过「File → Add Package Dependencies」添加 argmaxinc/argmax-oss-swift 仓库,选择 ArgmaxOSS(全量)或单个 WhisperKit/TTSKit/SpeakerKit 即可引入,最小化依赖体积。
自动模型下载:首次运行时,SDK 会自动从 HuggingFace 下载对应的 Core ML 模型并缓存,无需手动配置路径,开发者只需要写三行代码就能开始推理:
let pipe = try? await WhisperKit()
let transcription = try? await pipe!.transcribe(audioPath: "recording.m4a")
本地服务器兼容 OpenAI API:对于已有 OpenAI 应用的用户,只需将 base_url 指向本地服务器地址,改一行代码即可无缝迁移:
client = OpenAI(base_url="http://localhost:50060/v1")
result = client.audio.transcriptions.create(file=open("audio.wav", "rb"), model="tiny")
完善的 CLI 工具:通过 Homebrew 安装 whisperkit-cli,可以在终端直接运行转录、TTS、说话人分割,无需编写任何代码。
Argmax SDK 存在一个明确的前提条件:必须使用 Apple Silicon 芯片的 Mac 或 iOS 设备。这既是优势(Core ML 在 Apple 芯片上有出色的性能和能效比),也是限制(不支持 Intel Mac,也不支持 Linux/Windows/Android)。
另外,WhisperKit 需要 macOS 14.0+ 和 Xcode 16.0+,TTSKit 的流式播放功能更进一步要求 macOS 15.0+ 或 iOS 18.0+。如果你的开发环境是较老的 macOS 版本,可能需要先升级系统。
从部署难度来看,Argmax SDK 不支持 Docker,无法在服务器上容器化部署,天然面向的是桌面端和移动端 App 开发场景,而非后台服务。
Argmax 的出现折射出一个更宏观的趋势:随着端侧AI能力的提升,「数据不出设备」正在从合规要求变成真实可行的工程选择。在医疗记录、会议内容、客服对话等敏感场景中,本地推理意味着从架构层面杜绝了数据泄露的风险,而 Argmax SDK 将这个能力以极低的接入成本开放给了所有 Apple 开发者。
从社区活跃度来看,项目拥有 Discord 社区、持续更新的 CI/CD 测试、以及明确的公开路线图,同时 Argmax 公司也推出了 Pro 版 SDK 提供更多功能(非开源),形成了「开源引流 + 商业变现」的可持续模式。
Argmax Open-Source SDK 是 Apple 平台上最值得关注的本地语音AI开源项目之一。它将 Whisper、Pyannote、Qwen3-TTS 三大模型以工程级的品质封装为 Swift 框架,让任何具备 Xcode 开发能力的团队都能在几小时内为自己的 App 增添完整的语音转写、说话人分割和语音合成能力——所有推理完全在本地完成,不依赖任何云服务,隐私安全。唯一的门槛是 Apple Silicon + Swift 开发经验,但这两点对于目标用户群来说本就是天然约束,而非额外负担。