FluidVoice
macOS 本地语音转文字应用,支持语音命令控制、全App写作模式,完全离线运行,数据不离开设备
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
macOS 本地语音转文字应用,支持语音命令控制、全App写作模式,完全离线运行,数据不离开设备
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:你在撰写一份紧急报告,双手离不开键盘,手指敲击的节奏却赶不上思绪的流动。传统打字速度有限,切换窗口、复制粘贴更是打断思路的噩梦。而现在,只需按下全局快捷键,开口说话,你的声音就能实时转写成文字,自动出现在任何 App 的光标处——这就是 FluidVoice 正在做的事。
FluidVoice 是一款完全开源(GPLv3)的 macOS 语音转文字听写应用,由独立开发团队 ALTIC DEV 打造。它的核心理念是「本地优先」——所有语音处理在本地完成,数据绝不离开你的 Mac。与云端方案不同,用户无需注册账号、无需付费开通 API,也不必担心麦克风里的隐私内容被上传到第三方服务器。2025 年 9 月上线 GitHub,仅用不到一年时间便积累超过 5700 颗星,成为 macOS 语音输入领域最受关注的开源项目之一。
在 FluidVoice 出现之前,macOS 用户可选择的本地语音输入方案屈指可数。苹果自带的听写功能虽然可用,但功能单一、标点处理粗糙、多语言支持有限。Dragon(Nuance)等商业方案价格高昂且对 macOS 适配不佳。云端方案(如 Whisper Web、Dictation.io)则面临隐私风险——无论是医疗记录、商业邮件还是私人对话,用户都不希望这些内容流经第三方服务器。
FluidVoice 正是瞄准了这个空白。它采用「本地语音模型 + 可选云端增强」的混合架构:默认使用在设备上运行的 STT(语音转文字)模型进行实时转写,同时支持用户按需选择 Groq、OpenAI 等云端 API 进行后处理增强。这种设计让普通用户零成本享受高质量听写,而有更高需求的用户可以灵活扩展。
作者 Barathwaj Anandan 在 GitHub 上提到,项目灵感部分来自 Wispr Flow(一个类似的产品),但 FluidVoice 选择了一条更彻底的本地化路线,并选择开源以获得社区信任。这个定位让它在注重隐私的开发者和技术人群中迅速传播。
FluidVoice 提供三种核心交互模式,每种都针对不同的使用场景精心设计:
Command Mode(命令模式) 是 FluidVoice 最具差异化的功能。你可以通过语音控制整个 Mac:启动 App、执行快捷指令(Shortcuts)、触发系统操作(如「打开 Safari」「新建邮件」),甚至自动化复杂的工作流。例如,对 Mac 说「打开 Xcode 并创建新项目」,FluidVoice 理解意图后自动执行对应操作。这不只是语音输入,而是语音操控——它重新定义了人机交互的边界。
Write Mode(写作模式) 是最直接的使用场景。它通过 macOS 的 Accessibility API 直接向任何文本框插入文字,兼容所有 App——浏览器、邮件客户端、代码编辑器、备忘录,无一例外。选中已有文本后说「重写这段」,FluidVoice 还能对选中文本进行 AI 增强改写。Live Preview 实时显示转写结果,配合 Notch 适配的浮动窗口,确保你在任何分辨率的 Mac 上都能舒适使用。
AI Enhancement(AI 增强) 是可选的高级功能。项目支持 Groq API、Nemotron Speech 3.5、Parakeet Flash、Parakeet TDN v3 & v2、Cohere Transcribe、Apple Speech 和 Whisper 等多种语音模型。用户可以按语言、延迟和准确率偏好自由切换。更重要的是,团队还开发了 Fluid Intelligence——一个完全本地运行的 AI 增强模块,使用私有本地模型进行智能格式化、上下文感知的大小写纠正和文本后处理,数据同样不离开设备。
从代码结构来看,FluidVoice 是一个标准的 Swift macOS 应用,基于 Swift Package Manager 构建,依赖以下核心库:
源码结构清晰,主要分为 Analytics(分析服务)、AppDelegate(应用入口)以及各类功能模块。AppDelegate 负责启动序列:文件日志初始化 → 设置存储加载 → 本地 API Server 启动 → 分析服务引导 → 更新检查定时器。每个环节通过 PromiseKit 链式编排,确保启动顺序确定性。
值得注意的是,项目通过 LocalAPIServer(本地 API 服务器)暴露 HTTP 接口,这意味着 FluidVoice 可以作为后台服务运行,并通过 REST API 与其他工具集成——这是一个有深度的工程设计选择。
部署方面,项目支持通过 Homebrew Cask 一键安装(brew install --cask fluidvoice),也支持手动下载 DMG。但它需要 macOS 15(Sequoia)+,且目前仅针对 Apple Silicon 优化(M1/M2/M3/M4),Intel Mac 的兼容情况未在文档中明确说明。
从 GitHub 数据看,FluidVoice 目前(2026年7月)拥有 5743 颗星、343 个 Fork、活跃的 Watchers 列表。团队保持着高频迭代节奏,README 中记录了 v1.6.0 的最新更新,包括全新 Parakeet 实现(几乎零延迟)和 Fluid Intelligence 的正式推出。
项目正在积极扩展平台边界:iOS 和 Windows 版本已在开发中,官方开放了 waitlist 等待名单。如果这个本地优先的语音输入体验能复制到 iPhone 和 Windows PC,其用户群体将成倍扩大。
尽管潜力巨大,FluidVoice 也存在一些现实限制。首先,它目前是 macOS 专属,Linux 用户无缘体验。其次,完整的 AI 增强功能(如 Fluid Intelligence)并非开源——核心 AI 增强模块是私有维护的,这与其开源基础形成了一定张力,团队对此在 README 中做了明确说明,用户可以按需选择。第三,极端网络不稳定环境下,云端模型的切换可能出现问题。
此外,源码中有 PostHog 埋点,这是闭源分析库,虽然本地可禁用,但对极度注重隐私的完全离线用户来说,可能需要额外配置。
FluidVoice 的出现代表了开源社区在「本地 AI 推理」方向的一次成功实践。它用 Swift 和 Apple 原生框架,在 macOS 上构建了一套完整、可用、隐私安全的语音输入系统。从零延迟的 Parakeet 模型到 Fluid Intelligence 本地增强,从 Command Mode 的语音操控到 Write Mode 的全 App 兼容,功能覆盖面和技术实现都相当成熟。
对于 macOS 开发者、技术写作者、追求效率的用户而言,FluidVoice 是目前最值得尝试的开源语音输入工具之一。随着 iOS 和 Windows 版本的到来,它的影响力有望进一步扩大。
数据来源:GitHub (2026-07-02), 5743 Stars | GPL-3.0 License | macOS 15+