hyprwhspr
Linux本地语音转文字工具,支持Whisper/Cohere/Parakeet多后端,本地离线运行,Wayland/X11全兼容
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Linux本地语音转文字工具,支持Whisper/Cohere/Parakeet多后端,本地离线运行,Wayland/X11全兼容
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有过这种经历——深夜写代码写到一半,突然需要记录一段灵感,但手离开键盘去打字打断节奏,或者在嘈杂的咖啡馆里,周围人声鼎沸让语音输入完全不可用?更别提大多数语音转文字工具把你的声音数据上传到云端,隐私问题让人后背发凉。
hyprwhspr 正是为解决这些问题而生的:它是一款专为 Linux 打造的系统级本地语音听写工具,能在你说话的同时,将文字精准地注入任何焦点窗口——终端、浏览器、IDE、聊天软件,不一而足。更重要的是,语音处理完全在本地完成,云端 API 完全是可选项。
在 macOS 和 Windows 上,系统级语音听写早已是标配功能,按下快捷键就能将语音转化为文字写入任意应用。但 Linux 桌面生态长期存在一个尴尬的空缺:虽然 Whisper 等高质量开源语音识别模型已经成熟,却缺少一个开箱即用、无缝集成到日常桌面的听写工具。
goodroot(项目作者,GitHub ID: 9484709)从这个痛点出发,于 2025 年 8 月创建了 hyprwhspr 项目。项目的命名直接透露了它的设计目标:hypr(Hyprland 桌面环境)+ whspr(whisper 语音识别)= hyprwhspr。它不仅支持 Hyprland,还全面覆盖了 Sway、Niri、KDE Plasma、GNOME 等主流 Wayland/X11 会话环境,以及 Arch Linux、Debian、Ubuntu、Fedora、openSUSE 等主流发行版。
这种"我就是给 Linux 桌面用户做工具"的定位,让 hyprwhspr 在上线后迅速获得了关注。项目在 GitHub 上已积累超过 1100 颗星,社区活跃度相当高。
hyprwhspr 的架构设计非常清晰:它本身不实现语音识别模型,而是通过插件化的后端设计,灵活对接多种语音识别引擎。这种"搭积木"的思路让用户可以根据自己的硬件条件和隐私需求自由选择。
本地模型后端包括:
云端 API 后端包括:

硬件资源管理是另一个亮点。对于使用本地 Whisper 模型的玩家,hyprwhspr 提供了 hyprwhspr model unload/reload 命令,可以在不需要听写时释放 GPU 显存,让同一块 RTX 4090 既能跑 Whisper 听写,又能跑 LLaMA 推理。内存峰值可以在 0GB 到全占满之间灵活调节。
实时可视化是 hyprwhspr 区别于其他 Linux 语音工具的重要特性。它提供了一个 GTK4 Layer Shell 的麦克风 OSD(屏幕叠加层),在录音时会显示动态波形和实时转录文字——在 Hyprland、Sway、Niri 等支持 layer-shell 的 compositor 上,这个可视化层会自动匹配 Noctalia 和 Omarchy 桌面的主题色。对于 Noctalia 和 Waybar 用户,还有专门的插件集成,显示听写状态指示器。
高级听写控制包括:
从代码结构来看,hyprwhspr 的工程组织相当扎实。项目采用 Python 实现,代码被清晰地划分为多个功能模块:
lib/src/:核心源码目录,包含约 46 个模块文件lib/src/backends/:各语音识别后端的抽象实现(Whisper、Cohere、ElevenLabs 等)lib/src/cli/:命令行接口封装bin/:入口脚本(hyprwhspr 主程序和 meeting-recorder 会议录制工具)config/:面向不同桌面的配置模板(Hyprland、Noctalia、Waybar、systemd)scripts/:依赖安装和安装脚本docs/:详细配置文档热插拔和即插即用的设计哲学贯穿整个项目:音频设备监控(device_monitor.py)、键盘热插拔(keyboard_monitor.py)、系统休眠恢复(suspend_monitor.py)、PulseAudio/PipeWire 事件监控(pulse_monitor.py)——几乎所有可能影响录音状态的外部事件都有对应的监控模块,构成了一个健壮的"外设感知"层。
依赖管理也很有特色:requirements-*.txt 采用了模块化拆分策略——核心依赖、faster-whisper-cuda GPU 版本、onnx-asr CPU 版本、realtime WebSocket 版本,各取所需,避免安装一个本地听写工具还要拉取整套 GPU 依赖链。
对于 Arch Linux 用户,安装极为简单:
yay -S hyprwhspr
hyprwhspr setup
setup 命令会引导用户完成后端选择、模型下载、systemd 服务配置、权限设置和安装验证,全程交互式,体验流畅。
对于 其他发行版(Debian/Ubuntu/Fedora/openSUSE),一行命令搞定:
curl -fsSL https://hyprwhspr.com/install.sh | bash
安装脚本会自动检测发行版类型、安装对应依赖、克隆源码到 ~/.local/share/hyprwhspr/src,然后引导用户完成 hyprwhspr setup。
日常使用只需记住一个快捷键:Super+Alt+D(可自定义)。按下去——"哔"一声表示开始录音,说话,按同样快捷键停止——"噗"一声,文字已经出现在你刚才焦点所在的窗口里了。全程不需要鼠标,不需要切换应用。
CLI 命令行也提供了丰富的控制能力:
hyprwhspr model status # 查看当前加载的模型
hyprwhspr record toggle # 外部控制录音开关
hyprwhspr transcribe audio.wav # 离线转录音频文件
hyprwhspr validate # 验证安装完整性
任何工具都有其局限性,hyprwhspr 也不例外。
平台限制首当其冲:项目明确只支持 Linux,macOS 和 Windows 用户无法使用。这既是项目定位使然(专注 Linux 桌面生态),也是现实的技术约束——项目深度依赖 Wayland/X11 的窗口和剪贴板操作 API,这些在 macOS/Windows 上不存在直接对应的实现。
安装复杂度不低:虽然官方提供了安装脚本,但对于 Linux 新手来说,systemd 用户服务、会话工具链配置、GPU 驱动安装等概念仍然有门槛。README 中也坦承需要"Log out and back in"来应用组成员变更。
模型质量依赖后端选择:本地 Whisper 模型在 CPU 上推理速度有限,ONNX 版本的精度可能略低于原版 Whisper。云端 API 精度高但依赖网络连接和 API 密钥(需要额外付费)。
GNOME 用户体验稍逊:可视化层(麦克风 OSD)依赖 GTK4 Layer Shell,在 Hyprland、Sway 等 compositor 上体验完美,但在 GNOME/Mutter 上需要额外配置才能启用。
hyprwhspr 的出现填补了 Linux 桌面生态中一个长期空白的领域。语音输入不仅是打字困难人群的辅助工具,对于任何需要"手口并用"的场景——边思考边口述、快速记录灵感、多任务处理——都是实实在在的效率提升。
更难能可贵的是,hyprwhspr 坚持"本地优先"的设计哲学。语音数据默认不离开用户设备,这对于注重隐私的开发者、关注数据主权的用户,以及需要处理敏感信息的企业环境来说,是根本性的差异点。云端 API 完全是可选项,而非默认行为。
项目支持 20+ 个 GitHub Topics 标签,覆盖 AI、speech-to-text、Whisper、Cohere、ElevenLabs、Wayland、Hyprland、translation 等多个维度,体现了开源社区对高质量本地语音工具的旺盛需求。可以预见,随着 AI 语音模型持续进化,hyprwhspr 这类工具的重要性会进一步凸显。