buzz
本地 Whisper 音频转录工具,支持多后端引擎和离线使用,隐私安全
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
本地 Whisper 音频转录工具,支持多后端引擎和离线使用,隐私安全
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你参加了一场两小时的产品评审会,会后收到一叠混乱的笔记,却发现漏记了最关键的决策;或者你是视频创作者,每次给字幕都要花半小时反复拖进度条。现在,有一款叫 Buzz 的开源工具正在改变这一切——它能在你的电脑上离线完成语音转文字,而且完全免费、不需要网络。

Buzz(GitHub stars 19398,MIT 协议)是一款基于 OpenAI Whisper 模型的本地音频转录和翻译工具。与在线转录服务不同,Buzz 的所有处理都在本地完成——音频文件从未离开你的设备,这意味着隐私安全、离线可用,而且完全免费。
2022 年 OpenAI 发布 Whisper 模型后,开发者 Chidi Williams 敏锐地意识到:虽然 Whisper 模型已经开源,但普通用户使用它仍然需要写代码、搭环境。 Whisper 的潜力被锁在了技术门槛背后。于是他用 PyQt6 构建了一个开箱即用的桌面应用,让任何人都能用上 Whisper 的能力。这个项目迅速获得了社区认可,GitHub stars 逼近 2 万,成为了 Whisper 生态中最受欢迎的 GUI 工具之一。
很多人以为 Whisper 只是一个"听写工具",但 Buzz 告诉你它远比这强大:
多模型后端支持:Buzz 并没有绑定单一实现。它同时支持 OpenAI Whisper 官方模型、Faster Whisper(速度提升 4-5 倍)、Whisper.cpp(支持 Vulkan GPU 加速,兼容 AMD 显卡)、Hugging Face 上的 Whisper 兼容模型,以及 OpenAI Whisper API。这意味着无论你用英伟达 GPU、Mac M 芯片还是纯 CPU,都能找到合适的运行方式。
文件格式全覆盖:Buzz 支持导入音频文件(MP3、WAV、M4A 等)和视频文件(MP4、MOV、AVI 等),并导出为 TXT(纯文本)、SRT(字幕文件)和 VTT(WebVTT 字幕)三种格式。内置的 yt-dlp 模块还支持直接从 YouTube 等平台下载音视频并自动转录。
实时录音转录:Buzz 提供了麦克风实时录音功能,可以一边说话一边看到转录结果(虽然因本地处理速度限制,不是严格的"实时",但对于播客录制、会议记录等场景非常实用)。
翻译能力:除了转录英文,Buzz 还能借助 OpenAI API 兼容的大语言模型对转录内容进行翻译,支持多语言互译。
说话人识别:对于多人对话场景,Buzz 支持说话人识别(Speaker Identification),能自动标注不同发言者。
视频字幕同步:转录后的字幕文件(SRT/VTT)可以与原视频时间轴精确对齐,导出后直接用于视频压制。
从代码结构看,Buzz 采用经典的桌面应用架构:
main.py + PyInstaller spec(跨平台打包)buzz/buzz.py 处理主窗口逻辑,buzz/transcriber/ 目录下管理各类转录引擎file_transcriber.py(文件转录)、whisper_file_transcriber.py(官方Whisper)、local_whisper_cpp_server_transcriber.py(Whisper.cpp)、openai_whisper_api_file_transcriber.py(API方式)cuda_setup.py 负责 GPU 环境检测,faster-whisper 后端直接调用 CUDA 加速矩阵运算pyproject.toml 管理约 50+ 依赖(含 torch、torchaudio、transformers 等重量级包)项目还包含完整的 CLI 接口(buzz/cli.py),支持命令行批量转录,适合自动化工作流。
普通用户(桌面应用):
进阶用户(命令行):
pip install buzz-captions
python -m buzz
开发者:
git clone https://github.com/chidiwilliams/buzz
cd buzz
uv sync
python -m buzz
Buzz 的 GPU 推荐配置为 NVIDIA 显卡 + 4GB 以上显存(faster-whisper 模型)。在没有 GPU 的情况下,Buzz 仍可运行,但处理速度会显著降低(CPU 模式)。内存建议 8GB 以上,磁盘空间约 3GB(包含模型文件)。
1. 非真正实时转录:Buzz 标注了"Resource-intensive and may not be real-time",意思是麦克风录音转录不是严格意义的实时同步。对于需要实时字幕的场景(如无障碍辅助),仍有局限。
2. 模型精度依赖音频质量:在嘈杂环境或多人同时说话的情况下,转录准确率会明显下降。Buzz 内置了 Demucs 语音分离预处理模块,可以在一定程度上改善这一问题,但无法完全替代专业录音环境。
3. GPU 环境配置门槛:对于没有英伟达显卡的用户(如 AMD 显卡或纯 CPU),最佳实践需要使用 Whisper.cpp 或 Mac 专用版本,配置过程有一定门槛。
4. 缺乏自动字幕时间轴对齐:虽然支持 SRT/VTT 导出,但对于视频压制等需要精确帧级对齐的工作流,仍需配合 FFmpeg 等工具二次处理。
Buzz 的意义不仅在于它是一个好用的工具,更在于它代表了一种趋势:开源 AI 模型从"能跑"到"好用"的最后一公里问题,正在被社区逐一攻克。类似 Buzz 的工具还有 Whisper Desktop、Buzz Capsions 等,它们共同降低了 Whisper 的使用门槛,让普通用户无需写代码也能享受最前沿的语音识别能力。
根据 GitHub 动态,Buzz 保持着活跃维护(v1.4.5,2025年),持续跟进 Whisper 模型更新,并提供 Docusaurus 文档站(含简体中文翻译)。作者 Chidi Williams 还维护着配套网站 buzzcaptions.com,提供更多使用指南。
总结评分: