Whisper
Const-me/Whisper 是 Whisper 语音识别模型的高性能 C++/C# 实现。相比
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Const-me/Whisper 是 Whisper 语音识别模型的高性能 C++/C# 实现。相比
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
一张图秒懂它是干什么的:
想象你有一盘珍贵的老磁带,想把里面的声音转成文字。传统方式是请一位速录员(对应 OpenAI 官方 Whisper——需要 PyTorch、CUDA 环境,配起来就让人头疼)。而 Const-me/Whisper 就像一台专业转录机——下载、解压、运行,三步搞定,而且速度比速录员快 2-3 倍。
Whisper 是 OpenAI 2022 年开源的语音识别模型,精度高、支持多语言。但官方实现依赖 PyTorch + CUDA,在普通 Windows 电脑上跑起来要装一堆环境,配不好还报错。更让人头疼的是,官方版本打包后动不动就是几 GB 的依赖。
**Const-me(项目作者)**是一位 Windows 桌面应用开发者,他在 2022-2023 年间将 whisper.cpp(C/C++ 实现)移植到 Windows,利用 DirectCompute(Direct3D 11 的计算着色器)做 GPU 加速。相比 PyTorch + CUDA,原生 DLL 仅 431KB,而 PyTorch 依赖高达 9.63GB——体积差距超过两万倍。
本项目的核心创新在于用 DirectCompute(Direct3D 11 计算着色器)替代 CUDA 做 GPU 推理:

图1:WhisperDesktop 首次启动时自动下载模型文件
本仓库并非单一程序,而是由多个组件构成的有机整体:

图2:音频/视频文件转录界面,支持多格式
| 模块 | 语言 | 说明 |
|---|---|---|
| Whisper | C++/C++20 | 核心 DLL,实现 ML 推理、Media Foundation 音频处理、VAD |
| WhisperDesktop | C# | Windows 桌面 GUI 程序,基于 WinForms |
| WhisperNet | C# | .NET 封装库,已发布至 NuGet,供 C# 开发者调用 |
| WhisperPS | PowerShell | PowerShell 5.1 模块,适合批量处理音频文件 |
构建方式需要 Visual Studio 2022,编译前需运行 CompressShaders 项目将 46 个着色器压缩(123.5KB → 18KB)。

图3:麦克风实时录音并转写/翻译界面
对于普通用户而言,整个流程极为简洁:
WhisperDesktop.zip(465KB)WhisperDesktop.exeggml-medium.bin(约 1.4GB)对于开发者,提供了多种集成方式:
WhisperNet,调用 Whisper.Library.loadModel() 即可Install-Module -Name WhisperPS -Scope CurrentUser 一键安装cli.zip,配合批处理实现自动化项目使用 Windows Media Foundation 处理音频/视频解码,支持绝大多数常见格式(MP3、WAV、M4A、MP4、MKV 等),不支持 Ogg Vorbis。麦克风录音方面支持大多数 Windows 音频设备,但不支持专业 ASIO 接口设备。
**语音活动检测(VAD)**采用了 Mohammad Moattar 和 Mahdi Homayoonpoor 2009 年发表的论文算法,在 CPU 上实时运行,用于麦克风录音场景的静音过滤。
本项目局限性较为明显,潜在用户需注意:
mlmodelc 模型此外,项目自 2023 年 7 月发布 v1.12.0 后已停止更新(近 3 年未发布新版本),可能存在以下风险:无法使用 Whisper 最新模型、对新版 Windows 兼容性问题、安全漏洞未修复。若需最新 Whisper 模型支持,建议关注 ggerganov/whisper.cpp 源项目。
Const-me/Whisper 代表了一个重要趋势——将大模型推理能力下沉到普通 Windows 设备。在 CUDA 生态之外,DirectCompute 提供了一条可行的 Windows 原生 GPU 计算路径。项目作者撰写的 10 万字博客详细记录了移植过程中的工程决策,对 GPU 编程和 Windows 桌面开发有重要参考价值。