Skip to content

Whisper_CPP 语音识别集成

Whisper_CPP 是 OpenAI Whisper 模型的 C++ 高性能实现版本,相比原生 Python 实现,Whisper_CPP 具有更快的推理速度和更低的内存占用。

支持的模型

Whisper_CPP 使用 GGML 格式模型文件(.bin 扩展名),支持以下模型:

模型文件参数量显存需求识别效果推荐场景
ggml-tiny.bin39M~1GB一般快速测试
ggml-base.bin74M~1GB较好日常简单场景
ggml-small.bin244M~2GB多语言识别
ggml-medium.bin769M~5GB很好高精度识别
ggml-large-v1.bin1550M~10GB大模型 v1
ggml-large-v2.bin1550M~10GB很好大模型 v2
ggml-large-v3.bin1550M~10GB最佳最高精度
ggml-large-v3-turbo.bin1550M~10GB效果速度均衡推荐首选

Windows 系统

自 v4.08 版本起,windows上第一次使用时将自动下载[预编译GPU版本whisper-cublas-12.4.0-bin-x64.zip ]并解压到 软件目录/whisper-cpp文件夹内。

如果你想使用其他版本,可以自行打开该地址 https://github.com/ggml-org/whisper.cpp/releases/tag/v1.9.1 然后下载标有 Win32x64的压缩包,解压后将Releases内的所有文件复制覆盖到 软件目录/whisper-cpp文件夹内即可

macOS或Linux 系统

这2个系统下,你需要根据操作系统,下载符合该系统对应的预编译包,并将解压后的二进制文件和依赖复制到软件目录/whisper-cpp内,并赋予whisper-cli文件可执行权限。

如果不存在预编译包,需你自行根据仓库文档说明本地编译,然后将编译产物及so等依赖库复制到软件目录/whisper-cpp内,确保存在whisper-cli可执行文件。

下载载模型文件

模型文件在需要时会自动从以下地址下载 GGML 格式模型文件:

下载后将 .bin 文件放入 软件目录/models 文件夹内。

添加额外关键参数说明

可在 pyVideoTrans 软件目录下,即 sp.exe 同目录下创建一个 pyvideotrans.txt文本,自定义额外参数

常见问题

问题可能原因解决方法
whisper-cli.exe 无法启动缺少 VC++ 运行库安装 Microsoft Visual C++ Redistributable
提示找不到模型文件模型未下载或路径错误.bin 模型文件放入 models/ 目录
GPU 加速未生效CUDA/Vulkan 环境未配置安装对应版本的 CUDA Toolkit 或更新显卡驱动
识别速度很慢使用了 CPU 版本下载对应的 CUDA 加速版本并正确配置
识别结果不准模型太小或语言设置错误使用更大的模型,确认语言设置正确
路径包含中文报错程序路径不支持中文将 pyVideoTrans 解压到不含中文路径的文件夹