资讯动态

Whisper.cpp 本地部署教程:从克隆到跑通第一条音频

发布时间:2026/8/30 9:42:04 来源:尧图企业网站定制
Whisper.cpp 本地部署教程从克隆到跑通第一条音频【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cppWhisper.cpp 是 OpenAI Whisper 语音识别模型的 C/C 实现零外部依赖让你在任何机器上离线完成语音转文字。本文带你走完克隆仓库 → 下载模型 → 构建 → 跑通第一条 WAV 音频的完整流程让你独立上手本地部署与离线语音识别。先搞懂它是什么它解决什么问题你有一段会议录音、课程视频或访谈音频想把它转成文字又不想把音频上传到任何在线服务Whisper.cpp 就是为此而生的模型和推理全部跑在你自己的设备上音频数据不出本机。三条核心亮点纯 C/C无外部依赖核心实现就在 include/whisper.h 与 src/whisper.cpp 两个文件里克隆即可编译不折腾依赖全平台覆盖macOS、iOS、Android、Linux、FreeBSD、WindowsMSVC 与 MinGW、Raspberry Pi、WebAssembly 均受支持软硬优化到位Apple Silicon 走 Metal 与 Core MLx86 启用 AVX 指令集也支持 Vulkan、NVIDIA CUDA、OpenVINO、Ascend NPU 等多种加速路径开工前检查清单系统要求项目要求操作系统macOSIntel/Arm、Linux、Windows、FreeBSD、iOS、Android、Raspberry Pi编译器任意 C/C 编译器GCC、Clang 或 MSVC构建工具CMake版本控制Git可选ffmpeg仅当你要转码音频或下载更多示例音频时需要仓库地址仓库地址见此 GitCode 镜像克隆时直接使用这是全文唯一需要该地址的地方。一步步跑通第一步两条命令拿到代码克隆仓库并进入目录git clone https://link.gitcode.com/i/453f3824d8fda1a37548cafbf3922ea0 cd whisper.cpp第二步下载 ggml 格式的模型Whisper 模型需先转换为单文件的ggml格式仓库自带脚本一步完成。这里以 142 MiB 的base.en仅英文、精度与体积的平衡之选为例sh ./models/download-ggml-model.sh base.en脚本会把模型保存为models/ggml-base.en.bin。各型号磁盘占用见 models/README.mdtiny 75 MiB、base 142 MiB、small 466 MiB、medium 1.5 GiB、large 2.9 GiB内存占用约为磁盘体积的 1.52 倍。第三步编译项目用 CMake 两步完成构建产物输出到build/bin/cmake -B build cmake --build build --config Release图省事的话make等价于上面的 CMake 流程make base.en则一键完成下载模型 编译 对 samples 目录所有 WAV 跑推理的快速演示。第四步用自带样例音频验证仓库自带 11 秒的samples/jfk.wav样例运行推理工具whisper-cli./build/bin/whisper-cli -f samples/jfk.wav看到按时间戳分段的英文文字And so my fellow Americans...输出说明本地部署与离线语音识别全部跑通。想查看全部参数运行./build/bin/whisper-cli -h。注意whisper-cli只处理 16-bit WAV 文件你的音频若是 MP3/FLAC 等格式先做转换再运行。常用命令速查命令作用git clone https://link.gitcode.com/i/453f3824d8fda1a37548cafbf3922ea0克隆项目源码sh ./models/download-ggml-model.sh base.en下载指定型号 ggml 模型换tiny、small、medium、large-v3等同理cmake -B build初始化构建目录cmake --build build --config Release编译全部工具make base.en一键下载模型、编译并跑完 samples 目录所有 WAV./build/bin/whisper-cli -f samples/jfk.wav转写样例音频-m可指定其他模型./build/bin/whisper-cli -h查看全部命令行参数make -j samples下载更多示例音频并转为 16-bit WAVffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav把任意音频转成 16-bit WAV./build/bin/quantize models/ggml-base.en.bin models/ggml-base.en-q5_0.bin q5_0生成 Q5_0 量化模型省内存省磁盘卡住了怎么办音频转不动先转 16-bit WAV最常见的报错原因是音频格式不符。whisper-cli只认 16-bit WAV用ffmpeg转码后再喂给模型ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav转完用-f output.wav重新运行即可。内存不够跑不动大模型换小一号的按你的内存对号入座8 GB 内存以内建议tiny/base16 GB 可跑small32 GB 起再考虑medium。另外带.en后缀的模型只处理英文处理中文请使用不带.en的型号。也可以对大模型做量化压缩命令见上文速查表。参数和行为看不明白回仓库文档找完整功能说明Core ML、CUDA、Vulkan、量化、说话人分离等都在 README.md模型下载与转换细节在 models/README.md各类语言的绑定位于 bindings/ 目录。把第一条音频跑通只是起点换更大的模型提升精度或搭一个 HTTP 转写服务都是接下来的自然方向。完整文档随仓库一起提供祝你的离线语音识别之旅顺利。【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价