faster-whisper 本地部署同精度提速 4 倍实战指南【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper两小时客服录音走云 API 大概要 50 元加一小时等待放到本地一张 4GB 显存的显卡上faster-whisper 的 int8 模式只需 1 分 42 秒、1.5GB 内存。它是 OpenAI Whisper 的 CTranslate2 推理引擎重写版官方基准显示同等精度下比原版快 4 倍、少用近一半显存。下面是一份从安装到调参的本地部署指南。先说结论适合谁、不适合谁适合隐私敏感、必须本地部署的转录业务适合一次跑几百个音频文件的批量任务适合显存 4GB 上下、想靠 int8 量化省一半显存的机器适合有 NVIDIA GPU想用批量推理把 1 分多钟压进 17 秒的场景不适合手里只有 2 核 CPU 还要单文件转录whisper.cpp 更快不适合已有微调好的 Whisper 模型需要先转成 CTranslate2 格式三步跑起来从安装到第一条结果环境要求就一行Python 3.9。不需要系统级 FFmpeg音频解码由 PyAV 自带省掉一堆依赖。安装pip install faster-whisper最短可运行示例from faster_whisper import WhisperModel model WhisperModel(small, devicecpu, compute_typeint8) segments, info model.transcribe(tests/data/jfk.flac) print(f检测语言: {info.language}置信度: {info.language_probability:.2f}) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})两点注意transcribe返回的segments是生成器不遍历就不会真正转录模型首次加载会从 Hugging Face Hub 自动下载对应的 CTranslate2 权重tests/data/目录里有现成的测试音频可以直接用。预期输出形如检测语言: en置信度: 0.99... [00.00s - 03.68s] And so my fellow Americans...实测数据跟谁比、差多少官方基准用 13 分钟同一段音频对比GPUNVIDIA RTX 3070 Ti 8GBlarge-v2beam_size5CPUIntel Core i7-12700K 8 线程small实现精度 / 模式耗时显存 / 内存OpenAI Whisperfp162 分 23 秒4708MBwhisper.cppFlash Attentionfp161 分 05 秒4127MBfaster-whisperfp161 分 03 秒4525MBfaster-whisperint859 秒2926MBfaster-whisperbatch_size8int816 秒4500MBCPU 侧同一口径实现精度 / 模式耗时内存OpenAI Whisperfp326 分 58 秒2335MBwhisper.cppfp322 分 05 秒1049MBfaster-whisperint81 分 42 秒1477MBfaster-whisperbatch_size8int851 秒3608MB怎么读这两张表优势最明显的是「GPU int8」这一档比原版快 2.4 倍、显存只有 62%把 batch 拉满后 16 秒完成 13 分钟音频约为原版的 1/9transformers 实现则在 batch1 时直接 OOM。CPU 单线程对比里 whisper.cpp 占优faster-whisper 要开批量推理才能反超。让它更好用的 3 个技巧批量推理管线处理多路音频、或想把单文件也榨干 GPU 时用BatchedInferencePipeline替换原方法即可from faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(turbo, devicecuda, compute_typefloat16) pipeline BatchedInferencePipeline(modelmodel) segments, _ pipeline.transcribe(audio.mp3, batch_size16)基准里 fp16 下 13 分钟音频从 1 分 03 秒压到 17 秒batch_size86GB 显存。批量模式下 VAD 默认开启自动跳过静音。int8 量化显存只有一半、但精度不想让步时的开关model WhisperModel(large-v3, devicecuda, compute_typeint8_float16)同一张大卡上 VRAM 从 4525MB 降到 2926MB耗时 59 秒对 1 分 03 秒精度差距在误差范围内。VAD 静音过滤默认只砍掉超过 2 秒的静音min_silence_duration_ms2000对话间隙短时可收紧完整参数在 faster_whisper/vad.py 的VadOptions里segments, _ model.transcribe( audio.mp3, vad_filterTrue, vad_parametersdict(min_silence_duration_ms500), )注意threshold默认 0.5背景音乐重的素材别乱调低否则伴奏会被当人声切进来。按硬件抄作业一张表选配置硬件档位推荐模型compute_type说明8GB 显存3070 Ti / 4090large-v3 或 turbofloat16配合 batched 管线13 分钟音频 17 秒4~6GB 显存large-v3int8_float16约 2.9GB 显存59 秒跑完 13 分钟纯 CPU8 核smallint81.5GB 内存内存富余时开 batchedCUDA 11 老显卡small / mediumint8_float16先pip install --force-reinstall ctranslate23.24.0CPU 上建议显式控制线程例如OMP_NUM_THREADS8 python script.py基准就是在 8 线程下测的线程翻倍收益递减先按物理核数设。不 work 时按这个顺序排查症状cannot find CUDA library之类报错 → 原因新版 ctranslate2 只支持 CUDA 12 cuDNN 9旧环境不匹配 → 一行解决pip install --force-reinstall ctranslate23.24.0CUDA 11 / cuDNN 8。症状CUDA out of memory → 原因fp16 大模型显存不够 → 一行解决compute_type换成int8_float16batched 场景再降batch_size仍不够就换 medium 或拆短音频。症状感觉「比原版快不了多少」 → 原因segments是生成器没遍历就等于没转录或未用批量推理 → 一行解决segments list(segments)并改用BatchedInferencePipeline。症状静音处输出重复文本幻觉 → 原因解码器在无语音段瞎猜 → 一行解决加vad_filterTrue必要时调高no_speech_threshold默认 0.6。症状首次加载模型下载失败 → 原因模型权重默认从 Hugging Face Hub 拉取 → 一行解决手动下载Systran/faster-whisper-model后把本地目录路径直接传给WhisperModel()。faster-whisper 的定位就一句话把 Whisper 塞进 CTranslate2用量化和批量换速度让本地部署成本可控。下一步动作对照上面「按硬件抄作业」的档位表配好参数复跑一遍 benchmark/ 目录里的速度、内存与 WER 基准脚本验证收益。如果文中数据和你的实测有出入欢迎把机器型号、模型档位和耗时发回评论区帮后面抄作业的人避坑。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考