资讯动态

faster-whisper 快速上手指南:3 步跑出 4 倍速语音转文字

发布时间:2026/9/5 20:06:16 来源:尧图企业网站定制
faster-whisper 快速上手指南3 步跑出 4 倍速语音转文字【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 是用 CTranslate2 重写的 OpenAI Whisper 语音识别库。它在保持同样准确率的前提下比原版 Whisper 快最高 4 倍占用的显存和内存也更少。一行pip install faster-whisper就能装好无需额外配置 FFmpeg。你接下来就能用它把音频转成带时间戳的文字。你手里的音频又长又杂原版 Whisper 跑一段要等好几分钟。显存不够时大模型直接爆掉想省内存又只能牺牲精度。faster-whisper 用 8 位量化和批量推理把这两件事一起解决了。3 步装好 faster-whisper先装主库一条命令搞定pip install faster-whisper装完跑一段最小代码验证是否可用预期会打印出语言识别概率和带时间戳的文本from faster_whisper import WhisperModel model WhisperModel(tiny, devicecpu, compute_typeint8) segments, info model.transcribe(audio.mp3, beam_size5) print(语言:, info.language, 概率:, info.language_probability) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})注意segments是生成器只有你遍历它时才会真正开始转录。想立刻跑完就list(segments)一下。按设备选配置不同设备和内存下该选哪个模型、哪种精度按下表挑场景devicecompute_type说明有 GPU、追求速度cudafloat16显存够时的默认推荐有 GPU、显存紧张cudaint8_float16量化后显存约省一半纯 CPU、机器较新cpuint8内存占用最低纯 CPU、精度优先cpufloat32内存占用最高模型尺寸按需选tiny39M最快base74M、small244M、medium769M、large-v31550M逐级更准。首次按名字加载时会自动从 Hugging Face 下载对应的 CTranslate2 模型。核心用法基础转录就是上面那段加载模型、调用model.transcribe、遍历segments。几个高级能力各给一行关键代码️词级时间戳加word_timestampsTrue即可遍历segment.words拿到每个词的首尾时间。VAD 过滤静音加vad_filterTrue内置 Silero VAD 会剔除非语音段长音频更省时间。⚡批量推理用BatchedInferencePipeline包一层batch_size8起在 GPU 上能再快一个量级。from faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(turbo, devicecuda, compute_typefloat16) pipe BatchedInferencePipeline(model) segments, _ pipe.transcribe(audio.mp3, batch_size16)更多参数热词、condition_on_previous_text等看WhisperModel和 VAD 选项 的源码。避坑指南现象GPU 加载报 cuDNN / cuBLAS 找不到。原因NVIDIA 库缺失。最新版ctranslate2只支持 CUDA 12 cuDNN 9。解决pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*再按官方方式设好LD_LIBRARY_PATH。现象CUDA 11 或 cuDNN 8 环境起不来。原因新版引擎不再兼容。解决pip install --force-reinstall ctranslate23.24.0cuDNN 8 用4.4.0。现象大模型显存不足OOM。原因float16精度吃显存。解决把compute_type换成int8_float16或改用小模型。现象CPU 跑得太慢、对比结果对不上。原因线程数不一致会影响速度。解决OMP_NUM_THREADS4 python3 my_script.py固定线程数。先跑通tiny模型确认链路没问题再逐步换到large-v3和 GPU 量化配置。你的下一件事就是把一段真实音频丢进去看时间戳输出。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价