资讯动态

Buzz 离线语音转文字:3 个场景跑通第一次音频转录

发布时间:2026/9/7 4:58:31 来源:尧图企业网站定制
Buzz 离线语音转文字3 个场景跑通第一次音频转录【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的离线语音转文字工具音频转录和翻译全部在你的电脑上完成文件不需要上传到任何云端。它支持命令行方式批量处理一条buzz add命令就能把 MP3、WAV、视频文件转成 TXT 文本或 SRT、VTT 字幕。下面用 3 分钟带你跑通第一条转录命令再看 3 个常见场景、一份参数速查表和一条完整的批量处理工作流全程无需图形界面经验。 三分钟上手先安装 Buzz。它通过 pip 分发要求 Python 3.12 环境和已安装 ffmpegLinux 用户可能需要补装几个系统依赖详见 安装文档pip install buzz-captions装好后用下面这条命令完成第一次转录。它读取当前目录下的recording.mp3用默认的小模型自动检测语言并把结果导出为纯文本--hide-gui表示不弹出图形界面纯后台处理buzz add recording.mp3 --txt --hide-gui预期效果Buzz 会自动下载 tiny 模型首次运行稍慢模型缓存后不再下载处理完成后在音频文件同目录生成recording.txt内容就是带时间戳对齐的逐句转写文本。 三个场景解决实际问题场景一随手转一个音频文件你手里有一段会议录音或播客只是想快速拿到文字稿。用上面的最小命令即可--txt生成纯文本buzz add meeting.mp3 --txt --hide-gui预期效果处理结束后同目录出现meeting.txt打开即可看到按时间分段的转录结果。如果不确定音频是什么语言不传-l参数Buzz 会自动检测。场景二指定语言和模型生成带时间戳的字幕要处理中文课程录像并且希望字幕精确到单词、可以直接挂到播放器上。这条命令指定中文、用 medium 模型换取更高准确率同时生成 SRT 字幕和词级时间戳buzz add lecture.mp4 -l zh -s medium --srt --w --hide-gui预期效果同目录生成lecture.srt。-l zh告诉 Buzz 跳过语言检测直接按中文转录能明显减少错判-s medium把模型从默认 tiny 换大一号准确率提升但耗时更长。如果你的电脑没有独显可以把-m参数设为whispercpp它在 CPU 或核显上也能跑得比较快。场景三批量转录一个文件夹的录音你有一批英文采访录音想一次性全部转成字幕和文本。shell 的*.mp3通配符会把所有文件传给 Buzz-d指定输出目录避免结果散落在原目录buzz add interviews/*.mp3 -s small -l en --srt --txt -d ./transcripts --hide-gui预期效果./transcripts目录下每个录音各生成一份.srt和.txt文件数量与输入一致。 常用参数速查参数作用什么时候用-l, --language 代码指定语言如zh、en、ja已知音频语言时跳过自动检测、提高准确率-s, --model-size 大小选模型tiny / base / small / medium / large追求速度用 tiny追求准确率用 medium 以上-m, --model-type 类型选推理后端whisper / whispercpp / fasterwhisper / huggingface有 6GB 显存的 N 卡选 fasterwhisper无独显选 whispercpp--srt/--vtt/--txt输出对应格式的字幕或纯文本文件要挂字幕用 --srt只要文字稿用 --txt可叠加-d, --output-directory指定输出目录批量处理时集中存放结果-w, --word-timestamps生成单词级时间戳做精细字幕对齐、逐词高亮时-e, --extract-speech转录前先做语音分离背景音、音乐噪声明显的录音--hide-gui不弹出主窗口纯命令行运行脚本化、无显示器的服务器上 一条完整工作流假设podcasts/目录里有 5 个英文播客 MP3目标是全部转成 SRT 字幕 纯文本统一输出到output/。buzz add podcasts/*.mp3 -s small -l en --srt --txt -d ./output --hide-gui逐段拆解这条命令add唯一的子命令表示新建一个转录任务podcasts/*.mp3位置参数shell 展开后是 5 个输入文件Buzz 会逐个处理-s small用 small 模型速度和准确率折中适合批量任务-l en音频是英文直接指定可避免逐文件语言检测的开销和误判--srt --txt每个文件同时产出字幕和文字稿两种格式-d ./output所有结果写入output/目录而不是散落在podcasts/里--hide-gui不打开图形界面适合放进脚本或定时任务。处理完成后的对比输入是podcasts/下 5 个音频文件产出是output/下 5 组同名.srt与.txt文件。之后你可以在 Buzz 主界面打开这些文件查看、搜索和播放也可以直接交给字幕编辑工具。⚠️ 容易踩的 3 个坑第一次运行卡住或模型下载失败怎么办首次使用时 Buzz 会自动下载所选模型网络不稳定会中断。如果机器离线可以先在另一台联网电脑下载模型再整份拷贝到离线机的模型目录Linux 为~/.cache/Buzz也可以在偏好设置的 Models 页面点 Show file location 找到位置。转录速度太慢或者准确率不行怎么调小模型快但错得多大模型准但耗时长官方 FAQ 的建议是直接在你的语言上对比测试。机器有 6GB 以上显存的 N 卡就加-m fasterwhisper没有独显就-m whispercpp这两条路比默认 whisper 快很多。转完了但找不到输出文件默认结果生成在音频源文件同目录文件名与输入相同、只换扩展名。批量处理时建议始终加-d指定输出目录避免结果混进素材文件夹。Buzz 的核心价值在于转录全程本地完成隐私数据不出机器配合通配符和-d参数还能当批量字幕生产线用。建议你先拿一段 1 分钟左右的音频把「三分钟上手」那条命令跑通确认模型下载和输出文件都正常后再按场景章节逐步加参数。完整参数说明可参考 命令行文档想看实现细节可以读 CLI 源码。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价