资讯动态

Buzz 离线语音转文字完整指南:四步跑通你的第一个转写任务

发布时间:2026/9/6 18:44:16 来源:尧图企业网站定制
Buzz 离线语音转文字完整指南四步跑通你的第一个转写任务【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz如果你手头有一段两小时的访谈录音或者想把网课视频变成文字稿你可能正需要一种在本机就能完成音频转文字的解决方案。Buzz 就是这样一个开源工具它运行在你自己的电脑上基于 OpenAI 的 Whisper 语音识别模型一个专门把声音变成文字的 AI 模型完成离线语音转文字和翻译音频文件从头到尾不用离开你的设备。它支持 Windows、macOS 和 Linux可以输出 TXT、SRT、VTT 等格式也支持麦克风实时转写。这篇文章带你从安装一路走到批量自动化。先解决为什么用本地的问题把录音上传到云端转录服务虽然省事但有几点绕不开文件要经过别人的服务器敏感内容客户采访、医疗访谈、公司内部会议一旦上传就不可控部分长音频还涉及按量计费。Buzz 的思路相反转写模型下载后存在本地识别过程不联网隐私由你自己把关免费开源MIT 协议个人和团队使用都不花钱同一套操作逻辑覆盖文件转写、麦克风实时转写两种用法安装按你的系统选一条路macOS下载 dmg 安装包双击安装即可Intel 和 Apple Silicon 芯片都支持Windows运行安装程序。首次安装会弹出安全提示因为应用没有数字签名点更多信息 → 仍要运行即可Linux通过 Flatpak 或 Snap 商店安装例如 Flatpak 一行命令就能装好安装完成先别急着用。首次使用时 Buzz 会让你下载转写模型模型默认存在用户缓存目录设置里模型页面有显示文件位置按钮可以直达那个文件夹。四步完成第一次文件转写点工具栏的按钮或按 CtrlO选择音频或视频文件MP3、WAV、M4A、MP4 都行在任务栏选择任务转写或翻译成英语和语言。强烈建议手动指定语言——自动检测只靠开头几秒音频判断混合口音时容易猜错选择模型后点Run。第一次运行某个模型前会先下载之后就是本地计算状态变为 Completed 后双击这一行打开转写查看器双击任意一句可以回到原音对应位置试听官方对导入流程的详细字段说明在 docs/docs/usage/1_file_import.md里面的Initial prompt初始提示词可以填人名、专业术语能明显减少这类词的拼写错误。三个值得了解的核心能力转写查看器搜索、试听、识别说话人转写完成后的查看器不只是看一段文字支持关键词搜索长访谈里找某个说法直接定位有播放控制和倍速调节校对时可以 2 倍速快速过支持说话人识别speaker identification自动把同一段转写按谁说的分段多人对话整理起来快很多麦克风实时转写选好转写任务、语言和麦克风点 Record句子就会随说随出。它适合三类场合会议记录、演讲现场、给课程做实时字幕。录音开始后会出现Presentation window演示窗口选项可以把实时文字投到大屏幕上。官方文档特别提示实时转写对算力要求高建议用 Whisper.cpp 模型并选小尺寸档位。边转写边翻译任务选Translate to English后外语音频直接产出英文文本。如果你主要处理中文内容也可以把中文音频转成英文文本方便后续处理。模型怎么选一张表对号入座先说结论模型大小决定准还是快实现类型决定在你什么硬件上跑得动。模型尺寸Whisper 系列从最小到最大尺寸特点适合tiny最轻量、最快先跑通流程、低配设备base小而均衡日常转写small准确率明显提升有大量专有名词的音频medium更准速度慢不少不赶时间、追求质量large最准需求最高专业场景配合显卡官方 FAQ 里的经验之谈是没有万能答案建议在自己的语言上各试一遍。Large-V2 稳定Large-V3 更准但偶尔会无中生有编造词Turbo 则在速度和准确率之间取平衡。实现类型同一套模型的几种运行方式类型硬件情况说明Whisper.cpp无独显、集显、MacC 优化实现CPU 也能跑苹果电脑首选Faster WhisperN 卡且显存 ≥6GB比原版快很多显存占用更低Whisper原版大内存机器OpenAI 原始实现稳但慢Hugging Face各类设备支持上千种语言的 MMS 等定制模型OpenAI API本地硬件不够时走云端需要密钥不再纯离线下载和删除模型都在帮助 → 偏好设置 → 模型里完成。不用的模型删掉能省几十 GB 磁盘。三个高频场景的推荐设置 场景一访谈/播客做成字幕文件推荐设置模型Whisper.cpp small 或 medium勾选Word-Level Timings逐词时间戳让每个词都带时间点导出格式选 SRT操作步骤导入音频 → 勾选逐词时间戳 → 运行 → 完成后用内置的字幕调整功能或 Resize Transcript 插件把逐词结果合并成一行一句、长度合适的正式字幕行 → 导出 .srt可直接拖进视频剪辑软件。️ 场景二会议实时记录推荐设置Whisper.cpp tiny/base实时性优先准确率靠后续校对语言明确指定别用自动检测开启实时文本导出生成的文字会边转边写进一个 txt 文件方便接 OBS 等推流软件操作步骤选麦克风和语言 → 点 Record → 会议结束即停。需要投屏演示就打开演示窗口。 场景三文件夹自动批量转写在偏好设置里启用文件夹监控watch folder指定一个路径后往里丢的新文件会自动进入转写队列——出差路上把文件丢进网盘同步目录回家时文稿已经转好了。配合 Skip Already Transcribed 插件使用它先检查同名结果文件是否已存在已转过的直接标记 Skipped重复导入一个文件夹时不会白烧算力。进阶玩法命令行与插件Buzz 自带完整的 CLI命令行界面指在终端里用命令而不是鼠标操作应用的方式适合写脚本做批量任务。最常用的加一个转写任务并导出字幕一条命令就够buzz add --model-type whispercpp --model-size small --language zh --srt --vtt 访谈录音.mp3加上--hide-gui可以让主窗口隐藏纯后台跑。完整参数列表见 docs/docs/cli.md。从 1.4.5 版本开始Buzz 有插件系统内置插件包括AI Summary调用 OpenAI 兼容接口也可以是本机 Ollama给长转写生成摘要DeepFilterNet转写前自动降噪嘈杂录音的识别率会明显改善Export to DOCX把转写结果导出成 Word 文档Enhanced Language Detection先用本地小模型判断语言再转写适合语言未知的文件管理入口在帮助 → 插件可以开关、排序、改配置。想看插件怎么写直接读 buzz/plugins/ 目录下的源码内置插件就是现成模板。常见疑问现象 → 原因 → 解决1. Windows 安装时弹未知发布者警告原因安装包没有数字签名。解决点更多信息 → 仍要运行属于正常现象。2. 转写特别慢原因模型档位太高或没走 GPU。解决换 Whisper.cpp 实现 小一档模型N 卡用户可改用 Faster Whisper具体排查思路见 docs/docs/faq.md。3. 点运行后 Buzz 闪退原因模型文件下载不完整或损坏很常见。解决在偏好设置 → 模型里删掉该模型重新下载。另注意 Buzz 要求 CPU 支持 AVX2 指令集非常老的电脑无法运行。4. 录音报错提示麦克风访问失败原因系统隐私设置没给权限Windows 下常见错误码 PaErrorCode-9999。解决到设置 → 隐私 → 麦克风里确认 Buzz 有权限再检查杀毒软件是否拦截。5. 想在完全断网的机器上用原因模型需要先联网下载一次。解决在有网电脑上把模型下好整个模型缓存目录拷到离线机器相同位置项目里还附带了 scripts/download-models.py 脚本帮你提前备齐模型。Buzz 的价值不在于某个单点功能而在于离线转写 多种模型实现 实时/批量两种节奏这条完整链路小文件用 tiny 模型几分钟出稿正式交付用 medium 以上逐词校对会议室里直接开实时记录文件夹里堆多少文件它就消化多少。装好它、下载一个 base 模型、丢一段音频进去你的第一个转写文稿离你只有四步。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价