资讯动态

Buzz 本地离线音频转录指南:免费 3 步把录音变成文字和字幕

发布时间:2026/9/10 22:15:56 来源:尧图企业网站定制
Buzz 本地离线音频转录指南免费 3 步把录音变成文字和字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款完全本地运行的离线音频转录工具基于 OpenAI Whisper 模型在你的电脑上把录音、视频里的语音转成文字或翻译成英语并导出 TXT、SRT、VTT 等格式。它适合所有不希望把音频上传到云端、又想把声音变文字这件事自动化的人包括学生、内容创作者、会议记录和访谈整理者。它解决的是这几个真实痛点上传云端既花钱又有泄密风险。在线转写服务按分钟计费且商业会议、医疗访谈、未公开采访等素材一旦上传数据就离开了你的控制范围。Buzz 全程在本机推理音频文件不经过任何第三方服务器。断网环境无法工作。实验室、飞机上、内网隔离机器只要模型已经在本地缓存Buzz 就能照常转写。项目还附带 scripts/download-models.py 脚本可以先在联网机器上下载模型缓存再整体拷贝到离线机器使用详见 docs/docs/faq.md 第 7 条。长音频手工整理成本极高。几小时的访谈、课程录音靠人耳逐句打字既慢又容易漏。Buzz 输出带时间戳的逐句文本支持搜索、定位、播放联动整理工作从听写变成校对。核心能力一眼看懂按能力支柱归纳Buzz 提供以下四类核心能力文件与链接转写/翻译。导入本地音视频文件或粘贴 YouTube 链接自动拉取音频任务可选转录输出与语音同语言或翻译统一输出英语。支持 MP3、WAV、FLAC、MP4、AVI 等常见格式。实时麦克风转写。选择音频输入设备后边说边出字可打开独立的演示窗口放大展示用于现场讲解、直播加字幕、OBS 推流等场景。支持追加到上方/下方/追加并纠错三种实时模式。说话人识别。转写完成后可对多人口播录音做说话人分离自动给每段话打上标签你还能试听 10 秒随机片段来确认标签再重命名为真实姓名。字幕整形与导出。基于词级时间戳把原始转写重新切分成符合字幕规范的分句支持按静音间隔合并、按标点拆分、限制单行最大长度、延长显示时长导出 SRT/VTT 直接进剪辑软件。最短路径从安装到出结果整个链路只有 3 步安装。从项目官方发布渠道下载对应系统的安装包Windows.exe、macOS.dmg、Linux Flatpak 或 Snap安装完成即可启动无需配置 Python 环境。Linux 用户也可执行flatpak install flathub io.github.chidiwilliams.Buzz。导入并运行。点击工具栏图标或按Ctrl/Cmd O选择音视频文件在任务行选择任务类型、语言和模型点运行。首次运行某个模型会先自动下载到本地缓存后续转写不再需要联网。查看并导出。状态变为Completed后双击该行打开转录查看器逐句文本、时间戳、播放进度同步展示右上角即可导出 TXT/SRT/VTT。详细流程参考 docs/docs/usage/1_file_import.md。参数怎么选速度、精度与格式的权衡参数本质上是四个决策点每个都对应明确的取舍任务类型。选转录输出原语言文本选翻译则统一输出英语。跨语言场景法语访谈 → 英文稿必须选翻译否则模型会按原语言输出。语言。可留空让模型自动检测但官方建议手动指定因为自动检测在小片段上容易误判。已知语种时手动选能显著提升稳定性。模型与后端。这是最重要的权衡点模型尺寸从tiny、base、small、medium到large递增精度随尺寸上升耗时和显存需求也随之上升。后端决定跑在哪Whisper原版精度好但吃内存、Faster WhisperNVIDIA GPU 6GB 显存以上首选速度快、Whisper.cppC 实现Mac、集显、CPU 环境通用、Hugging Face支持 Parakeet、MMS 等定制模型。经验法则NVIDIA 独立显卡选 Faster Whisper small/mediumMac 或集显选 Whisper.cpp老 CPU 用 tiny/base 保速度。输出格式。TXT 是纯文字稿SRT/VTT 是字幕格式可同时勾选多个。需要后续做字幕整形时务必开启词级时间戳选项否则只能按最大长度粗暴重切。模型下载与管理在Help → Preferences → Models也可指定量化版本如q_5以节省显存详见 docs/docs/preferences.md。落地场景按任务拆解的典型用法给视频配字幕。导入 MP4 → 开启词级时间戳 → 选择 SRT 输出 → 运行完成后打开转录查看器点Resize设置单行最大长度、按标点拆分、按静音合并导出 SRT 直接导入剪辑软件。整条链路无需手工调整单行字幕长度。会议/访谈录音整理。导入录音 → 选large或small模型按硬件→ 转写完成后启用说话人识别 → 试听标签确认身份 → 重命名为真实姓名 → 勾选合并同一说话人连续句子 → 导出 TXT 或 DOCX。多人对话不再需要靠他说/她说猜。批量课程/播客归档。在偏好里设置监控文件夹把待转写文件丢进去即可自动进入队列同时启用跳过已转录插件重复导入同一批文件时不会重跑模型避免浪费算力。进阶扩展自动化、插件与命令行Buzz 的扩展点集中在三处可叠加使用文件夹监控。在偏好里指定目录新文件落盘即自动转写适合定时更新的播客、固定频次的录音归档。插件系统。在Help → Plugins里开关、排序、配置插件可用 URL 添加社区插件。内置插件包括AI 摘要转写完成后调用 OpenAI 兼容 API 生成摘要写入备注或独立文本文件Resize Transcript转写后自动按字幕规范重切分句Skip Already Transcribed识别已完成项避免重复转写Enhanced Language Detection用本地 Whisper tiny 模型预检语种多语种混排更稳Export to DOCX直接导出 Word 文档可选带时间戳DeepFilterNet 降噪转写前用本地模型去除背景噪声。命令行接口。适合脚本化批量任务示例buzz add --task transcribe --language zh --model-type whispercpp \ --model-size small --srt --vtt meeting.mp3更多参数与示例见 docs/docs/cli.md。适合谁、不适合谁边界与选型适合用 Buzz 的情况音频涉及隐私、合规、商业敏感不能上传第三方服务器工作环境断网或内网隔离需要批量、定时、可脚本化的转写流水线需要带时间戳的字幕产出且希望本地完成整形。需要谨慎或换方案的情况老 CPU无 AVX2 指令集无法运行这是硬性门槛追求极致精度且没有 GPU 时large模型在纯 CPU 上耗时较长建议改用Whisper.cpp small并接受精度折中需要调用云端 API 做实时翻译或摘要时Buzz 仍需联网访问 OpenAI 兼容接口并非完全零网络对零安装、开箱即用有强需求时在线服务上手更快但隐私与成本代价要自己权衡。选型速查硬件推荐后端推荐模型NVIDIA 独显 ≥6GB 显存Faster Whispersmall / mediumApple Silicon / 集显Whisper.cppsmall / medium老 CPUWhisper.cppCPU 模式tiny / base上手清单照着做就行下载并安装对应系统的 Buzz 安装包首次启动无报错即可在Help → Preferences → Models里下载一个small模型确认缓存目录可写导入一段 1~2 分钟的测试音频语言手动指定任务选转录点运行状态变为 Completed 后双击打开转录查看器确认时间戳、逐句文本、播放联动正常勾选词级时间戳重新转写一次进 Resize 工具试一次字幕整形导出 SRT打开Help → Plugins按需启用跳过已转录与Resize Transcript在偏好里配置监控文件夹把下一批待处理文件丢进去验证自动化链路。下一步从你手头最久没整理的一段录音开始跑通上面 7 步后把它接到监控文件夹里让后续同类文件自动进入队列。Buzz 把听写变成校对剩下的时间可以花在内容本身。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价