资讯动态

Buzz 离线音频转录完整指南:免费开源 Whisper 工具,把会议与视频变成字幕

发布时间:2026/9/7 18:49:53 来源:尧图企业网站定制
Buzz 离线音频转录完整指南免费开源 Whisper 工具把会议与视频变成字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz还在为一段两小时的访谈录音发愁吗Buzz是一个基于 OpenAIWhisper技术的免费开源转录工具它把音频转文字这件事完全放在你自己的电脑上完成——本地离线音频转录不上传云端、不收订阅费这是它和一切在线服务最根本的区别。为什么先想清楚Buzz 和云端转录怎么选装软件之前先花 30 秒判断它适不适合你。下面的对比表按实际使用体验整理帮助你快速定位。对比维度Buzz本地离线方案云端转录服务音频去了哪里全程留在本机不出设备需上传到第三方服务器直接成本软件免费开源成本你的电费常按音频时长计费量大时不划算网络要求首次下载模型后完全离线每次转写都依赖稳定网络速度上限取决于你的 CPU/GPU可自己加硬件受服务器排队和网络波动影响可改性开源可改模型、流程都能调功能固定黑盒使用什么时候选 Buzz音频涉及隐私客户访谈、内部会议、单次转写时长长按分钟计费会心疼、或你在无网环境工作出差、机房、外场录音。什么时候云端够用只是偶尔转一两分钟语音、对隐私不敏感、且不想折腾本地环境——直接用在线服务更省事不必勉强装 Buzz。一次性准备装好 Buzz 选对模型三大平台安装 BuzzWindows到项目的发行页面下载安装包双击安装即可macOS下载 DMG 挂载安装或用 Homebrew 安装Linux可用 Flatpak 或 Snap 安装仓库内flatpak/、snap/目录即对应打包配置。偏好从源码跑起来的用户也可以克隆仓库后按项目文档安装git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz首次启动4 个关键设置打开 Buzz 后按Ctrl,进入偏好设置建议先配好这 4 项后面就不用反复改了默认导出路径指定转录文件的落盘位置建议选一个固定目录导出文件名模板支持变量如{{ input_file_name }}、{{ task }}、{{ language }}、{{ date_time }}批量转写时文件不会重名打架默认语言如果你 90% 的音频是同一种语言直接设好省去每次选择默认模型按下文对照表选一个起步档位。模型选型对照表内存、速度与精度的取舍Buzz 内置 Whisper 的 5 个档位表中体积为常见量化版本的近似估算实际以下载页为准模型档位磁盘体积约相对速度精度定位适合谁Tiny~75MB最快勉强可读快速预览、老旧设备Base~142MB很快日常够用会议速记、草稿转写Small~466MB中等较稳大多数人的默认选择Medium~1.5GB较慢高术语多的专业内容Large~2.9GB最慢最高发布级成品、多语言起步建议内存 ≥8GB 直接选 Small内存 16GB 以上再考虑 Medium。模型会在首次使用时自动下载缓存在本机之后离线可用。三大工作流按你的场景走场景一处理已有音视频文件最常用适合谁手里已经有一堆 MP3、WAV、MP4、MKV 等文件要出文字。Buzz 支持 mp3、wav、m4a、ogg、flac 等音频和 mp4、mov、mkv、avi 等常见视频格式。关键操作按CtrlO添加一个或多个文件任务进入列表在任务行里确认模型和语言不确定语言就选自动检测Buzz 支持近百种语言含中文和粤语点击运行多文件会排队依次处理列表里能看到完成百分比。一个专业技巧音频里有固定专有名词公司名、人名、产品术语时在高级设置里填入初始提示initial prompt把这些词写进去误识别率会明显下降。要出字幕的话顺手打开词级时间戳。场景二实时录音转写会议/讲座/采访适合谁会议记录者、课程学生、采访记者——希望边说边出字的人。关键操作按CtrlR打开录音窗口选对输入麦克风点开始录音后Buzz 边录边转文字实时追加在下方可随时暂停结束后同样走导出流程。一个专业技巧实时模式对录音延迟敏感说话节奏快时可适当调大**转录间隔transcription step**参数让模型多攒一点再转比每句硬抢更稳回放核对时用CtrlP播放/暂停、CtrlShiftP重播当前段落逐句验证。场景三YouTube 视频转字幕适合谁想把网课、播客、别人频道里的长视频变成可搜索文字的人不用先手动下载视频。关键操作复制视频链接按CtrlU打开导入 URL 窗口粘贴指定语言或用自动检测选择模型Buzz 先抓取音频流再走和本地文件一样的转录流程完成后按你选的格式导出。一个专业技巧非英语视频一定要显式指定语言。语言猜错时 Whisper 容易把外语硬转成英语自动检测对短音频、口音重的内容并不可靠。结果加工从能读到能用转完只是开始Buzz 的转录查看器承担了把草稿变成品的活。时间轴微调用快捷键挪时间点每一段文字都带起止时间戳编辑文字的同时可以整体拖动时间点Ctrl方向键微移段落起点CtrlShift方向键微移段落终点CtrlG跳到当前正在播放的段落边听边改。字幕与声音不同步时这就是主要工具精确到毫秒级。字幕分割与合并按用途调整颗粒度Whisper 自动切出来的段落长短不一直接导 SRT 可能一句太长或碎成渣。字幕调整工具transcript resizer提供按标点、按每段最大时长/字符数、按段落间隔等规则重新切分和合并——比如把超过 8 字的行切开、把相邻两段间隔小于 0.3 秒的合并规则参数可以逐条调。为什么这样导出TXT / SRT / VTT / JSON 各管一摊Buzz 的导出菜单同时提供原文和译文两条线任务类型里除了 transcribe 还有翻译成英语每种格式对应明确用途TXT纯文本进笔记、喂分析软件、做检索底稿SRT带时间轴的标准字幕Premiere、剪映、Final Cut 都能直接导入VTT网页字幕贴到网页播放器用JSON给程序用的结构化数据Buzz 本身是开源的配合其插件机制与后处理管线plugins/post_processing.py可以进一步定制输出。导出前先改好文件名模板批量任务产出的文件才会整齐。更多细节可看官方文档docs/。更快更准GPU 加速与 3 个常见坑GPU 加速NVIDIA 用户 3 步提速装好 NVIDIA 显卡驱动确认 CUDA 环境可用Buzz 使用 CUDA 相关依赖首次运行时自动安装在模型设置中选择运行引擎让Whisper.cpp 或 Transformers 引擎走 GPU 后端重启任务同一段音频会明显更快。提速幅度与硬件强相关以下为 1080P 级配置下的示意性参考仅供参考计算方式1 小时音频的耗时量级纯 CPUSmall 模型约 30–60 分钟GPU 加速同模型约 5–15 分钟Apple Silicon 原生运行接近中端 GPU 水平CPU 党也有办法换小一档模型Large→Small通常比任何优化都见效转写时关掉吃内存的大程序。精度提升按顺序做这三件事先保录音源底噪大的音频换什么模型都救不回来加初始提示把术语表塞进 initial prompt升一档模型Small 不够就上 Medium比反复调参数有效。3 个常见坑的解法坑表现解法转得太慢长音频等待数小时降一档模型 GPU 加速 释放内存转得不准专名错、语言乱初始提示 显式指定语言 升模型导出不兼容剪辑软件打不开字幕确认目标软件认的格式多数要 SRT导出时选对应格式译文和原文分别导出真实落地三个短案例以下案例的收益数字为示例性估算用于说明典型用法带来的量级变化。案例一语言学研究生转访谈录音背景每月 20 小时访谈音频术语和方言词多做法Medium 模型 方言词表作为初始提示逐条转写后导出 TXT 进分析软件收益人工整理从每 10 小时音频约 4 小时压到 40 分钟以内专业词误识明显减少。案例二B 站科普 UP 主做双语字幕背景每周 3 支视频字幕全靠手打做法本地视频文件导入 Buzz转写中文后任务类型再跑一遍翻译成英语导出 SRT 进剪辑软件收益单支视频的字幕耗时从约 2 小时降到 30 分钟左右。案例三跨国项目经理的例会记录背景跨时区例会录音堆积纪要总是迟到做法会前按CtrlR实时录音转写会后打开转录结果核对修改导出 TXT 归档收益纪要产出时间从会后半天缩短到会后 10 分钟讨论要点不再靠回忆。效率进阶快捷键速查与进阶玩法Buzz 快捷键速查表以下快捷键取自项目默认配置buzz/settings/shortcut.py可在偏好设置的快捷键编辑器里改功能快捷键导入文件CtrlO导入 URLCtrlU打开录音窗口CtrlR打开偏好设置Ctrl,查看译文CtrlL搜索转录文本CtrlF播放/暂停音频CtrlP重播当前段CtrlShiftP微移段落终点CtrlShift左/右取消当前转写CtrlX文件夹监控与自定义模型 / API文件夹监控在偏好设置里指定一个投放目录把音频丢进去Buzz 会自动把它们加入转录队列任务来源里对应FOLDER_WATCH适合白天攒文件、晚上批量转的节奏自定义模型 / APIBuzz 的引擎层同时支持本地 Whisper、whisper.cpp 和 OpenAI 兼容接口——本地跑不动时也可以在设置里指向自建的 OpenAI 兼容 API 端点把重活分发给一台 GPU 服务器界面不变。行动清单今天按平台装好 Buzz用Ctrl,配好导出路径和文件名模板本周拿一段 5 分钟音频分别用 Base 和 Small 各转一次听一遍结果定下你的默认档位下次会议直接CtrlR实时录音转写会后 10 分钟导出 TXT有 NVIDIA 显卡确认 CUDA 可用切 GPU 引擎再转一次同一段音频对比耗时。工具就位之后剩下的只是习惯。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价