资讯动态

Buzz 本地音频转录实践指南:离线 Whisper 转写、字幕与说话人识别全解

发布时间:2026/9/10 17:03:49 来源:尧图企业网站定制
Buzz 本地音频转录实践指南离线 Whisper 转写、字幕与说话人识别全解【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款免费开源的本地音频转录工具基于 OpenAI 的 Whisper一款完全开源的语音识别模型运行在你自己的电脑上全程离线音频视频文件转写与翻译、麦克风实时听写结果可导出纯文本 TXT、带时间戳的 SRT字幕文件和 VTT网页字幕格式不需要把任何文件上传到服务器。本指南面向想把录音在本地变成文字的新手覆盖从安装到出第一个结果的完整操作、参数怎么配、以及监控文件夹和插件等批量能力。这个工具适合谁谁可以先不看Buzz 一次性解决三件事转写不花钱、音频不出本机、断网照样工作。如果你符合下面任一条值得放进工具箱处理商业会议、访谈、医患/师生录音等敏感素材不想上传到第三方服务器经常在没有网络的环境用电脑田野调查、列车、封闭会场做视频需要稳定产出字幕或者要批量转写长音频。建议跳过的人机器太老Buzz 要求 CPU 支持 AVX2 指令集大约 2013 年之前的电脑跑不了或者你需要的其实是丢进去一千小时音频、自动产出精修纪要——Buzz 输出的是带时间戳的原始转写文本最后的整理仍然靠人。和在线转写服务的第一处不同在线转写服务Buzz数据去向上传到第三方服务器文件始终留在本机费用按时长或订阅计费开源免费MIT 协议断网可用不可用完全可用模型提前下好即可算力来源对方服务器本机 CPU/GPUNVIDIA 显卡与 Apple Silicon 可加速交付物网页里复制TXT/SRT/VTT 文件落在本地文件夹一句话概括识别模型都是 WhisperBuzz 把算力位置从别人的机房搬回你自己的桌面顺带把隐私和费用问题一起解决。⚡ 从安装到第一次出结果的最短路径第 1 步安装。Windows 和 macOS 到项目官方下载页SourceForge取对应系统的安装包Linux 走 Flatpak 或 Snapflatpak install flathub io.github.chidiwilliams.Buzz如果你习惯 Python 生态也可以用pip install buzz-captions装包需要 Python 3.12 环境并先装好 ffmpeg。一个提醒Windows 安装包未做签名安装时会出现蓝色警告页点更多信息→仍要运行即可。第 2 步先下载模型。这一步最容易漏——Buzz 本体不带模型不下载就跑不了任务。菜单 Help → Preferences → Models选模型类型和大小点下载。普通办公电脑建议从small约 460MB开始large精度最高但耗时和内存占用能差出好几倍。下载完可以点Show file location看模型存放位置Linux 在用户目录下的.cache/Buzz。记住这个路径后面做完全离线部署会用到。第 3 步导入文件。三种方式点工具栏号、按 CtrlOmacOS 为 CmdO、直接把文件拖进窗口。MP3、WAV、FLAC、MP4 等常见音视频格式都认还支持粘贴 YouTube 链接Buzz 会把音频拉下来直接进流程。第 4 步选参数、点 Run。任务行保持默认转录、自动检测语言、刚下载的模型导出格式勾上 TXT点 Run。主界面是一个任务列表进度、状态、导出结果一目了然多个文件排队依次处理第 5 步打开结果。状态变为 Completed 后双击该行进入转录查看器全文和时间戳都在里面。核心功能逐个讲文件转录转写还是翻译解决什么把录音变文字或者直接变成英文。 怎么操作Task 字段两个选项——Transcribe 输出原语言Translate to English 把录音直接转成英文。法语访谈选后者出来的就是英文稿。 注意什么翻译成英语走的是 Whisper 模型自带能力完全离线。想翻译成中文等其他语言需要在偏好设置里配一个兼容 OpenAI 接口的 AI 服务本地 Ollama 也行Buzz 会逐句调它翻译。️ 实时转录边说边出字解决什么会议、课堂、访谈中要随说随有文字记录。 怎么操作在 Live recording 区选好麦克风、语言、模型点 Record文字随说话出现在屏幕上。可以同时打开演示窗口把实时文本投到大屏或投影仪上直播、现场演讲很实用。 注意什么实时转录很吃算力官方建议用 Whisper.cpp一个 C 优化的 Whisper 实现配小模型现代笔记本的核显就能做到接近实时。输出有三种模式新句追加在下方、追加在上方、追加并自动纠错会不断回改上一句最准但也最吃硬件。字幕整形把行长度收住解决什么原始字幕碎得没法看或一行长到屏幕放不下。 怎么操作转录查看器里点 Resize 按钮。如果转写时开了字级时间戳可以按三条规则重组字幕最大长度、按标点拆分、按静音间隔合并。还能给每段字幕统一延长停留时间让字幕在屏幕上多挂几秒。 注意什么转写时没开字级时间戳事后只能做粗合并开了就能精细重组而且只要原音频还在磁盘上Buzz 会分析音频里的静音点断句更准。说话人识别多人对话不靠猜解决什么访谈、会议录音里要分清谁说的。 怎么操作查看器里点Identify speakersBuzz 自动把句子聚类、逐段打标签。可以试听每位说话人约 10 秒的样例把标签改成真名保存时可勾选合并同一说话人的连续句子。 注意什么需要原音频文件还在本机Intel 芯片的 macOS 不支持此功能。转录查看器搜索、播放、精调时间戳解决什么转写出来之后核对、纠错、导出。 怎么操作双击任务行进入查看器时间戳表格、纯文本、译文三种显示模式可切换CtrlF 搜索点某行就跳转播放那一段播放速度 0.5×到 2× 可调勾上跟随音频文字自动滚动到当前播放位置单句可循环回放每行起止时间能用键盘以 0.5 秒为步长微调。 注意什么核对完用工具栏的导出按钮可以出 TXT、SRT、VTT、JSON 等格式。参数速查参数选项默认什么时候改任务转录 / 翻译成英语转录非英语录音想直接出英文时语言99 种以上语言代码自动检测已知语言时手动选比自动检测稳模型类型Whisper / Whisper.cpp / Faster Whisper / HuggingFace / OpenAI APIWhisper无 N 卡选 Whisper.cppN 卡显存 ≥6GB 可用 Faster Whisper模型大小tiny / base / small / medium / large含 v2/v3/turbotiny越大越准速度成比例下降导出格式TXT / SRT / VTTTXT多勾几个即一次出多份字级时间戳开 / 关关想事后精细重组字幕必须开提取语音开 / 关关录音嘈杂时先分离人声轨再识别初始提示词自由文本空填人名、地名、术语这些词识别率明显提升两个容易漏的点语言自动检测只参考音频开头几秒混合语言开头容易误判能手动选就手动选某个专业词反复被识别错先往初始提示词里填比换模型见效快。除任务参数外全局默认项在偏好设置里Ctrl/Cmd ,比如 AI 翻译用的 OpenAI 兼容接口密钥、默认导出文件名效率能力监控、插件与命令行文件夹监控在偏好设置里指定一个监控文件夹之后新放进来的音频自动开始转写不需要人守着。适合播客每周更新、课程录音攒一个文件夹这类场景配合下面的插件重放整个文件夹也不会重跑。插件系统1.4.5 起有插件机制Help → Plugins 里开关、拖拽排序、进各自设置页。当前内置六个AI Summary转写完成后调 AI 生成摘要存进备注或旁边的文本文件Resize Transcript转写后自动把字级片段重组成字幕大小的块等于自动执行上面的整形Skip Already Transcribed重复导入同一批文件时跳过已有结果的不浪费算力Enhanced Language Detection转录前先用本地小模型判定语言适合语言未知的素材Export to DOCX结果直接存成 Word 文档时间戳可带可不带DeepFilterNet 降噪转写前先跑一遍降噪模型嘈杂录音改善明显。插件源码结构可以看 plugins 目录自己写插件时照着抄骨架就行。命令行Buzz 带 CLI一条命令就能入队转写任务适合批量和定时脚本buzz add --task transcribe --language zh --srt --vtt meeting.mp3白话说把 meeting.mp3 按中文转录同时导出 SRT 和 VTT 两份字幕。再加--hide-gui可以后台跑不弹主窗口。三个真实场景学生把课程录音变成可检索的笔记导入讲座 MP3选 small 或 medium 模型跑完查看器切纯文本模式CtrlF 找关键词点行回放核对内容。时间戳版 TXT 相当于一份讲座索引复习时直接跳到对应时间点。视频创作者给视频配字幕导入 MP4高级设置里打开字级时间戳。任务结束后进 Resize把最大长度设为 20 字左右、勾按标点拆分字幕块立刻整齐导出 SRT 拖进剪辑软件字幕环节收工。职场会议纪要加说话人标签会前开实时转录演示窗口对准大屏文字随说随上墙。会后打开转写点识别说话人把自动标签改成同事名字导出 TXT纪要完成。全程本地不用担心讨论内容进了任何云服务。❓ 被问得最多的四个问题问完全离线的机器能用吗能。先在联网机器上下载好模型把整个模型目录拷到离线机对应位置Linux 是用户目录下.cache/BuzzWindows 在 AppData 的 Buzz 缓存目录。转写过程本身不碰网络模型就是本地文件。问转得太慢怎么办三个方向换小模型tiny/base 在老 CPU 上也能跑模型类型切 Whisper.cpp核显、纯 CPU 都支持有 6GB 以上显存的 N 卡就换 Faster Whisper速度比官方实现快数倍。问模型到底选哪个small/medium 覆盖多数日常。large-v2 在各语言上长期最稳large-v3 精度最高但偶尔会幻听写出音频里没有的词turbo 是速度和精度的折中。拿自己的素材各试一遍是唯一可靠办法。问电脑里正在放的声音不是麦克风怎么转装一个虚拟声卡把程序输出接到虚拟扬声器再在 Buzz 里把这个虚拟设备选成麦克风。macOS 常用 BlackHoleWindows 用 VB-CableLinux 用 pavucontrol 做路由。一句收尾一个现在就做的动作Buzz 的价值一句话把语音识别从要上传、要付费、要联网的服务变成装在电脑上就能用的本地工具。现在就可以做的下一步打开 Buzz下载一个 small 模型导入你手边任意一段会议或课程录音进度条走完你就有一份带时间戳的 TXT 了。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价