资讯动态

语音转文字连续加班三周后,我用这个开源工具一次性搞定了全部音频

发布时间:2026/8/13 13:29:04 来源:尧图企业网站定制
语音转文字连续加班三周后我用这个开源工具一次性搞定了全部音频【免费下载链接】AsrTools✨ AsrTools: Smart Voice-to-Text Tool | Efficient Batch Processing | User-Friendly Interface | No GPU Required | Supports SRT/TXT Output | Turn your audio into accurate text in an instant!项目地址: https://gitcode.com/gh_mirrors/as/AsrTools去年做人物专访项目我抱着录音笔跑了十几个受访者攒下将近二十个小时的音频。原以为写稿是重头戏没想到卡在最没技术含量的环节——转写。那段时间我每天下班就对着播放器听一句暂停一句敲进文档三周下来颈椎抗议、手腕酸疼而录音还有三分之一没碰。后来一个做自媒体的朋友看不过眼甩给我一个开源工具说把音频拖进去喝杯咖啡再回来字幕都给你排好了。这就是我今天想认真安利的项目——AsrTools一款基于 Python 的智能语音转文字工具主打免GPU、批量处理、开箱即用支持 SRT/TXT/ASS 字幕输出。给声音请一位不知疲倦的速记员先说说我一开始的疑问识别语音不都得装什么本地大模型、配显卡吗AsrTools 彻底颠覆了这个印象。它不依赖本地推理而是巧妙地对接了剪映、必剪、快手这些视频平台背后的语音识别能力把你要转写的音频借道云端处理。你可以把它想象成给声音请了一位速记员你把录音递过去它负责上传、排队、取回文字最后按时间轴给你排好版。整个过程中你的电脑只是个传话的所以哪怕是一台老旧办公本也照样跑得飞快。更贴心的是它默认开启了缓存机制。同一个文件转写过一次结果会按文件特征码缓存下来下次直接秒出不重复花时间也不重复消耗接口资源。五分钟把它请进你的电脑AsrTools 的使用门槛低到什么程度Windows 用户直接下载打包好的 Release 版本解压后双击AsrTools.exe就能用环境都不需要你自己配。习惯用命令行的朋友三行命令也能搞定git clone https://gitcode.com/gh_mirrors/as/AsrTools cd AsrTools pip install -r requirements.txt依赖清单非常克制——核心转写逻辑只需要requests想用图形界面才额外装PyQt5和PyQt-Fluent-Widgets。装完之后一句python asr_gui.py漂亮的主窗口就弹出来了。界面上手比想象中还要简单作为被各种丑界面荼毒过的人我得夸一句 AsrTools 的颜值。基于 PyQt5 和 qfluentwidgets 打造的界面布局清爽得像苹果系统自带的应用。整个窗口就分三个区域顶部选接口和格式中间拖文件底部看任务列表。看到截图里的绿色和橙色状态了吗绿色代表已处理橙色代表处理中一眼就能掌握全部进度。右键任意任务还会弹出快捷菜单识别效果不满意就重新处理加错了就删除任务想核对原文就打开文件目录不需要你去文件管理器里翻箱倒柜。三个引擎怎么选看这张表就够了界面上的选择接口下拉框藏着 AsrTools 的第二个杀手锏——它一口气内置了三种不同的语音识别引擎分别对应 B、J、K 三个接口。遇到识别效果不理想的场景换个引擎重试往往就有惊喜。接口对应平台适合场景B 接口必剪Bcut中规中矩的通用转写日常采访、会议够用J 接口剪映JianYing视频创作者的常用选项支持更细的时间戳控制K 接口快手KuaiShou另一个可用备胎多引擎对比时很有价值实际使用中我的经验是同一个音频文件A 引擎把专业术语听岔了B 引擎反而能识别对。三选一不满意就轮流试一遍反正换引擎的成本只是多等几分钟。批量处理才是效率爆炸的地方如果只是转写一个文件手动操作也勉强能忍。但回到我开头的困境——二十个小时的素材一个个文件来回折腾那才叫灾难。AsrTools 对这种情况简直是为我量身定做的。它支持把整个文件夹直接拖进窗口自动识别里面所有音频批量加入列表处理时默认开 3 个线程并发跑多个文件同时进行。更省心的是视频文件也能直接丢进去——程序会自动调用 ffmpeg 把视频里的音轨抽出来转成 mp3转完顺手在原目录生成字幕文件全程不需要你手动转换格式。我后来把攒下的几十段录音一次性全拖进去泡了杯茶的功夫回来文件目录里整整齐齐躺着对应的字幕文件。那种感觉就像攒了三周的脏衣服突然被洗衣机一次性洗完晾好。输出格式从记事本到视频字幕全覆盖转写只是第一步怎么用才是关键。AsrTools 在结果导出上也给了充足的选择自由处理完成后会自动在原音频目录生成字幕文件TXT纯文字版适合整理成采访稿、会议纪要不带时间轴干净利落SRT带时间轴的标准字幕格式丢进剪映、PR 就能直接挂到视频上ASS支持更多字幕样式定制进阶玩家做特效字幕用得上顺带一提底层的数据处理模块做得相当规整bk_asr/ASRData.py里封装了完整的格式转换逻辑支持 flac、m4a、mp3、wav 等常见音频格式。给爱折腾的人三行代码调用命令行版图形界面适合大多数人但如果你喜欢把工具嵌进自己的工作流里AsrTools 的核心库同样可以单独调用。参考项目自带的example.py逻辑简洁得惊人from bk_asr import JianYingASR asr JianYingASR(resources/test.mp3) result asr.run() print(result.to_srt())三行代码一个音频文件就被转成了带时间轴的字幕文本。这意味着你可以把它接入自己的 Python 脚本批量处理大批量音频、定时转写、甚至配合其他自动化流程玩法全看你脑洞。bk_asr/目录下每个引擎一个文件命名清晰想研究底层调用细节也很方便。避坑指南这几个细节先替你踩过用了一段时间也摸出了一些需要注意的地方提前告诉你省得走弯路视频转音频依赖 ffmpeg如果处理视频报错音频转换失败检查一下系统里装没装 ffmpeg处理依赖联网接口网络不稳定时建议分批添加任务别一口气塞太多接口属于共享型服务高峰期偶尔会慢耐心等一下或者换个接口都行中文路径偶尔会引发编码问题遇到异常优先试试把文件放到英文路径下别让转写吃掉你的创作时间回头看那三周的加班其实完全可以避免。转写本就不该是创作者的主业它是流程里最机械、最不该占用脑力的环节。AsrTools 的价值就在于把这段枯燥时间彻底压缩让你把精力放回真正重要的分析、写作和表达上。如果你也正被堆积如山的录音、会议、采访素材折磨不妨试试它。克隆一份到本地把音频拖进去点一下开始处理然后安心去做你真正该做的事。省下来的时间才是这款工具送你的最大礼物。【免费下载链接】AsrTools✨ AsrTools: Smart Voice-to-Text Tool | Efficient Batch Processing | User-Friendly Interface | No GPU Required | Supports SRT/TXT Output | Turn your audio into accurate text in an instant!项目地址: https://gitcode.com/gh_mirrors/as/AsrTools创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价