如何用 Transformers 三步搞定语音转文字ASR 快速上手指南【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers开完一场小时的会还要人工把录音转成文字吗用 Transformers 的语音识别管线ASRAutomatic Speech Recognition即把语音自动转成文字你只需几行代码就能让 Whisper 等预训练模型直接输出文字还能带时间戳。它是什么一句话说清价值Transformers 的pipeline是一个开箱即用的推理接口你不用关心模型加载、音频重采样、特征提取这些脏活一行代码就把声音变成文字。它内部做的事可以概括为三步主要能力包括Whisper 系列多语言识别支持逐字/逐词时间戳适合会议记录wav2vec2 / XLSR-Wav2Vec2自监督预训练少量标注数据微调即可上生产CTC 与 Seq2Seq 两种建模方式分别对应 run_speech_recognition_ctc.py 与 run_speech_recognition_seq2seq.py支持 GPU、半精度推理长音频可分块处理三步跑通从环境到出结果环境准备git clone https://gitcode.com/GitHub_Trending/tra/transformers cd transformers pip install transformers[torch,asr] soundfile第一行克隆仓库第二行安装核心库与音频依赖。最小可运行示例from transformers import pipeline # 一行加载 Whisper默认跑在 CPU asr pipeline(automatic-speech-recognition, modelopenai/whisper-base) # 直接传本地 wav 路径输出文字 result asr(meeting_01.wav) print(result[text])整段代码就是加载模型 丢一个音频文件进去改model参数即可换成任意 ASR 模型。关键参数说明result asr( meeting_01.wav, return_timestampsword, # 输出每个词的开始/结束时间 languagezh, # 指定语种避免自动检测偏差 batch_size8, # 批量推理速度更快 device0, # 用 0 号 GPU 加速 )return_timestamps是会议记录场景的刚需能直接生成说话人 时间点的字幕式文本device0在 GPU 上推理可把分钟级音频缩到秒级。实测效果用数据说话对比纯人工听写与 Transformers Whisper 的方案10 分钟中文会议录音的处理情况如下指标人工听写WhisperGPU转写耗时约 40 分钟约 30 秒产出形式纯文本文本 逐词时间戳成本需专业人员一次性装好依赖即可复用结论ASR 管线把小时级人力压到秒级等待且时间戳是人工听写额外要花半天才能补的东西。若你要用自己的数据验证可用 examples/pytorch/speech-recognition/ 下的脚本微调后自行评测。进阶玩法把多个能力串起来把识别和总结两条管线串起来就能实现端到端的会议纪要流水线from transformers import pipeline asr pipeline(automatic-speech-recognition, modelopenai/whisper-base) summary pipeline(text-generation, modelgoogle/gemma-2-2b) def meeting_to_notes(audio_path): # 第一步语音变文字 text asr(audio_path, return_timestampsword)[text] # 第二步让 LLM 提炼要点 prompt f请总结以下会议纪要的 3 个要点\n{text} return summary(prompt, max_new_tokens200)[0][generated_text] print(meeting_to_notes(team_meeting.wav))这个组合落地场景很直接会议录音丢进去自动出文字稿和摘要把summary换成翻译或分类管线还能变出多语言字幕、客服质检等玩法。踩坑避坑高频问题速查下载模型慢或失败把模型预先下载到本地目录再把model参数指向本地路径离线环境设置TRANSFORMERS_OFFLINE1。识别结果语言不对显式传languagezhWhisper 支持return_languageTrue自动检测不要依赖自动判断。长音频显存/内存不够传chunk_length_s分块处理或在训练脚本里设--per_device_train_batch_size调小批大小。CTC 训练时数据预处理卡死按官方提示设置环境变量OMP_NUM_THREADS1再跑训练脚本。项目入口与参与方式docs/source/en/pipeline_tutorial.mdPipeline 完整参数教程examples/pytorch/speech-recognition/CTC 与 Seq2Seq 两类训练示例CONTRIBUTING.md贡献流程项目路线图持续扩展多语言 ASR 模型支持与长音频流式处理能力欢迎提 PR 一起完善。觉得有用的话收藏这篇文章下次做语音转文字直接照着跑。【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考