资讯动态

零基础部署Fun-ASR语音识别:Linux环境保姆级教程,小白也能搞定

发布时间:2026/10/9 0:00:47 来源:尧图企业网站定制
零基础部署Fun-ASR语音识别Linux环境保姆级教程小白也能搞定1. 教程概述1.1 什么是Fun-ASR-MLT-Nano-2512Fun-ASR-MLT-Nano-2512是阿里通义实验室推出的轻量级多语言语音识别模型具有以下特点多语言支持可识别31种语言包括中文、英文、日语、韩语等方言识别支持粤语等方言的准确识别轻量高效仅800M参数适合边缘设备部署开箱即用提供Web界面和Python API两种使用方式1.2 本教程能学到什么通过本教程您将掌握在Linux系统上从零部署Fun-ASR的全过程使用Web界面进行语音识别的操作方法通过Python API集成到自己的应用中常见问题的解决方法2. 环境准备2.1 硬件要求操作系统Ubuntu 20.04或更高版本内存至少8GB存储空间5GB以上可用空间GPU可选但推荐NVIDIA显卡性能更佳2.2 软件依赖确保系统中已安装Python 3.8pip包管理工具ffmpeg音频处理工具可以通过以下命令检查python3 --version pip --version ffmpeg -version如果缺少任何组件可以使用以下命令安装sudo apt update sudo apt install -y python3 python3-pip ffmpeg3. 项目部署3.1 获取项目文件首先创建一个工作目录并进入mkdir funasr_project cd funasr_project然后下载项目文件假设您已经获得了项目压缩包wget [项目下载链接] unzip Fun-ASR-MLT-Nano-2512.zip cd Fun-ASR-MLT-Nano-25123.2 安装Python依赖建议先创建虚拟环境python3 -m venv venv source venv/bin/activate然后安装所需依赖pip install -r requirements.txt这个过程可能需要几分钟时间具体取决于您的网络速度。4. 启动Web服务4.1 启动命令在项目目录下执行nohup python app.py /tmp/funasr_web.log 21 echo $! /tmp/funasr_web.pid这个命令会在后台启动服务并将进程ID保存到文件中。4.2 验证服务可以通过以下命令检查服务是否正常运行curl http://localhost:7860如果看到HTML响应说明服务已成功启动。4.3 访问Web界面在浏览器中访问http://localhost:7860首次访问时模型需要加载可能需要等待30-60秒。5. 使用Web界面5.1 基本功能Web界面提供以下功能上传音频文件支持MP3、WAV等格式选择识别语言可选开始识别按钮结果显示区域5.2 操作步骤点击上传音频按钮选择文件可选在下拉菜单中选择语言点击开始识别按钮等待识别完成结果将显示在下方5.3 示例测试项目自带了几个示例音频文件位于example/目录下。您可以尝试上传这些文件进行测试ls example/6. Python API使用6.1 基本调用创建一个Python脚本test.py内容如下from funasr import AutoModel model AutoModel( model., trust_remote_codeTrue, devicecuda:0 if torch.cuda.is_available() else cpu ) res model.generate( input[example/zh.mp3], cache{}, batch_size1, language中文, itnTrue ) print(res[0][text])6.2 运行脚本在虚拟环境中执行python test.py您将看到中文音频的识别结果。7. 常见问题解决7.1 模型加载慢首次运行时模型需要加载到内存这可能需要一些时间。后续调用会快很多。7.2 内存不足如果遇到内存不足的问题可以尝试关闭其他占用内存的程序使用CPU模式去掉devicecuda:0参数增加系统交换空间7.3 音频格式不支持确保您的音频文件是支持的格式MP3、WAV等。如果不确定可以用ffmpeg转换ffmpeg -i input.xxx -ar 16000 output.wav8. 服务管理8.1 查看服务状态ps aux | grep python app.py8.2 查看日志tail -f /tmp/funasr_web.log8.3 停止服务kill $(cat /tmp/funasr_web.pid)8.4 重启服务kill $(cat /tmp/funasr_web.pid) nohup python app.py /tmp/funasr_web.log 21 echo $! /tmp/funasr_web.pid9. 总结9.1 学习回顾通过本教程您已经学会了在Linux系统上部署Fun-ASR语音识别模型使用Web界面进行语音识别通过Python API集成语音识别功能常见问题的解决方法9.2 进阶建议如果您想进一步探索尝试识别其他语言的音频研究如何优化识别准确率探索将模型部署到生产环境的方法获取更多AI镜像想探索更多AI镜像和应用场景访问 CSDN星图镜像广场提供丰富的预置镜像覆盖大模型推理、图像生成、视频生成、模型微调等多个领域支持一键部署。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑