资讯动态

Step-Audio-2-mini-Base 评测报告:方言识别 CER 9.85,迷你语音模型与旗舰差多少?

发布时间:2026/8/28 16:38:35 来源:尧图企业网站定制
Step-Audio-2-mini-Base 评测报告方言识别 CER 9.85迷你语音模型与旗舰差多少【免费下载链接】Step-Audio-2-mini-Base项目地址: https://ai.gitcode.com/StepFun/Step-Audio-2-mini-Base阶跃星辰StepFun开源了语音大模型 Step-Audio-2-mini-BaseStep-Audio 2 mini 系列的基础版Apache 2.0 许可。基于官方技术报告的多基准数据本报告的核心结论是在中文方言识别与旁语言学paralinguistic即语义之外由声音本身携带的信息理解上这款迷你模型已优于 GPT-4o 等商用接口与旗舰版 Step-Audio 2 的整体差距集中在推理维度感知与输出环节已基本对齐。评测口径六个任务、两类对手以及一个 Base 版本本报告数据全部取自随 Step-Audio 2 系列发布的官方技术报告与模型卡片覆盖六类任务多语种语音识别、旁语言信息理解、音频理解与推理MMAU、语音翻译、工具调用、语音对话URO-BenchU、R、O 分别指理解、推理、口语表达。对比对象分两组商用接口GPT-4o 系列与开源模型Kimi-Audio、Qwen-Omni、Qwen2.5-Omni、Omni-R1、Audio Flamingo 3。指标上识别类用 CER字错误率面向中文等字级语言与 WER词错误率面向英文越低越好其余基准为百分制得分越高越好。文中所有得分均指该 Base 版本的指令对齐版 Step-Audio 2 mini两者共用同一模型主体Base 版则面向微调场景。Base 版对二次开发的价值在于管线完整仓库内含模型权重28 层 Transformer、隐藏维度 3584、16K 上下文以及配套的 25Hz 语音分词器、CampPlus 说话人编码器、Flow 与 HiFT声码器声学组件可以直接在自有数据上训练并复现完整的语音输入-输出闭环。上图为官方模型卡片随附的多基准得分总览雷达图。阅读时建议关注各方向上 Step-Audio 2 系列与其余模型的相对距离而非单个绝对分数。语音识别普通话追平第一梯队方言是差距最大的场景普通话与英文两个平均数背后的排名变化中文识别AISHELL、AISHELL-2、FLEURS 中文、KeSpeech、WenetSpeech 共五个子集上Step-Audio 2 mini 平均 CER 为 3.19%比旗舰 Step-Audio 2 的 3.08% 仅高 0.11 个百分点而 GPT-4o Transcribe 为 14.05%、Qwen-Omni 为 4.81%。归因上25Hz 语音分词器先把音频压成离散 token 流语言模型只需处理 token 而非原始波形算力因此更多用于语言建模。英文侧mini 平均 WER 3.50%低于 GPT-4o Transcribe 的 4.50% 与 Kimi-Audio 的 4.18%在相对干净的 LibriSpeech clean 子集上mini 1.33% 与 Kimi-Audio 1.49% 几乎持平。方言子集89.58% 与 19.30% 的两极自研方言数据上海、四川、山西、安徽等口音是各模型分化最剧烈的板块GPT-4o Transcribe 平均错误率 40.49%Qwen-Omni 19.40%Step-Audio 2 mini 为 9.85%旗舰 Step-Audio 2 为 8.85%。单集极端差出现在上海话——GPT-4o 错误率 89.58%mini 为 19.30%相差约 70 个百分点。实际含义是对面向中文用户的语音产品而言方言往往是体验最先露馅的环节而这一板块也最集中地体现了 Step-Audio 2 系列的训练数据侧重。旁语言理解与口语对话不只听说了什么还听状态StepEval-Audio-Paralinguistic 在性别、年龄、音色、情绪、节奏等 11 个维度上考察模型对声音本身的判断与说话内容无关。mini 平均分 80.00GPT-4o Audio 为 43.45Qwen-Omni 44.18Kimi-Audio 49.64——与第一梯队最佳相差 30 分以上且性别判定一项拿到 100 分满分。再看 MMAU 音频理解基准mini 73.2GPT-4o Audio 58.1Audio Flamingo 3 为 73.1Omni-R1 77.0。两项合起来看听懂声音状态是开源 Step-Audio 2 系列领先幅度最清晰的板块。口语对话URO-Bench的图景则更细。中文 Basic 集mini 77.81GPT-4o Audio 78.59差距 0.78 分难度更高的 Pro 集上mini 69.57 为表内中文模型最高GPT-4o 67.10、Kimi-Audio 66.07。英文场景则反转mini Basic 集 74.36GPT-4o 为 84.54差距约 10 分。语音翻译CoVoST 2语音输入、文本输出上mini 平均分 39.29 反超旗舰 Step-Audio 2 的 39.26英译中单项 49.12 为全表最佳GPT-4o 为 29.61。可以这样概括mini 在中文对话与翻译任务上已达到旗舰水平甚至局部反超短板明确集中在英文口语场景。迷你版 vs 旗舰版差距集中在哪几个格子把 mini 与旗舰 Step-Audio 2 逐项并排模式很稳定。感知与输出维度两者接近URO-Bench 理解项 89.19 对 91.05口语表达项 84.12 对 86.08旁语言性别判定同为 100。推理维度差距则成倍放大MMAU 推理项 71.5 对 76.9URO-Bench 中文推理项 64.53 对 75.45识别侧英文 WER 3.50 对 3.14、中文 CER 3.19 对 3.08差距也维持在 0.1~0.4 个百分点。归因并不复杂——模型体量收缩时容量优先让位于深度推理链路感知与生成管线则几乎无损保留。对选型者的含义是高吞吐、偏感知、成本敏感的在线任务交给 mini 即可涉及音频多步推理的任务应保留旗舰接口或配合工具调用与检索来补齐。三条落地路径选型、上手与复现选型高频在线任务通话转写、方言场景、语音情绪标注用 mini 或基于 mini-Base 微调复杂推理保留旗舰接口兜底。理由上述数据显示这些任务上 mini 与旗舰差距在 1 分以内或个位数错误率而更小体量的推理成本更低。快速上手环境需 Python 3.10、PyTorch 2.3CUDA安装 transformers 4.49.0 等依赖后执行git clone https://gitcode.com/StepFun/Step-Audio-2-mini-Base拉取模型再运行官方示例脚本。理由仓库同时包含 25Hz 分词器与 Flow、HiFT 声学组件无需自行拼装管线即可得到完整语音输入-输出。复现与反馈基于官方 StepEval、URO-Bench 等评测集自建方言与旁语言 bad case 集做回归测试并把结果反馈给社区。理由仓库采用 Apache 2.0 许可bad case 数据对语音模型是最直接的贡献形态。从旗舰到 mini、从指令版到 Base 版Step-Audio 2 系列正用更小体量持续降低语音理解的部署门槛配合技术报告中列出的工具调用与多模态检索方向这条开源管线的下一版迭代值得继续跟踪。【免费下载链接】Step-Audio-2-mini-Base项目地址: https://ai.gitcode.com/StepFun/Step-Audio-2-mini-Base创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价