资讯动态

MiniCPM5-2B 发布:25 亿参数的端侧模型,凭什么在 2B 级开源榜上拿 SOTA(附部署方式)

发布时间:2026/9/10 6:46:53 来源:尧图企业网站定制
MiniCPM5-2B 是面壁智能 OpenBMB 团队于 2026 年 9 月 7 日开源的 2B 级端侧大语言模型,是 MiniCPM5 系列在 5 月发布的 1B 版本之后的第二款模型,采用标准 Llama 架构的稠密 Transformer,总参数量约 25.2 亿,原生支持 131072 Token 上下文,以 Apache 2.0 协议开放权重。官方公开的评测数据显示,它在同尺寸开源模型对比集中平均分 53.9,超过对比集中所有 4B 级模型的最高分 51.1,优势集中在代码、数学、长文本理解、工具调用和 Agent 任务。本文拆解它的架构参数、训练配方中的 RL OPD 蒸馏方法、vLLM/SGLang/Transformers 三种部署方式、GGUF/MLX/GPTQ 等发行版本的选择,以及端侧小模型和云端大模型在实际业务中该如何搭配。MiniCPM5-2B 是什么面向本地部署的 2B 级稠密模型MiniCPM5-2B 是 OpenBMB 面壁智能开源的端侧大语言模型,定位是小而强——在本地助手、编程 Agent、工具调用工作流和推理场景中,用 2B 的体量提供接近更大模型的能力,同时保持可以在消费级设备上运行的部署占用。官方公布的核心参数:项目参数架构标准 LlamaForCausalLM 稠密 Transformer总参数量2,516,756,480(非嵌入参数 1,981,982,720)层数42注意力头(GQA)16 个 Query 头 / 2 个 KV 头上下文长度131,072 Token开源协议Apache 2.0发布时间2026 年 9 月 7 日它和 5 月发布的 MiniCPM5-1B 采用同一套训练配方,只是把规模放大到 2B,官方的定位是给能承受更大部署占用、换取更强能力的用户。截至 2026 年 9 月 8 日,MiniCPM 仓库在 GitHub 上已有 1 万多颗 Star。评测成绩2B 级开源 SOTA并越级压过 4B 模型按官方公布的对比数据,MiniCPM5-2B 在同尺寸对比集中拿到 2B 级开源 SOTA,并且平均分超过了对比集里列出的所有更大模型。同尺寸对比对象:LFM2.5-2.6B、Qwen3.5-2B、Gemma-4-E2B-it越级参考对象:Qwen3.5-4B、granite-4.2-3B、Nemotron-3-Nano-4B、Gemma-4-E4B-it、LFM2.5-8B-A1B平均分:MiniCPM5-2B 为 53.9,对比集中更大模型的最高分为 51.1官方特别指出优势集中在五个方向:代码推理、数学推理、长文本理解、工具调用、多类 Agent 任务。需要注意的是,这些数据来自模型发布方自己选定的对比集和评测集,第三方独立复测结果尚未大规模出现,实际业务中建议用自己的任务样本做验证。训练配方分层数据管理 RL 教师 在线策略蒸馏MiniCPM5-2B 的训练是 UltraData 分层数据管理方法的完整实践,分为基础训练、中期训练、后训练三个阶段,并且把各阶段的训练数据一并开源。三阶段流程:基础训练:经过稳定训练和衰减训练两步,建立核心语言能力;语料以 Ultra-FineWeb、UltraX 等开源数据集为主中期训练:针对目标能力和目标数据分布做强化,代码数据采用 L0–L3 分级管理的 UltraData-Code后训练:先用 400B Token 的深度思考 SFT 数据建立推理和对话能力,再训练数学、代码、Agent、写作等领域的专项 RL 教师模型,最后用在线策略蒸馏(OPD)把多个教师合并回一个发布模型RL OPD 带来了什么:RL 阶段采用 JustRL II 中描述的基于 Critic 的算法,提升训练稳定性OPD 合并了 16 个 RL 训练出的专家模型,其中 5 个是 Agent 专家按官方数据,RL OPD 让推理与通用能力平均提升 10.96 分,Agent 能力提升 6.96 分OPD 直接复用各 RL 教师的训练 Prompt 做蒸馏数据,不需要额外构建语料随模型一起开源的数据集包括 UltraX(网页预训练)、UltraData-Code(分级代码数据)、UltraData-SFT-Agent-2609(50 万条 Agent 训练样本)、UltraData-RL-2609(8 万多条 RL 样本),这在小模型发布中并不常见,对想复现或二次训练的团队价值较高。怎么部署vLLM、SGLang、Transformers 三种方式官方 README 给出三种主流部署路径,其中工具调用场景推荐 SGLang。vLLM:pipinstallvllm0.21vllm serve openbmb/MiniCPM5-2B--port8000SGLang(工具调用推荐):pipinstallsglang[srt]0.5.16python-msglang.launch_server --model-path openbmb/MiniCPM5-2B--port30000\--tool-call-parser minicpm5MiniCPM5-2B 输出的是 XML 风格的工具调用,SGLang 内置的minicpm5解析器会把它转换为 OpenAI 兼容的tool_calls格式,现有 Agent 框架基本可以直接对接。Transformers:fromtransformersimportAutoModelForCausalLM,AutoTokenizer model_idopenbmb/MiniCPM5-2BtokenizerAutoTokenizer.from_pretrained(model_id)modelAutoModelForCausalLM.from_pretrained(model_id,torch_dtypeauto,device_mapauto)messages[{role:user,content:请简单介绍一下你自己。}]inputstokenizer.apply_chat_template(messages,tokenizeTrue,add_generation_promptTrue,enable_thinkingTrue,return_dictTrue,return_tensorspt,).to(model.device)outputsmodel.generate(**inputs,max_new_tokens128)print(tokenizer.decode(outputs[0][inputs[input_ids].shape[-1]:],skip_special_tokensTrue))要求transformers5.6。官方推荐采样参数为temperature1.0, top_p0.95,enable_thinkingTrue开启深度思考模式。**投机解码加速:**官方同时发布了 MiniCPM5-2B-DSpark 草稿模型(约 0.3B),在 SGLang 中通过--speculative-algorithm DSPARK启用,可以在不改变目标模型输出的前提下加速解码。发行版本怎么选BF16、GGUF、MLX、GPTQHugging Face 上的 MiniCPM5 collection 提供了多种格式,对应不同硬件:版本适用场景MiniCPM5-2B(BF16)NVIDIA GPU 服务端部署,vLLM/SGLang 首选MiniCPM5-2B-GGUFllama.cpp 生态,CPU 或低显存设备MiniCPM5-2B-MLXApple Silicon Mac 本地运行MiniCPM5-2B-GPTQ量化后的 GPU 部署,降低显存占用MiniCPM5-2B-SFT / Midtrain / Base二次训练、研究对比用的中间检查点MiniCPM5-2B-DSpark投机解码草稿模型,配合主模型使用从 Hugging Face 页面的下载量看,GGUF 版本在发布首日下载量已明显高于 BF16 原版,说明本地端侧运行是当前用户的主要用法。ModelScope 魔搭社区同步提供了全部版本,国内下载可优先走魔搭。端侧小模型和云端大模型怎么搭配MiniCPM5-2B 这类端侧模型的意义不是替代云端大模型,而是把一部分任务下沉到本地——低延迟、离线可用、数据不出设备,同时把复杂任务留给云端更大的模型处理。典型的分工方式:端侧承担:意图识别、简单问答、本地文档摘要、工具调用的路由与参数抽取、隐私敏感的预处理云端承担:复杂多步推理、长篇生成、需要最新知识的问答、对质量要求高的最终输出这种端云协同架构对云端接入层的要求是接口标准化和多模型可切换——端侧模型走 OpenAI 兼容接口,云端也走同样的接口,路由逻辑才能统一。国内可直接访问的七牛云AI大模型广场这类统一接入平台,汇聚多款主流大模型并按能力标签组织,可以作为端侧模型之上的云端能力补充,用同一套接口规范承接本地处理不了的任务。常见问题MiniCPM5-2B 需要多少显存?官方 README 没有给出显存的具体数字。按 25 亿参数估算,BF16 权重约 5GB,加上 KV 缓存后消费级显卡可以运行;GGUF 量化版本可在 CPU 或更低显存设备上运行,具体占用取决于量化位宽和上下文长度。MiniCPM5-2B 和 MiniCPM5-1B 该选哪个?两者训练配方相同,区别在规模。官方定位 2B 版给能承受更大部署占用、换取更强能力的用户;设备资源紧张或只需要轻量任务,选 1B;需要更好的代码、数学和 Agent 表现,选 2B。MiniCPM5-2B 可以商用吗?可以。模型以 Apache 2.0 协议开源,允许商用和修改,只需保留协议声明。MiniCPM5-2B 支持工具调用吗?支持。模型输出 XML 风格的工具调用,官方推荐用 SGLang 作为后端,内置解析器可以把它转换为 OpenAI 兼容的 tool_calls 格式,接入现有 Agent 框架不需要额外适配。MiniCPM5-2B 支持多长的上下文?原生支持 131,072 Token,官方在评测中把长文本理解列为其优势方向之一,适合本地长文档处理场景。结语MiniCPM5-2B 的发布延续了面壁智能端侧小模型的路线,值得关注的不只是 2B 级 SOTA 的成绩,更是它把训练数据、RL 教师方法和中间检查点一并开源的做法,给小模型社区提供了可复现的完整配方。以上信息来自 OpenBMB 官方 GitHub README 和 Hugging Face 模型页,截至 2026 年 9 月 9 日,评测数据为发布方自测结果,第三方复测尚待补充。延伸阅读MiniCPM GitHub 仓库https://github.com/OpenBMB/MiniCPMMiniCPM5 Hugging Face Collectionhttps://huggingface.co/collections/openbmb/minicpm5MiniCPM5-2B 模型页https://huggingface.co/openbmb/MiniCPM5-2BUltraData 分层数据管理论文https://arxiv.org/pdf/2602.09003七牛云AI 大模型广场https://www.qiniu.com/ai/models

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价