资讯动态

Agent-Native模型的架构代价:4B参数量如何撑起结构化决策

发布时间:2026/10/9 22:36:10 来源:尧图企业网站定制
Agent-Native模型的架构代价4B参数量如何撑起结构化决策【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B2026年9月基元律动TokenRhythm联合无问芯穹、清华大学、北京大学、阿里巴巴发布首个Agent-Native模型NeoHorse-1这家由前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创办的公司将此前开源Routing Harness系统OpenSquilla的执行轨迹经验反哺到模型训练中。作为该系列的开源4B版本NeoHorse-1-4B在README.md中被明确定义为一条通向递归自我改进RSI的原型路径。但真正值得工程界拆解的是另一个问题当通用大模型在卷参数、卷推理深度时一个4B模型凭什么敢自称Agent-Native又凭什么在tau²-Bench上跑出88.46的高分本文将从仓库源码出发拆解这个4B模型的架构账本Agent-Native与通用模型的本质差异、参数在混合架构中的分配方式、结构化输出约束如何与推理效率共存以及它在多步规划与复杂推理上的明确天花板。Agent-Native与通用模型从自由文本到动作接口通用聊天模型的核心契约是生成一段合理文本而Agent-Native模型的核心契约是在一个回合内做出正确的动作决策。两者的差异首先体现在对话协议层。打开仓库的chat_template.jinja可以看到这套模板为Agent执行设计了完整的结构化协议系统提示词注入# Tools与tools.../tools包裹的函数JSON Schema列表模型必须遵循严格的XML动作语法tool_call内嵌套function函数名与parameter参数名块模板强制声明如果选择调用函数只能以如下格式回复且不得附加任何后缀NO suffix推理过程与动作输出分离思考内容写入think.../think动作输出在/think之后工具返回结果统一包裹在tool_response.../tool_response中且模板通过从后向前扫描用户消息的multi_step_tool逻辑识别多轮工具调用后真正的最终用户查询从而正确处理长Agent轨迹。这套协议解决的是通用模型最常见的Agent事故——嘴上说要调函数正文却输出了散文。结构化动作语法把决策输出压缩成机器可直接解析的指令配合vLLM的--tool-call-parser qwen3_coder等推理侧解析器让模型说人话与系统执行动作之间不再需要脆弱的正则兜底。而训练的差异更为根本。据技术报告与澎湃新闻披露NeoHorse-1的训练语料以OpenSquilla Routing Harness产生的执行轨迹为核心每条轨迹完整保留能力需求预测、路由选择、模型响应、工具调用与环境反馈并经目标完成度、证据一致性、错误恢复等质量评估后才进入后训练。READMEE中将其总结为两条技术路线——路由引导的课程式SFTrouting-guided curriculum SFT与路由引导的on-policy蒸馏把执行轨迹转化为训练信号同时在每个响应周围保留执行与harness上下文。换言之这个模型不是学会聊天后顺便会用工具而是在决策轨迹中长大。4B的容量账本参数到底花在了哪里4B参数放在Agent场景里意味着什么先看config.json给出的骨架词表248,320、隐层维度2,560、FFN中间层9,216、共32层Transformer、权重共享tie_word_embeddings: true、BF16精度。而model.safetensors.index.json的元数据显示全部权重占用8,411,502,592字节——按BF16每个参数2字节折算实际参数量约为4.2B。做一个能验证的粗粒度分解词嵌入矩阵248,320 × 2,560 ≈ 6.36亿参数约占4.2B的15%且输出头与嵌入共享tie同一份矩阵承担双向职责MLP块每层3个投影gate/up/down约2,560×9,216×3 ≈ 7,080万参数32层合计约22.6亿占总参数的54%——这是容量的大头也是知识存储的主要场所注意力与其余部分约13亿参数分布于注意力投影、各类LayerNorm与MTP多token预测头中。这个分配比例透露了Agent-Native的取向容量向知识存量和转换能力倾斜而非向注意力深度倾斜。更关键的是注意力本身的结构——这是本仓库架构上最值得注意的一点。混合注意力用1/4的全注意力换取百万级上下文config.json的layer_types数组是一份精确的路线图32层中第3、7、11、15、19、23、27、31层为full_attention全注意力其余24层为linear_attention线性注意力间隔固定为4full_attention_interval: 4。而线性注意力层拥有典型的Mamba风格参数集in_proj_qkv、in_proj_z/a/b、conv1d、dt_bias、A_log且mamba_ssm_dtype明确设为float32。这是一个混合状态空间设计24层线性注意力提供O(n)的序列复杂度与廉价的KV状态8层全注意力每4层插入一层负责全局关系建模的精度。两者的比例是3:1——这正是4B模型能原生支持262,144 token上下文config.json中max_position_embeddingsREADME宣称可扩展至约101万token的底层原因。对比同规模纯Transformer262K上下文意味着不可想象的KV缓存开销而线性注意力以固定大小的隐状态近似长程记忆配合rope_theta: 10,000,000的mrope位置编码让长任务轨迹全程可见成为可能。Agent任务恰恰是长上下文的受益者多轮工具调用、逐步累积的环境反馈、跨步骤的状态跟踪都可能让单条会话膨胀到数万token。若KV缓存随长度线性爆炸4B模型在消费级硬件上根本跑不动Agent工作流。混合注意力在这里是架构级的部署策略而不只是精度指标的游戏。约束输出与推理效率两种确定性的平衡Agent-Native模型面临一对张力决策需要确定性但推理需要探索性。仓库给出的评估协议揭示了官方视角——README.md记录的十项基准统一采用SGLang v0.5.17、temperature1.0、top_p0.95、top_k20、min_p0.0、presence_penalty1.5、repetition_penalty1.0且开启thinking模式enable_thinkingtrueforce_nonempty_contenttrue。presence_penalty拉到1.5说明官方评估刻意惩罚重复表达、鼓励探索性推理路径——这是对Agent任务有多条合法解的建模假设。而生产侧的逻辑恰恰相反社区围绕该系列模型的部署实践Ollama/llama.cpp/vLLM路线普遍建议决策场景将温度压到0.1甚至0、用guided decoding/JSON Schema做强约束输出。仓库里的chat_template.jinja也为无探索模式预留了开关enable_thinkingfalse时会注入一个空的think/think块直接把模型按进少想快做的通道。两种确定性在不同场景各取所需评估时用温度探索能力上界上线时用约束锁住格式下限。推理效率的另一个杠杆藏在mtp_num_hidden_layers: 1——模型带一层多token预测MTP头这是解码加速类投机解码的常见工程手段。结合权重共享与线性注意力NeoHorse-1-4B的部署下限被压到很低README给出的标准部署是SGLang/vLLM拉起OpenAI兼容服务python3 -m sglang.launch_server \ --model-path $MODEL_PATH \ --served-model-name neohorse-1-4b \ --host 0.0.0.0 --port 30000 \ --context-length 262144 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder--reasoning-parser qwen3与--tool-call-parser qwen3_coder两个参数正是为 推理块与tool_call动作块量身定制说明这套约束协议已被主流推理框架原生识别。基准验证Agent优先的取舍十项基准中NeoHorse-1-4B以64.87的宏平均领先Qwen3.5-4B达5.93分58.94。逐项看更能看清它的能力画像能力维度基准NeoHorse-1-4BΔ vs Qwen3.5-4B同场最佳AgenticQwenClawBench44.686.21自身AgenticWorkBuddy Bench34.419.79自身AgenticPinchBench77.336.14自身AgenticVitaBench32.0010.50Agents-A1-4B39.25AgenticBFCL v461.790.77Nanbeige-4.2-3B67.28Agentictau2-Bench88.464.17自身CodingHumanEval96.959.75Nanbeige-4.2-3B98.78CodingLiveCodeBench v659.435.72Nanbeige-4.2-3B72.50*指令遵循IFBench65.335.00Spark-X2.5-4B73.33指令遵循IFEval88.351.29Spark-X2.5-4B91.13数据出处README.md Evaluation一节。最亮眼的增量集中在Agentic组WorkBuddy Bench暴涨9.79分、QwenClawBench与PinchBench均6以上tau2-Bench以88.46登顶——这正对应其Agentic post-training的训练配方路由轨迹里最多的就是工具调用-反馈-修正的循环。而对比同场其他4B级对手它的强项是稳定全能和工具执行弱项也清晰可见。局限与天花板诚实的数据比任何宣传都有说服力这份表格同样标出了4B的边界多步规划仍是软肋VitaBench仅32.00明显落后于Agents-A1-4B39.25与Spark-X2.5-4B37.00。VitaBench这类考验模拟执行、长链推理的基准上24层线性注意力对复杂状态演化的建模能力不足以完全替代深层全注意力。社区对该系列模型的实测也印证格式合规与单步决策占优多步规划准确率偏低。工具调用广度受限BFCL v4以61.79排第三落后Nanbeige-4.2-3B约5.5分说明工具类型覆盖和复杂参数组合上的泛化仍有缺口。架构的自带包袱仓库是文本推理重打包版——tokenizer_config.json保留了完整的视觉特殊token|image_pad|、|vision_start|等但权重仅含语言模型部分。这意味着其继承自Qwen3.5-4B的词表与特殊token体系存在留白若未来要补视觉能力需要在既有协议上做增量。RSI仍是原型README对此表述得非常克制——当前闭环是评估-选择-更新的原型跨迭代延展该闭环是迈向RSI的下一步。Routing Harness产生的轨迹质量、能力需求估计的准确度决定了这个飞轮是自我强化还是原地空转。此外4B的容量天花板是客观存在的知识广度不如更大的底座复杂的深链推理需要更多全注意力层与更大的隐层维度。混合注意力架构省下的算力在Agent长程规划场景中会被需要更多思考步数部分抵消。选择NeoHorse-1-4B意味着接受一个明确的价值交换——用推理深度的上限换取结构化决策的稳定性、部署的低门槛与长上下文的可负担性。结语回看这个4B模型的架构代价参数没花在堆注意力深度上而是花在了知识密度大MLP、长程记忆混合注意力与动作协议结构化模板上。它证明了一个判断——Agent-Native并不是在通用模型上加一个function-calling开关而是一整套从训练轨迹、对话协议到推理部署都围绕决策动作重构的系统。tau2-Bench的88.46与WorkBuddy的9.79增量说明这条路走得通而VitaBench的32.00则提醒4B的Agent-Native目前更适合做高并发、强约束、单步决策密集的执行层大脑而非全权代理的规划中枢。对工程团队而言这份开源仓库Apache-2.0协议LICENSE的价值不在于又一个4B聊天模型而在于一个可观测的范本如何用1/4的全注意力、一套XML动作语法和一份路由轨迹训练配方在消费级硬件上让结构化决策真正落地。【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑