【免费下载链接】KAT-Coder-V2.5-Dev项目地址https://ai.gitcode.com/hf_mirrors/Kwaipilot/KAT-Coder-V2.5-Dev点击查看免费下载KAT-Coder-V2.5-Dev 是快手 Kwaipilot 团队在 KAT-Coder-V2.5 之后发布的开放权重版本以 Qwen3.6-35B-A3B 为基座、总参数量 35B 而仅激活 3B 参数的 MoE 模型专为 Agentic Coding智能体编程场景设计。本文以仓库 README.md 为主线结合 config.json、chat_template.jinja、tokenizer_config.json 等配置与源码级证据完整讲解其基准性能、SFTRL 后训练管线、四类推理框架的部署命令、Chat Completions 调用方式以及 262K 原生上下文与 YaRN 超长文本扩展方案。读完本文你将能直接上手部署并正确配置该模型的工具调用、思维保留与超长上下文能力。模型概览与仓库构成本仓库发布的是 KAT-Coder-V2.5-Dev 经后训练post-training后的模型权重已转换为 Hugging Face Transformers 标准格式可兼容 Hugging Face Transformers、vLLM、SGLang、KTransformers 等主流推理框架。需要特别说明两点README 原话强调仅含语言模型权重本次开放权重发布只提供语言模型text-only视觉/多模态组件不包含且不可用模型类型为qwen3_5_moe架构为Qwen3_5MoeForConditionalGeneration训练精度为 bfloat16。从 model.safetensors.index.json 可以验证权重结构索引文件记录的total_size为 69,321,221,376 字节约 69.3GB与 35B 参数量的 bf16 存储相符全部 13 个分片model-00000-of-00013.safetensors至model-00012-of-00013.safetensors的权重路径均以model.language_model.*为前缀——没有任何视觉塔vision tower权重与 README 的 text-only 声明一致。仓库中 safetensors 与图片文件均为 Git LFS 指针实体大文件需通过 LFS 拉取但索引与配置足以确认模型结构。核心架构参数来自 config.jsonconfig.json 的text_config给出了语言模型的完整结构关键参数如下参数值说明hidden_size2048隐藏层维度num_hidden_layers40隐藏层总数num_attention_heads16注意力头数head_dim 256num_key_value_heads2GQA 键值头数num_experts/num_experts_per_tok256 / 8专家总数 / 每 token 激活专家数即 3B 激活参数的来源moe_intermediate_size512每个专家 FFN 中间维度shared_expert_intermediate_size512共享专家中间维度max_position_embeddings262144原生最大上下文 262K tokenvocab_size248320词表大小rope_theta/partial_rotary_factor10000000 / 0.25RoPE 基频与部分旋转因子mrope_section[11, 11, 10]多模态 RoPE 分段仅配置保留值得注意的还有layer_types40 层采用linear_attention 与 full_attention 交替的混合注意力设计每 4 层插入一层 full attentionfull_attention_interval: 4其余为线性注意力层这有助于降低长上下文推理成本。generation_config.json中的默认采样参数为do_sample: true、temperature: 1.0、top_p: 0.95、top_k: 20EOS token 为 248046|im_end|/ 248044|endoftext|这些默认值与下文 API 示例中的参数一致。版本亮点性能提升与异常行为优化README 将 KAT-Coder-V2.5-Dev 的核心收益归纳为两点性能提升通过 SFT/RL 训练官方在相似参数规模的模型群体中取得了 Agentic Coding 领域的 SOTA 结果该表述为官方声明异常行为优化通过 RL 训练两类病态行为得到显著抑制——异常工具标签abnormal tool labels从 9.34% 降至 0.28%约 -9pp单轮连续重复single-turn continuous repetition从 0.34% 降至 0%。这些异常行为的治理与后训练阶段专门设计的奖励项直接相关详见下文后训练管线一节。基准性能与评测方法README 给出了 KAT-Coder-V2.5-Dev 在 7 项 Coding Agent 基准上与 7 个对照模型的完整对比下表完整继承自 README.md加粗列为该模型成绩BenchmarkKAT-Coder-V2.5-DevQwen3.5-27BQwen3.6-35BA3BGemma4-31BQwen3.5-35BA3BOrnith-1.0-35BGemma4-26BA4BQwen3-Coder-30BSWE-bench Verified69.4068.6064.4060.6058.6055.8035.8031.80SWE-bench Multilingual63.0057.6757.0049.3347.6751.6727.3320.67SWE-bench Pro45.9642.1340.6332.9738.0334.479.5819.84Terminal-Bench 2.141.0232.60 / 49.4434.8441.57 / 28.1032.0234.83 / 29.2032.5930.34 / 34.8326.1226.44 / 25.8035.9835.96 / 36.0020.9427.27 / 14.6013.5010.11 / 16.90PinchBench93.4390.7192.2185.5388.7591.6282.0172.3Scicode44.2025.5837.5333.1927.7330.3430.8418.27KAT-Code-Bench46.2144.8342.7637.9335.8633.1022.0615.17Terminal-Bench 2.1 的加粗数字为两个 agent harness 的平均值小号数字为各 harness 单独得分Terminus-2 / Claude Code。评测方法与配置README 原注评测方法表中所有指标均为官方在内部复现——下载公开模型权重通过 vLLM 或 SGLang 部署在统一的标准化流水线下评测不直接采信各模型的官方报告值。每个模型在每个评测集上仅测试一次仅在发现明显错误时重测。评测配置SWE-bench Verified / Multilingual / Pro、KAT-Code-Benchagentclaude_code2.1.195passk1temperature1.0top_p0.95256k ctxTerminal-Bench 2.1agentterminus-2 / claude_codepassk1temperature0.7top_p1.0256k ctxPinchBenchagentopenclaw2026.3.13passk1temperature0.7top_p1.0256k ctxScicodepassk1temperature0.6top_p1.0256k ctx。异常说明Qwen3.6-35BA3B 在 SWE-bench 三个测试集上的复现结果与官方存在约 10pp 差距官方认为是 harness 版本与测试集优化所致Qwen3.5-35BA3B 与 Gemma4-26B-A4B-it 在评测中频繁出现调用当前环境不支持的 MultiEdit 工具的幻觉这些偏差源于模型工具偏好与评测 harness 允许工具集不匹配而非模型本身能力缺陷。后训练管线SFT 与 RL 两阶段README 明确交代了模型的训练来源以广泛认可的 Qwen3.6-35B-A3B 为基座整体沿用 KAT-V2.5 的后训练配方数据构建、训练流水线、优化策略基本不变分两个阶段进行SFT在 127K 条样本上对基座进行监督微调RL在 SFT 模型之上进行强化学习训练。RL 阶段保留了 KAT-V2.5 验证过的四大技术设计Token-in-Token-outTITO一致性保证 rollout 与训练阶段的 token 序列严格一致避免因聊天模板、序列化或 tokenizer 行为差异造成的训练偏差截断重要性采样TIS缓解异步 rollout 带来的策略陈旧与 off-policy 问题截断重要性采样权重降低过大权重引发的方差与不稳定性可靠的沙箱与验证器系统性地检查沙箱与验证器的稳定性和正确性防止执行超时、环境错误或验证器误判被当作模型失败而污染奖励信号基于 harness 执行反馈的层次化奖励从 harness 提供的细粒度执行反馈构建层次化奖励使模型既能朝最终任务目标优化又能在未成功的轨迹中获得有意义的进展奖励提高失败样本的训练价值、提供更密集的奖励信号。Qwen3.6 特异的奖励适配Qwen3.6 的轨迹模式与 KAT-V2.5 阶段不同需要额外的奖励适配。官方实验显示初期使用简单的 0-1 二元奖励在第二个 epoch 就导致模型崩溃。轨迹分析发现随着训练推进模型越来越倾向于在单轮内发出大量并行工具调用偶发超过 70 个调用导致上下文快速膨胀、大量无效轨迹与执行错误最终破坏 RL 训练稳定性。为此官方在原层次化奖励之上补充了若干 Qwen3.6 特异的惩罚项包括但不限于单轮内过量的并行工具调用失败的工具调用空的工具调用块empty tool-call blocks大量重复内容。这些针对性的奖励调整有效抑制了病态工具使用与重复生成使 RL 训练稳定推进10 个 epoch验证了整体训练管线与 Qwen3.6 特异奖励设计的有效性与可行性。快速开始四种推理框架部署官方推荐通过 API 集成 KAT-Coder-V2.5-Dev以下命令均创建http://localhost:8000/v1的 OpenAI 兼容端点。部署前务必记住本次发布仅含语言模型权重无 vision tower多模态组件相关启动项需按各框架的纯文本模式处理。SGLang推荐 sglang0.5.10uv pip install sglang[all]标准版本8 卡张量并行最大上下文 262,144 tokenpython -m sglang.launch_server \ --model-path Kwaipilot/KAT-Coder-V2.5-Dev \ --port 8000 \ --tp-size 8 \ --mem-fraction-static 0.8 \ --context-length 262144 \ --reasoning-parser qwen3启用工具调用增加工具解析器python -m sglang.launch_server \ --model-path Kwaipilot/KAT-Coder-V2.5-Dev \ --port 8000 \ --tp-size 8 \ --mem-fraction-static 0.8 \ --context-length 262144 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder注意如果所用 SGLang 版本在加载时尝试构建多模态/视觉组件会因缺少视觉权重而启动失败此时应使用该版本的纯文本language-model-only选项参见python -m sglang.launch_server --help。vLLM推荐 vllm0.19.0uv pip install vllm --torch-backendauto注意--language-model-only标志必填。它让 vLLM 跳过视觉编码器与多模态 profiling不加该标志vLLM 会尝试初始化 checkpoint 中不存在的 vision-tower 权重而启动失败。标准版本vllm serve Kwaipilot/KAT-Coder-V2.5-Dev \ --port 8000 \ --tensor-parallel-size 8 \ --max-model-len 262144 \ --reasoning-parser qwen3 \ --language-model-only工具调用版本vllm serve Kwaipilot/KAT-Coder-V2.5-Dev \ --port 8000 \ --tensor-parallel-size 8 \ --max-model-len 262144 \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --language-model-onlyKTransformersKTransformers 是面向 CPU-GPU 异构计算的 LLM 推理优化框架。使用 KTransformers 运行 KAT-Coder-V2.5-Dev 的步骤参见官方 KTransformers 部署指南README 指引。Hugging Face TransformersTransformers 内置轻量级服务器适合快速测试与中等负载部署。需要最新版 transformers并安装accelerate以支持多 GPU分片加载pip install transformers[serving] accelerate启动服务模型将自动放置到可用的加速器上transformers serve Kwaipilot/KAT-Coder-V2.5-Dev --port 8000通过 Chat Completions API 调用环境准备使用 OpenAI Python SDK若未安装先升级并按需配置环境变量pip install -U openai # 按实际环境设置 export OPENAI_BASE_URLhttp://localhost:8000/v1 export OPENAI_API_KEYEMPTY纯文本输入from openai import OpenAI # 由环境变量配置 client OpenAI() messages [ {role: user, content: Type \I love KAT-Coder-V2.5-Dev\ backwards}, ] chat_response client.chat.completions.create( modelKwaipilot/KAT-Coder-V2.5-Dev, messagesmessages, max_tokens81920, temperature1.0, top_p0.95, presence_penalty1.5, extra_body{ top_k: 20, }, ) print(Chat response:, chat_response)上述采样参数temperature1.0、top_p0.95、top_k20与 generation_config.json 中的默认值一致。Instruct非思考模式KAT-Coder-V2.5-Dev 默认在回答前进行思考thinking。通过 API 参数可让模型直接输出而不思考from openai import OpenAI # 由环境变量配置 client OpenAI() messages [ {role: user, content: Write a Python function that returns the n-th Fibonacci number.}, ] chat_response client.chat.completions.create( modelKwaipilot/KAT-Coder-V2.5-Dev, messagesmessages, max_tokens32768, temperature0.7, top_p0.8, presence_penalty1.5, extra_body{ top_k: 20, chat_template_kwargs: {enable_thinking: False}, }, ) print(Chat response:, chat_response)从 chat_template.jinja 可以看到该行为的实现模板在生成 prompt 结尾add_generation_prompt分支中当enable_thinking为 false 时只写入空think\n\n/think\n\n否则写入think\n引导模型展开推理。保留历史思考Preserve Thinking默认情况下模型只保留处理最新一条用户消息时产生的思考块形成常见的中插思考interleaved thinking模式。KAT-Coder-V2.5-Dev 额外训练了保留并利用历史消息思考痕迹的能力可通过preserve_thinking选项开启from openai import OpenAI # 由环境变量配置 client OpenAI() messages [...] chat_response client.chat.completions.create( modelKwaipilot/KAT-Coder-V2.5-Dev, messagesmessages, max_tokens32768, temperature0.7, top_p0.8, presence_penalty1.5, extra_body{ top_k: 20, chat_template_kwargs: {preserve_thinking: True}, }, ) print(Chat response:, chat_response)该能力对 Agent 场景尤其有价值保留完整推理上下文可增强决策一致性多数情况下还能通过减少冗余推理降低整体 token 消耗同时改善 KV cache 利用率在思考与非思考两种模式下均能优化推理效率。从模板源码看preserve_thinking的实际效果是在渲染 assistant 消息时若preserve_thinking为真或该消息位于最近一次用户查询之后则把think\n{reasoning_content}\n/think块完整写回历史消息否则只保留内容、丢弃思考块。这也解释了interleaved thinking的成因。工具调用协议chat_template.jinja 解析KAT-Coder-V2.5-Dev 的工具调用格式在 chat_template.jinja 中定义且 tokenizer_config.json 为相关标记分配了独立 tokentool_call248058、/tool_call248059、tool_response248066、/tool_response248067、think248068、/think248069。当消息中携带tools时模板会在 system 消息中注入完整的工具说明并要求模型仅以指定 XML 格式回复函数调用tool_call functionexample_function_name parameterexample_parameter_1 value_1 /parameter parameterexample_parameter_2 This is the value for the second parameter that can span multiple lines /parameter /function /tool_call协议要点模板内置的IMPORTANT提示function...块必须嵌套在tool_call/tool_call内必需参数必须给出可以在函数调用前而非之后用自然语言附带可选推理若没有可用函数则正常作答且不提及函数调用。工具结果以tool_response.../tool_response包裹并归入 user 消息。README 中异常工具标签从 9.34% 降到 0.28%正是针对这类调用格式的病态输出治理成果。这也解释了为何 vLLM / SGLang 启动命令中需要指定--tool-call-parser qwen3_coder服务端解析器与模型训练时的模板格式必须严格对应。处理超长文本原生 262K 与 YaRN 扩展KAT-Coder-V2.5-Dev 原生支持最长262,144 token的上下文对应 config.json 的max_position_embeddings: 262144。对于输入输出总长超过该限制的长程任务README 推荐使用 RoPE 缩放技术如 YaRN处理目前 transformers、vLLM、KTransformers、SGLang 均支持。启用 YaRN 有两种途径方式一修改模型配置文件。将 config.json 中text_config.rope_parameters改为{ mrope_interleaved: true, mrope_section: [ 11, 11, 10 ], rope_type: yarn, rope_theta: 10000000, partial_rotary_factor: 0.25, factor: 4.0, original_max_position_embeddings: 262144 }对比当前仓库 config.json 中的默认值rope_type: default、无factor字段可看到 YaRN 方案只是把rope_type切换为yarn并补充缩放因子factor: 4.0与原始最大位置original_max_position_embeddings: 262144其余 mRoPE 参数保持不变——这保证了缩放前后位置编码的一致性。方式二命令行参数覆盖无需改动配置文件。vLLMVLLM_ALLOW_LONG_MAX_MODEL_LEN1 vllm serve ... --hf-overrides {text_config: {rope_parameters: {mrope_interleaved: true, mrope_section: [11, 11, 10], rope_type: yarn, rope_theta: 10000000, partial_rotary_factor: 0.25, factor: 4.0, original_max_position_embeddings: 262144}}} --max-model-len 1010000SGLang 与 KTransformersSGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN1 python -m sglang.launch_server ... --json-model-override-args {text_config: {rope_parameters: {mrope_interleaved: true, mrope_section: [11, 11, 10], rope_type: yarn, rope_theta: 10000000, partial_rotary_factor: 0.25, factor: 4.0, original_max_position_embeddings: 262144}}} --context-length 1010000两处环境变量VLLM_ALLOW_LONG_MAX_MODEL_LEN、SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN用于显式允许服务端覆盖比原生 262K 更长的上下文长度限制目标上下文 1,010,000 token 与factor: 4.0的缩放倍率相吻合。引用与进一步阅读若本文内容对你有帮助可引用 KAT-Coder 技术报告README.md 中的 Citation 条目eprint 编号 2607.054712026 年 7 月发布misc{katcoder_v25_2026, title{{KAT-Coder-V2.5 Technical Report}}, author{{KwaiKAT Team}}, year{2026}, month{July}, eprint{2607.05471}, archivePrefix{arXiv}, primaryClass{cs.AI} }如需进一步深入可继续阅读仓库中的 README.md官方原始说明与基准数据、config.json完整架构参数、chat_template.jinja聊天与工具调用模板实现、tokenizer_config.json特殊 token 定义以及 generation_config.json默认采样参数。需要说明的是本镜像中模型权重分片与图片为 Git LFS 指针文件实际拉取需经由 LFS且发布版本不含视觉组件一切多模态相关配置如vision_config、image_token_id仅作架构占位保留。赞分享【免费下载链接】KAT-Coder-V2.5-Dev项目地址https://ai.gitcode.com/hf_mirrors/Kwaipilot/KAT-Coder-V2.5-Dev点击查看免费下载相关推荐Nested Unet架构揭秘Unet-Segmentation-Pytorch中的嵌套U-Net实现Nested Unet架构揭秘Unet Segmentation Pytorch中的嵌套U Net实现 Unet Segmentation Pytorch N深度学习计算机视觉OpenCLIP框架开源多模态模型训练的最佳实践OpenCLIP框架开源多模态模型训练的最佳实践 OpenCLIP是一个由LAION社区支持的开源多模态学习框架采用双编码器架构实现图像和文本信息的高效融合多模态深度学习计算机视觉大模型PaddleSpeech SpeedySpeech 声学模型解析架构、训练配置与部署实践PaddleSpeech SpeedySpeech 声学模型解析架构、训练配置与部署实践 本篇技术指南聚焦 PaddleSpeech 中 paddlespee人工智能语音音频NLP媒体生成创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考