资讯动态

如何微调Kimi K2.5:KTransformers+LLaMA-Factory LoRA SFT教程,2×4090训练1T参数模型

发布时间:2026/10/4 19:11:46 来源:尧图企业网站定制
如何微调Kimi K2.5KTransformersLLaMA-Factory LoRA SFT教程2×4090训练1T参数模型【免费下载链接】Kimi-K2.5Open Visual Agentic Intelligence项目地址: https://gitcode.com/gh_mirrors/ki/Kimi-K2.5本文带你手把手微调 Kimi K2.5通过 KTransformers LLaMA-Factory 组合在2 块 409032GB×2的普通消费级显卡上用LoRA SFT监督微调训练这个1 万亿参数的开源多模态智能体大模型实测吞吐可达 44.55 token/s。无需 H100也能拥有自己的 Kimi。为什么 2×4090 能微调 1T 参数大模型先给结论靠的是MoE 稀疏架构 INT4 原生量化 CPU/GPU 混合卸载。MoE 架构Kimi K2.5 总参数 1T但每个 token 只激活32B参数384 个专家、每 token 选 8 个计算量远小于稠密模型原生 INT4 量化官方权重自带 INT4 量化显存/内存占用大幅下降KTransformers把 MoE 专家层卸载到 CPU 内存AMX/INT4 加速GPU 只承担注意力等关键算子用大内存换多显卡LLaMA-Factory LoRA只训练低秩适配矩阵可训练参数占比极小。参考硬件官方实测配置组件配置GPU2× NVIDIA RTX 4090CPUIntel Xeon 8488CAMX 加速内存1.97TB RAM 200G Swap实测吞吐LoRA SFT 约 44.55 token/s项目简介与模型架构详见 README.md完整评测与训练细节见 tech_report.pdf授权为 Modified MITLICENSE。环境准备安装 KTransformers 与 LLaMA-Factory1️⃣ 拉取模型与配置模型权重Kimi-K2.5原生 INT4可从官方模型库下载本仓库提供部署与微调的参考配置git clone https://gitcode.com/gh_mirrors/ki/Kimi-K2.52️⃣ 安装训练栈需要安装KTransformersCPU 推理内核与LLaMA-FactorySFT 框架并保证transformers版本不低于4.57.1官方部署指南要求见 docs/deploy_guidance.mdpip install ktransformers llamafactory pip install -U transformers4.57.1 KTransformers 的 SFT 安装细节较多依赖 AMX 编译等以 KTransformers 官方 SFT 安装指南为准本文只关注能跑通。准备 LoRA SFT 训练配置KTransformers 官方提供了现成的配置文件核心思路是只训练 LoRA 模块rank 适中目标模块为 attention 投影1T 权重本身冻结专家层放 CPUMoE 部分由 KTransformers 在 CPU 上以 INT4/AMX 方式前向数据集LLaMA-Factory 标准 ShareGPT / 自定义 alpaca 格式数据集均可。配置文件位置训练配置examples/train_lora/kimik2_lora_sft_kt.yaml推理配置examples/inference/kimik2_lora_sft_kt.yaml新手建议只改三处dataset你的数据、output_dir产物目录、max_length训练截断长度建议先压到 4K~8K别直接上 256K 上下文显存/内存会失控。一键启动训练最简 LoRA SFT 命令关键只有一个环境变量USE_KT1它告诉 LLaMA-Factory 用 KTransformers 作为推理后端# 启动 LoRA SFT 训练 USE_KT1 llamafactory-cli train examples/train_lora/kimik2_lora_sft_kt.yaml训练时建议盯三个指标loss 曲线正常应缓慢下降内存占用1T INT4 权重约需 600GB 物理内存必要时把 Swap 加到 200G 以上显存2×4090 下若 OOM优先调小per_device_train_batch_size或max_length。训练完成后聊天与 API 部署微调结束后LLaMA-Factory 可以直接加载合并权重两种方式一键切换# 交互式对话 llamafactory-cli chat examples/inference/kimik2_lora_sft_kt.yaml # 以 OpenAI 兼容 API 服务方式启动 llamafactory-cli api examples/inference/kimik2_lora_sft_kt.yaml对话/服务参数小贴士来自官方说明Thinking 模式建议temperature1.0Instant 模式建议0.6top_p0.95更多推理引擎vLLM、SGLang部署方式见 docs/deploy_guidance.md。常见问题与避坑清单❓为什么必须设USE_KT1不开启 KTransformers 后端时1T 权重会尝试全部塞进 2×32GB 显存直接 OOM。❓内存不够怎么办INT4 权重 优化器状态是内存大头优先加 Swap其次降低 batch 与序列长度。❓训练很慢正常吗MoE 混合卸载下 44.55 token/s 是官方实测水平对 LoRA 小数据集几千条完全可接受。❓能直接全量微调吗不建议。1T 全量 SFT 即使 INT4 也需要远超消费级的资源LoRA 是性价比最高的路线。❓微调会破坏原能力吗LoRA 是可插拔适配不需要时可随时卸载基座能力保留。总结2×4090 微调 1T 参数模型的操作清单安装 KTransformers LLaMA-Factorytransformers≥4.57.1下载 Kimi-K2.5 原生 INT4 权重修改kimik2_lora_sft_kt.yaml的数据集与输出路径USE_KT1 llamafactory-cli train ...启动训练llamafactory-cli chat / api验证与上线。按这套流程消费级双卡 大内存服务器就能完成 1T 参数模型的个性化微调。想深入了解架构与评测数据可阅读 tech_report.pdf 与 README.md 中的 Model Summary 章节。【免费下载链接】Kimi-K2.5Open Visual Agentic Intelligence项目地址: https://gitcode.com/gh_mirrors/ki/Kimi-K2.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑