2026/9/14 15:14:51
ms-swift GRPO 多任务训练指南:用任务列 + 分任务奖励函数实现 Math/Code 混合强化学习
ms-swift GRPO 多任务训练指南:用任务列 分任务奖励函数实现 Math/Code 混合强化学习 【免费下载链接】swift Use PEFT or Full-parameter to CPT/SFT/DPO/GRPO 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) and 300 MLLMs (Qwen3-VL, Qwen3…