资讯动态

揭秘Ornith-1.5-35B-A3B-GGUF的自我改进训练范式:从自我脚手架到端到端强化学习

发布时间:2026/10/2 23:53:06 来源:尧图企业网站定制
揭秘Ornith-1.5-35B-A3B-GGUF的自我改进训练范式从自我脚手架到端到端强化学习【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUFOrnith-1.5-35B-A3B-GGUF 是开源推理模型Ornith-1.5-35B-A3B的 GGUF 量化权重仓库。这个模型的特别之处在于它的自我改进训练范式模型自主生成训练任务、自主搭建求解脚手架self-scaffolding再通过端到端强化学习不断优化策略无需依赖人工固定的任务集。本文将从零讲清这套范式并带你快速在本地跑起来。什么是自我改进训练一个自我驱动的学习飞轮 传统的大模型训练路径是固定的人类准备任务数据集 → 人类设计评测脚手架 → 模型在固定任务上练习。这条路线的天花板由人来决定——任务质量与数量都受限于人工。Ornith 团队的做法是让模型自己出题、自己搭台、自己练习。从 Ornith-1.0 到 1.5核心升级正在于此阶段Ornith-1.0Ornith-1.5任务生成依赖人工策划的固定任务集✅ 模型自主持续生成新任务脚手架构建手动设计的 harness✅ 与任务、rollout 联合优化Rollout 求解参与优化✅ 参与优化配合奖励信号也就是说Ornith-1.5 把自我改进的闭环从脚手架 rollout 优化扩展为任务生成、脚手架构建、rollout 求解三者的联合优化实现了真正意义上的端到端自我改进。三合一闭环自我脚手架是怎么工作的 这套范式可以拆成三个环环相扣的环节全部由模型自己驱动1. 任务生成摆脱人工任务集模型会持续生成新的训练任务而不是反复练习同一批人类编写的题目。任务库随训练不断长新天然规避了固定任务集带来的过拟合瓶颈。2. 脚手架构建模型自己设计解题支架脚手架scaffold / harness指模型解题时所处的支架环境可用的工具、执行框架、评测方式等。Ornith-1.5 不再使用人工设计的固定 harness而是让模型自行发现有效的解题策略与支架结构——这就是标题中自我脚手架Self-Scaffolding的含义。3. Rollout 强化用奖励信号自我迭代模型对任务进行多轮求解rollout奖励信号区分好策略与坏策略再通过强化学习更新策略网络。三个环节共享同一套优化目标形成越练越强、自我驱动的飞轮。官方将其描述为通过端到端自我改进构建基础模型的重要一步完整的任务、脚手架与 rollout 奖励设计说明可参考 README.md。性能解析35B-A3B 的 MoE 有多强 ⚡Ornith-1.5-35B-A3B 是 Ornith-1.5 家族的中型MoE混合专家成员总参数约 35B但每个 token 只激活约 3B 参数——推理开销接近小模型能力却对标大模型。关键基准成绩5 次独立运行平均数据取自 README.md 完整评测表基准Ornith-1.5-35B-A3BQwen 3.6-35B-A3BGemma 4-31BSWE-bench Verified79.073.452.0SWE-bench Pro59.649.535.7Terminal-Bench 2.1Terminus-267.852.542.1HLE带工具33.428.926.5GPQA Diamond89.286.084.3MCP-Atlas70.262.855.0可以看到它在编码与 Agent 类基准上全面领先同量级模型并大幅超过 Gemma 4-31B、Muse Glimmer-30B 等稠密模型——这背后正是自我改进范式的红利。快速上手GGUF 量化版本怎么选 本仓库提供开箱即用的多档 GGUF 量化权重无需自行转换文件量化适用场景Ornith-1.5-35B-Q4_K_M.ggufQ4_K_M显存/内存紧张追求最快启动Ornith-1.5-35B-Q5_K_M.ggufQ5_K_M精度与体积平衡之选Ornith-1.5-35B-Q6_K.ggufQ6_K精度优先Ornith-1.5-35B-Q8_0.ggufQ8_0接近原始精度Ornith-1.5-35B-BF16.ggufBF16全精度约 70GB 内存想要多模态能力的话仓库还附带视觉投影器 mmproj-Ornith-1.5-35B-BF16.gguf。Ollama 一行命令启动ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUFllama.cpp 起 OpenAI 兼容服务llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF --port 8000 -c 262144服务启动后任何 OpenAI 兼容客户端编码 CLI、Agent 框架把 base URL 指向http://localhost:8000/v1即可调用。推荐采样参数日常使用temperature0.6, top_p0.95, top_k20复现官方基准temperature1.0 提示这是一个推理模型默认先输出think.../think思考块再给出最终答案同时原生支持 OpenAI 风格的tool_calls函数调用天然适配各种 Agent 框架。要点总结自我改进三合一任务生成 脚手架构建 rollout 强化端到端强化学习驱动MoE 高性价比35B 总参数、约 3B 激活参数能力对标大模型长上下文原生 256K262,144 token窗口YaRN 扩展后最高约 1M部署友好多档 GGUF 量化齐全Ollama / llama.cpp 一键拉起这套从自我脚手架到自我改进的范式代表了当前基础模型训练的一个重要方向——让模型自己生产训练数据与训练环境值得每一位关注 AI 前沿的开发者重点关注。【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑