资讯动态

如何免费让Ornith-1.5-35B-A3B替你写代码:Terminal-Bench 67.8分Agent编程模型实战指南

发布时间:2026/8/25 9:31:06 来源:尧图企业网站定制
如何免费让Ornith-1.5-35B-A3B替你写代码Terminal-Bench 67.8分Agent编程模型实战指南【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B想让 AI 帮你改代码、修 Bug、跑测试还得自己买昂贵的 API 额度开源模型 Ornith-1.5-35B-A3B 给出了更省钱的答案它是 Ornith 团队推出的推理型 Agent 编程模型在终端编程基准 Terminal-Bench 2.1 上拿下 67.8 分超过同规模的 Qwen3.6-35B也明显领先 Gemma-4-31B 等稠密模型。本文是一份面向新手的上手指南读完你就能在本地把它变成 7×24 小时在线的编程搭档。先认识一下这位AI 同事 Ornith-1.5 家族的设计思路是端到端自我改进模型不再只靠人工整理的固定题库训练而是自己生成新任务、自己摸索解题策略再用强化学习反复迭代。Ornith-1.5-35B-A3B 正是这套方法训练出的中型专家模型。它有三个新手必须知道的特点️推理模型回答前会先在think块里打草稿草稿通过独立的reasoning_content字段返回最终答案才是正式输出混合专家MoE架构总参数约 35B但每个 token 只激活约 3B 参数速度快、显存省bf16 权重约 70 GB超长上下文原生支持 262K token 上下文可装下大项目代码库。67.8 分是什么概念一张对比表看懂 Terminal-Bench 成绩Terminal-Bench 考察的是给模型一个终端看它能否自主完成真实工程任务——这正是编程 Agent 的核心场景。下表为官方 README 中 5 次运行取平均的结果基准测试Ornith-1.5-35B-A3BOrnith-1.0-35B-A3BQwen3.6-35B-A3BGemma-4-31BQwen3.5-397BTerminal-Bench 2.1Terminus-267.864.252.542.153.5Terminal-Bench 2.1Claude Code68.562.849.2-48.6SWE-bench Verified7975.673.45276.4SWE-bench Pro59.650.449.535.751.6SWE-bench Multilingual71.469.367.251.769.3ClawEval72.569.868.748.570.7GPQA Diamond推理89.286.28684.388.4一眼看去有两个惊喜3B 激活参数打赢了 397B 的大家伙——在 Terminal-Bench 上领先 Qwen3.5-397B 约 14 分说明能自主操作终端才是关键能力而它在这方面被专项强化过换框架成绩不掉反涨Terminus-2 的 67.8 → Claude Code 的 68.5说明能力是模型自身的不依赖特定 Agent 框架。为什么小激活参数也能打赢大模型 两个原因都写在模型配置文件里可对照 config.json 查看256 个专家、每 token 只开 8 个大部分参数平时休息、按需上岗推理成本接近 3B 小模型知识容量却接近 35B 大模型线性注意力 全注意力交替每 4 层一组大幅降低长上下文的计算量所以 262K 窗口才跑得动。而打高分的根源在训练方式Ornith-1.5 把出题—解题—打分—迭代整个循环交给了模型自己任务、脚手架和解题策略是联合优化的等于让模型自己给自己出了无数套编程 Agent 真题。最快部署方法vLLM / SGLang 一键起服务️ 官方推荐2× 80GB 显存bf16 权重约 70 GB 256K 上下文留余量并建议安装较新版本Transformers ≥ 5.8.1、vLLM ≥ 0.19.1、SGLang ≥ 0.5.9。方式一vLLMvllm serve ornith-ai/Ornith-1.5-35B-A3B \ --served-model-name Ornith-1.5-35B-A3B \ --host 0.0.0.0 --port 8000 \ --tensor-parallel-size 2 \ --max-model-len 262144 \ --gpu-memory-utilization 0.90 \ --enable-prefix-caching \ --enable-auto-tool-choice --tool-call-parser qwen3_xml \ --reasoning-parser qwen3 \ --trust-remote-code方式二SGLangpython -m sglang.launch_server \ --model-path ornith-ai/Ornith-1.5-35B-A3B \ --served-model-name Ornith-1.5-35B-A3B \ --host 0.0.0.0 --port 8000 \ --tp 2 \ --context-length 262144 \ --mem-fraction-static 0.85 \ --tool-call-parser qwen3_coder \ --reasoning-parser qwen3两条命令都会起一个OpenAI 兼容接口/v1/chat/completions任何支持自定义 baseURL 的客户端都能直接接上。GPU 数量不同时改--tensor-parallel-size/--tp即可。上下文不够 262K用 YaRN 扩到 1M官方验证过 YaRN 缩放方案缩放系数取 4.0 时可用窗口扩展到约100 万 token。两种开启方式任选直接在 config.json 中加rope_scaling: {rope_type: yarn, factor: 4.0, original_max_position_embeddings: 262144}或启动时加参数vLLM 用--hf-overridesSGLang 用--json-model-override-args记得先设VLLM_ALLOW_LONG_MAX_MODEL_LEN1或SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN1。⚠️ 注意开源运行时的 YaRN 是静态生效的对普通短请求可能轻微降质只在确实需要超长窗口时开启请求上限约 52 万 token 的话factor: 2.0更合适。写代码前必做的参数设置 模型默认采样参数记录在 generation_config.jsontemperature1.0、top_p0.95、top_k20——这是官方跑分用的配置。日常写代码建议改为更稳的组合场景temperaturetop_ptop_k日常对话 / 写代码0.60.9520复现官方基准分数1.01.020把它接入你的编程 AgentClaude Code / OpenCode / OpenClawTerminal-Bench 在 Claude Code 框架下能跑出 68.5 分说明它和主流终端编程 CLI 的适配相当成熟。常见接法Claude Code / Hermes / OpenClaw等走 OpenAI 接口的工具设置环境变量OPENAI_BASE_URLhttp://localhost:8000/v1、OPENAI_API_KEYEMPTY模型名填ornith-ai/Ornith-1.5-35B-A3B即可OpenCode在~/.config/opencode/opencode.json里把本地端点注册为 providerbaseURL指向http://localhost:8000/v1然后直接运行opencode模型的工具调用会被服务端解析成标准tool_calls字段因此标准 Agent 框架无需额外适配就能用。接好之后读懂整个代码库 → 定位问题 → 修改 → 跑测试这类活就可以交给它了。常见问题FAQQ1回复里为什么总有一段思考过程A它是推理模型默认先输出think块再给答案。服务端开启reasoning-parser后思考内容走reasoning_content字段不会污染正式答案。Q2没有双卡 80G 也能跑吗A权重约 70 GB单卡 80G 需要压缩上下文长度更省事的方案是用量化版ornith-ai/Ornith-1.5-35B-A3B-GGUF配合 Ollama、llama.cpp 或 Atomic.chat 在单卡甚至 CPU 上运行。Q3它只是会补全代码吗A不是。SWE-bench Verified 79 分、Multilingual 71.4 分说明它擅长跨文件修 Bug、处理多语言代码库这类真实工程任务ClawEval 72.5 分则覆盖真实用户任务分布。Q4怎么获取完整模型文件A模型文件在官方仓库中托管克隆仓库即可git clone https://gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B写在最后67.8 分 Terminal-Bench 意味着Ornith-1.5-35B-A3B 已经具备独立在终端里干完一整套工程任务的实战能力。加上 MoE 带来的低推理成本、262K 长上下文和标准 OpenAI 接口它是目前用私有算力搭建本地编程 Agent 的高性价比选择。 延伸阅读项目内文件完整基准数据与评测说明README.md架构超参数专家数、注意力类型、上下文长度config.json默认采样参数generation_config.json对话模板影响think块解析chat_template.jinja【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价