资讯动态

System One 技术价值与 Laya 在各 Agent 中的接入方式

发布时间:2026/10/9 10:19:09 来源:尧图企业网站定制
背景接《 Jev(System One Model)开源模型》模型选型层本篇回答三个问题① 为什么要用 System One 技术② Laya 怎么用③ 现有 Agent 体系Claude Code、oh-my-pi/Pi、Hermes Agent、QwenPaw、DSH、WorkBuddy、自研 Agent怎么接上它——是否必须自研编码结论先行不必自研编码。Laya 官方自带 MCP server extralaya[mcp]和 Jev 兼容 HTTP 端点/v1/systemone所有支持 MCP 的 Agent 加一条配置即可用不支持 MCP 的自研系统走 HTTP 也只是几十行 client 代码。一、总体结论System One 的价值不是更强的模型而是更便宜的判断把高频、低复杂度、答案空间封闭的决策路由、分诊、分类、安全判断、置信门控从 LLM 里剥出来用 33ms 级别T4/ 免费本地推理的小模型完成LLMSystem 2只处理它不确定的部分。Laya 是目前该方向工程化最完整的开源实现29.5k★、Apache-2.0、PyPI/HF/Docker/Nix 齐全官方 MCP/serve/LangChain/TS SDK/ONNX 全有上一份调研的选型结论仍然成立。接入路径分层从省事到深入零代码托管 MCPlaya.studio付费 API key→ 任何 MCP 客户端粘贴 URL 即用本地免 keypip install laya[mcp]起本地 MCP server → 任何 MCP 客户端配 stdio服务化laya[serve]起/v1/systemoneJev 兼容 HTTP→ 任何能发 HTTP 的系统直接调用嵌入代码Python SDK /laya-tsNode/浏览器 ONNX→ 自研 Agent 进程内调用只有以下情况才值得在自研 Agent 里深度编码需要进程内极低延迟省掉 MCP/HTTP 往返、需要把 System 1 决策嵌入 agent loop 的 hook/gate 逻辑如每步决策前过一遍 Laya低置信才升级 LLM、或需要批量管线。即便如此也只是调用 门控逻辑不是重写模型。二、为什么需要 System One 技术2.1 问题我们在用 70B 模型做判断题一个 Agent 系统 90% 的决策其实不复杂这条消息该路由给哪个队列/哪个子 agent枚举选择这个工具输出是不是提示注入是/否这张工单紧急程度 0–3 分量表打分这个文件改动风险高吗该不该走人工审批是/否 置信度这段 RAG 召回的内容与问题相关吗是/否用生成式 LLM 回答这些问题的代价维度生成式 LLM 做判断题System OneLaya 类延迟500ms–2s逐 token 流式33ms/问批量 7.2ms/问T4 实测成本按 token 计费高频调用放大本地推理$0Apache-2.0 权重输出形态自由文本 → 还要写 JSON schema 解析、正则兜底原生类型化输出choice/score/noul 三种基元物理上不存在畸形 JSON置信度“confidence: 0.95” 是生成的 token无数学校准校准概率RLCD 训练ECE 0.081 vs Jev 0.246可以直接if p 0.6: 升级幻觉能生成不在选项里的标签只能从你给定的选项中选物理上不能编造可审计概率藏在 prose 里每个决策都是显式概率向量可导出、可回放2.2 正确的架构三层分工┌─────────────────────────────────┐ 高频、封闭答案 │ System 1Laya / Jev33ms │ ← 路由、分诊、守卫、门控 批量、低容错成本 └──────────────┬──────────────────┘ │ 置信度 阈值如 0.6 ▼ ┌─────────────────────────────────┐ 低频、开放式 │ System 2LLM推理/写作/规划 │ ← 真正的难题才用 └──────────────┬──────────────────┘ │ 确定方案后 ▼ ┌─────────────────────────────────┐ 确定性执行 │ 传统代码 / 工具调用 │ ← 副作用由代码守卫不靠 prompt └─────────────────────────────────┘一个有代表性的第三方实测dev.tovishalmysore 的 layaAgent 项目浏览器内用 Laya(421M) 做 agent 每步决策 1.5B 小 LLM 兜底 置信门控任务成功率 94%人在回路/21%全自动而同样场景纯 1.5B LLM 每步决策只有 10%。System 1 的价值不在单独替代 LLM而在确定时跑快路径、不确定时交出去的门控机制本身。2.3 对 Agent 场景的具体收益对应我们自己的 Agent/运维平台场景System 1 判断内容收益多 agent 编排子任务路由到哪个专家 agentchoice ≤20 个每次路由省一次 LLM 调用毫秒级工具调用守卫该工具参数是否危险/敏感noul替代prompt 里写请不要乱删用代码门控提示注入防护外部内容网页/文件/工单是否注入noulToxicChat 实测 75.5–76.2%50% 弃权覆盖下 93.1%比大模型快 10× 以上的入口筛查工单/告警分诊运维告警分级score、归属队列choice高频批量场景成本≈0置信门控LLM 输出后自评/复判低置信升级人工或更强模型用校准概率做分支而不是靠 LLM 自己说我很有信心RAG 相关性召回片段相关与否noul单趟 65.7%减少喂给 LLM 的噪声上下文注意承接上篇调研Laya 上下文窗口 512–1024 tokenmultilingual 可开到 8192 但 4k 精度波动它判断的是状态摘要 类型化问题不是长文档深度理解——长文档深读仍是 LLM 的活。三、Laya 怎么用3.1 安装本地自托管免费# Python ≥ 3.10python3-mvenv ~/.venvs/laya~/.venvs/laya/bin/pipinstalllaya[mcp,serve]# 或 CPU-only torch避免误装多 GB 的 CUDA 版# pip install torch --index-url https://download.pytorch.org/whl/cpu 先于 laya首次调用自动从 HuggingFace 下载检查点english 约 808MB / multilingual 约 647MB缓存在~/.cache/huggingface。3.2 三个检查点Router 自动选检查点编码器参数上下文用途layaModernBERT-large421M512英文分类/守卫/邮件分诊laya-multilingualmmBERT-base322M1024可开 8192100 语言含中文快 2.2×laya-typed-decisionsModernBERT-large421M1024微调过的 agent 观测/客服/发票/安全告警0.766 acc中文场景必须确认路由到 multilingual 检查点Router会按文字脚本自动路由英文检查点读不了 CJK且此时置信度不下降——不能靠置信度兜底必要时显式modelmultilingual。3.3 Python SDK生产用fromlayaimportRouter routerRouter(preloadTrue)# 三个检查点常驻内存免冷切换 7–10sstate{subject:生产 API 挂了,body:从早上 6 点开始报错要求按 SLA 退款否则取消合同}questions{queue:{type:choice,instructions:归哪个工程队列,criteria:{infrastructure:宕机/网络/数据库故障,billing:退款/发票/SLA 争议,security:入侵/漏洞,support:一般咨询}},urgency:{type:score,instructions:多紧急,criteria:[不紧急,尽快,高优先级,critical 阻塞]},churn:{type:noul,instructions:客户是否威胁取消/流失},}resrouter.predict(state,questions)# 一次前向三个问题全答print(res[answers][queue][choice])# infrastructureprint(res[answers][churn][noul])# 0.91校准概率可直接分支批量router.predict_batch(states, questions)按长度分组sort_by_length实测 1.4–2.6× 提速低置信弃权predict(..., min_confidence0.6)低于阈值标low_confidence: Truedecide()直接返回None。3.4 CLI / 本地服务laya我的支付失败了两次--presettriage--modelmultilingual--devicecpu# 内置 presettriage / email / guard / moderation / routercattickets.txt|laya--batch---predict--json# 批量 JSONLpipinstalllaya[serve]LAYA_HOST127.0.0.1LAYA_MODELSenglish,multilingual laya-serve# POST /v1/systemone —— 与 TypeSafe Jev 的 API 完全同构Jev 客户端改 baseUrl 即可3.5 已知限制写进任何方案都要带choice 选项 20 会掉点Banking77 77 标签0.425 vs Jev 0.870——选项共享 192–256 token 的 head 预算。对策≤20 选项或两级 coarse→fine 层次。零样本≠够用typed-decisions 基准上基座 0.362微调后 0.766。生产关键判断建议用自己的标注数据微调官方 Kaggle 2×T4 notebook 免费 4 小时跑完 按域拟合温度校准。上下文短512–1024 tokenmultilingual 可到 81924k 精度波动。它是决策器不写代码、不生成文本——别指望它替代 LLM 做开放生成。四、各 Agent 怎么用上它4.0 两条通用接入面关键结论接入面是什么适合MCPLaya 官方laya[mcp]extra本地 stdio serverlaya_predict/laya_decide/laya_predict_batch等工具或托管https://api.laya.studio/mcpStreamable HTTPBearer keydecide/classify/yes_no/score6 个工具或社区现成包装如YerikZ/laya-mcp把 triage/guard/moderate 包成 agent 友好工具一切支持 MCP 的 agentHTTP/v1/systemonelaya-serve自托管Jev 兼容 schema不支持 MCP 但能发 HTTP 的系统自研 agent、后端服务、CI进程内Python SDKfrom laya import Router/laya-tsNode、浏览器 ONNX自研 agent 内部热路径、批量管线4.1 AI Coding Agent 阵营Claude Code官方文档级支持 MCPstdio HTTP 都支持# 本地自托管 MCP推荐免费、离线claude mcpaddlaya-suser -- /home/honya/.venvs/laya/bin/python /path/to/laya-mcp/server.py# 或官方 laya[mcp] extra 提供的 server仓库自带 MCP 入口工具名 laya_predict/laya_decide 等# 或托管版免本地 GPU/依赖claude mcpadd--transporthttp laya https://api.laya.studio/mcp\--headerAuthorization: Bearer lsk_live_...# /mcp 确认连接之后 Claude Code 在任务中可自然调用判断任务难度/领域做模型路由smolvsslow档、对抓取的网页/文件做注入与敏感信息守卫、对 PR 描述做分诊打标。oh-my-piomp/ Pi agentomp.shPi 的 coding-first forkMCP 是一等公民——/mcp add交互添加或写配置文件mcpServersschemastdio/http/sse 三种 transport 都支持{mcpServers:{laya:{type:stdio,command:/home/honya/.venvs/laya/bin/python,args:[/path/to/laya-mcp/server.py]}}}或直连托管版type: http, url: https://api.laya.studio/mcp headers。另外 omp 本身有smol/slow/plan多角色模型路由——正好可以把 Laya 的 choice 判断用作这轮任务该派给哪个 role的前置门控提示词里约定先问 Laya。其他 coding agentCodex、Gemini CLI、Cursor 等同理都是标准 MCP client同一个 server 配置照抄。Laya 上游还自带 LangChain/LlamaIndex/CrewAI 集成laya[langchain]等走框架栈的 agent 可以直接用LayaDecision节点/LlamaIndex selector。4.2 通用 Agent / 个人助理阵营Hermes Agent本系统原生 MCP 客户端config.yaml里声明 MCP serverstdio 或 HTTP即自动发现工具注册为mcp__server__tool用法与调用其他 MCP 一致。配置指向本地laya[mcp]server 或api.laya.studio/mcp即可无需写代码。即便不配 MCP也可以用execute_code起一个持有Router的持久 kernel 做进程内调用变量跨调用保留或terminal里跑laya --preset ...CLI——但正式用法还是 MCP。QwenPawAgentScope 团队的开源个人助理文档级 MCP 集成Console → 设置里管理 MCP clientstdio/HTTPv2.0 的 Drivers 层是协议中立的 MCP/A2A/ACP 连接器带加密凭据与 per-call 策略门控。接法与上面一样本地laya[mcp]stdio server 或托管 HTTP endpoint 填进 MCP 配置即可agent 获得 decide/classify/yes_no/score 工具。DSHDeepSeek HarnessDSH 的哲学是everything is a pluginMCP 通过插件挂载内置deepseek-ai/dsh-mcp-client只支持静态 headers 的 HTTP社区插件补齐 stdio 与 OAuth# 路线一dsh-mcp-manager 插件支持 stdio HTTP OAuth推荐npx-pdeepseek-ai/dsh dsh plugin--profilewebaddgithub:hyqhyq3/dsh-mcp-manager# 然后 设置 → MCP 页面加 server# stdio: command/path/to/python, args[/path/to/laya-mcp/server.py]# 或 HTTP: https://api.laya.studio/mcp Bearer token# 工具注册为 mcp__laya__decide 等所有会话可见# 路线二dsh-plugin-mcp-supportsettings.yaml 里 mcp-support.servers 声明WorkBuddy腾讯桌面全场景 agent设置 → MCP 可视化配置用户级~/.workbuddy/mcp.json/ 项目级项目/.workbuddy/mcp.json支持 stdio 命令与远程 HTTP 标准 OAuth工具配置完即自然语言可调另有腾讯云 MCP 市场可逛。接法相同stdio 指向本地 laya-mcp server或 HTTP 指向托管 endpoint。企业版CodeBuddy 系插件系统也支持.mcp.json随插件分发。4.3 汇总谁必须自己编码Agent接入方式需要写代码吗Claude Codeclaude mcp addstdio/http❌ 一条命令oh-my-pi / Pi / Codex / Cursor 等mcpServers配置❌ 一段 JSONHermes Agentconfig.yaml 声明 MCP server❌ 一段 YAMLQwenPawConsole MCP 管理页❌ 配置DSHMCP 插件 设置页❌ 插件安装 配置WorkBuddy设置 → MCP / mcp.json❌ 配置自研 Agent 系统三选一① 支持 MCP 协议 → 纯配置② 不支持 MCP 但能发 HTTP → 调/v1/systemone请求/响应就是两个 JSON 对象client 几十行③ 要进程内低延迟/深度门控 →pip install laya嵌 SDK写门控逻辑约百行级不需要碰模型本身①❌ ②极少 ③少量必须自己编码的场景第③类的具体形态供自研 agent 参考每步门控agent loop 里每个动作前调router.predict问 noul “该动作有风险吗”p(risk) 0.5拦截或升级审批——这是 hook 逻辑写在你的 loop 里模型不用动。置信路由System 1 先答answer_confidence 0.6才调 LLMJev 官方 “confidence-gated routing” 模式的开源等价物。批量管线如告警洪峰时用predict_batch一次性分诊 1000 条。五、落地建议PoC 计划目标一周内在本机跑通本地 Laya 两个 agent 调用验证延迟与中文效果。步骤动作通过标准1python3.10 -m venvpip install laya[mcp,serve]CPU torchimport laya成功laya --preset triage出结果2CLI 中文测试laya 生产环境 API 挂了要求退款否则解约 --preset triage --model multilingual路由到 multilingualintent/urgency 合理记录 CPU 延迟预期 100ms–1s/问3起laya-servecurl/v1/systemone返回 Jev 同构 JSON4MCP 接入 Hermes Agentconfig.yaml 加 stdio server会话内能调 decide/classify 工具5MCP 接入 omp/mcp add同左6按自己数据构造 50–100 条真实状态告警/工单/消息对比 Laya 判断 vs 人工标注记录准确率与 ECE决定是否值得微调typed-decisions检查点7决策PoC 达标 → 部署为内网常驻服务compose.example.yml有 CPU/CUDA 两种 compose全 agent 统一挂 MCP不达标 → 退回 LLM 直判—需要拍板的点算力CPU 跑 322M multilingual 够 PoC秒级/问要 33ms 级需挂 GPU现有 L20/2080Ti 都远超 1GB 需求可与 vLLM 服务共用卡显存占比 5%。是否接受托管api.laya.studio数据出境/合规还是坚持全本地内网平台场景建议全本地。是否值得微调取决于步骤 6 的零样本准确率是否满足业务。六、风险提示项目很年轻Laya 首个公开版本 2026-09-18两周 29.5k★迭代极快25 个 release——接口可能变动生产接入 pin 版本当前 0.3.22。自述基准官方 vs Jev 的对比数字快 7.8×、校准 3× 好是作者自测Jev 侧数字来自第三方正式决策前用自己的数据测步骤 6。中文效果需实测multilingual 检查点覆盖 100 语言且官方 51 语言 sweep 显示 45/51 可用但 CJK 具体领域如中文告警文本精度必须自测。choice 20 选项、长上下文、零样本精度是三个已知硬边界见 3.5方案设计时避开或两级化。托管 MCPlaya.studio按输入 token 计费1 credit1 input token高频批量场景成本需评估——这也是高频决策选本地自托管的另一个理由。七、本机实测2026-10-01CPU laya 0.3.22真实运行数据7.1 环境~/.venvs/laya/Python 3.11 torch 2.14.1cpu laya[mcp]0.3.22检查点multilingual 322M~/.cache/huggingface/hub/models--convaiinnovations--laya国内需HF_ENDPOINThttps://hf-mirror.comHF_HUB_DISABLE_XET1否则 hf_xet 走 cas-server.xethub.hf.co 401——本机踩坑正解是后者而不是HF_HUB_DOWNLOAD_XET检查点冷加载6.0s一次性MCP server 首调含加载10.5sSDK 预热后单次 predict~0.8sCPU4 问题一次前向7.2 案例中文 P1 告警真实输出状态【P1告警】prod-face-recognition P95 延迟 120ms→4.2s错误率 38%。门店刷脸门禁全部失败约2000名员工无法打卡。昨晚22:00人脸模型热更新后出现。现场有领导参观。路由 : multilingual脚本检测non-Latin script (han, 79% of letters); the English checkpoint cannot read it choice queue → ml_platform 分布: ml_platform 0.353 / infra 0.319 / network 0.278 / billing 0.025 / other 0.024 置信度: 0.211 ← 低于 0.6 门控阈值 score urgency → 期望等级 1.80/3 分布: P3 0.074 / P2 0.130 / P1 0.721 / P0 0.074 answer_confidence 0.721 noul 是否模型相关 → P(true) 0.9995 noul 是否需要升级 → P(true) 0.9924这次实跑最有价值的发现门控按设计工作了。noul 两个问题是否模型相关、是否需升级概率 0.99直接可用不用问 LLMscore 紧急度P1 概率 0.72“大概率 P1、留了 P2 尾巴”——比 LLM 说很紧急可分支得多choice 队列归属置信度只有 0.21三选都 0.28–0.35模型不确定→按min_confidence0.6门控应升级给 Qwen-27B 复核而不是把 0.35 的ml_platform当结论用。这正是校准概率的意义模型诚实地不确定零样本、中文运维域、5 选项而不是像 LLM 那样自信地说错。7.3 MCP stdio 会话实录Hermes Agent 内部就是这个过程client → {jsonrpc:2.0,id:1,method:initialize, params:{protocolVersion:2025-06-18,capabilities:{}, clientInfo:{name:hermes-agent-demo}}} server ← {result:{protocolVersion:2025-06-18, serverInfo:{name:laya,version:0.3.22}, capabilities:{tools:{listChanged:false},...}}} client → {jsonrpc:2.0,method:notifications/initialized} client → {jsonrpc:2.0,id:2,method:tools/list} server ← 8 个工具: laya_status / laya_route / laya_predict / laya_predict_batch / laya_route_batch / laya_shortlist / laya_preset / laya_decide laya_predict 参数: state, questions, model, task, lang, max_len, head_max_len, min_confidence client → {jsonrpc:2.0,id:3,method:tools/call, params:{name:laya_predict, arguments:{state:{...告警...}, questions:{queue/urgency/is_model_related/needs_escalation}}}} server ← {result:{content:[{type:text,text:{answers..., routing, latency_ms: 10536.67, device: cpu}}]}} 预热后 latency_ms 为百毫秒级 CPU / 33ms 级 T4注意laya_decide与laya_predict的区别decide 带min_confidence时低置信项直接返回null适合不确定就不许动作的场景predict 返回完整分布适合让 LLM 自己看分布决策。演示用的 laya_predict 保留了完整概率分布。7.4 Hermes Agent 接入配置已实配并验证实际配置hermes mcp add写入~/.hermes/config.yaml的mcp_serversmcp_servers:laya:command:/home/honya/.venvs/laya/bin/laya-mcp-async# 包装器见下方坑 1env:LAYA_MODELS:multilingual# 只预载 multilingual中文场景LAYA_DEVICE:cpu# 有 GPU 改 cuda与 vLLM 共卡显存 1GBHF_HUB_DISABLE_XET:1HF_HUB_OFFLINE:1# 检查点已缓存强制离线免每次 revision 检查connect_timeout:120# timeout 未显式写Hermes per-call 超时默认 300s_DEFAULT_TOOL_TIMEOUT# CPU 推理 8–30s 够用若换 mcp 2.2 SDK 自研客户端注意其默认 10s 请求超时hermes mcp test laya实测✓ Connected (2781ms)Tools discovered: 8。工具注册名mcp_laya_laya_predict等。与 vLLM 的关系两者互不感知——vLLM 继续服务 Qwen-27BSystem 2OpenAI 兼容端点Laya MCP server 是独立进程System 1Hermes 同时挂两个按门控决定哪边答。接入踩的两个坑已解决记录在此官方laya-mcp-server的 main() 在server.run()前同步预加载检查点CPU 上 6–10s期间事件循环不转 → mcp 2.2 SDK 客户端在initialize握手就 10s 超时裸 JSON-RPC 不受影响因为裸协议无客户端超时。解法包装器laya-mcp-async~/.venvs/laya/bin/laya-mcp-asyncshebang 用 laya venv 的 python把预加载放进后台守护线程握手 0.8s 返回首调撞上预热未完成则按需加载。mcp 2.2 SDK 客户端tools/call默认请求超时 10sCPU 上laya_predict要 8–30s → 自研 MCP client 时必须调大请求超时Hermes 侧 per-call 默认 300s 无此问题T4 GPU 上 33ms 则两边都无所谓。HF 下载坑镜像hf-mirror.comHF_HUB_DISABLE_XET1HF_HUB_DOWNLOAD_XET无效缓存就位后加HF_HUB_OFFLINE1最干净。7.5 实测结论架构可行MCP 接入零代码8 工具注册一次 tools/call 拿到三基元完整概率——全部验证。noul/score 在中文运维域零样本即可用0.99/0.72 置信choice 多选项分类零样本不可靠0.21→ 生产上要么选项 ≤3、要么微调、要么一律走低置信升级 LLM门控。CPU 百毫秒级单问PoC/低频场景够用告警洪峰批量场景要上 GPU33ms/问7.2ms/问批量或用laya_predict_batch。演示脚本同目录laya_demo.pySDK MCP 双路演示可复跑~/.venvs/laya/bin/python laya_demo.py。八、资料索引Laya 官方github.com/NandhaKishorM/layaREADME 含全部 surface、laya.convaiinnovations.com创始人长文 vs Jev 基准、nandhakishorm.github.io/layahooks/structured/docker/langchain 指南托管 MCP 文档laya.studio/docs/mcp、laya.studio/agents.mdagent 接入指引社区 MCP 包装YerikZ/laya-mcpClaude Code 示例、PerryLink/laya-mcplaya-mcp serve/install自动注册到 harness、ThinkFlowLab/system1-agentsjev|laya|cua 三模型可切的 System 1 agent 框架 s1a-mcp第三方实测dev.to vishalmysore “A 421M encoder beat a 1.5B LLM at running my agent”浏览器内 agent 门控架构、dev.to aifrontierpost “Laya: replace your LLM-as-a-judge with a 322M-parameter decision engine”含 CPU 安装踩坑先装 CPU torchAgent 接入文档omp.sh/docs/mcp、DSH 插件dsh-mcp-manager / dsh-plugin-mcp-support、QwenPaw 文档 MCP 章、WorkBuddy 文档 MCP-Guidecodebuddy.cn、Hermes config.yaml native MCP client同系列《2026-09-23 Jev(System One Model)开源模型调研》

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑