资讯动态

收藏!小白程序员必看:如何构建可持续运行的大模型Agent系统?

发布时间:2026/10/4 11:38:16 来源:尧图企业网站定制
文章探讨了传统大模型Harness设计的局限性指出其围绕模型缺陷构建的结构难以适应模型快速迭代的环境。文章介绍了Anthropic的Managed Agents架构通过将LLM与执行环境分离实现更健壮和安全的系统。文章强调Agent工程的重心已从“如何为当前模型设计更好脚手架”转变为“如何让脚手架本身可替换”以确保系统在模型、工具、权限和状态变化时的持续运行。文章还讨论了Provider Abstraction和Runtime Abstraction两类抽象的重要性以及Managed Agents架构的优势和限制。过去很多 harness 设计包括 Anthropic 自己的早期实践本质上是在补当前模型的短板上下文不稳就设计 reset长任务容易跑偏就加 evaluator工具调用不可控就把更多规则写进 orchestration。问题是模型每几个月换一代围绕上一代模型缺陷搭出来的结构很快可能变成新的成本。所以 Agent 工程的问题正在改变早期问题是模型能不能完成任务现在更难的问题是当模型、工具、权限和状态都在变化时围绕模型搭出来的系统能不能持续运行。原来的 Harness 结构在 Managed Agents 的早期实现里Anthropic 曾把 agent 组件放进一个单容器系统session、harness、sandbox 都放在一起。这个设计容易启动也方便把模型、工具和执行环境绑成一个整体但它把几种本来应该分开的边界压在了一起。层承担的功能问题session记录任务过程、模型上下文和中间状态跟容器生命周期绑定容器失败时状态可能丢失harness调用模型、组织工具、管理上下文和执行流程默认工具、沙箱和资源都在本地容器附近sandbox执行 LLM 生成的代码访问 repo 和外部工具不可信代码和凭据处在同一环境里credential vault / proxy通过环境变量或本地配置提供 tokenprompt injection 可能诱导模型读取凭据第一是故障边界。session 跟着容器走容器失败session 也可能一起丢。对于长任务 agent 来说这不是小问题。任务已经花掉的 token、工具调用、观察结果、文件状态都可能因为一次进程或容器失败而变成不可恢复的上下文。第二是安全边界。LLM 生成的不可信代码和凭据处在同一环境里prompt injection 只要诱导模型读取环境变量就可能拿到 token。对于会运行代码、访问 repo、调用外部服务的 agent这相当于把执行权限和凭据暴露在同一个攻击面里。第三是部署边界。当客户希望把 LLM 接到自己的 VPC 或内部工具链时harness 会默认资源就在本地容器旁边。而实际上工具、沙箱和凭据未必都在同一处企业环境也很少愿意为了 agent 改掉已有的网络和权限结构。Managed AgentsManaged Agents 的拆分就是针对这些耦合点来的。Anthropic 把 LLM 和 harness 称为 brain把 sandbox 和工具称为 hands再把 session 放到外部持久日志里。层承担的功能变化session外部持久事件日志可查询、切片、重读从模型 context window 和容器生命周期里独立出来harness作为 brain 组织模型调用、工具调用和恢复流程可以崩溃后通过 session log 重启sandbox作为 hands 执行代码和工具请求通过execute(name, input) - string接口被调用可放在不同位置credential vault / proxy保存 OAuth token代调外部服务token 不进入 sandbox凭据和不可信代码分离session log 是可以查询、切片、重读的事件流。sandbox 也不再和 harness 住在同一个容器里而是通过execute(name, input) - string这样的接口被调用。harness 崩溃后可以通过wake(sessionId)和getSession(id)从 session log 恢复。这个拆分带来的是系统层面的健壮性。容器可以失败可以重建harness 可以失败可以重启sandbox 可以在不同位置session 则从模型上下文里抽出来变成系统级状态。安全性也随之变化。token 不进入 sandboxGit token 用于初始化 repoMCP OAuth token 放在 vault 里由专门 proxy 代调外部服务。不可信代码仍然可以在 sandbox 里执行但凭据、恢复状态和外部服务访问被放进了不同边界。这里的原则很具体把不稳定的模型行为包在相对稳定的执行、状态和权限接口后面。两类抽象这也解释了为什么 agent 基础设施正在分成两层抽象。一类是 provider abstraction也就是模型供应商抽象。统一 API 可以让开发者在不同模型和 provider 之间切换也可以配置 provider routing 和 model fallback。Vercel AI Gateway 的模型与供应商文档就是这一层的例子它处理的是模型供应商、价格、延迟和可用性变化带来的工程问题。另一类是 runtime abstraction也就是 agent 运行时抽象。Anthropic 的 Managed Agents 说的是这一层session log 从 context window 里抽出来sandbox 通过工具接口被调用credential vault/proxy 把凭据从不可信代码里隔离出来harness 可以崩溃后再从 session 恢复。这两类抽象解决的问题不同。provider abstraction 让系统减少对单个模型供应商的依赖。runtime abstraction 让工具、权限、凭据、状态恢复和可追踪性减少对单次模型调用的依赖。Managed Agents 关心的是后者agent 跑起来之后系统如何承受失败、恢复和权限隔离。架构压力LLM 无关不能理解成模型不重要。模型仍然决定 agent 的能力上限、任务拆分方式和工具调用质量。运行时抽象要处理的是模型变化太快带来的系统压力。Anthropic 给过一个模型变化很好的例子Sonnet 4.5 需要 context reset 来处理 context anxiety在 Opus 4.5 移除了这个问题然后 Opus 4.6 又改变了 sprint 结构和 evaluator 的成本收益。这解释了 runtime abstraction 的重要性。reset、evaluator、sprint structure 这些机制看起来像工程最佳实践但其中一部分其实是在编码某一代模型的缺陷。模型能力一变这些机制就可能变成额外成本。所以 LLM-independent harness 的目标不是抹平所有模型差异。它要避免的是把某一代模型的弱点硬编码进不可替换的架构。系统可以根据模型特性调整 reset、checkpoint、evaluator 和工具策略但 session log、sandbox、credential vault、trace 这些边界要尽量稳定。限制但这并不是完美的就现在来看它有三个限制。第一抽象层可能牺牲模型原生能力。越通用的框架越难充分利用 frontier model 的新能力。第二工具协议统一不等于安全问题解决。MCP 解决了连接协议标准化但 prompt injection、权限边界、token handling、tool marketplace 信任问题仍然要在 harness 层处理。第三复杂 harness 不适合所有任务。Anthropic 就有过评测一个完整 harness run 跑了 6 小时约 200 美元solo run 跑了 20 分钟成本 9 美元。Managed Agents 的意义是把 agent 工程的问题从怎样给当前模型写一套更好的脚手架发展为怎样让脚手架本身可替换。对长期运行的 agent 来说模型能力只是上限而稳定的状态、权限、恢复和观测接口决定系统能不能持续运行。最后对于正在迷茫择业、想转行提升或是刚入门的程序员、编程小白来说有一个问题几乎人人都在问未来10年什么领域的职业发展潜力最大答案只有一个人工智能尤其是大模型方向当下人工智能行业正处于爆发式增长期其中大模型相关岗位更是供不应求薪资待遇直接拉满——字节跳动作为AI领域的头部玩家给硕士毕业的优质AI人才含大模型相关方向开出的月基础工资高达5万—6万元即便是非“人才计划”的普通应聘者月基础工资也能稳定在4万元左右。再看阿里、腾讯两大互联网大厂非“人才计划”的AI相关岗位应聘者月基础工资也约有3万元远超其他行业同资历岗位的薪资水平对于程序员、小白来说无疑是绝佳的转型和提升赛道。对于想入局大模型、抢占未来10年行业红利的程序员和小白来说现在正是最好的学习时机行业缺口大、大厂需求旺、薪资天花板高只要找准学习方向稳步提升技能就能轻松摆脱“低薪困境”抓住AI时代的职业机遇。如果你还不知道从何开始我自己整理一套全网最全最细的大模型零基础教程我也是一路自学走过来的很清楚小白前期学习的痛楚你要是没有方向还没有好的资源根本学不到东西下面是我整理的大模型学习资源希望能帮到你。扫码免费领取全部内容1、大模型学习路线2、从0到进阶大模型学习视频教程从入门到进阶这里都有跟着老师学习事半功倍。3、 入门必看大模型学习书籍文档.pdf书面上的技术书籍确实太多了这些是我精选出来的还有很多不在图里4、AI大模型最新行业报告2026最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。5、面试试题/经验【大厂 AI 岗位面经分享107 道】【AI 大模型面试真题102 道】【LLMs 面试真题97 道】6、大模型项目实战配套源码适用人群四阶段学习规划共90天可落地执行第一阶段10天初阶应用该阶段让大家对大模型 AI有一个最前沿的认识对大模型 AI 的理解超过 95% 的人可以在相关讨论时发表高级、不跟风、又接地气的见解别人只会和 AI 聊天而你能调教 AI并能用代码将大模型和业务衔接。大模型 AI 能干什么大模型是怎样获得「智能」的用好 AI 的核心心法大模型应用业务架构大模型应用技术架构代码示例向 GPT-3.5 灌入新知识提示工程的意义和核心思想Prompt 典型构成指令调优方法论思维链和思维树Prompt 攻击和防范…第二阶段30天高阶应用该阶段我们正式进入大模型 AI 进阶实战学习学会构造私有知识库扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架抓住最新的技术进展适合 Python 和 JavaScript 程序员。为什么要做 RAG搭建一个简单的 ChatPDF检索的基础概念什么是向量表示Embeddings向量数据库与向量检索基于向量检索的 RAG搭建 RAG 系统的扩展知识混合检索与 RAG-Fusion 简介向量模型本地部署…第三阶段30天模型训练恭喜你如果学到这里你基本可以找到一份大模型 AI相关的工作自己也能训练 GPT 了通过微调训练自己的垂直大模型能独立训练开源多模态大模型掌握更多技术方案。到此为止大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗为什么要做 RAG什么是模型什么是模型训练求解器 损失函数简介小实验2手写一个简单的神经网络并训练它什么是训练/预训练/微调/轻量化微调Transformer结构简介轻量化微调实验数据集的构建…第四阶段20天商业闭环对全球大模型从性能、吞吐量、成本等方面有一定的认知可以在云端和本地等多种环境下部署大模型找到适合自己的项目/创业方向做一名被 AI 武装的产品经理。硬件选型带你了解全球大模型使用国产大模型服务搭建 OpenAI 代理热身基于阿里云 PAI 部署 Stable Diffusion在本地计算机运行大模型大模型的私有化部署基于 vLLM 部署大模型案例如何优雅地在阿里云私有部署开源大模型部署一套开源 LLM 项目内容安全互联网信息服务算法备案…扫码免费领取全部内容3、这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑