资讯动态

告别Prompt内卷!AI Agent竞争已转向「上下文工程」:这才是真正的胜负手!

发布时间:2026/8/20 1:37:43 来源:尧图企业网站定制
AI大模型应用的重心已从早期的Prompt Engineering提示词工程转向更复杂的Context Engineering上下文工程。如今竞争焦点在于如何有效管理模型赖以执行任务的「工作现场」包括信息检索、压缩、记忆存储、内容删除、工具接入及运行环境设置等。这要求开发者不仅要关注模型本身更要构建一套完整的支持系统如RAG、长上下文、记忆机制、沙盒环境等。Context Engineering的核心是优化模型推理时所需的全局信息而非简单的提示词修饰。未来Agent的强弱将更多取决于其上下文管理系统的优劣而非模型权重。摘要过去大家以为 AI 应用在卷 prompt。现在看真正的竞争正在转向 context检索什么、压缩什么、记住什么、删掉什么、接入什么工具、放进什么运行环境。Agent 的能力越来越不只在模型权重里而在模型周围那套可演化的工作现场里。过去两年大模型应用的重心变了好几次。最早大家卷的是 Prompt Engineering。模型回答不好第一反应是是不是提示词没写对于是出现了各种模板、角色扮演、few-shot、CoT、system prompt、反向提示词。那时很多人相信只要把「咒语」写得足够精确就能把模型能力榨出来。后来大家发现问题不只是怎么问。模型不知道你的内部文档不知道代码库当前状态不知道用户上一次改了什么也不知道某个任务刚刚失败在哪里。于是 RAG、长上下文、工具调用、文件系统、memory、MCP、sandbox、AGENTS.md、skills、subagents 这些东西开始变成 AI 应用的基础设施。这不是简单换了一个新名词。Prompt Engineering 关心的是「给模型一句更好的指令」。Context Engineering 关心的是「给模型组织一个更好的工作现场」。如果只记一个结论我会这样说AI Agent 的竞争正在从「模型能不能回答」转向「系统能不能持续给模型提供正确、紧凑、可执行、可更新的上下文」。这就是为什么 Context Engineering 会突然重要起来。先把概念说清楚context 不是 prompt 的同义词很多人听到 Context Engineering会本能觉得这是 Prompt Engineering 的包装版。这不完全对。Prompt 是 context 的一部分但 context 远比 prompt 大。一个真正可用的 Agent在执行任务时看到的东西通常包括用户当前的问题system prompt 和开发者指令历史对话摘要相关文档和代码片段检索回来的证据工具说明和可调用 schema文件系统状态任务计划、失败记录、用户偏好sandbox、权限、运行日志、测试结果其他 agent 或上一次运行留下的记忆。这些东西都在影响模型下一步怎么思考、怎么调用工具、怎么写代码、怎么判断结果是否可信。所以Context Engineering 的核心不是「写一个更漂亮的提示词」而是把模型推理时依赖的全部信息载荷工程化。《A Survey of Context Engineering for Large Language Models》把这个领域拆成几个基础部件context retrieval and generation、context processing、context management然后再看它们如何组合成 RAG、memory systems、tool-integrated reasoning 和 multi-agent systems。这个视角很有用因为它说明 context 不是一个输入框而是一整套系统设计。这篇 survey 还提到一个很关键的不对称现在模型在理解复杂上下文上已经很强但生成同样复杂、长程一致的输出仍然有限。也就是说把信息塞进去只是第一步真正困难的是让模型在长任务里持续保持正确状态。这就是 Agent 和普通 Chatbot 的分水岭。Chatbot 可以只回答当前问题。Agent 必须在一个不断变化的上下文里工作。Prompt Engineering第一代入口但天花板很低Prompt Engineering 曾经非常重要原因也很简单早期大模型的能力很大一部分是隐性的。你问得不好它就像普通聊天机器人你给 few-shot、给格式、给推理步骤它就突然会做复杂任务。Chain-of-Thought 是一个典型例子。很多推理能力不是通过改权重出现的而是通过改变上下文里的示范和指令被激活。这给了应用开发者一个直觉模型能力不只由参数决定也由输入时提供的信息决定。但 Prompt Engineering 的问题也在这里。它太静态了。一个 prompt 再精致也很难长期回答这些问题这次任务要读哪些文件哪些历史信息已经过期用户上次纠正我的偏好要不要带进来工具调用失败的原因是参数错了、环境错了还是任务理解错了这段代码库里真正相关的是哪 20 个文件而不是哪 2000 个文件当 AI 应用从「单轮问答」进入「长任务执行」后prompt 模板就不够用了。你需要的是一个动态系统能检索、能压缩、能更新、能遗忘、能把经验沉淀下来。这就是 RAG 和长上下文为什么先火起来。RAG把外部知识搬进窗口RAG 解决的是一个很朴素的问题模型权重里没有这份资料怎么办答案是别指望模型记住一切把相关内容检索出来放进上下文让模型基于证据回答。这一步把 AI 应用从「靠模型记忆」推进到「靠外部知识系统」。企业知识库、法律文档、客服资料、代码仓库、论文库很多场景都依赖这个范式。但 RAG 也很快暴露出自己的边界。 第一检索不是理解。你检索到的片段可能相关但不一定足够回答问题。 第二重排不是推理。top-k 文档排序靠前不等于它们能组成一个正确答案。 第三上下文窗口不是垃圾桶。把很多资料塞进去模型可能更迷糊而不是更聪明。很多 RAG 系统早期失败不是因为模型太弱而是因为 context 没有被好好设计证据太碎、顺序混乱、冲突没有标注、旧版本和新版本混在一起最后模型只能在一堆半相关信息里猜。所以 RAG 之后大家自然走向长上下文。既然检索会漏那能不能全塞进去Long Context暴力有效但不是免费午餐长上下文的诱惑非常大。如果模型能看 100K、1M 甚至更多 token那是不是就不用复杂 agent scaffold 了直接把整个代码库、整份合同、完整聊天记录放进去让模型自己判断就好。《Putting It All into Context: Simplifying Agents with LCLMs》就给了一个很有代表性的结果。作者在 SWE-bench 这类软件工程任务上研究复杂 agent scaffold 是不是必要他们发现只要把整个环境放进长上下文模型并配合合适 promptGemini-1.5-Pro 在 SWE-Bench-Verified 上可以做到 38%和一些精心调过的复杂 agent scaffold 相当换成 Gemini-2.5-Pro同样的 unscaffolded 路线能到 50.8%。这个结果很重要。它说明有些 agent 能力确实来自「上下文足够完整」。很多时候模型不是不会修 bug而是没看到足够多的代码和环境状态。但这不是长上下文的终局。长上下文有三个成本。第一是算力成本。上下文越长prefill 越贵KV cache 越大延迟越高。第二是注意力成本。信息越多模型越容易被无关片段干扰。长窗口不等于长记忆更不等于长程任务状态管理。第三是组织成本。把整个仓库塞进去很简单但告诉模型哪些文件是证据、哪些文件是历史、哪些文件是约束、哪些文件可以修改这仍然需要工程设计。Cartridges 这篇论文正好从成本侧切进去。它研究的是面对代码库、法律文档、聊天记录这类大 corpus能不能不要每次都把全部内容塞进上下文窗口而是离线训练一个更轻的 long-context representation。论文把这个可加载的 KV cache 表示叫 Cartridge并用 self-study 生成关于 corpus 的合成对话来训练它。结果是在一些长上下文 benchmark 上Cartridges 能匹配 ICL 表现同时减少 38.6 倍 memory吞吐提升 26.4 倍。这背后的信号很清楚长上下文不是 Context Engineering 的替代品。长上下文只是让 Context Engineering 有了更大的施工场地。真正的问题仍然是哪些信息该保留哪些信息该压缩哪些信息该提前加工哪些信息该在运行时再取。MemoryAgent 不能每次都从零开始当任务变成长周期memory 就变成必需品。但这里要小心memory 不是把聊天记录无限追加到 prompt 后面。那只是更长的历史不是更好的记忆。真正有用的 memory 至少要解决三件事第一它要能抽取经验。比如用户偏好、项目约定、常见错误、验证方式。第二它要能控制增长。不能每次运行都无限膨胀否则成本和噪声都会爆炸。第三它要能服务当前推理。记忆不是存档而是下一次任务能用上的状态。MEM1 这篇论文很适合说明这一点。它批评了很多系统的 full-context prompting每一轮都把过去所有交互追加进去不管相关不相关。这样会导致 memory 无界增长、计算成本上升并且在超出训练长度分布时损害推理表现。MEM1 的做法是训练 agent 在长程多轮任务里维护一个紧凑共享状态。每一轮它把旧 memory 和新 observation 合并同时主动丢弃无关或冗余信息。论文报告在一个 16-objective multi-hop QA 任务上MEM1-7B 相比 Qwen2.5-14B-Instruct 性能提升 3.5 倍同时 memory usage 降低 3.7 倍。这说明 memory 的关键不是「记得更多」而是「记得刚好能支撑后续推理的东西」。另一个方向是把反馈沉淀成可检索规则。《Distilling Feedback into Memory-as-a-Tool》提出把 inference-time critique 转成文件式记忆让 agent 以后通过工具调用检索这些 guideline。直观上这像是把一次次人工纠错、评审意见、失败教训从临时对话里捞出来变成下一次可用的操作手册。OpenAI Agents SDK 的 memory 设计也能看到类似思路它把 sandbox agent 运行中的经验沉淀成工作区文件未来运行时再通过 progressive disclosure 读取。它明确区分 conversational Session memory 和 sandbox agent memory前者是消息历史后者是从先前运行中抽取出的可复用经验。这一步的意义是Agent 不再只是「当场想办法」。Agent 开始拥有跨任务的工作痕迹。ACEcontext 不应该是静态说明书而应该是会进化的 playbook如果 memory 是把过去经验存下来那么 Agentic Context Engineering 更进一步让 context 自己演化。《Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models》这篇论文非常适合当这条主线的核心论文。它的出发点是现在很多 LLM 应用并不是通过更新权重来适配新任务而是通过修改输入里的 instructions、strategies、evidence 来适配。但这种 context adaptation 很容易遇到两个问题。第一个是 brevity bias。系统为了保持上下文简洁会把很多领域细节总结掉。总结越短越容易丢掉真正有用的经验。第二个是 context collapse。上下文反复被改写、压缩、再改写细节会逐渐磨损。最后留下来的东西看起来很整洁但已经不够解决真实任务。ACE 的核心判断是context 不应该被当作一段静态 prompt而应该被当作一个 evolving playbook。这个 playbook 会积累、反思、组织策略而且要用结构化的增量更新来防止信息塌缩。它的流程可以粗略理解成三步Generator 生成新的经验和策略Reflector 根据执行反馈反思哪里有效、哪里失败Curator 把有价值的内容整理进 context避免无脑追加也避免过度总结。实验结果也有传播性。论文报告 ACE 在 agent benchmark 上相对强基线有 10.6% 提升在金融任务上有 8.6% 提升同时降低 adaptation latency 和 rollout cost。更有意思的是它可以不依赖标注监督而是利用自然执行反馈来适配在 AppWorld leaderboard 上ACE 用更小的开源模型匹配整体平均第一的 production-level agent并在更难的 test-challenge split 上超过它。这件事的含义很大。过去我们习惯把「学习」理解成改权重。ACE 这类方法提醒我们对很多 agent 任务来说学习也可以发生在 context 层。系统不一定要微调模型先把工作手册、失败教训、任务策略组织好就可能拿到很大的收益。这和 GEPA 的结果能连起来看。GEPA有些任务改 context 可能比 RL 更划算GEPA 的标题很直接《Reflective Prompt Evolution Can Outperform Reinforcement Learning》。它挑战的是一个最近很流行的默认想法如果要让 LLM 系统适配下游任务就上 RL比如 GRPO。GEPA 的判断是语言本身是一种比稀疏标量奖励更丰富的学习介质。很多任务失败后模型不只需要一个 0/1 奖励它更需要知道为什么错、该改哪条规则、下次如何避免。GEPA 让系统采样轨迹包括 reasoning、tool calls、tool outputs然后用自然语言反思这些轨迹诊断问题提出 prompt 更新再从 Pareto frontier 里组合互补经验。论文报告GEPA 在 6 个任务上平均比 GRPO 高 6%最高高 20%并且使用最多少 35 倍 rollouts。它还比 MIPROv2 这类 prompt optimizer 高 10% 以上例如 AIME-2025 上 12% accuracy。这不是说 GEPA 可以替代所有 RL。更准确的理解是当任务反馈可以被解释成语言规则时context 层优化可能比权重层优化更省。RL 把经验压进参数GEPA/ACE 把经验写进上下文Memory-as-a-Tool 把经验写进可检索文件Cartridges 把 corpus 压进可复用表示它们其实都在回答同一个问题模型每次执行任务前应该带着什么经验上场ExternalizationAgent 的能力正在外部化如果把上面这些论文放到一张图里会发现它们并不是零散方向。它们共同指向一个趋势能力外部化。《Externalization in LLM Agents》给了一个很好的总框架LLM agents 越来越不是通过改模型权重来构建而是通过重组运行时环境来构建。过去希望模型内部恢复的能力现在被外部化成 memory stores、reusable skills、interaction protocols以及让这些模块可靠运行的 harness。可以这样理解Memory externalizes state across time。Skills externalize procedural expertise。Protocols externalize interaction structure。Harness engineering coordinates them into governed execution。这几句话基本解释了现在 Agent 产品为什么都在往同一个方向走。OpenAI 2026 年 4 月更新 Agents SDK 时也把重点放在 harness 和 sandbox 上agent 要能 inspect files、run commands、edit code、在 controlled sandbox environments 里做 long-horizon tasks。SDK 还把 MCP、skills、AGENTS.md、shell、apply patch、memory、sandbox orchestration 这些东西放进同一套开发者基础设施里。这说明前沿 agent 系统已经不再只是「模型 tools」。它更像是模型 上下文管理 文件系统 工具协议 权限边界 运行沙盒 记忆系统 评测反馈 可复用技能。这就是 Context Engineering 的真实边界。它不是 prompt 小技巧而是 Agent OS 的雏形。把这条线放在一起看如果按时间线整理可以得到这样一条演进Prompt Engineering 先证明一件事模型能力会被输入形式强烈影响。RAG 把外部知识接进来证明上下文可以补模型权重的缺口。Long Context 进一步放大窗口证明很多 scaffold 复杂度可以被完整上下文吸收。Cartridges 说明长上下文有成本context 需要提前压缩和复用。MEM1 和 Memory-as-a-Tool 说明 memory 不是历史追加而是任务经验的选择性沉淀。ACE 把 context 从静态 prompt 推到 evolving playbook让上下文可以根据执行反馈持续改进。GEPA 说明自然语言反思本身可以成为优化信号有些场景下甚至比 RL 更高效。Externalization 最后把这些部件放到系统层Agent 的一部分能力正在从模型内部转移到模型外部的工作环境。这条线和 PPO 到 MaxRL 的强化学习线有一个很有意思的对应关系。推理 RL 在问怎么通过可验证奖励改变模型分布Context Engineering 在问不改权重时怎么改变模型每次看到的世界前者优化的是 policy。后者优化的是 situation。Agent 真正强起来可能不是二选一而是两条线汇合训练让模型更会推理context 让模型更会工作。我自己的判断下一阶段会卷五个问题第一context 会从 prompt 模板变成可观测系统。以前大家贴一个 system prompt 就结束了。以后真正严肃的 Agent 系统会记录每次上下文由哪些来源组成、每个来源贡献了什么、哪些内容导致错误、哪些内容应该被删掉。Context trace 可能会像 today 的 model trace 一样重要。第二memory 会从聊天历史变成任务资产。最没用的 memory 是「把历史对话都记住」。更有价值的是记住项目约定、失败模式、用户偏好、验证命令、常用文件路径、业务规则和评审标准。也就是说memory 的产品形态会更像工作笔记、runbook、playbook而不是聊天记录。第三长上下文会继续变大但更重要的是压缩和复用。窗口越大越需要 context selection。否则成本、延迟、噪声都会增长。Cartridges 这类方向说明未来很多长上下文不会每次临时塞进去而会提前加工成可复用表示。第四tool 和 protocol 会成为 context 的一部分。工具不是外接插件那么简单。工具 schema、权限、失败返回、调用历史、可用资源都会改变模型决策。MCP、skills、AGENTS.md 这些东西本质上都是把「怎么和世界交互」写进上下文。第五评测会从单次答案转向长程工作质量。Context Engineering 的好坏不能只看某个 benchmark 分数。它要看任务是否能持续推进、上下文是否越来越干净、错误是否会复发、人工纠错是否能沉淀、成本是否随任务复用而下降。Agent 的评测会越来越像软件系统评测而不是一次性考试。最后总结如果把这篇文章压缩成一句话Prompt Engineering 是在写更好的问题Context Engineering 是在搭建更好的工作现场。这件事值得认真看不是因为又出现了一个新名词而是因为它揭示了 AI 应用进化的一个新规律模型权重决定了能力上限上下文决定了能力能不能在具体任务里被稳定调用harness 决定了这种能力能不能变成可靠工作流。所以下一次看到某个 Agent 产品说自己支持 memory、tools、MCP、skills、subagents、sandbox不要只把它理解成产品功能堆叠。更好的问题是它到底把哪些能力放进了模型外部这些外部能力是否能被模型稳定读取、调用、更新和验证它是在增加上下文噪声还是在减少模型每次工作的不确定性如果答案是后者那它卷的就不只是 prompt。它卷的是 Agent 时代真正稀缺的东西一个能让模型持续做对事的上下文系统。​最后我在一线科技企业深耕十二载见证过太多因技术更迭而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我整理出这套 AI 大模型突围资料包✅AI大模型学习路线图✅Agent行业报告✅100集大模型视频教程✅大模型书籍PDF✅DeepSeek教程✅AI产品经理入门资料完整的大模型学习和面试资料已经上传带到CSDN的官方了有需要的朋友可以扫描下方二维码免费领取【保证100%免费】​​为什么说现在普通人就业/升职加薪的首选是AI大模型人工智能技术的爆发式增长正以不可逆转之势重塑就业市场版图。从DeepSeek等国产大模型引发的科技圈热议到全国两会关于AI产业发展的政策聚焦再到招聘会上排起的长队AI的热度已从技术领域渗透到就业市场的每一个角落。智联招聘的最新数据给出了最直观的印证2025年2月AI领域求职人数同比增幅突破200%远超其他行业平均水平整个人工智能行业的求职增速达到33.4%位居各行业榜首其中人工智能工程师岗位的求职热度更是飙升69.6%。AI产业的快速扩张也让人才供需矛盾愈发突出。麦肯锡报告明确预测到2030年中国AI专业人才需求将达600万人人才缺口可能高达400万人这一缺口不仅存在于核心技术领域更蔓延至产业应用的各个环节。​​资料包有什么①从入门到精通的全套视频教程⑤⑥包含提示词工程、RAG、Agent等技术点② AI大模型学习路线图还有视频解说全过程AI大模型学习路线③学习电子书籍和技术文档市面上的大模型书籍确实太多了这些是我精选出来的④各大厂大模型面试题目详解⑤ 这些资料真的有用吗?这份资料由我和鲁为民博士共同整理鲁为民博士先后获得了北京清华大学学士和美国加州理工学院博士学位在包括IEEE Transactions等学术期刊和诸多国际会议上发表了超过50篇学术论文、取得了多项美国和中国发明专利同时还斩获了吴文俊人工智能科学技术奖。目前我正在和鲁博士共同进行人工智能的研究。所有的视频教程由智泊AI老师录制且资料与智泊AI共享相互补充。这份学习大礼包应该算是现在最全面的大模型学习资料了。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。智泊AI始终秉持着“让每个人平等享受到优质教育资源”的育人理念‌通过动态追踪大模型开发、数据标注伦理等前沿技术趋势‌构建起前沿课程智能实训精准就业的高效培养体系。课堂上不光教理论还带着学员做了十多个真实项目。学员要亲自上手搞数据清洗、模型调优这些硬核操作把课本知识变成真本事‌​​​​如果说你是以下人群中的其中一类都可以来智泊AI学习人工智能找到高薪工作一次小小的“投资”换来的是终身受益应届毕业生‌无工作经验但想要系统学习AI大模型技术期待通过实战项目掌握核心技术。零基础转型‌非技术背景但关注AI应用场景计划通过低代码工具实现“AI行业”跨界‌。业务赋能 ‌突破瓶颈传统开发者Java/前端等学习Transformer架构与LangChain框架向AI全栈工程师转型‌。获取方式有需要的小伙伴可以保存图片到wx扫描二v码免费领取【保证100%免费】**​

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价