资讯动态

Manus 通用 AI Agent 深度拆解:GAIA 基准、DeepSeek 与 GPT-4 协同的工程实践

发布时间:2026/10/3 6:40:12 来源:尧图企业网站定制
1. 从 GAIA 榜单说起通用 AI Agent 到底在解决什么问题如果你最近在搜索 Manus 通用 AI Agent 的技术拆解大概率会看到两个关键词反复出现GAIA 基准和 DeepSeek 与 GPT-4 的协同调用。前者是衡量 Agent 能不能真正干活的考试后者是它干活时脑子里到底在用谁的脑子。我先把这两个概念用最直白的话讲清楚再往下拆工程实现。GAIAGeneral AI Assistants benchmark不是那种让模型做选择题的考试。它给出的题目是真实世界任务比如“帮我查一下某家公司过去三年的营收变化做成折线图并给出结论”或者“从这份压缩包里筛选出符合岗位要求的简历输出 Excel 排名表”。这类任务的特点是需要多步推理、需要调用外部工具、需要处理文件、需要验证结果。GAIA 把难度分成 Level 1 到 Level 3Level 3 的题目人类专家都要花不少时间而 Manus 在三个级别上都拿到了 SOTA 成绩这才是它被反复讨论的根本原因。那 DeepSeek 和 GPT-4 在这里面扮演什么角色简单说通用 Agent 不会只用一个模型。任务规划阶段可能需要强推理模型来拆解步骤工具调用阶段可能需要快而便宜的模型来生成参数结果验证阶段又可能需要另一个模型来交叉检查。Manus 的工程实践里DeepSeek 和 GPT-4 是协同工作的不是二选一。DeepSeek 在中文理解和成本控制上有优势GPT-4 在复杂推理和代码生成上更稳两者配合才能把 GAIA 这种多步任务跑通。适合谁看这篇如果你是想自己搭一个能跑 GAIA 类任务的 Agent 开发者或者你已经在用 Claude Code、Cline 这类工具但想理解背后的编排逻辑再或者你只是好奇“通用 Agent 到底是不是噱头”这篇都会给你可复制的东西。我会给出配置模板、验证步骤和排错清单不是只讲概念。先明确一个认知Manus 这类产品的核心不是模型本身而是任务规划加工具编排的工程能力。模型是发动机编排是变速箱和底盘。GAIA 考的是整车能不能跑完复杂路况不是发动机单独多强。理解这一点后面的配置和验证才有意义。2. 前置准备TaoToken 接入与模型协同配置在复现 Manus 式 Agent 的协同调用之前你需要一个能同时访问 DeepSeek 和 GPT-4 类模型的 API 入口。自己分别去两家申请当然可以但调试阶段来回切换 Key 和 Base URL 很麻烦。我实测下来用统一的 API 网关来管理多模型调用会省很多事TaoToken 就是干这个的。先注册并拿到 Key。打开官网 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 完成账号注册后进入控制台。控制台地址是 https://taotoken.net/console 在 API Keys 页面创建一个新 Key复制保存。这个 Key 就是你后面所有配置里的核心凭证。接下来确认你要用的模型 ID。DeepSeek 系列常用的有 deepseek-chat 和 deepseek-reasonerGPT-4 系列有 gpt-4o 和 gpt-4o-mini。在模型对话页面 https://taotoken.net/models 可以先手动测试一下每个模型是否可用输入一句“用一句话说明你能做什么”看返回是否正常。这一步别跳过后面 Agent 跑不通很多时候就是模型 ID 写错了。Base URL 统一用 https://taotoken.net/api 注意这个地址不带任何查询参数。如果你用的是 OpenAI 兼容的 SDK直接把 base_url 设成这个api_key 填你刚创建的 Key。如果你用的是 Claude Code 或 Cline 这类工具它们的配置方式略有不同但核心三件套不变Base URL、API Key、Model ID。这里要提醒一个常见误区不要试图用一个模型跑完所有环节。Manus 的协同思路是规划用强推理模型执行用快模型验证用另一个模型交叉检查。你在配置时至少要准备两个模型 ID一个 DeepSeek 一个 GPT-4 系后面编排时按角色分配。如果你打算长期跑 Agent 任务建议直接看 Coding Plan https://taotoken.net/coding-plan 它针对高频编码和 Agent 场景做了额度优化比按次调用划算。接入文档在 https://taotoken.net/doc 里面有各语言 SDK 的完整示例遇到配置问题先查文档比到处问快。3. 可复制配置Agent 编排模板与 settings 片段这一节是核心我给出可以直接复制修改的配置。先讲整体结构一个通用 Agent 至少需要三个角色配置——Planner规划、Executor执行、Verifier验证。每个角色绑定不同的模型和参数。先看 JSON 格式的 Agent 配置文件你可以保存为 agent_config.json{ base_url: https://taotoken.net/api, api_key: sk-你的Key, agents: { planner: { model: deepseek-reasoner, temperature: 0.3, max_tokens: 4096, system_prompt: 你是一个任务规划专家。将用户目标拆解为可执行的步骤列表每步注明所需工具和预期输出。只输出 JSON 格式的步骤数组。 }, executor: { model: gpt-4o-mini, temperature: 0.1, max_tokens: 2048, system_prompt: 你是一个工具执行代理。根据给定的步骤和工具列表生成具体的工具调用参数。只输出工具调用 JSON。 }, verifier: { model: gpt-4o, temperature: 0.2, max_tokens: 2048, system_prompt: 你是一个结果验证专家。检查执行结果是否满足原始目标指出错误和遗漏。输出验证结论和修正建议。 } }, tools: [ web_search, python_executor, file_reader, chart_generator ], max_iterations: 10 }如果你用的是 Claude Code 或 Cline 这类工具配置方式不同。以 Cline 的 MCP 配置为例在 settings.json 里加入{ mcpServers: { taotoken-agent: { command: npx, args: [-y, taotoken/agent-mcp], env: { TAOTOKEN_BASE_URL: https://taotoken.net/api, TAOTOKEN_API_KEY: sk-你的Key, PLANNER_MODEL: deepseek-reasoner, EXECUTOR_MODEL: gpt-4o-mini, VERIFIER_MODEL: gpt-4o } } } }注意这里的三件套必须完整Base URL 是 https://taotoken.net/api API Key 是你创建的 sk- 开头的字符串Model ID 按角色分别填。少任何一个都会报连接错误。如果你用 Codex 的 auth.json 方式配置长这样{ base_url: https://taotoken.net/api, api_key: sk-你的Key, model: deepseek-reasoner, fallback_model: gpt-4o-mini }参数选择上有个经验Planner 的 temperature 不要超过 0.5否则步骤拆解会发散Executor 的 temperature 设 0.1 左右保证参数稳定Verifier 可以稍高到 0.3 让它更严格地挑错。max_iterations 控制循环上限防止 Agent 陷入死循环烧额度一般设 8 到 12 之间。工具列表按你的实际需求增减。web_search 和 python_executor 是 GAIA 类任务最常用的两个file_reader 处理上传文件chart_generator 生成可视化。如果你要跑简历筛选类任务还需要加一个 excel_writer 工具。配置写完后先别急着跑复杂任务。用一个最简单的任务验证链路是否通让 Planner 拆解“查询今天北京天气并输出一句话总结”看它能不能正确调用 web_searchExecutor 能不能生成正确的搜索参数Verifier 能不能判断结果是否合理。这一步通了再上 GAIA 难度的任务。4. 验证请求跑通一个 GAIA 风格任务配置就绪后用一段 Python 代码来验证整个编排链路。这段代码模拟 Manus 的三代理协作流程你可以直接复制运行。import json import requests BASE_URL https://taotoken.net/api API_KEY sk-你的Key HEADERS { Authorization: fBearer {API_KEY}, Content-Type: application/json } def call_model(model, system_prompt, user_content, temperature0.2): payload { model: model, messages: [ {role: system, content: system_prompt}, {role: user, content: user_content} ], temperature: temperature } resp requests.post( f{BASE_URL}/v1/chat/completions, headersHEADERS, jsonpayload, timeout120 ) return resp.json()[choices][0][message][content] task 从以下文本中提取所有日期和对应事件按时间排序输出 JSON 数组2024年3月公司发布A产品2024年7月完成B轮融资2025年1月用户破百万。 plan call_model( deepseek-reasoner, 你是任务规划专家。将任务拆解为步骤输出 JSON 数组每步含 step 和 tool 字段。, task ) print(规划结果, plan) exec_result call_model( gpt-4o-mini, 你是执行代理。根据步骤直接输出最终结果不要解释。, f任务{task}\n规划{plan} ) print(执行结果, exec_result) verify call_model( gpt-4o, 你是验证专家。检查执行结果是否正确输出 PASS 或 FAIL 及原因。, f任务{task}\n结果{exec_result} ) print(验证结果, verify)运行后你应该看到三段输出规划结果是带 step 和 tool 的 JSON 数组执行结果是排序好的日期事件 JSON验证结果是 PASS 加简短说明。如果验证输出 FAIL它会告诉你哪里错了你可以把修正建议喂回 Executor 重跑。这个流程跑通后把 task 换成 GAIA Level 1 的题目比如“找出这份 CSV 里销售额最高的三个产品并生成柱状图”。你需要额外接入 python_executor 工具来实际执行代码。工具调用的实现方式是在 Executor 的返回里解析出代码块用 subprocess 执行再把结果传回 Verifier。成功的关键标志有三个Planner 输出的步骤数在 3 到 7 之间太少说明没拆开太多说明发散了Executor 返回的是结构化结果而不是大段解释Verifier 能明确指出对错而不是含糊说“看起来没问题”。三个都满足说明你的编排链路是健康的。如果跑 GAIA Level 2 以上任务建议把 max_iterations 调到 15并且给 Executor 加上重试机制。单次工具调用失败很正常重试两次基本能覆盖网络抖动和参数格式问题。5. 常见报错排查401、local proxy failed 与 choices 读取失败这一节列的都是真实会撞上的报错按出现频率排序。401 Unauthorized是最常见的。原因通常有三个Key 复制时带了空格、Key 已过期或被删除、Authorization 头格式写错。正确格式是Bearer sk-xxxBearer 和 Key 之间一个空格Key 前面不要加引号。如果你用的是环境变量检查有没有多了一层引号导致实际值变成sk-xxx。去控制台 https://taotoken.net/api-keys 重新生成一个 Key 替换测试能快速定位是不是 Key 本身的问题。local proxy failed这个报错通常出现在你本地配了代理工具的情况下。Agent 请求走本地代理时代理没启动或者端口不对就会报这个。排查步骤先确认你的请求代码里没有硬编码 proxy 参数如果有去掉或改成正确的本地端口。另外检查环境变量 HTTP_PROXY 和 HTTPS_PROXY 是否指向了一个不可用的地址。最干净的做法是在跑 Agent 的终端里临时 unset 这两个变量再重跑。如果去掉代理后正常说明问题在代理配置不在 API 本身。reading choices 报错完整信息一般是KeyError: choices或list index out of range。这说明返回的 JSON 里没有 choices 字段通常是请求本身失败了但你没检查状态码。修复方式在解析前先判断resp.status_code 200不是 200 就把resp.text打印出来看真实错误信息。常见触发原因是 model ID 写错比如把 deepseek-reasoner 写成了 deepseek-reasoning服务端返回错误信息你的代码却直接去取 choices 就崩了。OAuth 相关报错多出现在 Claude Code 或类似工具的接入场景。如果你看到OAuth token invalid或authentication failed说明工具在尝试用 OAuth 方式认证而不是 API Key。解决方式是在工具的配置里明确指定用 API Key 模式把 Base URL 设为 https://taotoken.net/api Key 填进去。有些工具需要你在设置里关掉“使用官方登录”选项强制走自定义 API 端点。模型返回空内容也值得单独说。如果 choices 存在但 content 是空字符串检查 max_tokens 是不是设得太小或者 system_prompt 和 user_content 冲突导致模型拒绝回答。把 max_tokens 调到 2048 以上再试。循环次数超限不是报错但很常见。Agent 跑了 10 轮还没出结果通常是 Planner 拆的步骤太模糊导致 Executor 反复试错。解决办法是在 Planner 的 system_prompt 里加一句“每步必须包含明确的输入和输出格式”并且把 max_iterations 设一个硬上限超限就强制让 Verifier 输出当前最佳结果。排查顺序建议先看 HTTP 状态码再看返回体原文最后才看代码逻辑。大部分问题在返回体里已经写清楚了只是被异常捕获吞掉了。6. 从验证到落地长期跑 Agent 任务的选择跑通单次 GAIA 任务只是起点。如果你打算把这种 Agent 编排用在日常开发或业务里比如自动处理数据报表、批量筛选简历、定时抓取竞品信息那调用频率和额度消耗会快速上升。按次调用在调试阶段没问题但长期跑需要更稳定的方案。我自己的做法是调试期用按次调用快速迭代 prompt 和工具配置稳定后切到 Coding Plan https://taotoken.net/coding-plan 它在高频 Agent 场景下的额度策略更友好。接入方式不变还是那三件套Base URL 用 https://taotoken.net/api Key 用你控制台创建的Model ID 按角色分配。如果你在接入过程中遇到配置问题优先查接入文档 https://taotoken.net/doc 里面有各语言和各类工具的完整示例。想先手动验证模型可用性去模型对话页面 https://taotoken.net/models 直接测试。Key 的管理和重新生成在 https://taotoken.net/api-keys 。最后给一个实用建议把你调通的 agent_config.json 和验证脚本存成一个模板仓库下次换任务只需要改 system_prompt 和工具列表不用从头配。Agent 工程的效率提升很大程度来自配置复用而不是每次重写。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑