论文翻译:Position Paper: Agent AI Towards a Holistic Intelligence
发布时间:2026/8/15 11:45:23来源:尧图企业网站定制
这篇论文是一篇“立场论文Position Paper”重点不是报告某个实验结果而是提出一种未来 AI 的发展方向从只会处理语言或图像的模型走向能够感知、记忆、规划并采取行动的完整智能体系统。摘要近年来大型基础模型的发展显著增强了我们对开放世界环境中感知信息的理解。在利用基础模型能力的过程中人工智能研究必须摆脱过度的还原主义转而重视那些能够作为有机整体协调运行的系统。具体而言我们强调发展 Agent AI智能体人工智能一种将大型基础模型整合到智能体行动之中的具身系统。新兴的 Agent AI 领域涵盖了现有的多种具身交互和基于智能体的多模态交互包括机器人、游戏和医疗系统等。本文提出了一种实现具身智能行为的新型大型动作模型Large Action Model即智能体基础模型Agent Foundation Model。在此基础上我们讨论了 Agent AI 如何在多种领域和任务中展现出卓越能力并对我们现有的学习与认知观念提出挑战。此外我们从跨学科视角探讨了 Agent AI 的发展潜力并强调应当将人工智能的认知与意识问题纳入科学讨论。我们相信这些讨论能够为未来的研究方向奠定基础并推动社会各界更加广泛地参与其中。引言从历史上看人工智能Artificial IntelligenceAI在 1956 年的达特茅斯会议上被定义为一种人工生命形式它能够从环境中收集信息并在环境中采取有效行动。1970 年明斯基在麻省理工学院的研究团队开发了一个名为“Copy Demo”的机器人系统。该系统能够观察“积木世界”场景并成功重建所观察到的多面体积木结构Winston, 1972。这个系统由观察、规划和操作模块组成同时也说明上述每一个子问题都极具挑战性需要进一步开展研究。因此人工智能领域逐渐分化为多个专业化的子领域。虽然这些子领域分别取得了显著进展但这种过度的还原主义也模糊了人工智能研究的总体目标。为了超越当前阶段、迈向更加先进的人工智能我们强调采用亚里士多德整体主义哲学的重要性。该哲学强调应当将各个组成部分整合起来使整体所实现的能力超越各部分的简单相加。近年来大语言模型Large Language ModelsLLMs和视觉语言模型Visual Language ModelsVLMs的进展已经展现出在开放世界环境中识别语言和图像的巨大潜力OpenAI, 2023。例如研究人员已经利用大语言模型先进的语义处理能力将人类指令分解为可供机器人执行的高层任务Wake et al., 2023c,d。然而现有的多模态基础模型——即使是 GPT-4V(ision)——在完成需要预测动作的细粒度操作方面仍然面临困难。因此Durante et al.2024b提出了一种新的具身智能体基础模型embodied Agent Foundation Model。该模型融合了语言能力、视觉认知、上下文记忆和直觉推理并能够以具有适应性的方式预测具身动作。这是首项使用从机器人、游戏和医疗任务中收集的具身数据对基础模型进行预训练以开发通用人工智能体的研究。具身智能体可以被理解为一种交互式系统它通过自身的感知能力与人类交流并与环境互动同时采取符合人类意图的行动。正因如此我们认为大型具身基础模型的发展是 Agent AI 的一项重要贡献。这类模型使系统能够从不同领域的信息、动作、自然语言指令和多模态上下文中解析并推断人类意图。此外通过积极利用以动作为基础的大型基础模型我们的方法在开发一体化人工智能系统方面具有独特性。在 Agent AI 框架的基础上我们相信人工智能研究群体将逐步积累必要的认识与知识推动 AI 模型从执行被动、结构化任务转向在复杂环境中承担动态、交互式角色。这是迈向通用人工智能Artificial General IntelligenceAGI的关键一步见图 1。本文分析了一种新的 Agent AI 系统架构并回顾了机器人、游戏和医疗等 Agent AI 应用领域的近期研究。此外我们还探讨了 Agent AI 的认知层面并介绍了可能受到 Agent AI 影响的研究领域希望借此吸引更广泛的研究群体参与并积极推动该领域的发展。最后我们讨论了未来的研究方向其中包括必须解决的伦理挑战。通过这些讨论我们希望说明相关技术的发展正在如何推动 AI 智能体逐步接近 AGI即整体智能。2 Agent AI 范式2.1 Agent AI 基础我们将Agent AI定义为一种智能体它能够根据感知输入在物理环境、虚拟环境或混合现实环境中自主执行适当且符合当前情境的行动。Agent AI 代表了一种聚焦于具身智能的新范式它强调面对复杂且动态的环境应当采用一体化方法来构建交互式智能体。这种方法建立在一个基本观点之上即智能产生于学习、记忆、行动、感知、规划和认知之间复杂而紧密的相互作用见图 2。学习LearningAgent AI 能够通过获取新知识和更新已有技能来适应新的环境。为此智能体需要观察环境、理解自身行动对环境产生的影响并从人类示范中学习Wake et al., 2021。例如智能体可以采用强化学习Reinforcement LearningRL或者基于人类示范的监督学习方法——如模仿学习Imitation LearningIL和行为克隆Behavior Cloning——逐步改善自己的行为。记忆Memory长期记忆使智能体能够记住特定的操作并根据当前环境或用户偏好调整这些操作。相比之下短期记忆记录的是智能体在一次任务执行过程中已经采取的行动以及此前观察到的感知信息。借助短期记忆系统可以根据历史信息重新进行规划并思考下一步应当采取什么行动。行动ActionAgent AI 的行动不一定是现实世界中的物理动作。根据环境的具体定义行动也可以包括与虚拟现实Virtual RealityVR环境进行交互或者向人类说话。智能体会根据记忆通过认知过程从已经学会的技能中选择适当的行动。此外现实世界中的操作通常无法一次完成因此需要智能体与人类或环境进行多轮交互。这些交互同样由认知过程和记忆——例如对话历史——协调完成。感知Perception与人类一样稳健的多模态感知能力对于智能体理解环境至关重要。视觉感知是其中最重要的能力之一它使智能体能够理解图像、视频和游戏画面等形式的世界信息。同样听觉感知对于理解人类意图也非常重要。规划Planning规划是长期任务的重要组成部分。例如机器人为了实现某个特定目标需要在环境中对物体进行操作。规划策略通常取决于任务目标。面向目标的规划能够实现灵活操作使智能体可以适应由外部或内部干扰所造成的不确定性。认知层面Cognitive AspectsAgent AI 不仅关注各个独立组件的性能也关注整个系统所能发挥的整体效用。设想这样一个场景一个机器人刚刚被拆箱启用便开始与不具备专业知识的普通用户交流并迅速适应用户的家庭环境进而完成各种家务任务。实现这样的系统非常困难因为它需要一种机制来协调 Agent AI 的所有组成部分。这里所说的协调功能就是 Agent AI 的认知层面。图 2Agent AI 范式该范式用于支持具身的多模态通用智能体系统包含以下五个主要模块环境中的智能体与感知包括任务规划和观察智能体学习记忆行动认知与意识。我们认为对这些组成部分进行紧密而协调的整合有助于实现整体智能。与以往的一些交互策略相比该方法的一项关键区别是训练完成后智能体的行动可以直接影响任务规划而不需要像以往的交互范式那样必须先接收环境反馈才能规划下一步行动。2.2 Agent AI 的意识Agent AI 可以超越简单的组件协调并可能涉及某种形式的“意识”。近期一些研究尝试根据神经科学的认识判断 AI 是否具有意识。在这些研究中神经科学家讨论了两个可能的意识指标能动性Agency和具身性EmbodimentButlin et al., 2023。能动性能动性是指一个系统具备以下能力从反馈中学习为了实现目标而作出决策在相互冲突的目标之间进行调整。它体现了系统通过与环境交互来实现目标的特征。具身性具身性涉及理解并利用“行动”与“环境反馈”之间的关系从而影响智能体的感知或控制过程。它强调智能体应当理解如何在认知过程中利用自身的身体以及周围的环境。本文提出的 Agent AI 根据语言信息——即文本指令——感知输入和行动历史来预测最优行动。由于它能够产生面向目标的行动因此体现了能动性。同时它也能从自身行动与环境结果之间的关系中学习因此符合具身性原则。基于这些特征我们或许能够对 Agent AI 意识的某些方面进行量化。这也表明 Agent AI 可能对多个学科产生影响包括神经科学、生物学、物理学、生物物理学、认知科学、医疗健康和道德哲学。开发 Agent AI 可以采用多种不同的方法。第 4 节将介绍一个具体的 Agent AI 实例第 6 节则将讨论该领域面临的主要挑战以及需要采取的措施其中包括 Agent AI 研究中的伦理问题。3 智能体基础模型Agent AI 系统可以与环境、人类以及其他智能体进行交互。我们认为“智能体与环境的交互”所涵盖的范围比具身智能体更广。例如环境智能Ambient Intelligence系统即使没有具体的物理实体也可以嵌入环境并与环境交互。能够与人类交互的智能体系统也是该领域重点关注的方向。我们坚信人类与智能体之间的多模态交互不应局限于高层意图指令。面向人机交互中的低层细粒度动作控制这是一项很有前景的研究方向。我们还希望开发能够在多智能体基础设施中实现有效的智能体间通信和高效协作的系统并探索新的智能体范式和智能体学习策略。本节将概述一种结合基础模型与最新机器学习技术的 Agent AI 系统。该系统由三个部分组成交互式智能体 Transformer采用强化学习和模仿学习的智能体基础模型学习策略自我改进机制。3.1 智能体 Transformer图 3交互式智能体基础模型框架概览该 Transformer 被设计用于处理处于不同抽象层级的多模态信息。这种方法可以帮助智能体更全面地理解上下文从而采取更加连贯的行动。该框架能够跨越多种任务领域和应用进行学习。本文分析了一种基于 Transformer 的多模态编码器见图 3。它使交互式智能体能够根据多模态信息采取行动。该模型通过三个预训练子模块进行初始化视觉模块智能体行动模块语言模块。为了促进跨模态信息共享Durante et al.2024b提出的基础模型允许智能体预测行动或“行动词元”action tokens从而完成机器人、游戏和交互式医疗等领域的具身任务。在预训练过程中该模型还会将多种历史数据输入 Transformer作为上下文。这些数据包括但不限于此前执行的低层细粒度行动即智能体信息视频或图像音频语言高层指令。因此在任意给定的时间步上模型都可以预测低层操作词元即行动词元通用智能体类型例如游戏中的 TypeChat或者高层指令例如智能体意图。此外这个统一的 Transformer 还能够根据文本提示、视觉上下文和先前行动生成高层指令。通过这种方式模型可以同时考虑当前上下文和历史交互从而更加准确地响应当前任务。3.2 智能体学习策略强化学习Reinforcement LearningRL为了根据行动产生的奖励或惩罚学习状态与行动之间的最优关系我们可以使用强化学习。强化学习是一种具有较强扩展性的框架目前已经应用于包括机器人在内的许多领域。在不少应用中收集人类示范既困难又昂贵。例如研究人员可能需要在自动生成的虚拟环境中学习行动策略。在这类场景中强化学习尤其有效采用演员-评论家架构的 PPO 算法就是一个典型例子Schulman et al., 2017。强化学习还可以用于建模人类与 AI 之间的交互而这是交互式 Agent AI 的一个重要方面。例如可以通过人类反馈强化学习Reinforcement Learning from Human FeedbackRLHF训练智能体Ouyang et al., 2022。这样人类可以直接选择自己希望得到的响应而无须手工设计奖励函数。模仿学习Imitation LearningIL模仿学习利用示范数据使智能体模仿人类专家的行动。例如在机器人领域行为克隆Behavioral CloningBC是模仿学习的一种主要框架。行为克隆直接复制人类专家的行动以此训练机器人模仿专家。具体而言研究人员首先记录专家执行特定任务时的行动然后训练机器人使其能够在相似情境中复现这些行动。近期基于行为克隆的方法通常会融合大语言模型或视觉语言模型技术从而构建更加先进的端到端模型。例如Brohan 等人提出了 RT-1Brohan et al., 2022和 RT-2Brohan et al., 2023。这两种基于 Transformer 的模型以一系列图像和语言信息为输入为机器人的底座和机械臂输出行动序列。据报道由于使用了大量示范数据进行训练这些模型表现出了很强的泛化能力。传统 RGB 输入多年来利用图像输入学习智能体行为一直是一个受到广泛关注的研究方向Mnih et al., 2015。使用 RGB 图像作为输入时一个内在挑战是“维数灾难”。为了解决这个问题研究人员通常采用两种方法使用更多数据Jang et al., 2022Ha et al., 2023在模型设计中引入归纳偏置以提高样本效率。在操作任务中一些研究将三维结构融入模型架构Zeng et al., 2021Shridhar et al., 2023Goyal et al., 2023James and Davison, 2022。在机器人导航任务中研究人员则使用地图作为环境表示Chaplot et al., 2020a,b。地图既可以由神经网络聚合此前所有 RGB 输入并学习得到也可以通过神经辐射场Neural Radiance FieldsNeRF等三维重建方法生成Rosinol et al., 2022。3.3 智能体系统中的优化智能体系统的优化可以分为空间优化和时间优化两个方面。空间优化空间优化关注智能体如何在物理空间中执行任务包括机器人之间的协调、资源分配以及维持空间的有序状态。为了有效优化 Agent AI 系统特别是包含大量并行行动智能体的系统以往研究主要采用大批量强化学习方法Shacklett et al., 2023。由于面向特定任务的多智能体交互数据集较为稀缺自博弈强化学习可以让智能体团队随着时间推移不断进步。然而这种方法也可能产生非常脆弱的智能体由于过度拟合自博弈训练范式它们只能在自博弈条件下正常工作却无法与人类或其他独立智能体顺利合作。为了解决这一问题我们可以发现并建立多样化的协作约定Cui et al., 2023Sarkar et al., 2023然后训练能够理解广泛约定的智能体。基础模型还可以帮助智能体与人类或其他独立智能体建立协作约定从而与新智能体顺畅配合Gong et al., 2023。时间优化时间优化关注智能体如何随时间推进来执行任务包括任务调度、任务排序以及时间安排效率。例如对机械臂的运动轨迹进行优化就是在连续任务之间提高运动效率的一种方法Zhou et al., 2023b。在任务调度层面LLM-DPDagan et al., 2023和 ReActYao et al., 2023等方法通过交互式地考虑环境因素解决高效任务规划问题。3.4 Transformer 的自我改进目前基于基础模型的 AI 智能体已经能够从多种不同的数据来源中学习因此可以更加灵活地获得训练数据。这会带来两个重要结果可以使用用户数据和人机交互数据进一步优化、改进智能体可以使用现有的基础模型及其模型产物生成训练数据。后续章节将更加详细地讨论这两点。不过需要注意的是当前的 AI 智能体在很大程度上依赖已有的预训练基础模型因此通常无法通过与环境持续交互来不断学习。我们认为持续学习是一个令人期待的未来研究方向。Bousmalis 等人的初步研究已经表明用于机器人控制的自我改进智能体能够在没有监督的情况下通过与环境交互持续学习和改进Durante et al., 2024bBousmalis et al., 2023。此外迭代学习过程还可以利用人类反馈Gong et al., 2023。例如在机器人教学场景中Agent AI 可以根据人类提供的多模态指令理解自己需要完成什么任务Wake et al., 2021。随后它根据这些指令生成图像或场景并使这些内容能够在虚拟世界中进行操作。系统利用用户反馈不断重复这一过程使 Agent AI 得以逐步改进并适应所在的环境。4 Agent AI 的分类Agent AI 的目标是开发能够在不断变化的世界中灵活行动并与之交互的智能体。这些智能体通过直接参与环境交互学习并解决复杂任务。通用基础模型的显著进展推动了这一领域的发展使 AI 在过去被认为极具挑战性的多个领域中取得了超越人类的表现。这些进展也大幅提升了具身人工智能的能力。研究人员正在迅速推进能够实现以下能力的智能体感知周围环境进行自然语言对话理解并回应听觉输入在环境中导航和操作以实现特定目标推理自身行动所产生的长期后果。我们尤其关注具身 AI 系统的多模态特性以及如何开发新的方法将多种感官输入综合转化为有意义的智能体输出。4.1 具身智能体分类图 4智能体空间的两个分类维度具身 Agent AI 可以根据其是否需要在现实或虚拟环境中执行低层级、细粒度的动作进行分类。本文将这种动作称为操作行动manipulation action例如预测具体动作。与之相对智能体的行动也可能主要用于向机器人或人类传递高层信息或意图指令。本文将这种行动称为意图行动intention action例如通用任务规划。智能体所在的环境则可以大致分为物理世界和虚拟世界。根据“行动类型”和“环境类型”这两个维度本文将具身与交互式智能体划分为四个主要类别。Agent AI 是指整合了大型基础模型的 AI 系统。因此近期许多基于大语言模型或视觉语言模型的 AI 系统都可以归入 Agent AI 的不同子类别。具体而言如图 4 所示本文按照智能体的行动类型及其所处环境对 Agent AI 进行分类环境与行动操作行动意图行动物理环境物理环境中的操作行动物理环境中的意图行动虚拟环境虚拟环境中的操作行动虚拟环境中的意图行动本节将回顾相关研究Durante et al., 2024a并按照以上四个类别进行整理。附录 A 还进一步讨论了同时结合意图智能体和操作智能体的系统。4.1.1 物理环境中的操作行动这一类别的智能体被设计用于物理世界机器人应用是其中的典型例子Ahn et al., 2022aHuang et al., 2022bLiang et al., 2022Driess et al., 2023Brohan et al., 2023。采用端到端方式训练智能体完成物理操作通常非常困难因为收集大量训练数据需要付出很高的成本。因此近期研究趋势逐渐转向使用大型基础模型解决高层任务规划问题再将其与通过传统方法训练的低层控制器相结合。相关研究包括 RT-1Brohan et al., 2022、RT-2Brohan et al., 2023以及智能体基础模型Durante et al., 2024b。也就是说大模型主要负责理解目标并制定计划而专门的低层控制器负责把计划转化为机器人可以实际执行的精细动作。4.1.2 虚拟环境中的操作行动这类智能体使用虚拟仿真环境。在机器人领域其主要目标是通过反复试错来训练 Agent AI尤其适用于那些在物理世界中进行试验不切实际或风险较高的任务。这些任务包括预测用户行动以及在特定约束条件下制定任务计划Ahn et al., 2022bBrohan et al., 2023Durante et al., 2024bGong et al., 2023。对于游戏智能体而言研究目标通常不是最终将智能体迁移到物理世界智能体在仿真环境中的学习本身就是主要目标Park et al., 2023cWang et al., 2023b,eBaker et al., 2022。另有多项研究表明在大规模文本、图像和视频数据上训练并与视觉信息对齐的通用大语言模型可以成为构建多模态具身智能体的基础。这些智能体能够在不同环境中采取行动Baker et al., 2022Driess et al., 2023Brohan et al., 2023Durante et al., 2024b。相关研究通常会使用仿真平台来开展物体识别等任务Kolve et al., 2017Wang et al., 2023dMees et al., 2022Yang et al., 2023aEhsani et al., 2021Szot et al., 2021Puig et al., 2018Carroll et al., 2019Li et al., 2021Srivastava et al., 2022Mittal et al., 2023Zhong et al., 2023Liu and Negrut, 2021Saito et al., 2023Huang et al., 2022a。4.1.3 物理环境中的意图行动这类交互式智能体的典型应用可以在医疗健康领域找到例如辅助诊断和知识检索Lee et al., 2023Peng et al., 2023。在类似的应用背景下一些研究开发了能够感知和表达同理心的智能体用于参与对话和人机交互Chen et al., 2021Mao et al., 2022Wake et al., 2023aSavva et al., 2019Puig et al., 2023Huang et al., 2018。在其他情况下Agent AI 对知识和逻辑推理的关注涉及隐式知识与显式知识的整合。这种整合使智能体能够生成更加准确、更加符合当前情境的回答Brown et al., 2020OpenAI, 2023Lewis et al., 2020Peng et al., 2023Gao et al., 2022Marcus and Davis, 2019Gao et al., 2020Wang et al., 2023aChen et al., 2020Park et al., 2023aLi et al., 2023b。4.1.4 虚拟环境中的意图行动这一类别的 Agent AI 研究表明智能体可以用于在游戏、虚拟现实VR和扩展现实XR中创建交互式内容Chen et al., 2021Mao et al., 2022Huang et al., 2023b。按照指令进行导航也是这一类别中的代表性任务Tsoi et al., 2022Deitke et al., 2020。与执行意图行动的游戏智能体类似这类 Agent AI 已经在一些特定游戏中展现出超越人类的表现Meta Fundamental AI Research et al., 2022Yao et al., 2023。近期的机器人研究也使用大语言模型进行任务规划Ahn et al., 2022aHuang et al., 2022bLiang et al., 2022。其做法是把自然语言指令分解为一系列子任务以自然语言或 Python 代码的形式表达这些子任务再由低层控制器负责执行。4.2 多模态智能体分类非具身这一类智能体强调使用多模态信息从各自的应用角度产生有用的非具身行动。这意味着智能体需要同时具备较强的语言识别能力和视觉识别能力也进一步说明了利用大型基础模型的有效性。多模态智能体已经在多种任务中展现出重要价值。大规模基础模型和交互式人工智能的进步为多模态智能体带来了新的能力。许多研究使用多模态智能体执行任务规划Huang et al., 2022aWang et al., 2023bYao et al., 2023Li et al., 2023b利用大型多模态模型从互联网规模数据中获得的领域知识及其零样本规划能力完成规划、推理等智能体任务。此外Huang et al.2022b、Liang et al.2022和 Wang et al.2023e还将环境反馈纳入智能体系统以提高任务表现。不过要让 Agent AI 真正发挥作用它必须提供直观的交互体验并能适应多种环境、上下文和信息模态。为了推动这一领域的研究本文提出了一套广泛的非具身多模态智能体分类。它包括但不限于以下类别Gui et al., 2022aPark et al., 2023b仿真与环境智能体Puig et al., 2018生成式智能体Huang et al., 2023b知识与逻辑推理智能体Lewis et al., 2020Peng et al., 2023Wang et al., 2023aGui et al., 2022b情感智能体Chen et al., 2021神经符号智能体Chen et al., 2020面向传统多模态任务的智能体多模态智能体系统及其基础设施多模态智能体的实际应用。5 Agent AI 的应用任务第 4 节对 Agent AI 领域的现有研究进行了分类。为了更加具体地说明 Agent AI 的应用本节介绍四个可能受到 Agent AI 重大影响的关键领域。5.1 机器人机器人是一类具有代表性的智能体需要与周围环境进行有效交互。本节介绍实现高效机器人操作所必需的关键要素回顾大型基础模型已经得到应用的研究课题并总结近期研究提供的启示。多模态系统Multimodal Systems近期研究重点开发端到端机器人系统。这些系统将大型基础模型作为输入信息的编码器根据语言指令和视觉线索引导机器人行动Huang et al., 2018Jiang et al., 2022Brohan et al., 2022, 2023Li et al., 2023fAhn et al., 2022bShah et al., 2023bLi et al., 2023c。换言之机器人不再只接收一种形式的输入而是综合理解语言、图像及其他感知信息再决定应当执行的动作。任务规划与技能训练Task Planning and Skill Training大语言模型先进的语言处理能力可以解释人类指令并将其分解为一系列机器人行动步骤从而推动任务规划技术的发展Ni et al., 2023Li et al., 2023aParakh et al., 2023Wake et al., 2023b。在技能训练方面大型基础模型可以用于设计奖励函数Yu et al., 2023Katara et al., 2023Ma et al., 2023为策略学习生成训练数据Kumar et al., 2023Du et al., 2023直接作为奖励函数的一部分Sontakke et al., 2023。现场优化On-site Optimization现场优化是指将任务计划与实时环境数据结合起来动态调整和改进机器人的技能Ahn et al., 2022bZhou et al., 2023bRaman et al., 2023Chen et al., 2021。相关策略试图使机器人的执行真正建立在当前环境之上。为此系统可以在任务规划层面调整整体计划也可以在控制器层面修正机器人的具体动作。对话智能体Conversation Agents大语言模型可以帮助对话机器人与人类进行自然且符合上下文的交流Ye et al., 2023Wake et al., 2023d。这些模型能够处理语言并生成类似人类对话的回答还能估计话语中包含的概念属性Hensel et al., 2023Teshima et al., 2022和情感属性Zhao et al., 2023Yang et al., 2023bWake et al., 2023a。导航智能体Navigation Agents机器人导航的核心问题包括基于地图的路径规划以及同步定位与建图Simultaneous Localization and MappingSLAMGuimarães et al., 2016。近期研究使机器人能够在具有挑战性的环境中根据物体名称进行导航Chaplot et al., 2020aBatra et al., 2020Gervet et al., 2023Ramakrishnan et al., 2022Zhang et al., 2021或者执行零样本物体导航即寻找训练期间没有专门见过的目标物体Gadre et al., 2023Dorbala et al., 2023Cai et al., 2023。视觉语言导航Vision-Language NavigationVLN要求机器人理解自然语言句子并在未见过的环境中进行导航Anderson et al., 2018Shah et al., 2023aZhou et al., 2023aDorbala et al., 2022Liang et al., 2023Huang et al., 2023a。由于视觉语言导航需要理解完整句子而不仅仅是识别物体名称因此它要求系统具备更强的文本解析能力Wang et al., 2019。5.2 游戏游戏提供了一个独特的“沙盒环境”可以用来检验大型基础模型的智能体行为并探索其协作和决策能力的边界。本节重点介绍四个方面用以体现智能体与人类玩家、其他智能体进行交互的能力以及它在环境中采取有意义行动的能力。非玩家角色行为NPC Behavior在现代游戏系统中非玩家角色Non-Player CharactersNPC的行为主要由开发人员编写的预定义脚本决定。这些脚本规定了 NPC 如何根据游戏环境中的各种触发条件或玩家行动作出反应和进行交互。在这一背景下Agent AI 有望推动 NPC 技术发生重大变化。通过使用大型基础模型Agent AI 可以生成动态对话并根据玩家反馈和游戏数据不断改进角色行为从而显著促进游戏 NPC 的发展。人类与 NPC 的交互Human-NPC InteractionAgent AI 在改善人类玩家与 NPC 之间的互动、提供更具沉浸感的游戏体验方面发挥着重要作用。传统的交互模式基本上是单向的NPC 仅按照预先设定的方式回应玩家输入。使用大型基础模型的 Agent AI 则可以分析人类行为并从中学习从而提供更接近人类的互动提高游戏的真实感和沉浸感Gong et al., 2023。基于智能体的游戏分析Agent-based Analysis of Gaming游戏已经成为日常生活的重要组成部分。据估计全球约有一半人口参与游戏活动Intelligence, 2020而游戏也可能对心理健康产生积极影响Granic et al., 2014。然而由于游戏角色的行为主要由开发人员手工设计现代游戏系统在与人类玩家互动时常常存在不足。在这种情况下Agent AI 可以发挥重要作用。它能够分析聊天记录、玩家反馈等游戏内文本数据识别玩家的行为模式和偏好分析游戏过程中的图像及视频数据理解用户的意图和行动。游戏场景合成Scene Synthesis for Gaming场景合成对于创建和改善沉浸式游戏环境十分重要包括生成三维场景、创建地形、放置物体、构建逼真的光照以及生成动态天气系统Huang et al., 2023b。现代游戏通常需要提供规模庞大的开放世界因此必须采用程序化技术或 AI 驱动的方法来自动生成地形。使用大型基础模型的 Agent AI 可以根据设计师的意图和当前场景制定不重复且独特的景观设计规则在保证所生成资产语义一致性的同时提供足够的变化。这些模型还可以加快物体放置和内容生成的过程从而提高整体设计效率。5.3 交互式医疗在医疗健康领域Agent AI 可以利用大型基础模型理解用户意图、检索临床知识并掌握正在发生的人际互动从而同时帮助患者和医生。其能力并不限于这些方面具体应用包括以下几类。诊断智能体Diagnostic Agents使用大语言模型构建医疗聊天机器人并辅助患者诊断已经受到广泛关注。这类系统可能帮助医疗机构对患者进行分诊和初步诊断并使不同人群获得更加公平的医疗服务Lee et al., 2023。医疗智能体能够理解不同的语言、文化背景和健康状况因此可能成为改善数百万人医疗服务的一种途径。初步研究结果表明在大规模网络数据上训练并掌握医疗知识的大语言模型具有一定潜力Durante et al., 2024a,b。不过模型在医疗场景中产生“幻觉”或错误信息的风险仍然是一项不可忽视的挑战。知识检索智能体Knowledge Retrieval Agents在医疗环境中模型幻觉可能十分危险甚至可能对患者造成严重伤害或导致死亡。因此使用智能体进行可靠的知识检索Peng et al., 2023或者采用基于检索的文本生成方法Guu et al., 2020都是很有前景的研究方向。将诊断智能体与医疗知识检索智能体结合可以降低模型产生幻觉的概率并提高回答的质量、准确性和精确程度。远程医疗与远程监测Telemedicine and Remote Monitoring在远程医疗和远程监测中基于智能体的 AI 可以扩大医疗服务的可及性改善医护人员与患者之间的沟通并提高医患互动的效率Amjad et al., 2023。智能体可以协助分流和整理来自医生、患者及其他医疗服务人员的信息突出显示重要通信内容并可能推动远程医疗和数字健康行业发生重大变化。5.4 交互式多模态任务视觉理解与语言理解的结合是 Agent AI 的基础。因此Agent AI 的发展与多模态任务的表现密切相关。这些任务包括图像描述生成视觉问答视频语言生成视频理解。以下是近期受到广泛关注的一些任务。图像与语言的理解和生成图像语言理解要求系统使用语言解释给定图像中的视觉内容并生成与之相关的语言描述。这项任务对于开发能够以更加接近人类的方式与世界交互的 AI 智能体至关重要。常见任务包括图像描述生成Lin et al., 2014Sharma et al., 2018Young et al., 2014Krishna et al., 2016指代表达即使用语言指向图像中的特定对象Yu et al., 2016Karpathy et al., 2014视觉问答Antol et al., 2015Ren et al., 2015Singh et al., 2019。这些任务要求的能力远远超出简单的物体识别。智能体需要深入理解空间关系和视觉语义并结合世界知识才能进行准确描述和推理。视频与语言的理解和生成视频描述与视频故事生成要求系统针对一系列视频帧生成连贯的句子。这项任务具有较大挑战因为系统必须全面理解每一帧内容及不同帧之间的关系。近期研究利用大型基础模型改善视频语言生成并着重开发能够感知智能体的文本生成模型使其可以编码视频序列并生成连贯段落。视频理解将图像理解扩展到了动态内容。它要求智能体同时处理视觉、文本和音频等模态。关键任务包括视频描述生成视频问答活动识别。这些任务主要关注时间对齐、序列处理以及复杂活动的解释。智能体还需要处理语音、背景声音等音频线索以理解视频的情绪和细微含义。与此同时另一类研究首先利用大型模型生成具有一定规模的数据集再使用生成的数据进行视觉指令微调Durante et al., 2024a,bLi et al., 2023dZhu et al., 2023。随后系统使用多种音频、语音和视觉专家感知模型将视频内容转化为语言使用自动语音识别工具转录视频中的语音使用不同的标注、定位和描述模型生成视频描述及相关数据Li et al., 2023eMaaz et al., 2023Chen et al., 2023Wang et al., 2023c。这些技术表明使用生成的数据集对视频语言模型进行指令微调可能增强模型的视频推理和交流能力。由此形成的智能体能够理解视频的上下文识别其中的关键步骤并生成连贯的操作过程摘要。这不仅能够提高模型的可解释性还能使模型向用户提供有用的反馈或指导。论文在附录 B.1、B.2 和 B.3 中进一步讨论了跨模态与混合现实相关主题。6 Agent AI 的部署我们认为为了开发一个整合上述要素的系统需要来自广泛领域的专家和实践人员共同参与。以下是一些重要的研究方向。探索新的范式开发能够整合音频、图像、文本和传感器输入等多种模态的智能体范式可能有助于解决大型模型普遍存在的问题例如输出中的幻觉和偏见从而增强智能体在各种应用中的识别与响应能力。通用端到端系统通过使用大规模数据训练端到端模型可以推动形成用途广泛、适应能力较强的 AI 解决方案。模态落地方法通过整合不同模态的信息可以提高数据处理的一致性和有效性。论文在附录 B.1 中进一步讨论了这个问题。这里的“落地”grounding是指把语言、图像等抽象信息与现实环境中的对象、状态或行动对应起来。直观的人机界面开发直观的人机界面可以促进人类与智能体之间有效且有意义的交互。驯服大语言模型和视觉语言模型研究新的方法可以帮助解决大型基础模型输出中的幻觉和偏见等常见问题使 LLM 和 VLM 的行为更加可靠、可控。弥合仿真与现实之间的差距“从仿真到现实”sim-to-real问题指的是将在仿真环境中训练的 AI 智能体部署到现实世界时所面临的困难。现实世界与仿真环境之间通常存在差异例如环境干扰和物理属性不完全一致。这些差异可能导致智能体的实际表现下降。解决这一问题的策略包括领域随机化Domain Randomization在仿真环境中主动引入变化使模型能够更好地应对现实世界中的不确定性Tobin et al., 2017Saito et al., 2022。领域适应Domain Adaptation同时使用仿真数据和现实世界数据进行训练以缩小仿真与现实之间的差距Zhu et al., 2017aRao et al., 2020Ho et al., 2021。改善仿真环境Improvement of Simulation更加准确地复现现实世界的条件提高仿真环境的保真度Zhu et al., 2017bAllevato et al., 2020Martinez-Gonzalez et al., 2020Müller et al., 2018Shah et al., 2018Sasabuchi et al., 2023。多智能体系统Agent AI 中的多智能体交互目前仍然是一个复杂过程需要综合多种不同的技能。当前多智能体系统内部的人机交互机制主要依靠预先设定的协作规则。这些系统能够针对人类或用户的行动表现出一定程度的智能行为并在一定程度上掌握网络知识Gong et al., 2023。多智能体之间的这种交互对于智能体的发展非常重要因为它可以帮助系统设计者在智能体系统中实现特定的协作行为。智能体基础设施与系统基于智能体的人工智能已经在娱乐、科研和工业领域形成了一个规模庞大且发展迅速的研究群体。大型基础模型的发展显著提高了 Agent AI 系统的性能。不过这类智能体的发展受到两方面因素的限制创建高质量数据集所需的工作量不断增加系统开发与训练的整体成本较高。在工业领域通过使用先进硬件、多样化数据来源和强大的软件库来构建高质量智能体基础设施已经显著推动了多模态智能体助手的发展Gong et al., 2023。Agent AI 日益普及也更加凸显出建设可靠基础设施的必要性。这些基础设施需要支持智能体的训练、评估和部署。为此作者提出设立一个专门的智能体研究方向重点关注与 Agent AI 的开发、评估和部署相关的基础设施及方法。作者预计该方向将吸引大量关于智能体系统效率和优化的研究。Agent AI 基础设施的目标是让更广泛的研究群体能够方便地使用相关研究成果并从中受益从而推动该领域进一步发展。论文分别在附录 C 和附录 D 中进一步讨论偏见与幻觉问题。7 Agent AI 面临的挑战本文特别强调识别当前 Agent AI 的局限并讨论在迈向更深入、更全面的 AGI 过程中所面临的挑战。这其中可能包括探索一种超越“预测下一个词”的新范式。实现 Agent AI 仍然面临多项困难特别是在物理世界中处理具有高度多模态观察信息的动态系统时。需要解决的挑战包括但不限于以下四个方面。1. 非结构化环境在非结构化环境中即使目标指令相同当前视觉输入也可能同时影响具身智能体的高层意图和低层行动。因此智能体不能只机械地执行预定计划还需要根据环境中的实时变化同时调整总体目标理解和具体操作。2. 智能体的共情与常识能力当环境中出现开放类别或此前未见过的对象时智能体的决策模块需要运用常识知识。这些知识往往难以通过人工方式完整编码。与此同时与人类自然交互还要求智能体理解人的情绪、意图和处境因此需要具备一定程度的共情能力。3. 多智能体交互与协作多智能体交互与协作要求智能体理解和执行的不只是模板化命令还包括使用日常语言表达的目标约束条件不完整的计划具体情境信息。为了更加全面地应对这些复杂挑战来自更广泛学科的研究人员和实践人员必须共同参与。4. 具身大型智能体基础模型的涌现能力作者希望借助不同研究者独特而多样的视角扩大我们对智能体范式潜力与局限的共同认识。作者相信这种新的智能体范式不仅可以丰富每位研究者和实践人员的认识也可以增加整个研究群体的集体知识形成一种更加整体、更加包容的视角以应对未来 Agent AI 所面临的广泛挑战。8 涌现能力尽管交互式 Agent AI 系统正在得到越来越广泛的采用大多数已提出的方法在未见过的环境或场景中仍然面临泛化能力不足的问题。目前的建模方式要求开发人员为每个应用领域准备大型数据集再对模型进行微调或预训练。这个过程成本很高如果面对的是全新领域收集足够的数据甚至可能是不现实的。为了解决这个问题作者提出构建一种交互式智能体使其能够在新场景中利用通用基础模型——例如 ChatGPT、DALL-E 和 GPT-4——内部积累的知识与记忆尤其用于在人类与智能体之间建立协作空间。作者提出了一种涌现机制并将其称为基于知识推理交互的混合现实Mixed Reality with Knowledge Inference Interaction该机制能够帮助智能体与人类协作在复杂的现实环境中解决具有挑战性的任务同时探索未见过的环境并将学到的能力适配到虚拟现实中。在该机制中智能体学习两类能力。1. 跨模态的微观反应智能体为每一项交互任务收集相关的具体知识。例如在理解未见过的场景时它可以从公开的网络来源中显式检索知识根据预训练模型的输出隐式推断知识。这使智能体能够针对每一次具体交互形成适当的局部反应。2. 不依赖现实形态的宏观行为智能体改善语言和多模态领域中的交互维度与交互模式并根据角色特征、特定目标变量以及混合现实和大语言模型中协作信息的变化来调整行为。作者研究了由知识引导的交互协同效应将多种 OpenAI 模型结合起来共同生成协作场景。研究结果初步表明在这一设定中交互式智能体系统可以进一步增强大型基础模型的能力。这种机制能够整合并提升复杂自适应 AI 系统的泛化深度、意识性和可解释性。9 影响声明Agent AI 范式的目标是创造能够在现实环境和虚拟环境中与人类共同工作的通用智能体。因此这一范式可能产生非常广泛的影响并可能影响社会中的所有成员。Agent AI 框架强调将智能体整合到更广泛的环境中应用场景包括游戏、机器人、医疗健康和长视频理解。游戏领域多模态游戏智能体的发展可能带来更具沉浸感和个性化的游戏体验从而推动游戏产业发生变化。机器人领域自适应机器人系统的发展可能改变从制造业到农业的多个行业缓解劳动力短缺问题并提高生产效率。医疗健康领域将大型基础模型用于诊断智能体或患者护理助手可能产生以下价值提高诊断准确性改善患者护理质量提高医疗服务的可及性改善医疗资源不足地区的服务条件。长视频理解模型理解长视频的能力可能产生广泛应用例如改善在线学习体验以及提高技术支持服务的质量。总体而言Agent AI 框架可能对全球众多行业及其从业者产生显著的下游影响。不同领域存在不同风险在多种环境和情境中部署 AI 智能体也会带来复杂而多样的挑战。例如当 Agent AI 被用于医疗诊断等专业领域时会面临许多限制和潜在危险。在这类应用中AI 行为产生危险幻觉可能造成严重风险因此系统必须经过极为谨慎的设计和测试。不过这些挑战在游戏领域可能没有同等的重要性也可能并不明显。在娱乐性应用中开发人员可能更加关注其他问题例如要求 AI进行更加开放的内容生成表现出创造力动态适应不可预测的游戏过程动态适应不同玩家的交互行为。因此对 Agent AI 的评价、安全要求和设计重点需要根据具体应用领域进行调整。10 结论本文提出的 Agent AI 聚焦于先进的多模态系统。这些系统能够在物理环境和虚拟环境中有效交互同时促进智能体与人类之间的有效互动。本文希望汇聚不同领域的研究人员深化围绕 Agent AI 的讨论。这项研究跨越多个人工智能方向包括智能体范式基础模型基础设施智能体系统。作者的目标是丰富科学界对 Agent AI 的理解并探索具身智能体在整体智能研究中的潜力。这项工作将使研究者能够更加有效地利用不断涌现的基础模型。