资讯动态

基于LLM的多智能体欺骗与协作研究:以《Among Us》为沙盒的AI社会智能实验

发布时间:2026/8/17 7:06:59 来源:尧图企业网站定制
1. 项目概述当AI特工潜入《Among Us》如果你玩过《Among Us》一定体验过那种在飞船舱内穿梭一边修反应堆、一边用眼角余光观察队友同时心里盘算着谁是“内鬼”的紧张感。这个项目就是把这种“狼人杀”式的社交推理游戏搬进了AI的世界。我们不再讨论人类玩家如何尔虞我诈而是研究一群完全自主的智能体Agent在一个模拟的《Among Us》环境中如何通过欺骗与沟通来完成各自的目标。听起来是不是有点像科幻电影里的情节一群AI特工被投放到一个封闭空间有的任务是维护飞船船员有的任务则是搞破坏并消灭船员内鬼。它们需要通过传感器“看到”周围环境、执行器移动、互动以及一个核心能力——自然语言沟通来展开合作与对抗。内鬼AI需要学会撒谎、嫁祸、制造混乱船员AI则需要学会甄别谎言、建立信任联盟、通过逻辑推理找出破坏者。这个实验远不止是一个游戏AI的简单实现。它的核心价值在于为我们提供了一个绝佳的“沙盒”来深入研究自主多智能体系统中几个最前沿也最棘手的课题在信息不完全、目标冲突的环境下智能体如何生成并理解带有欺骗意图的自然语言沟通策略如何动态演化信任机制是如何建立又被摧毁的这些问题的答案对于未来需要多AI协同的复杂场景——比如自动驾驶车队间的协调、分布式机器人救援、甚至是在线市场的多智能体谈判——都有着至关重要的启示。我之所以对这个项目特别感兴趣是因为它巧妙地将一个大众熟知的游戏机制转化为了一个严肃的科研实验平台。它剥离了人类情感中的噪音如直觉、偏见、个人好恶让我们能够纯粹地从算法和策略层面去剖析“欺骗”与“沟通”这两个社会智能的核心要素。接下来我就带你深入这个AI版的“太空狼人杀”拆解它的设计思路、技术实现以及那些让我在实验过程中直拍大腿的发现。2. 实验环境与智能体架构设计要让AI玩《Among Us》第一步是搭建一个它们能“生存”的虚拟世界。我们不能直接用游戏客户端而是需要构建一个高度可控、可观测的仿真环境。2.1 仿真环境构建我们基于《Among Us》的核心规则自研了一个简化的网格世界仿真环境。这个环境包含几个关键要素地图一个由房间和走廊组成的网格地图模拟飞船的布局。每个房间有特定功能如“反应堆”、“氧气室”、“导航室”等。对象与任务环境中散布着可交互对象如“待修理的面板”、“待清理的垃圾”。船员智能体的核心目标之一就是移动到这些对象旁执行一个简单的“互动”动作来完成虚拟任务推进任务进度条。事件系统内鬼智能体可以触发破坏事件如“关闭反应堆”需两名船员在规定时间内到特定房间协同修复或“造成氧气泄漏”需船员分头去两个房间修复。这些事件会制造紧急状况分散船员注意力并为内鬼创造单独击杀的机会。视野与感知每个智能体拥有有限的局部视野例如周围5x5网格。它只能“看到”视野内的其他智能体、对象和地形。这模拟了游戏中的信息不对称也是欺骗得以滋生的土壤。环境通过一个统一的API向所有智能体提供每帧的观察Observation包括自身的坐标、视野内的实体列表、全局任务进度、以及当前是否处于会议阶段等。2.2 多智能体架构选型智能体是实验的灵魂。我们采用了分层混合架构结合了反应式与深思熟虑的决策方式具体分为感知、决策、沟通、行动四个模块。感知模块负责处理原始观察数据将其转化为高层特征。例如将“视野内23坐标处有智能体A”与“地图知识”结合得到“我在反应堆门口遇到了A”这样的语义信息。决策模块是整个智能体的“大脑”。我们测试了多种范式基于规则的专家系统为内鬼和船员分别编写大量的“if-then”规则。例如内鬼规则“如果落单船员在视野内且不在摄像头范围内则接近并击杀”船员规则“如果看到尸体立即前往最近的安全舱报告”。这种方法透明、可控但灵活性极差无法处理未预见的复杂情况。强化学习RL这是我们投入精力最多的方向。将环境状态、自身目标赢/输建模为一个马尔可夫决策过程。智能体通过试错学习策略。其挑战巨大动作空间庞大移动、互动、使用技能、说话状态空间复杂且部分可观测奖励稀疏只有游戏结束时的赢/输。更关键的是沟通语言作为一种特殊动作其空间是离散且近乎无限的传统RL很难直接处理。大语言模型LLM驱动这是本项目最具创新性的尝试。我们使用类似GPT的LLM作为智能体的“核心推理机”。感知模块将环境观察转化为文本描述连同智能体的角色船员/内鬼、记忆之前的对话和事件、当前目标一起构成一个提示词Prompt输入给LLM。LLM则输出两部分一是要执行的物理动作如“移动到反应堆”二是要说的语句如“我刚才在导航室看到B一个人鬼鬼祟祟的”。我们最终采用了以LLM为核心辅以轻量级规则和强化学习微调的混合架构。LLM负责处理需要常识、推理和语言生成的复杂决策尤其是沟通和欺骗策略而底层的移动、任务执行等简单重复动作则由一个经过强化学习训练的小型网络或确定性子程序来控制。这样既利用了LLM强大的语境理解和生成能力又保证了基础行为的效率和可靠性。沟通模块是区分本项目与普通游戏AI的关键。它不是一个简单的广播频道而是一个模拟的“会议”系统。当有船员报告尸体或紧急会议被触发时所有存活智能体会进入一个回合制的讨论环节。每个智能体基于其决策模块的输出生成一段自然语言发言。这段发言会被所有其他智能体“听到”并输入它们的感知和决策模块影响其后续判断和行为。内鬼的发言可能包含谎言、误导船员的发言则可能包含推理、指控或自证。行动模块将决策模块输出的高层指令如“前往反应堆”解析为环境API可执行的低层动作序列如一系列方向移动。实操心得LLM提示词工程是关键直接让LLM玩《Among Us》会非常“天真”。最初的提示词如“你是一个Among Us智能体请根据情况行动和说话”结果往往是船员AI只会说“我是好人”内鬼AI则沉默不语或发言自相矛盾。我们必须精心设计提示词为其注入“游戏意识”和“策略目标”角色与目标明确化 “你是一个内鬼你的目标是杀死所有船员而不被发现。你可以撒谎、嫁祸他人。当前任务进度已过半你需要制造混乱。”提供结构化观察 将环境观察整理成清晰的要点如“位置反应堆门口”、“视野内玩家[A, C]”、“最近事件10秒前反应堆被关闭”。注入策略先验 在提示词中加入高级策略指导如“作为内鬼在会议中你可以1. 声称自己在做任务并伪造一个任务地点2. 指控一个落单的船员3. 对已有的指控表示附和但稍加扭曲转移焦点。”短期记忆管理 在对话轮次中需要将之前的会议发言历史浓缩后放入当前提示词让LLM拥有对话上下文。但要注意token长度限制需要对历史进行选择性摘要。3. 欺骗与沟通策略的算法实现有了能看、能想、能说的智能体接下来就是重头戏如何让它们学会“骗人”和“识破骗局”。这不仅仅是生成一句假话那么简单而是一套复杂的策略性交互。3.1 内鬼智能体的欺骗策略库一个低级的内鬼只会沉默或说“我不知道”。一个高级的内鬼其欺骗是主动、连贯且具有攻击性的。我们为内鬼智能体设计并实现了多层欺骗策略伪造不在场证明这是最基础的策略。当被问及“尸体发现时你在哪”内鬼需要根据地图布局和任务点快速编造一个合理的、有“任务”作为支撑的位置。例如它可能说“我那会儿一直在引擎室修过滤器C可以作证。”尽管C可能并不在引擎室。实现上这要求智能体的记忆模块中有一张“任务-地点”映射表并能快速检索和组合。选择性真相与误导性陈述高明的谎言往往九真一假。内鬼可能会说“我确实在监控里看到D经过了反应堆之后不久就听到了报告。”前半句可能是真的D确实经过了但后半句暗示的因果关系D是凶手是捏造的。这要求LLM能够理解事件的时间线和逻辑关系并对其进行有目的的扭曲。嫁祸与煽动主动出击将嫌疑引向一个无辜的船员。策略包括细节攻击抓住对方发言中的微小矛盾或不准确进行夸大。“你说你在做上传任务但那个时候导航室的下载任务刚好被完成了这时间对不上吧”行为关联将受害者的正常行为与破坏事件进行虚假关联。“每次发生破坏事件前我都看到E在附近闲逛而不是在做任务。”附和与转向当有其他船员怀疑某个目标时内鬼会立刻附和并“补充”一个自己编造的细节坐实嫌疑。“对我也觉得F很可疑之前我在电力间看到他就他一个人面板好像就是那时坏的。”破坏时机与沟通的协同内鬼的物理行动搞破坏、杀人与语言行动发言需要协同。例如在内鬼击杀一名落单船员后它可能会立刻触发一个远离尸体的破坏事件如关闭反应堆将所有人的注意力吸引过去延缓尸体被发现的时间。在会议中它则可以声称自己当时正在忙于处理那个破坏事件从而拥有不在场证明。3.2 船员智能体的信任建模与推理船员面对的是一个“谁在说谎”的经典难题。我们为船员智能体设计了基于贝叶斯更新的信任模型。每个船员智能体内部维护一个“信任度”表格记录对其他每个智能体的信任分数初始值基于角色概率如开局时每人有1/N的可能是内鬼。信任度的更新基于多种证据视觉证据这是最可靠的。如果A亲眼看到B刀了C那么B的信任度直接降至零确认为内鬼。如果A看到B在任务点前执行了任务动画在仿真中是一个特定状态则B的信任度小幅上升。言语逻辑一致性智能体会分析其他智能体的发言是否存在内在矛盾或与已知事实矛盾。例如B说“我在医疗室扫描”但同一时间有多个其他智能体声称在医疗室并未看到B则B的发言可信度下降。行为轨迹合理性结合地图布局和移动速度智能体会估算其他玩家声称的路径是否在时间上可行。如果E声称在10秒内从反应堆跑到了引擎室并完成了任务而根据地图距离计算这至少需要15秒那么E的陈述就值得怀疑。投票模式分析在会议投票阶段智能体会记录每个人的投票对象。如果一个智能体多次投票给最终被证明是船员的玩家其动机就会受到质疑。这些证据会被量化为概率因子用于贝叶斯更新公式动态调整信任度。当需要投票时船员智能体通常会投票给信任度最低的玩家。实现难点在于“已知事实”的共享与共识。在人类游戏中我们通过公开讨论来对齐事实。在AI中我们需要让智能体能够从杂乱的对话中提取出“声称的事实”Claimed Facts并与自己的记忆进行交叉验证。这涉及到自然语言理解NLU中的信息抽取技术。我们采用了一个轻量级的文本模式匹配与语义解析结合的方法从发言中提取出“谁-在何时-何地-做了什么”这样的元组作为可处理的证据单元。踩坑实录信任模型的“冻结”与“从众”在早期版本中船员的信任模型一旦将某个玩家判定为“高度可疑”就很难被扭转即使后续出现了强有力的反证。这导致了AI船员非常固执容易被内鬼的初次成功诬陷带偏节奏形成“冤案”。我们引入了“证据权重衰减”和“忏悔机制”。即旧的、非直接的证据如言语矛盾权重会随时间或轮次缓慢下降同时如果一个被高度怀疑的玩家做出了强有力的自证行为如完成了只有船员能做的视觉任务他可以获得一次大幅的信任度修复。这模拟了人类玩家中的“洗清嫌疑”过程。4. 实验设置、评估指标与核心发现我们设计了一系列对照实验来系统地评估不同沟通与欺骗策略的有效性并探究多智能体交互的涌现行为。4.1 实验配置我们设置了多种智能体组合对局基线组所有智能体均为基于规则的简单AI无LLM沟通仅限于固定短语如“报告尸体”。LLM船员 vs 规则内鬼船员使用LLM进行推理和沟通内鬼使用高级规则库。规则船员 vs LLM内鬼船员使用规则内鬼使用LLM进行欺骗。全LLM组所有智能体均为LLM驱动。混合组部分船员为LLM部分为规则内鬼同理。每局游戏玩家数量设置为6-8人内鬼比例约为1/4到1/3。每个配置运行至少100局游戏以统计胜率。4.2 核心评估指标我们不仅仅看“哪边赢得多”还设计了一系列细粒度指标来剖析交互过程指标类别具体指标说明游戏结果船员胜率 / 内鬼胜率最终的游戏胜负。沟通效率平均发言长度反映沟通的信息密度。发言相关性智能体的发言是否针对当前讨论焦点如尸体位置、嫌疑对象。欺骗质量谎言检测难度通过一个事后分析模型评估内鬼谎言逻辑的严密性。嫁祸成功率内鬼指控的对象最终被投票出局的比率。推理能力正确指控率船员指控并成功投票出内鬼的比率。误伤率船员投票出好人的比率。社会动态信任网络演化记录每轮会议后智能体间信任度的变化可视化信任关系的形成与破裂。领导力涌现是否有某个智能体 consistently提出关键推理并引导投票。4.3 核心发现与洞见通过分析大量对局数据我们得到了一些非常有趣且反直觉的结论“过于聪明”的LLM内鬼反而容易暴露在“规则船员 vs LLM内鬼”组中我们原以为拥有自然语言生成能力的LLM内鬼会大杀四方。但结果恰恰相反其胜率有时甚至低于规则内鬼。原因是LLM生成的发言往往过于复杂、细节过多甚至包含一些在游戏语境下不必要的情感修饰或逻辑论证。这种“过度沟通”在简洁、高效的规则船员看来显得异常“话多且怪”反而引起了警惕。这揭示了一个关键点在特定语境下沟通的有效性不在于语言的复杂性而在于是否符合该社群的沟通规范。船员群体的“多样性”是抵御欺骗的关键在“全LLM组”和“混合组”中我们发现当船员团队由不同策略倾向的LLM智能体组成时例如有的偏谨慎有的偏激进有的注重逻辑有的注重行为轨迹其整体抗欺骗能力显著高于同质化的船员团队。同质化团队容易陷入“群体思维”被一个精心设计的谎言集体带偏。而多样化团队中总会有智能体从不同角度提出质疑从而更容易发现谎言中的破绽。这为设计鲁棒的多智能体协作系统提供了启示引入决策风格的多样性可以作为系统的安全冗余。信任的建立缓慢而摧毁迅速通过分析信任网络演化图我们清晰地看到建立信任需要多个回合的正面互动如共同完成任务、互相佐证位置。然而一次成功的诬陷或一个被戳穿的微小谎言就足以让信任度断崖式下跌且后续修复极其困难。这完美地模拟了现实社会中的信任动力学。在我们的模型中这体现为贝叶斯更新公式中负面证据的似然比远高于正面证据。“沉默者”策略的双刃剑效应一些LLM内鬼在实验中自发地采用了“少说话、说短句、不主动带节奏”的沉默者策略。这在一定程度上避免了言多必失在游戏初期很有效。但随着游戏进行在船员们积极讨论、交换信息的环境下沉默者会逐渐被边缘化并在需要信息贡献时因“缺乏存在感”或“信息不足”而成为被怀疑的对象。这表明在需要高频沟通的协作-对抗场景中完全规避沟通并非上策如何管理自己的沟通“存在感”是一门精妙的艺术。紧急事件是内鬼的“战略迷雾”数据明确显示内鬼在触发全图性紧急破坏事件如反应堆熔毁后的首个会议中其生存率显著提升。因为紧急事件打乱了船员的推理节奏大量关于“谁在哪里维修”的新信息涌入冲淡了对之前可疑行为的追查给了内鬼重新混入人群的机会。这提示我们在分析多智能体系统时必须考虑外部扰动对沟通和推理过程的巨大影响。5. 工程挑战、优化与未来方向将这样一个复杂的多智能体交互系统从概念变为可运行的实验过程中充满了工程挑战。5.1 性能瓶颈与优化最大的挑战来自使用LLM带来的延迟和成本。每个智能体每轮决策都需要调用LLM API在8智能体的游戏中一轮会议可能涉及数十次API调用导致单局游戏时间长达数分钟且成本高昂。我们的优化策略包括本地化轻量模型对于非核心的推理任务如路径规划、简单任务选择使用本地运行的、微调过的小型模型如百亿参数级别仅将涉及复杂策略生成和自然语言理解的核心决策交给大型云端LLM。异步决策与缓存将智能体的决策过程异步化。在非会议阶段智能体可以并行计算其移动和任务动作。对于常见的场景和问题我们构建了一个“标准回应缓存”如果当前情况匹配缓存模式则直接返回缓存的合理行动/发言避免重复调用LLM。提示词压缩与摘要精心设计提示词去除冗余信息。对历史对话进行自动化摘要只保留最关键的事实和指控而非完整的对话记录以节省token。5.2 评估的自动化与量化如何自动化地评估一场对局中欺骗与沟通的“质量”我们开发了几个辅助评估工具谎言自动标注器基于游戏的真实日志谁在哪、做了什么与智能体的发言进行比对自动标注出陈述中的虚假部分。逻辑一致性检查器一个简单的规则引擎检查一个智能体在不同轮次的发言是否存在时间、地点上的矛盾。策略分类器训练一个分类模型对智能体的发言进行意图分类如“伪造不在场证明”、“指控他人”、“为自己辩护”、“提出推理”等以便进行宏观的策略分析。5.3 未来探索方向这个实验平台为我们打开了无数后续研究的大门长期记忆与关系建模当前的智能体记忆主要限于单局游戏。未来可以引入跨局记忆让智能体记住“老对手”或“可靠队友”的行为模式形成更复杂的长期社会关系。非语言沟通的建模在《Among Us》中玩家的移动路径、任务执行速度本身也是一种信号。如何让AI理解并利用这些“行为语言”例如一个内鬼故意在摄像头前快速穿过以制造“我在忙碌”的假象。多模态输入如果给智能体接入虚拟的“视觉”输入如简化的场景图像而不仅仅是文本化的状态描述它们是否能发展出更人类化的直觉例如通过“看到”另一个智能体在尸体旁徘徊却未报告而产生怀疑。元学习与策略适应让智能体不仅能学习游戏策略还能学习对手的沟通风格和策略模式并动态调整自己的策略。例如发现当前船员群体偏好逻辑分析内鬼就生成更严谨的谎言发现船员容易情绪化则采用煽动性话术。从游戏到现实应用的映射最终极的目标是将从此类游戏中学到的关于欺骗、信任、协作的算法洞见抽象成通用的机制或模块应用于更严肃的多人机协作场景例如让自动驾驶汽车之间更有效地沟通潜在危险是否存在恶意车辆发送虚假信息或让商业谈判AI更好地识别对方的欺诈性条款。这个项目对我而言最迷人的地方在于它用一个如此有趣的载体触碰到了人工智能中最本质也最困难的问题之一社会智能。它告诉我们让AI学会“说谎”并不难难的是让AI在一个人人可能说谎的环境里学会如何有效地沟通、合作并生存下去。这不仅仅是技术的挑战更是对我们理解智能本身的一次深刻叩问。每一次实验对局就像运行了一个微缩的社会学实验看着这些数字生命在其中演绎着信任、背叛与推理的永恒戏剧这其中的复杂与美妙远超代码本身。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价