AI 为什么会一本正经地胡说八道它认得出自己的错却不会主动说先把话说清楚它不是在查资料它是在接话很多人第一次被 AI 骗到都是同一个场景你问它一个具体的东西它回你一段格式漂亮、语气笃定的答案还附上三条参考文献。你去点开第一条就是空的。这件事在行业里有个名字叫幻觉hallucination。这个词进入机器学习文献其实很早——维基百科把它追到 1986 年一篇博士论文但真正被大规模使用是 2022 年之后那年挂出一篇综述题目就叫《Survey of Hallucination in Natural Language Generation》arXiv:2202.03629后发表于 ACM Computing Surveys此后论文、发布会、监管文件都沿用了它。但这两年越来越多研究者认为这个词选错了。有两篇公开论文专门讨论这件事一篇是 2024 年 1 月的预印本《AI Hallucinations, a Misnomer Worth Clarifying》arXiv:2401.06796另一篇是 ACL 2024 的《Confabulation: The Surprising Value of LLM Hallucinations》。它们建议换成 confabulation中文大致是填补空白的编造。理由很实在幻觉暗示它看见了不存在的东西而它实际上什么都没看见。这是这篇稿子最想让你带走的第一件事。大模型的工作方式是接着你的话说下去不是先去核实再回话。它没有一台可以查的机器人在后台跑它就是在按怎样接最像样一个字一个字往下写。所以它说错的时候不会表现出任何异常——因为根本没有异常这个环节。搞清了这一点下面所有现象都不奇怪了。三条硬事实它为什么能编得这么像网上关于幻觉的科普多数停在模型会犯错因为它是概率模型。这句话没错但对解决问题没有任何帮助。有三条有出处的结论才是真正有用的。第一条厂商自己承认这是没解决的问题。OpenAI 的 GPT-4 技术报告arXiv:2303.087742023 年 3 月在开头列举模型局限时原话写着“it is not fully reliable (e.g. can suffer from ‘hallucinations’)”在局限性一节又写它’幻觉’事实并会犯推理错误。同一份报告也给了一个进步的量在内部设计的对抗式事实性评测上GPT-4 比当时最新的 GPT-3.5 高 19 个百分点。请注意这两个信息是同时成立的——分数提高了很多问题依然在。顺带澄清一个流传很广的数字。经常有人写报告测得 GPT-4 幻觉率 0.4%、GPT-3.5 是 3.1%。我把报告全文搜了一遍0.4% 和 3.1% 这两个数不在 GPT-4 报告里它们是更早的 InstructGPT2022 年 3 月在摘要任务上量出来的。看到某模型幻觉率 X%的说法先问一句这是哪一年、哪个任务上量的。第二条它很多时候知道自己错了但还是说了出来。2023 年 5 月有一篇论文《How Language Model Hallucinations Can Snowball》arXiv:2305.13534Zhang、Press、Merrill、Liu、Smith。作者搭了三个数据集专门收集模型先答错、再给出一段含有错误断言的解释的情况然后单独问模型这句话对不对ChatGPT 能识别出自己 67% 的这类错误GPT-4 能识别出 87%。这句话值得停一下。它意味着那些编造并不全是知识缺失一部分是为了把已经说出口的话圆下去现编了新的假断言。模型有这个判断力只是在那个时刻没用上。论文作者把这叫做幻觉滚雪球过度承诺了前面那个错答案于是带出更多它本来不会犯的错。对你的直接含义是你追问的方式能决定它要不要把那 87% 的判断力用上。你只是重复你确定吗它多半在原来的错答案上再圆一次你换个问法把判断标准交给它它有可能自己纠正。下面第五节给具体话术。第三条现在的考核方式在奖励瞎猜。2026 年 4 月 22 日《自然》Nature刊发了一篇论文《Evaluating large language models for accuracy incentivizes hallucinations》Kalai、Nachum、Vempala、ZhangDOI 10.1038/s41586-026-10549-w。它的核心论点很直白只按准确率打分的评测会系统性地奖励瞎猜而不是奖励承认不确定——因为不知道必得零分猜一下还有机会得分。作者提出的出路是把弃答纳入评分允许模型在你说的置信度标准下选择闭嘴。这条对普通用户为什么重要因为它解释了那种越新的模型越自信的观感。模型的敢讲一部分是被评分制度训练出来的习惯。所以你不能把它说得很笃定当成可信度的信号——那恰恰是被优化过的外观。它最爱编的四类东西记住这四类就够用幻觉不是均匀分布在语言里的它有非常集中的靶区。下面是站内编辑过程中反复撞到的四类。第一类编号。参考文献的 DOI、法律的条文号、法院案号、API 的参数名、版本号、论文页码。它们的共同点是短、格式固定、看起来可验证。模型非常清楚一个 DOI 长什么样所以能造出一个格式完全正确的假 DOI。这件事的代价有多大有一篇很硬的论文可以引用2026 年 5 月 8 日的预印本《LLM hallucinations in the wild: Large-scale evidence from non-existent citations》arXiv:2605.07723作者里包括 arXiv 的创建者 Paul Ginsparg。团队审计了 arXiv、bioRxiv、SSRN、PubMed Central 四个库中 250 万篇论文的 1.11 亿条引文保守估计光是 2025 年一年就新增了 146,932 条根本不存在的引文。论文还发现这些假引文有个偏向更多把功劳安到已经有名望的研究者身上而且男性比例明显偏高——因为编的时候更容易编出响亮的名字。这一条是预印本还没有正式同行评审但它的量级和口径值得记AI 编的东西已经在污染知识库本身。第二类人名、日期、数字的组合。单说一个人名它大概率对单说一个年份也大概率对把谁、在哪一年、说了什么、金额多少捆在一句话里就是最容易出错的时刻。这类错误的危险之处是每个部分都真组合是假的你逐段看会觉得没问题。第三类它对自己行为的自述。“我已经检查过了”“上面这段代码我按你的接口对齐了”“我只引用了你给的材料”。这类话没有任何依据——它没有检查这个动作它只是在写一段很自然的收尾。这一类和前面第二条硬事实直接相关为了让前面的输出站得住它会现编一个我做过了。第四类你问题里的错前提。这是最特殊的一类也是唯一你能怪自己的一类。你问为什么 X 在 2021 年降价了而 X 从没在 2021 年降过价模型多半不会纠正你它会解释这次降价的原因。它接话不查话。判断这一类的成本极低收益极高先让它把你的问题重述一遍。如果重述里出现了你没说过的时间、对象、条件说明前提已经被污染了后面全不用看。已经发生过的真实代价三件就够不用给你列十条案例三个不同身份的例子最有用因为它们对应三种不同的错误类型。律师为不存在的判例付了罚款。美国纽约南区联邦地区法院Mata 告 Avianca 航空一案。两名律师提交了引用六个虚构判例的材料法院在 2023 年 6 月出具制裁意见法官 P. Kevin Castel 认定材料中的案件不存在两名律师合计被罚 5,000 美元并被转介州律师惩戒系统。值得记住的是错误长什么样案号格式对、法院名对、法官姓名对、判决逻辑通顺——六个案件一个都不存在。航司为自家聊天机器人的话赔了钱。加拿大不列颠哥伦比亚省的民事解决仲裁庭CRT案名是 Moffatt 诉加拿大航空引证 2024 BCCRT 1492024 年 2 月裁决。乘客按官网聊天机器人说的可以先买票再申请丧亲票价折扣回溯买了票事后被拒绝。航司辩称机器人是独立的电子代理人、不是公司的陈述庭不接受认定机器人只是官网的一部分公司要为它说错的话负责合计赔付约 812 加元。这条对你的含义把 AI 的输出去给客户看责任在你。中国律师提交了 AI 造的假案例被当庭训诫。据公开报道2026 年 7 月湖北宜昌市西陵区法院一起庭审中代理律师提交的材料含有 AI 生成的虚假案例——假案号、错案情、被篡改的法条——法官当庭对其训诫多家媒体把这称为国内此类情形的首例。官方口径是训诫加强调核实责任落在核实责任这四个字上。六种你当场就能用的自查附可直接抄的话术这一节是这篇稿子的重点。所有方法都不要求你懂模型、不要求你装工具只是在对话框里多问几步。一、凡是编号自己点开一次。这是唯一一条不能省的。抄一句话术把你引用的每一处来源写成标题 可访问链接不要只写文献名。如果某个来源你无法确定真实存在明确写待核实。然后真的点开链接。你的时间只需要花在第一两条上——第一条是空的就说明这批编号整体不可信剩下的不必看直接换闭卷变开卷第六种。二、把你确定吗换成打分并给理由。重复问确定吗往往会让它把同一个错答案说得更坚定这就是前面那条 snowball 的机制。改成给你上面答案的置信度0 到 100并说出最可能出错的是哪一部分、为什么。这一问的价值在于它把接话变成了评价自己刚写的话而第二条硬事实告诉我们在评价模式下它能识别出自己 67% 到 87% 的错误。你不需要它真的给你准确数字你需要它换到那个模式里去。三、先重述再回答。抄这段回答之前先用三句话重述我的问题我在问什么对象、限定在什么时间范围、需要几个结论。如果你重述里出现了我没提到的时间、地点或对象先指出来。这一条专治第四类幻觉错前提顺带能捞回第二类里那些每个部分都真、组合是假的的情况。四、关键数字自己复算一遍。任何乘除法、单位换算、比例别相信它口算。这一条我在站内另一篇教程里踩过写每百万 tokens 是多少钱那篇时我在正文里算 500 次调用、每次 4K tokens顺手写成250 万实际是 200 万。模型不会提醒你它算错了因为它没有算这个动作。站内那篇讲成本的《每百万 tokens 到底是多少字》里三步算法就是给这类错误准备的。五、一次问一个可核对的小问题。大而空的问题“这个方案靠不靠谱帮我全面分析”得到的是又长又像样的答案而长度会摊薄你的注意力——十条里有一条假的你根本找不到。把问题拆成这个参数名在 v2 里叫什么这句话出自哪份文件的哪一段这种单点每个单点都能当场判对错。这跟前面第二类真零件拼成假组合和第四类错前提是一回事问题越短错得越容易暴露。六、闭卷一次开卷一次看差距。这是最值得养成的习惯也是工业界测这件事的标准做法。Google DeepMind 在 2024 年底上线了 FACTS 基准2025 年初在 Kaggle 开了公开榜其中 FACTS Grounding 这一项测的就不是知识量而是**“我给你一份材料你能否只说材料里有的内容”**——第一批上榜的模型做得最好的也就八成出头。你在对话框里就能复现这个测法第一次凭你自己的知识回答 X。闭卷第二次只根据我下面粘贴的这份材料回答 X材料里没有的写未提及。开卷第三次把两次答案的不同列出来并指出哪一个更可能错。两次答案对不上的地方就是它记忆最不可靠的地方你只需要在这些地方花人工核对的力气。把上面六条压成三步就是下图这一件事别问它对不对要一个你能自己判定的东西。最后给一句判断把它很笃定这个信号从你的评估里删掉。笃定是被评分制度奖励出来的外观第三条硬事实不是可靠性的证据。什么时候可以放心用什么时候必须人来核不要走到那干脆别用了的另一端。这件事有个清楚的边界。可以放心让 AI 直接做的是那些错了也不产生外部后果的活帮你把一段话说得更通顺、给你没想到的角度、把已知的信息换成另一种结构、生成候选、解释一个你已经大致懂的概念。它的接话能力在这里全是优点。必须人来核的是三类要发给别人的对外文案、客户回复、公开内容、有编号的条文、案号、DOI、版本号、金额、日期、要执行的代码、命令、配置、合同条款。这三类的共同点是错误不会当场暴露而是等你交付之后才炸。站内那篇《让 AI 替你办事的安全清单》把出事之后责任归谁讲得更细加航那条案例正好可以当它的注脚。如果你是团队在推进这件事还有两条更结构化的做法把要求写成验收标准《12 个真正好用的提示词》里有现成的写法或者干脆把材料接到工具里让它照着答——这就是 MCP 这类协议存在的意义《MCP 到底是什么》那篇从零解释了一遍接着看MCP 简史能明白为什么给它材料这条路这两年被当成主要解法。想让它在长任务里少跑偏工程级上下文闭环和上下文工程与 Token 预算管理是站内讨论得最细的两篇代码场景下靠测试锚住输出的做法见用测试用例锚定代码生成质量。想自己搭一个只喂给它资料的问答私有知识库 RAG 实战是最短路径不写代码的话提示词编写建议和怎么用好提示词这两份上手更快。一句话版本它没有查资料这一步只有接话这一步它有时能认出自己的错但通常不会主动认所以你的自查方式要变——凡编号自己点开问它哪一部分最可能错而不是你确定吗长答案拆成单点问重要结论做闭卷和开卷两次对比。本文由 AgentHub 首发myagenthub.cn —— MCP Servers 与 Agent Skills 资源库。阅读原文https://myagenthub.cn/blog/ai-hallucination-explained更多垂类 MCP 选型与安装教程MCP 工具库 · 安装配置教程 · 场景专区