资讯动态

GPT-5也会话到嘴边想不起来,谷歌测了450万次:钥匙丢了

发布时间:2026/8/18 11:39:48 来源:尧图企业网站定制
它得先知道自己想不起来那个名字明明就在嘴边。你看到一张熟脸却死活想不起他的名字心理学给这种现象起过一个名字「舌尖现象」tip-of-the-tongue。现在谷歌在一项研究里发现GPT-5和Gemini 3也有同一种毛病。这两个模型把95%–98%的测试事实都装进了参数里。可你直接去问它们却有26%–34%的事实答不出来。开启thinking多想一会儿还剩11%–12%怎么也想不起来。大模型答不出来很多情况下真不是它大脑里没有是学过了取不出来。这项研究叫《空货架还是丢钥匙》Empty Shelves or Lost Keys?收录于ICML 2026。8月12日Google Research发博客把结果集中讲了一遍同时公开的还有一套名叫WikiProfile的基准和完整数据集。货架没空钥匙丢了模型答错题可能是两种毛病。一种是压根没学过那得往预训练里加数据、加参数另一种是学过了换个问法就调不出来那是后训练和推理环节的事。这两种问题都曾被归结为一个准确率的问题。谷歌提出的「知识画像」框架不再问「这道题答对没有」而是判断「这条事实在这个模型记忆中处于什么状态」一共划分出五种。「知识画像」把一条事实分成五种状态存入失败、回忆失败、直接回忆、借助thinking回忆、未存入却靠推理答对。同样一个错误答案在不同的状态修改方法也完全不同。怎么判断一条事实存没存进去办法是把维基原文截到答案出现之前让模型顺着写下去或者在同样的上下文后面直接发问。这两道题都不许开thinking为的是把「记住了」和「推出来的」分开。左侧测存没存进去把维基原文截断让模型补完右侧测答不答得出换措辞、换正反方向反复提问。基准叫WikiProfile一共2150条事实全部取自英文维基百科。每条事实配10道题2道测存没存进去4道让它自己答4道给选项挑。加起来21500道题。出题全交给了模型Gemini-2.5-Pro生成Google搜索逐题验证答案不唯一或题目有歧义的连带整条事实一起丢弃。最后人工再验一遍又砍掉不到2%。跑分的是13个模型覆盖Gemini 3、GPT-5、GPT-4.1和Gemma 3四个家族每个模型开关thinking各跑一遍每道题采样八次攒出约450万条回答。把一个前沿模型完整测一遍大概要花500美元。结果就是开头那组数字。在前沿模型的事实错误里「取不出来」已经压过了「没学过」成了大头。取不出来的都卡在同两个地方第一个是冷门知识。过去的主流解释是模型容量不够一些冷门事实压根没学进去。这次的数据冷门知识其实都存进去了。Gemini-3-Pro存下了94.5%的冷门事实热门事实是99.5%只差5个点。可一开口回答冷门事实就掉到63.3%热门事实还有84.7%差了21个点。存的时候几乎没差别取的时候差出四倍。冷门事实后20%与热门事实前20%对比存入率差距很小直接回忆率差距明显拉开。GPT-5的落差更大。冷门事实它存住了90.7%热门事实98.4%。可一开口冷门事实只剩下52.9%热门事实还有77.8%。将近一半的冷门事实明明躺在模型里就是调不出来。存入的时候差别不大取的时候差别很大。长尾问题的真相不是模型没见过那些冷门事实是那些知识更难被叫醒。第二个场景是反向提问你问AI汤姆·克鲁斯的妈妈是谁它答得又快又准。你反过来问这位女士的儿子是谁它就卡壳了。2023年那篇论文给它起名叫「反转诅咒」模型学会了「A是B」不会自动泛化出「B是A」。当年的解释是双向关联压根没被学进去。谷歌把同一批题改成了四选一结果马上反转。GPT-5正向问答的回忆率是82.9%反向掉到74%。可一换成给选项的识别题反向不但不比正向难13个模型里有9个反而答得更好剩下4个持平。选择题会做一换成问答题就答不出来了。同一批正反向问题四选一识别里反向不比正向难闭卷生成里反向明显更难。这说明那层关联显然是在的真正卡住的是怎么把它挖出来。作者的解释是事实被存进去的时候当时的语境、措辞和顺序也一并留在了里面。你问的方式一旦偏离训练时的样子钥匙就对不上锁。thinking的另一个身份帮它回忆WikiProfile里的题都是问一句答一句中间没有推理步骤。「Oasis第一场演出在哪个俱乐部」这种题要么记得要么不记得。按理说让模型多想一会儿也帮不上什么忙。但thinking真捞回来了。那些存进去却答不出的事实它找回了40%–65%。关键线索藏在它的偏好上那些压根没存进去的事实thinking只能捞回5%–15%。开启thinking后被找回的事实比例已存进参数的能捞回40%–65%没存进去的只有5%–15%。它不是在凭别的知识推演是在原地找钥匙。作者还顺手排除了一个更省事的解释。有人会想thinking无非是让模型答得更花八次里蒙中一次的机会变大了。真是这样的话答案应该更飘才对。实际反过来了开了thinking同一道题八次里答对的次数反而更集中。收益最大的两处恰好是前面最堵的那两处。Gemini-3-Pro的冷热门差距从21.4个点收窄到12.5个点GPT-5的正反向差距从9个点收窄到2个点。哪儿最堵它就往哪儿使劲。谷歌另一篇姊妹论文《思考以回忆》Thinking to Recall给出了机制解释一是计算缓冲那些吐出来的思考token哪怕内容本身没什么意义也在给模型争取额外的隐式算力二是事实启动模型先说出一批相关事实等于给正确答案搭了一座语义桥。这在人类认知里叫「扩散激活」spreading activation。想不起某个人的名字就先回忆他在哪家公司、留什么发型、上次见面是什么场合名字常常自己就冒出来了。摆脱「舌尖现象」的办法人和模型居然是同一套。但这种方式也有代价。同一篇论文警告如果思维链里那些中间事实是编的最终答案的幻觉概率反而更高。桥搭歪了走得越远错得越离谱。扩规模等于补货不负责配钥匙拿开源的Gemma 3家族当尺子。参数从1B涨到27B编码失败率从85%一路降到23%。规模确实在补货货架肉眼可见地被填满了。可回忆失败没有同步下降。它在剩余错误里的占比一路上升到27B时成了错误的主要构成。放到前沿模型上更极端回忆失败占了GPT-5.2全部错误的七成以上而且模型越强这个比例越高。13个模型的五种状态分布参数越大编码失败一路收缩回忆失败几乎不动。规模改善的是存了多少不是取得出多少。这并没有给scaling判死刑而是给它划了一条边界。既然存进去的比例已经摸到95%–98%的天花板那么继续加参数、加数据能换来的准确率提升正在肉眼可见地变小。下一段增益更可能来自后训练和推理时的方法也就是怎么用好已经存进去的知识。检索增强当然能补位。但作者也提醒道参数里的知识仍然关系到流畅度、响应速度和跨语境整合很难被外部检索完全替代。它得先知道自己想不起来那么什么时候该让模型多想一会儿论文把这个问题定义成了元认知也就是模型对自己状态的判断它得先意识到「我直接答不上来」才知道这道题值得开thinking多想一会儿。过去两年让模型更靠谱的默认答案是喂更多数据、堆更大参数。这项研究把话说清楚了事实层面前沿模型的货已经上架得差不多了。接下来考验的是它能不能自己把货取出来。更麻烦的是下一步它得先知道自己想不起来。原文链接GPT-5也会话到嘴边想不起来谷歌测了450万次钥匙丢了-36氪

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价