资讯动态

Modeling Understanding of Story-Based Analogies Using Large Language Models

发布时间:2026/10/1 9:01:14 来源:尧图企业网站定制
文章主要内容总结本文聚焦大型语言模型(LLMs)在基于故事的类比推理任务中的表现,通过与人类认知对比,深入探究LLMs的类比推理能力。研究围绕四个核心问题展开:语义表示:使用BERT的句子嵌入评估LLMs是否能捕捉源故事与真类比目标故事的相似性,以及与假类比干扰故事的差异性;提示策略:测试“两步增强提示法”(让模型自生成提示后再推理)能否提升LLMs与人类表现的一致性;细粒度对齐:从单个类比问题层面而非仅整体准确率,评估LLMs与人类对“难易问题”的判断是否一致;模型因素:考察模型大小(如8B vs 70B参数)和架构(如GPT-4、LLaMA3)对推理表现的影响。实验结果显示:BERT嵌入在78%的案例中能区分真/假类比,但与人类对单个问题的难易判断无相关性;增强提示法提升了LLMs的整体准确率(大模型甚至超过人类),但小模型(如GPT-4o-mini)在单个问题上与人类的相关性更强;模型大小与准确率正相关,而架构差异会导致推理表现差异。文章创新点细粒度评估:突破以往仅关注整体准确率的局限,首次从单个类比问题层面分析LLMs与人类的表现对齐,揭示“大模型准确率高但与人类对难易的判断一致性低”的矛盾;提示策略创新:设计“自生成提示+推理”的两步法,证明其能提升LLMs的整体类比推理准确

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑