资讯动态

Assessing the Reliability and Validity of Large Language Models for Automated Assessment of Stude...

发布时间:2026/10/1 2:33:35 来源:尧图企业网站定制
文章主要内容和创新点主要内容本文研究了5个先进大型语言模型(LLMs)——Claude 3.5、DeepSeek v2、Gemini 2.5、GPT-4和Mistral 24B在高等教育真实场景中自动评估学生论文的可靠性和有效性。研究以67篇意大利语的大学心理学课程学生论文为样本,采用包含“相关性(Pertinence)、连贯性(Coherence)、原创性(Originality)、可行性(Feasibility)”四个维度的评分标准,每个模型对每篇论文进行三次重复评分以评估模型内稳定性。结果显示:人机评分一致性极低且不显著(通过加权二次Kappa系数衡量);模型内三次重复评分的可靠性较弱(Kendall’s W中位数0.30);存在系统性评分偏差,例如模型普遍高估“连贯性”分数,且对依赖语境的维度(如相关性、可行性)处理不一致;模型间一致性分析显示,在“连贯性”和“原创性”上有中等一致性,但在“相关性”和“可行性”上几乎无一致性。研究认为,当前LLMs难以复制人类在需要学科洞察力和语境敏感性的任务中的判断,评估开放式学术作品时,人类监督仍至关重要。创新点真实教育场景验证:聚焦高等教育真实课堂的学生论文(心理学领域、意大利语),而非标准化数据集或人工设计任务,更贴近实际教学评估需求。多维度与多模型对比:采用四维度评分标准(涵盖内容、结构、

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑