恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
Can LLMs Reliably Simulate Real Students‘ Abilities in Mathematics and Reading Comprehension?
首页
资讯中心
/
Can LLMs Reliably Simulate Real Students‘ Abilities in Mathematics and Reading Comprehension?
Can LLMs Reliably Simulate Real Students‘ Abilities in Mathematics and Reading Comprehension?
发布时间:2026/10/12 4:23:58
文章主要内容总结本文聚焦大型语言模型(LLMs)能否可靠模拟真实学生在数学和阅读理解中的能力,通过以下步骤展开研究:数据来源:使用美国国家教育进展评估(NAEP)的489道选择题,覆盖4、8、12年级的数学和阅读理解科目,包含真实学生的答题数据(正确率、选项分布等)。研究方法:采用项目反应理论(IRT),将11个不同类型的LLM(涵盖开源/闭源、不同参数规模、预训练/领域微调模型)与真实学生的能力置于同一量表进行评估。核心发现:无特定提示时,强通用模型(如LLaMA3.1-70B、o3-Mini)的表现持续优于各年级平均学生,而弱模型或领域不匹配模型可能偶然与学生表现对齐。年级强化提示(如“作为8年级普通学生答题”)能改变模型表现,但效果高度依赖模型和提示设计,没有任何模型-提示组合能在所有科目和年级中稳定匹配平均学生水平。结论:现有LLM作为“代理学生”存在局限性,需新的训练和评估策略,并提出了选择可行代理学生的指导方针。创新点数据集构建:首次编译并公开了基于NAEP的真实学生响应数据集,覆盖2个科目(数学、阅读)和3个年级(4、8、12),支持长期评估自动化学生代理。方法创新:将项目反应理论(IRT)改编用于量化L