恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

Can LLMs Reliably Simulate Real Students‘ Abilities in Mathematics and Reading Comprehension?

  • 首页
  • 资讯中心
  • /
  • Can LLMs Reliably Simulate Real Students‘ Abilities in Mathematics and Reading Comprehension?

相关资讯

单片机物联网毕设选题指南:五大方向难度对比与避坑攻略 2026/10/12 4:18:58
SketchUp Pro 2021 Mac版实战指南:安装、建模、导出与高频问题排查 2026/10/12 4:18:58
达梦DCA认证备考指南:从安装到备份恢复的实操解析 2026/10/12 4:18:58

最新资讯

Agent开发前置基础知识点全总结:零基础入门必读
基于V2G的电动汽车实时调度策略Matlab仿真实现
P1220 关路灯【洛谷算法习题】
Hive 源码导读(三):都是 SELECT,为什么有的查询不需要 YARN?
大厂年薪600万抢AI博士?别焦虑!3个方法让你在AI时代不落伍
WinForms左导航右内容最佳实践

今日推荐

Debian新手入门:从部署到日常操作的完整指南
MongoDB复制集扩缩容实战:从rs.add到选主事故复盘
条形码目标检测数据集实战:从YOLOv8训练到部署

本周热门

UE动画修改实战:从资产编辑到重定向与蒙太奇驱动
统计随机数生成器攻击下的KLJN安全密钥交换协议Matlab仿真
政务API安全治理:资产测绘、低代码编排与行标对标实践

本月精选

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)

Can LLMs Reliably Simulate Real Students‘ Abilities in Mathematics and Reading Comprehension?

发布时间:2026/10/12 4:23:58
Can LLMs Reliably Simulate Real Students‘ Abilities in Mathematics and Reading Comprehension? 文章主要内容总结本文聚焦大型语言模型(LLMs)能否可靠模拟真实学生在数学和阅读理解中的能力,通过以下步骤展开研究:数据来源:使用美国国家教育进展评估(NAEP)的489道选择题,覆盖4、8、12年级的数学和阅读理解科目,包含真实学生的答题数据(正确率、选项分布等)。研究方法:采用项目反应理论(IRT),将11个不同类型的LLM(涵盖开源/闭源、不同参数规模、预训练/领域微调模型)与真实学生的能力置于同一量表进行评估。核心发现:无特定提示时,强通用模型(如LLaMA3.1-70B、o3-Mini)的表现持续优于各年级平均学生,而弱模型或领域不匹配模型可能偶然与学生表现对齐。年级强化提示(如“作为8年级普通学生答题”)能改变模型表现,但效果高度依赖模型和提示设计,没有任何模型-提示组合能在所有科目和年级中稳定匹配平均学生水平。结论:现有LLM作为“代理学生”存在局限性,需新的训练和评估策略,并提出了选择可行代理学生的指导方针。创新点数据集构建:首次编译并公开了基于NAEP的真实学生响应数据集,覆盖2个科目(数学、阅读)和3个年级(4、8、12),支持长期评估自动化学生代理。方法创新:将项目反应理论(IRT)改编用于量化L

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号