近日,清华大学教育学院张羽课题组发布研究,报告了基于LLM的“学生发展智能体(Student Development Agent, SDA)”仿真框架的设计与实证效果,为高效、合乎伦理地评估AIED创新提供了“零风险”的数字孪生新范式。
在生成式人工智能驱动的教育创新(AIED)快速发展的今天,各种新颖的教学设计层出不穷。然而,教育干预对学生往往具有不可逆性与高利害性。因此,在将这些教育创新真正应用于真实课堂之前,评估其对学生发展的影响,预判其潜在的教育收益与可能造成的危害,已成为一项至关重要且极具挑战性的任务。科学、前瞻的教育评估对于规避教学风险、优化AIED设计至关重要。
传统的教育干预效果评估主要依赖实证研究,此类方法通常受限于高昂的成本、极长的研究周期以及潜在的伦理风险,难以进行大规模的前置验证。作为替代方案,学生仿真提供了低风险、高效率的预测方法,并且借助于生成式人工智能的前沿技术,性能和效果普遍得到提升。然而,现有的基于大语言模型(LLMs)的学生模拟多局限于静态画像与单次交互,难以捕捉学生长周期的动态发展轨迹。大语言模型对复杂情境的推理与演化模拟能力,为突破这一瓶颈、建立长时序的动态学生智能体提供了新的技术契机。
近日,清华大学教育学院张羽课题组发布了相关研究,报告了基于LLM的“学生发展智能体(Student Development Agent, SDA)”仿真框架的设计与实证效果,为高效、合乎伦理地评估AIED创新提供了“零风险”的数字孪生新范式。该研究已被AIED 2026接收。第一作者为清华大学教育学院硕士生蒋建骁,通讯作者为张羽教授。
该研究设计了LLM模拟学生在特定学习环境中的发展轨迹的智能体框架与仿真方法。课题组首先采用数据驱动的自然语言处理技术,深度挖掘逾83万篇高质量文献,构建了包含“学习环境、学生禀赋和发展维度”的通用教育分类体系。在此基础上,研究进一步整合“行动集合”与“历史记忆”,形成了SDA操作化定义五元组,并设计了“感知—决策—更新”的闭环迭代仿真机制。在“全AI守护课堂”(MAIC)多智能体学习环境的实证验证中,课题组将42名虚拟智能体与真实学生的数据进行了对比分析。结果表明,SDA能够复现不同学生亚群的微观交互行为模式,且在学习动机、学业自我效能感、坚毅等非认知发展维度的预测上,SDA的性能优于传统的均值基线方法(RMSE、MAE平均下降约16.83%)。这些发现揭示了基于LLM的学生发展智能体在作为数字孪生测试台方面的强大潜力,同时也为未来引入微调模型、优化长时序评估方法指明了方向。
论文信息:Jiang, J., & Zhang, Y.* (2025). Student Development Agent: Risk-free Simulation for Evaluating AIED Innovations . arXiv preprint arXiv : 2510.09183. (已被AIED 2026接收)论文链接 :https://arxiv.org/abs/2510.09183
( 点击文章左下角“阅读原文” )供 稿 | 张羽课题组审 核 | 张 羽来 源 | 清华大学教育学院
