
OpenAI 发布学习成果测量套件,旨在解决 AI 如何长期影响教育效果的难题。通过与斯坦福大学、塔尔图大学等合作,该框架提供标准化工具评估 AI 对知识保留、高阶思维和学习行为的影响,帮助教育者做出更明智的决策。
教育的下一个前沿——衡量长期学习成果 教育是人工智能最具前景的应用领域之一。借助 ChatGPT 等工具,个性化学习支持可以随时随地触达任何学生。然而,教育行业对 AI 如何影响学习成果的理解仍处于早期阶段。去年,OpenAI 团队开始研究“学习模式”(study mode)等工具的使用情况,并发现了学生在成绩上的可喜进步。但研究也提出了一个关键问题:我们如何评估 AI 对学生长期学习进程的影响,而不仅仅是一次期末考试的成绩? 这是一个更广泛的生态系统挑战。迄今为止,大多数研究方法只关注狭窄的表现信号——如考试分数——缺乏评估学生在真实环境中如何与 AI 互动学习,以及这种使用如何长期塑造学习成果的能力。为填补这一空白,OpenAI 与爱沙尼亚塔尔图大学(University of Tartu)以及斯坦福加速学习实验室(Stanford Accelerator for Learning)的 SCALE 计划合作,开发了“学习成果测量套件”(Learning Outcomes Measurement Suite),这是一个支持跨不同教育情境纵向测量学习成果的框架。目前,正在通过随机对照试验进行广泛验证,并计划与 OpenAI 学习研究生态系统“学习实验室”(Learning Lab)的创始组织——包括亚利桑那州立大学、伦敦大学学院知识实验室(UCL Knowledge Lab)和麻省理工学院媒体实验室(MIT Media Lab)的研究人员——开展进一步研究。 今天,我们分享该测量套件的工作原理及其重要性的概述。随着时间的推移,我们计划发布更多研究,并将该测量套件作为公共资源提供给全球的学校、大学和教育系统。 > “这项研究让我们能够快速学习,同时为更深入地理解如何以真正有意义的方式将 AI 深思熟虑地融入学校奠定基础。我们想了解这些工具如何在支持严谨学术学习的同时,培养高阶思维、创造力、好奇心以及学生对自己作为学习者的信心。”
—— Susanna Loeb,斯坦福大学教育学教授兼 SCALE 计划主任
当前关于 AI 对学习影响的研究方法显示出关于成绩的有希望信号,但未能捕捉 AI 如何长期影响学习成果的全貌。
“学习成果测量套件”将首次为纵向研究提供一个标准框架,帮助教育者、研究者和机构理解 AI 如何在不同情境下塑造学习和成果。
OpenAI 的“学习实验室”是一个专注于推进这项工作的新研究生态系统。随着该领域的发展,OpenAI 将与一系列合作伙伴共同发布研究结果。
当学生使用 AI 工具学习和研究时,这可以意味着很多不同的事情——从向 AI 寻求快速答案,到像导师一样逐步引导解决问题。为了鼓励用户以支持更深层次理解和技能构建的方式使用 ChatGPT,OpenAI 去年推出了“学习模式”。在幕后,“学习模式”由我们与教师、科学家和教育学专家合作编写的自定义系统指令驱动,这些指令反映了支持真正学习(而不仅仅是答案)的核心行为集——包括搭建脚手架、检查理解和引导练习。 为了测试这种符合教学法的 AI 交互模式是否能转化为更好的学习成果,我们进行了一项随机研究,涉及 300 多名准备神经科学和微观经济学考试的大学生。虽然分析仍在进行中,但早期结果让我们有信心认为,通过“学习模式”等功能鼓励的符合教学法的 AI 交互模式,可以改善学习成果。但这项研究也揭示了一个重要现实:真正重要的是这些成果和相关的高效行为是否能够长期保持。
参与者被分配到三组之一:对照组使用传统在线资源(如谷歌搜索和 YouTube)学习,并禁用 AI 生成的摘要功能;另外两组则获准使用两种略有不同的“学习模式”变体之一,这些变体旨在以略微不同的方式引导学生完成学习过程。提前收集了基线测验和入门调查,以调整先前课程接触、学习习惯、学术信心和 AI 工具熟悉度方面的差异。学生在每次考试前完成限时的“学习模式”课程,两种“学习模式”变体在科目间进行平衡。 这种设置旨在反映真实的学习条件,而不是严格控制的实验室环境。参与与考试成绩无关,并非所有学生在名义上的 40 分钟课程中都同等程度地使用了“学习模式”。这使我们能够测量和报告“意向治疗”(ITT)效应,即在现实推广条件下提供工具访问权限的影响——换句话说,就是提供“学习模式”的因果影响,同时承认参与度在实践中可能有所不同。
我们分别测量了每门考试的成绩。在我们的随机研究中,不同科目的改善并不一致,参与者对“学习模式”的参与度也各不相同。 - 神经科学(主要 ITT):我们观察到“学习模式”相对于对照组的正向差异,但结果与使用传统在线资源学习的学生没有显著区别。一些入门和技术问题影响了使用“学习模式”的学生花费的学习时间。
传统上,教育研究依赖于短期指标——如期末考试分数——来评估干预措施的有效性。但这忽略了 AI 作为学习工具的一个关键优势:它能够支持持续的、个性化的学习旅程,其影响可能不会立即在单次考试中显现。 “学习成果测量套件”正是为此而生。它提供了一套标准化的方法和工具,用于纵向追踪学生的学习进展,包括: 1. 知识保留测量:评估学生在一段时间后对概念的掌握程度,而不仅仅是短期记忆。
为了加速这一领域的进展,OpenAI 成立了“学习实验室”(Learning Lab),这是一个专注于 AI 教育影响的研究生态系统。该实验室汇集了来自顶尖大学和研究机构的研究人员,包括: - 亚利桑那州立大学(Arizona State University)
对于教育者和政策制定者而言,这一框架提供了几个关键见解: 1. 不要只看分数:AI 对学习的影响是多维的。依赖单一指标可能低估其长期价值。
AI 在教育中的应用正处于一个转折点。我们不再问“AI 能否帮助学习”,而是问“如何以最佳方式设计和使用 AI,以实现最大化的学习收益”。 “学习成果测量套件”和“学习实验室”代表了 OpenAI 对这一问题的严肃承诺。通过提供标准化工具和开放研究,OpenAI 希望加速整个领域的进步,确保 AI 不仅让学习更便捷,而且让学习更有效、更持久。 随着更多研究的发布,我们将继续更新教育社区。同时,我们邀请研究人员和教育者加入这一努力,共同塑造 AI 教育的未来。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

本文以美国柴郡学院为案例,探讨学校如何从“防作弊”转向“教思考”,通过分层管理、反思式教学和专用工具,将生成式 AI 转化为教育赋能工具,并为国内 AI 教育实践提供参考。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。