要理解如何使用AI进行学习而不外包你的思考,请让模型等待。
首先尝试问题,要求它找到你推理中最早的缺口,一次给一个提示,然后关闭聊天并从记忆中重建答案。最后给出一个AI没有展示过的新问题。
两篇2026年7月的论文帮助解释了这个顺序的重要性。一项随机实验发现,当本科生可以使用生成性AI时,他们的即时和一周后的测试分数更高。另一项独立的模拟研究发现,LLM教师通常在早期干预,并且透露的解决方案比人类教师更多。这些研究测量了不同的内容,且没有一项证明某种工作流程适用于每个学习者。它们共同支持一个有用的边界:AI可以改善学习过程,但任务完成并不证明学习者能够独立执行。
读者水平: 中级。你不需要教育研究的背景,但本文区分了随机证据、模拟结果、子组关联和实际解释。
目录
简短回答:控制AI介入的时机
保持第一次尝试和最终回忆不受帮助。给AI三个狭窄的任务:诊断第一个缺口,逐渐揭示帮助,并生成一个测试相同技能的不同问题。
这是一种学习者控制的干预政策。你决定模型何时可以介入,它可以透露多少,以及什么证据将被视为学习。一个正确的辅助产物本身并不能通过这个测试。
七月研究实际测量了什么
最近最强的证据并不支持任何极端。它没有显示AI不可避免地损害学习。它也没有显示访问一个有能力的模型保证理解。
| 证据 | 主要发现 | 支持的内容 | 不能建立的内容 |
|---|---|---|---|
| --- | --- | --- | --- |
| 随机本科生实验 | AI访问提高了报告环境中的即时和一周知识测试分数 | AI可以在受控设计下支持学习 | 每种AI工作流程、主题、学习者或时间范围的效果 |
| INT-BENCH模拟 | 测试的LLM教师早期、频繁且提供了大量解决方案内容 | 辅助需要时机和披露限制 | 普通产品使用中的人类学习结果 |
| 77人代数提示研究 | 70%的生成提示通过了审查;人类提示的收益更大 | AI提示需要质量检查 | 当前AI辅导员的排名 |
一项随机实验发现保留的收益
关于生成性AI学习影响的实验证据,提交于2026年7月9日,将211名本科生随机分配到允许AI或禁止AI的条件下。学生学习一个不熟悉的主题——区块链、碳捕获或CRISPR——然后写一篇分析性论文。他们立即进行了不受帮助的知识测试,并在大约一周后返回进行另一个测试和没有AI或外部资源的论文。
测量: AI访问使即时测试分数提高了6.7个百分点,从56.3%的控制均值开始。这在论文中等于0.27个标准差。大约一周后,允许AI的组仍然领先5.1分,也为0.27个标准差。在进入第一次会议的211名学生中,有204名完成了两个会议。
测量: 访问并不意味着普遍使用。68%的处理组使用了AI。在接受处理的学生中,57%使用它来解释概念,31%用于草拟回应,17%用于总结阅读。
研究人员将AI用户的ChatGPT日志分类为增强、自动化、混合或其他。49%被分类为纯增强,32%为纯自动化。自动化组在第一次AI辅助论文中获得了更多收益,但当AI被移除时,这种优势几乎降为零。增强组保留了积极的测试和论文估计,尽管几个子组估计在统计上不精确。
重要限制: 学生是随机分配到AI访问的,而不是增强或自动化行为。这使得整体访问效果在研究中是因果的。行为子组对比是关联的。它不能证明请求解释导致了后来的差异。
实验室还基本上保持学习时间不变。作者明确警告,该研究并未证明广泛的AI采用会提高总学习。在实验室外,学生可能会使用AI提前完成并将节省的时间用于其他地方。
一项模拟发现LLM教师介入过早
AI助手过度干预,提交于2026年7月23日,引入了INT-BENCH。它模拟了一个LLM学生解决1500个代码调试、数学和脑筋急转弯问题的过程,同时一个LLM教师观察推理轨迹并决定是否介入。
标准教师以50个字符为增量查看轨迹。一个神谕教师在决定是否以及何时提供帮助之前,查看完整的推理、答案和正确性判定。
测量: 标准LLM教师在90%的试验中介入,平均在推理轨迹的18%后介入。在获得完整信息的情况下,干预频率降至54%,平均时机移动到轨迹的56%。标准干预产生了0.20的净准确性增益:25.5%的最初错误答案变为正确,而5.4%的最初正确答案变为错误。
即时准确性提高,但来自先前问题和干预的上下文并没有显著改善在一个新的相关问题上的表现。报告的泛化变化在三个领域之间范围从-0.04到+0.04。
论文还比较了LLM干预与50人作为教师在30个脑筋急转弯上的表现。在标准条件下,LLM教师在14.2%的干预中揭示了完整的解决方案,而人类为5.4%。近乎完整的支架出现在大约45%的LLM干预和30%的人类干预中。
重要限制: INT-BENCH研究模拟了学生。一个继续推理轨迹的模型并不能重现人类的记忆、动机、困惑或认知负荷。它的转移测试在原始情节后立即使用一个相关问题。论文没有测量人类在几天或几个月内的保留。
实际解释: 一个模型可以在消耗推理机会的同时改善答案。学习需要一个单独的测试,在其中没有帮助。
为什么正确的输出可能掩盖薄弱的学习
AI的回应可以优化你面前的产物:解决的方程、通过的函数、润色的段落或简洁的总结。你的学习目标是不同的。你需要在表面细节变化时,稍后重建推理并应用它。
这会产生三种不同的结果:
| 结果 | 证明了什么 | 并未证明什么 |
|---|---|---|
| --- | --- | --- |
| 辅助任务是正确的 | 人类与AI的结合过程产生了有效的结果 | 学习者可以重现该方法 |
| 学习者可以解释结果 | 学习者现在可以描述推理 | 学习者可以将其转移到新案例 |
| 学习者稍后解决一个新案例 | 技能在上下文和时间的变化中存活 | 技能在没有进一步练习的情况下将保持 |
这个边界类似于任何AI辅助的生产工作流程。一个系统可以生成听起来完整的文本,同时失去作者的判断。相同的风险在使用AI而不失去作者自己的上下文和标准中也很明显。在代码中,一个完成的补丁仍然需要独立测试;大型代码代理工作负载并未消除验证的需要。
学习需要自己的验证层。模型应该帮助创建练习、诊断错误并调整难度。它不应该是答案存在的唯一地方。
如何使用AI进行学习:五步工作流程
这个顺序是一个实用的综合,而不是一个新的学习理论。2026年4月的TACO框架已经将学习者控制组织为思考、提问、检查和拥有。下面的五个步骤在同一以人为本的边界上增加了一个明确的提示梯度、无辅助转移问题和延迟回忆检查。
将工作流程用于一个概念、一组问题、一段代码或一个论点。一个周期可以花费15分钟。一个更难的话题可能需要几个周期。
1. 定义技能并尝试无辅助
写一个可观察的目标:
然后在打开AI对话之前尝试这个任务。保留尝试,包括你变得不确定的地方。这为辅导员提供了关于你实际缺口的证据,并防止模型的答案成为你的起始思考。
不要问,“教我微积分。”问,“我可以对多项式进行微分,但我不明白为什么链式法则要乘以导数。我尝试了这个解释并在这里卡住了。”
2. 请求一个提示,而不是解决方案
设定一个干预预算。从一个问题、反例或方向性提示开始。要求模型在给出更多帮助之前等待另一次尝试。
有用的提示级别:
只有在前一个级别失败时才向下移动列表。完整的解决方案仍然可用,但它成为最后的干预,而不是默认。
较早的研究ChatGPT与人类辅导员生成的代数提示之间的学习收益差异显示了为什么提示仍然需要审查。70%的ChatGPT生成的提示在其77人实验中通过了人工质量检查。两个条件都有积极的学习收益,但收益在统计上仅对人类创作的提示显著,并且大于ChatGPT条件。该论文使用了一个早期的ChatGPT系统,因此无法对当前模型进行排名。它确实表明“提示”并不是质量的保证。
3. 用自己的话解释这个想法
关闭或隐藏模型的回应。用你自己的话解释这个方法。包括:
要求模型根据一个简短的评分标准来评估解释,而不是立即重写它。请求所需的最小修正。如果模型声称有事实错误,请在接受修正之前检查源材料。
清晰的解释在保留技术核心时是有用的。关于使困难想法更易于理解的AI解释的短文也表达了同样的观点:可访问性不应要求假装主题简单。
4. 在没有AI的情况下解决转移问题
要求模型创建一个使用相同基础技能但改变表面形式的新问题。告诉它暂时不要包括答案。
示例:
然后离开聊天,独立解决新问题。仅在提交答案后比较结果。
这一步将模式复制与转移分开。它也直接回应INT-BENCH的结果:对原始问题的帮助并未可靠地改善模拟学生在相关问题上的表现。

*说明:AI在第一次尝试后介入,并在转移和回忆检查之前离开。*
5. 进行延迟回忆
通过为未来的自己写两个提示结束会话:
第二天回答它们。对于重要的材料,一周后重复。在完成回忆尝试之前,不要重新打开原始AI对话。
七月的随机实验在大约一周时测量了保留,但这个工作流程并没有继承论文的效应大小。延迟回忆是局部测试:它告诉你你的理解是否在你自己使用AI后存活。
可重复使用的AI辅导提示
这个提示适用于正常聊天或产品学习模式。替换方括号中的字段。
text 充当[主题]的辅导员,水平为[我的水平]。
我的目标技能: [一个可观察的结果]
我已经知道: [简短描述]
我的第一次尝试: [粘贴尝试,包括我卡住的地方]
本次会议的规则:
在提供的情况下使用我的源材料。标记不确定性,并且当材料不支持时,不要编造引用或事实。
一个顽固的模型可能仍然会透露太多。在下一轮中重复边界:“只给出帮助我再迈进一步的最小提示。”
如何测量你是否学习了
不要根据模型的解释听起来多么流畅来评分会话。记录属于学习者的证据。
| 检查 | 通过条件 |
|---|---|
| --- | --- |
| 第一次尝试 | 在帮助之前存在真实尝试 |
| 提示预算 | 完整解决方案不是第一次干预 |
| 解释回馈 | 你没有抄袭地陈述机制 |
| 错误诊断 | 你可以说明原始尝试失败的原因 |
| 转移 | 你在没有AI的情况下解决了一个变化的问题 |
| 延迟回忆 | 你在一天或一周后重建了这个想法 |
| 源检查 | 重要事实与课程或主要材料匹配 |
使用紧凑的日志:
text 技能: 第一次尝试缺口: 使用的提示: 解释回馈错误: 转移结果: 次日回忆: 源检查: 下次练习:
一个失败的检查并不是放弃AI的理由。它确定了下一个练习目标。一个失败的转移问题意味着返回机制,而不是请求五个附带解决方案的例子。
学习模式和引导学习的变化
当前产品可以减少提示的开销,但它们并未消除工作流程的需要。
OpenAI的学习模式文档,检查于2026年7月28日,表示该模式可以提问、分层解释概念、测验学习者、使用上传的材料,并以苏格拉底式的方法进行引导。同一页面警告学习模式可能会出错,并且有时可能会给出直接答案。
谷歌的引导学习文档,同样检查于2026年7月28日,描述了引导学习、视觉辅助、上传文件、练习问题、反馈、提示和可用的OpenStax资源。
Anthropic的教育页面表示Claude的学习模式提出问题,旨在帮助学生找到答案。这是产品描述,而不是独立的学习结果。
开源项目也朝着同一方向发展。DeepTutor库在6月29日至7月26日之间发布了八个版本。其公共历史显示146次提交和657个新创建的分支,从6月28日到7月28日的检查。这些数字衡量的是工程活动,而不是学习结果、课堂采用或安全性。
选择一种模式以便于使用、文件支持、隐私规则和访问。保持相同的行为契约:
这个工作流程可能失败的地方
模型可能教错东西
一个雄辩的解释仍然可能包含一个错误的前提、虚构的引用或无效的步骤。检查高风险和课程特定的声明是否与指定材料、官方文档或主要来源相符。
提示可能泄露答案
“考虑能量守恒”可能是一个有用的方向。一个命名方程、替换值并留下一个算术步骤的段落是一个解决方案,标签已更改。收紧提示预算。
你可能会将识别误认为回忆
阅读解释两次会产生熟悉感。这并不能证明重建。关闭答案并从记忆中写出机制。
转移问题可能过于相似
仅改变数字测试重复性。要求模型在保留技能的同时改变上下文、表示和干扰项。
工作流程可能与课程规则冲突
遵循讲师的AI政策。有效的学习方法仍可能在评分工作、受保护材料或评估中被禁止。
证据仍然狭窄
随机论文涵盖了一个选择性的本科生样本、三个技术主题、固定时间的实验室和大约一周的保留。INT-BENCH使用模拟学生和即时转移。代数提示研究使用了一个较旧的模型和77名参与者。没有一项提供“AI辅导”的普遍效应大小。
安全的结论更为狭窄:AI可以支持学习,特别是当它帮助学习者检查和练习他们自己的推理时。独立转移和延迟回忆应决定会话是否有效。
声明检查
| 声明 | 基于证据的措辞 |
|---|---|
| --- | --- |
| “AI通过0.27个标准差改善学习。” | 一项随机本科生实验报告了0.27-SD的即时测试效果和在其设计下大约一周后的0.27-SD效果。 |
| “增强被证明比自动化更好。” | 该研究随机分配了AI访问,而不是使用风格。增强和自动化子组差异是关联性的,且部分不精确。 |
| “AI辅导员介入过早。” | 四个LLM教师在INT-BENCH中对模拟学生进行了干预;该结果并不是对每个辅导员或学习者的普遍测量。 |
| “AI提示不起作用。” | 太宽泛。一项较早的代数研究发现两个条件都有积极收益,但只有人类提示的收益显著,且70%的生成提示通过了审查。 |
| “这个五步工作流程是一种新教学法。” | 这是一个实用的综合,扩展了TACO框架,增加了提示梯度、转移问题和延迟回忆检查。 |
| “学习模式解决了问题。” | 供应商文档描述了问题、提示和测验功能。它还承认错误和直接答案泄露。 |
| “一个正确的辅助答案证明了学习。” | 它证明了结合过程的任务成功。转移和延迟回忆需要单独的无辅助检查。 |
