很多面向孩子的 AI 课程第一节就开始教提示词公式角色、任务、背景、格式。这个方法当然有用但如果课程到这里就停下来孩子学到的仍然只是“怎样让模型更像一个熟练的回答者”。真正困难的问题在后面• 它的回答依据是什么• 引用的来源真的存在吗• 来源是否支持它刚才的结论• 资料没有覆盖的部分模型有没有自己补全• 关闭 AI 以后孩子能否复述自己的判断这也是我在设计“AI 原生一代儿童 AI 素养”课程时刻意把“提示词技巧”放到后面把输入、输出、验证和责任放到前面的原因。生成式模型输出的不是数据库查询结果搜索系统和生成式模型都会给出一段看起来像答案的内容但两者的生成路径并不相同。传统检索系统的基本任务是从已有文档中召回与查询相关的内容再完成排序和展示。虽然搜索结果同样可能低质量或过时但用户至少可以打开原始页面判断作者、时间和上下文。生成式模型的核心任务则是在当前上下文中预测后续更可能出现的内容。它可以把分散的信息组织成流畅的说明也可能在缺少证据时继续生成一个形式完整、语气自信的句子。因此“回答得像不像”与“结论能不能被证据支持”是两个不同的评价维度。对于还在建立知识结构的孩子尤其不能把流畅度当成正确性的替代品。一个十分钟的三次提问实验课程里有一个很简单的家庭实验。选择一个不涉及隐私、能够找到可靠资料的常识问题例如为什么傍晚的天空有时会变红然后连续做三次提问。第一次直接提问只把原问题交给模型记录回答。此时不要急着评价对错先观察它是否给出了机制解释、精确数字、人物引语或来源。第二次要求标出不确定性和来源在问题后面增加要求请区分可以确认的内容和仍不确定的内容并为关键结论提供可以打开的来源。没有可靠来源时直接说明不知道。这一步不是为了证明模型“更聪明”而是观察它是否具备稳定的证据意识。现实中经常会出现一种情况模型列出了几个看似规范的来源但页面不存在或者页面存在却没有支持对应结论。所以列出来源不等于完成验证。第三次先给资料再限定证据边界家长和孩子先找到一份可靠资料把与问题相关的段落交给模型再要求只根据下面的资料回答。每个结论标明对应的资料位置资料没有说明的内容写“不知道”不要补充常识。第三次提问引入了一个重要概念证据边界。模型可以帮助整理给定资料但不能因为一句话“听起来合理”就越过资料覆盖范围。从提示词升级为五段式流水线把上面的实验抽象一下可以得到一条适合家庭学习任务的简化流水线。1. 定义问题先让孩子说明我到底想知道什么这个问题的范围是什么怎样的结果才算完成如果问题本身含糊后续无论使用搜索还是生成式 AI都只会更快地产生大量无法评价的内容。2. 约束输入输入不能包含姓名、学校、住址、精确位置、账号、私人聊天和可识别照片。需要分析作业时可以先删除身份信息只保留完成任务所必需的内容。3. 标记高风险输出让孩子在回答中圈出四类句子精确数字、真实引语、人物或机构经历以及医疗、法律、财务、安全等高影响建议。这些内容并不一定错误但一旦出错影响更大也更值得优先核验。4. 回到原始来源核验至少包含三个动作询问来源、打开原文、寻找第二个相互独立的来源。仅仅让模型“再检查一次”仍然是在同一个生成系统内部循环不能替代外部证据。5. 保留失败状态和人的结论工程系统需要明确的失败状态学习过程也一样。资料不足时允许孩子写目前资料不足我还不能确认。这句话比一个勉强完整的答案更有价值。最终还要让孩子关闭 AI用自己的话说明已经确认了什么、仍然不知道什么以及下一步准备怎样查证。怎样评价孩子的完成质量如果只给最终答案打分孩子很容易把“让 AI 生成更漂亮的文字”当成目标。更合适的评价对象是整个过程留下的证据环节 可检查的产物问题定义 一句话任务目标与完成标准输入约束 已删除的敏感信息清单输出检查 被标记的高风险断言来源核验 原文链接、支持范围与第二来源独立判断 不依赖 AI 的最终结论与不确定项这套方法不会保证孩子每次都得到正确答案。它真正训练的是当工具可能出错时仍然知道自己该做什么。AI 素养的分界线不是“会不会用”孩子很快就会掌握新的对话框、新的生成功能和新的提示词模板。工具界面会不断变化具体技巧的保质期很短。更稳定的能力是能否定义问题能否识别回答中的风险能否回到证据能否保护隐私能否在信息不足时停止以及能否对最后的判断承担责任。这也是儿童 AI 教育应该留下的“慢变量”。我正在试运行一套面向 8—14 岁孩子和家长的四周实践课。第一周的任务不是背提示词而是完成“三次提问”和“AI 错误侦探”两个实验。完整任务与集中答疑放在知识星球“芝士AI吃鱼”https://wx.zsxq.com/group/88888881284242参加时请不要上传孩子的姓名、学校、住址、正脸、私人聊天、账号或联系方式。我们只讨论去标识化的问题、验证过程和结论。