资讯动态

AI教育决策赋能:RAG与Agent的工程实践

发布时间:2026/10/9 6:00:37 来源:尧图企业网站定制
我做这个“百考通AI”项目时最深的感受是真正困难的不是把大模型接进来而是想清楚“决策赋能”这四个字到底意味着什么。很多团队以为AI落地就是套一个聊天窗口结果做了三个月发现只是个高级搜索引擎。百考通AI的实践给了我们一个很好的样本——它要解决的是教育考试场景里一连串真实的决策问题学生该重点复习什么、老师该怎么调整教学策略、教务怎么预判通过率。这篇文章就把我们在这个项目里的完整思路、技术选型、踩过的坑和最后沉淀下来的工程方法一并整理出来。无论是正在做AI产品落地的工程师还是想用AI改造业务流程的负责人这篇都应该能帮你少走不少弯路。1. 先想清楚“决策赋能”到底解决什么问题1.1 教育场景里决策真的那么难吗教育考试领域有个很反常识的现象数据量越大决策越难。一个在线学习平台里可能沉淀了几十万道题、几百万条刷题记录、上万份学情报告但学生拿到手仍然是“题海战术”老师做学情分析依然要手动拉表格算半天。我接触过不少这类平台的真实痛点学生端面对海量题库不知道自己的薄弱知识点到底是哪个只能“雨露均沾”地刷题。教师端想精准掌握班级学情但靠EXCEL透视表做出来的分析滞后且粗糙。一个四五十人的班级光整理成绩分布、知识点薄弱度、进步趋势熟练的老师也要花上两三个小时。教务端排课、组卷、预测考试通过率基本依赖历年经验和拍脑袋缺少数据化支撑。这就引出了“百考通AI”要解决的核心问题如何用大模型技术把“经验驱动”的决策变成“数据模型驱动”的决策同时让决策速度和覆盖范围都实现量级上的跃迁。1.2 为什么“高效跃迁”的关键不在算力很多人一听到AI赋能第一反应就是“上更大参数的模型”。但百考通AI项目给我们的第一个教训是没有清晰的决策链路再强的模型也发挥不出来。打个比方算力就像发动机马力但真正决定车速的是传动系统和驾驶员判断。你在一个老旧流程上硬塞一个大模型只会得到一个更快的“自动化传话工具”原来的等待时间确实缩短了但决策质量没有本质提升。我们梳理下来“高效跃迁”的本质包含三个层面效率跃迁原来需要几小时的学情分析现在几分钟出结果。质量跃迁原来靠经验的决策现在有知识点级别的数据支撑甚至可以给出归因解释。范围跃迁原来只有头部的教研专家能做的复杂命题、学情诊断现在普通老师和学生也能获得接近专家水平的建议。所以整个项目从一开始就把重心放在了决策链路的再设计上而不是单纯堆模型。这也决定了后面所有的技术选型方向。1.3 用一张业务模型图看清启动路径我们启动百考通AI时画了一张很朴素的业务图把所有环节的“人”和“决策点”列出来再逐个标注“AI能帮什么”。当然这里不画技术架构图只画业务视角的决策地图角色高频决策当前痛点AI赋能方向学生刷哪些题、先学哪个知识点题海战术、盲目复习个性化诊断、薄弱点推荐教师怎么调整教学重点、怎么出卷数据滞后、依赖经验班级学情洞察、智能组卷教务学习路径怎么排、通过率预测拍脑袋、缺乏归因数据预测、风险预警这张表看起来简单但它是整个项目的“定盘星”。后面所有技术工作都是围绕这三条线展开的。任何新功能上线前都要先回答它优化了哪个决策点如果答不上来先不做。2. 技术底座选型大模型、Agent与RAG的取舍2.1 通用大模型 vs 行业微调模型别急着微调做AI应用模型选型是第一个分岔口。百考通AI早期也纠结过要不要自己微调一个“教育行业大模型”后来我们权衡再三决定不上微调直接用通用大模型 RAG。原因很实在教育考试行业的知识更新是持续性的教材改版、考纲调整、新题型出现如果依赖微调意味着每隔几个月就要重新训练一次成本和周期都扛不住。通用大模型的基础能力已经非常强特别是逻辑推理和文本生成。教育场景里的很多任务比如根据知识点生成一道变式题、总结错题规律通用模型完全能胜任。真正个性化、时效性的内容比如特定地区的考纲、特定教材版本的章节体系本质上是私有知识天然适合放到知识库里做RAG检索增强而不是靠微调“背下来”。这里不是否定微调的价值而是在百考通AI这种业务场景下RAG的投入产出比明显更高。如果哪天我们要做语音评测、手写识别这类“技能型”能力那再考虑专门的模型也不迟。2.2 为什么引入AI Agent而不是只做对话机器人项目走到中期我们发现一个瓶颈学生问“我该怎么复习数学”如果只是调API生成一段建议那和百度搜到的结果没有本质区别。真正的决策赋能需要AI像一位助教一样主动完成一整套动作先诊断调取该学生的答题记录检索知识点关联库。再规划找出薄弱知识点排列优先级。最后执行生成一份个性化的复习路径并匹配题目。这种“多步规划 工具调用 结果汇总”的完整任务单轮问答根本做不了必须引入Agent机制。我们采用了计划-执行Plan-and-Execute模式作为主框架配合思维链CoT的ReAct范式做局部推理。举个例子智能组卷任务里Agent的规划步骤大致是根据考试目标单元考、月考、模拟考确定知识点范围。从题目知识库中按难度、题型、区分度检索候选题目。根据历史作答数据预估试卷整体难度系数。调用拼卷工具组合成卷再让“审题Agent”做一轮质量校验。这套流程如果不用Agent而是写一堆if-else光是“知识点范围”和“难度系数”的匹配逻辑就能把代码复杂度推到失控边缘。用Agent的好处是模型可以在运行时动态决定先做哪步、调用哪个工具极大增强了系统的自适应能力。2.3 RAG工程化决定AI可信度的地方RAG在概念上很简单——把用户问题拿去检索知识库把搜到的片段塞进上下文让模型回答。但真做起来每一个环节都有坑。百考通AI在RAG工程化上踩过一轮这里直接给可复用的经验。切分策略一定不能只用固定长度。一开始我们按500字固定切分结果把一道完形填空题和它的答案解析拆到了两个片段里检索时经常只召回题干、召不回解析。后来改成“语义完整单元切分”优先按题号、知识点、章节等自然边界切。一道题连带解析、考察知识点、难度标签作为一个整体单元入库。这一步的收益立竿见影召回准确率提升了近20个百分点。Embedding模型要试不要想当然。教育领域有很多专业术语和相似概念比如“函数”和“映射”“成因”和“归因”通用Embedding模型很容易混。我们最终选用了一个针对中文教育语料微调过的向量模型并且在测试集上做了逐类评估。建议做类似项目的朋友至少要准备500条以上覆盖到核心业务的评测问题对比两三个候选模型的召回效果再拍板。召回只是第一步重排才是关键。原始召回Top-20的片段直接塞给大模型效果很不稳定。我们接了一个Rerank模型在向量召回的候选集上做精排最终只取Top-5送入大模型。这个重排模块让生成内容的准确率显著提升尤其是在依赖倒推、因果推断的题目中重排的作用近乎决定性的。知识库的更新机制必须常态化。教育行业的内容有非常强的时效性——今天教材改版明天考纲调整后天新增真题。我们的知识库是每周执行一次增量更新每天晚上跑定时任务把新增的题目、修订的解析打上时间戳入库同时把过时内容软删除。这样做的好处是知识库永远跟得上变化AI给的建议不会“拿着旧地图找新大陆”。3. 从0到1搭建决策链路一套可以抄作业的实操参考3.1 六步建链法理清技术该往哪走这部分我想尽量说得具体给正在做同类项目的团队一个可参考的路线图。我们把一个AI决策系统的搭建拆成六步需求拆解把业务决策点转化为可计算的AI任务。比如“个性化推题”拆成“学生薄弱点诊断 题目难度匹配 产出解释”。数据治理盘点并用技术手段清洗现状数据。百考通AI刚启动时题库里有大量重复题、答案错位题、无知识点标签的题。我们先用规则脚本做了两轮清洗MD5去重、答案格式校验再人工抽检了5000道建立了基础可信度。知识库构建把清洗后的数据向量化入库并设计好分段策略和更新机制。提示词编排为每个核心任务设计职责明确的Prompt模板并且做版本管理。Agent工作流实现用计划-执行框架串起多个任务节点中间加入工具调用和人工审批节点。反馈闭环建立“错误的AI输出能回流并优化系统”的机制。这六步里第4、5步是技术含量最集中的下面展开细说。3.2 Prompt编排的几个关键细节写Prompt看起来人人都会但工程化的Prompt和临时问几句AI完全是两码事。百考通AI的Prompt做过三轮大的重构最重要的心得有三个。第一明确限定“决策依据”和“输出格式”。我们给学情诊断Agent设计的系统Prompt里明确写清了输入数据的Schema、知识库检索规则、输出必须包含的字段诊断结论、证据题目编号、薄弱知识点、建议动作。这样做不仅提高了输出规范性更重要的是让AI的决策过程变得可追溯、可解释。学生看到的不只是一句“你函数部分薄弱”而是“基于你最近15道函数题的作答记录你整式变形题的正确率只有40%判定为薄弱点”。第二让Agent“说人话”禁止“正确的废话”。我们发现如果不约束AI生成的学习建议经常是“建议你多练习、多加复习”这种正确但无用的内容。后来在Prompt里增加了一条硬性要求所有建议必须包含具体动作、具体题目、具体时间安排。比如“今天先看解析第17题的变形逻辑再做同知识点的3道基础题预计用时45分钟”。这个改动直接拉高了用户对AI建议的采纳率。第三Prompt也要做版本管理。我们用Git管理Prompt模板每个改动都走评审上线后同步观测效果指标。别觉得多此一举教育类产品的输出质量直接关系用户信任任何一个Prompt的临时修改都可能影响整个链路的效果。3.3 三个决定AI表现的关键参数与经验值在工程化过程中我们发现有3个参数几乎每次调优都会碰到这里直接给出经验值大家可以根据业务自己调整。参数作用百考通AI的经验值备注temperature控制随机性决策型任务0.2-0.3组卷、诊断建议要求稳定不能每次结果都不一样top_p核采样范围0.7-0.9与temperature配合不要两个同时大幅调整max_tokens输出上限按任务类型500-2000学情报告类给足长度分类等短任务给短即可经验之谈像“学情诊断”“组卷”这类有标准答案倾向的任务temperature一定要调低宁可保守一点也不能让AI发挥出“创新性的错误”。文本生成类的题目解析则可以把temperature放到0.4-0.5让解释更灵活多样。3.4 多AI协作的工程实践不要试图让一个模型干完所有事一个常见的误判是大模型是全能的所有任务都往里面塞。实际上对长业务链来说让多个各司其职的Agent协作效果和稳定性都远好于一个“超级Agent”。百考通AI里的多AI协作架构是把一个复杂任务拆成专业Agent流水线。以智能组卷为例流水线是这样的命题Agent根据知识点和难度要求从题库中筛选候选题目并补充题干、答案、解析等完整信息。审题Agent独立检查试卷内容找重复题、超纲题校验答案正确性。美观排版Agent负责格式统一、题号规范、难度顺序排列。总控Agent最后汇总检查整张试卷是否符合最初的组卷要求。这中间有一个非常重要的设计“审题Agent”不能由“命题Agent”兼任。每次我们看到一个Agent既负责出题又负责审核时就相当于让运动员自己给自己当裁判出错的概率会显著变大。分开成两个Agent之后问题暴露得更充分。这种“角色分离”原则在AI工程里值得被当作一种标准做法。3.5 效果验收怎么判断“跃迁”真的发生了做技术的人容易陷入一个陷阱模型输出变好看了就认为项目成功了。但“决策赋能”的评价标准必须是业务决策质量的提升。我们对百考通AI的落地上线效果定了三类验收指标效率指标学情报告生成时间从原来人工的2-3小时下降到40-60秒。质量指标学生推荐题目的知识点匹配准确率从人工经验匹配的约70%提升到85%以上以试后测试结果为基准。采纳指标老师根据AI诊断结果调整教学计划的采纳率从上线初期的30%提升到了60%以上。建议做类似项目的朋友一定不要把验收的终点放在“AI能生成多通顺的文本”上而是要盯住它是否改变了真实业务中的决策行为。否则做得再花哨也是自嗨。4. 踩过的坑与排查实录4.1 数据质量是最大的隐性地雷项目上线一个月后我们做了一次专项抽检发现AI推荐题目中有一部分来自“脏数据”——有些题目的答案本身就是错的AI还一本正经地给学生讲解错题。这是所有AI教育产品最严重的事故类型。排查过程分三步对题目全集做“答案一致性”批量校验凡是解析答案和标准答案不一致的题目全部下架。在Agent的检索环节增加“可信度过滤”题目必须有完整的知识点标签、不低于两位审题专家确认过才进入可推荐范围。建立用户反馈通道学生点“这道题有问题”后对应题目立即进入人工复核队列。这个坑提醒我们RAG检索得来的内容可信度取决于知识库自身的可信度。在把数据灌进知识库之前数据治理花的每一分钟都是值得的。4.2 延迟、成本和并发的“不可能三角”AI决策系统上线之后性能问题会被迅速放大。一开始我们是最直接的API调用每次学情诊断要串行调用两次大模型再加上一次向量检索端到端延迟经常飙到15秒以上用户早跑了。我们的优化组合拳小模型分流简单的分类任务判断学生属于哪种学习风格、识别题干是否完整走一个小参数模型延迟只有几百毫秒只有复杂推理任务才走大模型。流式输出学情报告先输出框架再逐步补充细节用户等待体感时间缩短到3秒以内。大模型缓存对于重复的诊断请求比如同一知识点同样难度的推荐加上语义级缓存命中就直接返回不重复算。做过类似架构的同学应该对这个组合不陌生这几个手段叠加起来效果非常明显成本也控制住了。4.3 可解释性AI替人做决策必须备好证据链在真实使用中学生和老师天然不信任一个“黑箱”。一次期中考试前AI给一个班的学生做学情诊断结论是把“立体几何”作为全班最薄弱点建议大比重复习。但任课老师认为班级立体几何并不差拒绝采纳AI建议。我们复盘时发现AI给出的结论依据太高阶了——它综合了“题目正答率”“答题用时”“知识热度”等多个维度但用户在界面上看到的只有结论没有依据。后来我们做了两个改变所有诊断结论必须配套“证据面板”展示具体的错题编号、对应知识点、统计比例。让结论可以追溯可被验证。增加AI建议的置信度展示当模型对某条判断不够确信时明确提示“该结论样本量较少建议人工复核”。可解释性这件事看起来是产品层面的细节但实质是技术系统设计的延伸。它要求Agent在决策过程中就把依据记录下来而不是最后硬凑一段解释。4.4 常见问题速查表把我在百考通AI项目里遇到过的高频问题整理成一个速查表方便大家直接对照排查。症状可能原因解决动作推荐题目和知识点关联明显错误题目标签缺失或标注错误数据清洗重新建立题目-知识点映射学情报告每次结果不一样temperature设置过高决策型任务调低到0.2-0.3检索召回的相关片段不完整切分策略破坏了语义完整单元按题号、知识点、章节等自然边界重新切分AI输出大量“正确废话”Prompt中缺少行动指令约束增加“必须包含具体动作”的硬性要求组卷重复率高审题与命题未分离引入独立审题Agent做全卷查重高峰期响应延迟极高所有请求都走大模型增加小模型分流和语义缓存用户反馈建议不落地知识库更新滞后执行知识库增量更新加入时效过滤4.5 一个小众但很重要的细节长期效果的监控最后想提醒一点很多AI教育项目的效果是会随时间衰减的。学生群体在变考纲在变题目的难易分布也在变。百考通AI上线三个月后我们发现推荐模型的效果指标比上线初期下降了约10%查下来是某地区的考纲发生了调整而知识库的更新策略没有跟上。从那之后我们把“效果监控”放到了和“技术监控”同等重要的位置。不仅要盯系统的延迟和可用性还要定期评估业务效果指标是否有下滑趋势。一旦发现连续两周指标下滑自动触发一次根因分析重点检查数据时效性和Prompt是否需要微调。这个习惯的确立让整个系统的生命力和可持续性提升了一个档位。我个人在实际操作中最深的一条体会是在AI决策赋能的系统里效果不是上线那一刻确定的而是上线后持续运营出来的。技术架构再先进也离不开一套务实的运营保障机制在背后撑着。希望这篇整理能帮正走在这条路上的团队少踩几个坑。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑