1. 先说清楚AI Agent和普通问答机器人的核心差别1.1 为什么教学场景需要Agent而不是一个聊天框很多人一开始会问我现在用ChatGPT、文心一言或者Kimi用得好好的备课、出题、答疑都能干为什么还要折腾WorkBuddy这样的AI Agent工具这个问题我一开始也有直到我真的把两种方式放到同一个教学任务里对比了一次才彻底明白差距在哪。普通对话式AI本质上是一个你问一句、它答一句的问答机器。你让它帮我出一套高中数学函数的练习题它能给但你需要反复补充约束条件——要几道题选择题还是大题难度梯度怎么安排有没有配套答案和解析每次补充都要重新生成。这就像你请了一个能力很强但完全不动脑子的助教你不把每个细节交代清楚它就给你交一个差不多能用的版本你还得自己二次加工。AI Agent则不一样。它的运行逻辑是你把一个任务目标交给它它自己拆解成步骤按顺序调用工具、查资料、生成内容、检查结果最后交付一个完整成果。我常用的一个说法是普通AI是打字员AI Agent是实习生。打字员你逐字逐句吩咐实习生你告诉他目标和标准他自己想办法把活儿干完。放在辅助教学这个场景里区别非常具体。比如我设计了一门《Python程序设计基础》课每周要出一次课后练习。以前我用对话式AI每周要花大概四十分钟在这个重复劳动上交代背景、约束题型、检查错误、调整格式。现在我把它封装成一个固定的Agent任务每次只要把本周讲到的知识点列表丢给它它自动结合教学大纲和往期作业风格生成一套带答案、带评分标准的练习我再花十分钟审一遍就能直接用。这个从四十分钟到十分钟的差距就是Agent和聊天框之间最直观的分水岭。1.2 WorkBuddy这类工具到底在解决什么那WorkBuddy在这中间扮演什么角色如果只看表面它看起来像一个能跑AI任务的客户端。但用了一段时间之后我个人理解它本质上解决的是三件事任务的组织、知识的管理、流程的复用。任务的组织是指你不用每次把所有背景信息重新讲一遍。做教学的人都知道AI生成内容效果好不好极大程度上取决于你的需求描述写得细不细。但每天写详细描述不现实。WorkBuddy里可以把一套完整的教学任务定义成可复用的流程下次直接调用这套流程就是它里面常说的Skill。知识的管理是指把课程大纲、教材章节、学生常见问题这些零散的文档整理成Agent可以检索的资料库。你不需要把资料背给Agent听而是让它知道去哪儿找。这个动作看起来不起眼但对教学场景是决定性的——没有课程资料的Agent就像新来的老师没拿到教材只能凭常识讲课。流程的复用解决的是这次做好了下次还能不能做得一样好的问题。你这一周精心设计了一套作业生成流程下周、下下周、用到下学期它都能保持同样的标准。这恰恰是教师工作里最累的部分不是做一次而是每一次都要达到差不多的质量水准。所以WorkBuddy在我眼里不是又一个AI客户端而是把AI能力和个人工作方法绑定在一起的一个工作台。它的价值不在模型本身有多聪明而在于你能不能把一份教案、一套批改标准、一个答疑思路沉淀成Agent能照着执行的东西。2. WorkBuddy搭建教学助手从下载到跑通第一节课的任务2.1 安装与账号准备比想象中简单先说安装。WorkBuddy目前有客户端版本支持主流的桌面操作系统Windows和macOS都有对应的安装包。下载之后一路默认安装就行整个过程和装一个普通的聊天软件没有太大区别不需要配置命令行环境也不用自己折腾模型服务。装完之后用它自带的默认账号体系登录就能进入主界面。有一点想提醒大家WorkBuddy和CodeBuddy是两个不同的产品我在网上经常看到有人把这两个名字混着搜结果跑错了地方。这里简单区分一下CodeBuddy是面向程序员的AI辅助开发工具侧重代码生成、代码解释、工程项目理解WorkBuddy则是更通用的AI Agent工作台强调的是把日常工作任务交给Agent去跑教学场景用它更合适。如果你手头已经装了CodeBuddy也不要紧两个工具在使用逻辑上有不少相通之处但别指望在CodeBuddy里找到WorkBuddy的全部功能入口。登录进去之后你会看到主界面大致分成几个区域对话区、任务列表、工具面板、知识库入口。刚上手的时候不需要把每个按钮都搞明白先做一件事把默认配置跑通。我建议第一次使用的朋友先不要急着配什么复杂流程直接在对话区丢一个简单的教学任务给它比如帮我写一份45分钟课程的教案框架主题是《循环结构》面向大一学生。这一步的目的不是检验它写得好不好而是确认整个链路是通的——模型能响应、输出能正常显示、你能复制走。我第一次装WorkBuddy的时候犯过一个很低级的错误装完直接开聊发现回复速度很慢一度以为工具出问题了。后来才发现是后台在第一次启动时要初始化本地模型配置和插件环境这是个一次性过程耐心等几分钟就好。如果你也遇到类似情况不用急着卸载重装。2.2 建一个会按步骤办事的Agent跑通对话之后下一步就是把一个只会聊天的助手变成一个会按流程办事的Agent。这一步是整个使用过程中最关键的习惯转变。具体操作上WorkBuddy里可以创建自己的工作区或任务空间你可以把它理解成一个专门为某类任务准备的独立环境。我给课程答疑建了一个独立空间里面定义了一个答疑Agent的身份它的人设是本课程的助教熟悉教材和作业要求回答风格耐心、简洁遇到不确定的内容要主动说明不能凭空编造同时给它配置了两个能力一个是检索课程知识库一个是调用计算工具处理数值问题。配置好之后我的用法就不一样了。以前学生答疑我问AI 这个报错是什么意思它给我一段通用的解释现在我会把学生提交的错误截图或者代码片段发到Agent任务里说这是学生第3次作业的报错请结合作业要求先指出出错原因再给出修改建议最后用适合初学者的口吻解释相关概念。Agent会按这个顺序自己组织答案。同样是答疑前者是一个一个零散的问题后者是一套稳定的服务学生的体验也更一致。这里有一个非常实用的经验Agent的身份设定越具体输出越稳定。别只写你是助教要写清楚这个助教服务什么课、面对什么水平的学生、回答风格偏学术还是偏口语、输出格式是什么。你写定义花掉的十分钟会在后面每一次运行时加倍赚回来。2.3 让Skill承担教学流程而不是靠即时对话如果只停留在给Agent下指令这一步说实话它还是一个高级聊天框。真正让WorkBuddy这类工具区别于普通AI的是Skill这套机制。Skill可以理解为一个预先写好的工作流模板你把一项任务的执行步骤、输出要求、质量标准固定下来之后每次只要提供不同的输入Agent就能按同一套流程自动产出结果。我做的第一个教学Skill是周作业生成器。这个Skill内含的流程是这样的第一步读取指定章节的知识点清单第二步根据教学大纲确定题型分布选择、填空、编程题各占多少第三步按由易到难的梯度生成题目第四步为每道题配置答案和解析第五步检查题目难度是否与往期作业持平第六步输出为固定格式的Word文档。配置流程的时候界面并不复杂。你可以用可视化的节点编辑方式来设置步骤也可以直接用自然语言描述流程WorkBuddy会把描述解析成可执行的流程。我个人的建议是前几个Skill用可视化的方式手动拖出步骤因为这样你能清楚看到Agent每一步在做什么后面熟练了再用描述式效率更高。做完这个Skill之后我每周的使用方式就变成了给它发一个本周知识点列表等它跑完流程我拿到一套作业初稿。整个过程大概五到八分钟剩下的工作就是我的审核。这里要特别说明这个Skill不是一次就调好的前几次跑出来的作业题有不少问题比如题目偏难、解析过于简略、题型比例失衡。每次发现问题我就回到Skill配置里增加一条约束比如编程题的解析必须包含代码逐行说明选择题必须至少有2题是概念辨析类。迭代了大概三四次之后这个Skill的输出质量才稳定下来。是的AI Agent工具的使用过程本质上就是一个不断优化流程的过程。3. 教学生和帮自己三类真正值得落地的教学用法3.1 课前备课用Agent做素材预加工而不是代替思考很多老师对AI备课有顾虑觉得AI写的教案空或者担心用了AI备课会让自己失去对课程的掌控。这个顾虑我理解但我的观点是AI Agent在备课环节的最大价值不是替你写教案而是帮你把备课中的素材搜集和初步组织这部分体力活干掉让你把精力集中在真正的教学设计上。举一个实际例子。我备《数据库原理》这门课的时候每节课都要准备案例数据、课堂练习题和课后阅读材料。以前这些都要自己去网上翻现在我的备课Agent任务是这样的输入本节课的主题索引的工作原理Agent自动完成四件事第一从课程知识库中调取本讲对应的ppt大纲第二搜索并整理两个生活化的类比案例来解释索引加快查询第三生成3道随堂测试题并标注难度第四推荐一篇拓展阅读材料附上推荐理由和核心观点摘要。注意它做的事情是预加工而不是终极交付。拿到Agent产出的这份素材包之后我还是要自己判断这个类比贴不贴切、那道测题会不会太偏、推荐阅读适不适合现在学生的水平。但这个过程比从零开始快太多我只需要做判断题不需要做填空题。另外一个很实用的备课技巧是反向生成。有时候我备课备到后面会陷入我知道这节讲什么但不知道学生会在哪里卡住的困境。这时候我会让Agent换一个视角让它扮演一个学过前置课程但基础一般的初学者针对我的教案初稿提出你可能听不懂的地方。这个视角切换经常能帮我发现自己习以为常、但学生确实会困惑的概念盲区。比如我讲函数递归的时候Agent模拟学生视角提出的一个问题是既然函数可以调用其他函数为什么不直接在同函数内部用循环非要再调用一次自己——这个问题的确经常在学生的脑子里盘旋如果不在课堂里正面回应一部分学生就会在这个点上走神。3.2 课后答疑把Agent做成学生可以反复问的陪练答疑是教学工作里非常消耗时间但又极其重要的一环。有了AI Agent之后我发现它不能完全替代老师答疑但能非常有效地分流掉那些重复性、基础性、规则性的问题让老师的精力释放出来处理真正有深度的问题。我的做法是把课程的知识库和常见问题FAQ交给答疑Agent并设置了非常明确的服务边界——《课程须知》文档里写明作业提交方式、格式规范、常见环境问题这类教务类问题先问课程Agent回答不了再找老师概念类疑惑Agent会根据教材章节给出解释而设计类、开放性的问题比如我的项目选题应该怎么定代码报错看了半天找不到原因Agent会把学生引导到带着代码和运行截图来找我。这个边界的设计非常重要而且我强烈建议每个用Agent做答疑的老师都要设置。如果不设置边界会出现两种情况一种是Agent承担了需要老师判断的任务给出的回答不够准确或者过于机械反而误导了学生另一种是Agent成了无限回答的廉价劳动力学生自己不动脑直接把问题都丢给它。合理的边界既保护了教学质量也培养了学生的自主解决问题的能力。还有一个细节我觉得值得分享配置文件里我专门加了一条规则回答学生问题时如果涉及代码必须先给出简短的思路解释再给出代码不能只贴代码不解释如果学生问题问得模糊必须先反问澄清不要猜。这条规则起源于一次事故——有一个学生直接问我们那个作业怎么做Agent基于猜测给了一版答案结果驴唇不对马嘴学生反而更懵了。从那之后我就加了澄清机制。事实证明让Agent在拿不准的时候主动提问而不是硬猜答案是保证答疑质量的重要防线。3.3 批改和学情分析让Agent按你的评分标准干活批改作业这件事大概是老师们最渴望用AI替代的部分了。我的经验是主观题的批改AI没办法百分百替代老师的判断但客观题规范性检查错误类型归类这三类工作AI Agent真的能承担掉很大一部分。我自己设计了一个作业质量分析的Skill流程是这样的第一步定义这周作业各题的知识点覆盖第二步批量读取学生提交的答案文本形式第三按我提供的评分标准对各题打分并给得分点第四把所有错误答案归类成几种典型错误类型比如概念混淆型计算粗心型逻辑跳跃型第五输出一份学情分析报告列出正确率最低的题和对应的知识点。这个流程的核心在于评分标准。标准写得越具体评分越稳定。我第一次跑这个Skill时直接让Agent按常识打分结果分数飘得很厉害同一个答题方式在不同份作业里得的分都不一样。后来我把标准改成了按得分点给分每一道题明确列出有几个得分点答出一个给对应的分答错指定概念不给分。修改之后稳定性明显上来了。这里要给各位老师提前打个预防针AI批改的结果一定要抽查。至少抽20%的人工复核一下确认没有系统性偏差之后再决定要不要扩大使用范围。它不是替代你的判断而是帮你把重复劳动降下来。我自己现在的流程是Agent先批一遍出分和错误归类我重点看它标记的典型错误和疑似问题卷这比我从头批到脚效率高不少而且错误类型的归类分析说实话比我以前手工统计做得细——它能告诉我学生普遍在哪个概念上翻车这对我调整下一周的课件重点很有帮助。4. 知识库和连接器让Agent真正认识你的课程资料4.1 为什么必须把课程资料喂进去我见过不少用AI辅助教学的人第一步就卡在知其然不知其所以然——用Agent聊天很好用但要它结合自己的教材、自己的大纲、自己的学生水平来产出内容它就力不从心。原因很简单AI模型训练的时候并没有学过你和你的课程。它知道全世界的《Python编程》教材长什么样但它不知道你的课程是偏数据科学应用还是偏后端开发你的学生是零基础还是有一定编程经验你的作业评判标准是什么。这些信息必须你自己提供给Agent。WorkBuddy里提供了知识库功能我可以把课程相关文档、教材章节摘录、历史教案、历年试卷这些内容整理好放进去Agent在处理任务时能主动检索引用。这一步是让Agent从一个聪明的外行变成一个熟悉你课程的助教的必经之路。整理知识库有一个顺序建议优先放那些你在备课和答疑中用到频率最高的资料比如教学大纲、课件、作业要求和参考答案。这些东西决定了Agent的基础工作质量。其次是教材的目录和重点章节不用整本上传但至少让Agent知道知识体系结构。最后才是那些补充阅读、课外资料有空再整理。4.2 配合Obsidian整理课程资料的一些实际经验我在用WorkBuddy的过程中发现了不少把它和Obsidian知识库联动的玩法。Obsidian是一款很多人用来做个人知识管理的本地笔记工具它的核心优势是用Markdown格式管理笔记。为什么这个配合有意义因为Obsidian里的笔记本身就是结构化的纯文本非常容易被Agent读取和解析。我的实际做法是把每一门课在Obsidian里建一个独立的文件夹里面按周次组织笔记每周的笔记内容包括本周教学目标、讲义要点、课堂活动设计、作业要求。凡是和课程相关的碎片信息我都随时丢进Obsidian里。然后在WorkBuddy里我把这个Obsidian文件夹关联为课程Agent的知识库来源之一——这样Agent在答疑和备课时能实时使用我维护的最新笔记内容。这里分享一个管理技巧目录前面不要放容易引起混淆的特殊字符或空目录层级。我自己踩过坑——在Obsidian里建了一个测试用的空目录又在WorkBuddy里把它配置成了知识库的一部分结果Agent检索资料时好几次给我返回空结果我当时还以为是WorkBuddy坏了排查了半天才发现是空目录导致的检索干扰。把空目录删掉之后一切恢复正常。这种小细节没人会在官方教程里告诉你但确实能卡你半天时间。另一个实用的配合是双向同步你在WorkBuddy里跑完一次任务产出的优质内容比如一份很好的教案、一组不错的学生练习我会直接把markdown格式的结果复制回Obsidian里打上标签归档。这样每一次使用Agent产出好内容都是对个人知识库的一次扩充。时间长了你会拥有一个既属于自己、又被Agent充分理解的课程资料库。4.3 连接器让Agent进入日常流程而不只是工具WorkBuddy里还有一类能力叫连接器可以简单理解成它帮你在Agent和各种外部应用之间搭的桥。比如你可以在Agent工作流中配置一个通知步骤任务执行完成之后自动把结果同步到你的即时通讯工具或者协作软件里。这个能力对教学工作最直接的价值是它能把Agent从主动打开软件才能用变成流程自动跑完推送给你的后台员工。举个例子我给自己设了一个每周五上午十点自动触发的任务检查本周作业的提交情况对比知识库里的评分标准生成一份简明的学情摘要然后通过连接器推送到我的手机端。这样每周五我不用特意去问这周作业情况怎么样消息已经躺在那里了。还有一个跟我个人工作流结合得很好的场景把课程答疑记录定期同步到内部的协作表格里做统计。学生哪些问题被问得最多集中在哪些知识点Agent每周自动汇总更新一次。这个表我每次开教研会都会扫一眼能非常直观地看到课程在哪些地方给学生的压力最大。以前做这种统计要靠手工费时费力有了连接器自动同步就再也没有借口说没时间统计了。据我了解WorkBuddy连接器已经支持包括钉钉多维表在内的多种协同软件的同步能力。我虽然没有把钉钉三维表用到极致但至少在定期同步数据这个场景里验证过——配置好之后数据能按时按点、自动地更新到目标表格里这个基础场景是靠谱的。如果你也身处一个依赖表格协作的教务团队值得研究一下这个方向。5. 踩过的坑和个人建议5.1 Skill写得太笼统Agent就给你自由发挥前面反复提到Skill我在这里再强调一个核心教训Skill的描述一定要具体不要追求写一段漂亮话而应该写一个可执行的SOP。我最早做作业生成Skill的时候只写了这样一段描述生成一套关于本周知识点的作业题型分布合理难度适中包含答案解析。听起来没问题对吧但Agent自由发挥的结果是出的题量忽多忽少有时候选择题全是记忆类概念题没有考应用能力有的编程题难度明显超纲。问题不在Agent笨而在于我给的约束太模糊——什么叫分布合理什么叫难度适中这些词在不同人眼里完全是不同的标准。后来我把Skill改成了这样题量和题型分布明确列出来比如选择题6题每题4个选项填空题4题编程题2题难度梯度明确第1-2题为基础概念第3-4题为基础应用第5-6题为综合应用题干风格有示例题干引入问题的实际场景不直接考定义背诵解析规则也有约束解析必须包含知识点标签、完整推理过程和常见错误说明。改完之后输出质量立刻不一样了。这件事给我的体会是AI Agent就像一面镜子它忠实地反映了你给它定义的工作方式。你输入模糊的要求它就给你模糊的结果你给它精确的SOP它就给你稳定的交付。很多时候大家抱怨AI输出质量差其实最根本的原因是我们在定义工作流程这件事上偷了懒。5.2 关于AI幻觉Agent也会一本正经地胡说八道在所有使用AI Agent辅助教学的人面前都横着一个绕不过去的坎AI幻觉。也就是说模型会生成看起来非常流畅、结构清晰、但实际上是错误或者虚构的内容。在教学场景里这个问题的严重性会被放大——因为你面对的是学生他们有理由相信老师给的内容是经过验证的。我的处理原则是Agent可以起草老师必须终审。尤其是在涉及公式推导、法律条文引用、历史事件时间点、医学常识这些高风险内容的时候我基本不会直接使用Agent的原文输出而是把它当成一个初步候选方案然后对核心事实一一核对。比如我让Agent帮忙编一道物理题涉及光速和折射率计算我拿到题目之后一定会手工验算一遍答案确认公式使用和数值代入都没问题才敢发给学生。这里分享一个我确认Agent输出可信度的笨办法凡是在回答中出现了我不熟悉的事实我会让Agent给出信息来源并要求它在找不到信息来源时明说无法确认、请人工核对。通过设置这种追问习惯能从意识层面把AI说的不一定对这根弦绷紧。其实让Agent承认不知道并不难真正难的是你愿不愿意花时间追问。5.3 从一个小场景开始别一开始就搞大而全最后一条建议也是我最想对刚开始接触这类工具的老师说的千万别一开始就想着搭一个覆盖全部教学环节的超级Agent。我见过不少同事和朋友满怀热情装好工具然后花了一整个周末试图把备课、授课、答疑、批改、学情分析全部移植进去最后哪哪都没做好干脆放弃了。这条路我自己也走过一截教训很深。更合理的做法是选一个你每周都要做、且重复性最强的教学工作比如生成周作业或者整理答疑记录先把它做成一个能稳定运行的Skill。用起来迭代它等到它真的能帮你省下时间再开始下一个场景。为什么这样更有效因为AI Agent的使用能力本质上是流程思维的能力。你需要时间适应如何把一段模糊的教学需求拆解成Agent能理解的清晰步骤。这种能力只能通过一个个小项目练。我用了大概三周时间前前后后只打磨了两个Skill一个周作业生成一个学情分析。第三周开始我的效率才真正有了质的提升。另一个更深层的体会是工具再强大也不该替代老师在理解学生上的判断。AI能帮你把重复劳动压缩但它不知道哪个学生最近状态不好也不知道哪个知识点需要换个角度再讲一遍。这些判断才是教学活动里不可让渡的部分。WorkBuddy这类工具的意义是把你从繁琐事务中释放出来让你有更多精力去做那些AI永远做不了的事情——比如站在讲台上看着学生的眼睛判断他们到底懂了没有。这几年AI工具迭代速度非常快WorkBuddy也只是这条路上的一款产品。我今天分享的这些方法和经验未必每一处都适用于你的场景但把AI从玩具变成生产力工具的这个思路我相信是通用的。从今天开始选一个最让你头疼的重复性教学任务试着把它定义成一个Agent流程跑通它然后迭代它——你会看到完全不同的一番景象。