资讯动态

ChatGPT任务续写如何影响二语写作效能感与产出?

发布时间:2026/9/29 1:55:30 来源:尧图企业网站定制
简介一份围绕ChatGPT任务续写视角的实证研究文档面向二语写作教学研究者、教育技术开发人员及关注AI辅助写作的高校师生。文档系统梳理了人与人工智能合作对二语写作效能感与写作产出的影响机制包含研究背景、目的、假设、实验与问卷调查设计、效能感量表、对比实验数据分析、ChatGPT任务续写原理与实践案例、合作挑战与对策、研究总结与展望等模块适合需要了解AI辅助写作研究方向或设计相关实验的读者参考。资源压缩包共1个文件为docx格式文本整体约45KB内容结构完整目录层级清晰目前已有64人学习下载。文档不仅呈现了研究结论ChatGPT任务续写对二语写作效能感有提升作用、对写作产出质量有积极影响还提供了较为细致的混合研究方法范例包括定量量表计算思路与定性访谈分析路径可帮助读者借鉴如何设计人机协同写作教学实验、如何采集和分析效能感与产出数据并启发后续个性化学习与AI深度融合的扩展研究。1. 探究人与人工智能合作对二语写作效能感及产出的影响ChatGPT任务续写的视角到底在研究什么拿到这个标题先别急着把它归类为“又一篇AI教学实验”。它真正想回答的问题不是“ChatGPT能不能帮学生写英语作文”而是“当学生和ChatGPT以‘续写’这种特定方式合作时学生对自身写作能力的信念——也就是写作效能感——会发生什么变化这种变化又是否会真实地反映在作文产出上”。这个选题在当下的二语写作研究里卡住了一个关键位置绝大多数已有研究都在讨论“AI作为反馈工具”或者“AI作为代写工具”但任务续写是第三种形态——AI提供前半段文本学生负责把故事或论证接下去。续写不是让AI替学生写而是逼着学生在别人AI的叙事框架里做出自己的语言决策。这个交互过程对效能感的冲击方式和“拿到AI反馈后修改”完全不一样学生既要理解AI生成的文本意图又要维持自己作为作者的掌控感这中间的博弈才是标题里“合作”二字的真实含义。适合读这篇文章的人很具体正在设计二语写作实证研究的硕博生和青年教师、想用生成式AI做教学干预但不知道怎么设计对照组的一线教师、以及被“AI会不会毁掉学生写作能力”这类问题困扰但手上没有数据的人来说本文给出了一套从理论框架到统计分析的完整落地方案。研究中涉及的效能感量表使用、产出指标计算和数据收集避坑都会在后面逐节拆开讲。核心结论先放在这里ChatGPT任务续写真正能改变效能感的不是“AI写得有多好”而是续写任务里那个“人机交接点”的设计——每次续写前学生要读多少AI文本、AI文本留了多少空白让学生发挥、以及学生能否在续写后看见自己的贡献被保留。这三个设计参数比模型本身的选择更值得花时间。2. 把“人机合作”拆成可操作的自变量三个关键变量与一个准实验框架2.1 为什么选“任务续写”而不是“AI反馈”或“AI代写”二语写作研究里AI介入的形态大致分三路。第一路是“AI作为反馈提供者”学生写完后让ChatGPT给语法和内容建议然后自行修改第二路是“AI作为代写引擎”学生输入提示词模型直接产出整篇文本第三路就是标题里的任务续写——AI只提供前文后文由学生完成或者学生写前半段、AI补完后半段再让学生在此基础上改写。三种形态对写作效能感的作用机制完全不同。反馈模式下学生的自我效能感主要受“修改能力”驱动收到反馈、看懂反馈、改对问题这一系列操作会强化“我能控制自己文本”的信念。代写模式下效能感很容易被架空作文得分再高学生心里清楚那不是自己写的长期反而会削弱“我自己能写”的信念。而续写模式的独特之处在于它制造了一个持续的“认知交接”——学生必须在AI给定的语言环境里决策这个人物接下来该说什么这个论点用哪个论据接上一段的语气是正式的还是随意的从效能感理论来看Bandura提出效能感四大来源——成败经验、替代经验、言语说服、情绪唤醒——续写任务几乎每个都占续写完成度直接构成成败经验看到同桌续写的不同走向构成替代经验教师在讲评时指出“你接的这一段比AI原来的走向更有说服力”构成言语说服而流畅续写带来的心流体验则是正向情绪唤醒。2.2 自变量、因变量与控制变量怎么定很多模仿这个题目的研究翻车最先翻在变量界定模糊上。标题里的“人与人工智能合作”不是自变量它是一个情境描述。真正可操作的自变量应该是“人机协作模式”至少分三个水平水平一是“AI续写人修改”AI产出后半段学生改写、扩写后作为终稿水平二是“人续写AI开头”AI产出故事前半段学生独立完成后半段水平三是对照组的“无AI续写”同题目的纸质续写任务只给情节提示不给文本。因变量有两类对应标题的“效能感”和“产出”。效能感要用问卷量化推荐使用Second Language Writing Self-Efficacy Scale这类经过验证的量表或者从学业自我效能感问卷中抽取写作维度。产出指标则包括文本长度、句法复杂度、词汇多样性、内容连贯性评分和整体质量评分。注意产出评价必须用分析性评分量表如内容、组织、语言、机械四个维度分别打分不能只给一个总分。需要严格控制的控制变量包括学生英语水平用前测作文或标准化成绩分层、ChatGPT使用经验先做一次无干预的熟悉性任务排除“不会用”带来的干扰、写作题目难度各级别使用同题但不同提示文本、输入文本长度AI提供的续写前文控制在120150词避免过长让学生只能被动延续而没有发挥空间。研究者还必须记录每次续写的用时因为“协作任务耗时显著更长”本身就是个值得分析的中间变量。2.3 实验设计模板前测—干预—后测的最小结构从实际操作来看一个学期内能完成的最小设计是三组准实验前测作文写同一题目的完整作文不打分只计效能感问卷→六次续写干预每周一次→后测作文与前测等价的题目。独立样本t检验或单因素ANOVA就够用不需要跑复杂的多水平模型。具体到每周干预序列建议固定为四步。第一步学生阅读AI生成的前文约120150词用2分钟在文本上标出自己认为关键的情节转折或论证缺口——这个动作是在强制建立“我要接什么”的问题意识。第二步学生用15分钟完成续写。第三步同桌交换阅读续写段落讨论“哪里接得自然、哪里跳了逻辑”。第四步下拉一个5点量表记录本次续写的难度感知和掌控感——这两项数据是追踪效能感变化的中间过程指标。这套周期设计隐含一个容易忽略的要点续写干预后必须安排“分享—讲评”环节而且讲评重点要放在学生做出的不同于AI的选择上。原因在于效能感依赖于“我能行”的验证如果每节课只写不评、学生永远不知道自己接得好不好六次干预做完问卷数据大概率是平的。3. 搭建续写实验的完整流程从材料控制、分组设计到两轮干预的操作细节3.1 续写材料怎么选可控性先于趣味性续写材料是整个研究里最费时间的准备项没有之一。很多新手第一反应是拿ChatGPT生成一段小说开头但直接拿通用故事的意外结果是学生接不下去——不是语言问题是叙事语境超出了他们的生活经验。二语写作研究里选择续写材料要同时满足三个条件。第一是主题可控性故事场景必须是目标学生群体熟悉的生活范围比如“宿舍里来了一个新室友”“社团竞选前的决定”而不是“宇航员在火星上发现了一个洞穴”这类需要背景知识的题材。第二是语言难度匹配AI生成的续写开头要用学生的目标水平来限词——对英语专业大二学生句子的平均长度控制在1215词对四级水平的非英语专业学生还要进一步降低句法复杂度。第三是留白充分性一段好的续写前文必须在前半段埋下至少两个明显的情节岔路或论证争议点让学生有选择可做。材料准备阶段常见做法是先让ChatGPT生成三版内容再人工改写一版由两位研究者独立评阅“是否清晰、是否开放、是否超出学生水平”不一致处协商解决。这份材料清单里包含每组的题目编号、AI前文文本、前文词数、关键转折点说明和预期续写时长作为论文附录提交审稿人。3.2 用Python控制材料难度词数、句长与词汇等级既然要以“文本长度”作为材料控制指标手工数词就太原始了。准备材料时我一般会跑一个简短的Python脚本做难度预检统计AI前文本的词数、平均句长和高频词汇覆盖率。# -*- coding: utf-8 -*- import re from collections import Counter def analyze_text(text_path): with open(text_path, encodingutf-8) as f: text f.read() # 按句号/问号/感叹号切分句子注意英文缩写如 Dr. 不切分 sentences re.split(r(?[.!?])\s(?[A-Z]), text.strip()) words re.findall(r[A-Za-z], text.lower()) total_words len(words) total_sentences len([s for s in sentences if len(s.strip()) 0]) avg_sentence_len total_words / total_sentences if total_sentences else 0 # 词频统计用于后续观察是否过度依赖某个高频词 freq Counter(words) top_words freq.most_common(10) print(f总词数: {total_words}) print(f句子数: {total_sentences}) print(f平均句长: {avg_sentence_len:.1f} 词) print(f最高频词: {top_words}) analyze_text(continuation_prompt.txt)这段脚本的价值不在复杂而在于让材料控制可复现。参数说明句子切分的正则表达式要求句号后必须紧跟一个空格加大写字母才切分这样可以避免把“e.g.”“Mr.”这类缩写误判为句尾词数统计忽略大小写但保留撇号词形因为didnt应算一个词单位。实际操作中如果某篇前文的平均句长超过目标水平2个词以上我会直接删掉那段材料而不是硬用——因为后续解释“是否难度对效能感产生干扰”时会很被动。3.3 分组与干预排期用同一老师的两个平行班省掉一大半麻烦如果条件允许最推荐的方案是找同一位老师教的两个平行班参与研究一个班做干预、一个班做对照。这样做最大的好处是教学风格变量被自然抵消不需要再为此写一段“控制教师差异”的辩护词。分组时一定要收集上一次期末考试的写作单项成绩做独立样本t检验确认两组基线没有显著差异——这是审稿人必看的数据。六次干预的排期建议按两个阶段设计中间停一周。第一阶段第13周是“人续写AI开头”学生从头到尾独立完成续写这个阶段侧重观察学生面对机器文本时的自然应对。第二阶段第46周是“人改写AI续写”AI按照第一阶段的同一批故事开头续写出后半段学生必须保留AI文本的事实信息但用自己认为更合理的语言表达改写一遍——这两个阶段的对比能回答一个更有意思的问题学生是“接得住”更提升效能感还是“改得动”更提升效能感。第7周做后测作文和第二次效能感问卷。后测作文的题目必须和前测同一体裁、同一难度、不同主题。很多研究在这里翻车前测写“描述一次难忘的旅行”后测写“论述在线教育的利弊”——文体都变了作文质量的差异根本没法归因于干预。3.4 每轮干预的课堂时间分配与材料回收每次干预的课堂时间建议60分钟前10分钟用于说明本次续写的目标和规则特别是“必须延续前文的人称视角不得新开角色”这类硬约束30分钟用于写作10分钟用于同伴互评最后10分钟填当次的过程量表。研究者需要回收的材料包括学生的续写文本、互评记录表、每次课的过程量表。材料回收时要特别注意文件命名规范。我见过最惨痛的例子是学生交来的作文用“final_new_true.docx”命名六个班混在一起根本没法对应到具体人和具体轮次。正确的做法是初始文件名为“学号_姓名_轮次.docx”教师收齐后统一重命名为“C01_S12_R3.docx”C班级、S学生编号、R轮次并且每轮回收后立即用压缩包备份一份到网盘和本地硬盘。这个习惯在后面做重复测量分析时会救你一命。这里还必须提前想好“流失率”问题。六次干预加上前测后测通常会有学生因为缺课、退课导致数据不完整。处理办法是在实验前就定好规则缺勤超过两次的学生数据整组剔除缺勤一次但前后测完整的可以使用但要在论文里报告。不提前写这条规则等数据处理时再决定争议就来了——这不是统计问题这是研究伦理一致性问题。4. 效能感量表与产出量化这份研究的数据要从哪里来、怎么算4.1 效能感问卷别拿现成量表直接“翻译”了事写作效能感测量是整个研究里最容易被质疑的部分也是新手翻车重灾区。常见错误是直接找一份英文的量表机翻成中文后发给学生填。这样做的致命伤是翻译不等于等价——某个条目在中英文化语境下的理解偏差会让整个维度产生系统误差。选量表的底线是使用已在中国二语学习者群体中做过信效度检验的版本或者明确提出量表翻译加回译back-translation加预测试的完整流程。量表结构上建议覆盖三个维度写作自信学生觉得“我写英语作文时能清晰表达想法”、写作坚持学生觉得“即使初稿很差我也能改好”、写作策略学生觉得“我知道怎么策划一篇作文的结构”。每个维度至少5个条目全部用6点李克特量表1完全不同意6完全同意不要用5点——6点量表强制学生在“同意”一侧做出更精细区分能有效防止社会称许性作答。前后测用完全相同的量表但条目顺序要打乱重排一次防止记忆效应。施测时间点也必须固定前测在第一轮干预前一天、后测在最后一轮干预完成后一周内。中间过程量表难度感知、掌控感随堂收集但它不进入前后测对比的主分析只作为解释性证据。主分析用配对样本t检验比较前后测总分和各维度分。4.2 产出量化指标复杂度、准确度、流利度三个维度怎么算二语写作产出测量有个成熟的分析框架叫CAF框架也就是复杂度Complexity、准确度Accuracy、流利度Fluency用这三个维度把“写得好”翻译成可计算的变量。流利度最常用的指标是总词数和每分钟产词数复杂度看句法复杂度每个T单位包含的子句数和词汇多样性D值或MSTTR准确度看无错误T单位占比——这里说“T单位”是主句加所有从属子句一个T单位就是一个完整的句子结构。手动标记T单位是可以做的但用Python脚本能帮你把切分和基础统计自动化。下面的代码实现了一个最小可行的T单位切分工具配合人工校准可以省掉大量机械劳动。# -*- coding: utf-8 -*- import re import math def count_t_units(text): # 去除换行保留句子边界 text re.sub(r\s, , text.strip()) # 简单切句 raw_sentences re.split(r(?[.!?])\s, text) t_units [] for sent in raw_sentences: # 按并列连词切分T单位注意等立连词出现在主句之间 parts re.split(r\b(?:and|but|so|yet)\b, sent) for part in parts: if part.strip(): t_units.append(part.strip()) return t_units def lexical_diversity(words): # 简单TTR种类数/总词数——注意长文本会低估 unique set(w.lower() for w in words) return len(unique) / len(words) if words else 0 sample input() units count_t_units(sample) words re.findall(r[A-Za-z], sample.lower()) print(f估算T单位数: {len(units)}) print(f总词数: {len(words)}) print(f词汇多样性(TTR): {lexical_diversity(words):.3f})代码说明这个脚本是粗切版。它把包含and、but、so、yet这些并列连词的句子切成多个T单位但无法区分“并列主句”和“从属结构里的连接词”——比如“He left because he was tired and hungry”会被错误切成两段。因此脚本结果只能作为第一轮自动统计最后必须由至少两名评分者人工核对至少30%的文本计算评分者间信度Cohens kappa或组内相关系数不低于0.80。4.3 整体文本质量评分分析性评分表是必须的CAF指标回答的是“产出里有多少复杂结构、多少错误”但它回答不了“这篇作文作为整体好不好”。整体质量评分建议使用ESL Composition Profile的简化版从内容满分30、组织满分20、词汇满分20、语言使用满分25、机械规范满分5五个维度打分总分100。关键是评分方式。两名评分者需要先接受培训用不属于实验数据的五篇样文校准评分尺度然后在互不知晓学生组别的情况下独立评分。评分顺序随机打乱不能把同一个学生的前测后测排在一起评——否则评分者会下意识给后测更高的分来“体现进步”。两轮评分后用Pearson相关或ICC确认评分者间一致性取两者平均分作为最终得分进入统计分析。统计部分前后的简单思路是效能感总分和作文总分之间做相关分析按组分别计算干预前后差值之间的Pearson相关——这个系数回答了标题隐含的核心问题“效能感提升是否真的伴随产出提升”。如果相关系数在干预组显著而对照组不显著那你就在“效能感”和“产出”之间架起了一座统计证据的桥。5. 这类研究最容易翻车的五个坑现象、原因与补救办法5.1 学生偷偷用ChatGPT“代写”续写多人产出文本雷同现象批改第一轮续写作文时发现三个学生交上来的段落几乎一模一样连错误都完全相同明显不是独立完成的。原因学生在家里做作业时开了ChatGPT新对话窗让AI直接生成了“续写段落”然后粘贴提交。学生给出的理由非常一致“我不想显得比AI写得差。”解决先别急着定性——补救方案要区分“事中”和“事后”。事中手段是改变任务条件第二轮起把续写环节改成课堂内完成、统一在指定里写作平台进行并在提交后系统自动统计关键词重复率。事后处理是保留证据完整记录重复文本然后在论文“局限”一节报告。“数据造假”是绝对不能放的但没有事先声明“续写必须在课堂内完成”这项要求时责任一半在研究者。提示续写实验的伦理与契约问题可以这样表述——把“学生有权使用AI工具的边界”写进知情同意书并在说明时明确“本课程讨论AI的使用但评分的只是你的文字决策能力而不是AI的输出本身”。5.2 前测后测题目难度不一致产出分数不可比现象前测作文班级平均分比后测低出4分审稿人第一句话就问“是不是后测题目更简单”原因前测写的是“描述你最喜欢的季节”这类描述性题目后测写的是“是否应该禁止在校园内使用手机”这类议论文两种文体的评分维度不同。解决题目研发阶段就让两道题同体例、同字数要求、同评分维度最好由两位有经验的写作教师盲评预测试确定难度等价。如果已经发生了题目难度不平衡的情况能从统计角度补救的办法是把“题型”作为协变量放进ANCOVA模型但审稿人通常更认可“换一批数据从做”而不是“事后找补”。这个坑属于研究设计层面的问题最佳处理时机永远是材料定稿之前。5.3 效能感问卷前后测都“爆表”干预组和对照组根本没有差异现象前后测的效能感总分平均值都已经到了量表的85%以上六周后两组分数都没有变化实验做了等于白做。原因两个可能一个是量表条目的社会称许性太强——比如条目写“我有信心写好英语作文”任何学生都不会选“完全不同意”这等于逼着学生在量表上撒谎另一个是前测时间距离期末考试太近学生自我评价虚高。解决量表条目必须构造到具体行为而非抽象自信。把“我有信心写好英语论文”改成“当写作任务要求我在30分钟内完成一篇200词的议论文时我能做到”。后一种描述描述的是可验证的任务学生只能诚实地按照自己上次的真实经历回答。另外前测最好安排在开学第二周避开考试季。5.4 ChatGPT生成的续写前文跑题学生“接错方向”变成集体翻车现象AI生成的续写开头后半段悄悄引入了一个新的设定如“他其实已经决定退学了”学生的续写里出现了八种不同的展开方向最后数据根本没法统一评分。原因ChatGPT生成的长文本是按概率延续句子的它并不理解“这一段是给学生留白用的”在第五、第六句时往往自觉展开收束。这是生成式模型本质上无法自控的“叙事贪心”。解决材料制作时给ChatGPT加一句话作为生成约束——“只写起始段不要推进到事件的高潮结尾留在一个尚未选择的分岔口”并在生成后人工删掉最后一两句话。最关键的是每次生成的续写前文都要交给两位老师试写一遍确认“确实存在两条以上看起来都合理的续写路线”才可以用。5.5 过程量表每天填但数据完全没进分析现象每轮干预结束时学生填的量表收集了几百份结果写论文时不知道拿它干嘛只能搁置在补充材料里。原因实验设计时把过程量表当成了“配套动作”没有提前规划它的分析角色——这是一类非常普遍的时间与劳动浪费。解决过程量表的定位应该是“中介变量的候选”。在正式分析前先做一遍相关分析如果“每次续写的掌控感”和“后测效能感”相关显著这就是一个值得报告的中介线索如果六次的掌控感逐步上升但效能感没有相应变化这本身就是个有价值的结果——说明效能感的改变比主观感受更顽固需要更长时间或更明确的成败反馈。无论如何过程数据要想清楚再做想不清楚就别收省下的时间拿来多改一轮作文材料。6. 用AI对话日志做过程性证据让效能感变化不再只靠问卷“自说自话”最后这个技巧是我做完两轮实验后回头看觉得最值得提前说的事。如果你告诉学生“任务续写AI写前半段你写后半段”然后在实验结束后只回收了作文文本和量表你的证据链其实缺了最精彩的一环——学生与ChatGPT的真实交互过程。问卷只能回答“你觉得自己行不行”作文只能回答“你最终写出了什么”但“学生在续写时到底做了什么决定”这个过程性黑匣子从未被打开。而这件事恰恰能解释为什么有些学生效能感上升了但产出没变化——因为他们在续写时选择了“顺着AI写”放弃了自己作为作者的判断。解决方法非常直接把你的实验界面从“学生自己打开ChatGPT网页”改成“让学生在一个统一的办公文档平台里完成续写”或者更简单的使用文本编辑软件的记录功能、版本历史功能让学生的每次修改在保存时都留下一帧快照。你不需要让学生装任何新技术——文档的历史记录就是你的AI交互日志。续写任务里ChatGPT的词句粘贴进来、删掉、改写、又重粘回来这些动作被真实记录下来构成了效能感变化的微观证据。拿到这些日志后做一次简单的行为标注就行。你设三个编码直接采纳学生原样保留AI文本、部分改写保留5个词以上但调整了主干、完全重写AI文本全部替换。统计三种行为的占比与效能感变化量的相关性大概率会得到一个有意思的发现完全重写占比越高的学生效能感提升越明显——因为每一次重写都是一次“我能比它写得更好”的真实验证而直接采纳占比越高的学生作文产出可能提高了但效能感会走平甚至跌下来——因为“人机合作”变成了“人机投降”。这件事对一线教学的启发可能比论文结果更重要。如果你是设计写作课程的老师不必把ChatGPT当作代笔工具或反驳对象而是把它放在“续写”这个任务结构里让AI成为那个必须先出牌、但永远不等到最后一手的对手。学生每一次把AI的“完成段”改写成“我的版本”都是对“我能行”的一次增量确认。我这个习惯后来带进了所有学生写作项目里单人独写的作文我会反复追问“哪一句是你自己最想保留的”人机合作的任务我会追问“哪一句是你从AI那里抢回来的”。问题问完效能感的高与低其实心里早就有数了。希望这个从效能感量表到过程日志的闭环方案能帮你把“人机合作”这个抽象概念变成一组可测量、可干预、可信服的数据。本文还有配套的精品资源点击获取

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑