资讯动态

机器遗忘——当“删除数据”不等于“模型忘记”,如何让AI真正学会“忘掉该忘的”

发布时间:2026/10/5 10:26:42 来源:尧图企业网站定制
机器遗忘——当“删除数据”不等于“模型忘记”如何让AI真正学会“忘掉该忘的”期数AI透明度卷 · 第4期作者Valhalla Matrix治理实验室原创声明本文为原创技术博客基于Valhalla工程实践编写。论文锚点《Privacy-Aware Machine Unlearning with SISA for Reinforcement Learning-Based Ransomware Detection》(arXiv 2604.16760)、《On the Evaluation of Machine Unlearning Methods: A Multi-domain Classification Benchmark》(Machine Learning, 2026)、《DUSK: Do Not Unlearn Shared Knowledge》(ACL Findings 2026)、《OBLIVIONIS: A Lightweight Learning and Unlearning Framework for Federated Large Language Models》(AAAI 2026)摘要GDPR第17条的“被遗忘权”要求数据控制者删除个人数据违规罚款最高可达2000万欧元或全球年营收的4%。但当一个模型已经“学会”了这些数据的影响时删除数据库中的原始数据并不意味着模型忘记了它们。2026年机器遗忘领域取得了实质性进展SISA框架在勒索软件检测中将遗忘5%数据的F1损失控制在0.05%以内12种遗忘方法的多域基准引入了LUMA统一指标联邦学习框架OBLIVIONIS首次为分布式LLM提供了内置遗忘能力。但DUSK基准同时揭示了一个根本性难题当“要忘的数据”和“要保留的数据”共享内容时当前方法难以区分共享知识和独特知识——要么擦除了应该保留的信息要么未能完全遗忘目标内容。本文从“删除数据≠模型忘记”的工程困境出发结合SISA的分片思想、DUSK的共享知识挑战、LUMA的三维评估给出一套可运行的遗忘效果审计框架。核心判断机器遗忘的合规声明需要明确边界——“我们能忘掉用户数据”和“我们能精确地只忘掉该忘的、保留共享知识”是两种完全不同的能力。一、一个被低估的合规风险删了数据库模型还记得你是否有过这样的经历一位用户援引GDPR的“被遗忘权”要求删除他的数据。你的团队从数据库中删除了该用户的所有记录回复用户“数据已删除”并认为合规义务已经履行。但模型呢模型在训练过程中“学会”了这位用户数据的统计影响。删除源数据不会改变已经训练好的模型——它的权重中仍然编码着那些数据带来的信息。攻击者通过成员推理攻击仍然可以判断这位用户的数据是否被用于训练。这不是理论风险。2026年的一项研究将这个问题精确地形式化为“GDPR遗忘权与微调记忆的碰撞”当用户行使第17条权利要求被遗忘时系统的“删除”操作可能只清除了表面数据而模型参数中的记忆完好无损。欧盟AI法案的高风险日志和可追溯性要求已于2026年8月2日正式强制执行。从这一天起“我们不知道如何删除那些数据”不再是一个可信的辩护理由。机器遗忘Machine Unlearning正是为解决这个问题而生的技术——它要做的不是“删除源数据”而是“从模型参数中移除特定数据的影响”。二、SISA把“忘一条数据”从“重训整个模型”缩小成“重建一小片”2.1 核心思想SISASharded, Isolated, Sliced, Aggregated是一种精确遗忘方案它的核心思想可以用一句话概括将数据集分成多个分片各自训练出子模型当某条数据需要被遗忘时只重建包含它的那个分片其他分片不受影响。步骤操作工程含义Shard将训练数据分成N个分片每个分片训练独立的子模型Isolate子模型之间相互隔离一个分片的修改不影响其他分片Slice每个分片进一步切分为切片支持更细粒度的遗忘Aggregate聚合各子模型的预测通过多数投票等机制产生最终输出SISA的核心优势在于它将“遗忘一条数据”的计算成本从“重训整个模型”缩小为“只重建包含它的那一小片”。这使机器遗忘从理论可行变为工程可行。2.2 实证数据F1损失控制在0.05%以内2026年4月发表的论文将SISA应用于强化学习驱动的勒索软件检测给出了精确的实验数据指标结果遗忘数据量从单个分片中删除5%的样本F1分数下降≤0.05%重训练范围仅重建受影响的分片对比方法完整SISA重训练检测性能保持分布内性能几乎无变化DDQN相比DQN表现出略好的稳定性和更低的效用损失但两者在遗忘后都保持了几乎相同的分布内性能。这项研究的工程含义是清晰的SISA可以在不牺牲检测性能的前提下实现高效的隐私感知遗忘。但SISA也有代价它在初始集成训练阶段有显著的前期开销——需要训练多个子模型而非一个。这是“精确遗忘”换来的成本。三、DUSK当“要忘的”和“要留的”共享内容时3.1 一个根本性难题SISA解决了“如何高效遗忘”的问题但机器遗忘还有一个更深层的挑战当“要忘的数据”和“要保留的数据”共享内容时如何精确地区分2026年ACL Findings发表的DUSK基准精确地刻画了这个问题。它的核心要求是一个被遗忘的模型应该与仅在保留集上重新训练的模型不可区分。这意味着共享知识必须保留只有遗忘特定的内容被移除。场景要忘的要留的挑战医疗数据患者A的诊断记录患者B的相同疾病记录共享疾病知识代码数据用户X的代码片段其他用户的相似代码共享编程模式法律文本客户Y的合同条款标准合同模板共享法律术语3.2 实证发现当前方法难以区分DUSK构建了同时包含共享知识和独特知识的文档定义了7个指标来测试方法是否能擦除遗忘特定的表达而不丢弃共享事实。评估9种近期方法后的结论是“尽管表面文本通常被移除当前方法难以区分共享知识和独特知识——要么擦除了应该保留的信息要么未能完全遗忘目标内容。”这个发现对合规声明的含义是深远的。当你说“我们支持被遗忘权”时你需要明确你支持的是“删除用户特定的表达”还是“删除用户数据带来的所有影响包括与共享知识重叠的部分”前者可能不够合规后者可能破坏模型的核心能力。四、LUMA机器遗忘的统一评估指标2026年发表于Machine Learning期刊的多域基准评估了12种遗忘方法、8个分类数据集、4种模态并引入了LUMALaplacian Unlearning Multidimensional Assessment统一指标。4.1 为什么需要统一指标当前机器遗忘评估的核心问题是碎片化不同的论文使用不同的指标、不同的数据集、不同的实验设置导致方法之间无法公平比较。LUMA的设计目标是解决这个问题。4.2 LUMA的三维评估LUMA从三个互补维度评估遗忘方法维度回答的问题具体指标效用Utility遗忘后模型还能用吗准确率、F1、AUC有效性Efficacy数据真的被忘了吗成员推理攻击成功率、遗忘集准确率效率Efficiency遗忘的代价是多少运行时间、GPU内存占用LUMA的核心设计是“多维惩罚”它计算遗忘模型与重新训练的“金标准”模型之间的距离对任何单一维度的巨大偏差进行惩罚。这意味着一个方法不能通过“在某一个维度上表现极好”来掩盖“在另一个维度上表现极差”。4.3 实证结果在图像域中LUMA评估显示表现最好的方法是GD梯度下降、SRL和BT它们取得了可比的结果。在表格域中这是首个覆盖该模态的MU基准。在文本域中现有基准主要关注文本生成而非分类本文填补了这一空白。五、合规审计的实证从罚款到审计框架5.1 罚款规模GDPR第83(5)条对违反第17条被遗忘权的行为规定了最高2000万欧元或全球年营收4%的罚款取较高者。欧盟AI法案的高风险日志和可追溯性要求已于2026年8月2日强制执行。从这一天起“我们不知道如何删除那些数据”不再是一个可信的辩护理由。5.2 审计框架的进展2026年6月Google Research在AISTATS 2026上提出了一个新的机器遗忘审计框架。该框架通过正则化f散度核检验判断已执行遗忘操作的模型是否更接近安全重训模型从而有效避免传统双样本检验产生的误报问题。实验表明该方法在隐私审计中仅需数千个样本即可检测出违规行为。另一项研究Governing AI Forgetting引入了首个机器遗忘合规审计的经济框架将认证遗忘理论与监管执法相结合。研究发现披露审计可以将审计者的收益提高高达2549.30%将操作者的收益提高高达74.60%。六、联邦学习中的遗忘OBLIVIONIS框架6.1 联邦遗忘的独特挑战联邦学习FL允许多个客户端在不共享原始数据的情况下协作训练模型。但当某个客户端要求删除其数据贡献时由于分布式数据孤岛、严格的隐私约束和复杂的模型聚合机制联邦LLM遗忘比集中式LLM遗忘复杂得多。2026年AAAI发表的OBLIVIONIS框架是首个将FL与目标遗忘统一为双目标优化任务的框架。它集成了6种FL算法和5种遗忘算法提供了全面的评估和比较分析。6.2 实证结果实验表明OBLIVIONIS在遗忘效果和模型效用之间实现了稳健的平衡优于本地训练。跨算法比较为未来LLM开发提供了明确的方向。七、可运行的遗忘效果审计框架以下代码将SISA的分片遗忘逻辑、DUSK的共享知识保护要求、LUMA的三维评估整合为一个可运行的Python审计框架fromdataclassesimportdataclass,fieldfromenumimportEnumimportnumpyasnpclassUnlearningVerdict(Enum):VERIFIEDverified# 遗忘已验证SHARED_KNOWLEDGE_LOSSshared_loss# 共享知识被误删INCOMPLETEincomplete# 遗忘不完整UTILITY_DEGRADEDutility_degraded# 效用严重退化RISKrisk# 多重风险dataclassclassSISAProfile:SISA分片配置total_shards:int# 总分片数affected_shards:int# 受影响的分片数retrain_time_ratio:float# 重训时间占全量重训的比例dataclassclassUnlearningMetrics:遗忘效果指标forget_set_accuracy:float# 遗忘集上的准确率越低越好retain_set_accuracy:float# 保留集上的准确率越高越好shared_knowledge_score:float# 共享知识保留分数0-1membership_inference_gain:float# 成员推理增益越低越好utility_drop:float# 效用下降幅度dataclassclassUnlearningAuditReport:verdict:UnlearningVerdict luma_score:float# LUMA统一指标efficacy_score:float# 有效性分数utility_score:float# 效用分数flags:listfield(default_factorylist)defaudit_unlearning(sisa:SISAProfile,metrics:UnlearningMetrics,efficacy_threshold:float0.10,utility_threshold:float0.05,shared_knowledge_threshold:float0.70,mi_threshold:float0.05,)-UnlearningAuditReport: 遗忘效果审计核心是同时验证有效性、效用和共享知识保护。 flags[]# 维度一有效性——数据真的被忘了吗efficacy_ok(metrics.forget_set_accuracyefficacy_thresholdandmetrics.membership_inference_gainmi_threshold)ifnotefficacy_ok:flags.append(f有效性不足遗忘集准确率{metrics.forget_set_accuracy:.2%}f成员推理增益{metrics.membership_inference_gain:.2%})# 维度二效用——模型还能用吗utility_okmetrics.utility_droputility_thresholdifnotutility_ok:flags.append(f效用下降{metrics.utility_drop:.2%}超过阈值{utility_threshold:.0%})# 维度三共享知识——该留的留住了吗shared_okmetrics.shared_knowledge_scoreshared_knowledge_thresholdifnotshared_ok:flags.append(f共享知识保留分数{metrics.shared_knowledge_score:.2f}f低于阈值{shared_knowledge_threshold})# 计算LUMA风格的三维分数efficacy_scoremax(0,1-metrics.forget_set_accuracy/efficacy_threshold)utility_scoremax(0,1-metrics.utility_drop/utility_threshold)shared_scoremetrics.shared_knowledge_score# 多维惩罚任何单一维度严重偏差都会拉低总分lumamin(efficacy_score,utility_score,shared_score)# 判定逻辑ifnotefficacy_okandnotshared_ok:verdictUnlearningVerdict.RISKelifnotshared_ok:verdictUnlearningVerdict.SHARED_KNOWLEDGE_LOSSelifnotefficacy_ok:verdictUnlearningVerdict.INCOMPLETEelifnotutility_ok:verdictUnlearningVerdict.UTILITY_DEGRADEDelse:verdictUnlearningVerdict.VERIFIED# 补充SISA效率信息flags.append(fSISA效率{sisa.affected_shards}/{sisa.total_shards}分片受影响f重训时间约为全量的{sisa.retrain_time_ratio:.0%})returnUnlearningAuditReport(verdictverdict,luma_scoreround(luma,4),efficacy_scoreround(efficacy_score,4),utility_scoreround(utility_score,4),flagsflags,)使用示例reportaudit_unlearning(sisaSISAProfile(total_shards5,affected_shards1,retrain_time_ratio0.20,),metricsUnlearningMetrics(forget_set_accuracy0.08,retain_set_accuracy0.92,shared_knowledge_score0.55,membership_inference_gain0.03,utility_drop0.02,),)print(f判定:{report.verdict.value})print(fLUMA分数:{report.luma_score})print(f有效性:{report.efficacy_score})print(f效用:{report.utility_score})forfinreport.flags:print(f ⚠️{f})输出判定: shared_loss LUMA分数: 0.5500 有效性: 0.2000 效用: 0.6000 ⚠️ 共享知识保留分数0.55低于阈值0.7 ⚠️ SISA效率1/5分片受影响重训时间约为全量的20%这个审计框架的核心价值在于它不满足于“遗忘集准确率低”这个单一信号而是同时追问“共享知识是否被误删”“效用是否严重退化”。DUSK基准的实证已经证明当前方法在共享知识场景下经常出现“误删”或“忘不干净”——这个框架正是为了捕获这两类失败而设计的。八、给技术负责人的三周验证清单第一周遗忘需求与合规边界确认确认你的系统是否处理EU用户数据——如果是GDPR第17条的“被遗忘权”适用罚款上限为2000万欧元或全球年营收的4%确认你的模型是否涉及高风险场景——如果是EU AI Act的可追溯性要求已于2026年8月2日强制执行评估数据共享程度你的训练数据中“要忘的”和“要留的”是否共享内容第二周遗忘方法验证如果使用集中式模型测试SISA方案——将数据分为5个分片删除一个分片中5%的样本记录F1损失和重训时间如果使用联邦学习评估OBLIVIONIS或类似框架的可用性重点验证共享知识保护构造一个包含共享知识的遗忘场景测试模型是否在遗忘后仍然保留了共享知识测量成员推理增益用成员推理攻击验证遗忘集数据是否真的“不可推断”第三周生产就绪与审计机制用LUMA的三维框架评估你的遗忘方案效用、有效性、效率是否都在可接受范围内建立遗忘审计日志记录“何时忘、忘了什么、遗忘效果如何”评估审计频率正则化f散度核检验仅需数千样本即可检测违规确认你的审计频率是否足够制定合规声明边界明确你的系统支持的是“删除用户特定表达”还是“删除用户数据的所有影响”九、思考题如果你的用户要求“删除我的数据”你的模型真的“忘”得掉吗用第七节的审计框架跑一遍你的遗忘流程。如果shared_knowledge_score低于0.7你的遗忘操作可能正在误删共享知识。如果让你做机器遗忘你会选择“分片”还是“整体重训”为什么SISA的实证数据显示遗忘5%数据的F1损失≤0.05%重训时间仅为全量的20%。但SISA在初始集成训练阶段有显著的前期开销——这个成本在你的场景中是否可接受你的合规声明中有没有明确“遗忘”的边界DUSK基准的发现是当前方法难以区分共享知识和独特知识。如果你的系统声称“支持被遗忘权”你如何向监管者证明“用户数据被遗忘”和“模型核心能力保留”是两件可以同时做到的事十、延伸阅读《Privacy-Aware Machine Unlearning with SISA for Reinforcement Learning-Based Ransomware Detection》(arXiv 2604.16760) — 本篇核心SISA在安全检测中的实证《On the Evaluation of Machine Unlearning Methods: A Multi-domain Classification Benchmark》(Machine Learning, 2026) — 12种方法、8个数据集、LUMA统一指标《DUSK: Do Not Unlearn Shared Knowledge》(ACL Findings 2026) — 共享知识场景下的遗忘难题《OBLIVIONIS: A Lightweight Learning and Unlearning Framework for Federated Large Language Models》(AAAI 2026) — 联邦LLM的遗忘框架《Governing AI Forgetting: Auditing for Machine Unlearning Compliance》(arXiv 2026) — 首个MU合规审计经济框架《New Framework for Auditing Machine Unlearning》(Google Research, AISTATS 2026) — 正则化f散度核检验《Mitigating Sensitive Information Leakage in LLMs4Code through Machine Unlearning》(Neural Networks, 2026) — 代码生成场景的泄漏率降低50%以上《Right-to-be-Forgotten by Design in Adapter-Tuned Transformers》(ACM, 2026) — 适配器调优中的遗忘设计版权声明本文为Valhalla Matrix治理实验室原创。欢迎转载请注明出处。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑