资讯动态

图宾根大学团队用数学方法给神经网络做了一次拓扑体检

发布时间:2026/8/14 2:18:29 来源:尧图企业网站定制
这项由德国图宾根大学医学数据隐私与隐私保护机器学习实验室MDPPML及生物信息学与医学信息学研究所IBMI联合开展的研究以预印本形式发布于2026年5月论文编号为arXiv:2605.06380感兴趣的读者可通过该编号在arXiv平台检索完整论文。一、神经网络分类器的地图长什么样当一个图像识别AI看到一张照片时它会做出判断这是猫、这是汽车、这是香蕉。但在AI的内部世界里这个判断过程是怎么发生的有一种理解方式是把AI想象成一个超级复杂的地图绘制者它把所有可能的图像分成了若干块区域每块区域贴上一个标签——比如猫区、汽车区。只要一张图片落在猫区里AI就会说这是猫。这些区域在数学上叫做决策区域。问题是这些区域的形状是什么样的它们是整块的还是碎片化的是不是存在奇怪的洞过去的研究已经确认同一类别的图像区域通常是连通的也就是说从同类的图像A到图像B存在一条路径可以一直保持在同一类别区域内行走不会突然跳到别的类别去。但这项新研究想问一个更深的问题这些区域里有没有洞用地图来打比方一块普通的大陆是完整的没有洞。但如果这块大陆的中间有一个湖从地图上看就像一个洞——你可以围着湖走一圈这个圆圈无法被压缩成一个点因为中间有湖挡着。数学上能够把任何圆圈都压缩成一个点的区域叫做单连通区域而有洞的区域就不是单连通的。这项研究就是要弄清楚深度学习图像分类器的决策区域是否是单连通的。二、从路到面研究问题升级了以前的研究验证的是连通性——能不能从A走到B。这就好比检查地图上两个城市之间有没有路。而这项研究验证的是单连通性——能不能把一个圆圈收缩成一个点。这就好比检查地图上有没有湖泊或孤岛使得某些路线围不拢、收不回来。从数学角度说这是从一维问题升级到了二维问题。路是一维的而能把圆圈填满的面是二维的。研究团队的核心想法是如果我在决策区域里画一个封闭的圆圈能不能在圆圈内部填满一个膜而这个膜也完全在同一决策区域内如果能就说明这个圆圈可以被收缩区域具有单连通性。为了实际操作这个检验研究团队不是在纸上画圈而是选取四张被同一个AI分类为同一类别的图像把它们当作圆圈的四个角然后尝试用图像空间里的一个面来填满这四个角围成的框。如果这个面里的每一个点都被AI分类为同一类别那就说明这个圆圈可以被填满即可以被收缩。三、研究用到了哪些数学工具要理解研究团队的方法先得明白图像在计算机里是什么。一张普通的彩色图像在计算机里是一个由数字组成的大矩阵每个像素有红绿蓝三个数值。所以图像可以被看作一个超高维空间里的一个点——维度等于像素数乘以3。对于常见的224×224像素图像来说这个空间的维度高达约15万。研究就在这个超高维空间里进行。研究团队引入了一个叫做Coons曲面片的经典几何工具。Coons曲面片源自计算机辅助设计领域是1967年提出的一种数学方法给定四条边界曲线它能自动生成一个自然平滑地填充在这四条边界之内的曲面。就像给你四根弯曲的铁丝围成一个框Coons方法能帮你找到一块最自然的布来蒙在这个框上。研究团队先构建Coons曲面作为参考然后用自己的方法生成一个保标签曲面即所有点都被分类为同一标签的曲面最后比较这两个曲面有多相似。如果自己生成的曲面和Coons参考曲面面积接近、形状相近就说明决策区域不仅能被填满而且填法还很自然不需要绕很大的弯。研究还引入了一个叫做灰度均方根距离的度量单位用来衡量图像之间的差异。简单说如果两张图像的距离为1个灰度单位意思是平均每个像素差了大约一个灰度级别——对人眼来说几乎看不出差别。这个度量让研究团队能以一个直观的尺度来判断曲面的精细程度。四、具体怎么操作补丁游戏研究团队设计了一套逐步细化的四边形网格填充程序。可以把这个过程理解为用越来越小的瓷砖来铺一块地。第一步选取四张图像作为角点这四张图像已经被确认属于同一类别。然后沿着四条边生成路径每条边是两个角点图像之间的一条连续路径路径上所有的图像也都属于同一类别。如果直线路径上有图像被分错了类就用一种叫做DeepFool的工具把它拉回来——DeepFool是一种能找到最近的分类边界的算法这里被反过来用把跑出去的点拉回正确区域。第二步在这四条边围成的框里先试着铺一块大瓷砖也就是一个粗糙的曲面。在这块大瓷砖上均匀取一些点逐个检查它们的分类标签。如果所有点都属于正确类别这块瓷砖就被接受了。如果有点跑出了决策区域就把这块大瓷砖切成四块小瓷砖分别检查如果还有问题就继续切直到所有瓷砖都通过检验或者瓷砖小到已经超过了研究设定的精度阈值0.5个灰度单位。每当切割产生新的顶点时这个新顶点也要接受分类检验。如果它被分错了就用DeepFool把它拉回正确区域。整个过程结束后所有被接受的小瓷砖拼在一起就构成了一个完整的保标签曲面。这个方法有一个很聪明的设计采用了二进制网格结构也就是每次切割都把边长减半产生的顶点坐标都是2的幂次分之一。这样新生成的顶点自然地落在已有网格的格点上不会产生不对齐的问题整个曲面能保持连续和一致。五、六种主流AI、六千个测试结果如何研究团队在ImageNet数据集一个包含约128万张图像、1000个类别的大型图像数据库上进行了实验测试了六种代表性的图像分类模型。这六种模型几乎覆盖了当前主流的神经网络架构类型。ResNet-50是一种通过残差连接解决深层网络训练难题的经典卷积网络已在学术界和工业界广泛使用。DenseNet-121则是一种让每一层都与后续所有层直接相连的密集连接网络信息流动极其充分。EfficientNet-B0是谷歌通过系统性缩放宽度、深度和分辨率来提升效率的紧凑型网络。ConvNeXt-Tiny是借鉴了Transformer设计思想的现代卷积网络。ViT-B/16是把图像切成16×16像素小块、用纯Transformer架构处理的视觉Transformer。Swin-T是采用分层滑动窗口设计的层次化视觉Transformer。对于每个模型研究团队构建了1000个测试圆圈每个圆圈对应ImageNet的一个类别共6000个圆圈、24000张图像。每个圆圈由四张被该模型正确分类为同一类别的图像作为角点构成然后运行填充程序看能不能成功构建保标签曲面。结果相当一致所有6000个测试圆圈都被成功填充成功率100%。在第一轮测试中使用默认的修复参数最多50次DeepFool迭代绝大多数圆圈直接成功。其中ResNet-50有999个成功、1个失败DenseNet-121有975个成功、25个失败EfficientNet-B0、ConvNeXt-Tiny、ViT-B/16、Swin-T分别有990、992、993、990个成功。对于第一轮失败的案例研究团队用了更强的修复参数最多200次迭代、调整后的超冲值和二分步骤重新运行全部成功。六、表面之下更多有趣的细节研究团队不只是记录成功或失败还做了大量诊断性分析。首先是根级诊断在运行任何切割或修复之前先直接测试最简单的曲面——把四个角点直接做双线性插值看看这个粗糙曲面是否已经整体落在决策区域内。结果发现只有少数圆圈通过了这个最简单的测试ResNet-50为15.9%DenseNet-121仅6.9%EfficientNet-B0为8.5%而ConvNeXt-Tiny、ViT-B/16、Swin-T分别为38.9%、28.4%、42.2%。这说明对于大多数测试案例决策区域并不是简单到可以用直接插值来填充的需要自适应的细化和修复过程。较新的模型ConvNeXt-Tiny、ViT-B/16、Swin-T之所以根级通过率更高可能是因为它们的决策区域在局部更宽广包含更多余量。其次是覆盖深度分析研究团队追踪了每一轮切割后已接受区域的累积比例。对于非根级通过的圆圈大多数在前几轮切割后就覆盖了大部分面积随后逐渐趋近100%。研究还统计了达到50%、75%、90%、95%、99%覆盖率所需的切割轮数发现多数模型在3到5轮内就能覆盖大半困难区域只集中在少数需要细化到更深轮次的局部。第三是接受机制分解最终接受的小瓷砖有两种接受方式——要么直接通过网格点采样检验要么是因为太小了达到了灰度阈值而自动接受。对于卷积网络如ResNet-50、DenseNet-121、EfficientNet-B0直接通过网格检验的比例较低更多依赖细化到阈值以下自动接受对于较新的Transformer类模型ConvNeXt-Tiny、Swin-T直接通过网格检验的比例更高说明这些模型的决策区域在局部呈现出更平坦的特征。第四是与Coons参考曲面的比较对于每个成功填充的圆圈研究团队计算了自己构建的保标签曲面面积与Coons参考曲面面积的比值称为面积比ρ。如果ρ接近1说明保标签曲面和Coons参考曲面几乎一样大两者形状接近填充方式很自然。结果显示所有六个模型的面积比分布都集中在1附近中位数约在1.03到1.05之间说明构建出的曲面并不需要大幅偏离自然插值几何上保持了较好的规则性。七、网格有多复杂修复有多难研究团队还统计了最终生成的网格规模以及整个过程中需要修复的顶点数量和难度。从网格规模来看各模型差异较大。ResNet-50平均需要约15600个小瓷砖四边形和16600个顶点DenseNet-121最多平均约22900个四边形和24260个顶点EfficientNet-B0次之约20800个四边形而ConvNeXt-Tiny最少平均约5170个四边形和5506个顶点Swin-T更少约4424个四边形和4821个顶点ViT-B/16居中约6734个四边形和7268个顶点。网格越复杂说明决策区域的边界在曲面附近越曲折需要更多细化才能保证整个曲面都在目标区域内。从修复难度来看整体上修复是频繁但容易的。以ResNet-50为例平均每个圆圈需要修复约11039个顶点但平均每次修复只需要约2.1次DeepFool迭代没有任何一次修复达到了迭代上限也没有失败。其他模型的情况类似平均迭代次数都在2到2.1之间最多的单次迭代数也不超过28次。这说明新引入的偏离目标区域的顶点通常都非常靠近目标决策区域只需轻微调整就能拉回来。从计算时间来看每个圆圈的处理时间差异较大。ResNet-50每个圆圈中位耗时约24.5分钟DenseNet-121约34.75分钟EfficientNet-B0约21.5分钟ConvNeXt-Tiny约13.5分钟ViT-B/16约31分钟Swin-T约14.3分钟。其中网格点采样检验是最耗时的环节约占总时间的一半到三分之二切割和修复是次要耗时来源。八、精度阈值更严格时结论还成立吗一个合理的质疑是研究设定的精度阈值0.5个灰度单位是不是太宽松了如果把阈值调得更严格结果会不会不同研究团队专门做了消融实验在ResNet-50的100个随机圆圈上用0.5、0.25、0.125以及1.0作为对照四个灰度阈值分别测试。结果所有阈值下100%成功没有任何失败。随着阈值收紧最终网格更复杂从约2951个四边形增加到约25931个四边形最大切割深度从7增加到10但面积比的中位数始终保持在约1.03到1.05之间说明曲面的几何形状没有因为精度要求提高而变得更扭曲。这表明研究的结论对精度要求的变化具有稳健性。九、这些发现意味着什么说到底这项研究想说的是现代图像分类AI的分类地图不只是连通的而且是没有洞的。当然研究团队非常诚实地指出这是有限精度下的实证证据不是严格的数学证明。他们只能说在所测试的分辨率下在所测试的6000个圆圈中没有发现任何无法填充的情况。更小尺度的洞或者超出测试范围的非收缩圆圈理论上仍然可能存在。但这个发现本身已经很有意思。它给了我们一个新的视角来理解AI的鲁棒性问题。过去人们发现AI很容易被微小的扰动愚弄——把一张图像改动几个像素AI就可能把猫认成汽车。这让人担心AI的决策区域是碎片化的、脆弱的。而这项研究表明即便存在这种局部的脆弱性决策区域在全局上仍然可能是拓扑上连贯的、没有洞的大结构。这就像一块看似凸凹不平的大陆虽然表面崎岖但总体上没有被湖泊贯穿成环状。对于未来的研究这项工作打开了几个新方向。研究团队提出可以开发更严格的数学认证方法不只是在采样点上验证而是在采样点之间的连续区域也给出保证。此外这种拓扑分析工具也可以用来理解为什么不同架构的AI对对抗攻击的抵抗程度不同——拓扑结构越简单、越完整的决策区域或许意味着更好的鲁棒性。归根结底这项研究做的事情有点像用卫星给一片陌生大陆拍照证明它不像人们担心的那样布满了湖泊和孤岛。这不是终点而是我们开始真正理解AI内部世界的一个新起点。有兴趣深入研究的读者可以通过arXiv编号2605.06380查询完整论文原始代码也已公开于GitHub平台搜索mdppml/contractible-class-regions即可找到。QAQ1什么是决策区域的单连通性为什么它对理解图像分类AI很重要A单连通性是一个拓扑学概念简单说就是一个区域内没有洞——任何画在区域内的封闭圆圈都能缩成一个点而不越界。对图像分类AI来说如果决策区域是单连通的意味着同一类别的图像在AI的内部世界里形成一个结构完整、没有被贯穿的大块区域这有助于理解AI为何在全局上稳定尽管局部可能存在被对抗攻击欺骗的脆弱点。Q2DeepFool在这个研究里是怎么被用到的ADeepFool本来是一种用来生成对抗样本的工具能找到让AI分类出错所需的最小扰动方向。在这项研究里研究团队把它反过来用当网格中某个新生成的顶点被AI分错了类别时DeepFool帮助找到把这个点拉回目标决策区域所需的最小调整方向然后再通过二分搜索精确定位到区域内部从而修复偏离的顶点。Q3Coons曲面片在这项研究里起什么作用ACoons曲面片是一种经典的几何工具能根据四条边界曲线自动生成一个自然填充的曲面就像用四根弯铁丝框架蒙上一块最平滑的布。在这项研究里Coons曲面被用作几何参考基准研究团队先构建Coons曲面再构建自己的保标签曲面然后比较两者的面积比。如果比值接近1说明保标签曲面和Coons参考曲面形状相近即填充方式很自然不需要大幅绕弯从而证明决策区域的形状是相对规则的。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价