资讯动态

图像篡改定位:ForMa论文解读与简单复现:翻译+代码跑通(Vision Mamba)

发布时间:2026/9/28 23:04:08 来源:尧图企业网站定制
1.导语本文将以通俗易懂的语言解读图像篡改定位论文《A Lightweight and Effective Image Tampering Localization Network with Vision Mamba》并结合图表解释核心方法与设计动机。在复现部分受限于硬件条件我将在作者开源代码基础上对数据规模与训练设置做适度简化重点进行环境搭建和实验流程验证而非完全复现论文的全部指标。论文可以在https://arxiv.org/abs/2502.09941v1位置查看原文和源码部分内容仅供学习参考若侵犯您的合法权益请私信我我将第一时间删除。2.论文部分理解摘要目前的图像篡改定位方法主要依赖于卷积神经网络CNNs和Transformer。卷积神经网络存在局部感受野有限的问题而Transformer虽然能够进行全局上下文建模但计算复杂度呈二次方增长。最近状态空间模型Mamba作为一种有竞争力的替代方案出现能够以线性复杂度实现全局依赖建模。受此启发论文作者提出了一种基于视觉MambaForMa的轻量级高效的取证网络用于盲图像篡改定位。首先ForMa捕获多尺度全局特征通过线性复杂度实现高效的全局依赖建模。然后通过一个轻量级解码器生成像素级定位图该解码器采用无参数的 pixel shuffle 层注pixel shuffle 可理解为“通道到空间的重排”用重排实现放大分辨率额外参数开销很小进行上采样。此外论文作者提出了一种噪声辅助解码策略以整合来自篡改图像的互补操纵痕迹从而提高解码器对伪造线索的敏感性。在10个标准数据集上的实验结果表明ForMa 在保持最低计算复杂度的同时实现了最先进SOTA的泛化能力和鲁棒性。pixel shuffle是一种上采样方法输入特征图[C*r^2, H, W]Pixel Shuffle 后[C, H*r, W*r]也就是将通道数减少r^2倍同时高和宽各放大r倍简单例子放大 2 倍r2原来[64, 128, 128]先卷积得到[64*4, 128, 128] [256, 128, 128]Pixel Shuffle 后[64, 256, 256]上采样是“可学习的”通常先用卷积生成C*r^2通道再 shuffle论文关键词图像取证、图像篡改定位、状态空间模型、视觉 Mamba、大量实验评估引言随着图像编辑工具与技术的发展普通用户无需大量专业知识也能轻松篡改图片。如果这些技术被恶意使用这类技术会对社会稳定与和谐构成威胁。这也给图像伪造定位任务带来了挑战该任务的目标是在伪造图像中找出具体被篡改的区域。近年来人们提出了多种基于深度学习的方法用于实现图像伪造定位。早期方法主要基于 CNN 架构例如 MVSS-Net、CAT-Net、PSCC-Net 和 HiFi-Net。随后带注意力机制的 Transformer 架构成为很有前景的方向例如 EITLNet、TruFor 和 IML-ViT。任务需求从“局部纹理检测”走向“局部全局一致性建模”。早期依赖CNN原因伪造痕迹很多是局部异常边缘拼接、纹理不连续、压缩噪声差异CNN 的卷积天然擅长局部特征提取参数效率高、训练稳定、数据需求相对小在之前的数据规模和算力条件下CNN 性价比最高之后CNN 的瓶颈逐渐显现感受野虽然能靠堆层增大但建模远距离依赖不够直接对“跨区域关系”表达弱比如图像不同区域之间的语义/光照/结构一致性面对复杂篡改高级融合、风格迁移、扩散生成时单纯局部线索不够转向 Transformer 的原因Self-Attention 能直接做全局建模捕捉长程依赖更擅长发现“整体不协调”与跨区域不一致语义、上下文、结构在大数据大算力条件下Transformer 潜力更容易释放但不是“CNN 被淘汰”Transformer 训练更重、对数据更敏感小数据下未必稳赢现在主流往往是 CNN Transformer 混合CNN 抓细粒度局部噪声/边缘痕迹Transformer 抓全局一致性与上下文关系这也是很多图像取证模型演进的主线CNN 先赢在“局部特征高效可靠”Transformer 后来赢在“全局关系建模能力”最终趋势是融合两者如下图基于 CNN 的方法通常定位精度低、泛化能力差F1 分数范围在 14.4% 至 37.6% 之间。由于注意力机制能够捕捉全局信息基于 Transformer 的方法 F1 分数可达 40.1% 至 59.8%显著高于 CNN 方法。然而这种性能提升是以参数和计算量增大为代价的。其中图中的sparseViT也是基于transformer架构如上图在10个标准基准数据集上平均F1分数与FLOPs基于512×512输入尺寸计算及模型参数的对比。论文作者的方法在FLOPs42G和参数量37M最低的情况下实现了最佳F1分数64.1%。注1.F1(64.1%):定位准不准篡改定位一般会输出一张mask(哪里被修改过)F1综合了“找的全不全”和“有没有乱报“数值越高通常表示像素级定位越好2.FLOPS(42G)”算一次大概多贵“:FLOPs粗略表示模型做一次推理要做多少次浮点运算越大通常越慢越吃算力论文把它和输入尺寸512*512绑定是为了让不同方法可比同样分辨率下谁更省算力3.参数量37M”模型有多大“37M相当于3700万个可训练参数越大通常占显存/存储越多但绝不等于速度速度还看实现和算子论文作者提出 ForMa一种轻量且有效的图像篡改定位网络。得益于经典状态空间序列模型SSM的基础研究现代 SSM 架构如 Mamba不仅能够以强特征表示能力建立长程依赖而且其计算复杂度相对输入尺寸呈线性增长。我们使用 VMamba 作为 ForMa 的骨干网络backbone来提取多尺度特征。ForMa 还包含一个仅由线性层构成的轻量解码器并利用 pixel shuffle(像素重排) 操作进一步降低计算成本。此外我们集成了噪声辅助解码策略用于提取辅助取证特征从而增强方法对篡改区域的精确定位能力。与现有最先进的 CNN 与 Transformer 方法相比ForMa 在获得更强定位精度的同时还显著降低了参数量与计算复杂度。本文其余部分组织如下第二节介绍所提出的ForMa方案第三节展开广泛的实验与讨论第四节得出结论第二节:提出的方法a所提出的ForMa的架构。Li​{2,2,9,2}。Linear、DWConv.和Shuffle分别指线性层、深度卷积层和像素重排层。⊕表示逐元素相加。bVSS Block的结构。它包含一个深度卷积层DWConv、SiLU激活函数、SS2D模块和线性归一化LN。VSS Block、基于Shuffle的解码器和噪声提取器是可学习的。如上图所示所提出的 ForMa 架构包含三项关键设计1用视觉状态空间VSS编码器替代常规的 CNN/Transformer 骨干2带有基于 pixel shuffle 上采样的新型轻量解码器3噪声辅助解码策略。给定输入 RGB 图像 X尺寸为 H×W×3ForMa 通过 VSS 块对其进行处理得到层次化特征图 Fᵢi 1, 2, 3, 4其空间分辨率逐级变为 H/2^{i1} × W/2^{i1}每往后一层宽高再减半通道数为 Cᵢ从而借助状态空间建模捕获多尺度上下文信息。与以往工作中计算代价较高的解码器设计不同本文通过 pixel shuffle 实现高效上采样该操作通过通道重排逐步恢复空间细节在参数量与细节保留之间取得较好平衡。同时噪声特征提取器融合来自 Noiseprint、SRM 与 Bayar 卷积等的噪声残差特征以增强解码器对篡改线索的敏感性。所提出 ForMa 的整体结构示意图说明a网络整体流程输入为篡改图像 X。图像依次经过四组 VSS Block视觉状态空间块各阶段重复次数记为 L₁、L₂、L₃、L₄形成层次化的多尺度特征图。与此同时并行支路从图像中提取并融合三类噪声特征这些特征主要是篡改痕迹让神经网络忽略图像内容只关注篡改痕迹Noiseprint、Bayar、SRM。多尺度编码特征与融合后的噪声特征一并送入基于 Shuffle 的解码器含线性层与 Shuffle / pixel shuffle 上采样最终输出预测掩码 PP 与真值掩码 Y 通过损失函数 ℒ(P, Y) 监督学习。Noiseprint一种基于深度学习的图像噪声指纹提取技术检测照片是否被PS过判断照片来源设备自监督学习利用对比学习自动分离噪声对复杂后期处理更鲁棒Bayar一种经典的底层技术方案一种约束卷积层及其配套的通用篡改检测网络特征工程SRM:一套专门用来剥离图像内容放大噪声与篡改痕迹的底层特征提取方法设计初衷用于对抗隐写术监督学习b单个 VSS Block 内部结构输入经层归一化LN后进入 SS2D 模块再与输入残差相加随后再经 LN、前馈网络 FFN线性 → SiLU → 深度卷积 DWConv → 线性再次残差相加输出。VSS阶段是在层次化编码里配合下采样让特征图逐步变小但语义更强pixel shuffle解码阶段将低分辨率特征重排到高分辨率逐步变大整体而言我们输入一张rgb图像在vss编码阶段逐步得到F1,F2,F3,F4,图片分辨率逐级变小。H/4 - H/8 - H/16 - H/32为什么变小原图太大直接全分辨率建模计算率很高先压缩能省算力还能聚合全局信息这个阶段是看全局的逻辑是否合理之后进入pixel shuffle上采样阶段将子像素信息重排到空间逐步将分辨率恢复上去。比如将H/32恢复到H/4或更高在效率和细节恢复之间折中之后还有个噪声提取器主要看相机噪声压缩痕迹滤波残留等取证线索如果发生图像篡改这些统计规律会被破坏将这些特征和解码器融合模型对伪造边界拼接痕迹更敏感A. 带 SS2D 模块的 VSS 编码器传统状态空间模型将一维输入序列 x(t) 经隐状态 h(t)维度 N映射为输出 y(t)由一组静态参数 Δ、A、B、C 控制。这类固定参数对多变序列的适应性有限。Mamba 引入选择性状态空间模型 S6以刻画与输入相关的动态。S6 可写为式子1其中 A横 是 N×N 矩阵满足 A横 f_A(Δ, A)B横 是 N×1满足 B横 f_B(Δ, A, B)C 是 1×N 矩阵f_A 与 f_B 分别为将 A、B 离散化为 A横、B横 的离散化函数。要将 S6 应用于图像篡改定位任务需将图像二维结构序列化。如上图图三 所示二维选择性扫描SS2D通过 Cross-scan交叉扫描先将输入 patch 沿四个方向展开为序列再分别用并行的 S6 系统处理最后经 Cross-merge交叉合并恢复空间维度。所提出的 ForMa 通过上述状态空间建模捕获多尺度上下文信息。步骤输入 patch 经 Cross-scan 沿四个不同方向展开为一维序列四路并行进入各自的 S6选择性扫描再经 Cross-merge 还原为二维空间排列得到输出 patch。B. 噪声辅助解码策略以往图像取证方法通常将噪声特征与 RGB 输入在早期融合后一并送入编码器进行联合处理。本文做法不同策略性地在解码阶段引入噪声特征作为辅助定位线索而非在编码器输入处做早期融合。该噪声辅助解码策略在保持编码器效率的同时提升了篡改定位精度其有效性在第三节 C 小节的消融实验中得到验证。考虑到单一噪声源难以适配多样的篡改类型本文将 SRM、Noiseprint 与 Bayar 卷积提取的取证特征作为互补的取证痕迹加以融合。具体而言三类取证特征在通道维拼接后经卷积块得到融合特征 F_mod空间分辨率为 H/4 × W/4 × C_mod。C. 轻量基于 Shuffle 的解码器ForMa 采用基于 shuffle 的解码器借助无参数上采样优化计算复杂度。首先编码器输出的多尺度特征图 Fᵢ 分别经线性层按扩展因子 rᵢ 做通道扩展rᵢ 表示特征图放大比例文中取 rᵢ [1, 2, 4, 8]可写为对每一个下标 i 成立式子2其中 Linear(输入通道数, 输出通道数)(·)即表示将输入通道维映射到输出通道维的线性层。C 96 指定嵌入张量的通道维数。接着引入 pixel shuffle像素重排 作为上采样层。与以往方法中常用的双线性插值不同pixel shuffle 不引入额外可学习参数通过把通道维“展开”为空间维来实现上采样从而进一步降低定位网络的计算复杂度。对式2得到的每个尺度的特征再施加 pixel shuffle像素重排),得到新的特征图空间维度为H/4 × W/4仍记为每个 i 对应一支尺度。随后将 四个尺度的与噪声提取器提取的特征的 F_mod 在通道维 拼接(Concat)再经线性层融合最后一个新的线性层被用于对融合后的特征执行像素级预测生成预测输出 P。可写为式子3第三节.实验A. 实验设置数据集与与CAT - Net TruFor IML - ViT 和SparseViT 一致一致ForMa 在 CATNet 训练集上训练。该训练集包含超过 80 万张伪造图像涵盖拼接、复制–移动、物体移除等多种篡改类型。为评估 泛化能力测试使用 10 个跨域数据集且训练集与测试集 无重叠。测试集包括CASIAv1、Columbia、NIST、DSO、Coverage、Korus、Wild、MISD、FF、CoCoGlide。实现细节网络用 ImageNet 上预训练的 VMambatiny 权重初始化。在 单块 A10040GB 上训练批量大小为 8所有图像缩放至 512×512 像素。学习率由 ReduceLROnPlateau 策略从 1e4 调度至 1e8。优化器采用 AdamW动量参数取 β₁ 0.9、β₂ 0.999。数据增强包括翻转、模糊、压缩与加噪等。评价指标与既有工作一致采用 F1 与 IoU 作为评价标准默认阈值为 0.5。样本不均衡与平均指标。 考虑到不同数据集的样本数量差异明显本文按既有文献中的做法平均计算 跨数据集F1 与IoU。损失函数。 与既有工作一致采用 DICE 损失 与 Focal 损失 组成的 组合损失。B. 与最先进方法的对比上表对 8 种 图像伪造定位前沿方法进行了定量对比。表中给出各测试集上的 F1%与 IoU%每个测试集名称旁括号内为 该集合图像张数每个测试集上的最优结果在原文表格中用红色标出。表 1 对 8 种 图像伪造定位前沿方法进行了定量对比。本文方法在 10 个数据集上按 F1 与 IoU 的平均表现 均为最优分别达到 64.1% 与 56.2%。与当前最强的 Transformer 类方法 TruFor 相比平均 F1 高出 4.3 个百分点平均 IoU 高出 4.9 个百分点与当前最强的 CNN 类方法 CAT-Net 相比平均 F1 高出 6.5 个百分点平均 IoU 高出 24.2 个百分点。上述优势体现了本文方法的优越性。在 FFDeepFake 与 CoCoGlide扩散模型生成 数据集上ForMa 的 F1 分别达到 81.9% 与 45.3%表明其具有较强的泛化能力。图 4 直观展示了篡改定位结果可以看出ForMa 的 误报更少对篡改区域的 漏检也更少。上图图4 来自 NIST、Korus 与 CASIAv1 数据集的示例结果。从左到右依次为篡改图像、真实标签ground truth、CAT - Net最佳的基于CNN的方法的定位结果、TruFor最佳的基于Transformer的方法的定位结果以及ForMa的定位结果。对图 4 的说明正文 可见 ForMa 的 误报更少对篡改区域的 漏检也更少。作者的方法与最先进SoTA模型的计算复杂度对比对于512×512的图像浮点运算次数FLOPs为42G对于1024×1024的图像FLOPs为70G这两项指标在现有方法中均为最低。此外论文提到的方法仅维持着3700万37M的低参数量级。总而言之作者所提出的ForMa不仅在定位精度上优于现有方法还在计算复杂度方面实现了显著降低。C.消融研究作者所提方案的消融分析。指标值为百分比形式。最佳结果以红色高亮显示。为评估各关键设计对定位精度的影响本文开展多项消融实验。如 表 3 所示同时使用 Focal 损失焦点损失与 DICE 损失 时在 CoCoGlide 上 F1 至少提升 9.3%、IoU 至少提升 7.4%验证了 组合损失 的优势。噪声提取器 在各数据集上均有增益在 FF 上 F1 最多提升约 16.1%、IoU 约 17%。Pixel shuffle 在 FF 上使 F1 提升 9.0%、IoU 提升 10.5%在 Korus 上 F1 提升 3.5%、IoU 提升 2.3%。将噪声特征 放在解码过程 中融合而非与 RGB 在编码端早期融合可在 Korus 上带来 6.7% 的 F1 提升并将 FLOPs 降低 192G。总体而言上述结果说明 ForMa 各组成部分均有效。D.鲁棒性评估鲁棒性性能针对在线社交网络OSNs后处理的F1[%]和IoU[%]后处理包含FacebookFB、微信WC、微博WB和WhatsAppWA首先评估模型对 在线社交网络OSN 后处理如 Facebook、微博、微信、WhatsApp 等平台带来的压缩与重编码等即后处理影响Post-processing effects​的鲁棒性。如 表 4 所示即便在较强后处理后ForMa 仍保持优势。以 Facebook 为例本文 F1 为 70.3%高于 TruFor 的 67.3% 与 CAT-Net 的 63.3%。此外本文方法在不同平台后处理场景下表现 相对稳定。在 NIST 数据集上本文在各平台上 稳定优于 TruFor。例如在 微博 上本文 F1 为 44.8%TruFor 为 33.2%。参照既有工作还在 Columbia 上评估了对 JPEG 压缩、高斯模糊、高斯噪声 与 缩放 等后处理的鲁棒性。如 下图所示ForMa 始终表现最好验证了方案对上述后处理操纵的 高鲁棒性。图 5 图注译文 在 Columbia 数据集上针对不同图像后处理技术的 鲁棒性评估。图 5 中曲线说明四幅折线图横轴为退化强度1JPEG 压缩质量本文红线在多数设置下 最高且更稳。2高斯模糊核大小本文保持较高CAT-Net绿线在轻微模糊后即 急剧下降。3高斯噪声强度本文仍较高CAT-Net 迅速趋近 0TruFor蓝线呈 逐步下降。4缩放因子三者相对平稳本文 整体最高。第四节结论在本文letter中论文作者提出了一种轻量级的图像篡改定位方法 ForMa它由视觉 Mamba 编码器、噪声辅助解码策略以及基于 Shuffle 的解码器组成。Mamba 结构能够在高效处理输入的同时自适应地捕获长程依赖辅助的篡改痕迹特征进一步提升了定位精度。解码器采用 pixel shuffle 操作以保持计算效率。实验结果表明ForMa 相比现有最先进的 CNN 与 Transformer 类方法具有更优性能。未来工作将聚焦于进一步提升模型的鲁棒性与泛化能力。实验部分复现实验代码部分论文作者在github上有提供首先个人采用的实验主要还是针对课堂设计偏向理论讲述对于实验部分只要可以出结果图即可针对代码部分我使用了CASIA version2数据集可以直接搜索常用图像篡改数据集配置了模型权重文件并用ai修改了输入输出形式如果测试使用的数据集过大会使耗费时间过长但我们的目的仅仅只是为了简单测试在配置好虚拟环境后python test.py即可进行

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑