从体素到像素再回来无标签数据如何改进 fMRI 自然图像重建论文From Voxels to Pixels and Back: Self-supervision in Natural-image Reconstruction from fMRI作者Roman Beliy, Guy Gaziv, Assaf Hoogi, Francesca Strappini, Tal Golan, Michal Irani会议NeurIPS 2019官方原文NeurIPS Proceedings先说结论这篇论文真正解决的不只是“怎样把 fMRI 变成一张更好看的图”而是脑解码里一个长期存在的数据结构问题配对的图像—fMRI 数据极少但不带 fMRI 的自然图像很多测试阶段又常常能拿到一批没有刺激标签的目标域 fMRI。能否把两类无标签数据都利用起来作者的答案是构造一对互逆网络编码器把图像映射到 fMRI解码器把 fMRI 重建为图像。先用少量配对数据训练编码器再固定编码器用“图像→fMRI→图像”和“fMRI→图像→fMRI”两个闭环训练解码器。实验表明在 fMRI on ImageNet 数据集上2-way 识别准确率从纯监督训练的 80.1% 提升到 85.3%在 vim-1 上达到 70.5%。但这项工作的边界也要说清楚它使用了无标签的测试 fMRI参与适配属于 transductive learning直推学习或 test-time/domain adaptation 的早期形式不是严格的“训练完成后面对任何新样本”的归纳式解码器而且测试 fMRI 是多次扫描后取平均重建质量不能直接等同于单次扫描表现。1. 研究问题脑图像重建到底缺什么数据自然图像重建希望从视觉刺激诱发的脑活动中恢复刺激内容。困难在于fMRI 采集昂贵、时间分辨率低、噪声大每个被试能得到的配对样本通常只有几千甚至更少。传统监督模型只能在这些配对样本上学习“脑活动→图像”容易过拟合也难覆盖自然图像的复杂分布。与此同时研究者其实拥有两座“没有标签的矿山”一座是海量自然图像它们没有对应的 fMRI另一座是测试阶段采集到的 fMRI它们的刺激图像在评估时不能使用但脑信号本身可以获得。论文的核心问题就是如何在不泄露测试图像标签的前提下把这两种数据变成训练信号来源原论文 Figure 1主论文 PDF 第 2 页仅作忠实裁剪未重绘或添加标注。Figure 1 给出了最简洁的答案。监督路径使用配对样本同时学习图像到 fMRI 的编码关系与 fMRI 到图像的解码关系无标签图像走“像素→体素→像素”的闭环无标签 fMRI 走“体素→像素→体素”的闭环。只要闭环输出接近输入就能产生监督信号。这里的关键不是普通的数据增强而是把编码模型当作一个可微分的脑响应约束器解码器生成的图像如果能再次诱导编码器预测出原始 fMRI说明这张图至少在模型所表达的视觉神经空间中与原刺激相容。2. 数据集和评估先看清数字代表什么论文在两个公开数据集上验证方法。fMRI on ImageNet训练集含 1,200 张不同图像每张图像对应一次 fMRI 记录测试集为 50 张图像每张重复记录 35 次。输入约为 4,500 个视觉皮层体素。vim-1训练集含 1,750 张灰度自然图像每张重复 2 次测试集含 120 张图像每张重复 13 次。作者按信噪比从约 50,000 个体素中选择约 8,500 个。图像统一处理为 112×112。额外的无标签图像来自 ImageNet 验证集共 50,000 张与 fMRI 数据集中的图像不重合。无标签 fMRI 则来自目标测试集合但训练时不使用相应的刺激图像。定量指标采用 n-way identification。对每个重建结果计算它与真实刺激及若干随机候选图像的像素 Pearson 相关系数真实刺激相关性最高就算识别正确。论文报告 n2、5、10 的准确率并给出 95% 置信区间。这个指标直观但偏好低频结构和颜色布局不能完整衡量语义是否正确因而必须结合整组视觉结果阅读。3. 方法两个网络、两个阶段、三个损失设编码器为 E负责 image→fMRI解码器为 D负责 fMRI→image。作者没有同时从零训练它们而是采用明确的两阶段流程。来源原论文 Figure 3主论文 PDF 第 5 页仅作忠实裁剪未重绘或添加标注。阶段一先学会预测脑活动编码器 E 只用配对数据训练。它以前馈的 AlexNet 低层特征为起点经过卷积模块和全连接层输出体素响应。fMRI 端的损失同时考虑欧氏距离与余弦距离权重参数 α 取 0.9。这样做兼顾预测幅度和响应方向也让编码器先成为相对稳定的“图像—脑空间”映射。阶段二固定编码器集中训练重建器作者随后冻结 E用三类损失联合训练 D配对监督损失 Lᴰ直接比较重建图像与真实图像包括像素 L1、VGG-19 前两层特征损失和总变分正则。无标签图像闭环 Lᴱᴰ自然图像先经 E 变为预测 fMRI再经 D 回到图像要求输出能重建输入。无标签 fMRI 闭环 Lᴰᴱ测试 fMRI 先经 D 生成图像再经 E 回到体素空间要求预测响应接近输入 fMRI。第二阶段每个 batch 中约 60% 为配对样本20% 为无标签图像20% 为无标签测试 fMRI。训练 150 个 epoch使用 Adam初始学习率 10⁻³每 30 个 epoch 衰减 80%。论文报告在单张 Tesla V100 上训练约 15 分钟推理可实时完成。网络规模以今天的标准并不大贡献主要来自训练信号的组织方式而不是模型容量。4. 核心结果闭环真的提供了有效信息吗4.1 加入无标签数据后重建结构更稳定来源原论文 Figure 2主论文 PDF 第 3 页仅作忠实裁剪未重绘或添加标注。Figure 2 中纯监督模型往往只留下模糊色块加入无标签数据后主体位置、轮廓和大尺度颜色布局通常更接近真实刺激。提升不是把图像“锐化”得更自然而是让重建与原刺激更一致。这一点很重要脑解码需要的是忠实性不是仅凭生成先验造出一张看起来合理的图片。只展示少数成功案例很容易造成误判因此补充材料给出了 fMRI on ImageNet 的完整 50 张测试图像。整体观感更克制一些样本能恢复对象的大致姿态与颜色另一些仍然非常模糊类别也未必可辨。来源官方补充材料 Figure 1补充材料 PDF 第 1 页仅作忠实裁剪未重绘或添加标注。这张全量图比主文精选结果更能说明 2019 年技术水平模型稳定恢复的是低频外观、主体区域和部分颜色信息还谈不上精确恢复物体细节。论文的进步是真实的但它仍处于“从脑信号还原可辨视觉线索”的阶段。4.2 消融实验拆出了两类无标签数据的贡献来源原论文 Figure 4主论文 PDF 第 8 页仅作忠实裁剪未重绘或添加标注。在 fMRI on ImageNet 的 2-way identification 上纯监督模型为80.1%加入无标签自然图像后提高到83.2%再加入无标签测试 fMRI 后达到85.3%。这说明两个闭环都提供了增益而且图像闭环的贡献略大。更值得关注的是最后一列作者从无标签训练集合中移除当前待重建的那一个目标 fMRI准确率降到84.1%。它仍高于纯监督基线说明模型确实学到了目标域的整体分布但 85.3% 与 84.1% 的差距也表明直接让目标样本参与自身的无标签闭环带来额外收益。因此最准确的描述不是“完全未知样本上的普通泛化”而是“允许访问目标域无标签样本的直推式适配”。4.3 重复扫描次数是隐藏在结果背后的关键变量来源官方补充材料 Figure 4补充材料 PDF 第 4 页仅作忠实裁剪未重绘或添加标注。补充实验把同一刺激的 fMRI 平均次数从 1 增加到 5、10、20、35。重建随平均次数增加明显变得稳定单次记录时噪声和伪影很重35 次平均后才能较可靠地呈现主体轮廓。主实验使用的正是高重复平均测试信号。因此这篇论文不能被解读为“单次、实时读脑已经能重建自然图像”。它证明的是在较高信噪比的测试表征上无标签闭环能够进一步适配解码器。若应用目标是临床沟通、自然观看或在线 BCI单试次性能仍是必须单独验证的问题。4.4 哪些体素更容易被编码模型约束来源官方补充材料 Figure 3补充材料 PDF 第 3 页仅作忠实裁剪未重绘或添加标注。散点图显示编码预测相关性与体素信噪比总体同向变化V1、V2 等早期视觉区出现更多高相关、高 SNR 体素。这个结果解释了闭环约束为什么主要帮助恢复低层结构编码器最可靠地表示的是早期视觉信息而不是高层语义。D→E 的一致性只能约束 E 能准确建模的部分无法凭空恢复编码模型没学到的语义。4.5 方法是否依赖精细调参来源官方补充材料 Figure 5补充材料 PDF 第 5 页仅作忠实裁剪未重绘或添加标注。作者改变无标签/有标签样本比例并分别将图像闭环或 fMRI 闭环损失加倍。示例重建存在变化但整体结论相对稳定说明增益并非依赖唯一的一组权重。不过这里只给出有限设置的视觉比较不能替代系统的超参数统计分析。5. 与当时方法相比优势在哪里来源原论文 Figure 5主论文 PDF 第 9 页仅作忠实裁剪未重绘或添加标注。在 fMRI on ImageNet 上完整方法的 2-way 准确率为85.3%在 vim-1 上为70.5%。论文称在 n2、5、10 的不同难度下它分别比 Shen 等方法至少高 5 个百分点、比 St-Yves 等方法至少高 3 个百分点。视觉上这篇方法的输出仍然模糊却更倾向于保留刺激的布局与形状。相比之下依赖 GAN 图像先验的方法有时生成得更像自然图但也可能偏离真实刺激。这里体现了两个目标的张力感知真实性追求“看起来像照片”刺激忠实性追求“确实对应这次脑活动”。对神经解码来说后者通常更重要。6. 这篇工作的贡献与局限主要贡献第一它把无标签自然图像和无标签目标域 fMRI 放入同一套可训练框架不需要为两类数据构造伪标签。第二编码器不再只是前向预测工具还成为解码结果的神经一致性约束。第三论文用消融明确区分了图像闭环、fMRI 闭环以及目标样本自身参与适配的贡献。第四补充材料公开整组重建、重复次数与体素 SNR 分析使读者能看到主结果背后的条件。必须保留的边界它不是今天所说的 fMRI 基础模型。模型针对单个数据集训练没有大规模跨被试预训练、统一脑表征、通用任务迁移或可复用的大模型检查点。更合适的标签是自监督脑图像重建与直推式域适配。测试 fMRI 参与训练。虽然没有使用对应图像标签不构成标签泄漏但评估协议依赖能提前访问目标测试集合。面对真正流式到来的新样本时条件会不同。测试信号经过大量重复平均。fMRI on ImageNet 为 35 次vim-1 为 13 次单次重建明显更差。评估维度有限。n-way 像素相关识别强调低层相似性缺少现代常用的语义、感知和人类判断指标也没有系统的显著性检验报告。泛化范围有限。只有两个数据集模型没有验证跨被试、跨扫描仪或跨任务迁移112×112 的输出和 2019 年的卷积结构也限制了细节。闭环可能继承编码器偏差。如果 E 对某些高层信息不敏感D 只需满足 E 的约束就可能得到多种不同图像cycle consistency 并不保证逆映射唯一。7. 对今天做 fMRI 解码有什么启发这篇论文最值得继承的不是具体网络而是它对数据的分层使用方式。如果把它迁移到今天可以先用大规模多被试数据训练共享脑表征再用少量个体配对数据学习刺激映射外部图像可通过视觉自监督模型或扩散模型提供先验目标被试的无标签 fMRI 则用于分布对齐但评估时必须把“目标集合适配”和“真正未见样本泛化”分开报告。与此同时应分别给出单试次、不同重复平均次数、跨 session 和跨被试结果避免一个汇总数字掩盖采集条件。另一个启发是保留“编码—解码双向验证”。现代生成模型能产出高度逼真的图片却更容易出现与脑信号无关的语义幻觉。把生成结果重新映射到脑表征空间是约束幻觉的一条合理路径但编码器需要经过独立验证而且最好在多层视觉表征、多个 ROI 和不确定性上同时检查而不是依赖单一体素损失。8. 一句话总结From Voxels to Pixels and Back证明了当配对脑成像数据稀缺时未配对自然图像与无标签目标 fMRI 可以通过双向闭环共同改进重建。它是自监督脑解码与测试域适配的一项重要早期工作但结果建立在可访问测试 fMRI、重复扫描平均和数据集内训练之上理解这些条件比只记住 85.3% 的准确率更重要。参考文献Beliy R, Gaziv G, Hoogi A, et al.From Voxels to Pixels and Back: Self-supervision in Natural-image Reconstruction from fMRI. NeurIPS, 2019.Shen G, Horikawa T, Majima K, Kamitani Y.Deep image reconstruction from human brain activity. PLOS Computational Biology, 2019.St-Yves G, Naselaris T.Generative Adversarial Networks Conditioned on Brain Activity Reconstruct Seen Images. bioRxiv, 2018.Kay KN, Naselaris T, Prenger RJ, Gallant JL.Identifying natural images from human brain activity. Nature, 2008.图片声明本文全部 9 张图片均来自原论文正文或官方补充材料只做了页内忠实裁剪未使用 AI 生成、重绘、补图、箭头标注、水印或语义性修改。原始 PDF、页码、裁剪范围与文件哈希均保存在本地溯源清单中。