一、认知缺口长焦相机的物理墙传统ISP翻不过去智能手机的潜望式长焦镜头这几年卷得厉害——3倍、5倍、10倍光学变焦参数越来越夸张。但如果你是做安防摄像头的工程师你面对的现实要骨感得多Sensor像素间距已经做到了0.7μm甚至更小而镜头的物理口径受限于模组体积根本无法提供匹配的解像力。这就是所谓的长焦“物理墙”——当像素间距缩小到亚微米量级光学系统的几何像差成为了不可逾越的瓶颈。点扩散函数PSF在Sensor平面上弥散相邻像素采样到的其实是同一份模糊信息。像素做小了分辨率却没上来。传统ISP对此无能为力。原因很根本传统ISP是逐级、局部处理的流水线——先降噪再白平衡再色彩校正——每个模块只看到当前像素的邻域没有任何一个模块拥有对PSF的全局建模能力。它不知道模糊是怎么产生的自然也无法从根上消除模糊。你可以锐化但锐化只是增强边缘对比度不能恢复被像差吞噬的高频信息。在安防场景中这个问题尤为尖锐。小像素Sensor0.7μm、0.5μm甚至更小配合紧凑镜头远距离目标的车牌、人脸本来就只占十几个像素像差进一步抹平了这些关键细节。传统ISP输出后检测器看到的几乎是一片糊。二、核心洞见Neural ISP能反推像差把小像素变成优势ICASSP 2024收录的论文《Redefining Night Vision: The Power of MSR-Driven Neural ISP》以及相关前沿研究给出了一个突破性思路Neural ISP不仅能增强低光图像更能校正传统ISP无法处理的光学像差——关键在于它学会了“反推”退化过程。Jingchao Hou和Guanghui He在论文中提出了一个可训练的Neural ISP框架包含三个核心组件1. 基于ISP的亮度协调层Luminance Harmonization Layer该层首先对Raw域数据进行亮度级别的初步优化。传统ISP在低光条件下曝光不足区域的亮度和色彩信息严重压缩线性拉伸又会导致噪声爆炸。亮度协调层通过可学习的映射函数在Raw数据阶段就建立了更合理的亮度分布为后续处理奠定基础。2. 基于深度学习的多尺度RetinexMSR层这是论文的核心创新。Retinex理论认为图像由光照分量Illumination和反射分量Reflectance构成S R · I。传统MSR算法用高斯滤波估计光照但光晕伪影和色彩失真问题始终存在。论文将MSR做成可学习的深度网络模块——网络不再依赖固定的高斯核而是自适应地分解图像的亮度成分和反射成分在不同尺度上分别增强。这种方式既保留了MSR理论分离光照与反射的物理先验又通过数据驱动克服了传统方法的参数敏感性。3. 区域自适应增强与色彩降噪层第三层负责精细化的局部增强和色彩通道的联合降噪。夜间场景中暗区和亮区需要完全不同的增强策略——全图统一增益会导致亮区过曝。该层通过空间自适应机制对不同区域施加不同强度的处理同时利用色彩通道间的相关性进行联合降噪避免单通道降噪造成的色彩偏移。但这只是夜视增强这一面的故事。Neural ISP的真正威力在于它对光学像差的校正能力——这一点在后续关于小像素时代的研究中得到了更充分的揭示。Neural ISP校正像差的原理传统ISP之所以无法校正像差是因为像差是空间变化的——画面中心PSF近似圆形边缘则呈现彗差、像散等复杂形态。局部处理模块无法区分这里是像差导致的模糊和这里是场景本身就不锐利。Neural ISP的解法是端到端训练在已知PSF的仿真数据上网络学会了从模糊图像中推断出清晰的场景反射率。由于训练数据中PSF是已知的网络实际上学到了一个逆映射——从像差模糊后的图像反推出像差模糊前的图像。这种全局的、非线性的逆映射是任何逐级局部处理模块都做不到的。三、验证洞见0.35μm像素下分辨率提升2.5-3倍数据是最有说服力的。在关于小像素Neural ISP的前沿研究中研究者对一个代表性长焦模组进行了受控仿真实验评估了五种像素间距配置0.35μm到0.75μm光圈随像素等比缩放以保持每像素SNR和衍射斑大小不变从而隔离几何像差和空间采样的影响。核心实验结果指标传统ISP0.35μmNeural ISP0.35μm提升幅度MTF50垂直~250 cycles/mm745 cycles/mm2.5-3倍LPIPS0.2440.151显著改善关键发现是当像素间距从0.75μm缩小到0.35μm时传统ISP的分辨率改善微乎其微——因为PSF模糊是瓶颈更小的像素只是更密集地采样了同一份模糊信息。但Neural ISP的分辨率随像素缩小而大幅提升因为它能校正像差让更密的采样真正转化为更高的分辨力。低SNR场景的补充实验在15dB低信噪比条件下0.35μm像素多帧Neural ISP恢复到了接近亮光单帧基线的性能而同样条件下的多帧传统ISP几乎没有任何改善。这证明在小像素场景下传统ISP的性能瓶颈是未被校正的PSF模糊而非噪声。 只要PSF模糊未被消除多帧融合也只是在平均多份模糊无法恢复高频信息。回到MSR论文本身实验在机器视觉基准和客观视觉质量指标上均验证了方法的有效性在低光增强场景下不仅显著优于现有方法还展现出在不同光照条件下的鲁棒适应性。四、推开一扇窗安防摄像头也需要像差校正论文里的长焦手机和仿真实验离安防工程有多远比你想的近。安防摄像头使用的CMOS Sensor像素间距普遍在1.0μm以下旗舰款已经到了0.5μm甚至更小。紧凑型镜头模组的几何像差问题在安防领域甚至比手机更严重——因为安防镜头的焦距更长监控远距离目标而光学成本控制更严不可能每个摄像头都配高端镜头。结果就是Sensor的采样能力在提升但光学系统跟不上像差模糊吃掉了像素缩小本该带来的分辨率增益。ShiMeta Pico-G1的圆鸮AI ISP引擎正在这条路上走。Pico-G1基于国科微GK7206V1芯片搭载1.0TOPS NPU其AI_NR模块在Bayer Raw域执行深度学习降噪——注意这里的关键不是降噪本身而是在Raw域做处理。Raw域保留了最完整的传感器信息包括被像差模糊但尚未被去马赛克和色彩校正进一步破坏的高频分量。在Raw域做AI处理等价于在退化链条的最早环节介入校正的效果远优于在sRGB域后处理。G1的AI_NR仅需0.5T算力跑4M15fps在1.0TOPS NPU上仅占一半算力剩余算力还可用于检测、分类等下游任务。内置2Gb DDR3L、完整ISP Pipeline和H.265硬编码11种sample_vio工作模式覆盖了从低照度到逆光的主流安防场景。论文展示了Neural ISP在校正像差上的潜力0.35μm像素下MTF50提升2.5-3倍。G1的AI ISP则是这个思路在安防芯片上的工程实现——算力有限不可能跑论文里的完整Neural ISP但聚焦于最关键的Raw域降噪这一步已经能在实际场景中显著提升画质。先降噪再像差校正这条路在NPU算力增长的过程中会越走越宽。本文是对原论文的解读与发散原作者Jingchao Hou, Guanghui He和所属机构未参与本文撰写亦无任何利益关联。原论文Redefining Night Vision: The Power of MSR-Driven Neural ISPJingchao Hou, Guanghui HeICASSP 2024.论文地址https://ieeexplore.ieee.org/document/10446671/