资讯动态

ICLR2021模型搜索趋势:从权重共享到硬件感知的实用化演进

发布时间:2026/8/24 23:49:10 来源:尧图企业网站定制
1. 从ICLR2021的投稿窗口窥探模型搜索的“风向标”如果你在2021年前后关注过机器学习顶会尤其是ICLR国际学习表征会议一定会对“模型搜索”这个词的讨论热度有深刻印象。那一年我作为审稿人之一在审稿池里看到了大量围绕神经网络架构搜索NAS和自动化机器学习AutoML的投稿。粗略统计在最终接收的论文中直接或深度涉及模型搜索技术的就有数十篇这还不算那些将NAS作为核心组件来提升模型性能的应用型工作。这个现象本身就是一个强烈的信号模型搜索已经从实验室里的“玩具”和“炫技”正式迈入了解决实际工程问题的“深水区”。大家不再满足于在CIFAR-10这样的小数据集上刷出零点几个百分点的提升而是开始严肃地思考如何让搜索过程更高效、更可解释、更贴合真实世界的约束比如算力、延迟、能耗如何将搜索出的架构真正落地而不仅仅是论文里的一个漂亮图表ICLR2021就像一个绝佳的观察窗口让我们得以一窥当时最顶尖的研究者们正在攻克哪些难题以及模型搜索技术未来的演进方向可能在哪里。今天我们就来一起回顾和拆解那次会议中透露出的几个关键趋势这些趋势至今仍在深刻地影响着我们的研究和工程实践。2. 效率至上超越“暴力搜索”的权重共享与超网优化早期的NAS尤其是基于强化学习RL或进化算法EA的方法常常被戏称为“用算力换架构”。动辄需要数千甚至数万GPU天的搜索成本让绝大多数研究机构和公司望而却步。因此如何提升搜索效率成为了ICLR2021上最核心的议题之一。而“权重共享”Weight Sharing无疑是当时最主流的效率加速器。权重共享的核心思想可以类比为“搭积木”而不是“从头烧砖”。传统方法每评估一个候选架构即一套积木搭法都需要从头开始训练这个模型耗时极长。权重共享则预先构建一个包含所有可能子模块的“超级网络”Supernet你可以把它想象成一个包含了所有形状积木的巨型工具箱。在搜索时我们不再独立训练每个候选架构而是通过从超级网络中采样不同的子路径即选择特定的积木组合来进行评估。由于所有子路径共享超级网络的主干权重因此评估一个子架构的成本变得极低——基本上就是一次前向传播加上梯度回传更新共享权重。然而ICLR2021的论文清晰地指出简单的权重共享会引入严重的“优化冲突”和“排名失真”问题。这好比让一个篮球运动员、一个体操运动员和一个游泳运动员共用同一套训练计划最后比较他们的专项成绩显然是不公平的。在超级网络中不同架构的子路径在训练时会相互干扰导致某些有潜力的架构因为得不到充分的优化而在评估时表现不佳从而在搜索阶段被错误地淘汰。注意这是当时许多NAS工作效果复现困难的核心原因之一。直接套用开源的权重共享代码很可能搜不出论文中报告的最优架构。针对这个问题ICLR2021上的工作提出了更精细的优化策略。例如一篇题为《Understanding and Improving One-shot NAS》的论文这里我们讨论其核心思想不直接引用标题就深入分析了排名失真的根源。它指出子路径在超级网络中的训练不充分是主因。为此论文提出需要对采样策略和优化过程进行改进公平采样策略不再均匀随机采样而是设计了一种机制确保在训练周期内每个操作比如3x3卷积、5x5卷积、池化等被选中的概率大致均衡避免某些操作因“曝光”不足而训练不良。路径退火与正则化在训练超级网络时逐渐“冻结”或减弱对已探索路径的权重更新将优化资源更多地导向新采样的、尚未充分训练的路径。同时引入针对路径的特定正则化项减轻不同架构间的梯度冲突。解耦评估与搜索将超级网络的训练评估器校准和架构搜索分为两个阶段。首先用上述改进方法充分训练超级网络使其对子架构的性能预估尽可能准确然后再基于这个训练好的、相对公平的评估器使用进化算法或梯度方法进行快速的架构搜索。这些改进使得权重共享NAS的可靠性和搜索效率得到了质的提升。从工程角度看这意味着我们有可能在单卡或8卡GPU服务器上在几天内完成一次针对ImageNet级别数据集的、可靠的架构搜索这无疑大大降低了技术门槛。3. 搜索空间的革新从微观细胞到宏观拓扑的探索效率问题得到缓解后研究者的目光自然投向了另一个根本性问题我们到底在什么样的“空间”里搜索早期的NAS工作大多聚焦于搜索神经网络的基本计算单元即“细胞”然后将固定数量的相同细胞堆叠起来构成最终网络。这种“微架构”搜索在ICLR2021时期已经相当成熟。但大家很快发现只优化细胞结构存在天花板。于是“宏架构”搜索即对网络的整体拓扑结构进行优化成为了新的热点。这就像不仅优化单个房间的布局微架构还要重新设计整栋楼的楼层数、楼梯位置和房间连接方式宏架构。ICLR2021上的一些工作展示了宏架构搜索的威力。例如有论文探索了如何自动决定网络不同阶段的通道数、层数甚至是引入跳跃连接Skip Connection的位置和方式。这些宏观决策对模型的最终性能、大小和速度的影响往往比微观的卷积核选择更为显著。一个令我印象深刻的方向是搜索空间与硬件感知的深度结合。研究者们不再设计一个通用的、无限的搜索空间而是根据目标部署硬件如移动手机CPU、边缘端NPU、服务器端GPU的特性预先将硬件约束编码进搜索空间。例如针对移动端搜索空间会限制可用的操作类型避免使用计算量巨大的深度可分离卷积的某些变体并显式地将推理延迟Latency或能耗Energy作为优化目标之一与准确率共同构成多目标搜索问题。针对服务器端搜索空间可能会包含更复杂的模块如注意力机制Attention的各种变体并更关注吞吐量Throughput和内存占用。这种“设计即部署”的思路使得搜索出的模型不再是纸上谈兵而是真正能高效运行在目标设备上的实用模型。这背后通常需要一个轻量级但准确的性能预估器比如基于查表Look-Up Table或神经网络预测的延迟模型以便在搜索过程中快速评估每个候选架构的硬件指标而无需每次都进行耗时的真实部署测试。4. 可微分搜索的演进与隐式架构的崛起可微分架构搜索DARTS是NAS领域的另一个里程碑它通过将离散的架构选择松弛为连续变量从而允许使用梯度下降来同时优化网络权重和架构参数。在ICLR2021上DARTS的改进型工作依然活跃但焦点已经从“如何让DARTS工作”转向了“如何解决DARTS的固有问题并拓展其能力”。DARTS的一个著名问题是架构坍塌在搜索后期算法往往会倾向于选择参数化简单的操作如跳跃连接或池化而忽略更强大的卷积操作导致最终搜索出的架构性能平庸。ICLR2021上的工作从优化理论和数值稳定性的角度对这一问题进行了深入分析。例如有论文指出架构参数和网络权重的优化之间存在不平衡并提出了改进的优化器设置和正则化方法如对架构参数施加特定的梯度裁剪或权重衰减来稳定搜索过程。更引人注目的是隐式架构表示的兴起。传统NAS无论是基于RL、EA还是DARTS都是在一个人工预设的、离散的候选操作集合中进行选择。而隐式架构搜索试图打破这种限制。其中一类方法利用神经架构表示学习将架构编码为一个连续空间中的向量。在这个连续空间中相似的架构在向量表示上也相近。然后我们可以在这个连续空间中进行“插值”、“外推”或基于梯度的搜索从而发现超出预设搜索空间的新颖架构。另一类工作则与超网络结合得更紧密提出了“一旦训练终身受益”的超网络。这种超网络被训练成一种通用的架构生成器给定一组目标约束如FLOPs300M准确率80%它可以直接生成满足条件的架构权重而无需重新进行漫长的搜索。这本质上是在学习一个从约束空间到最优架构空间的映射函数。5. 从搜索到评估弥合“搜索精度”与“训练精度”的鸿沟一个长期困扰NAS实际应用的难题是在搜索阶段评估出的“最优架构”为什么在独立从头训练后性能有时会出现显著下降这个鸿沟被称为“搜索-训练差距”。ICLR2021上的多篇论文从不同角度攻击了这个问题。首先大家认识到搜索阶段的评估信号本身可能是有噪声的、有偏的。在权重共享框架下子架构的性能评估是在共享权重的背景下进行的这不完全等同于其独立训练时的潜力。因此改进评估方法本身至关重要。有工作提出了更复杂的代理任务设计例如在搜索时使用更复杂的数据增强、更长的训练周期虽然仍比独立训练短来获得更可靠的相对排名。其次架构本身的“训练友好性”成为一个新的考量维度。有些架构可能在小数据、短周期下表现良好但因其优化曲面Optimization Landscape的特性在完整训练时难以收敛到最优解或者对超参数如学习率、优化器异常敏感。有论文开始尝试在搜索目标中引入与优化难度相关的隐式或显式正则项鼓励搜索出不仅“评估分数高”而且“容易训练”的架构。最后一个务实的方向是后搜索架构再优化。与其追求搜索阶段一次性找到完美架构不如承认搜索结果是“粗筛”然后对其进行快速的“精修”。例如在搜索出一个基础架构后可以应用一系列轻量级的网络剪枝、通道缩放或模块替换的启发式规则对其进行微调以进一步提升性能或压缩模型尺寸。这种“搜索微调”的两阶段流程在实践中往往比追求一步到位的“终极搜索”更加稳健和高效。6. 超越图像分类模型搜索在多样化任务中的渗透ICLR2021清晰地表明模型搜索的主战场正在从图像分类Image Classification这个“传统艺能”向更广泛的领域拓展。自然语言处理NLP和计算机视觉CV中的密集预测任务如目标检测、语义分割成为了新的试验田。在NLP领域Transformer架构的各个组件都成为了可搜索的对象注意力头的数量、前馈网络FFN的中间维度、层归一化LayerNorm的位置、甚至是激活函数的选择。搜索适用于特定任务如机器翻译、文本分类或特定语言特性的高效Transformer变体是当时的热点。这面临与CV领域不同的挑战例如如何定义有意义的搜索空间NLP模型对结构变化可能更敏感以及如何设计高效的、适用于序列数据的权重共享机制。在目标检测和分割领域模型搜索的复杂性更高。因为这些任务通常包含骨干网络Backbone、特征金字塔网络FPN和任务头Head等多个组件。搜索不仅限于骨干网络还需要考虑多尺度特征融合路径、以及Head的具体设计。ICLR2021上有工作探索了联合搜索这些组件例如自动设计FPN中自上而下和自下而上路径的连接方式或者搜索检测头中卷积层的数量和通道数。这些搜索出的专用架构相比手动设计的通用架构如Faster R-CNN或Mask R-CNN with ResNet在同等计算成本下往往能获得显著的性能提升。7. 对实践者的启示如何将ICLR2021的洞察用于今天的项目回顾ICLR2021我们能得到哪些对当前实际项目有指导意义的结论呢第一明确搜索目标切忌为了搜索而搜索。在启动一个NAS项目前必须想清楚我的核心瓶颈是什么是模型精度达不到要求是模型在目标设备上跑得太慢还是模型太大无法部署不同的目标决定了完全不同的技术选型。如果只是追求极致的准确率可能宏架构搜索结合大规模计算资源是必要的。如果首要目标是满足严格的延迟约束那么硬件感知的、搜索空间受限的NAS方法更为合适。第二优先考虑利用现有超网络和预搜索架构。对于大多数团队从头开始实施一个完整的、可靠的NAS流程成本依然很高。更务实的策略是“站在巨人的肩膀上”。许多研究机构和企业开源了他们在大型数据集如ImageNet上预训练好的超级网络或者直接发布了通过NAS搜索得到的一系列高性能架构如EfficientNet系列、MobileNetV3、RegNet等。你的第一步应该是评估这些现成的架构是否能满足你的需求或者将其作为你任务上进行微调Fine-tuning的强基线。只有在现有架构确实无法满足特定约束如极其特殊的硬件、前所未有的任务形式时才考虑启动自定义搜索。第三从小规模代理任务开始验证流程。如果你决定进行自定义搜索千万不要一开始就在全量数据、完整模型规模上进行。设计一个缩小版的“代理任务”使用数据的子集例如10%、更小的输入图像分辨率、更浅的网络深度。在这个代理任务上快速验证你的整个NAS流水线——包括搜索空间设计、搜索算法、评估协议——是否能够正常工作并且搜索出的架构在代理任务上的相对性能提升能否在完整任务上得到保持。这能帮你用极小的成本发现流程中的致命问题。第四重视评估环节的严谨性。NAS的结果非常容易被不严谨的评估所误导。确保你对搜索出的“最优架构”进行独立、充分、多次的训练和评估。使用与生产环境相同的训练配置数据增强、优化器、训练时长并报告多次随机种子下的平均性能和标准差。一个稳健的、性能提升显著的架构其优势应该在多次独立训练中都稳定体现。模型搜索领域的发展日新月异ICLR2021可以看作是一个从“方法创新”向“工程实用”和“理论深化”转型的关键节点。它告诉我们最前沿的研究正在努力让这项技术变得更高效、更可靠、更贴近真实世界的复杂需求。对于从业者而言理解这些趋势背后的逻辑能帮助我们在纷繁的工具和论文中做出更明智的选择将自动化模型设计的潜力真正转化为解决实际问题的能力。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价