资讯动态

AAAI|2025|ParZC:面向高效神经网络架构搜索的参数化零代价代理

发布时间:2026/8/11 13:34:26 来源:尧图企业网站定制
文章目录论文主要贡献论文创新点方法逐节点零代价编码模块融合贝叶斯网络的混合架构 MABN贝叶斯网络模块混合 Mixer 架构节点分段PatchifyLayerNorm 标准化转置 Transpose跨段 FFN 多层 MLP转置复原 残差连接可微排序优化DiffKendall无训练非负加权变体 ParZC†实验论文名称ParZC: Parametric Zero-Cost Proxies for Efficient NAS论文作者Peijie Dong1*, Lujun Li2*, Zhenheng Tang2, Xiang Liu1, Zimian Wei3,Qiang Wang4, Xiaowen Chu1,2†发表会议AAAI 2025论文主要贡献提出参数化零代价代理框架 ParZC融合节点零代价统计量自带的不确定性建模实现自适应代理打分设计 MABN 混合贝叶斯网络架构用于量化逐节点零代价特征的预估不确定性同时提出 DiffKendall 损失强化模型排序能力在 NASBench-101/201、NDS、视觉 Transformer 多类搜索空间开展完备实验充分验证 ParZC 对比现有方法的优越性。论文创新点指出传统零代价 NAS 的同质化假设缺陷实验证明节点贡献随深度差异巨大提出 ParZC 参数化零代价代理框架设计 MABN 建模节点非线性关联与预测不确定性发明 DiffKendall 可微排序损失直接优化架构排序匹配度方法逐节点零代价编码模块不同节点、不同零代价代理的统计量数值量级差距极大本文采用最小 - 最大归一化缓解特征尺度失衡、降低条件数归一化公式σ ( z k ( N ( m ) ) ) : z k ( N ( m ) ) − min ⁡ ( z k ( N ( m ) ) ) max ⁡ ( z k ( N ( m ) ) ) − min ⁡ ( z k ( N ( m ) ) ) \sigma\left(z_k\left(N^{(m)}\right)\right):\frac{z_k\left(N^{(m)}\right)-\min\left(z_k\left(N^{(m)}\right)\right)}{\max\left(z_k\left(N^{(m)}\right)\right)-\min\left(z_k\left(N^{(m)}\right)\right)}σ(zk​(N(m))):max(zk​(N(m)))−min(zk​(N(m)))zk​(N(m))−min(zk​(N(m)))​式中z k z_kzk​第k kk种节点级零代价代理将单节点统计量映射为实数N ( m ) N^{(m)}N(m)搜索空间中第m mm个网络z k ( N ( m ) ) ∈ R L z_k\left(N^{(m)}\right)\in \mathbb{R}^Lzk​(N(m))∈RL代表该网络全部L LL个节点的代理统计量σ \sigmaσ最小 - 最大缩放将所有特征归一至同一区间保障后续模型训练稳定。融合贝叶斯网络的混合架构 MABN本文提出 MABN 架构嵌入概率关系显式建模零代价统计量的预估不确定性。贝叶斯网络模块零成本代理指标是网络随机初始化、仅单批次前传反传算出的统计量每次采样波动大浅层 / 深层节点的 ZC 指标估算误差不同传统 MLP/GCN 把权重当成固定单点数值完全忽略预测不确定性。贝叶斯模块为每个节点特征输出概率分布自动学习不同节点的置信度,Kendall 排序相关性显著提升。权重服从高斯分布W b ∼ N ( μ , σ 2 ) W_b \sim \mathcal{N}(\mu,\sigma^2)Wb​∼N(μ,σ2)贝叶斯权重通过重参数化表达为W b μ log ⁡ ( 1 e ρ ) ⋅ ϵ W_b \mu \log(1e^\rho) \cdot \epsilonWb​μlog(1eρ)⋅ϵ式中μ \muμ权重分布均值对应传统网络权重ρ \rhoρ对数方差参数采用log ⁡ ( 1 e ρ ) \log(1e^\rho)log(1eρ)softplus 函数保证标准差恒大于 0ϵ ∼ N ( 0 , I ) \epsilon \sim \mathcal{N}(0,I)ϵ∼N(0,I)标准正态分布采样噪声。可靠的节点分段方差σ \sigmaσ更小权重稳定对模型的贡献被放大噪声大、可靠性低的节点分段方差σ \sigmaσ更大权重波动剧烈模型会自动降低其影响力。混合 Mixer 架构传统MLP只能单独处理单个节点GCN只能和直接相连邻居交换信息都不能使深层节点和浅层节点相连。核心目的把网络浅层、中层、深层节点的零代价特征互相融合让模型自动学到「深层节点对性能预测更重要」从结构上打破同质化假设。节点分段Patchify在送入Mixer模块前先执行分块操作将网络全部算子节点依据深度最长数据流路径进行分组切分为S SS个分段PatchPatch1浅层节点Patch2中层节点PatchS _SS​深层节点输入张量维度批次 × 架构数 × 分段数 × 单段特征维度每一行对应一组深浅节点的整体特征每一列对应当前分段内的ZC特征通道LayerNorm 标准化对贝叶斯模块输出的分段特征做归一化消除数值波动稳定后续 MLP 训练。转置 Transpose交换张量两个维度完成维度变换[ N , S , L ] → [ N , S ′ , L ] [N,S,L] \rightarrow [N,S,L][N,S,L]→[N,S′,L]意义原本一段一段隔开的浅层 / 中层 / 深层 Patch现在全部摊开到同一维度MLP 可以一次性读取所有深浅分段实现跨层信息交互。跨段 FFN 多层 MLPMLP 会同时读取 Patch1浅层、Patch2中层、Patch3深层全部数据模型通过梯度自动学习权重深层 Patch 的特征对最终打分贡献更大浅层 Patch 贡献更小自动捕捉深浅节点之间非线性关联比如浅层卷积 深层卷积组合对精度的联合影响。转置复原 残差连接再次 T 转置把张量恢复为[N,S,L]原始形状残差 Skip把最开始贝叶斯输入的原始分段特征直接加到 MLP 输出上。作用缓解深层网络梯度消失保留原始节点有效信息。可微排序优化DiffKendall设计了一种新的肯德尔系数使其可微能参与梯度下降本文提出 DiffKendall采用带超参数α \alphaα的 Sigmoid 函数平滑原始肯德尔τ \tauτ中不可微的符号函数σ α ( Δ ) sigmoid ( α Δ ) − sigmoid ( − α Δ ) \sigma_\alpha(\Delta) \text{sigmoid}(\alpha\Delta) - \text{sigmoid}(-\alpha\Delta)σα​(Δ)sigmoid(αΔ)−sigmoid(−αΔ)可微近似肯德尔τ \tauτ损失定义如下τ d − 1 ( L 2 ) ∑ i ≠ j σ α ( Δ x i j ) ⋅ σ α ( Δ y i j ) \tau_d -\frac{1}{\binom{L}{2}} \sum_{i \ne j} \sigma_\alpha(\Delta x_{ij}) \cdot \sigma_\alpha(\Delta y_{ij})τd​−(2L​)1​ij∑​σα​(Δxij​)⋅σα​(Δyij​)式中( L 2 ) \binom{L}{2}(2L​)全部架构配对总数量Δ x i j x i − x j \Delta x_{ij} x_i - x_jΔxij​xi​−xj​预测分数的样本配对差值Δ y i j y i − y j \Delta y_{ij} y_i - y_jΔyij​yi​−yj​真实精度的样本配对差值。相较于仅随机抽取少量配对的成对排序损失DiffKendall 遍历全部样本配对能够完整捕捉序列整体排序一致性。无训练非负加权变体 ParZC†受MABN学习得到的节点重要性分布启发本文设计一种无训练加权策略可直接适配任意现有零代价代理稳定提升排序性能。采用正弦加权函数保证权重非负、变化平滑无突变第i ii个节点的权重计算公式w i sin ⁡ ( 0.5 × i 2 ) 1 w_i \sin\left(\frac{0.5 \times i}{2}\right) 1wi​sin(20.5×i​)1该权重取值范围固定在0 ∼ 2 0 \sim 20∼2无需额外参数优化轻量化适配各类零代价代理指标。实验个人声明本文为作者对原论文的学习笔记与心得分享受个人学识与理解所限文中对论文内容的解读或有不够周全之处一切以原论文正式表述为准。本文仅用于学术交流与传播内容均由作者独立整理完成不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议请及时与作者联系作者将在第一时间核实并妥善处理。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价