
ICML 2021|NASWOT无需训练的神经网络架构搜索01 论文信息02 论文主要贡献03 方法3.1 打分指标的计算3.2 NASWOT04 实验4.1 NAS 基准测试集4.2 指标可视化实验K H K_HKH矩阵模式4.3 打分与最终精度的相关性实验4.4 与其他零成本指标的对比实验4.5 消融实验鲁棒性分析4.6 训练过程中打分变化实验4.7 NASWOT 搜索算法对比实验4.7.1 NAS‑Bench‑1014.7.2 NAS‑Bench‑2014.7.3 NATS‑Bench‑SSS4.8 AREA 集成实验与进化搜索结合05 个人声明01 论文信息论文题目Neural Architecture Search without Training论文作者Joseph MellorJack TurnerAmos StorkeyElliot J. Crowley发表会议\期刊ICML 2021代码链接https://github.com/BayesWatch/nas-without-training02 论文主要贡献NAS 算法普遍速度慢、开销巨大搜索过程需要对大量候选网络进行训练。如果可以仅依靠网络初始化状态就能部分预测网络训练完成后的精度就能够缓解上述问题。本文研究一个小批量数据内未训练网络中不同样本之间的激活重叠现象并据此提出一个指标该指标可以有效反映网络训练后的性能。将该指标嵌入简易算法无需网络训练仅需数秒即可搜索出高性能架构。本文通过适配正则化进化搜索完成验证。无训练打分指标基于 ReLU 激活的二进制编码汉明距离构建核矩阵的对数行列式作为架构得分仅靠网络初始化状态即可预测模型最终精度。NASWOT 快速搜索算法随机采样候选架构并直接打分选优全程无需参数训练单 GPU 数十秒内即可完成架构搜索综合精度优于传统权重共享类 NAS 方法。算法兼容性拓展可集成现有搜索算法将无训练打分指标嵌入正则化进化搜索AREA用于种群初始化筛选。多场景鲁棒性验证在 NAS-Bench-101/201、NATS-Bench、NDS 等主流搜索空间完成系统性验证消融实验证明该指标对输入数据、权重初始化、batch size \text{batch size}batch size均具备优异鲁棒性。03 方法3.1 打分指标的计算对于带 ReLU 激活的神经网络每一层的每个标准 ReLU神经元都可以用二元标记神经元未激活输出为负置 0、神经元激活输出大于 0置 1。固定这些二元标记之后网络在局部等价于线性算子算子由每层线性变换穿插 ReLU 二值选择得到。取一个小批量样本X { x i } i 1 N X\{x_i\}_{i1}^{N}X{xi}i1N输入网络f ff样本x i x_ixi经过网络时所有 ReLU 单元的激活标记组合构成二进制编码c i c_ici该编码对应样本所处的线性区域。核心两个输入样本对应的二进制编码相似度越高网络越难学习区分这两个样本。如果两个输入拥有完全相同的二进制编码说明二者落在网络同一个线性区域很难被模型分开。反之如果样本之间编码差异大网络更容易学习区分。图 2 可视化二进制编码与线性区域。我们使用汉明距离d H ( c i , c j ) d_H(c_i,c_j)dH(ci,cj)衡量未训练网络下两个输入样本对应二进制编码之间的差异。对整个小批量样本计算核矩阵K H ( N A − d H ( c 1 , c 1 ) ⋯ N A − d H ( c 1 , c N ) ⋮ ⋱ ⋮ N A − d H ( c N , c 1 ) ⋯ N A − d H ( c N , c N ) ) K_H \begin{pmatrix} N_A-d_H(c_1,c_1) \cdots N_A-d_H(c_1,c_N) \\ \vdots \ddots \vdots \\ N_A-d_H(c_N,c_1) \cdots N_A-d_H(c_N,c_N) \end{pmatrix}KHNA−dH(c1,c1)⋮NA−dH(cN,c1)⋯⋱⋯NA−dH(c1,cN)⋮NA−dH(cN,cN)式中N A N_ANA代表 ReLU 神经元总数量。归一化核矩阵可视化特征非常明显性能高的网络非对角线位置高相似度元素更少。利用这个现象无需训练就可以预测未训练网络的最终性能替代 NAS 中开销巨大的训练环节。网络打分公式s log ∣ K H ∣ s\log|K_H|slog∣KH∣当矩阵迹相同时越接近对角矩阵该对数行列式得分越高。初始化阶段打分越高预示网络训练结束后精度越高。3.2 NASWOT本文提出 NASWOT如算法 1所示不使用神经网络作为生成器从搜索空间随机采样候选架构不对网络执行训练直接在网络初始化状态下完成打分。一共采样N NN个架构选取打分最高的网络作为最终输出。本打分可以很容易集成到已有 NAS 算法。我们改造 REA 正则化进化搜索得到 AREAAssisted‑REA。原版 REA 初始种群随机挑选AREA 先随机采样更大规模候选集合利用本文打分筛选出初始种群再交给后续进化流程。04 实验4.1 NAS 基准测试集本文使用 NAS‑Bench‑101、NAS‑Bench‑201、NATS‑Bench、NDS 网络设计空间数据集评估方法。NAS‑Bench‑101包含423 624 423\,624423624个网络全部在 CIFAR‑10 上完整训练 108 轮每个网络提供 3 种不同初始化的训练结果。NAS‑Bench‑201共15 625 15\,62515625个网络在 CIFAR‑10、CIFAR‑100、ImageNet‑16‑120 数据集上开展多次训练。NATS‑BenchDong 等人2021包含两套搜索空间拓扑搜索空间 TSS网络集合和 NAS‑Bench‑201 完全一致尺寸搜索空间 SSS共32 768 32\,76832768个网络主要改变单元内部通道数。NDS 网络设计空间数据集全部网络基于 DARTS 宏观骨架cell 单元采样自 AmoebaNet、DARTS、ENAS、NASNet、PNAS 五种经典 NAS 搜索空间划分为 NDS‑AmoebaNet、NDS‑DARTS、NDS‑ENAS、NDS‑NASNet、NDS‑PNAS。4.2 指标可视化实验K H K_HKH矩阵模式我们从 NAS‑Bench‑201、NDS‑DARTS 中随机选取一批未训练网络输入 CIFAR‑10 小批量数据计算K H K_HKH做归一化绘图。核心结果性能好的架构不同样本之间激活相似度更低矩阵非对角线颜色更浅该模式在两套完全不同的搜索空间中一致出现精度区间更窄区分度相对弱一些。4.3 打分与最终精度的相关性实验目的量化验证初始化打分s log ∣ K H ∣ s\log|K_H|slog∣KH∣与网络训练后验证精度之间存在正相关。实验设置从各搜索空间随机采样未训练架构计算打分与训练后验证精度画散点图计算肯德尔相关系数τ \tauτ。核心结果全部实验中打分与验证精度均呈正相关NAS‑Bench‑201和NDS‑DARTS相关性尤其强打分可迁移到ImageNette2等更难数据集。4.4 与其他零成本指标的对比实验目的证明本文打分优于其他已有的零成本/少训练架构指标。实验设置在NDS的各个CIFAR‑10搜索空间上对比三种指标与最终精度的肯德尔tau本文打分log ∣ K H ∣ \log|K_H|log∣KH∣grad‑norm一个小批量数据上权重梯度的欧几里得范数synflowTanaka等人(2020)提出的基于梯度的打分对所有参数求和核心结果本文打分在全部搜索空间都与精度保持稳定正相关grad‑norm和synflow的相关性波动很大在部分搜索空间上甚至接近零或为负。4.5 消融实验鲁棒性分析目的验证打分指标对各种干扰因素的鲁棒性。实验设置从NAS‑Bench‑201按精度分位数选取10个架构每个条件重复20次默认batch128。子图消融变量实验设置核心结果左上输入小批量20组不同的CIFAR‑100小批量网络打分相对排序对具体采样的小批量鲁棒右上输入数据类型用正态分布随机噪声图像替代真实图片趋势依旧保留说明打分捕捉架构本身属性左下权重初始化20次不同随机初始化打分有噪声但高性能网络仍可被区分右下Batch size32/64/128/256打分除以同batch最低分做归一化即使更换batch尺寸性能最好的网络仍可被区分4.6 训练过程中打分变化实验目的观察打分随训练进程如何变化验证初始化阶段打分的代表性。实验设置挑选NAS‑Bench‑201上10个CIFAR‑10验证精度90%的网络用SGD交叉熵训练100 epoch每轮计算打分。左图放大前2个epoch右图完整100 epoch核心结果训练刚开始打分迅速上升之后很快趋于稳定不同网络打分增长幅度接近网络之间打分的相对排序在训练全程基本不变——这进一步支撑了用初始化打分预测最终性能的合理性。4.7 NASWOT 搜索算法对比实验这是论文的核心算法实验在三个基准上分别与现有NAS方法对比。4.7.1 NAS‑Bench‑101实验设置NASWOT运行500次N 100 N100N100REA正则化进化运行50次时间预算12000秒AREA运行50次时间预算12000秒Random随机挑选运行500次核心结果NASWOT单GPU不到一分钟精度显著优于随机搜索介于随机与REA之间。4.7.2 NAS‑Bench‑201实验设置搜索在CIFAR‑10上执行选出的架构再分别在CIFAR‑10、CIFAR‑100、ImageNet‑16‑120上训练评估非权重共享方法统一给12000秒时间预算NASWOT测试N 10 / 100 / 1000 N10/100/1000N10/100/1000每个设置重复500次权重共享基线重复3次核心结果NASWOT搜索耗时远低于所有基线性能优于全部权重共享类NAS方法增大N NN精度持续提升非权重共享基线精度仍更高但代价是巨大的搜索时间仅数十秒即可得到接近最优非训练基线的网络4.7.3 NATS‑Bench‑SSS实验设置SSS搜索空间改变网络通道数拓扑固定搜索与评估使用同一数据集。核心结果当N 1000 N1000N1000时NASWOT性能已非常接近REA等基线。说明该方法在尺寸搜索通道数选择场景下同样有效。4.8 AREA 集成实验与进化搜索结合核心结果NAS‑Bench‑201的CIFAR‑100、ImageNet‑16‑120上AREA略优于REANAS‑Bench‑101上二者接近93.91% vs 93.87%证明打分可作为通用初始化/筛选模块嵌入现有NAS算法05 个人声明本文为作者对原论文的学习笔记与心得分享受个人学识与理解所限文中对论文内容的解读或有不够周全之处一切以原论文正式表述为准。本文仅用于学术交流与传播内容均由作者独立整理完成不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议请及时与作者联系作者将在第一时间核实并妥善处理。