量子神经网络的贫瘠高原:表达力、梯度集中与可训练性

前置阅读:量子神经网络。建议同时翻阅附录 1:含参量子门中的参数化旋转门记号。

课程目标:

  1. 理解贫瘠高原 (Barren Plateau) 现象:参数梯度的方差随量子比特数指数衰减,训练 landscapes 变成一片"平地"。

  2. 掌握三类主要成因——过深随机线路全局型代价函数噪声——各自的物理图像与数学表述。

  3. 学会从集中测度 (concentration of measure) 的统一视角理解这些成因,以及它与第 8 章量子核方法中"核指数集中"现象的同源性。

  4. 掌握实践中的缓解策略:局部代价函数、浅层/问题启发拟设、恒等块初始化、分层训练等。

  5. 会做"梯度体检":用小模型数值验证方差随 \(n\) 的指数标度。

1. 现象:训练在指数变平

回顾变分模型:参数化线路 \(U(\boldsymbol\theta)\),代价 \(C(\boldsymbol\theta) = \langle 0| U^\dagger(\boldsymbol\theta)\, H\, U(\boldsymbol\theta) |0\rangle\),用梯度下降类优化器训练。随机初始化后,若对参数采样有

\[ \mathrm{Var}_{\boldsymbol\theta}\!\left[\frac{\partial C}{\partial \theta_j}\right] \sim \frac{1}{2^{n}} \quad (\text{随比特数 } n \text{ 指数衰减}), \]

则梯度几乎处处接近零:优化器无论往哪个方向走,代价函数都几乎没有变化—— landscapes 成了"高原"。这就是 McClean 等人 (2018) 命名的贫瘠高原。注意它与经典深度学习中的"梯度消失"不同:这不是某一层的问题,而是整个参数空间的梯度范数以高概率集中到零附近(梯度分布的标准差本身指数级小),且随线路规模只会更糟。

一个量级感受:\(n = 30\)\(2^{-n} \approx 10^{-9}\);测量 \(10^9\) 次 shots 才能把梯度信噪比拉到 \(O(1)\)。贫瘠高原不是"训练慢",而是"训练在原理上不可行"。

2. 成因一:随机深层线路 —— 2-设计给出指数平坦

第一类结果(McClean et al., 2018)考虑随机结构的深层拟设(如硬件高效拟设 hardware-efficient ansatz:每层随机单比特旋转 + 纠缠门,层数据量足够)。核心结论的表述相当干净:

若参数化线路族在随机参数下构成**(近似)酉 2-设计** (unitary 2-design)——即其二阶统计性质与 Haar 随机酉一致——则对任何固定观测量 \(H\), $\( \mathrm{Var}\!\left[\partial_{\theta} C\right] = \frac{\|H - \mathrm{tr}(H)I/2^n\|^2_{\mathrm{F}}}{2^{2n+1}(2^n+1)\cdot(\text{门的结构因子})} \;\lesssim\; \frac{\mathrm{poly}(n)}{4^n}. \)$

(不同拟设的精确常数不同,但指数标度 \(4^{-n}\) 不变;注意到 \(\|H-\mathrm{tr}(H)I/2^n\|_F^2 \le \|H\|_F^2 \le 2^n\|H\|^2\),对局部 \(H\) 给出 \(\mathrm{Var} \lesssim 2^{-n}\)。)

物理图像:表达力过头的代价。2-设计意味着线路"太随机了"——它能覆盖整个酉群的一切统计性质,代价函数因此对任何参数扰动都极其迟钝。直觉与测度集中 (concentration of measure) 相连:高维酉群上的 Lipschitz 函数(代价函数正是)在 Haar 测度下以极高概率落在均值附近的窄带里,带宽 \(\sim 1/\sqrt{\text{维度}} \sim 2^{-n}\)表达力与可训练性在这里成了直接的对手:越"万能"的拟设, landscapes 越平。

这不是哲学批评而是可计算的判据:给定拟设,可以数值检验其偏离 2-设计的程度(如比较其二阶矩与 Weingarten 函数给出的 Haar 值),从而预判高原风险。

3. 成因二:代价函数的"全局性" —— 浅层也会高原

第二类结果 (Uvarov, Kardashin & Biamonte, 2020) 给出更微妙的警告:即使线路很浅,只要代价函数是"全局"的,高原依然出现

对比两种代价。设目标态为 \(|\psi\rangle\),拟设输出 \(|\phi(\boldsymbol\theta)\rangle = U(\boldsymbol\theta)|0\rangle\)

  • 全局代价\(C_G = 1 - |\langle\psi|\phi\rangle|^2\)(整体保真度);

  • 局部代价\(C_L = 1 - \frac1n \sum_{i=1}^n \langle\phi| \Pi_i |\phi\rangle\)\(\Pi_i\) 只作用在第 \(i\) 个比特上的投影(把 \(|\psi\rangle\) 的对应比特投影到 \(|\psi\rangle\)\(i\) 比特的状态)。

两个代价在描述"离目标多远"上等价——\(C_L \le C_G \le n\, C_L\)(相差一个多项式因子)。但梯度行为天差地别:对局部观测量加某种结构性假设,有

\[ \mathrm{Var}[\partial_\theta C_G] \sim \frac{1}{2^n}, \qquad \mathrm{Var}[\partial_\theta C_L] \sim \frac{1}{\mathrm{poly}(n)} \ \text{(随 } n \text{ 多项式衰减甚至不衰)}. \]

物理图像:非正交态的可分辨性。全局代价要"看"整个 \(2^n\) 维态矢,而两个 Haar 随机态几乎正交(\(|\langle\psi|\phi\rangle| \sim 2^{-n/2}\)),微调参数几乎不改变重叠——所以指数平坦。局部代价只要求逐比特对齐,而逐比特的"方向"在低维空间里变化是多项式级的。启示:写代价函数时,能用局部量就用局部量——这在量子化学里对应"把整体保真度换成局域可观测量"的习惯。

4. 成因三:噪声 —— 指数衰减的另一种来源

第三类结果 (Wang et al., 2021) 表明,退相干噪声本身制造高原,与线路深度、代价函数类型无关。设每层噪声把密度矩阵朝最大混合态方向衰减因子 \(\eta = e^{-\varepsilon}\)\(\varepsilon\) 为单层有效错误率),则对深度 \(L\) 的线路,

\[ \mathrm{Var}[\partial_\theta C] \;\lesssim\; \eta^{2L}\ (\text{无噪声方差}) + O\!\left(\frac{(1-\eta^L)^2}{2^n}\right) \cdot \text{(噪声诱导项)}. \]

两项都是坏消息:第一项随深度指数衰减(信号被噪声吃掉),第二项在深度大时把方差拉向 \(2^{-n}\) 级(态趋向最大混合,梯度信息丢失)。由此得到著名的"幸运深度" (lucky depth) 图像:深度必须随 \(\log(1/\varepsilon)\) 增长才能表达足够复杂的态,但方差却随深度指数缩水——NISQ 时代的变分算法被夹在中间,能可靠训练的规模存在原理性上限。这也解释了为什么第 5、6 章的容错算法路线在长期竞争中不可或缺。

5. 缓解策略:与高原共处的工程学

没有一招通杀,但有一组互补手段,实践中常组合使用:

  1. 浅层 + 问题启发拟设 (problem-inspired ansatz)。用物理/结构先验压缩参数空间(如 UCC、哈密顿量项对应的 Trotter 层、对称性适配层),避免"随机万能线路"。表达力换可训练性——但小心:拟设太弱会陷入"高原没了、最优解也不在参数空间里"的另一种失败。

  2. 局部代价函数(第 3 节):多项式级方差。

  3. 恒等块初始化 / 热启动 (identity-block initialization, warm start)。把初始参数设在使整块线路近似恒等的位置,梯度保持 \(O(1)\);或用经典近似解、前一层的优化结果做初始化。

  4. 分层/逐块训练 (layerwise training)。每次只训练一薄层,单层 landscapes 尚未进入 2-设计区;代价是需要外层调度。

  5. 对称性与守恒量。在正确的对称扇区内工作等效于缩小希尔伯特空间,抑制集中。

  6. 参数关联与过度参数化 (overparametrization)。近期研究显示,当参数多到使损失 landscapes 出现"丰饶盆地"(训练分岔充分多)时,局部极小值质量显著改善——与贫瘠高原并不矛盾:高原是初始化区域的性质,过度参数化改变的是全局 landscapes 几何

  7. 数值体检先行。训练前先在小系统 (\(n \le 12\)) 扫梯度直方图:若方差随 \(n\) 明显指数衰减,先改拟设/代价函数,再谈扩大规模。

最后指出一个统一视角:贫瘠高原、量子核的指数集中(第 8 章)、以及"随机态几乎正交",都是高维希尔伯特空间集中测度的不同侧面。理解了"高维空间里随机的东西全都长得一样"这一点,NISQ 算法设计中一半的"为什么"就有了答案。

本课总结

  • 贫瘠高原 = 梯度方差随比特数指数衰减;\(n=30\) 时已不可训练。

  • 三大成因:随机深层线路(2-设计,\(\mathrm{Var}\sim 4^{-n}\) 量级)、全局代价函数(浅层也平,局部代价可救回多项式级)、噪声(随深度指数衰减 + 最大混合化)。

  • 统一图像是高维集中测度;表达力与可训练性存在张力。

  • 实践对策:问题启发浅拟设、局部代价、恒等初始化、分层训练、对称性、先做小规模梯度体检。

习题

  1. 单参数走查:\(C(\theta) = \langle 0| R_z(\theta)^{\otimes n}\, Z_1\, R_z(\theta)^{\otimes n\,\dagger} |0\rangle\)。证明 \(\partial_\theta C \equiv 0\)——一个"构造出来"的平坦方向;再换 \(H\) 为含 \(X_1\) 的观测量,计算梯度并解释为什么非零。

  2. 数值实验:对硬件高效拟设(\(L\) 层,每层 \(R_y\!-\!R_z\) 加线性纠缠),取 \(n = 4, 6, 8, 10\),随机参数采样估计 \(\mathrm{Var}[\partial_{\theta_{1,1}} C]\),画 \(\log_2 \mathrm{Var}\)\(n\) 的图;再对 \(L = 2, 4, \ldots, 40\) 画对深度的图,观察进入高原的深度阈值。

  3. 证明 \(C_L \le C_G \le n\, C_L\)(提示:若全局保真度高则逐比特都接近;反之逐比特投影均值高则由 Cauchy–Schwarz 推出全局重叠下界)。

  4. 讨论:为何"恒等块初始化"能保住 \(O(1)\) 梯度?(提示:在恒等附近,参数微扰等价于直接对初态加小旋转,作用量不经过高维随机化。)