# 量子神经网络的贫瘠高原:表达力、梯度集中与可训练性 *前置阅读:[量子神经网络](quantum-neural-network.md)。建议同时翻阅[附录 1:含参量子门](parametrized-gates-appendix.md)中的参数化旋转门记号。* **课程目标:** 1. 理解**贫瘠高原 (Barren Plateau)** 现象:参数梯度的方差随量子比特数指数衰减,训练 landscapes 变成一片"平地"。 2. 掌握三类主要成因——**过深随机线路**、**全局型代价函数**、**噪声**——各自的物理图像与数学表述。 3. 学会从**集中测度 (concentration of measure)** 的统一视角理解这些成因,以及它与第 8 章量子核方法中"核指数集中"现象的同源性。 4. 掌握实践中的缓解策略:局部代价函数、浅层/问题启发拟设、恒等块初始化、分层训练等。 5. 会做"梯度体检":用小模型数值验证方差随 $n$ 的指数标度。 ## 1. 现象:训练在指数变平 回顾变分模型:参数化线路 $U(\boldsymbol\theta)$,代价 $C(\boldsymbol\theta) = \langle 0| U^\dagger(\boldsymbol\theta)\, H\, U(\boldsymbol\theta) |0\rangle$,用梯度下降类优化器训练。随机初始化后,若对参数采样有 $$ \mathrm{Var}_{\boldsymbol\theta}\!\left[\frac{\partial C}{\partial \theta_j}\right] \sim \frac{1}{2^{n}} \quad (\text{随比特数 } n \text{ 指数衰减}), $$ 则梯度几乎处处接近零:优化器无论往哪个方向走,代价函数都几乎没有变化—— landscapes 成了"高原"。这就是 McClean 等人 (2018) 命名的贫瘠高原。注意它与经典深度学习中的"梯度消失"不同:这不是某一层的问题,而是**整个参数空间的梯度范数以高概率集中到零附近**(梯度分布的标准差本身指数级小),且随线路规模只会更糟。 一个量级感受:$n = 30$ 时 $2^{-n} \approx 10^{-9}$;测量 $10^9$ 次 shots 才能把梯度信噪比拉到 $O(1)$。贫瘠高原不是"训练慢",而是"训练在原理上不可行"。 ## 2. 成因一:随机深层线路 —— 2-设计给出指数平坦 第一类结果(McClean et al., 2018)考虑**随机结构的深层拟设**(如硬件高效拟设 hardware-efficient ansatz:每层随机单比特旋转 + 纠缠门,层数据量足够)。核心结论的表述相当干净: > 若参数化线路族在随机参数下构成**(近似)酉 2-设计** (unitary 2-design)——即其二阶统计性质与 Haar 随机酉一致——则对任何固定观测量 $H$, > $$ \mathrm{Var}\!\left[\partial_{\theta} C\right] = \frac{\|H - \mathrm{tr}(H)I/2^n\|^2_{\mathrm{F}}}{2^{2n+1}(2^n+1)\cdot(\text{门的结构因子})} \;\lesssim\; \frac{\mathrm{poly}(n)}{4^n}. $$ (不同拟设的精确常数不同,但指数标度 $4^{-n}$ 不变;注意到 $\|H-\mathrm{tr}(H)I/2^n\|_F^2 \le \|H\|_F^2 \le 2^n\|H\|^2$,对局部 $H$ 给出 $\mathrm{Var} \lesssim 2^{-n}$。) **物理图像:表达力过头的代价**。2-设计意味着线路"太随机了"——它能覆盖整个酉群的一切统计性质,代价函数因此对任何参数扰动都极其迟钝。直觉与测度集中 (concentration of measure) 相连:高维酉群上的 Lipschitz 函数(代价函数正是)在 Haar 测度下以极高概率落在均值附近的窄带里,带宽 $\sim 1/\sqrt{\text{维度}} \sim 2^{-n}$。**表达力与可训练性在这里成了直接的对手**:越"万能"的拟设, landscapes 越平。 这不是哲学批评而是可计算的判据:给定拟设,可以数值检验其偏离 2-设计的程度(如比较其二阶矩与 Weingarten 函数给出的 Haar 值),从而预判高原风险。 ## 3. 成因二:代价函数的"全局性" —— 浅层也会高原 第二类结果 (Uvarov, Kardashin & Biamonte, 2020) 给出更微妙的警告:**即使线路很浅,只要代价函数是"全局"的,高原依然出现**。 对比两种代价。设目标态为 $|\psi\rangle$,拟设输出 $|\phi(\boldsymbol\theta)\rangle = U(\boldsymbol\theta)|0\rangle$: - **全局代价**:$C_G = 1 - |\langle\psi|\phi\rangle|^2$(整体保真度); - **局部代价**:$C_L = 1 - \frac1n \sum_{i=1}^n \langle\phi| \Pi_i |\phi\rangle$,$\Pi_i$ 只作用在第 $i$ 个比特上的投影(把 $|\psi\rangle$ 的对应比特投影到 $|\psi\rangle$ 第 $i$ 比特的状态)。 两个代价在描述"离目标多远"上等价——$C_L \le C_G \le n\, C_L$(相差一个多项式因子)。但梯度行为天差地别:对局部观测量加某种结构性假设,有 $$ \mathrm{Var}[\partial_\theta C_G] \sim \frac{1}{2^n}, \qquad \mathrm{Var}[\partial_\theta C_L] \sim \frac{1}{\mathrm{poly}(n)} \ \text{(随 } n \text{ 多项式衰减甚至不衰)}. $$ **物理图像:非正交态的可分辨性**。全局代价要"看"整个 $2^n$ 维态矢,而两个 Haar 随机态几乎正交($|\langle\psi|\phi\rangle| \sim 2^{-n/2}$),微调参数几乎不改变重叠——所以指数平坦。局部代价只要求逐比特对齐,而逐比特的"方向"在低维空间里变化是多项式级的。**启示:写代价函数时,能用局部量就用局部量**——这在量子化学里对应"把整体保真度换成局域可观测量"的习惯。 ## 4. 成因三:噪声 —— 指数衰减的另一种来源 第三类结果 (Wang et al., 2021) 表明,**退相干噪声本身制造高原**,与线路深度、代价函数类型无关。设每层噪声把密度矩阵朝最大混合态方向衰减因子 $\eta = e^{-\varepsilon}$($\varepsilon$ 为单层有效错误率),则对深度 $L$ 的线路, $$ \mathrm{Var}[\partial_\theta C] \;\lesssim\; \eta^{2L}\ (\text{无噪声方差}) + O\!\left(\frac{(1-\eta^L)^2}{2^n}\right) \cdot \text{(噪声诱导项)}. $$ 两项都是坏消息:第一项随深度指数衰减(信号被噪声吃掉),第二项在深度大时把方差拉向 $2^{-n}$ 级(态趋向最大混合,梯度信息丢失)。由此得到著名的"幸运深度" (lucky depth) 图像:**深度必须随 $\log(1/\varepsilon)$ 增长才能表达足够复杂的态,但方差却随深度指数缩水**——NISQ 时代的变分算法被夹在中间,能可靠训练的规模存在原理性上限。这也解释了为什么第 5、6 章的容错算法路线在长期竞争中不可或缺。 ## 5. 缓解策略:与高原共处的工程学 没有一招通杀,但有一组互补手段,实践中常组合使用: 1. **浅层 + 问题启发拟设 (problem-inspired ansatz)**。用物理/结构先验压缩参数空间(如 UCC、哈密顿量项对应的 Trotter 层、对称性适配层),避免"随机万能线路"。表达力换可训练性——但小心:拟设太弱会陷入"高原没了、最优解也不在参数空间里"的另一种失败。 2. **局部代价函数**(第 3 节):多项式级方差。 3. **恒等块初始化 / 热启动 (identity-block initialization, warm start)**。把初始参数设在使整块线路近似恒等的位置,梯度保持 $O(1)$;或用经典近似解、前一层的优化结果做初始化。 4. **分层/逐块训练 (layerwise training)**。每次只训练一薄层,单层 landscapes 尚未进入 2-设计区;代价是需要外层调度。 5. **对称性与守恒量**。在正确的对称扇区内工作等效于缩小希尔伯特空间,抑制集中。 6. **参数关联与过度参数化 (overparametrization)**。近期研究显示,当参数多到使损失 landscapes 出现"丰饶盆地"(训练分岔充分多)时,局部极小值质量显著改善——与贫瘠高原并不矛盾:高原是**初始化区域**的性质,过度参数化改变的是**全局 landscapes 几何**。 7. **数值体检先行**。训练前先在小系统 ($n \le 12$) 扫梯度直方图:若方差随 $n$ 明显指数衰减,先改拟设/代价函数,再谈扩大规模。 最后指出一个统一视角:贫瘠高原、量子核的指数集中(第 8 章)、以及"随机态几乎正交",都是**高维希尔伯特空间集中测度**的不同侧面。理解了"高维空间里随机的东西全都长得一样"这一点,NISQ 算法设计中一半的"为什么"就有了答案。 ## 本课总结 - 贫瘠高原 = 梯度方差随比特数指数衰减;$n=30$ 时已不可训练。 - 三大成因:随机深层线路(2-设计,$\mathrm{Var}\sim 4^{-n}$ 量级)、全局代价函数(浅层也平,局部代价可救回多项式级)、噪声(随深度指数衰减 + 最大混合化)。 - 统一图像是高维集中测度;表达力与可训练性存在张力。 - 实践对策:问题启发浅拟设、局部代价、恒等初始化、分层训练、对称性、先做小规模梯度体检。 ## 习题 1. 单参数走查:$C(\theta) = \langle 0| R_z(\theta)^{\otimes n}\, Z_1\, R_z(\theta)^{\otimes n\,\dagger} |0\rangle$。证明 $\partial_\theta C \equiv 0$——一个"构造出来"的平坦方向;再换 $H$ 为含 $X_1$ 的观测量,计算梯度并解释为什么非零。 2. 数值实验:对硬件高效拟设($L$ 层,每层 $R_y\!-\!R_z$ 加线性纠缠),取 $n = 4, 6, 8, 10$,随机参数采样估计 $\mathrm{Var}[\partial_{\theta_{1,1}} C]$,画 $\log_2 \mathrm{Var}$ 对 $n$ 的图;再对 $L = 2, 4, \ldots, 40$ 画对深度的图,观察进入高原的深度阈值。 3. 证明 $C_L \le C_G \le n\, C_L$(提示:若全局保真度高则逐比特都接近;反之逐比特投影均值高则由 Cauchy–Schwarz 推出全局重叠下界)。 4. 讨论:为何"恒等块初始化"能保住 $O(1)$ 梯度?(提示:在恒等附近,参数微扰等价于直接对初态加小旋转,作用量不经过高维随机化。)