前置阅读:量子神经网络。建议同时翻阅附录 1:含参量子门中的参数化旋转门记号。
本词条要点:
- 理解贫瘠高原 (Barren Plateau) 现象:参数梯度的方差随量子比特数指数衰减,训练 landscapes 变成一片”平地”。
- 掌握三类主要成因——过深随机线路、全局型代价函数、噪声——各自的物理图像与数学表述。
- 学会从集中测度 (concentration of measure) 的统一视角理解这些成因,以及它与量子核方法中”核指数集中”现象的同源性。
- 掌握实践中的缓解策略:局部代价函数、浅层/问题启发拟设、恒等块初始化、分层训练等。
- 会做”梯度体检”:用小模型数值验证方差随 的指数标度。
1. 现象:训练在指数变平
回顾变分模型:参数化线路 ,代价 ,用梯度下降类优化器训练。随机初始化后,若对参数采样有
则梯度几乎处处接近零:优化器无论往哪个方向走,代价函数都几乎没有变化—— landscapes 成了”高原”。这就是 McClean 等人 (2018) 命名的贫瘠高原。注意它与经典深度学习中的”梯度消失”不同:这不是某一层的问题,而是整个参数空间的梯度范数以高概率集中到零附近(梯度分布的标准差本身指数级小),且随线路规模只会更糟。
一个量级感受: 时 ;测量 次 shots 才能把梯度信噪比拉到 。贫瘠高原不是”训练慢”,而是”训练在原理上不可行”。
2. 成因一:随机深层线路 —— 2-设计给出指数平坦
第一类结果(McClean et al., 2018)考虑随机结构的深层拟设(如硬件高效拟设 hardware-efficient ansatz:每层随机单比特旋转 + 纠缠门,层数据量足够)。核心结论的表述相当干净:
若参数化线路族在随机参数下构成**(近似)酉 2-设计** (unitary 2-design)——即其二阶统计性质与 Haar 随机酉一致——则对任何固定观测量 ,
(不同拟设的精确常数不同,但指数标度 不变;注意到 ,对局部 给出 。)
物理图像:表达力过头的代价。2-设计意味着线路”太随机了”——它能覆盖整个酉群的一切统计性质,代价函数因此对任何参数扰动都极其迟钝。直觉与测度集中 (concentration of measure) 相连:高维酉群上的 Lipschitz 函数(代价函数正是)在 Haar 测度下以极高概率落在均值附近的窄带里,带宽 。表达力与可训练性在这里成了直接的对手:越”万能”的拟设, landscapes 越平。
这不是哲学批评而是可计算的判据:给定拟设,可以数值检验其偏离 2-设计的程度(如比较其二阶矩与 Weingarten 函数给出的 Haar 值),从而预判高原风险。
3. 成因二:代价函数的”全局性” —— 浅层也会高原
第二类结果 (Uvarov, Kardashin & Biamonte, 2020) 给出更微妙的警告:即使线路很浅,只要代价函数是”全局”的,高原依然出现。
对比两种代价。设目标态为 ,拟设输出 :
- 全局代价:(整体保真度);
- 局部代价:, 只作用在第 个比特上的投影(把 的对应比特投影到 第 比特的状态)。
两个代价在描述”离目标多远”上等价——(相差一个多项式因子)。但梯度行为天差地别:对局部观测量加某种结构性假设,有
物理图像:非正交态的可分辨性。全局代价要”看”整个 维态矢,而两个 Haar 随机态几乎正交(),微调参数几乎不改变重叠——所以指数平坦。局部代价只要求逐比特对齐,而逐比特的”方向”在低维空间里变化是多项式级的。启示:写代价函数时,能用局部量就用局部量——这在量子化学里对应”把整体保真度换成局域可观测量”的习惯。
4. 成因三:噪声 —— 指数衰减的另一种来源
第三类结果 (Wang et al., 2021) 表明,退相干噪声本身制造高原,与线路深度、代价函数类型无关。设每层噪声把密度矩阵朝最大混合态方向衰减因子 ( 为单层有效错误率),则对深度 的线路,
两项都是坏消息:第一项随深度指数衰减(信号被噪声吃掉),第二项在深度大时把方差拉向 级(态趋向最大混合,梯度信息丢失)。由此得到著名的”幸运深度” (lucky depth) 图像:深度必须随 增长才能表达足够复杂的态,但方差却随深度指数缩水——NISQ 时代的变分算法被夹在中间,能可靠训练的规模存在原理性上限。这也解释了为什么第 5、6 章的容错算法路线在长期竞争中不可或缺。
5. 缓解策略:与高原共处的工程学
没有一招通杀,但有一组互补手段,实践中常组合使用:
- 浅层 + 问题启发拟设 (problem-inspired ansatz)。用物理/结构先验压缩参数空间(如 UCC、哈密顿量项对应的 Trotter 层、对称性适配层),避免”随机万能线路”。表达力换可训练性——但小心:拟设太弱会陷入”高原没了、最优解也不在参数空间里”的另一种失败。
- 局部代价函数(第 3 节):多项式级方差。
- 恒等块初始化 / 热启动 (identity-block initialization, warm start)。把初始参数设在使整块线路近似恒等的位置,梯度保持 ;或用经典近似解、前一层的优化结果做初始化。
- 分层/逐块训练 (layerwise training)。每次只训练一薄层,单层 landscapes 尚未进入 2-设计区;代价是需要外层调度。
- 对称性与守恒量。在正确的对称扇区内工作等效于缩小希尔伯特空间,抑制集中。
- 参数关联与过度参数化 (overparametrization)。近期研究显示,当参数多到使损失 landscapes 出现”丰饶盆地”(训练分岔充分多)时,局部极小值质量显著改善——与贫瘠高原并不矛盾:高原是初始化区域的性质,过度参数化改变的是全局 landscapes 几何。
- 数值体检先行。训练前先在小系统 () 扫梯度直方图:若方差随 明显指数衰减,先改拟设/代价函数,再谈扩大规模。
最后指出一个统一视角:贫瘠高原、量子核的指数集中、以及”随机态几乎正交”,都是高维希尔伯特空间集中测度的不同侧面。理解了”高维空间里随机的东西全都长得一样”这一点,NISQ 算法设计中一半的”为什么”就有了答案。
本词条总结
- 贫瘠高原 = 梯度方差随比特数指数衰减; 时已不可训练。
- 三大成因:随机深层线路(2-设计, 量级)、全局代价函数(浅层也平,局部代价可救回多项式级)、噪声(随深度指数衰减 + 最大混合化)。
- 统一图像是高维集中测度;表达力与可训练性存在张力。
- 实践对策:问题启发浅拟设、局部代价、恒等初始化、分层训练、对称性、先做小规模梯度体检。
习题
- 单参数走查:。证明 ——一个”构造出来”的平坦方向;再换 为含 的观测量,计算梯度并解释为什么非零。
- 数值实验:对硬件高效拟设( 层,每层 加线性纠缠),取 ,随机参数采样估计 ,画 对 的图;再对 画对深度的图,观察进入高原的深度阈值。
- 证明 (提示:若全局保真度高则逐比特都接近;反之逐比特投影均值高则由 Cauchy–Schwarz 推出全局重叠下界)。
- 讨论:为何”恒等块初始化”能保住 梯度?(提示:在恒等附近,参数微扰等价于直接对初态加小旋转,作用量不经过高维随机化。)
参考资料
- 本词条整理自《量子计算算法教程》原文:ch02-quantum-nn/barren-plateau
- 内容遵循 CC BY-NC-SA 4.0 许可协议