量子核方法详解:核技巧、指数集中与优势边界

前置阅读:量子数据编码详解(特征映射与诱导核)、量子神经网络的贫瘠高原(集中测度视角,本篇第 4 节直接续用)。

课程目标:

  1. 复习经典核方法的最小必需件(核技巧、RKHS、SVM 对偶式),确保量子部分不悬空。

  2. 掌握量子核的定义(投影核)、从线路估计核矩阵的方法(内积碰撞测量)与完整训练流程。

  3. 理解"QNN 与核方法等价"的视角转换(Schuld 2021):变分模型其实是某个量子核 RKHS 里的线性模型。

  4. 认清两个关键事实:核难算 ≠ 优势(学习论分离与反例),以及核指数集中(深度/纠缠把核推向常数,与贫瘠高原同源)。

  5. 会按规范(核矩阵可经典模拟吗?核是否已集中?任务有没有结构?)评估一篇量子核论文的成色。

1. 经典核方法:三十秒到所需的全部

给定特征映射 \(\phi: \mathcal X \to \mathcal H\)(希尔伯特空间),核函数 \(k(x, x') = \langle\phi(x), \phi(x')\rangle\)核技巧:一切只依赖内积的算法(SVM、核回归、核 PCA、高斯过程)都无需显式 \(\phi\),只需核矩阵 \(K_{ij} = k(x_i, x_j)\)。Mercer 定理保证正定核对应唯一再生核希尔伯特空间 (RKHS),模型假设空间 = RKHS 中的函数。软间隔 SVM 的对偶形式是典型:

\[ \max_\alpha \sum_i \alpha_i - \tfrac12 \sum_{ij} \alpha_i\alpha_j y_i y_j\, k(x_i,x_j), \quad \text{s.t. } 0\le\alpha_i\le C,\ \sum_i \alpha_i y_i = 0, \]

解为 \(f(x) = \sum_i \alpha_i y_i\, k(x_i, x)\)——模型完全由核决定。把 \(\phi\) 换成量子特征映射,就进入本篇。

2. 量子核:定义、估计与流程

定义。取编码线路 \(U_\phi(x)\)(第 8 章上篇),量子特征态 \(|\phi(x)\rangle = U_\phi(x)|0\rangle^{\otimes n}\)。两种标准核:

\[ k_{\text{inprod}}(x, x') = \big|\langle\phi(x)|\phi(x')\rangle\big|^2 \quad (\text{内积/碰撞核}), \qquad k_{\text{proj}}(x, x') = \langle\phi(x)|\,\rho(x')\,|\phi(x)\rangle \quad (\text{投影核,}\ \rho = |\phi\rangle\langle\phi| \text{ 或混合推广}). \]

核的线路估计(无需任何振幅估计):内积核有两条标准路——(a) 交换检验:制备 \(|\phi(x)\rangle|\phi(x')\rangle\),对两寄存器做受控 SWAP、测辅助比特,成功概率 \(\tfrac{1 + |\langle\phi(x)|\phi(x')\rangle|^2}{2}\);(b) 碰撞测量(NISQ 主力):把 \(U_\phi^\dagger(x')U_\phi(x)\) 串在线路末尾、测全零概率——\(\Pr(0^n) = |\langle\phi(x)|\phi(x')\rangle|^2 = k(x,x')\)\(O(\log(1/\delta)/\varepsilon^2)\) 次采样把每对核值估到加性 \(\varepsilon\)。对角项 \(k(x,x)=1\) 自动归一。

完整流程("量子核 SVM"):

  1. 选编码 \(U_\phi\)(这是全部的模型设计,见第 4 节的设计准则);

  2. 对训练集 \(\{x_i\}_{i=1}^M\) 估核矩阵 \(K\)\(M(M+1)/2\) 次两两碰撞测量,量子设备只做这一步;

  3. 经典侧解 SVM 对偶(或核回归/GP);

  4. 预测时同样在线路上估 \(k(x_{\text{test}}, x_i)\),代入 \(f(x)\)

与 QNN(第 2 章)的关键工程区别:没有变分优化——不训参数、无 landscapes、天然免疫贫瘠高原的优化难题(第 4 节会看到核有自己的"集中"病)。量子的角色被压缩为"计算一个经典难算的核矩阵"。

3. 视角转换:变分 QNN 其实是核模型

Schuld (2021) 的观察给两类模型画了等号。固定数据编码 \(U_\phi(x)\) 与可训练线路 \(W(\boldsymbol\theta)\),模型

\[ f_{\boldsymbol\theta}(x) = \langle 0| W^\dagger U_\phi^\dagger(x)\, M\, U_\phi(x) W |0\rangle = \langle \phi'(x)|\, \underbrace{W^\dagger M W}_{\rho_W}\, |\phi'(x)\rangle, \]

其中 \(|\phi'(x)\rangle = U_\phi(x)W|0\rangle\) 是"把可训练酉搬进编码"后的新特征映射、\(\rho_W\) 是可训练观测量。于是:任何监督式 QNN = 某个(数据依赖的)量子核 RKHS 里的线性模型,可训练参数只是在选 RKHS 里的方向。两个直接推论:

  • 分析 QNN 泛化时,正确的工具是核/RKHS 的容量度量(核的谱、有效维度),而不是经典深度学习的那套直觉;

  • QNN 相对核方法唯一的"增量"是优化过程中特征映射本身在动(\(W\) 进了 \(\phi'\))——这正是训练困难(高原)与核集中风险的来源。

4. 优势的边界:难算的核不等于好用的核

(a) 分离结果与它的反面。Liu 等 (2021, Nature Physics) 构造了"不交核" (disjoint kernels) 的学习问题:某量子核把两类样本映到近乎正交的子空间,量子 SVM 以 \(O(\mathrm{poly})\) 样本完美分类;并证明在标准密码假设下,经典算法(即使把核当作预言机来采样)需要指数多样本。这是量子核的第一个严格学习论加速。但同一框架立刻给出对称的坏消息:也存在量子核上的问题,经典(去量子化/dequantization 式)方法多项式可解而任何用量子核的算法都要指数样本。结论是刻薄而清醒的:"量子核难经典计算"本身不构成优势的证据;优势取决于核与任务标签结构的匹配。审稿口径:没有"任务结构 ↔ 核结构"论证的核加速主张,默认存疑。

(b) 指数集中:核的贫瘠高原。第二重边界来自集中测度(第 2 章贫瘠高原的孪生现象)。近期结果(Thanasilp 等,2024)表明:当编码线路随比特数 \(n\)、深度 \(L\) 或纠缠量增长时,随机采样的两个核值以高概率集中到期望值附近,涨落指数级缩小:

\[ k(x,x') \;\approx\; \bar k \ \text{(常数)} + O\!\left(2^{-n}\right) \text{ 级涨落}. \]

核矩阵一旦"糊成一片"(对角占优消失、谱塌缩),SVM 学不到任何结构——能表达的核太多,能用的核太少。与高原同源的原因:高维希尔伯特空间中随机量子态几乎正交(\(\bar k \to 0\)),任何 Lipchitz 泛函集中。缓解策略也与高原一脉相承:浅编码、低纠缠、局域核(只对子集比特编码后拼接)、把可训练缩放参数放进 \(U_\phi\) 来"撑开"核的动态范围、以及小规模诊断先行——训练前先画训练集核值的直方图,若已集中在单点,换编码再谈。

(c) 全流程成本的现实。核矩阵 \(M^2\) 级的量子估计 + 经典 \(O(M^3)\) 的 SVM 求解;与经典核(高斯核等 \(O(1)\) 评估)对比时,量子核每对的 \(\varepsilon^{-2}\) 采样开销必须入账。量子核的合理生态位:数据量子原生(传感器/模拟器输出)、或任务结构已知与某类多体纠缠特征对齐(如相位分类、量子数据纠错)的场景。

5. 设计清单:怎么挑一个能用 的量子核

把本篇收成一张可执行的检查表:

  1. 数据从哪来? 经典数据 + 昂贵加载 \(\Rightarrow\) 先算总账(上篇第 5 节);量子原生 \(\Rightarrow\) 核路线天然合理。

  2. 核有没有集中?\(k(x_i,x_j)\)\(i\ne j\))直方图:宽度 \(\gtrsim 1/\mathrm{poly}\) 才有信息;指数窄 \(\Rightarrow\) 减深度/减纠缠/改局域核。

  3. 核能不能经典模拟? 能(低纠缠、稳定子段、小 \(n\)\(\Rightarrow\) 直接经典算核矩阵,量子设备没有存在感;不能 \(\Rightarrow\) 追问"任务标签结构为什么恰好和这个难算的核对齐"(拿出分离式的论证,而不是耸肩)。

  4. 基线跑了吗? 高斯核、随机特征、梯度提升——量子核论文的第一张表永远是经典基线。

  5. 规模诚实吗? \(\varepsilon^{-2}\) 采样、\(M^2\) 对核值、\(M^3\) 经典求解,全部写进复杂度栏。

本课总结

  • 量子核 = 编码线路诱导的正定核;NISQ 上用碰撞测量估核矩阵,经典侧解 SVM——量子只做"难算的相似度"。

  • 视角转换:监督式 QNN 就是(数据依赖)量子核 RKHS 里的线性模型;变分训练的全部增量在于特征映射本身随优化在动。

  • 优势边界有三重:分离结果真实存在但依赖任务-核匹配;"难算"本身不是优势(有对称的反例);指数集中让深/纠缠编码的核失去分辨力(高原的孪生病)。

  • 设计清单五问:数据来源、集中诊断、经典可模拟性、经典基线、全成本核算。

习题

  1. 证明碰撞测量 \(\Pr(0^n) = |\langle\phi(x)|\phi(x')\rangle|^2\)(提示:把 \(U^\dagger U'\) 的作用展开到初态上);并推导用 \(N\) 次采样估计核值的标准差。

  2. 手算上篇习题 2 的角度编码核 \(k(x,x')\) 对应的 RKHS:证明其函数形如 \(f(x) = a\cos x + b\sin x + c\),并据此说明"该编码的 SVM 只能学一阶纹波边界"。

  3. 集中实验:对 \(n\) 比特随机铺开的角度编码(特征填充后接随机纠缠层,深度 \(L\)),数值计算训练集两两核值的方差随 \((n, L)\) 的标度;找出"核可用"的深度阈值曲线。

  4. 证明"不交核"分离的采样下界直觉版:若两类样本的核子空间正交(类内 \(k \approx 1\)、类间 \(k \approx 0\)),SVM 样本复杂度为何是 \(O(\log M)\) 级;再说明若核集中为常数,同一论证如何反转为不可学习。

  5. 思考题:把第 2 章贫瘠高原与本篇核集中并排,用集中测度写一段"统一说明"(两者各自集中的对象是什么泛函?为什么纠缠量都出现在指数上?)。