# 量子数据编码详解:从角度编码到数据重上传 *前置阅读:[量子神经网络](../ch02-quantum-nn/quantum-neural-network.md)(第 2 章)。本篇是第 8 章的"地基":VQE/QAOA 之外的一切 QML 模型,先要回答"经典数据怎么进量子态"。* **课程目标:** 1. 掌握四种主流编码(基编码、角度编码、振幅编码、数据重上传)的线路形态、比特数与线路深度权衡。 2. 理解"编码决定模型"的定量刻画:**线路即傅里叶级数**(Schuld–Sweke–Meyer 2021)——数据门的生成元谱决定模型能表达的频率。 3. 认识编码的容量极限:单层编码的表达力瓶颈、$O(2^n)$ 参数 vs 数据维度的计数论证。 4. 为下一章量子核方法做好准备:特征映射 $\phi(x)$ 与由编码诱导的核 $k(x,x')$。 5. 了解数据加载瓶颈与 QRAM 背景,理解"编码成本必须算进 QML 的账"。 ## 1. 问题:$\mathbb R^d \to$ 希尔伯特空间 经典机器学习的数据是 $\boldsymbol x \in \mathbb R^d$(或离散特征)。量子模型的第一步是选择一个**特征映射 (feature map)** $$ \boldsymbol x \;\mapsto\; |\phi(\boldsymbol x)\rangle \in \mathcal H, \qquad U_\phi(\boldsymbol x)|0\rangle^{\otimes n} = |\phi(\boldsymbol x)\rangle, $$ 并把"训练"交给参数化线路(第 2 章)。编码方式的选择不是实现细节——它决定了模型的假设空间、表达力上限与核结构。四种主流方案画像如下。 **基编码 (basis encoding)**:把比特串 $\boldsymbol x \in \{0,1\}^n$ 直接当计算基矢 $|\boldsymbol x\rangle$。适合离散/二值数据;量子优势的叙事里最少被用到(无非是"指针态")。 **角度编码 (angle encoding)**:每个特征转一个旋转门,$|\phi(\boldsymbol x)\rangle = \bigotimes_{i=1}^{d} R_\sigma(x_i)|0\rangle$($\sigma \in \{X,Y,Z\}$,必要时每特征两角 $R_\phi(x_{2i})R_\theta(x_{2i+1})$)。**$n = d$ 个比特、深度 $O(1)$**——最便宜、NISQ 标配。代价:每个量子比特只装一个(或两个)标量,且不做多次重上传时表达力受限(见第 3 节)。 **振幅编码 (amplitude encoding)**:把归一化向量当振幅,$|\phi\rangle = \sum_{j=0}^{2^n-1} x_j |j\rangle$(需 $\|\boldsymbol x\|_2 = 1$)。**$n = \log_2 d$ 个比特**装下 $d$ 维数据——账面上最省。代价:制备线路一般需要 $O(2^n)$ 级深度(除非数据有结构),"省比特、费门";且振幅对数据扰动更敏感。第 7 章[量子态制备](../ch07-quantum-info/quantum-state-preparation-tutorial.md)讨论的就是它的制备成本。 **数据重上传 (data re-uploading, Pérez–Salas 等 2018)**:同一特征 $x$ 在线路**多处**重复编码:$U(\boldsymbol x,\boldsymbol\theta) = \prod_{\ell=1}^{L} \big[W_\ell(\boldsymbol\theta)\, V_\ell(\boldsymbol x)\big]$,$V_\ell$ 是特征旋转、$W_\ell$ 是可训练酉。动机与能力见第 3 节的计数论证与傅里叶视角——它是"表达力不足"的标准解药,代价是深度线性增长,且要注意与[贫瘠高原](../ch02-quantum-nn/barren-plateau.md)的深度-可训练性权衡。 | 编码 | 比特数 | 深度 | 特点 | |---|---|---|---| | 基编码 | $n = $ 数据长 | $O(1)$(若可并行制备) | 离散数据;本质是"指针" | | 角度编码 | $n = d$ | $O(1)$ | NISQ 标配;表达力靠后两层补 | | 振幅编码 | $n = \log_2 d$ | $O(d)$(一般) | 省比特费门;制备即瓶颈 | | 数据重上传 | $\ge\! \log d$ 可灵活 | $O(L)$ | 表达力强;深度/高原风险 | ## 2. 线路即傅里叶级数:编码决定模型能说什么 考虑最纯粹的"数据仅进入旋转角"的线路:$U(\boldsymbol x) = \prod_j e^{i x_j H_j}$($H_j$ 是生成元,如 $Z$ 或 $ZZ$;可训练酉夹在中间),输出观测量 $f(\boldsymbol x) = \langle 0|U^\dagger(\boldsymbol x)\,M\,U(\boldsymbol x)|0\rangle$。Schuld–Sweke–Meyer (2021) 的结论: > $f(\boldsymbol x)$ 是每个变量 $x_j$ 的**多元三角多项式**,其可达频率集合由生成元谱间隔决定: > $$ f(\boldsymbol x) = \sum_{\boldsymbol\omega \in \Omega} c_{\boldsymbol\omega}\, e^{i\boldsymbol\omega\cdot \boldsymbol x}, \qquad \Omega \subseteq \{\text{生成元谱差的整系数组合}\}. $$ 例证:单比特 $R_Z(x)$ 生成元谱 $\{+1,-1\}$、间隔 2,模型频率 $\Omega \subseteq \{0, \pm1\}$ 乘重上传次数 $L$ 后 $\subseteq \{0, \pm1, \ldots, \pm L\}$——**重上传 = 拉宽频带**。若生成元是 $ZZ$(间隔 2)与 $Z$(间隔 2),频带结构相同;若引入 $R_Z(\pi x)$ 之类的缩放,频率整体乘 $\pi$。 这给了三条硬结论: 1. **模型的假设空间在编码那一刻就定了**:可训练参数只决定系数 $c_\boldsymbol\omega$,不能创造新频率。拟合高频函数(如快速振荡决策边界)必须靠重上传/缩放/深线路扩频带。 2. **生成元谱是设计旋钮**:换一组生成元($X$ vs $ZZ$ vs 更高权重的泡利串)等于换频谱结构;"频率资源"与"门开销"在此直接挂钩。 3. **过简编码的失败可预言**:单层单比特角度编码只能学 $\sin/\cos$ 一阶纹波——很多"QML 不管用"的实验报告,败因在编码而不在优化器。 ## 3. 容量与计数:重上传为什么是解药 **计数论证**(Schuld–Sweke–Meyer 同文):单份编码(每个 $x_j$ 只出现一次)的模型系数自由度只有 $O(\mathrm{poly})$ 量级,而一般 $n$ 比特观测量需要 $O(4^n)$ 个实参数描述。数据重上传让 $x$ 出现 $L$ 次,频率集合扩张到 $\Omega \sim \{-L,\ldots,L\}^{d}$,系数个数随之指数化(对固定 $d$)。配合 Pérez–Salas 的表达力定理(含重上传的通用近似:足够层数的单比特重上传线路可逼近任意单比特函数),重上传成为"小系统上表达力/深度折中"的标准答案。 与第 2 章[贫瘠高原](../ch02-quantum-nn/barren-plateau.md)的联动必须写进设计文档:重上传增加深度 $\to$ 逼近 2-设计 $\to$ 梯度方差指数缩水。实务折中:$L = O(\mathrm{poly})$ 小深度重上传 + 局部代价函数 + 恒等初始化。 ## 4. 编码诱导的核:通往量子核方法 对任意编码 $U_\phi(\boldsymbol x)$,定义 $$ k(\boldsymbol x, \boldsymbol x') \;=\; \big|\langle 0| U_\dagger^\dagger(\boldsymbol x')\, U_\phi(\boldsymbol x) |0\rangle\big|^2 \quad (\text{或其不去模方的投影核版本}). $$ $k$ 是正定核(可由构造验证),于是**每个编码天然定义一个 RKHS 与一个核方法模型**——这正是下一篇文章的主角。此处只强调因果链:**编码 $\to$ 核 $\to$ 模型的归纳偏置**。例如角度编码下,$k$ 随 $|\boldsymbol x - \boldsymbol x'|$ 以 $\cos$ 型纹波衰减,纹波频率又是生成元谱——傅里叶视角与核视角在"频率"处会师。 ## 5. 数据加载的现实:QML 的账要算全 把 $d$ 维经典数据装进量子态,一般性制备成本 $O(d)$ 起步(振幅编码的下界即排序网络的规模量级)。这带来 QML 文献反复争论的"输入瓶颈": - 若每条样本都要 $O(d)$ 经典工作来加载,任何对样本量的亚线性改进都会被输入成本吞掉。理论上的出路是**量子原生数据**(数据本来就在量子态里:量子传感、量子模拟的输出)或 **QRAM 式结构化加载**(第 7 章 [QRAM](../ch07-quantum-info/data-qram-tutorial.md))。 - 设计规范:报告 QML 复杂度时**单列数据加载成本**("假设数据已在振幅中"与"含加载"是两个命题),并把编码选型与数据规模一起陈述——这是审稿与复现的第一道门槛。 ## 本课总结 - 四种编码的画像:基(指针)、角度($n=d$、浅、NISQ 标配)、振幅($\log d$ 比特、制备贵)、重上传(表达力换深度)。 - 线路即傅里叶级数:生成元谱决定可达频率,参数只调系数不扩频带;重上传/缩放/深线路是扩频带的三种手段。 - 容量计数解释单层编码的表达力天花板与重上传的必要性;深度换表达力要过贫瘠高原的关卡。 - 每个编码诱导正定核 $k(x,x')$,编码设计 = 核设计的另一种说法(下篇展开)。 - 数据加载成本必须进账:量子原生数据或 QRAM 是绕开输入瓶颈的两条正路。 ## 习题 1. 频谱手算:$U(x) = R_Z(x)\cdot W\cdot R_Z(x)$($W$ 为固定酉),证明输出 $\langle Z\rangle$ 是 $\{0,\pm1,\pm2\}$ 频率的三角多项式;再证明把第二个门换成 $R_Z(3x)$ 后频率集合变为 $\{0,\pm1,\pm2,\pm3,\pm4\}$ 的子集。 2. 显式核:计算角度编码 $\phi(x) = R_Y(x)|0\rangle$ 的核 $k(x,x') = |\langle\phi(x)|\phi(x')\rangle|^2$,画出 $k$ 随 $\Delta = x - x'$ 的图像并说明其"相似度"语义($\Delta$ 多大时两样本在核眼中"最不相似"?)。 3. 重上传实验:用 1 个量子比特、$L$ 层重上传拟合 $f^\star(x) = \sin(3x) + \cos(5x)/2$($x \in [0, 2\pi]$),扫描 $L = 1, \ldots, 8$ 的训练误差,验证频带扩张与拟合成功的关系。 4. 论证题:证明振幅编码的任意态制备需要 $\Omega(d)$ 级基本门(提示:参数计数/维度论证即可),并讨论为什么"数据有结构"(稀疏、低秩、树状)是唯一的逃逸通道。