前置阅读:量子神经网络。本词条是的”地基”:VQE/QAOA 之外的一切 QML 模型,先要回答”经典数据怎么进量子态”。

本词条要点:

  1. 掌握四种主流编码(基编码、角度编码、振幅编码、数据重上传)的线路形态、比特数与线路深度权衡。
  2. 理解”编码决定模型”的定量刻画:线路即傅里叶级数(Schuld–Sweke–Meyer 2021)——数据门的生成元谱决定模型能表达的频率。
  3. 认识编码的容量极限:单层编码的表达力瓶颈、 参数 vs 数据维度的计数论证。
  4. 为后一词条量子核方法做好准备:特征映射 与由编码诱导的核
  5. 了解数据加载瓶颈与 QRAM 背景,理解”编码成本必须算进 QML 的账”。

1. 问题: 希尔伯特空间

经典机器学习的数据是 (或离散特征)。量子模型的第一步是选择一个特征映射 (feature map)

并把”训练”交给参数化线路。编码方式的选择不是实现细节——它决定了模型的假设空间、表达力上限与核结构。四种主流方案画像如下。

基编码 (basis encoding):把比特串 直接当计算基。适合离散/二值数据;量子优势的叙事里最少被用到(无非是”指针态”)。

角度编码 (angle encoding):每个特征转一个旋转门,,必要时每特征两角 )。 个比特、深度 ——最便宜、NISQ 标配。代价:每个量子比特只装一个(或两个)标量,且不做多次重上传时表达力受限(见第 3 节)。

振幅编码 (amplitude encoding):把归一化向量当振幅,(需 )。 个比特装下 维数据——账面上最省。代价:制备线路一般需要 级深度(除非数据有结构),“省比特、费门”;且振幅对数据扰动更敏感。量子态制备讨论的就是它的制备成本。

数据重上传 (data re-uploading, Pérez–Salas 等 2018):同一特征 在线路多处重复编码: 是特征旋转、 是可训练酉。动机与能力见第 3 节的计数论证与傅里叶视角——它是”表达力不足”的标准解药,代价是深度线性增长,且要注意与贫瘠高原的深度-可训练性权衡。

编码比特数深度特点
基编码 数据长(若可并行制备)离散数据;本质是”指针”
角度编码NISQ 标配;表达力靠后两层补
振幅编码(一般)省比特费门;制备即瓶颈
数据重上传 可灵活表达力强;深度/高原风险

2. 线路即傅里叶级数:编码决定模型能说什么

考虑最纯粹的”数据仅进入旋转角”的线路: 是生成元,如 ;可训练酉夹在中间),输出观测量 。Schuld–Sweke–Meyer (2021) 的结论:

是每个变量 多元三角多项式,其可达频率集合由生成元谱间隔决定:

例证:单比特 生成元谱 、间隔 2,模型频率 乘重上传次数 ——重上传 = 拉宽频带。若生成元是 (间隔 2)与 (间隔 2),频带结构相同;若引入 之类的缩放,频率整体乘

这给了三条硬结论:

  1. 模型的假设空间在编码那一刻就定了:可训练参数只决定系数 ,不能创造新频率。拟合高频函数(如快速振荡决策边界)必须靠重上传/缩放/深线路扩频带。
  2. 生成元谱是设计旋钮:换一组生成元( vs vs 更高权重的泡利串)等于换频谱结构;“频率资源”与”门开销”在此直接挂钩。
  3. 过简编码的失败可预言:单层单比特角度编码只能学 一阶纹波——很多”QML 不管用”的实验报告,败因在编码而不在优化器。

3. 容量与计数:重上传为什么是解药

计数论证(Schuld–Sweke–Meyer 同文):单份编码(每个 只出现一次)的模型系数自由度只有 量级,而一般 比特观测量需要 个实参数描述。数据重上传让 出现 次,频率集合扩张到 ,系数个数随之指数化(对固定 )。配合 Pérez–Salas 的表达力定理(含重上传的通用近似:足够层数的单比特重上传线路可逼近任意单比特函数),重上传成为”小系统上表达力/深度折中”的标准答案。

贫瘠高原的联动必须写进设计文档:重上传增加深度 逼近 2-设计 梯度方差指数缩水。实务折中: 小深度重上传 + 局部代价函数 + 恒等初始化。

4. 编码诱导的核:通往量子核方法

对任意编码 ,定义

是正定核(可由构造验证),于是每个编码天然定义一个 RKHS 与一个核方法模型——这正是下一篇文章的主角。此处只强调因果链:编码 模型的归纳偏置。例如角度编码下, 型纹波衰减,纹波频率又是生成元谱——傅里叶视角与核视角在”频率”处会师。

5. 数据加载的现实:QML 的账要算全

维经典数据装进量子态,一般性制备成本 起步(振幅编码的下界即排序网络的规模量级)。这带来 QML 文献反复争论的”输入瓶颈”:

  • 若每条样本都要 经典工作来加载,任何对样本量的亚线性改进都会被输入成本吞掉。理论上的出路是量子原生数据(数据本来就在量子态里:量子传感、量子模拟的输出)或 QRAM 式结构化加载QRAM)。
  • 设计规范:报告 QML 复杂度时单列数据加载成本(“假设数据已在振幅中”与”含加载”是两个命题),并把编码选型与数据规模一起陈述——这是审稿与复现的第一道门槛。

本词条总结

  • 四种编码的画像:基(指针)、角度(、浅、NISQ 标配)、振幅( 比特、制备贵)、重上传(表达力换深度)。
  • 线路即傅里叶级数:生成元谱决定可达频率,参数只调系数不扩频带;重上传/缩放/深线路是扩频带的三种手段。
  • 容量计数解释单层编码的表达力天花板与重上传的必要性;深度换表达力要过贫瘠高原的关卡。
  • 每个编码诱导正定核 ,编码设计 = 核设计的另一种说法(下篇展开)。
  • 数据加载成本必须进账:量子原生数据或 QRAM 是绕开输入瓶颈的两条正路。

习题

  1. 频谱手算: 为固定酉),证明输出 频率的三角多项式;再证明把第二个门换成 后频率集合变为 的子集。
  2. 显式核:计算角度编码 的核 ,画出 的图像并说明其”相似度”语义( 多大时两样本在核眼中”最不相似”?)。
  3. 重上传实验:用 1 个量子比特、 层重上传拟合 ),扫描 的训练误差,验证频带扩张与拟合成功的关系。
  4. 论证题:证明振幅编码的任意态制备需要 级基本门(提示:参数计数/维度论证即可),并讨论为什么”数据有结构”(稀疏、低秩、树状)是唯一的逃逸通道。

参考资料