前置阅读:量子神经网络。本词条是的”地基”:VQE/QAOA 之外的一切 QML 模型,先要回答”经典数据怎么进量子态”。
本词条要点:
- 掌握四种主流编码(基编码、角度编码、振幅编码、数据重上传)的线路形态、比特数与线路深度权衡。
- 理解”编码决定模型”的定量刻画:线路即傅里叶级数(Schuld–Sweke–Meyer 2021)——数据门的生成元谱决定模型能表达的频率。
- 认识编码的容量极限:单层编码的表达力瓶颈、 参数 vs 数据维度的计数论证。
- 为后一词条量子核方法做好准备:特征映射 与由编码诱导的核 。
- 了解数据加载瓶颈与 QRAM 背景,理解”编码成本必须算进 QML 的账”。
1. 问题: 希尔伯特空间
经典机器学习的数据是 (或离散特征)。量子模型的第一步是选择一个特征映射 (feature map)
并把”训练”交给参数化线路。编码方式的选择不是实现细节——它决定了模型的假设空间、表达力上限与核结构。四种主流方案画像如下。
基编码 (basis encoding):把比特串 直接当计算基矢 。适合离散/二值数据;量子优势的叙事里最少被用到(无非是”指针态”)。
角度编码 (angle encoding):每个特征转一个旋转门,(,必要时每特征两角 )。 个比特、深度 ——最便宜、NISQ 标配。代价:每个量子比特只装一个(或两个)标量,且不做多次重上传时表达力受限(见第 3 节)。
振幅编码 (amplitude encoding):把归一化向量当振幅,(需 )。 个比特装下 维数据——账面上最省。代价:制备线路一般需要 级深度(除非数据有结构),“省比特、费门”;且振幅对数据扰动更敏感。量子态制备讨论的就是它的制备成本。
数据重上传 (data re-uploading, Pérez–Salas 等 2018):同一特征 在线路多处重复编码:, 是特征旋转、 是可训练酉。动机与能力见第 3 节的计数论证与傅里叶视角——它是”表达力不足”的标准解药,代价是深度线性增长,且要注意与贫瘠高原的深度-可训练性权衡。
| 编码 | 比特数 | 深度 | 特点 |
|---|---|---|---|
| 基编码 | 数据长 | (若可并行制备) | 离散数据;本质是”指针” |
| 角度编码 | NISQ 标配;表达力靠后两层补 | ||
| 振幅编码 | (一般) | 省比特费门;制备即瓶颈 | |
| 数据重上传 | 可灵活 | 表达力强;深度/高原风险 |
2. 线路即傅里叶级数:编码决定模型能说什么
考虑最纯粹的”数据仅进入旋转角”的线路:( 是生成元,如 或 ;可训练酉夹在中间),输出观测量 。Schuld–Sweke–Meyer (2021) 的结论:
是每个变量 的多元三角多项式,其可达频率集合由生成元谱间隔决定:
例证:单比特 生成元谱 、间隔 2,模型频率 乘重上传次数 后 ——重上传 = 拉宽频带。若生成元是 (间隔 2)与 (间隔 2),频带结构相同;若引入 之类的缩放,频率整体乘 。
这给了三条硬结论:
- 模型的假设空间在编码那一刻就定了:可训练参数只决定系数 ,不能创造新频率。拟合高频函数(如快速振荡决策边界)必须靠重上传/缩放/深线路扩频带。
- 生成元谱是设计旋钮:换一组生成元( vs vs 更高权重的泡利串)等于换频谱结构;“频率资源”与”门开销”在此直接挂钩。
- 过简编码的失败可预言:单层单比特角度编码只能学 一阶纹波——很多”QML 不管用”的实验报告,败因在编码而不在优化器。
3. 容量与计数:重上传为什么是解药
计数论证(Schuld–Sweke–Meyer 同文):单份编码(每个 只出现一次)的模型系数自由度只有 量级,而一般 比特观测量需要 个实参数描述。数据重上传让 出现 次,频率集合扩张到 ,系数个数随之指数化(对固定 )。配合 Pérez–Salas 的表达力定理(含重上传的通用近似:足够层数的单比特重上传线路可逼近任意单比特函数),重上传成为”小系统上表达力/深度折中”的标准答案。
与贫瘠高原的联动必须写进设计文档:重上传增加深度 逼近 2-设计 梯度方差指数缩水。实务折中: 小深度重上传 + 局部代价函数 + 恒等初始化。
4. 编码诱导的核:通往量子核方法
对任意编码 ,定义
是正定核(可由构造验证),于是每个编码天然定义一个 RKHS 与一个核方法模型——这正是下一篇文章的主角。此处只强调因果链:编码 核 模型的归纳偏置。例如角度编码下, 随 以 型纹波衰减,纹波频率又是生成元谱——傅里叶视角与核视角在”频率”处会师。
5. 数据加载的现实:QML 的账要算全
把 维经典数据装进量子态,一般性制备成本 起步(振幅编码的下界即排序网络的规模量级)。这带来 QML 文献反复争论的”输入瓶颈”:
- 若每条样本都要 经典工作来加载,任何对样本量的亚线性改进都会被输入成本吞掉。理论上的出路是量子原生数据(数据本来就在量子态里:量子传感、量子模拟的输出)或 QRAM 式结构化加载( QRAM)。
- 设计规范:报告 QML 复杂度时单列数据加载成本(“假设数据已在振幅中”与”含加载”是两个命题),并把编码选型与数据规模一起陈述——这是审稿与复现的第一道门槛。
本词条总结
- 四种编码的画像:基(指针)、角度(、浅、NISQ 标配)、振幅( 比特、制备贵)、重上传(表达力换深度)。
- 线路即傅里叶级数:生成元谱决定可达频率,参数只调系数不扩频带;重上传/缩放/深线路是扩频带的三种手段。
- 容量计数解释单层编码的表达力天花板与重上传的必要性;深度换表达力要过贫瘠高原的关卡。
- 每个编码诱导正定核 ,编码设计 = 核设计的另一种说法(下篇展开)。
- 数据加载成本必须进账:量子原生数据或 QRAM 是绕开输入瓶颈的两条正路。
习题
- 频谱手算:( 为固定酉),证明输出 是 频率的三角多项式;再证明把第二个门换成 后频率集合变为 的子集。
- 显式核:计算角度编码 的核 ,画出 随 的图像并说明其”相似度”语义( 多大时两样本在核眼中”最不相似”?)。
- 重上传实验:用 1 个量子比特、 层重上传拟合 (),扫描 的训练误差,验证频带扩张与拟合成功的关系。
- 论证题:证明振幅编码的任意态制备需要 级基本门(提示:参数计数/维度论证即可),并讨论为什么”数据有结构”(稀疏、低秩、树状)是唯一的逃逸通道。
参考资料
- 本词条整理自《量子计算算法教程》原文:ch08-qml/data-encoding
- 内容遵循 CC BY-NC-SA 4.0 许可协议