量子神经网络(附录2:参数平移法则)

深入探索:参数平移法则 (PSR) 的证明与适用范围

在正文中,我们介绍了参数平移法则(Parameter-Shift Rule, PSR):只需在两个"平移后"的电路上测量期望值,就能得到关于门参数的解析梯度(analytical gradient)。本附录将给出这一法则的完整证明,并严格刻画它的适用范围。整个推导只用到矩阵欧拉公式(其推导见附录1《含参量子门与矩阵欧拉公式》)和几个基本的三角恒等式,我们对每一个等号都注明所用的依据,读者可以逐步核验。

1. 问题的设定:把一般电路化简为单个参数门

考虑一个含参数的量子电路,其中只有一个门 \(U(\theta)\) 依赖于参数 \(\theta\),其余的门与测量都与 \(\theta\) 无关。为讨论方便,我们把 \(\theta\) 无关的门按位置归并到电路的前段和后段,即把整个电路写成 \(W(\theta) = A\,U(\theta)\,B\),其中 \(A\)\(B\) 都是与 \(\theta\) 无关的幺正算符。设输入态为 \(|\psi_{\mathrm{in}}\rangle\)、可观测量(observable)为 \(M\),则期望值为

\[ E(\theta) = \langle\psi_{\mathrm{in}}|\, W^\dagger(\theta)\, M\, W(\theta)\, |\psi_{\mathrm{in}}\rangle = \langle\psi_0|\, U^\dagger(\theta)\, M\, U(\theta)\, |\psi_0\rangle, \]

其中第二个等号只是把 \(B\) 吸收进初态、把 \(A\) 吸收进观测量。具体地,代入 \(W(\theta)=A\,U(\theta)\,B\) 并展开 \(W^\dagger = B^\dagger U^\dagger A^\dagger\),得

\[ \langle\psi_{\mathrm{in}}|\,B^\dagger U^\dagger A^\dagger M A U B\,|\psi_{\mathrm{in}}\rangle = \big(B|\psi_{\mathrm{in}}\rangle\big)^\dagger\, U^\dagger\,\big(A^\dagger M A\big)\, U\, \big(B|\psi_{\mathrm{in}}\rangle\big), \]

因此只需取 \(|\psi_0\rangle = B|\psi_{\mathrm{in}}\rangle\)、并把 \(A^\dagger M A\) 重新记作 \(M\)(它仍是厄米算符),就得到了最简形式。这一化简表明:无论参数门位于电路的什么位置、周围还有多少别的门,我们都只需要研究 \(E(\theta)=\langle\psi_0|U^\dagger M U|\psi_0\rangle\) 这一种情形。

参数门本身具有如下形式:

\[ U(\theta) = e^{-i\frac{\theta}{2} G}, \]

其中 \(G\) 是厄米的生成元(generator)。对于旋转门 \(R_x, R_y, R_z\),生成元分别是对应的泡利矩阵 \(X, Y, Z\)。这些生成元满足一个关键性质:\(G^2 = I\)(单位矩阵)。

2. 核心引理:期望值是 \(\theta\) 的正弦型函数

引理(正弦响应)\(G\)\(M\) 都是厄米算符且 \(G^2 = I\)\(|\psi_0\rangle\) 为任意归一化初态。记 \(\langle A\rangle_0 := \langle\psi_0|A|\psi_0\rangle\)\([G,M] := GM - MG\) 为对易子(commutator)。定义 \(E(\theta) = \langle\psi_0|U^\dagger(\theta) M U(\theta)|\psi_0\rangle\),其中 \(U(\theta) = e^{-i\theta G/2}\)。则存在与 \(\theta\) 无关的实常数 \(a, b, C\),使得

\[ E(\theta) = a\sin\theta + b\cos\theta + C, \]

其中

\[ a = \frac{i}{2}\langle[G,M]\rangle_0, \qquad b = \frac{1}{2}\big(\langle M\rangle_0 - \langle GMG\rangle_0\big), \qquad C = \frac{1}{2}\big(\langle M\rangle_0 + \langle GMG\rangle_0\big). \]

证明 分三步进行。

第一步:把 \(U(\theta)\) 展开成 \(I\)\(G\) 的线性组合。\(G^2=I\) 和矩阵欧拉公式(附录1)可得

\[ U(\theta) = \cos\frac{\theta}{2}\, I - i \sin\frac{\theta}{2}\, G. \]

对其取伴随(利用 \(G^\dagger = G\) 以及 \(\cos\)\(\sin\) 取实数值)得

\[ U^\dagger(\theta) = \cos\frac{\theta}{2}\, I + i \sin\frac{\theta}{2}\, G. \]

为书写简洁,记 \(c = \cos\frac{\theta}{2}\)\(s = \sin\frac{\theta}{2}\)

第二步:展开 \(U^\dagger M U\) 并对初态取期望。 将上面两式代入 \(U^\dagger M U\),逐项相乘可得四项:

\[ U^\dagger M U = (cI + isG)\,M\,(cI - isG) = c^2 M - ics\, MG + ics\, GM + s^2\, GMG. \]

四项的来源分别是:\(cI \cdot M \cdot cI = c^2 M\)\(cI \cdot M \cdot (-isG) = -ics\,MG\)\((isG)\cdot M \cdot cI = ics\,GM\)\((isG)\cdot M\cdot(-isG) = (i)(-i)\,s^2 GMG = s^2\,GMG\),最后一步用了 \(i\cdot(-i) = -i^2 = 1\)。把中间两项合并为对易子,得到

\[ U^\dagger M U = c^2 M + ics\,[G,M] + s^2\, GMG, \]

于是

\[ E(\theta) = c^2 \langle M\rangle_0 + ics\,\langle[G,M]\rangle_0 + s^2 \langle GMG\rangle_0. \]

第三步:用半角恒等式把 \(\theta/2\) 的函数改写为 \(\theta\) 的函数。 所需的三个恒等式为

\[ \cos^2\frac{\theta}{2} = \frac{1+\cos\theta}{2}, \qquad \sin^2\frac{\theta}{2} = \frac{1-\cos\theta}{2}, \qquad \sin\frac{\theta}{2}\cos\frac{\theta}{2} = \frac{\sin\theta}{2}, \]

它们都可由倍角公式 \(\cos\theta = \cos^2\frac\theta2 - \sin^2\frac\theta2\)\(\sin\theta = 2\sin\frac\theta2\cos\frac\theta2\) 直接得到。先处理含 \(\cos^2\)\(\sin^2\) 的两项:

\[ c^2\langle M\rangle_0 + s^2\langle GMG\rangle_0 = \frac{1+\cos\theta}{2}\langle M\rangle_0 + \frac{1-\cos\theta}{2}\langle GMG\rangle_0 = \frac{\langle M\rangle_0 + \langle GMG\rangle_0}{2} + \frac{\cos\theta}{2}\big(\langle M\rangle_0 - \langle GMG\rangle_0\big). \]

再处理交叉项:

\[ ics\,\langle[G,M]\rangle_0 = \frac{i}{2}\,\langle[G,M]\rangle_0\,\sin\theta. \]

把三部分按常数项、\(\cos\theta\) 项、\(\sin\theta\) 项归拢,即得

\[ E(\theta) = C + b\cos\theta + a\sin\theta, \]

其中 \(a = \frac{i}{2}\langle[G,M]\rangle_0\)\(b = \frac{1}{2}\big(\langle M\rangle_0 - \langle GMG\rangle_0\big)\)\(C = \frac{1}{2}\big(\langle M\rangle_0 + \langle GMG\rangle_0\big)\)

最后我们说明这三个系数都是实数,且与 \(\theta\) 无关。先看实数性:\(M\) 是厄米的,而 \(GMG\) 的伴随为 \(G^\dagger M^\dagger G^\dagger = GMG\),故它也是厄米的,因此 \(\langle M\rangle_0\)\(\langle GMG\rangle_0\) 都是实数,从而 \(b, C\in\mathbb{R}\)。再看 \(a\):对易子满足

\[ [G,M]^\dagger = (GM - MG)^\dagger = M^\dagger G^\dagger - G^\dagger M^\dagger = MG - GM = -[G,M], \]

\([G,M]\) 是反厄米的,因此 \(i[G,M]\) 是厄米算符,其期望值 \(\langle i[G,M]\rangle_0\) 是实数,故 \(a\in\mathbb{R}\)。至于与 \(\theta\) 无关这一点:\(a, b, C\) 的构造只涉及固定初态 \(|\psi_0\rangle\) 上固定算符 \(M\)\(GMG\)\(i[G,M]\) 的期望值,不含任何 \(\theta\)。证毕。

推论(振幅–相位形式) 实系数的正弦与余弦的线性组合总可以合并成一个带相位的正弦波。取

\[ A = \sqrt{a^2+b^2} \ \ge 0, \qquad \cos\varphi = \frac{a}{A}, \quad \sin\varphi = \frac{b}{A} \quad \Big(\text{即 } \varphi = \operatorname{atan2}(b,\,a)\Big), \]

则由加法公式 \(\sin(\theta+\varphi) = \sin\theta\cos\varphi + \cos\theta\sin\varphi\) 展开可得

\[ E(\theta) = A\sin(\theta+\varphi) + C. \]

这正是正文中所说"期望值必然是正弦函数"的准确含义:振幅 \(A\)、相位 \(\varphi\) 和垂直偏移 \(C\) 完全由初态 \(|\psi_0\rangle\)、生成元 \(G\) 和观测量 \(M\) 决定,与 \(\theta\) 无关;随 \(\theta\) 变化的只有 \(\sin(\theta+\varphi)\) 这一个因子。特别地,当 \(a=b=0\)(即 \(A=0\))时 \(E(\theta)\) 是常数,梯度恒为零,参数无法被训练——这与"平坦损失景观"的现象一致。

3. 参数平移法则的证明

定理(参数平移法则) 在引理的条件下,

\[ \frac{dE(\theta)}{d\theta} = \frac{1}{2}\left[E\left(\theta+\frac{\pi}{2}\right) - E\left(\theta-\frac{\pi}{2}\right)\right]. \]

证明\(E(\theta) = a\sin\theta + b\cos\theta + C\) 逐项求导,得

\[ \frac{dE}{d\theta} = a\cos\theta - b\sin\theta. \]

再计算平移后的两个函数值。由诱导公式 \(\sin\big(\theta+\frac{\pi}{2}\big) = \cos\theta\)\(\sin\big(\theta-\frac{\pi}{2}\big) = -\cos\theta\)\(\cos\big(\theta+\frac{\pi}{2}\big) = -\sin\theta\)\(\cos\big(\theta-\frac{\pi}{2}\big) = \sin\theta\),得

\[ E\left(\theta+\frac{\pi}{2}\right) = a\cos\theta - b\sin\theta + C, \qquad\qquad E\left(\theta-\frac{\pi}{2}\right) = -a\cos\theta + b\sin\theta + C. \]

两式相减时,常数项 \(C\) 互相抵消:

\[ \frac{1}{2}\left[E\left(\theta+\frac{\pi}{2}\right) - E\left(\theta-\frac{\pi}{2}\right)\right] = \frac{1}{2}\cdot 2\big(a\cos\theta - b\sin\theta\big) = a\cos\theta - b\sin\theta = \frac{dE}{d\theta}. \]

证毕。用振幅–相位形式来读,这个证明说的是:\(E'(\theta) = A\cos(\theta+\varphi)\),而 \(E(\theta\pm\frac{\pi}{2}) = \pm A\cos(\theta+\varphi) + C\),两者恰好吻合。PSR 之所以给出的是解析梯度而非数值近似,正是因为它利用了"期望值是频率为 \(1\) 的正弦波"这一先验结构:对任意正弦型函数,其在某点的导数都等于它向前、向后各平移 \(90^\circ\) 后的函数值之差的一半。

4. 数值验证:一个完整的算例

下面我们构造一个可以手工算透的例子,把引理中的常数逐一算出,并在具体的一点上验证 PSR 两边相等。取生成元 \(G = X\)、观测量 \(M = Z\),初态为

\[ |\psi_0\rangle = \frac{\sqrt{3}}{2}\,|0\rangle + \frac{1}{2}\,e^{i\pi/4}\,|1\rangle. \]

该态满足归一化条件,因为 \(\big|\frac{\sqrt3}{2}\big|^2 + \big|\frac12\big|^2 = \frac34 + \frac14 = 1\)

先计算引理所需的初态期望值。对形如 \(\cos\alpha\,|0\rangle + e^{i\beta}\sin\alpha\,|1\rangle\) 的一般单比特态,直接把泡利矩阵与态向量相乘可以验证:

\[ \langle Z\rangle_0 = \cos 2\alpha, \qquad \langle X\rangle_0 = \sin 2\alpha\cos\beta, \qquad \langle Y\rangle_0 = \sin 2\alpha\sin\beta. \]

本例中 \(\alpha = \frac{\pi}{6}\)\(\beta = \frac{\pi}{4}\),于是

\[ \langle Z\rangle_0 = \cos\frac{\pi}{3} = \frac{1}{2}, \qquad \langle Y\rangle_0 = \sin\frac{\pi}{3}\sin\frac{\pi}{4} = \frac{\sqrt3}{2}\cdot\frac{\sqrt2}{2} = \frac{\sqrt6}{4} \approx 0.6124. \]

再利用两个泡利恒等式 \(XZX = -Z\)\([X,Z] = -2iY\)(两者都可以用矩阵直接相乘验证),代入引理的系数公式:

\[ a = \frac{i}{2}\langle[X,Z]\rangle_0 = \frac{i}{2}\,(-2i)\,\langle Y\rangle_0 = \langle Y\rangle_0 = \frac{\sqrt6}{4}, \]
\[ b = \frac{\langle Z\rangle_0 - \langle XZX\rangle_0}{2} = \frac{\langle Z\rangle_0 - (-\langle Z\rangle_0)}{2} = \langle Z\rangle_0 = \frac{1}{2}, \qquad C = \frac{\langle Z\rangle_0 + \langle XZX\rangle_0}{2} = \frac{\langle Z\rangle_0 - \langle Z\rangle_0}{2} = 0. \]

因此期望值函数为

\[ E(\theta) = \frac{\sqrt6}{4}\sin\theta + \frac{1}{2}\cos\theta = A\sin(\theta+\varphi), \]

其中振幅与相位为

\[ A = \sqrt{\frac{6}{16}+\frac{1}{4}} = \frac{\sqrt{10}}{4} \approx 0.7906, \qquad \varphi = \operatorname{atan2}\!\left(\frac{1}{2},\,\frac{\sqrt6}{4}\right) \approx 0.6847\ \text{rad} \approx 39.2^\circ. \]

作为一条独立的交叉验证,我们绕开引理、直接化简海森堡绘景中的算符 \(U^\dagger Z U\):由第 2 节第二步的展开式,

\[ U^\dagger Z U = \cos^2\frac{\theta}{2}\,Z + ics\,[X,Z] + \sin^2\frac{\theta}{2}\,(XZX) = \Big(\cos^2\frac{\theta}{2}-\sin^2\frac{\theta}{2}\Big)Z + ics\,(-2iY) = \cos\theta\,Z + \sin\theta\,Y, \]

(其中 \(2cs = \sin\theta\)),于是 \(E(\theta) = \cos\theta\,\langle Z\rangle_0 + \sin\theta\,\langle Y\rangle_0\),与引理给出的结果一致。

现在取 \(\theta = 1\) 验证 PSR。左边是解析导数:

\[ \frac{dE}{d\theta}\bigg|_{\theta=1} = \frac{\sqrt6}{4}\cos 1 - \frac{1}{2}\sin 1 \approx 0.6124\times 0.5403 - 0.5\times 0.8415 \approx -0.0899. \]

右边是两次平移后的期望值之差的一半。利用 \(\sin(1+\frac{\pi}{2}) = \cos 1\)\(\cos(1+\frac{\pi}{2}) = -\sin 1\)\(\sin(1-\frac{\pi}{2}) = -\cos 1\)\(\cos(1-\frac{\pi}{2}) = \sin 1\),以及 \(\cos 1 \approx 0.5403\)\(\sin 1 \approx 0.8415\),得

\[ E\left(1+\frac{\pi}{2}\right) \approx 0.6124\times 0.5403 + 0.5\times(-0.8415) \approx -0.0899, \]
\[ E\left(1-\frac{\pi}{2}\right) \approx 0.6124\times(-0.5403) + 0.5\times 0.8415 \approx +0.0899, \]
\[ \frac{1}{2}\left[E\left(1+\frac{\pi}{2}\right) - E\left(1-\frac{\pi}{2}\right)\right] \approx \frac{1}{2}\big(-0.0899 - 0.0899\big) = -0.0899. \]

两边在保留的四位小数内完全相等,PSR 在该点得到验证。顺带一提,\(E(1) \approx 0.7854\),也可以用振幅–相位形式 \(A\sin(1+\varphi) \approx 0.7906\times\sin(1.6847) \approx 0.7854\) 复核,说明推论的形式同样正确。

5. PSR 的适用范围:哪些门可以用?

适用的条件:生成元恰有两个不同本征值

回顾第 2、3 节的证明,我们只在两处用到了生成元的性质:其一,把 \(U\) 展开为 \(\cos\frac\theta2 I - i\sin\frac\theta2 G\) 需要 \(G^2 = I\),等价于 \(G\) 的谱(本征值集合)为 \(\{+1, -1\}\);其二,半角换元之后函数的频率恰好为 \(1\)。把这两点一并推广,就得到最一般的适用条件。

定理(两本征值生成元的广义参数平移)\(U(\theta) = e^{-i\theta G/2}\),其中 \(G\) 是厄米算符且恰有两个不同本征值 \(\lambda_1 > \lambda_2\)。记谱隙(spectral gap)\(\Delta = \lambda_1 - \lambda_2 > 0\),并设电路的其余部分与 \(\theta\) 无关。则

\[ \frac{\partial E}{\partial\theta} = \frac{\Delta}{4}\left[E\left(\theta+\frac{\pi}{\Delta}\right) - E\left(\theta-\frac{\pi}{\Delta}\right)\right]. \]

证明\(\mu = \frac{\lambda_1+\lambda_2}{2}\)\(\delta = \frac{\Delta}{2}\),并定义 \(P = \frac{G-\mu I}{\delta}\)。由于 \(G\) 厄米,\(P\) 也厄米;\(P\) 的两个本征值为 \(\frac{\lambda_{1,2}-\mu}{\delta} = \pm 1\),由谱分解可知 \(P^2 = I\)。又因单位矩阵与一切算符对易,指数可以拆开:

\[ U(\theta) = e^{-i\theta(\mu I + \delta P)/2} = e^{-i\mu\theta/2}\, e^{-i(\delta\theta)P/2}. \]

式中的标量相位 \(e^{-i\mu\theta/2}\)\(E(\theta)=\langle\psi_0|U^\dagger M U|\psi_0\rangle\) 中与自身的复共轭相乘而抵消(\(U^\dagger M U = V^\dagger M V\),其中 \(V = e^{-i(\delta\theta)P/2}\)),所以 \(E\) 只通过组合 \(t = \delta\theta\) 依赖于 \(\theta\)。把第 2 节的引理应用于生成元 \(P\)、参数 \(t\),得

\[ E(\theta) = \tilde a\sin(\delta\theta) + \tilde b\cos(\delta\theta) + C, \]

其中 \(\tilde a, \tilde b, C\)\(\theta\) 无关。对上式求导,并对任意平移量 \(s\) 用和差化积公式 \(\sin(x+y)-\sin(x-y) = 2\cos x\sin y\)\(\cos(x+y)-\cos(x-y) = -2\sin x\sin y\),得

\[ \frac{dE}{d\theta} = \delta\big[\tilde a\cos(\delta\theta) - \tilde b\sin(\delta\theta)\big], \qquad\qquad E(\theta+s)-E(\theta-s) = 2\sin(\delta s)\big[\tilde a\cos(\delta\theta) - \tilde b\sin(\delta\theta)\big]. \]

只要 \(\sin(\delta s) \neq 0\),两式相除便得 \(\frac{dE}{d\theta} = \frac{\delta}{2\sin(\delta s)}\big[E(\theta+s)-E(\theta-s)\big]\)。取 \(\delta s = \frac{\pi}{2}\),即 \(s = \frac{\pi}{2\delta} = \frac{\pi}{\Delta}\),系数化为 \(\frac{\delta}{2} = \frac{\Delta}{4}\)。证毕。

推论(谱为 \(\pm r\) 的情形)\(G\) 的本征值为 \(\pm r\)\(r>0\)),则 \(\Delta = 2r\),平移量为 \(\pm\frac{\pi}{2r}\)、系数为 \(\frac{r}{2}\)

\[ \frac{\partial E}{\partial\theta} = \frac{r}{2}\left[E\left(\theta+\frac{\pi}{2r}\right) - E\left(\theta-\frac{\pi}{2r}\right)\right]. \]

泡利生成元对应 \(r = 1\),此时平移量为 \(\pm\frac{\pi}{2}\)、系数为 \(\frac{1}{2}\),即标准的 PSR。常见的适用例子包括:

  • 单比特旋转门 \(R_x(\theta) = e^{-i\theta X/2}\)\(R_y(\theta) = e^{-i\theta Y/2}\)\(R_z(\theta) = e^{-i\theta Z/2}\),生成元谱均为 \(\{\pm 1\}\),直接用标准 PSR。

  • 两比特相互作用门 \(e^{-i\theta Z_1 Z_2/2}\):生成元 \(Z_1 Z_2\) 的本征值为 \(\pm 1\),标准 PSR 直接适用。

  • 加权单比特生成元 \(e^{-i\theta(aX+bY+cZ)/2}\)\(a,b,c\) 为不全为零的实数):生成元是厄米无迹的 \(2\times 2\) 矩阵,其本征值为 \(\pm\sqrt{a^2+b^2+c^2}\),仍属两本征值情形,取 \(r = \sqrt{a^2+b^2+c^2}\) 即可用上式求梯度。

注意参数化约定。 平移量的具体数值依赖于我们把门写成 \(e^{-i\theta G/2}\) 还是 \(e^{-i\theta G}\)。若采用后一种约定且谱为 \(\{\pm r\}\),则有效参数为 \(t = 2r\theta\),同样的推导给出平移量 \(\pm\frac{\pi}{4r}\)、系数 \(r\)。两种写法在文献中都很常见,对照不同资料时务必先统一参数化约定;本教程统一采用 \(e^{-i\theta G/2}\)

无法直接应用 PSR 的情况

以下类型的参数门不能直接套用标准(两项)PSR,需要额外处理。

  1. 生成元有三个及以上不同本征值。 例如三比特门 \(e^{-i\theta(Z_1Z_2 + Z_2Z_3)/2}\):把 \(z_1z_2 + z_2z_3\)\(z_i = \pm 1\) 枚举取值,可得生成元的谱为 \(\{-2, 0, +2\}\),其两两之差有 \(2\)\(4\) 两个值,因此 \(E(\theta)\) 同时含有频率 \(1\) 和频率 \(2\) 的正弦成分,任何单一平移量的两项公式都无法同时匹配两个频率。再如受控旋转 \(CR_z(\theta) = |0\rangle\langle 0|\otimes I + |1\rangle\langle 1|\otimes R_z(\theta)\),其生成元为 \(\frac{I - Z_1}{2}\otimes\frac{Z_2}{2}\),谱为 \(\big\{-\frac{1}{2},\, 0,\, +\frac{1}{2}\big\}\),同样不满足两本征值条件。对这类门,标准做法是先做电路分解(例如 \(CR_z\) 可以分解为两个 CNOT 与若干个 \(R_z\),再对每个 \(R_z\) 分别使用 PSR),或使用下面提到的推广形式。

  2. 参数化操作不是幺正的。 本附录的推导前提是参数门为幺正演化。需要说明的是,若噪声信道以与 \(\theta\) 无关的方式作用在参数门之外,则可以把它并入等效初态或等效观测量(利用信道的伴随 \(\mathrm{Tr}[\mathcal{N}(U\rho U^\dagger)M] = \mathrm{Tr}[U\rho U^\dagger\,\mathcal{N}^\dagger(M)]\)),PSR 依然成立;但若噪声进入了参数门内部(例如把参数门整体替换为含参数的噪声信道),幺正性被破坏,期望值一般不再是有限个正弦分量之和,需要另行分析。

  3. 参数以非线性方式进入。 若门的形式为 \(U(\theta) = e^{-if(\theta)G/2}\),其中 \(f\) 是非线性函数(例如 \(f(\theta) = \theta^2\)),则 \(E(\theta) = \hat E(f(\theta))\),其中 \(\hat E\) 是引理给出的正弦型函数。此时不能对 \(\theta\) 直接套用 PSR,但只要 \(f\) 可微且 \(f'(\theta)\) 已知,链式法则给出

    \[ \frac{dE}{d\theta} = f'(\theta)\cdot\frac{1}{2}\big[\hat E(f(\theta)+\tfrac{\pi}{2}) - \hat E(f(\theta)-\tfrac{\pi}{2})\big], \]

    即先对中间变量 \(f(\theta)\) 使用 PSR,再乘上 \(f'(\theta)\)

  4. 同一参数出现在多个门中(共享参数)。\(\theta\) 同时出现在两个门中。把 \(E\) 看成二元函数 \(F(\theta_1, \theta_2)\),其中 \(\theta_1\) 只进入第一个门、\(\theta_2\) 只进入第二个门,则链式法则给出 \(\frac{dE}{d\theta} = \frac{\partial F}{\partial\theta_1} + \frac{\partial F}{\partial\theta_2}\)(在 \(\theta_1 = \theta_2 = \theta\) 处取值)。固定另一个变元时,每个偏导数都对应单个被夹在中间的参数门,可分别用两项 PSR 计算。结论是:梯度等于"每次只平移一个出现位置、各做一次两项差分、再求和"。


总结表

门类型

是否可直接用 PSR

原因

Rx(θ), Ry(θ), Rz(θ)

生成元为泡利矩阵,谱为 \(\{\pm 1\}\),平移 \(\pm\pi/2\),系数 \(1/2\)

\(e^{-i\theta(aX+bY+cZ)/2}\)

谱为 \(\{\pm r\}\)\(r=\sqrt{a^2+b^2+c^2}\),平移 \(\pm\pi/(2r)\),系数 \(r/2\)

\(e^{-i\theta (Z_1Z_2)/2}\)

生成元谱为 \(\{\pm 1\}\)

CRz(θ)(受控旋转)

⚠️

生成元谱为 \(\{-\frac12, 0, +\frac12\}\);需分解为 CNOT+Rz 或用推广公式

\(e^{-i\theta (Z_1Z_2 + Z_2Z_3)/2}\)

生成元谱 \(\{-2,0,+2\}\),谱隙不唯一,期望值含多个频率

\(U(\theta) = e^{-i\theta^2 Z/2}\)

参数非线性进入;可用链式法则补救

含噪声通道的参数门

⚠️

视噪声位置而定:门外的 \(\theta\) 无关噪声不影响 PSR,门内噪声破坏推导前提


概括地说,无法直接应用参数平移法则的参数门,是那些生成元不恰有两个本征值(例如谱为 \(\{-2,0,+2\}\)\(\{-\frac12,0,+\frac12\}\))、参数以非线性方式进入门的定义、或者参数化操作本身非幺正的门;其余情形(包括一切谱为 \(\{\pm r\}\) 的生成元)都有精确的两项平移公式可用。

好消息有两点。第一,绝大多数量子机器学习模型使用的参数化门(如 \(R_x, R_y, R_z\))都属于可直接使用 PSR 的类型。第二,对于更复杂的情况,学术界已经发展出推广的参数平移法则(generalized parameter-shift rules),它们可能需要更多次平移或不同的平移量,但基本思想与本文相同;像 PennyLane 这样的框架会自动识别生成元的谱结构,并调用合适的梯度计算方法。

总结:实践者的启示

  • PSR 是解析梯度,不是数值近似:它的精确性源于量子门 \(e^{-i\theta G/2}\) 的数学结构——期望值关于 \(\theta\) 是频率为由生成元谱隙决定的正弦波,这保证了梯度计算的可靠性。

  • 检查你的门:当你设计自己的含参数电路时,应确认所用参数门的生成元恰有两个本征值(绝大多数常见门都满足),否则需要分解电路或改用推广公式。

  • 信任你的框架:在使用 PennyLane 等工具时,通常不需要手动实现 PSR。框架会自动处理梯度计算,你只需要专注于模型的设计与训练。

通过本附录的推导,我们不仅知道了如何使用 PSR,更理解了它为何精确、以及它的边界在哪里。