矩阵与高斯恒等式
本书各章反复用到少数几条恒等式。每一条都在首次需要时引入,推导通常结合该章的例子展开。本附录以一般形式将它们汇集于此,每条附一个简短、便于核对的证明,并注明书中何处用到它。
五节内容层层递进,分块求逆是根本:Woodbury 恒等式是以两种方式解读的分块求逆,高斯分布的条件化是作用于协方差矩阵的分块求逆,两个高斯密度的乘积则是换了形式的条件化。最后一节讨论两个高斯值的期望最大值,与其他各节相互独立,为第 12 章 与第 19 章 中的采集函数服务。
全文约定:向量均为列向量,I \mI I 为尺寸相应的单位矩阵,凡求逆的矩阵均假定可逆。
B.1 分块求逆与 Schur 补 #
若矩阵的行与列各分为两组,则可以逐组求逆。写成分块形式,
M = [ A B C D ] , \mathbf{M} = \begin{bmatrix} \mA & \mathbf{B} \\ \mathbf{C} & \mathbf{D} \end{bmatrix}, M = [ A C B D ] , (B.1)
其中 A \mA A 的尺寸为 p × p p \times p p × p ,D \mathbf{D} D 的尺寸为 q × q q \times q q × q 。矩阵不必对称。A \mA A 在 M \mathbf{M} M 中的 Schur 补 (Schur complement)为
S = D − C A − 1 B , \mathbf{S} = \mathbf{D} - \mathbf{C}\mA^{-1}\mathbf{B}, S = D − C A − 1 B , (B.2)
即消去第一组之后 D \mathbf{D} D 余下的部分,正如对两个方程消元后,会在 2 × 2 2 \times 2 2 × 2 矩阵的一角留下 d − c b / a d - cb/a d − c b / a 。
定理 B.1 分块求逆
若 A \mA A 与 S \mathbf{S} S 可逆,则
M − 1 = [ P Q R S − 1 ] , P = A − 1 + A − 1 B S − 1 C A − 1 , Q = − A − 1 B S − 1 , R = − S − 1 C A − 1 , \begin{aligned}
\mathbf{M}^{-1} &=
\begin{bmatrix} \mathbf{P} & \mathbf{Q} \\ \mathbf{R} & \mathbf{S}^{-1} \end{bmatrix}, \\
\mathbf{P} &= \mA^{-1} + \mA^{-1}\mathbf{B}\,\mathbf{S}^{-1}\mathbf{C}\mA^{-1}, \\
\mathbf{Q} &= -\mA^{-1}\mathbf{B}\,\mathbf{S}^{-1}, \\
\mathbf{R} &= -\mathbf{S}^{-1}\mathbf{C}\mA^{-1},
\end{aligned} M − 1 P Q R = [ P R Q S − 1 ] , = A − 1 + A − 1 B S − 1 C A − 1 , = − A − 1 B S − 1 , = − S − 1 C A − 1 , (B.3)
并且 det M = det A ⋅ det S \det\mathbf{M} = \det\mA \cdot \det\mathbf{S} det M = det A ⋅ det S 。
证明
用两个三角矩阵消去非对角块,
E = [ I 0 − C A − 1 I ] , F = [ I − A − 1 B 0 I ] . \mathbf{E} = \begin{bmatrix} \mI & \mathbf{0} \\ -\mathbf{C}\mA^{-1} & \mI \end{bmatrix},
\qquad
\mathbf{F} = \begin{bmatrix} \mI & -\mA^{-1}\mathbf{B} \\ \mathbf{0} & \mI \end{bmatrix}. E = [ I − C A − 1 0 I ] , F = [ I 0 − A − 1 B I ] .
左乘 E \mathbf{E} E ,即从第二块行中减去 C A − 1 \mathbf{C}\mA^{-1} C A − 1 左乘第一块行的结果。左下块变为 C − C A − 1 A = 0 \mathbf{C} - \mathbf{C}\mA^{-1}\mA = \mathbf{0} C − C A − 1 A = 0 ,右下块变为 D − C A − 1 B = S \mathbf{D} - \mathbf{C}\mA^{-1}\mathbf{B} = \mathbf{S} D − C A − 1 B = S 。
再右乘 F \mathbf{F} F ,即从第二块列中减去第一块列右乘 A − 1 B \mA^{-1}\mathbf{B} A − 1 B 的结果;右上块由此消去,其余各块不变。于是E M F = [ A 0 0 S ] . \mathbf{E}\,\mathbf{M}\,\mathbf{F} = \begin{bmatrix} \mA & \mathbf{0} \\ \mathbf{0} & \mathbf{S} \end{bmatrix}. E M F = [ A 0 0 S ] .
E \mathbf{E} E 与 F \mathbf{F} F 都可逆:将各自的非对角块变号,即得其逆矩阵。对第 2 步的等式两边求逆,得 F − 1 M − 1 E − 1 = diag ( A − 1 , S − 1 ) \mathbf{F}^{-1}\mathbf{M}^{-1}\mathbf{E}^{-1} = \operatorname{diag}(\mA^{-1}, \mathbf{S}^{-1}) F − 1 M − 1 E − 1 = diag ( A − 1 , S − 1 ) ,即以这两块为对角块的分块对角矩阵,从而 M − 1 = F diag ( A − 1 , S − 1 ) E \mathbf{M}^{-1} = \mathbf{F}\operatorname{diag}(\mA^{-1}, \mathbf{S}^{-1})\,\mathbf{E} M − 1 = F diag ( A − 1 , S − 1 ) E 。
将乘积展开。F diag ( A − 1 , S − 1 ) \mathbf{F}\operatorname{diag}(\mA^{-1}, \mathbf{S}^{-1}) F diag ( A − 1 , S − 1 ) 的上块行为 ( A − 1 , − A − 1 B S − 1 ) (\mA^{-1},\, -\mA^{-1}\mathbf{B}\mathbf{S}^{-1}) ( A − 1 , − A − 1 B S − 1 ) ,下块行为 ( 0 , S − 1 ) (\mathbf{0},\, \mathbf{S}^{-1}) ( 0 , S − 1 ) ;再右乘 E \mathbf{E} E ,即把第二块列右乘 − C A − 1 -\mathbf{C}\mA^{-1} − C A − 1 后加到第一块列上,由此得到式(B.3) 的四个块。
E \mathbf{E} E 与 F \mathbf{F} F 是对角元全为 1 的三角矩阵,行列式为 1;乘积的行列式又等于行列式的乘积(第 3.6 节 )。于是由第 2 步得 det M = det A ⋅ det S \det\mathbf{M} = \det\mA\cdot\det\mathbf{S} det M = det A ⋅ det S 。
第一组并无特殊之处。改为先消去第二组,利用 D \mathbf{D} D 的 Schur 补 T = A − B D − 1 C \mathbf{T} = \mA - \mathbf{B}\mathbf{D}^{-1}\mathbf{C} T = A − B D − 1 C ,同样的论证给出同一逆矩阵的第二种表达式:
M − 1 = [ T − 1 Q ′ R ′ P ′ ] , P ′ = D − 1 + D − 1 C T − 1 B D − 1 , Q ′ = − T − 1 B D − 1 , R ′ = − D − 1 C T − 1 , \begin{aligned}
\mathbf{M}^{-1} &=
\begin{bmatrix} \mathbf{T}^{-1} & \mathbf{Q}' \\ \mathbf{R}' & \mathbf{P}' \end{bmatrix}, \\
\mathbf{P}' &= \mathbf{D}^{-1} + \mathbf{D}^{-1}\mathbf{C}\,\mathbf{T}^{-1}\mathbf{B}\mathbf{D}^{-1}, \\
\mathbf{Q}' &= -\mathbf{T}^{-1}\mathbf{B}\mathbf{D}^{-1}, \\
\mathbf{R}' &= -\mathbf{D}^{-1}\mathbf{C}\,\mathbf{T}^{-1},
\end{aligned} M − 1 P ′ Q ′ R ′ = [ T − 1 R ′ Q ′ P ′ ] , = D − 1 + D − 1 C T − 1 B D − 1 , = − T − 1 B D − 1 , = − D − 1 C T − 1 , (B.4)
且 det M = det D ⋅ det T \det\mathbf{M} = \det\mathbf{D}\cdot\det\mathbf{T} det M = det D ⋅ det T 。
书中用途 。第 3.7.2 节 逐步推导了对称情形 C = B ⊤ \mathbf{C} = \mathbf{B}^\T C = B ⊤ ,并说明对称矩阵 M \mathbf{M} M 正定当且仅当 A \mA A 与 S \mathbf{S} S 都正定。条件化后的高斯分布以 Schur 补为协方差,原因正在于式(B.3) 的右下块为 S − 1 \mathbf{S}^{-1} S − 1 (第 B.3 节 )。取第二组为单个坐标,即得式(9.6) 中的留一公式;为已分解的矩阵添加一行一列,即得第 3.7.3 节 的 Cholesky 更新。
B.2 Woodbury 恒等式 #
M − 1 \mathbf{M}^{-1} M − 1 的两种表达式必须逐块相等。比较二者的左上块,便得到本附录中最有用的恒等式,它给出矩阵加上一个低秩矩阵之后其逆的变化。
定理 B.2 Woodbury 恒等式
设 Z \mathbf{Z} Z 为 n × n n \times n n × n 矩阵,W \mW W 为 m × m m \times m m × m 矩阵,U \mathbf{U} U 与 V \mathbf{V} V 为 n × m n \times m n × m 矩阵。则
( Z + U W V ⊤ ) − 1 = Z − 1 − Z − 1 U N − 1 V ⊤ Z − 1 , where N = W − 1 + V ⊤ Z − 1 U . \begin{aligned}
&\left(\mathbf{Z} + \mathbf{U}\mW\mathbf{V}^\T\right)^{-1}
= \mathbf{Z}^{-1} - \mathbf{Z}^{-1}\mathbf{U}\,\mathbf{N}^{-1}\mathbf{V}^\T\mathbf{Z}^{-1}, \\
&\text{where } \mathbf{N} = \mW^{-1} + \mathbf{V}^\T\mathbf{Z}^{-1}\mathbf{U}.
\end{aligned} ( Z + UW V ⊤ ) − 1 = Z − 1 − Z − 1 U N − 1 V ⊤ Z − 1 , where N = W − 1 + V ⊤ Z − 1 U . (B.5)
证明
取 A = Z \mA = \mathbf{Z} A = Z 、B = − U \mathbf{B} = -\mathbf{U} B = − U 、C = V ⊤ \mathbf{C} = \mathbf{V}^\T C = V ⊤ 、D = W − 1 \mathbf{D} = \mW^{-1} D = W − 1 ,对相应的分块矩阵应用第 B.1 节 的结果。
A \mA A 的 Schur 补为 S = W − 1 + V ⊤ Z − 1 U = N \mathbf{S} = \mW^{-1} + \mathbf{V}^\T\mathbf{Z}^{-1}\mathbf{U} = \mathbf{N} S = W − 1 + V ⊤ Z − 1 U = N ,由式(B.3) ,逆矩阵的左上块为 P = Z − 1 − Z − 1 U N − 1 V ⊤ Z − 1 \mathbf{P} = \mathbf{Z}^{-1} - \mathbf{Z}^{-1}\mathbf{U}\,\mathbf{N}^{-1}\mathbf{V}^\T\mathbf{Z}^{-1} P = Z − 1 − Z − 1 U N − 1 V ⊤ Z − 1 。
D \mathbf{D} D 的 Schur 补为 T = Z + U W V ⊤ \mathbf{T} = \mathbf{Z} + \mathbf{U}\mW\mathbf{V}^\T T = Z + UW V ⊤ ,由式(B.4) ,逆矩阵的左上块为 T − 1 \mathbf{T}^{-1} T − 1 。
矩阵的逆是唯一的,因此这两个块相等。
该恒等式也称为矩阵求逆引理(Rasmussen 与 Williams,2006 ,附录 A.3) ,其价值在于矩阵的尺寸。左边需要对 n × n n \times n n × n 矩阵求逆;右边在已知 Z − 1 \mathbf{Z}^{-1} Z − 1 时,只需对 m × m m \times m m × m 矩阵 N \mathbf{N} N 求逆。当 Z \mathbf{Z} Z 易于求逆(例如为对角矩阵)且 m m m 远小于 n n n 时,计算代价从 O ( n 3 ) O(n^3) O ( n 3 ) 降到 O ( n m 2 ) O(nm^2) O ( n m 2 ) 。
由同一分块矩阵还可以得到三个相关结果。
秩一情形 。取 m = 1 m = 1 m = 1 、W = 1 \mW = 1 W = 1 ,并以向量 u , v \mathbf{u}, \mathbf{v} u , v 代替 U , V \mathbf{U}, \mathbf{V} U , V ,中间的逆即为一个数,由此得到 Sherman-Morrison 公式:
( Z + u v ⊤ ) − 1 = Z − 1 − Z − 1 u v ⊤ Z − 1 1 + v ⊤ Z − 1 u . \left(\mathbf{Z} + \mathbf{u}\mathbf{v}^\T\right)^{-1}
= \mathbf{Z}^{-1} - \frac{\mathbf{Z}^{-1}\mathbf{u}\,\mathbf{v}^\T\mathbf{Z}^{-1}}{1 + \mathbf{v}^\T\mathbf{Z}^{-1}\mathbf{u}}. ( Z + u v ⊤ ) − 1 = Z − 1 − 1 + v ⊤ Z − 1 u Z − 1 u v ⊤ Z − 1 . (B.6)
行列式 。对同一分块矩阵,令第 B.1 节 中的两个行列式公式相等,即得矩阵行列式引理(Rasmussen 与 Williams,2006 ,附录 A.3) :
det ( Z + U W V ⊤ ) = det Z det W det N . \det(\mathbf{Z} + \mathbf{U}\mW\mathbf{V}^\T)
= \det\mathbf{Z}\,\det\mW\,\det\mathbf{N}. det ( Z + UW V ⊤ ) = det Z det W det N . (B.7)
推移恒等式 。对任意 n × m n \times m n × m 矩阵 X \mathbf{X} X 与 m × n m \times n m × n 矩阵 Y \mathbf{Y} Y ,
( I + X Y ) − 1 X = X ( I + Y X ) − 1 , \left(\mI + \mathbf{X}\mathbf{Y}\right)^{-1}\mathbf{X} = \mathbf{X}\left(\mI + \mathbf{Y}\mathbf{X}\right)^{-1}, ( I + XY ) − 1 X = X ( I + YX ) − 1 , (B.8)
这是因为 X ( I + Y X ) = ( I + X Y ) X \mathbf{X}(\mI + \mathbf{Y}\mathbf{X}) = (\mI + \mathbf{X}\mathbf{Y})\mathbf{X} X ( I + YX ) = ( I + XY ) X ,两边分别左乘、右乘相应的逆,便把这两个因子移到了等式另一侧。
例 B.1 权重空间与函数空间一致
第 5.4.2 节 在权重空间中求出了含 M M M 个特征的线性模型的后验:协方差为 A w − 1 \mA_w^{-1} A w − 1 ,其中 A w = Σ p − 1 + σ n − 2 Φ ⊤ Φ \mA_w = \mSigma_p^{-1} + \sigma_n^{-2}\boldsymbol{\Phi}^\T\boldsymbol{\Phi} A w = Σ p − 1 + σ n − 2 Φ ⊤ Φ 是 M × M M \times M M × M 矩阵;均值为 w ˉ = σ n − 2 A w − 1 Φ ⊤ y \bar{\vw} = \sigma_n^{-2}\mA_w^{-1}\boldsymbol{\Phi}^\T\vy w ˉ = σ n − 2 A w − 1 Φ ⊤ y 。第 8.3 节 则在函数空间中用 n × n n \times n n × n 矩阵 K y = Φ Σ p Φ ⊤ + σ n 2 I \mK_y = \boldsymbol{\Phi}\mSigma_p\boldsymbol{\Phi}^\T + \sigma_n^2\mI K y = Φ Σ p Φ ⊤ + σ n 2 I 做预测。两者的预测必须相同,上述恒等式表明确实如此。
协方差 :取 Z = Σ p − 1 \mathbf{Z} = \mSigma_p^{-1} Z = Σ p − 1 、U = V = Φ ⊤ \mathbf{U} = \mathbf{V} = \boldsymbol{\Phi}^\T U = V = Φ ⊤ 、W = σ n − 2 I \mW = \sigma_n^{-2}\mI W = σ n − 2 I ,应用式(B.5) :
A w − 1 = Σ p − Σ p Φ ⊤ K y − 1 Φ Σ p . \mA_w^{-1} = \mSigma_p - \mSigma_p\boldsymbol{\Phi}^\T\mK_y^{-1}\boldsymbol{\Phi}\mSigma_p. A w − 1 = Σ p − Σ p Φ ⊤ K y − 1 Φ Σ p .
在等式两边用新输入的特征 ϕ ∗ \boldsymbol{\phi}_* ϕ ∗ 从左右两侧相乘。左边是权重空间中的预测方差 ϕ ∗ ⊤ A w − 1 ϕ ∗ \boldsymbol{\phi}_*^\T\mA_w^{-1}\boldsymbol{\phi}_* ϕ ∗ ⊤ A w − 1 ϕ ∗ ;右边是 k ( x ∗ , x ∗ ) − k ∗ ⊤ K y − 1 k ∗ k(\vx_*, \vx_*) - \vk_*^\T\mK_y^{-1}\vk_* k ( x ∗ , x ∗ ) − k ∗ ⊤ K y − 1 k ∗ ,其中核函数为式(7.3) 的 k ( x , x ′ ) = ϕ ( x ) ⊤ Σ p ϕ ( x ′ ) k(\vx, \vx') = \boldsymbol{\phi}(\vx)^\T\mSigma_p\boldsymbol{\phi}(\vx') k ( x , x ′ ) = ϕ ( x ) ⊤ Σ p ϕ ( x ′ ) ,k ∗ = Φ Σ p ϕ ∗ \vk_* = \boldsymbol{\Phi}\mSigma_p\boldsymbol{\phi}_* k ∗ = Φ Σ p ϕ ∗ 。这正是式(8.6) 。
均值 :由定义,A w Σ p Φ ⊤ = Φ ⊤ + σ n − 2 Φ ⊤ Φ Σ p Φ ⊤ = σ n − 2 Φ ⊤ K y \mA_w\mSigma_p\boldsymbol{\Phi}^\T = \boldsymbol{\Phi}^\T + \sigma_n^{-2}\boldsymbol{\Phi}^\T\boldsymbol{\Phi}\mSigma_p\boldsymbol{\Phi}^\T = \sigma_n^{-2}\boldsymbol{\Phi}^\T\mK_y A w Σ p Φ ⊤ = Φ ⊤ + σ n − 2 Φ ⊤ Φ Σ p Φ ⊤ = σ n − 2 Φ ⊤ K y 。左乘 A w − 1 \mA_w^{-1} A w − 1 、右乘 K y − 1 \mK_y^{-1} K y − 1 ,得 σ n − 2 A w − 1 Φ ⊤ = Σ p Φ ⊤ K y − 1 \sigma_n^{-2}\mA_w^{-1}\boldsymbol{\Phi}^\T = \mSigma_p\boldsymbol{\Phi}^\T\mK_y^{-1} σ n − 2 A w − 1 Φ ⊤ = Σ p Φ ⊤ K y − 1 ,即一个推移恒等式。于是 ϕ ∗ ⊤ w ˉ = k ∗ ⊤ K y − 1 y \boldsymbol{\phi}_*^\T\bar{\vw} = \vk_*^\T\mK_y^{-1}\vy ϕ ∗ ⊤ w ˉ = k ∗ ⊤ K y − 1 y ,同样是式(8.6) 。
权重空间要对 M × M M \times M M × M 矩阵求逆,函数空间则要对 n × n n \times n n × n 矩阵求逆(Rasmussen 与 Williams,2006 ,第 2.1.2 节) 。特征少而观测多时,权重空间的计算代价更低;特征有无穷多个时,只能采用函数空间(第 7.2 节 )。
书中用途 。除上例之外,式(B.6) 还为习题 8.2 提供了第二种解法(习题 B.1 )。低秩近似使高斯过程能够处理大数据集(第 8.4 节 ),这类方法以 m m m 个诱导点代替 n n n 个观测,应用的正是式(B.5) 与式(B.7) (Quiñonero-Candela 与 Rasmussen,2005 ) 。
第 B.2 节引用的文献 2 Rasmussen 与 Williams(2006) Gaussian Processes for Machine LearningQuiñonero-Candela 与 Rasmussen(2005) A Unifying View of Sparse Approximate Gaussian Process Regression
B.3 高斯分布的条件化 #
将高斯向量分为两块,沿用式(4.12) 的记号:
[ a b ] ∼ N ( [ μ a μ b ] , [ Σ a a Σ a b Σ a b ⊤ Σ b b ] ) . \begin{bmatrix} \mathbf{a} \\ \mathbf{b} \end{bmatrix}
\sim \N\!\left(
\begin{bmatrix} \vmu_a \\ \vmu_b \end{bmatrix},\;
\begin{bmatrix} \mSigma_{aa} & \mSigma_{ab} \\ \mSigma_{ab}^\T & \mSigma_{bb} \end{bmatrix}
\right). [ a b ] ∼ N ( [ μ a μ b ] , [ Σ aa Σ ab ⊤ Σ ab Σ bb ] ) .
有两种运算可将其化为关于其中一块的陈述,结果都是高斯分布。
定理 B.3 高斯分布的边际分布与条件分布
a \mathbf{a} a 的边际分布为 N ( μ a , Σ a a ) \N(\vmu_a, \mSigma_{aa}) N ( μ a , Σ aa ) 。给定 a \mathbf{a} a 时 b \mathbf{b} b 的条件分布是高斯分布,
b ∣ a ∼ N ( μ b ∣ a , Σ b ∣ a ) , μ b ∣ a = μ b + Σ a b ⊤ Σ a a − 1 ( a − μ a ) , Σ b ∣ a = Σ b b − Σ a b ⊤ Σ a a − 1 Σ a b . \begin{aligned}
\mathbf{b} \given \mathbf{a} &\sim \N\!\left(\vmu_{b \mid a},\, \mSigma_{b \mid a}\right), \\
\vmu_{b \mid a} &= \vmu_b + \mSigma_{ab}^\T\mSigma_{aa}^{-1}(\mathbf{a} - \vmu_a), \\
\mSigma_{b \mid a} &= \mSigma_{bb} - \mSigma_{ab}^\T\mSigma_{aa}^{-1}\mSigma_{ab}.
\end{aligned} b ∣ a μ b ∣ a Σ b ∣ a ∼ N ( μ b ∣ a , Σ b ∣ a ) , = μ b + Σ ab ⊤ Σ aa − 1 ( a − μ a ) , = Σ bb − Σ ab ⊤ Σ aa − 1 Σ ab . (B.9)
若用精度矩阵 Λ = Σ − 1 \bm{\Lambda} = \mSigma^{-1} Λ = Σ − 1 (按同样方式分块)表示,条件分布的精度为 Λ b b \bm{\Lambda}_{bb} Λ bb ,均值为 μ b − Λ b b − 1 Λ a b ⊤ ( a − μ a ) \vmu_b - \bm{\Lambda}_{bb}^{-1}\bm{\Lambda}_{ab}^\T(\mathbf{a} - \vmu_a) μ b − Λ bb − 1 Λ ab ⊤ ( a − μ a ) 。
证明
边际分布对应保留 a \mathbf{a} a 、丢弃 b \mathbf{b} b 的线性映射;高斯变量经线性映射后仍为高斯变量,均值与协方差随之映射(式(4.9) )。
再看条件分布。给定 a \mathbf{a} a 时,b \mathbf{b} b 的密度作为 b \mathbf{b} b 的函数正比于联合密度,而联合密度的对数为 − 1 2 ( x − μ ) ⊤ Λ ( x − μ ) -\tfrac12(\vx - \vmu)^\T\bm{\Lambda}(\vx - \vmu) − 2 1 ( x − μ ) ⊤ Λ ( x − μ ) 加一个常数。合并含 b \mathbf{b} b 的项,余下一个二次型,其精度为 Λ b b \bm{\Lambda}_{bb} Λ bb ,均值即上文以精度形式给出的均值。对 Σ \mSigma Σ 应用定理 B.1 ,Schur 补为 S = Σ b b − Σ a b ⊤ Σ a a − 1 Σ a b \mathbf{S} = \mSigma_{bb} - \mSigma_{ab}^\T\mSigma_{aa}^{-1}\mSigma_{ab} S = Σ bb − Σ ab ⊤ Σ aa − 1 Σ ab ,精度矩阵的块为 Λ b b = S − 1 \bm{\Lambda}_{bb} = \mathbf{S}^{-1} Λ bb = S − 1 与 Λ a b ⊤ = − S − 1 Σ a b ⊤ Σ a a − 1 \bm{\Lambda}_{ab}^\T = -\mathbf{S}^{-1}\mSigma_{ab}^\T\mSigma_{aa}^{-1} Λ ab ⊤ = − S − 1 Σ ab ⊤ Σ aa − 1 。代入即得协方差 S \mathbf{S} S 与均值偏移 Σ a b ⊤ Σ a a − 1 ( a − μ a ) \mSigma_{ab}^\T\mSigma_{aa}^{-1}(\mathbf{a} - \vmu_a) Σ ab ⊤ Σ aa − 1 ( a − μ a ) 。第 4.5.2 节 完成了每一步的计算,并给出了不借助精度矩阵的另一种证明。
式(B.9) 的三个特点在全书中反复出现:条件均值是观测块的线性函数;条件协方差完全不依赖于观测值;条件协方差等于先验协方差减去一个半正定矩阵,因此观测只会减少不确定性。
本书的多数模型并非以联合高斯分布的形式给出,而是由高斯先验与观测构成,观测等于未知量的线性函数加高斯噪声。下面的结果实现两种形式之间的转换。
定理 B.4 线性高斯对
设 a ∼ N ( μ , Σ ) \mathbf{a} \sim \N(\vmu, \mSigma) a ∼ N ( μ , Σ ) ,b ∣ a ∼ N ( H a + c , R ) \mathbf{b} \given \mathbf{a} \sim \N(\mathbf{H}\mathbf{a} + \mathbf{c},\, \mathbf{R}) b ∣ a ∼ N ( Ha + c , R ) 。则 a \mathbf{a} a 与 b \mathbf{b} b 服从联合高斯分布,且
E [ b ] = H μ + c , Cov [ b ] = H Σ H ⊤ + R , Cov [ a , b ] = Σ H ⊤ , \begin{aligned}
\E[\mathbf{b}] &= \mathbf{H}\vmu + \mathbf{c}, \\
\Cov[\mathbf{b}] &= \mathbf{H}\mSigma\mathbf{H}^\T + \mathbf{R}, \\
\Cov[\mathbf{a}, \mathbf{b}] &= \mSigma\mathbf{H}^\T,
\end{aligned} E [ b ] Cov [ b ] Cov [ a , b ] = H μ + c , = H Σ H ⊤ + R , = Σ H ⊤ , (B.10)
给定 b \mathbf{b} b 时 a \mathbf{a} a 的后验是高斯分布,且
E [ a ∣ b ] = μ + G ( b − H μ − c ) , Cov [ a ∣ b ] = Σ − G H Σ , G = Σ H ⊤ ( H Σ H ⊤ + R ) − 1 . \begin{aligned}
\E[\mathbf{a} \given \mathbf{b}] &= \vmu + \mathbf{G}\,(\mathbf{b} - \mathbf{H}\vmu - \mathbf{c}), \\
\Cov[\mathbf{a} \given \mathbf{b}] &= \mSigma - \mathbf{G}\,\mathbf{H}\mSigma, \\
\mathbf{G} &= \mSigma\mathbf{H}^\T\left(\mathbf{H}\mSigma\mathbf{H}^\T + \mathbf{R}\right)^{-1}.
\end{aligned} E [ a ∣ b ] Cov [ a ∣ b ] G = μ + G ( b − H μ − c ) , = Σ − G H Σ , = Σ H ⊤ ( H Σ H ⊤ + R ) − 1 . (B.11)
证明
记 b = H a + c + e \mathbf{b} = \mathbf{H}\mathbf{a} + \mathbf{c} + \mathbf{e} b = Ha + c + e ,其中 e ∼ N ( 0 , R ) \mathbf{e} \sim \N(\mathbf{0}, \mathbf{R}) e ∼ N ( 0 , R ) 与 a \mathbf{a} a 独立。( a , e ) (\mathbf{a}, \mathbf{e}) ( a , e ) 的两部分是相互独立的高斯变量,因而服从联合高斯分布;( a , b ) (\mathbf{a}, \mathbf{b}) ( a , b ) 是它的线性映射,所以同样服从联合高斯分布。其矩由线性性得出:Cov [ a , b ] = Cov [ a , H a ] = Σ H ⊤ \Cov[\mathbf{a}, \mathbf{b}] = \Cov[\mathbf{a}, \mathbf{H}\mathbf{a}] = \mSigma\mathbf{H}^\T Cov [ a , b ] = Cov [ a , Ha ] = Σ H ⊤ ;Cov [ b ] = H Σ H ⊤ + R \Cov[\mathbf{b}] = \mathbf{H}\mSigma\mathbf{H}^\T + \mathbf{R} Cov [ b ] = H Σ H ⊤ + R ,因为 b \mathbf{b} b 的两个独立部分的协方差相加。后验即互换两块角色后的式(B.9) 。
书中用途 。在观测输入上取 H = I \mathbf{H} = \mI H = I 、R = σ n 2 I \mathbf{R} = \sigma_n^2\mI R = σ n 2 I ,式(B.10) 即为带噪声的高斯过程回归背后的联合分布(第 8.3 节 ),其中间一式即边际似然中的协方差 K y \mK_y K y (第 9.3 节 )。取 H = Φ \mathbf{H} = \boldsymbol{\Phi} H = Φ ,则得到贝叶斯线性回归(第 5.4 节 ),即例 B.1 中的函数空间形式。矩阵 G \mathbf{G} G 称为增益,它把观测中出乎预期的部分转化为对先验均值的修正。
B.4 高斯密度的乘积 #
同一变量上的两个高斯密度相乘,结果仍呈高斯形状,只差一个常数因子。记 N ( x ; μ , Σ ) \N(\vx;\, \vmu, \mSigma) N ( x ; μ , Σ ) 为均值为 μ \vmu μ 、协方差为 Σ \mSigma Σ 的高斯密度在 x \vx x 处的值。
定理 B.5 两个高斯密度的乘积
N ( x ; μ 1 , Σ 1 ) N ( x ; μ 2 , Σ 2 ) = Z N ( x ; μ , Σ ) , \N(\vx;\, \vmu_1, \mSigma_1)\;\N(\vx;\, \vmu_2, \mSigma_2)
= Z\;\N(\vx;\, \vmu, \mSigma), N ( x ; μ 1 , Σ 1 ) N ( x ; μ 2 , Σ 2 ) = Z N ( x ; μ , Σ ) , (B.12)
其中 Σ = ( Σ 1 − 1 + Σ 2 − 1 ) − 1 \mSigma = \left(\mSigma_1^{-1} + \mSigma_2^{-1}\right)^{-1} Σ = ( Σ 1 − 1 + Σ 2 − 1 ) − 1 ,μ = Σ ( Σ 1 − 1 μ 1 + Σ 2 − 1 μ 2 ) \vmu = \mSigma\left(\mSigma_1^{-1}\vmu_1 + \mSigma_2^{-1}\vmu_2\right) μ = Σ ( Σ 1 − 1 μ 1 + Σ 2 − 1 μ 2 ) ,Z = N ( μ 1 ; μ 2 , Σ 1 + Σ 2 ) Z = \N(\vmu_1;\, \vmu_2,\, \mSigma_1 + \mSigma_2) Z = N ( μ 1 ; μ 2 , Σ 1 + Σ 2 ) 。
证明
将这一乘积视为一个模型。令 x ∼ N ( μ 1 , Σ 1 ) \vx \sim \N(\vmu_1, \mSigma_1) x ∼ N ( μ 1 , Σ 1 ) ,y ∣ x ∼ N ( x , Σ 2 ) \vy \given \vx \sim \N(\vx, \mSigma_2) y ∣ x ∼ N ( x , Σ 2 ) 。
联合密度为 p ( x ) p ( y ∣ x ) = N ( x ; μ 1 , Σ 1 ) N ( y ; x , Σ 2 ) p(\vx)\,p(\vy \given \vx) = \N(\vx;\, \vmu_1, \mSigma_1)\,\N(\vy;\, \vx, \mSigma_2) p ( x ) p ( y ∣ x ) = N ( x ; μ 1 , Σ 1 ) N ( y ; x , Σ 2 ) 。高斯密度对自变量与均值的依赖只通过二者之差,所以 N ( y ; x , Σ 2 ) = N ( x ; y , Σ 2 ) \N(\vy;\, \vx, \mSigma_2) = \N(\vx;\, \vy, \mSigma_2) N ( y ; x , Σ 2 ) = N ( x ; y , Σ 2 ) 。在 y = μ 2 \vy = \vmu_2 y = μ 2 处,联合密度就是式(B.12) 的左边。
同一联合密度也可以按另一顺序分解为 p ( y ) p ( x ∣ y ) p(\vy)\,p(\vx \given \vy) p ( y ) p ( x ∣ y ) 。由定理 B.4 ,取 H = I \mathbf{H} = \mI H = I 、c = 0 \mathbf{c} = \mathbf{0} c = 0 、R = Σ 2 \mathbf{R} = \mSigma_2 R = Σ 2 ,得 p ( y ) = N ( y ; μ 1 , Σ 1 + Σ 2 ) p(\vy) = \N(\vy;\, \vmu_1, \mSigma_1 + \mSigma_2) p ( y ) = N ( y ; μ 1 , Σ 1 + Σ 2 ) ,而 p ( x ∣ y ) p(\vx \given \vy) p ( x ∣ y ) 是高斯分布,协方差为 Σ 1 − Σ 1 ( Σ 1 + Σ 2 ) − 1 Σ 1 \mSigma_1 - \mSigma_1(\mSigma_1 + \mSigma_2)^{-1}\mSigma_1 Σ 1 − Σ 1 ( Σ 1 + Σ 2 ) − 1 Σ 1 ,均值为 μ 1 + Σ 1 ( Σ 1 + Σ 2 ) − 1 ( y − μ 1 ) \vmu_1 + \mSigma_1(\mSigma_1 + \mSigma_2)^{-1}(\vy - \vmu_1) μ 1 + Σ 1 ( Σ 1 + Σ 2 ) − 1 ( y − μ 1 ) 。
在 y = μ 2 \vy = \vmu_2 y = μ 2 处,第一个因子就是常数 Z Z Z 。
由式(B.5) ,取 Z = Σ 1 − 1 \mathbf{Z} = \mSigma_1^{-1} Z = Σ 1 − 1 、U = V = I \mathbf{U} = \mathbf{V} = \mI U = V = I 、W = Σ 2 − 1 \mW = \mSigma_2^{-1} W = Σ 2 − 1 ,第 2 步中的协方差等于 ( Σ 1 − 1 + Σ 2 − 1 ) − 1 = Σ (\mSigma_1^{-1} + \mSigma_2^{-1})^{-1} = \mSigma ( Σ 1 − 1 + Σ 2 − 1 ) − 1 = Σ 。
由第 4 步,Σ Σ 1 − 1 = I − Σ 1 ( Σ 1 + Σ 2 ) − 1 \mSigma\mSigma_1^{-1} = \mI - \mSigma_1(\mSigma_1 + \mSigma_2)^{-1} Σ Σ 1 − 1 = I − Σ 1 ( Σ 1 + Σ 2 ) − 1 ;又因 Σ ( Σ 1 − 1 + Σ 2 − 1 ) = I \mSigma(\mSigma_1^{-1} + \mSigma_2^{-1}) = \mI Σ ( Σ 1 − 1 + Σ 2 − 1 ) = I ,有 Σ Σ 2 − 1 = Σ 1 ( Σ 1 + Σ 2 ) − 1 \mSigma\mSigma_2^{-1} = \mSigma_1(\mSigma_1 + \mSigma_2)^{-1} Σ Σ 2 − 1 = Σ 1 ( Σ 1 + Σ 2 ) − 1 。所以第 2 步中的均值在 y = μ 2 \vy = \vmu_2 y = μ 2 处为 Σ Σ 1 − 1 μ 1 + Σ Σ 2 − 1 μ 2 = μ \mSigma\mSigma_1^{-1}\vmu_1 + \mSigma\mSigma_2^{-1}\vmu_2 = \vmu Σ Σ 1 − 1 μ 1 + Σ Σ 2 − 1 μ 2 = μ 。
由这一证明可以理解结果的三个部分。精度相加,是因为关于同一个量的两份独立证据合并在了一起。均值是两个均值以精度为权重的加权平均。常数 Z Z Z 是第一个高斯分布经第二个高斯分布模糊之后,在第二个高斯分布中心处的概率密度:两个密度重叠时该值较大,不重叠时极小。第 4.6.2 节 用配方法推导了一维情形,并配有图示。
例 B.2 一个变量上的两个鼓包
第 7.2.1 节 需要计算两个未归一化鼓包之积 e − ( x − c ) 2 / 2 s 2 e − ( x ′ − c ) 2 / 2 s 2 e^{-(x - c)^2/2s^2}\,e^{-(x' - c)^2/2s^2} e − ( x − c ) 2 /2 s 2 e − ( x ′ − c ) 2 /2 s 2 对 c c c 的积分。作为 c c c 的函数,每个鼓包都是 2 π s 2 \sqrt{2\pi s^2} 2 π s 2 乘以方差为 s 2 s^2 s 2 的高斯密度,两者的中心分别为 x x x 与 x ′ x' x ′ 。由式(B.12) ,乘积为
2 π s 2 ⋅ N ( x ; x ′ , 2 s 2 ) ⋅ N ( c ; x + x ′ 2 , s 2 2 ) . 2\pi s^2 \cdot \N(x;\, x',\, 2s^2) \cdot \N\!\left(c;\, \tfrac{x + x'}{2},\, \tfrac{s^2}{2}\right). 2 π s 2 ⋅ N ( x ; x ′ , 2 s 2 ) ⋅ N ( c ; 2 x + x ′ , 2 s 2 ) .
最后一个因子对 c c c 的积分为 1,所以积分值为 2 π s 2 N ( x ; x ′ , 2 s 2 ) = s π e − ( x − x ′ ) 2 / 4 s 2 2\pi s^2\,\N(x;\, x', 2s^2) = s\sqrt{\pi}\; e^{-(x - x')^2/4s^2} 2 π s 2 N ( x ; x ′ , 2 s 2 ) = s π e − ( x − x ′ ) 2 /4 s 2 ,与该节用配方法求得的结果相同。径向基函数核正是两个鼓包之积中的常数 Z Z Z 。
书中用途 。高斯先验与高斯似然下的贝叶斯定理即为式(B.12) ,其中 Z Z Z 为模型证据(第 5.6 节 )。期望传播(第 17.3 节 )依据同一规则逐个乘、除高斯因子。
B.5 两个高斯变量的期望最大值 #
有几个采集函数需要计算两个不确定量中较大者的期望值:期望改进比较一个不确定的值与一个已知的值(第 12.3 节 ),最优选项期望效用比较效用的两个不确定的值(第 19.4 节 )。当这两个量服从联合高斯分布时,该期望有闭式解。
定理 B.6 两个高斯变量的期望最大值
设 A A A 与 B B B 服从联合高斯分布,均值为 μ A , μ B \mu_A, \mu_B μ A , μ B ,方差为 v A , v B v_A, v_B v A , v B ,协方差为 c c c 。记 δ = μ A − μ B \delta = \mu_A - \mu_B δ = μ A − μ B ,s 2 = v A + v B − 2 c s^2 = v_A + v_B - 2c s 2 = v A + v B − 2 c 为 A − B A - B A − B 的方差。若 s > 0 s > 0 s > 0 ,则
E [ max { A , B } ] = μ A Φ ( α ) + μ B Φ ( − α ) + s ϕ ( α ) , α = δ / s , \begin{aligned}
\E[\max\{A, B\}] ={}& \mu_A\,\Phi(\alpha) + \mu_B\,\Phi(-\alpha) \\
&+ s\,\phi(\alpha), \qquad \alpha = \delta / s,
\end{aligned} E [ max { A , B }] = μ A Φ ( α ) + μ B Φ ( − α ) + s ϕ ( α ) , α = δ / s , (B.13)
其中 ϕ \phi ϕ 与 Φ \Phi Φ 分别是标准正态分布的密度与分布函数。若 s = 0 s = 0 s = 0 ,期望为 max { μ A , μ B } \max\{\mu_A, \mu_B\} max { μ A , μ B } 。
证明
对任意两个数,max { A , B } = B + max { A − B , 0 } \max\{A, B\} = B + \max\{A - B, 0\} max { A , B } = B + max { A − B , 0 } 。
D = A − B D = A - B D = A − B 是高斯向量的线性映射,因而服从高斯分布(式(4.9) ),均值为 δ \delta δ ,方差为 Var [ A ] + Var [ B ] − 2 Cov [ A , B ] = s 2 \Var[A] + \Var[B] - 2\Cov[A, B] = s^2 Var [ A ] + Var [ B ] − 2 Cov [ A , B ] = s 2 。
若 s > 0 s > 0 s > 0 ,记 D = δ + s Z D = \delta + sZ D = δ + s Z ,其中 Z Z Z 服从标准正态分布。仅当 Z > − δ / s Z > -\delta/s Z > − δ / s 时 max { D , 0 } \max\{D, 0\} max { D , 0 } 不为零,因此 E [ max { D , 0 } ] = ∫ − δ / s ∞ ( δ + s z ) ϕ ( z ) d z \E[\max\{D, 0\}] = \int_{-\delta/s}^{\infty}(\delta + sz)\,\phi(z)\,\dd z E [ max { D , 0 }] = ∫ − δ / s ∞ ( δ + sz ) ϕ ( z ) d z 。第一部分为 δ ( 1 − Φ ( − δ / s ) ) = δ Φ ( δ / s ) \delta\,(1 - \Phi(-\delta/s)) = \delta\,\Phi(\delta/s) δ ( 1 − Φ ( − δ / s )) = δ Φ ( δ / s ) 。第二部分:由 ϕ ′ ( z ) = − z ϕ ( z ) \phi'(z) = -z\,\phi(z) ϕ ′ ( z ) = − z ϕ ( z ) ,z ϕ ( z ) z\,\phi(z) z ϕ ( z ) 的原函数为 − ϕ ( z ) -\phi(z) − ϕ ( z ) ,z ϕ ( z ) z\,\phi(z) z ϕ ( z ) 从 − δ / s -\delta/s − δ / s 到无穷的积分为 ϕ ( − δ / s ) = ϕ ( δ / s ) \phi(-\delta/s) = \phi(\delta/s) ϕ ( − δ / s ) = ϕ ( δ / s ) 。于是 E [ max { D , 0 } ] = δ Φ ( δ / s ) + s ϕ ( δ / s ) \E[\max\{D, 0\}] = \delta\,\Phi(\delta/s) + s\,\phi(\delta/s) E [ max { D , 0 }] = δ Φ ( δ / s ) + s ϕ ( δ / s ) 。
由期望的线性性与第 1 步,E [ max { A , B } ] = μ B + δ Φ ( δ / s ) + s ϕ ( δ / s ) \E[\max\{A, B\}] = \mu_B + \delta\,\Phi(\delta/s) + s\,\phi(\delta/s) E [ max { A , B }] = μ B + δ Φ ( δ / s ) + s ϕ ( δ / s ) 。由于 μ B + δ Φ ( δ / s ) = μ A Φ ( δ / s ) + μ B ( 1 − Φ ( δ / s ) ) \mu_B + \delta\,\Phi(\delta/s) = \mu_A\Phi(\delta/s) + \mu_B(1 - \Phi(\delta/s)) μ B + δ Φ ( δ / s ) = μ A Φ ( δ / s ) + μ B ( 1 − Φ ( δ / s )) ,且 1 − Φ ( t ) = Φ ( − t ) 1 - \Phi(t) = \Phi(-t) 1 − Φ ( t ) = Φ ( − t ) ,这就是式(B.13) 。
若 s = 0 s = 0 s = 0 ,D D D 等于常数 δ \delta δ ,max { A , B } = B + max { δ , 0 } \max\{A, B\} = B + \max\{\delta, 0\} max { A , B } = B + max { δ , 0 } 的期望为 max { μ A , μ B } \max\{\mu_A, \mu_B\} max { μ A , μ B } 。
该公式出自 Clark(1961) 。这篇论文对相关系数任意的两个联合正态变量给出了精确结果,并通过反复应用该结果,给出多于两个变量时的近似。第 3 步正是期望改进背后的计算,第 12.3 节 逐步完成了这一计算(式(12.4) )。
该公式可以逐项解读。Φ ( δ / s ) \Phi(\delta/s) Φ ( δ / s ) 是 A A A 超过 B B B 的概率,所以前两项是两个均值的加权平均,权重为相应变量较大的概率。第三项是由于不知道哪个较大而获得的额外收益,它对不确定性的依赖只通过 s s s 。书中用到由此得出的四个推论。
从不低于较优均值 。max { D , 0 } ≥ D \max\{D, 0\} \ge D max { D , 0 } ≥ D 且 max { D , 0 } ≥ 0 \max\{D, 0\} \ge 0 max { D , 0 } ≥ 0 ,所以 E [ max { D , 0 } ] ≥ max { δ , 0 } \E[\max\{D, 0\}] \ge \max\{\delta, 0\} E [ max { D , 0 }] ≥ max { δ , 0 } ,进而 E [ max { A , B } ] ≥ max { μ A , μ B } \E[\max\{A, B\}] \ge \max\{\mu_A, \mu_B\} E [ max { A , B }] ≥ max { μ A , μ B } 。
随 s s s 递增 。将第 3 步的结果对 s s s 求导,来自 Φ \Phi Φ 的项与来自 ϕ ′ \phi' ϕ ′ 的项相互抵消,恰好余下 ϕ ( δ / s ) > 0 \phi(\delta/s) > 0 ϕ ( δ / s ) > 0 。关于两者之差的不确定性越大,价值总是越高。
相关性只通过 s s s 起作用 。A A A 与 B B B 正相关会降低 s s s ,从而降低期望最大值;负相关则使之升高。同涨同落的两个选项,几乎没有选择的余地。
均值相等 。δ = 0 \delta = 0 δ = 0 时公式化为 μ + s / 2 π \mu + s/\sqrt{2\pi} μ + s / 2 π :额外收益约为 0.4 s 0.4\,s 0.4 s 。
下图展示最大值的完整分布,式(B.13) 给出的正是该分布的均值。
A 的密度 B 的密度 max(A, B) 的密度 0.0 0.2 0.4 0.6 0.8 密度 −4 −2 0 2 4 取值 较优均值 E[max] E[max(A, B)] = 0.674(Clark 公式),0.674(对密度数值积分)· 较优均值 0.40 · 额外收益 0.274 · s = 1.12 A 的密度 B 的密度 max(A, B) 的密度 0.0 0.2 0.4 0.6 0.8 密度 −4 −2 0 2 4 取值 较优均值 E[max] E[max(A, B)] = 0.674(公式),0.674(积分) 较优均值 0.40 · 额外收益 0.274 · s = 1.12 图 B.1 两个联合高斯值的最大值。细曲线:A A A 与 B B B 的密度。阴影:max { A , B } \max\{A, B\} max { A , B } 的精确密度。竖直实线为其均值,即式(B.13) ;虚线为两个均值中较优者。读数以阴影密度的数值积分检验该公式,并给出超出较优均值的额外收益。
按下“均值相等” 。额外收益为 s / 2 π s/\sqrt{2\pi} s / 2 π :标准差分别为 1 与 0.5、不相关时,s = 1.12 s = 1.12 s = 1.12 ,额外收益为 0.446。
把“相关系数 ρ”调向 0.95 。额外收益随 s s s 一同缩小。两个标准差相等且相关系数接近 1 时,两个值同步变化,其差几乎为常数,最大值的期望几乎恰好等于较优均值。
把相关系数调向 − 0.95 -0.95 − 0.95 。此时一个值高时另一个值低,最大值几乎总是远高于两个均值,额外收益达到最大。
按下“一个确定的选项” 。B B B 近乎常数时,阴影密度就是将 A A A 的密度中低于 B B B 的部分全部堆积到 B B B 处所得的密度,其均值为 μ B \mu_B μ B 加上 A A A 相对于 μ B \mu_B μ B 的期望改进。期望改进正是式(B.13) 在两个值之一已知时的特例。
书中用途 。式(B.13) 就是式(19.3) ,即一对选项的 EUBO 闭式解,其中 A A A 与 B B B 为两个选项的后验效用。只有两个输入参与时,它也是知识梯度(第 12.6 节 )。此时两个值是同一标准正态变量的线性函数,因而完全相关,定理依然适用,只需取 s s s 为二者斜率之差的绝对值。
第 B.5 节引用的文献 1 Clark(1961) The Greatest of a Finite Set of Random Variables
B.6 习题 #
习题 B.1
令 1 \mathbf{1} 1 为由 n n n 个 1 组成的向量。用式(B.6) 计算 ( σ 2 I + 11 ⊤ ) − 1 1 (\sigma^2\mI + \mathbf{1}\mathbf{1}^\T)^{-1}\mathbf{1} ( σ 2 I + 1 1 ⊤ ) − 1 1 ,并由此求出:在单位幅度的核下,于 x 0 x_0 x 0 处做 n n n 次带噪声观测之后,x 0 x_0 x 0 处的后验方差(与习题 8.2 相同)。
解答
取 Z = σ 2 I \mathbf{Z} = \sigma^2\mI Z = σ 2 I 、u = v = 1 \mathbf{u} = \mathbf{v} = \mathbf{1} u = v = 1 ,则 Z − 1 1 = 1 / σ 2 \mathbf{Z}^{-1}\mathbf{1} = \mathbf{1}/\sigma^2 Z − 1 1 = 1 / σ 2 ,1 ⊤ Z − 1 1 = n / σ 2 \mathbf{1}^\T\mathbf{Z}^{-1}\mathbf{1} = n/\sigma^2 1 ⊤ Z − 1 1 = n / σ 2 。于是
( σ 2 I + 11 ⊤ ) − 1 1 = 1 σ 2 − 1 ( n / σ 2 ) σ 2 ( 1 + n / σ 2 ) = 1 σ 2 ⋅ 1 1 + n / σ 2 = 1 σ 2 + n . \begin{aligned}
(\sigma^2\mI + \mathbf{1}\mathbf{1}^\T)^{-1}\mathbf{1}
&= \frac{\mathbf{1}}{\sigma^2} - \frac{\mathbf{1}\,(n/\sigma^2)}{\sigma^2\,(1 + n/\sigma^2)} \\
&= \frac{\mathbf{1}}{\sigma^2}\cdot\frac{1}{1 + n/\sigma^2}
= \frac{\mathbf{1}}{\sigma^2 + n}.
\end{aligned} ( σ 2 I + 1 1 ⊤ ) − 1 1 = σ 2 1 − σ 2 ( 1 + n / σ 2 ) 1 ( n / σ 2 ) = σ 2 1 ⋅ 1 + n / σ 2 1 = σ 2 + n 1 .
所有核函数值都是 1,所以 K = 11 ⊤ \mK = \mathbf{1}\mathbf{1}^\T K = 1 1 ⊤ ,k ( x 0 ) = 1 \vk(x_0) = \mathbf{1} k ( x 0 ) = 1 ,式(8.6) 的后验方差为 1 − 1 ⊤ 1 / ( σ 2 + n ) = σ 2 / ( σ 2 + n ) 1 - \mathbf{1}^\T\mathbf{1}/(\sigma^2 + n) = \sigma^2/(\sigma^2 + n) 1 − 1 ⊤ 1 / ( σ 2 + n ) = σ 2 / ( σ 2 + n ) 。
习题 B.2
用式(B.7) 计算 n n n 个观测时 σ 2 I + 11 ⊤ \sigma^2\mI + \mathbf{1}\mathbf{1}^\T σ 2 I + 1 1 ⊤ 的行列式,并由此求出式(9.4) 中的复杂度项 − 1 2 log ∣ K y ∣ -\tfrac12\log\lvert\mK_y\rvert − 2 1 log ∣ K y ∣ ,其中核为单位幅度、长度尺度无穷长。再与长度尺度很短的情形比较,此时 K y = ( 1 + σ 2 ) I \mK_y = (1 + \sigma^2)\mI K y = ( 1 + σ 2 ) I 。
解答
取 Z = σ 2 I \mathbf{Z} = \sigma^2\mI Z = σ 2 I 、U = V = 1 \mathbf{U} = \mathbf{V} = \mathbf{1} U = V = 1 、W = 1 \mW = 1 W = 1 :det ( σ 2 I + 11 ⊤ ) = σ 2 n ( 1 + n / σ 2 ) = σ 2 ( n − 1 ) ( σ 2 + n ) \det(\sigma^2\mI + \mathbf{1}\mathbf{1}^\T) = \sigma^{2n}\,(1 + n/\sigma^2) = \sigma^{2(n-1)}(\sigma^2 + n) det ( σ 2 I + 1 1 ⊤ ) = σ 2 n ( 1 + n / σ 2 ) = σ 2 ( n − 1 ) ( σ 2 + n ) 。复杂度项为 − 1 2 [ ( n − 1 ) log σ 2 + log ( σ 2 + n ) ] -\tfrac12\left[(n - 1)\log\sigma^2 + \log(\sigma^2 + n)\right] − 2 1 [ ( n − 1 ) log σ 2 + log ( σ 2 + n ) ] 。噪声小时,该项是很大的正数:n = 7 n = 7 n = 7 、σ = 0.1 \sigma = 0.1 σ = 0.1 时为 − 1 2 [ 6 × ( − 4.61 ) + 1.95 ] = 12.8 -\tfrac12\left[6 \times (-4.61) + 1.95\right] = 12.8 − 2 1 [ 6 × ( − 4.61 ) + 1.95 ] = 12.8 。长度尺度很短时,行列式为 ( 1 + σ 2 ) n (1 + \sigma^2)^n ( 1 + σ 2 ) n ,该项为 − n 2 log ( 1 + σ 2 ) = − 0.03 -\tfrac{n}{2}\log(1 + \sigma^2) = -0.03 − 2 n log ( 1 + σ 2 ) = − 0.03 。长的长度尺度所受的复杂度惩罚小得多,因为它预期所有观测几乎相等,而这只占数据集空间中很薄的一片。除非观测确实几乎相等,否则它会在数据拟合项上受到惩罚。
习题 B.3
设 A A A 与 B B B 是相互独立的标准正态变量。(a)用式(B.13) 求 E [ max { A , B } ] \E[\max\{A, B\}] E [ max { A , B }] 。(b)不经积分,证明 E [ max { A , B } 2 ] = 1 \E[\max\{A, B\}^2] = 1 E [ max { A , B } 2 ] = 1 ,并求最大值的方差。(c)在图 B.1 中核对这两个数。
解答
(a)δ = 0 \delta = 0 δ = 0 ,s 2 = 2 s^2 = 2 s 2 = 2 ,所以期望为 s ϕ ( 0 ) = 2 / 2 π = 1 / π ≈ 0.564 s\,\phi(0) = \sqrt{2}/\sqrt{2\pi} = 1/\sqrt{\pi} \approx 0.564 s ϕ ( 0 ) = 2 / 2 π = 1/ π ≈ 0.564 。(b)max { A , B } 2 + min { A , B } 2 = A 2 + B 2 \max\{A, B\}^2 + \min\{A, B\}^2 = A^2 + B^2 max { A , B } 2 + min { A , B } 2 = A 2 + B 2 ,其期望为 2。( − A , − B ) (-A, -B) ( − A , − B ) 与 ( A , B ) (A, B) ( A , B ) 同分布,且 min { A , B } = − max { − A , − B } \min\{A, B\} = -\max\{-A, -B\} min { A , B } = − max { − A , − B } ,所以 min { A , B } 2 \min\{A, B\}^2 min { A , B } 2 与 max { A , B } 2 \max\{A, B\}^2 max { A , B } 2 的期望相同,都等于 1。方差为 1 − 1 / π ≈ 0.682 1 - 1/\pi \approx 0.682 1 − 1/ π ≈ 0.682 :两次抽样的最大值,其变异性比任何一次单独的抽样都小。(c)把两个均值都设为 0,两个标准差都设为 1,相关系数设为 0。读数为 0.564,阴影密度明显比两条细曲线窄。
延伸阅读 #
参考文献
Bishop, C. M. (2006) . Pattern Recognition and Machine Learning . Springer .
Clark, C. E. (1961) . The Greatest of a Finite Set of Random Variables . Operations Research . 引用于 §B.5
Golub, G. H., and Van Loan, C. F. (2013) . Matrix Computations . Johns Hopkins University Press .
Petersen, K. B., and Pedersen, M. S. (2012) . The Matrix Cookbook . Technical University of Denmark . 非同行评审
Quiñonero-Candela, J., and Rasmussen, C. E. (2005) . A Unifying View of Sparse Approximate Gaussian Process Regression . Journal of Machine Learning Research . 引用于 §B.2
Rasmussen, C. E., and Williams, C. K. I. (2006) . Gaussian Processes for Machine Learning . MIT Press . 引用于 §B.2