记号
本书通篇使用同一套记号,本附录将其汇总。每个条目都注明引入该符号的小节;在那里,符号先以文字解释,再用于公式。文献中有多种约定并存时,条目注明本书采用哪一种。
以下排版规则全书通用。标量用斜体(、),向量用粗体小写(、),矩阵用粗体大写(、)。转置记作 。输入位于定义域 中,经缩放后通常为单位立方体 ,其中 是输入个数;下标遍历各个输入时(例如每个输入各有一个长度尺度),记作 。有限的候选输入集合同样记作 ,含 个元素,即使书中引述的论文将其记作 。全书约定越大越好:本书求最大值,天然需要最小化的函数(例如错误率)则取其相反数。
A.1 集合、向量与矩阵 #
表 A.1 线性代数。
A.2 概率 #
表 A.2 概率。
| 符号 | 含义 | 引入位置 |
|---|---|---|
| 事件的概率 | 第 2.1.2 节 | |
| , | 密度函数或质量函数;以 为条件 | 第 2.1.3 节 |
| 服从分布 | 第 2.1.3 节 | |
| 观测数据 | 第 2.5 节 | |
| , | 期望; 次观测后关于后验的期望 | 第 2.6.1 节、第 12.1 节 |
| , | 方差;协方差 | 第 2.6.2 节、第 2.6.3 节 |
| , | 以均值和方差为参数的高斯分布;以均值向量和协方差矩阵为参数的高斯分布 | 第 4.1 节、第 4.2 节 |
| , | 标准正态分布的密度函数与累积分布函数 | 第 4.1.1 节 |
| 逻辑函数 ,即 Bradley-Terry 链接 | 第 16.4 节 | |
| , | 分布或随机变量的熵 | 第 6.1.2 节 |
| Kullback-Leibler 散度 | 第 6.2.1 节 | |
| 互信息 | 第 6.3 节 | |
| 失效概率:以高概率成立的论断,其成立的概率至少为 | 第 13.2.2 节 | |
| -次高斯 | 均值为零、且对所有 满足 的随机变量 ;这里的 不是遗憾 | 第 13.2.2 节 |
与多数统计学教材一样,本书 中的第二个参数是方差,需要时另行给出标准差 。
A.3 高斯过程 #
表 A.3 高斯过程。
| 符号 | 含义 | 引入位置 |
|---|---|---|
| 未知的目标函数(或潜在效用) | 第 1.1 节 | |
| 输入的定义域 | 第 1.1 节 | |
| 定义域为有限集时的候选个数 | 第 12.4 节 | |
| 均值函数为 、核函数为 的高斯过程 | 第 7.3 节 | |
| 核函数(协方差函数) | 第 3.1.1 节、第 7.1.2 节 | |
| , | 长度尺度;每个输入 各有一个长度尺度(自动相关性确定,ARD) | 第 3.1.1 节、第 9.2 节 |
| 幅度的平方,对平稳核而言等于 | 第 7.2.1 节 | |
| 观测噪声方差 | 第 2.6.4 节、第 8.3 节 | |
| , | 已观测的输入与观测值 | 第 8.1 节 |
| 已观测输入的核矩阵, | 第 7.3 节、第 8.1 节 | |
| 与各已观测输入之间的协方差 | 第 8.1 节 | |
| , | 后验均值( 次观测后) | 第 8.1 节、第 11.2 节 |
| , | 潜在值的后验方差( 次观测后) | 第 8.1 节、第 11.2 节 |
| 后验均值中的权重 | 第 3.5.1 节、第 8.2.1 节 | |
| 线性模型的特征个数;对随机 Fourier 特征,指抽取的频率个数 | 第 7.1 节、第 10.4.3 节 | |
| , , | 的再生核 Hilbert 空间(RKHS)及其内积与范数 | 第 10.2 节 |
| RKHS 范数的上界;有的论文界定 ,有的界定 | 第 10.2.4 节 | |
| , | 核函数的积分算子,以及积分所用的权重密度 | 第 10.1.3 节 |
| , | 的特征值与特征函数(Mercer 定理) | 第 10.3 节 |
| , | 平稳核的谱密度;归一化为概率密度后的谱密度 | 第 10.4 节 |
有一处记号冲突需要留意。不带自变量的 表示噪声方差,沿用 Rasmussen 与 Williams(2006)的写法,下标代表噪声(noise)。 总是带自变量书写,表示 次观测后的后验标准差,沿用 Srinivas 等人(2010)的写法。两者靠自变量 区分。两者出现在同一公式中时(第 12.6 节),噪声方差记作 。在第 10 章中,带下标的 表示特征值, 表示权重密度;在其他章节中, 表示逆 Mills 比或失误率, 表示一次查询中的选项数。
第 A.3 节引用的文献 2
- Rasmussen 与 Williams(2006)Gaussian Processes for Machine Learning
- Srinivas 等人(2010)Gaussian Process Optimization in the Bandit Setting: No Regret and Experimental Design
A.4 优化与偏好 #
表 A.4 优化与偏好。
| 符号 | 含义 | 引入位置 |
|---|---|---|
| , | 某个最大值点与最大值 | 第 6.4.2 节、第 11.1 节 |
| 当前最优值,即 次评估后观测到的最好值 | 第 12.2 节 | |
| 次观测后的采集函数 | 第 11.2 节 | |
| , , | 改进概率、期望改进、上置信界 | 第 12.2 节、第 12.3 节、第 12.4 节 |
| , | 上置信界 中的探索权重 | 第 11.2.1 节、第 12.4 节 |
| 改进概率与期望改进中的改进裕量(在第 6.4 节中另指对实验的一种选择) | 第 12.2 节 | |
| , | 瞬时遗憾; 轮的累积遗憾 | 第 13.1 节 |
| 核函数在 次观测后的最大信息增益 | 第 6.5.2 节 | |
| 优于 | 第 16.3 节 | |
| 或 | 人的潜在效用(与高斯过程共用同一套机制时,本书记作 ) | 第 18.1 节 |
| (链接函数中) | 人评价单个选项时的噪声尺度 | 第 16.3 节 |
| 逻辑链接的尺度, | 第 16.4 节 | |
| 逆 Mills 比 ,只在定义它的章节中使用 | 第 17.3 节、第 18.2 节 | |
| 失误率,即回答属于随机失误的概率 | 第 20.4.2 节 | |
| 对数似然的负 Hessian 矩阵;对成对回答而言为加权图 Laplace 矩阵 | 第 17.2 节、第 18.2 节 | |
| 最优选项期望效用 | 第 19.4 节 | |
| 一次查询展示的选项数(qEUBO) | 第 19.4 节 |
遗憾界用 表述,该记号隐去对数因子;书中的每个速率都连同其假设与遗憾单位一并给出(第 29.4 节)。
参考文献
- (2006). Gaussian Processes for Machine Learning. MIT Press. 引用于 §A.3
- (2010). Gaussian Process Optimization in the Bandit Setting: No Regret and Experimental Design. ICML 2010. 引用于 §A.3