后验不是高斯分布时
高斯过程回归之所以有简洁的公式,依赖于一个事实:高斯先验与高斯观测噪声结合,得到的后验仍是高斯分布。第 16 章中的比较模型打破了这一事实。其似然是概率单位曲线或逻辑曲线,而非高斯函数,效用的后验因而不再是高斯分布。后续的一切,包括预测均值与预测带、下一个回答的概率以及第 19 章中的采集函数,都需要这一后验。
本章几乎完全围绕能体现这一困难的最小情形展开:一个效用差、一个高斯先验和少数几次比较。这一情形的精确后验可以在网格上计算并画出,每种近似都可以与真实答案对照。随后转向两个及更多潜在值的情形,那里的精确答案只在比较所涉及的方向上偏斜。最后讨论近似方法的选择在实践中影响多大,并给出相关证据。
17.1 非高斯似然 #
先回顾回归为什么容易。先验为 ,观测 带高斯噪声,贝叶斯定理把关于 的两个高斯密度相乘。高斯密度之积在相差一个常数的意义下仍是高斯密度(第 4.6 节),因此后验有闭式解,其归一化常数(即边际似然)也有闭式解。先验与似然构成一对共轭分布。
比较则不然。记 为已比较输入处的效用,设已记录 个回答,第 个回答表示输入 优于输入 。采用式(16.2)的概率单位模型,由贝叶斯定理得
先验是高斯的,但每个似然因子都是沿 某一方向(即差 的方向)变化的 S 形曲线。乘积不是高斯的; 是高斯向量落入由 堵软墙围成的区域的概率,即一个 维积分,一般没有闭式解(第 5.7 节)。高斯过程分类具有同样的结构:每个输入带有是或否的标签 ,而不是一个数,每个带标签的输入对应一个因子 (Rasmussen 与 Williams,2006,第 3 章)。本章的方法最早正是在分类问题中发展和检验的。
17.1.1 最小情形 #
把问题简化到只剩一个数。与第 16.6 节相同,令 为两个选项之间的效用差,其先验为高斯分布 。这里 是方差;式(16.6)用标准差 描述同类信念,故 。假设一个人回答了一次 更好。记 为差上的噪声,则后验为
因子 2 就是 :信念以零为中心时,由式(16.6),这一回答的先验概率为 。高斯密度乘以正态分布函数,称为偏斜正态(skew-normal)密度,这一分布族由 Azzalini(1985)提出。它保留先验的上尾,切去下尾:噪声大时切得平缓,噪声小时切得陡峭。其均值有闭式解。
- 对 与可微函数 ,由分部积分得 ,因为密度 的导数是 。这就是 Stein 引理(Stein's lemma)。
- 取 ,则 。于是 。
- 即密度 ,只是视为 的函数。因此其先验期望等于 在 0 处的密度,其中 为独立变量(第 4.6 节),即 。
- 除以 ,得后验均值 。
当 时,均值从 时的约 0.46 增大到噪声消失时的 ,标准差则从约 0.89 降到 0.60(习题 17.1)。众数(mode),即密度的峰值点,表现不同:它是方程 的解,随 缩小而滑向零, 时为 0.05。在无噪声的极限下,后验是先验的上半部分,即半正态分布:峰值位于切口处,质量却大多远在切口右侧。
可以做以下尝试:
- 缩小噪声。把 拖向 0.01。似然变为阶跃函数,后验变为半正态分布,众数与均值分离:众数移到切口处,均值停在 0.80 附近。
- 增大噪声。 时,似然是平缓的斜坡,后验是略有偏移的钟形,众数与均值几乎重合。
- 让双方都获胜。 赢三次、 也赢三次时,后验两侧都受到限制,接近以零为中心的高斯分布。偏斜来自单方面的证据。
- 让 一直获胜。每多赢一次,质量就向上推移一些,但噪声小时左边缘始终陡峭:一连串相同的回答之后,证据更坚定地表明“ 更好”,而不是表明“好多少”。
下文每种方法都要概括这种偏向一侧的形状,通常只用单个高斯分布。
第 17.1 节引用的文献 2
- Rasmussen 与 Williams(2006)Gaussian Processes for Machine Learning
- Azzalini(1985)A Class of Distributions Which Includes the Normal Ones
17.2 Laplace 近似 #
最简单的概括是在后验峰值处放置一个高斯分布,并赋予它峰值处的曲率。钟形曲线由最高点的位置以及从最高点下降的快慢决定;如果后验接近钟形,这两项信息就足以将其还原。这就是 Laplace 近似(Laplace approximation),得名于近似积分的 Laplace 方法。Tierney 与 Kadane(1986)展示了它在贝叶斯计算中能发挥的作用:近似的后验矩与边际密度只需要一次最大化以及最大值点处的曲率。
记 为未归一化后验的对数, 为其最大值点,即众数,也称最大后验估计。
- 记 为 的梯度,即其关于 各分量的一阶导数组成的向量;记 为其 Hessian 矩阵,即二阶导数组成的矩阵。在 附近把 展开到二阶(Taylor 定理):,其中 。
- 在最大值点处梯度为零,,因此一次项消失。
- 对数先验的 Hessian 矩阵为 。记 (在 处取值)为对数似然的曲率,则 。
- 取指数:,右端在相差一个常数的意义下是高斯密度。
- 因此 。
需要的只有两样:众数,以及众数处的曲率。对概率单位似然,由于 是凹函数,对数似然是凹的;对数先验是凹的二次函数,因此 只有一个最大值点,Newton 法(Newton's method)能很快找到它。Newton 法在当前点用二次近似代替原函数,然后跳到该二次函数的最大值点。
- 梯度为 ,Hessian 矩阵为 ,此处 在当前的 处取值。
- 局部二次函数的最大值点为 。
- 写出 并合并各项:。
- 避免对 求逆:由于 ,有 ,所以 。
从 出发反复应用式(17.4),每当 没有增大就把步长减半,几次迭代即可收敛。分类问题中 是对角矩阵,Rasmussen 与 Williams(2006)给出了数值稳定的版本,即其算法 3.1。对比较而言, 不是对角矩阵;第 18.2 节推导了它的结构。
同一展开还可以近似归一化常数 ,即用来拟合超参数的边际似然(第 9.3 节)。对第 4 步中的高斯函数积分,得到
这就是 Chu 与 Ghahramani(2005)用于偏好问题的 Laplace 证据,即其论文中的式(12);BoTorch 拟合偏好模型时最大化的也是这一量(第 18.6 节)。
17.2.1 失效之处 #
下图在精确后验上叠加了 Laplace 近似给出的高斯分布。
噪声适中时,蓝色曲线与精确曲线十分接近。随着噪声缩小,近似以一种特定方式失效。 时,精确后验的均值为 0.80,标准差为 0.60, 更好的概率为 0.004。Laplace 近似的高斯分布以众数 0.05 为中心,标准差为 0.27,给出 更好的概率为 0.43:在一个几乎无噪声的回答之后,它对顺序的不确定程度几乎与回答之前相同(习题 17.2)。众数位于质量的边缘,以此为中心的高斯分布必然越过边缘。
这一普遍结论源自分类问题。Kuss 与 Rasmussen(2005)在二分类高斯过程分类器上,把 Laplace 方法、期望传播与长时间采样的结果相比较,发现 Laplace 方法“系统性地低估均值”,因此潜在函数的近似后验“幅度太小”,预测概率过于保守,尽管潜在函数的符号大多正确。他们的结论是,该方法“如此不准确,以至于我们建议不要使用它,尤其是在需要认真对待预测概率的时候”。比较问题中也出现同样的模式:对决几乎无噪声时,众数可能离均值非常远(Takeno 等,2023)。
Laplace 方法至今仍在使用,原因是快速而简单。在从成对偏好中学习机器人奖励的研究中,Bıyık 等人(2020)称期望传播“比 Laplace 近似更准确”,但“在实践中更慢”,最终出于计算效率选择了 Laplace 近似。它也是 BoTorch 的默认方法(第 18.6 节)。
第 17.2 节引用的文献 6
- Tierney 与 Kadane(1986)Accurate Approximations for Posterior Moments and Marginal Densities
- Rasmussen 与 Williams(2006)Gaussian Processes for Machine Learning
- Chu 与 Ghahramani(2005)Preference learning with Gaussian processes
- Kuss 与 Rasmussen(2005)Assessing Approximate Inference for Binary Gaussian Process Classification
- Takeno 等人(2023)Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes
- Bıyık 等人(2020)Active Preference-Based Gaussian Process Regression for Reward Learning
17.3 期望传播 #
Laplace 近似只考察后验的一个点。更好的高斯分布应当匹配后验的均值与方差,即匹配其质量而不是峰值。对完整后验计算这些矩,与原问题一样困难;但对只含一个非高斯因子的后验,计算这些矩很容易。期望传播(expectation propagation,EP)正是由这类单因子问题构建近似的(Minka,2001)。
每个似然因子 称为一个位点(site)。期望传播把每个位点替换为同一方向上的未归一化高斯函数 ,使近似后验 为高斯分布,然后逐个细化各位点。
输入:先验 ,位点 。
- 把每个位点的近似初始化为常数,使 等于先验。
- 选取位点 ,去掉其近似,得到空腔分布(cavity),它是高斯分布。
- 乘入精确因子,得到倾斜分布(tilted distribution)。
- 计算 的均值与协方差。
- 选择新的 ,使 恰好具有这些矩,并更新 。
- 对所有位点逐轮重复第 2 至 5 步,直到各位点的近似不再变化。
第 3 步中的倾斜分布只有一个非高斯因子,且该因子只沿一个方向起作用,因此其矩可以归结为一维问题。对概率单位位点,答案有闭式解。设空腔分布下差 服从高斯分布 ,这里 与 一样表示方差;设位点为 , 获胜时 , 获胜时为 。
- 由式(16.6)的论证,归一化常数为 ,其中 。
- 在积分号下求导,,所以 ,倾斜分布的均值为 。
- 再求一次导,得到倾斜分布的方差 。
- 记 ,利用 ,由链式法则得 与 。
- 因此,倾斜分布的均值为 ,方差为 。
取 ,这些量与概率单位分类的期望传播算法中的量相同(Rasmussen 与 Williams,2006,第 3 章)。每次位点更新都是对协方差的秩一修改,对 个潜在值的代价为 ,因此遍历 个位点一轮的代价为 ;当 与 同阶时,与一次 Newton 迭代相当。
只有一次比较时只有一个位点,倾斜分布就是精确后验,期望传播返回其精确的均值与方差: 时,均值为 0.80,标准差为 0.60,远优于 Laplace 近似的 0.12 与 0.32。不过,矩匹配也有自身的代价。均值和方差都正确的高斯分布,仍会把质量放在精确后验没有质量的地方:期望传播给出 更好的概率为 0.093,而精确值为 0.013。在 下赢五次时,多个位点作用在同一方向上,期望传播不再精确(均值 0.93、标准差 0.45,精确值为 0.90 与 0.58)。
这一微小的错位对比较问题尤为重要。Takeno 等人(2023)以采样方法的长时间运行结果为真实值(取第 17.5 节中 Gibbs 采样器的 10,000 个样本,丢弃前 1,000 个,每十个保留一个),发现期望传播对均值与可信区间的估计非常准确;但对于已观测到 胜过 的对决,它高估了 的概率。在标准测试函数 Ackley 函数上,它低估了接近 0 或 1 的对决概率,其估计也没有保持各对之间的真实顺序,这可能改变采集函数选中的选项对。
在分类问题上,期望传播得到的评价是正面的。Kuss 与 Rasmussen 发现,其预测概率与边际似然估计都与长时间采样的结果非常接近(Kuss 与 Rasmussen,2005);一项范围更广的研究比较了二分类高斯过程分类的各种近似方法,结论是:“除非计算预算非常紧张,期望传播算法几乎总是首选方法”(Nickisch 与 Rasmussen,2008)。与凹函数上的 Newton 法不同,期望传播不能保证每一步都改进某个目标函数,因此位点更新出现振荡时,实现中会对更新施加阻尼。
第 17.3 节引用的文献 5
- Minka(2001)Expectation Propagation for Approximate Bayesian Inference
- Rasmussen 与 Williams(2006)Gaussian Processes for Machine Learning
- Takeno 等人(2023)Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes
- Kuss 与 Rasmussen(2005)Assessing Approximate Inference for Binary Gaussian Process Classification
- Nickisch 与 Rasmussen(2008)Approximations for Binary Gaussian Process Classification
17.4 变分推断 #
第三条途径把近似转化为优化:选定一族简单分布(这里是高斯分布),从中找出与后验最接近的成员,接近程度用 Kullback-Leibler 散度 度量(第 6.2 节)。到后验的散度含有未知的 ,无法直接计算,但仍然可以最小化。
- 由贝叶斯定理,。
- 在 下对 取期望:。
- 第一个期望就是到先验的 。整理得 。
- 最后一项非负,所以 ;又因 不依赖于 ,最大化 等价于最小化到后验的散度。
称为证据下界(evidence lower bound,ELBO)。对高斯分布 与概率单位似然,每一项的计算代价都很低:两个高斯分布之间的散度有闭式解;期望对数似然是若干一维积分之和,每次比较对应一个积分,积分对象是 赋予某个差的高斯分布。因此,标准的基于梯度的优化器即可将其最大化。
散度的方向决定了拟合的特性。 在 下对 取平均,只要 在某处有质量而 在那里几乎没有,散度就会极大。因此最优的 停留在后验的支撑集之内,往往过窄。期望传播的局部矩更新则按相反方向的散度 选择与倾斜分布最接近的高斯分布;这一散度惩罚 遗漏的质量,往往使其过宽。
时,变分高斯分布的均值为 0.88,标准差为 0.30,精确值为 0.80 与 0.60;它给出 更好的概率为 0.002,接近精确值 0.004。它守住了期望传播所越过的硬边界,却把不确定性减半。每种方法都在其准则顾及不到之处出错。
变分推断是可扩展的近似方法。借助诱导点(inducing points),即概括函数的一小组伪输入(Titsias,2009),再结合随机优化,它可以处理数千次比较,以及任何期望对数可估计的似然。正因如此,近来许多偏好建模工作都以它为基础:涉及数千名用户和物品的群体偏好学习(Simpson 与 Gurevych,2020)、top- 排序(Nguyen 等,2021)、选择函数(Benavoli 等,2023)、反应时(Shvartsman 等,2024)、一篇 2025 年预印本中把比较与把握度评分相结合的混合似然(Wu 等,2025a),以及 qEUBO 的实验(Astudillo 等,2023)。截至 2026 年 9 月,对于变分推断在偏好似然上的误差,我们没有找到可与 Laplace 近似和期望传播所受评估相比的系统评估。
第 17.4 节引用的文献 7
- Titsias(2009)Variational Learning of Inducing Variables in Sparse Gaussian Processes
- Simpson 与 Gurevych(2020)Scalable Bayesian preference learning for crowds
- Nguyen 等人(2021)Top-$k$ Ranking Bayesian Optimization
- Benavoli 等人(2023)Learning Choice Functions with Gaussian Processes
- Shvartsman 等人(2024)Response Time Improves Gaussian Process Models for Perception and Preferences
- Wu 等人(2025a)Mixed Likelihood Variational Gaussian Processes
- Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
17.5 采样 #
以上三种方法都用高斯分布代替后验。Markov 链蒙特卡洛(Markov chain Monte Carlo,MCMC)方法则抽取一列样本,其分布收敛到后验本身。任何感兴趣的量,如均值、可信区间、一个选项胜过另一个的概率,都可以通过对样本取平均来估计。样本数增加时答案趋于精确,代价是计算量,以及需要判断链何时已运行得足够久。
对于高斯先验乘以似然的情形,椭圆切片采样(elliptical slice sampling)是自然的选择。Murray 等人(2010)为“具有多元高斯先验的模型”设计了这一方法:其“代码简单、通用”,“没有自由参数”需要调节,并且“在多种基于高斯过程的模型上效果很好”。其思路是沿一个椭圆移动,椭圆经过当前状态与从先验中新抽取的样本,因此每个提议在先验下都已合理,只需检查似然。
输入:当前状态 ,先验 ,对数似然 。
- 抽取 ,由其确定椭圆 。
- 从 上的均匀分布抽取 ,令阈值 。
- 从 上的均匀分布抽取 ,令区间为 。
- 若 ,接受 并停止。
- 否则向零收缩区间:用 替换与它位于零同侧的端点,然后在区间内均匀抽取新的 ,返回第 4 步。
收缩的区间始终包含 ,即当前状态,因此循环必然终止。比较问题还允许进一步改进。概率单位因子是一个高斯噪声变量落在效用差之下的概率,所以精确后验是某个高斯分布的边际分布,这一高斯分布限制在由线性约束切出的区域内。Benavoli 等人(2021c)用 LinESS 对其采样。LinESS 是针对线性截断高斯分布的无拒绝椭圆切片采样器,时间与内存代价分别为 与 (以比较次数计)。Takeno 等人(2023)对同一分布采用 Gibbs 采样(每次在给定其余所有变量的条件下重新抽取一个变量),发现它更快:在其表 1 中约为 0.54 秒对 1.61 秒;不过当截断数量远超维度时,LinESS 应当更有优势。
只有 200 个样本时,直方图参差不齐;在默认随机种子下,均值偏差接近 0.2。Markov 链的相继样本彼此相关,因此 200 个这样的样本所含信息少于 200 次独立抽取。样本数为 1,000 时,误差低于 0.05;为 5,000 时,估计值与精确值一栏约两位数字一致。采样是本章唯一能够靠增加计算把误差压到零的方法,因此研究其他方法时都以它为参照。
第 17.5 节引用的文献 3
- Murray 等人(2010)Elliptical Slice Sampling
- Benavoli 等人(2021c)Preferential Bayesian optimisation with skew gaussian processes
- Takeno 等人(2023)Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes
17.6 精确答案:偏斜高斯过程 #
一次比较的后验式(17.2)有专门的名称,也有闭式解。一般的后验式(17.1)是否也有?答案是肯定的,理由正是第 16 章中反复使用的随机效用技巧:概率单位因子就是一个隐藏的高斯变量为正的概率。
- 对每次比较 ,记 ,使 ,并引入相互独立的 。于是 。
- 把各个 堆叠成 矩阵 ,把各个 堆叠成 。由独立性,似然为 ,即所有不等式同时成立的概率。
- 由贝叶斯定理, 就是在事件 发生的条件下 的分布,其中 服从联合高斯分布。
- 归一化常数 就是这一事件的概率。向量 服从均值为零、协方差为 的高斯分布,所以 是一个 维高斯向量各坐标全为正的概率,即卦限概率(orthant probability)。
设一个高斯向量的某个线性变换加上独立高斯噪声后为正,以此为条件,该高斯向量的分布就是统一偏斜正态(unified skew-normal)分布。Durante(2019)证明,对任意高斯先验,参数化概率单位回归的后验都属于这一分布族,因此该分布族与概率单位似然共轭。对于函数,Benavoli 等人(2021c)证明了“偏好函数的真实后验分布是一个偏斜高斯过程(SkewGP),其成对边际分布高度偏斜”,并据此论证 Laplace 方法“通常给出非常差的近似”。定理 29.1 给出了这一定理及其参数。
由这一推导还可以看出后验在哪些方向上偏斜。每个因子都只通过差 依赖于 。在与所有 都正交的方向上,似然是常数,后验就是以这些差为条件的高斯先验。偏斜至多出现在 个方向上,而且从不出现在把所有效用平移相同量的方向上,因为沿这一方向没有任何差会改变。下图展示最小的实例:两个效用以及它们之间的比较。
可以做以下尝试:
- 沿对角线看。精确等高线在直线 处截断,并沿这条直线自由延伸。偏斜完全发生在横跨对角线的方向上,即差的方向;沿对角线方向,即和的方向,后验就是高斯先验。
- 看顶部条带。 的边际分布混合了偏斜的差与高斯的和。、 时,差的偏度约为 0.98,而单独的 偏度约为 0.04。即使后验远非高斯分布,单个效用看起来也可能接近高斯分布。Kuss 与 Rasmussen(2005)在分类问题中做过同样的观察:高维截断高斯分布的边际分布“可能与高斯分布相当相似”。
- 增大相关系数。在核函数看来彼此接近的输入,其先验效用相关,因此它们之差的先验方差很小,为 。同样的噪声相对于这一离散程度就变大了,切口更平缓,差的偏度随之下降,从 时的约 0.98 降到 时的 0.90。模型已认为相似的两个选项,一次比较对它们的改变也最小。
- 增大噪声。 时切口变得平缓,等高线接近椭圆;差的偏度降到约 0.06。
这一结论可以推广到多维情形。设一次会话在 60 个不同设计之间做了 30 次比较,每个设计是 6 维参数空间中的一个点,则后验定义在 60 个潜在效用上。后验只能在 30 个比较方向张成的子空间内偏斜;输入维度只通过核函数起作用,核函数决定各效用之间的相关程度。Laplace 近似与期望传播对其余方向的处理都是精确的。它们出错的是横跨各比较方向的形状,而下一个回答的概率恰恰取决于这一形状(推断)。
精确后验是有代价的:每次预测都需要从截断多元高斯分布中采样,边际似然需要计算高维正态卦限概率(Benavoli 等,2021c)。近似方法仍在使用,原因就在于此。
第 17.6 节引用的文献 3
- Durante(2019)Conjugate Bayes for probit regression via unified skew-normal distributions
- Benavoli 等人(2021c)Preferential Bayesian optimisation with skew gaussian processes
- Kuss 与 Rasmussen(2005)Assessing Approximate Inference for Binary Gaussian Process Classification
17.7 近似方法的影响有多大 #
上面的图展示了各种近似在最小情形下的偏差。这些偏差是否会改变偏好优化器面对真实回答时的行为?讨论证据之前,先用表 17.1 对各方法做一汇总。
| 方法 | 匹配的对象 | 每次拟合的代价 | 典型失效 | 使用者 |
|---|---|---|---|---|
| Laplace 近似 | 众数及众数处的曲率 | 几步 Newton 迭代,每步 | 回答几乎无噪声时,中心落在质量的边缘;均值与离散程度都过小 | Chu 与 Ghahramani;BoTorch PairwiseGP;Bıyık 等(2020) |
| 期望传播 | 逐个位点匹配单个因子的矩 | 若干轮秩一更新,每轮 | 在不可能的一侧有质量;接近 0 或 1 时对决概率的顺序出错 | Siivola 等(2021);optuna-dashboard |
| 变分推断(高斯) | 证据下界最高的高斯分布 | 一次优化;借助诱导点可扩展 | 过窄 | crowdGPPL;top- 排序;qEUBO 实验 |
| 采样 | 极限意义下的后验本身 | 大量样本;截断高斯分布 | 样本相关,需要长时间运行;蒙特卡洛误差 | Benavoli 等(2021);Takeno 等(2023) |
最有力的证据来自 Takeno 等人(2023)。他们以 Gibbs 采样为真实值,使用径向基函数核、噪声方差 以及均匀随机的对决。Laplace 近似不准确,“因为众数可能离均值非常远,尤其是当”噪声方差很小时;他们的结论是:“尽管 Laplace 近似很快,基于 Laplace 近似的偏好贝叶斯优化将会失败”。期望传播对均值与可信区间非常准确,但扭曲了对决概率,如第 17.3 节所述。他们也不认同 Benavoli 等人(2021c)早先的检验:那项检验中,一个区间内的输入全部落败,另一个区间内的输入全部获胜。他们称这种有偏的训练对决“不现实”,改用随机对决。尽管如此,他们仍用 Laplace 证据拟合超参数,认为它在噪声小时足够准确。
这些结果来自几乎无噪声的比较,而图 17.2 显示,Laplace 近似恰恰在这一区间表现最差。人的比较带有噪声,如前面各图所示,噪声会使切口变平缓、使偏斜缩小。在真实的人类噪声水平下,Laplace 近似与期望传播的误差有多大,我们找到的论文中没有一篇回答这个问题;我们也没有找到在真实人类比较上对 Takeno 等人的比较所做的独立复现(推断;两者均截至 2026 年 9 月)。第 27.4 节完整报告了这方面的证据,以及各软件库的选择。
实践中,方法的选择取决于三个问题。如果后验通过成对结果的概率进入采集函数,如 EUBO(第 19.4 节),那么高斯近似放错位置的质量影响最大,值得为采样或至少为期望传播付出额外代价(推断)。如果只需要后验均值来推荐最终设计,任何能把效用顺序排对的方法都已足够。如果会话很长,或模型有很多用户,变分推断是可扩展的方法。
第 17.7 节引用的文献 2
- Takeno 等人(2023)Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes
- Benavoli 等人(2021c)Preferential Bayesian optimisation with skew gaussian processes
17.8 习题 #
两次应用 Stein 引理,证明一次比较的后验式(17.2)的二阶矩为 ,与先验相同,从而方差为 。取 ,验证 时的 0.89 与 时的 0.60 这两个值。
解答
取 应用 Stein 引理:在先验下,。第一项为 。第二项中, 正比于关于 的零均值高斯密度,因此 与之乘积的期望为零。除以 ,得 。方差为 。当 、 时,,方差为 ,标准差约为 0.89。当 时,方差趋于 ,标准差约为 0.60。比较移动了均值,却不改变二阶矩:它重新分配了先验的质量,而没有使其变小。
对 时一次比较的后验,证明当 时,Laplace 近似赋予事件 的概率趋于 ,而精确概率趋于零。可以利用如下事实: 较大时,逆 Mills 比 满足 。
解答
众数 满足 。记 ,则 ,所以当 时 无界增长,但只以 的速度增长,且 。利用 ,曲率为 ,所以 Laplace 近似的标准差约为 。Laplace 近似给出的 的概率为 ;由于 只按对数增长,,因此该概率趋于 。精确后验是半正态分布,在零以下没有质量。一个完全确定了顺序的无噪声回答,在 Laplace 近似下却显示为对顺序毫无信息。
延伸阅读 #
- Rasmussen 与 Williams(2006)第 3 章推导了高斯过程分类的 Laplace 近似与期望传播,给出的稳定算法可以沿用到比较问题。
- Kuss 与 Rasmussen(2005)与 Nickisch 与 Rasmussen(2008)细致比较了分类问题中的各种近似方法,解释了 Laplace 近似为何失效、期望传播为何表现良好。
- Minka(2001)提出了期望传播;Murray 等人(2010)提出了椭圆切片采样;Tierney 与 Kadane(1986)是用 Laplace 方法求后验矩的经典文献。
- Durante(2019)证明了概率单位模型与统一偏斜正态分布的共轭性;Benavoli 等人(2021c)将其推广到偏好后验,并对其精确采样。
- Takeno 等人(2023)测量了 Laplace 近似与期望传播在对决上的误差有多大,并提出了一种代价更低的精确采样替代方案。
参考文献
- (2023). qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization. International Conference on Artificial Intelligence and Statistics. 引用于 §17.4
- (1985). A Class of Distributions Which Includes the Normal Ones. Scandinavian Journal of Statistics. 引用于 §17.1
- (2020). Active Preference-Based Gaussian Process Regression for Reward Learning. RSS 2020. 引用于 §17.2
- (2005). Preference learning with Gaussian processes. Proceedings of the 22nd international conference on Machine learning - ICML '05. 引用于 §17.2
- (2019). Conjugate Bayes for probit regression via unified skew-normal distributions. Biometrika. 引用于 §17.6
- (2005). Assessing Approximate Inference for Binary Gaussian Process Classification. Journal of Machine Learning Research. 引用于 §17.2 §17.3 §17.6
- (2001). Expectation Propagation for Approximate Bayesian Inference. Proceedings of the 17th Conference on Uncertainty in Artificial Intelligence (UAI 2001). 引用于 §17.3
- (2010). Elliptical Slice Sampling. Proceedings of the 13th International Conference on Artificial Intelligence and Statistics (AISTATS 2010). 引用于 §17.5
- (2021). Top- Ranking Bayesian Optimization. AAAI 2021. 引用于 §17.4
- (2008). Approximations for Binary Gaussian Process Classification. Journal of Machine Learning Research. 引用于 §17.3
- (2006). Gaussian Processes for Machine Learning. MIT Press. 引用于 §17.1 §17.2 §17.3
- (2024). Response Time Improves Gaussian Process Models for Perception and Preferences. Uncertainty in Artificial Intelligence. 引用于 §17.4
- (2020). Scalable Bayesian preference learning for crowds. Machine Learning. 引用于 §17.4
- (2023). Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes. International Conference on Machine Learning. 引用于 §17.2 §17.3 §17.5 §17.7
- (1986). Accurate Approximations for Posterior Moments and Marginal Densities. Journal of the American Statistical Association. 引用于 §17.2
- (2009). Variational Learning of Inducing Variables in Sparse Gaussian Processes. Proceedings of the 12th International Conference on Artificial Intelligence and Statistics (AISTATS 2009). 引用于 §17.4
- (2025a). Mixed Likelihood Variational Gaussian Processes. arXiv. 预印本引用于 §17.4