观测模型、代理模型与推断
每个偏好贝叶斯优化系统都建立在三个建模选择之上,第四部分已逐一介绍。观测模型(observation model)规定一次比较、一个排序或一次选择如何由潜在效用产生:在第 16 章中,即作用于效用差的概率单位链接或逻辑链接。代理模型(surrogate)是效用上的先验:在第 18 章中,即高斯过程。后验推断(posterior inference)将两者结合,并把结果交给采集函数:在第 17 章中,通常采用 Laplace 近似。
2017 年至 2026 年 9 月,默认组合几乎没有变化。BoTorch 的 PairwiseGP 实现的仍是高斯过程先验、概率单位链接与 Laplace 近似,即 Chu 与 Ghahramani(2005)的模型(Meta Platforms, Inc.,2026h)。变化的是每一层受到的审视。本章依次考察这三层,最后讨论默认实现替使用者做了哪些决定。
引言引用的文献 2
- Chu 与 Ghahramani(2005)Preference learning with Gaussian processes
- Meta Platforms, Inc.(2026h)BoTorch PairwiseGP source code pairwise_gp.py
27.1 基线模型 #
Chu 与 Ghahramani(2005)在潜在效用 上放置高斯过程先验,并使用似然
这正是 Thurstone 的比较判断:每个选项上叠加尺度为 的高斯噪声(第 16.3 节)。他们用 Laplace 近似拟合后验,并按近似的模型证据选择超参数。Koyama 等人(2020)指出,Brochu 等人(2007)的成对模型也是同一 Thurstone 模型。Houlsby 等人(2011)殊途同归:借助偏好核(preference kernel),把成对偏好学习转化为输入对上的高斯过程分类。
为该领域命名的论文既没有使用概率单位链接,从其正文看也没有使用 Laplace 近似。González 等人(2017)在对决空间 上用高斯过程分类器为 在对决中胜过 的概率建模:似然为 Bernoulli 似然,潜在的联合奖励经逻辑(logistic)函数压缩,并假设潜在函数具有 的形式。正文只说后验难以处理、需要近似,没有指明采用哪种近似。他们把输入维度加倍列为一项局限;Nguyen 等人(2021)后来批评该模型在目标函数两倍的维度上运算,不直接对目标函数建模,也不对平局建模。第 27.4 节中的偏斜高斯过程定理针对的是概率单位似然,因此并不直接适用于这一原始模型(推断)。
此后这两种链接一直并用。BoTorch 同时提供两者:PairwiseProbitLikelihood 对应 ,PairwiseLogitLikelihood 对应 (Meta Platforms, Inc.,2026g)。逻辑链接见于 qEUBO 的噪声分析(Astudillo 等,2023)、乐观算法 POP-BO(Xu 等,2024b)与多轮偏好反馈学习算法(MR-LPF)(Kayal 等,2025)。只有两个选项时,效用上的 softmax 恰好就是逻辑形式的 Bradley-Terry 模型。两种链接都是随机效用模型(第 16.5 节):概率单位链接源于每个选项上的高斯噪声,逻辑链接源于 Gumbel 噪声;Kayal 等人在讨论下界时用到了这一对应关系。
在偏好贝叶斯优化文献中,我们没有找到在人类数据上比较概率单位链接与逻辑链接的论文,也没有找到研究链接设定错误时稳健性的工作。唯一由数据驱动的替代方案来自 Shvartsman 等人(2024):决策过程的漂移扩散模型会导出自身的选择链接;但他们测得的增益出现在加入反应时数据之后,不能归功于链接本身(推断)。选用哪种链接,取决于沿袭与便利,而非证据(推断)。在出现这样的比较之前,实践者可以把链接视为可检验的选择:用收集到的回答分别拟合两种链接,比较二者对留出比较的预测效果(推断)。
第 27.1 节引用的文献 11
- Chu 与 Ghahramani(2005)Preference learning with Gaussian processes
- Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
- Brochu 等人(2007)Active Preference Learning with Discrete Choice Data
- Houlsby 等人(2011)Bayesian Active Learning for Classification and Preference Learning
- González 等人(2017)Preferential Bayesian Optimization
- Nguyen 等人(2021)Top-$k$ Ranking Bayesian Optimization
- Meta Platforms, Inc.(2026g)BoTorch pairwise likelihood source code likelihoods/pairwise.py
- Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
- Xu 等人(2024b)Principled Preferential Bayesian Optimization
- Kayal 等人(2025)Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds
- Shvartsman 等人(2024)Response Time Improves Gaussian Process Models for Perception and Preferences
27.2 扩展观测模型 #
人对“哪个更好?”的回答,可以携带多于 1 比特的信息,或不同种类的信息。2017 年以来,研究者从八个方向扩展了似然。表 27.1 汇总了这些方向;表后各段给出评判每个方向所需的关键细节。
| 扩展 | 代表性工作 | 似然 | 人类数据 |
|---|---|---|---|
| 从集合中选择、批次赢家、排序 | (Koyama 等,2017;Koyama 等,2020;Siivola 等,2021;Nguyen 等,2021;Benavoli 等,2023) | 个选项的 Bradley-Terry 模型;批次赢家似然;多项 logit 与 top- 排序;含多个效用的选择函数 | 众包及一项 6 人预实验;由评分数据构建的基准;Benavoli 等仅有模拟 |
| 平局与无差异 | (Bıyık 等,2019)(线性奖励);(Nguyen 等,2021;Benavoli 与 Azzimonti,2026a;Erarslan 等,2025) | 最小可觉差阈值;含平局的多项 logit;不可区分性 | 仅有 Bıyık 等的用户研究,且采用线性模型 |
| 序数标签与把握度 | ROIAL(Li 等,2021);(Dao 等,2025;Wu 等,2025a;Peng 等,2025;Zhang 等,2026b) | 有序阈值;5 级 Likert 强度;带切点与失误率的 Likert 把握度 | 3 名被试(ROIAL);离线拟合(Wu 等);一项用户研究(Peng 等);(Zhang 等) |
| 反应时 | (Shvartsman 等,2024);(Li 等,2024a)(线性) | 漂移扩散似然的可微近似 | 三个数据集,离线 |
| 失败、有效性、崩溃 | (Benavoli 等,2021c);C-GLISp(Zhu 等,2022);CrashPBO(Menn 等,2026b) | 有效/无效标签与偏好联合建模;可行性代理模型;把崩溃作为第二种结果 | 控制器校准;三个机器人平台 |
| 不可传递性 | (Chau 等,2022) | 斜对称偏好函数上的高斯过程 | 动物争斗、NFL 比赛、引用;没有设计偏好 |
| 异方差噪声 | (Sinaga 等,2026) | 由锚点上的核密度得到的输入相关噪声 | Sushi 与 Candy 基准,无真实用户 |
| 多个用户、多个效用 | (Houlsby 等,2012;Simpson 与 Gurevych,2020;Benavoli 等,2023;Astudillo 等,2025;Dubey 等,2026) | 协同低秩高斯过程;结合高斯过程的矩阵分解;多个潜在效用;Dirichlet 过程混合 | 真实的多用户数据(Houlsby、Simpson);其余为模拟 |
| 随时间漂移的效用 | 无 | 无 | 无 |
从集合中选择,以及排序。Koyama 等人(2017)的序列线搜索把人沿滑块所做的选择记录为偏好:所选的点既优于当前最优点,也优于期望改进最高的点;所用模型为 Bradley-Terry-Luce 模型,即 Bradley-Terry 模型向 个选项中选择的推广。序列画廊(Sequential Gallery)用 Thurstone 模型处理成对数据,用 Bradley-Terry-Luce 形式处理 个选项中的选择(Koyama 等,2020)。Siivola 等人(2021)给出了针对两个或更多点任意并行反馈的似然,重点讨论批次赢家,并认为让人给出完整排序过于费力。Nguyen 等人(2021)借鉴多项 logit 及其排序推广构建了代理模型,该模型可解释为带独立同分布 Gumbel 噪声的高斯过程回归,能够处理 top- 排序与平局。Benavoli 等人(2023)用多个潜在效用处理取值为集合的选择(例如在展示的五个选项中挑出三个,而这三个之中没有哪一个明显优于其他两个);其摘要仅报告了模拟结果。
平局与无差异。Bıyık 等人(2019)增加了“差不多”(About Equal)回答,并引入最小可感知差异 :,在 时退化为 softmax 模型。他们的模型采用线性奖励而非高斯过程,并辅以模拟和一项用户研究。C-GLISp 将更好、更差、相近三种判断编码为径向基函数代理模型上的约束(Zhu 等,2022)。Benavoli 与 Azzimonti 的教程列出了九种似然,其中的最小可觉差模型加入了不可区分性陈述 ,这一做法可追溯到 Luce 1956 年提出的辨别阈限概念。Erarslan 等人(2025)在扩展的 Thurstone 模型中用最小可觉差阈值表示无差异,并报告:当 10% 至 20% 的比较为无差异时,增益明显。该领域已形成两种处理方式:在 Thurstone 或 logit 模型中设置阈值参数,或在多项 logit 中处理平局(推断)。我们没有找到任何高斯过程偏好贝叶斯优化论文设有区别于平局的“弃权”或“跳过”结果,而人在完全无法比较这些选项时,给出的正是这种回答。
序数标签、强度与把握度。ROIAL(Li 等,2021)将成对偏好与序数标签(很差、差、中性、好)相结合,理由是 级序数查询至多给出 比特,而一次偏好只给出 1 比特;其被试为 3 名非残障人士,调节 4 个外骨骼步态参数。Wu 等人(2025a)在概率单位偏好似然之外加入 Likert 把握度似然,其切点与失误率均可学习。在人对机器人步态的比较数据上,他们报告用把握度评分训练的模型“始终取得更低的 Brier 分数和更高的 F1 分数”,即预测概率的平方误差更小、预测的选择更准确。
反应时。回答用时的长短,在一定程度上反映了回答者感到选项之间差别有多大。Shvartsman 等人(2024)用矩匹配的三参数偏斜分布近似漂移扩散似然,使反应时得以纳入变分高斯过程;他们称这是第一个对漂移扩散反应时与选择采用联合似然的高斯过程模型。在一名被试对 1,225 对四足机器人步态的判断以及一个视觉心理物理学数据集上,联合漂移扩散模型对留出选择的预测显著优于只用选择的模型,训练集较小时尤其如此;更简单的堆叠方法(把反应时的对数作为额外输入交给选择模型)则没有优于只用选择的模型。在一个推荐系统数据集上,每个联合模型都有改进,堆叠方法改进最多。Li 等人(2024a)把 EZ 扩散模型用于线性效用下的固定预算最优臂识别,并证明:偏好较强时,反应时能提供关于偏好强度的额外信息。
失败、有效性与崩溃。有些实验根本不产生输出。有效性标签与可行性代理模型给每个样本附加第二个标签;CrashPBO(Menn 等,2026b)则将崩溃报告视为第二种结果,在合成基准上使崩溃减少 63%,并在三个机器人平台上得到验证。
不可传递性。Chau 等人(2022)在斜对称偏好函数 上放置高斯过程,并采用一种能够表示循环的核函数,他们称之为广义偏好核。在真实数据上,新模型与 Chu-Ghahramani 模型的准确率分别为:变色龙争斗 0.78 对 0.51,扁平蜥蜴 0.83 对 0.80,2000 至 2018 年的 NFL 比赛 0.59 对 0.51(在这组数据上,线性成对逻辑回归最好,为 0.65),arXiv 引用图 0.74 对 0.66。作者的结论是:他们的发现支持一个猜想,即违反可排序性(单一效用能为所有条目排序这一假设)的情形在真实偏好数据中普遍存在。但这些数据集本就属于预期会出现不可传递性的场合(争斗与体育比赛);在唯一的人类竞赛数据上胜出的是线性模型;而且没有一个数据集是单个用户的设计偏好。因此,把这一结论推广到典型的偏好贝叶斯优化场景缺乏依据(推断)。
异方差噪声。有些比较比另一些更难。Sinaga 等人(2026)请用户给出可靠的“锚”点,再用核密度估计将其转化为随输入变化的噪声图,用于概率单位似然 ,或温度随输入变化的逻辑似然。他们的一致性分析只在理想化的独立同分布锚点模型下成立,评测使用 Sushi 与 Candy 数据,没有真实用户参与。Fauvel 与 Chalk(2021)认为,二元贝叶斯优化与偏好贝叶斯优化的采集函数必须区分认知不确定性与偶然不确定性,因为只有前者应当驱动探索。
多个用户,以及漂移。面向多用户的模型在用户之间共享低维结构;crowdGPPL(Simpson 与 Gurevych,2020)将矩阵分解与高斯过程的组合扩展到数千个用户和条目。这些模型见第 20.5 节。我们没有找到任何偏好贝叶斯优化论文或高斯过程偏好论文对随时间变化的效用建模;现有的有限臂理论见第 29.10 节。
人类证据支持什么。关于平局,有一项采用线性模型的用户研究;关于序数标签,有 3 名被试;关于把握度,有一个离线的机器人步态数据集和两项小型用户研究;关于反应时,有三个数据集、少量被试和离线拟合;关于崩溃,有三个机器人平台;关于异方差噪声,有两个由评分数据转换而来的基准;关于不可传递性,则完全没有设计偏好数据。多数评测是离线比较模型的拟合,而非与人一起闭环运行(推断)。在无需人额外付出的信号中,反应时与把握度已在真实人类数据上改进过模型,因此是依据最充分的升级。在每次会话中记录这两者不需要任何成本,日后也便于在闭环偏好贝叶斯优化中加以检验(推断)。
第 27.2 节引用的文献 25
- Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
- Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
- Siivola 等人(2021)Preferential Batch Bayesian Optimization
- Nguyen 等人(2021)Top-$k$ Ranking Bayesian Optimization
- Benavoli 等人(2023)Learning Choice Functions with Gaussian Processes
- Bıyık 等人(2019)Asking Easy Questions: A User-Friendly Approach to Active Reward Learning
- Benavoli 与 Azzimonti(2026a)A tutorial on learning from preferences and choices with Gaussian Processes
- Erarslan 等人(2025)Consecutive Preferential Bayesian Optimization
- Li 等人(2021)ROIAL: Region of Interest Active Learning for Characterizing Exoskeleton Gait Preference Landscapes
- Dao 等人(2025)Experience in Engineering Complex Systems: Active Preference Learning With Multiple Outcomes and Certainty Levels
- Wu 等人(2025a)Mixed Likelihood Variational Gaussian Processes
- Peng 等人(2025)Towards Uncertainty Unification: A Case Study for Preference Learning
- Zhang 等人(2026b)Vibrotactile Preference Learning: Uncertainty-Aware Preference Learning for Personalized Vibration Feedback
- Shvartsman 等人(2024)Response Time Improves Gaussian Process Models for Perception and Preferences
- Li 等人(2024a)Enhancing Preference-based Linear Bandits via Human Response Time
- Benavoli 等人(2021c)Preferential Bayesian optimisation with skew gaussian processes
- Zhu 等人(2022)C-GLISp: Preference-Based Global Optimization Under Unknown Constraints With Applications to Controller Calibration
- Menn 等人(2026b)Preferential Bayesian Optimization with Crash Feedback
- Chau 等人(2022)Learning Inconsistent Preferences with Gaussian Processes
- Sinaga 等人(2026)Anchor-Based Heteroscedastic Noise for Preferential Bayesian Optimization
- Houlsby 等人(2012)Collaborative Gaussian Processes for Preference Learning
- Simpson 与 Gurevych(2020)Scalable Bayesian preference learning for crowds
- Astudillo 等人(2025)Preferential Multi-Objective Bayesian Optimization
- Dubey 等人(2026)Active Preference Learning over Latent Preference Archetypes for Many-Objective Bayesian Optimization
- Fauvel 与 Chalk(2021)Efficient Exploration in Binary and Preferential Bayesian Optimization
27.3 高斯过程之外的代理模型 #
高斯过程效用仍是主流,但也出现了四类替代方案,每一类各有具体的动因。
高斯过程的变体。Bıyık 等人(2020)借助核函数在参考点处固定 ,从而在先验中消除了第 18.4 节所述的加性不可识别性。偏斜高斯过程这一研究脉络由 Benavoli、Azzimonti 与 Piga 建立:2020 年的一篇分类论文提出偏斜高斯过程,并证明它与概率单位似然共轭(Benavoli 等,2020);2021 年的一篇论文将共轭性推广到正态与仿射概率单位似然及其乘积(Benavoli 等,2021a);Benavoli 与 Azzimonti(2024)则证明带线性不等式约束的高斯过程是偏斜高斯过程,并将其用于单调偏好学习。
径向基函数、神经网络与树。GLISp(Bemporad 与 Piga,2021)用线性规划或二次规划拟合径向基函数代理模型,使其尽可能满足观测到的偏好;论文报告,比较次数相同时,它通常比偏好贝叶斯优化更接近最优点,计算成本也更低。GLISp-r(Previtali 等,2023)补充了全局收敛的证明。这些代理模型不是概率模型,第 19 章的采集函数因而不适用。神经对决赌博机(Verma 等,2025)用神经网络从偏好反馈中估计奖励,证明了次线性遗憾,实验使用合成数据;Wang 等人(2025a)在偏好探索中以单调神经网络集成取代高斯过程效用。DT-PBO(Leenders 等,2025)直接从比较中构建浅层决策树,每个叶节点内采用 Laplace 近似;作者报告,在 8 个基准函数上,其收敛表现与高斯过程偏好贝叶斯优化相当,在崎岖的函数上尤其如此。
摊销代理模型。偏好摊销黑箱优化(PABBO)(Zhang 等,2025a)的出发点是:非共轭似然使偏好贝叶斯优化的每一步都代价高昂。它在 Transformer 神经过程中同时元学习代理模型与采集函数,在高斯过程样本等合成任务上,以强化学习加辅助的偏好预测损失进行训练。其摘要声称它“比常用的基于高斯过程的策略快几个数量级”(several orders of magnitude faster than the usual Gaussian process-based strategies);论文报告,在五个问题上,它比最快的高斯过程策略平均快 12 倍,在高斯过程任务上比带噪声批量期望改进快约 10 倍。其默认评测配置使用无噪声比较(Zhang,2025)。作者列出的局限包括:查询集随维度增大;每个维度需要单独的模型;如何构建预训练数据尚无定论;没有对做比较的人建模。
跨用户的先验,以及生成模型的潜空间。跨用户结构有三种实现途径:一是 crowdGPPL 这类协同模型;二是采集函数层面的迁移,例如 Meta-PO(Li 等,2025a),它将早期用户的会话分别保存为独立的高斯过程,再通过按排名加权的采集函数加以迁移(其用户研究见第 32.5 节);三是在群体数据上训练的引导模型,例如 Granley 等人(2023)的深度编码器。另有几个系统在生成模型的潜空间中优化,例如在字体风格空间中优化的 FontCraft(Tatsukawa 等,2025),以及在 20 至 30 个扩散适配器的合并权重上优化的 GimmBO(Liu 等,2026b);这些论文都没有对潜空间几何与效用长度尺度之间的关系建模(推断)。
总体而言,2020 年以来关于代理模型的争论,主要围绕同一模型中的推断质量(高斯近似与精确偏斜高斯过程之争),而非模型类别。模型类别的改变出于结构(单调性、不可传递性、多个效用)或速度(PABBO、GLISp)的需要,而不是因为有证据表明高斯过程效用先验不适合人的偏好(推断)。
第 27.3 节引用的文献 15
- Bıyık 等人(2020)Active Preference-Based Gaussian Process Regression for Reward Learning
- Benavoli 等人(2020)Skew Gaussian processes for classification
- Benavoli 等人(2021a)A unified framework for closed-form nonparametric regression, classification, preference and mixed problems with Skew Gaussian Processes
- Benavoli 与 Azzimonti(2024)Linearly Constrained Gaussian Processes are SkewGPs: application to Monotonic Preference Learning and Desirability
- Bemporad 与 Piga(2021)Global optimization based on active preference learning with radial basis functions
- Previtali 等人(2023)GLISp-r: a preference-based optimization algorithm with convergence guarantees
- Verma 等人(2025)Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
- Wang 等人(2025a)Bayesian Optimization with Preference Exploration using a Monotonic Neural Network Ensemble
- Leenders 等人(2025)DT-PBO: an Interpretable Tree-based Surrogate Model for Preferential Bayesian Optimization
- Zhang 等人(2025a)PABBO: Preferential Amortized Black-Box Optimization
- Zhang(2025)PABBO code repository: evaluation config evaluate.yaml
- Li 等人(2025a)Efficient Visual Appearance Optimization by Learning from Prior Preferences
- Granley 等人(2023)Human-in-the-Loop Optimization for Deep Stimulus Encoding in Visual Prostheses
- Tatsukawa 等人(2025)FontCraft: Multimodal Font Design Using Interactive Bayesian Optimization
- Liu 等人(2026b)GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization
27.4 后验推断 #
第 17 章介绍了这些近似方法,第 17.7 节报告了其效果的主要证据;本节补充证据背后的细节,以及各软件库的选择。表 27.2 列出了各方法的使用情况。
| 方法 | 使用者 | 已记录的问题 |
|---|---|---|
| Laplace 近似 | Chu 与 Ghahramani 2005;BoTorch PairwiseGP;Bıyık 等 2020;ROIAL 2021;投影偏好贝叶斯优化 2020 |
众数可能远离均值,噪声小时更严重;与 EUBO 合用时似然 Hessian 矩阵秩亏(预印本) |
| 期望传播 | Houlsby 等 2012(与变分贝叶斯结合);Siivola 等 2021;Fauvel 与 Chalk 2021;optuna-dashboard | 均值与可信区间准确;接近 0 或 1 的对决概率失真,相对次序无法保持 |
| 变分推断 | Simpson 与 Gurevych 2020;Nguyen 等 2021;Benavoli 等 2023;Shvartsman 等 2024;Wu 等 2025;qEUBO 的实验 | 缺乏针对偏好似然的系统误差评估 |
| 精确偏斜高斯过程采样 | Benavoli 等 2021(LinESS);Takeno 等 2023(Gibbs 采样) | 每次预测都需要截断多元正态采样;模型证据需要计算高维正态累积分布函数 |
| 幻觉信念 | Takeno 等 2023 | 只用截断后验的单个样本;在逻辑噪声下陷入局部最优(POP-BO 的作者报告) |
| 摊销 | PABBO 2025 | 维度固定;依赖预训练数据 |
Laplace 近似成为库的默认选择,主要出于速度考虑。Bıyık 等人(2020)谈到期望传播时写道,“它虽然比 Laplace 近似更准确,但在实践中更慢”,因而选择了 Laplace 近似;投影偏好贝叶斯优化(Mikkola 等,2020)采用 Laplace 近似则是“为了简单起见”。Koyama 等人采用最大后验估计,并在每个超参数上放置很紧的对数正态先验(论文中写作 ):每个长度尺度取 ,幅度取 。这样的先验几乎固定了长度尺度(Koyama 等,2020)。Siivola 等人在真实数据实验中使用期望传播进行推断,optuna-dashboard 的偏好高斯过程采样器也用它拟合超参数(Optuna developers,2026c)。
精确后验是偏斜高斯过程。Benavoli 等人(2021c)在其偏好贝叶斯优化论文中证明了这一点(定理 29.1),并用 LinESS 对后验采样。LinESS 是针对线性截断高斯分布的无拒绝椭圆切片采样。按他们给出的数字,其代价为 的时间与 的内存,瓶颈与普通高斯过程相同(一次 Cholesky 分解);他们报告,该方法的收敛性与计算时间始终优于基于 Laplace 近似的偏好贝叶斯优化。
高斯近似的误差有多大。Takeno 等人(2023)以 Gibbs 采样为基准真值(预烧 1,000 次后取 10,000 个样本,每 10 个保留 1 个),设置为径向基函数(RBF)核、噪声方差 和均匀随机的对决。第 17.7 节已介绍了他们的两项发现:噪声小时,Laplace 近似的众数可能离均值很远;期望传播对均值与可信区间准确,却会扭曲对决概率。此外,他们还报告:在 Ackley 函数上,期望传播会低估接近 0 或 1 的概率,且不能保持真实的次序,这会影响依赖两点联合分布的采集函数;Gibbs 采样的混合速度快于 LinESS。他们认为 Benavoli 等人比较期望传播与偏斜高斯过程时所用的设定不现实:一个区间内的所有输入都输,另一个区间内的所有输入都赢;而更早一项关于二分类高斯过程分类的研究曾发现期望传播是准确的(Kuss 与 Rasmussen,2005)。另外,他们对后验弃用 Laplace 近似,选择超参数时却仍用 Laplace 模型证据;可见超参数与采集函数所需的精度是分开考虑的。
Takeno 等人最有力的证据来自噪声方差为 的情形,此时后验近乎截断高斯分布;比较噪声更大时(更接近真人的情况),偏斜应会减弱。截至 2026 年 9 月,尚无论文测量 Laplace 近似与期望传播在现实的人类噪声水平下的误差,也没有论文在真实的人类比较上复现 Takeno 等人的校准。这一实验不难描述:取真人做出的比较,以精确采样为基准真值,测量各近似方法预测的对决概率与之相差多远。
第 27.4 节引用的文献 7
- Bıyık 等人(2020)Active Preference-Based Gaussian Process Regression for Reward Learning
- Mikkola 等人(2020)Projective Preferential Bayesian Optimization
- Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
- Optuna developers(2026c)optuna-dashboard PreferentialGPSampler source code gp.py
- Benavoli 等人(2021c)Preferential Bayesian optimisation with skew gaussian processes
- Takeno 等人(2023)Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes
- Kuss 与 Rasmussen(2005)Assessing Approximate Inference for Binary Gaussian Process Classification
27.5 默认实现的内部 #
运行偏好贝叶斯优化的人大多使用 BoTorch 的 PairwiseGP,因此其默认设置实际上就是该领域的默认设置。表 18.2 列出了 0.18.1 版内部的各项选择(Meta Platforms, Inc.,2026h;Meta Platforms, Inc.,2026g)。其中三项决定了模型能学到什么。概率单位似然为 ,即把噪声固定为 1,于是输出尺度(BoTorch 对核函数幅度 的称呼)相当于噪声水平的倒数。输出尺度与长度尺度只能从比较中联合学习,没有单独的噪声参数,并受 上的平滑箱形先验与 的约束限制;源码注释称这一约束是经验法则,用于使估计值远离令 饱和的尺度。概率单位函数的自变量截断在 ,因此拟合时任何单次比较的似然至多约为 0.9987,相当于对标错的回答有一种隐含的稳健性(第 18.6 节)。最后,每个维度上的长度尺度先验都是 Gamma(2.4, 2.7),并以其众数初始化。
更新日志补充了相关历史(Meta Platforms, Inc.,2026e)。0.9.0 版(2023 年 8 月)加入了成对形式的贝叶斯分歧主动学习采集函数;0.10.0 版(2024 年 2 月)加入了 qEUBO;0.12.0 版(2024 年 9 月)把大多数模型改为随维度缩放的长度尺度先验,但明确排除了 PairwiseGP;0.18.0 版(2026 年 6 月)修复了 PairwiseGP 在评估与交叉验证中的状态处理;而在 0.18.1 版(2026 年 6 月)中,PairwiseGP 仍使用 Gamma(2.4, 2.7)。维度缩放先验源自 Hvarfner 等人(2024)对标量贝叶斯优化的研究,详见第 30 章。optuna-dashboard 中的偏好采样器基于 Takeno 等人的方法,使用 Matérn 3/2 核(每个维度一个长度尺度)与 Gamma(5, 10) 先验(众数 0.4),同样与维度无关(Optuna developers,2026c)。
固定先验在高维中的后果可以计算出来(推断)。Gamma(2.4, 2.7) 的众数在每个维度上都是 ,而在单位立方体上,维度缩放先验的众数从 10 维时的约 0.65 增长到 100 维时的约 2.05。 中的随机点相距约 (推导见第 30.1.2 节),因此默认偏好模型在高维中工作的区域,典型点之间的核函数值接近零,每次比较对其他任何点几乎都不提供信息。这一点尚未在 PairwiseGP 上直接验证。
第 27.5 节引用的文献 5
- Meta Platforms, Inc.(2026h)BoTorch PairwiseGP source code pairwise_gp.py
- Meta Platforms, Inc.(2026g)BoTorch pairwise likelihood source code likelihoods/pairwise.py
- Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
- Hvarfner 等人(2024)Vanilla Bayesian Optimization Performs Great in High Dimensions
- Optuna developers(2026c)optuna-dashboard PreferentialGPSampler source code gp.py
27.6 比较图与条件数 #
2026 年报告的数值问题,其核心是一个线性代数事实,第 18.5 节已经推导过:负对数似然的 Hessian 矩阵 是比较图的加权图 Laplace 矩阵(graph Laplacian),比较图以比较过的输入为节点、以已回答的成对比较为边;每个连通分量都使该矩阵多一个零特征值。由于先验贡献了 ,Laplace 后验的精度矩阵 总是满秩的。因此实际问题不在于奇异,而在于先验沿平移方向较弱(即长度尺度较长或输出尺度较大)时矩阵病态。同一事实也有统计学的一面,如图 27.1 所示:不受任何比较约束的平移方向,对应一个任何回答都未曾测量的相对效用,关于它的信息只能来自先验。
Shao 等人(2026)(2026 年的预印本)报告:在由 PairwiseGP、Laplace 近似与 EUBO 组成的流程中,EUBO 新选出的成对选项与先前查询没有共同候选,因此每一对都在比较图中自成孤立的连通分量,似然的 Hessian 矩阵随之秩亏。他们称这种亏缺是结构性的,“无法通过改变代理模型的建模方法来解决”(cannot be resolved by changing the surrogate modeling approach);并指出,现有补救办法要么强制比较保持连通,浪费查询预算,要么施加均匀的正则化,扰动已受到充分约束的方向。他们的修正(效果大小见第 18.5 节)仅在模型拟合期间,向 Hessian 矩阵的对角线加上按先验不确定性缩放的项;其自适应版本只在代理模型有把握时才施加修正。基准中包括一个 16 维的等离子体医学控制器。Pukdee 等人(2026)给出了一些条件:在这些条件下,即使数据违反 Bradley-Terry 模型,该模型仍能恢复条件偏好分布;他们还表明,比较图的间隔与连通性决定样本效率。局部偏好贝叶斯优化论文(Menn 等,2026a)的引理 1 表明,由 Laplace 后验得到的梯度与 Hessian 矩阵估计会继承其众数的偏差;作者补充道,Hessian 矩阵估计可能对长度尺度和核矩阵的条件数尤其敏感,其实验把单位立方体上的长度尺度限制在 之内。
实践中如何学习超参数。我们找到的做法各不相同:从配合 Laplace 模型证据的弱 Gamma 先验(BoTorch)、精确的偏斜高斯过程模型证据(Benavoli 等,2021),到几乎固定长度尺度的紧对数正态先验(Koyama 等)和箱形约束(局部偏好贝叶斯优化)。这些做法能否从一个人给出的几十至一两百次比较中识别出长度尺度,尚无研究;第 30.3.3 节阐述了这一空白,以及可以填补它的模拟实验。
第 27.6 节引用的文献 3
- Shao 等人(2026)Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization
- Pukdee 等人(2026)What Does Preference Learning Recover from Pairwise Comparison Data?
- Menn 等人(2026a)Local Preferential Bayesian Optimization
27.7 已定、有争议与缺失 #
已定。在概率单位偏好似然与高斯过程先验下,精确后验是偏斜高斯过程(Benavoli 等,2021c)。González 等人的原始模型使用逻辑链接,没有说明其推断方法。BoTorch 与 optuna-dashboard 中的偏好模型所用的长度尺度先验不随维度缩放。只要比较图不连通,Laplace 似然的 Hessian 矩阵就秩亏,这是线性代数的事实;在实践中,它表现为病态而非奇异(推断)。
有争议。在人类的噪声水平下,高斯近似的误差是否大到足以改变优化结果:Benavoli 等人与 Takeno 等人的证据来自低噪声或特定的设定,而且双方对哪些设定符合现实意见不一。2026 年那篇预印本所称的结构性病态,是否会在人类数据上造成可测量的损失。不可传递性是否常见:Chau 等人的数据不是设计偏好,而在 NFL 数据上线性模型表现更好。
缺失。在人类数据上比较不同链接函数,以及链接设定错误时的稳健性。带有弃权结果的观测模型。漂移效用的模型。长度尺度在人类规模的预算下是否可识别的证据。维度缩放先验与成对似然结合使用的检验。比较 Laplace 近似、期望传播、精确偏斜高斯过程采样与幻觉信念的闭环人类实验。在成对数据上训练的先验拟合网络。在噪声恒定的概率单位链接之外,描述人如何回答的模型仍是一片开放的设计空间,充斥着未经验证的默认设定(推断)。
第 27.7 节引用的文献 1
- Benavoli 等人(2021c)Preferential Bayesian optimisation with skew gaussian processes
延伸阅读 #
- Benavoli 与 Azzimonti(2026a)的教程是关于偏好与选择的高斯过程模型最完整的论述,包括九种似然。
- Benavoli 等人(2021c)与 Takeno 等人(2023)是推断之争的两方,宜对照阅读。
PairwiseGP的源码(Meta Platforms, Inc.,2026h)篇幅很短,在采信其默认设置之前值得一读。- Shvartsman 等人(2024)将一种无需额外成本的行为信号(反应时)加入似然,是这类做法最清晰的例子。
参考文献
- (2023). qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization. International Conference on Artificial Intelligence and Statistics. 引用于 §27.1
- (2025). Preferential Multi-Objective Bayesian Optimization. Transactions on Machine Learning Research. 引用于 §27.2
- (2021). Global optimization based on active preference learning with radial basis functions. Machine Learning. 引用于 §27.3
- (2019). Asking Easy Questions: A User-Friendly Approach to Active Reward Learning. CoRL 2019. 引用于 §27.2
- (2020). Active Preference-Based Gaussian Process Regression for Reward Learning. RSS 2020. 引用于 §27.3 §27.4
- (2007). Active Preference Learning with Discrete Choice Data. Advances in Neural Information Processing Systems. 引用于 §27.1
- (2022). Learning Inconsistent Preferences with Gaussian Processes. International Conference on Artificial Intelligence and Statistics. 引用于 §27.2
- (2005). Preference learning with Gaussian processes. Proceedings of the 22nd international conference on Machine learning - ICML '05. 引用于 §27.1
- (2025). Experience in Engineering Complex Systems: Active Preference Learning With Multiple Outcomes and Certainty Levels. IEEE Transactions on Human-Machine Systems. 引用于 §27.2
- (2026). Active Preference Learning over Latent Preference Archetypes for Many-Objective Bayesian Optimization. arXiv. 预印本引用于 §27.2
- (2025). Consecutive Preferential Bayesian Optimization. arXiv. 预印本引用于 §27.2
- (2021). Efficient Exploration in Binary and Preferential Bayesian Optimization. arXiv. 预印本引用于 §27.2
- (2017). Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §27.1
- (2023). Human-in-the-Loop Optimization for Deep Stimulus Encoding in Visual Prostheses. NeurIPS 2023. 引用于 §27.3
- (2011). Bayesian Active Learning for Classification and Preference Learning. arXiv. 预印本引用于 §27.1
- (2012). Collaborative Gaussian Processes for Preference Learning. Advances in Neural Information Processing Systems. 引用于 §27.2
- (2024). Vanilla Bayesian Optimization Performs Great in High Dimensions. International Conference on Machine Learning. 引用于 §27.5
- (2025). Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds. International Conference on Machine Learning. 引用于 §27.1
- (2017). Sequential line search for efficient visual design optimization by crowds. ACM Transactions on Graphics. 引用于 §27.2
- (2020). Sequential Gallery for Interactive Visual Design Optimization. ACM Transactions on Graphics 39(4) (SIGGRAPH 2020). 引用于 §27.1 §27.2 §27.4
- (2005). Assessing Approximate Inference for Binary Gaussian Process Classification. Journal of Machine Learning Research. 引用于 §27.4
- (2025). DT-PBO: an Interpretable Tree-based Surrogate Model for Preferential Bayesian Optimization. arXiv. 预印本引用于 §27.3
- (2021). ROIAL: Region of Interest Active Learning for Characterizing Exoskeleton Gait Preference Landscapes. ICRA 2021. 引用于 §27.2
- (2024a). Enhancing Preference-based Linear Bandits via Human Response Time. Advances in Neural Information Processing Systems. 引用于 §27.2
- (2025a). Efficient Visual Appearance Optimization by Learning from Prior Preferences. UIST 2025. 引用于 §27.3
- (2026b). GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization. ACM Transactions on Graphics. doi:10.1145/3811293. 引用于 §27.3
- (2026a). Local Preferential Bayesian Optimization. arXiv. 预印本引用于 §27.6
- (2026b). Preferential Bayesian Optimization with Crash Feedback. IEEE Robotics and Automation Letters. doi:10.1109/LRA.2026.3665446. 引用于 §27.2
- (2026e). BoTorch CHANGELOG. GitHub. 软件引用于 §27.5
- (2026g). BoTorch pairwise likelihood source code likelihoods/pairwise.py. GitHub. 软件引用于 §27.1 §27.5
- (2026h). BoTorch PairwiseGP source code pairwise_gp.py. GitHub. 软件引用于 §27.5
- (2020). Projective Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §27.4
- (2021). Top- Ranking Bayesian Optimization. AAAI 2021. 引用于 §27.1 §27.2
- (2026c). optuna-dashboard PreferentialGPSampler source code gp.py. GitHub. 软件引用于 §27.4 §27.5
- (2025). Towards Uncertainty Unification: A Case Study for Preference Learning. RSS 2025. 引用于 §27.2
- (2023). GLISp-r: a preference-based optimization algorithm with convergence guarantees. Computational Optimization and Applications. 引用于 §27.3
- (2026). What Does Preference Learning Recover from Pairwise Comparison Data? ICML 2026. 引用于 §27.6
- (2026). Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization. arXiv. 预印本引用于 §27.6
- (2024). Response Time Improves Gaussian Process Models for Perception and Preferences. Uncertainty in Artificial Intelligence. 引用于 §27.1 §27.2
- (2021). Preferential Batch Bayesian Optimization. IEEE MLSP 2021. 引用于 §27.2
- (2020). Scalable Bayesian preference learning for crowds. Machine Learning. 引用于 §27.2
- (2026). Anchor-Based Heteroscedastic Noise for Preferential Bayesian Optimization. Symposium on Probabilistic Machine Learning (ProbML 2026), Proceedings Track. 引用于 §27.2
- (2023). Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes. International Conference on Machine Learning. 引用于 §27.4
- (2025). FontCraft: Multimodal Font Design Using Interactive Bayesian Optimization. CHI 2025. 引用于 §27.3
- (2025). Neural Dueling Bandits: Preference-Based Optimization with Human Feedback. International Conference on Learning Representations. 引用于 §27.3
- (2025a). Bayesian Optimization with Preference Exploration using a Monotonic Neural Network Ensemble. Advances in Neural Information Processing Systems 38. doi:10.52202/085713-4124. 引用于 §27.3
- (2025a). Mixed Likelihood Variational Gaussian Processes. arXiv. 预印本引用于 §27.2
- (2024b). Principled Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §27.1
- (2025). PABBO code repository: evaluation config evaluate.yaml. GitHub. 软件引用于 §27.3
- (2025a). PABBO: Preferential Amortized Black-Box Optimization. ICLR 2025. 引用于 §27.3
- (2026b). Vibrotactile Preference Learning: Uncertainty-Aware Preference Learning for Personalized Vibration Feedback. UMAP 2026 (per Semantic Scholar). 引用于 §27.2
- (2022). C-GLISp: Preference-Based Global Optimization Under Unknown Constraints With Applications to Controller Calibration. IEEE Transactions on Control Systems Technology. 引用于 §27.2