贝叶斯优化
第六部分:研究前沿
EN

偏好贝叶斯优化的十年

第四部分按通常的讲法介绍了偏好贝叶斯优化:从比较中学习的高斯过程效用(第 18 章)、选择下一对选项的规则(第 19 章)、查询可以采取的形式(第 20.1 节),以及从对决中学习的赌博机视角(第 21 章)。这种讲法只是一张快照。其中各个部分分别在特定的时间、由特定的社区为回答特定的问题而提出,有几部分后来受到了质疑。

本书这一部分报告 2017 年以来的研究确立了什么、有哪些争议、留下了哪些空白。本章是这一部分的总览。下面按时间顺序叙述这段历史,从该领域得名之前已有的模型一直讲到 2026 年的预印本,以便后续各章分别深入追踪一条线索:观测模型(第 27 章)、采集函数(第 28 章)、理论(第 29 章)、高维问题(第 30 章)以及软件与评测(第 31 章)。

这段历史的走向出人意料。2026 年大多数人运行的流程,即高斯过程先验加概率单位链接与 Laplace 近似,是 2005 年的模型。十年间变化的,与其说是这套机制,不如说是研究者针对它提出的问题。

2005–16基线2017–19如何提问2020–21工具定型2022–23决策论2024–26理论与审视模型与推断查询与采集理论人与应用软件相邻领域20052017201820192020202120222023202420252026同行评审论文或事件预印本软件发布查询与采集 · ICML 2017González 等人:对决表述、这一名称与三个采集函数问题表述与这一名称的起点。它没有给出收敛理论。当时的核心问题(推断):应当如何向人提问,又如何从回答中推断?
05–1617–1920–2122–2324–26模型与推断查询与采集理论人与应用软件相邻领域200520172019202120232025同行评审论文或事件预印本软件发布查询与采集 · ICML 2017González 等人:对决表述、这一名称与三个采集函数问题表述与这一名称的起点。它没有给出收敛理论。当时的核心问题(推断):应当如何向人提问,又如何从回答中推断?
图 26.1 偏好贝叶斯优化从 2005 年至 2026 年 9 月的历程,分为六条泳道。实心圆为经同行评审的论文(另有一个研讨会),空心圆为预印本,方块为软件发布。阴影带表示所选事件所处的阶段。2005 至 2016 年压缩显示;同一年内各点错开排列只为便于辨认,不表示日期。每个时期标出的核心问题是本章的推断,并非任何来源的论断。发布日期取自 BoTorch 与 Ax 的更新日志和软件包页面(Meta Platforms, Inc.,2026e;Meta Platforms, Inc.,2026l;Facebook, Inc.,2022;Optuna developers,2026b);各篇论文在正文讨论之处引用。

图中只列出本章讨论的里程碑,外加两个 BoTorch 版本(0.10.0 与 0.18),并未收录全部论文。可以留意以下几点:

  • 理论的来源。2021 年以前,理论泳道中的每一项保证都来自对决赌博机社区;面向连续定义域的核化结果始于 2021 年,2024 年起大量出现。
  • 人何时进入研究。2022 年以前,“人与应用”泳道中只有两篇外骨骼论文;此后这条泳道逐渐充实,只有 2024 年空缺。
  • 哪些尚未经过同行评审。空心圆全部位于 2026 年:对默认流程最新的批评都是预印本。
  • 重演这十年。打开“隐藏之后的年份”,选中 2005 年的事件,然后反复按“下一个”,即可看到该领域逐步积累的过程。
引言引用的文献 4
  1. Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
  2. Meta Platforms, Inc.(2026l)CHANGELOG (versions 1.2 to 1.3)
  3. Facebook, Inc.(2022)ax-platform 0.2.6
  4. Optuna developers(2026b)optuna-dashboard 0.21.0

26.1 2017 年以前 #

在该领域得名之前,三块基石已经存在,分别出自不同的社区。

第一块是模型。Chu 与 Ghahramani(2005)在潜在效用上放置高斯过程先验(潜在效用是为人对每个选项的喜爱程度打分的函数),并通过概率单位(probit)似然将其与比较联系起来:x\vx 优于 x′\vx' 的概率,等于标准正态分布函数 Φ\Phi 在缩放后效用差处的取值(第 16.3 节)。这一似然不是高斯形式,后验因而没有闭式解;他们改用 Laplace 近似(Laplace approximation),即以后验峰值为中心的高斯分布来代替后验(第 17.2 节)。这就是第 18 章的模型,二十年后它仍是默认模型。

第二块是交互式系统。Brochu 等人(2007)采用主动偏好学习(由系统自行决定下一步展示哪些选项),让人从候选画廊中挑选,以此设计计算机图形学所需的材质。其流程正是第 19.5 节的循环:展示选项,记录选择,更新模型,再决定下一步展示什么。

第三块是来自信息检索的问题表述。Yue 与 Joachims(2009)将检索系统(例如向用户学习的搜索引擎)的交互式优化表述为对决赌博机(dueling bandit)问题:学习者反复挑选两个选项,只能观察到哪一个获胜(第 21.1 节)。这一表述将在线学习的分析工具,尤其是遗憾界,引入了从比较中学习的研究。

三者各自独立发展:高斯过程偏好学习属于机器学习,画廊属于图形学与交互设计,对决赌博机属于在线学习。此后十年的大部分历程,可以理解为这些社区缓慢而不完全的交汇。

第 26.1 节引用的文献 3
  1. Chu 与 Ghahramani(2005)Preference learning with Gaussian processes
  2. Brochu 等人(2007)Active Preference Learning with Discrete Choice Data
  3. Yue 与 Joachims(2009)Interactively optimizing information retrieval systems as a dueling bandits problem

26.2 2017 至 2019 年:如何提问 #

得名。González 等人(2017)在对决空间(dueling space)上定义了这一问题(对决空间即所有输入对构成的集合),将其命名为“偏好贝叶斯优化”(preferential Bayesian optimization),并提出三个采集函数:纯探索、Copeland 期望改进与对决 Thompson 采样(第 19.2 节)。这篇论文没有给出收敛理论,即没有说明随着查询增多,推荐选项以多快的速度接近最优选项。

赌博机一侧的保证。对于密切相关的问题,对决赌博机社区早已有形式化结果。这些结果所控制的量是遗憾(regret):由于展示的是算法所选的选项而非最优选项,在全部查询上累计损失的效用(第 13 章)。SelfSparring 是一种让多个选项同时对决的方法,其渐近收敛性已得到证明(Sui 等,2017b);Kumagai(2017)在该领域得名的同一年,给出了连续空间上对决赌博机的遗憾界。分阶段安全贝叶斯优化 StageOpt 处理未知的安全约束,其定理针对数值观测;它还有一个偏好变体,该变体本身没有收敛定理,已应用于脊髓刺激(Sui 等,2018b)(第 28.7 节)。

注常见说法核查

有时会读到这样的说法:在 2024 年的核化遗憾界出现之前,从比较中学习没有任何形式化保证。这一说法有一点是对的:González 等人的高斯过程表述没有给出收敛速率。2018 年的一篇对决赌博机综述指出了这一点,称之为“一种没有收敛速率理论保证的纯贝叶斯优化方法”(a pure Bayesian optimization approach without theoretical guarantees on convergence rate)(Sui 等,2018a)。但若用来描述整个领域,这一说法并不成立。SelfSparring 的渐近收敛结果(Sui 等,2017b)、Kumagai 的连续定义域遗憾界(Kumagai,2017),以及偏好反馈的一项临床应用(StageOpt 的应用(Sui 等,2018b)),都早于 2019 年。准确的说法范围更窄:这一问题的赌博机表述有理论保证,实践者运行的高斯过程流程则没有;并且如第 29 章所述,理论分析的算法与实践中使用的流程至今仍不相同。

改变问题的形式。在图形学中,Koyama 等人(2017)另辟蹊径。他们的序列线搜索(sequential line search)把每次查询变成一个滑块:众包工作者沿设计空间中的一条直线拖动,停在自己最喜欢的点上(第 20.2 节)。这篇论文开启了人机交互领域的一类研究,其主要变量是查询的形式,而非选择查询的规则。

这一时期的问题。这几年的核心问题是如何向人提问。机器学习改进了选择比较的规则,人机交互则主要改变查询的形式,很少改动采集函数(推断)。图中 2019 年没有里程碑,但研究仍在继续,例如允许人回答“差不多”的工作(Bıyık 等,2019)(第 27.2 节)。

第 26.2 节引用的文献 7
  1. González 等人(2017)Preferential Bayesian Optimization
  2. Sui 等人(2017b)Multi-dueling Bandits with Dependent Arms
  3. Kumagai(2017)Regret Analysis for Continuous Dueling Bandit
  4. Sui 等人(2018b)Stagewise Safe Bayesian Optimization with Gaussian Processes
  5. Sui 等人(2018a)Advancements in Dueling Bandits
  6. Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
  7. Bıyık 等人(2019)Asking Easy Questions: A User-Friendly Approach to Active Reward Learning

26.3 2020 至 2021 年:工具与推断定型 #

默认实现。2020 年 4 月,BoTorch(Meta 基于 PyTorch 构建的开源贝叶斯优化库,第 14.8 节)在 0.2.3 版中加入了 PairwiseGP,即用于成对比较数据的模型(Meta Platforms, Inc.,2026e)。它实现的是概率单位链接加 Laplace 近似,此后这一组合一直是偏好贝叶斯优化中使用最广的实现。也就是说,从 2020 年起该领域有了事实标准,而这一标准正是 2005 年的模型(第 27.5 节)。

子空间中的查询。同年出现的一些方法把每次查询限制在低维子空间中,以处理更多维度:在投影偏好贝叶斯优化中,人沿空间中的一条直线选出最好的点(Mikkola 等,2020);序列画廊(Sequential Gallery)则以网格形式展示设计的一个二维平面(Koyama 等,2020)(第 20.3 节)。在机器人学中,CoSpar 根据穿戴者的偏好学习外骨骼的行走步态(Tucker 等,2020b),LineCoSpar 将其扩展到 6 个步态参数,并在 6 名身体健全的被试身上做了测试(Tucker 等,2020a)。这两篇论文开创了外骨骼应用这一研究方向:第 33.1 节追踪其进展,第 24 章以案例形式完整演示。

精确后验。2021 年,Benavoli 等人(2021c)证明,在概率单位偏好似然下,效用的精确后验是偏斜高斯过程(skew Gaussian process):它与高斯过程一样是函数上的分布,但其边际分布是偏斜的,而非对称的(第 17.6 节)。Laplace 近似这类高斯近似无法表示这种偏斜;自此,后验推断的质量成为争论的焦点(第 27.4 节)。

第一个核化界,以及一种替代方案。同样在 2021 年,Kirschner 与 Krause(2021)给出了核化(kernelized)对决反馈下的第一个累积遗憾界。核化是指假设未知效用在某个核函数所定义的意义下光滑,因此这一结果涵盖连续定义域(第 21.3 节);他们的反馈模型是效用差加噪声,而非偏好模型中的概率单位链接或逻辑链接。控制工程领域独立处理了同一问题:GLISp 将径向基函数代理模型(即若干凸起的加权和)拟合到观测到的偏好上,完全不使用概率模型(Bemporad 与 Piga,2021)(第 27.3 节)。

至 2021 年底,该领域已有一个标准实现,已知这一实现的推断存在弱点,连续定义域的理论也已起步。实际使用的采集函数则大多仍是启发式规则。

第 26.3 节引用的文献 8
  1. Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
  2. Mikkola 等人(2020)Projective Preferential Bayesian Optimization
  3. Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
  4. Tucker 等人(2020b)Preference-Based Learning for Exoskeleton Gait Optimization
  5. Tucker 等人(2020a)Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits
  6. Benavoli 等人(2021c)Preferential Bayesian optimisation with skew gaussian processes
  7. Kirschner 与 Krause(2021)Bias-Robust Bayesian Optimization via Dueling Bandits
  8. Bemporad 与 Piga(2021)Global optimization based on active preference learning with radial basis functions

26.4 2022 至 2023 年:决策论转向 #

EUBO。启发式规则让位于有原则的规则。在偏好探索贝叶斯优化(Bayesian optimization with preference exploration,BOPE)中,系统在实验进行的同时,通过比较学习人对实验结果的偏好。针对这一设定,Lin 等人(2022)提出了最优选项期望效用(expected utility of the best option,EUBO;第 19.4 节),并证明它一步贝叶斯最优(one-step Bayes optimal):若会话在再获得一个回答后即结束,任何其他查询都不能得到期望意义下更好的最终推荐(第 19.4.1 节)。Astudillo 等人(2023)将其推广为 qEUBO,用于一次展示多个选项的查询和带逻辑噪声的回答,并证明期望改进经改编的一种批量版本不具有渐近一致性。这就是决策论转向。qEUBO 成为 BoTorch 偏好采集函数的基础;BoTorch、Ax 与 optuna-dashboard 在数月之内即发布了这些新规则(第 31.1 节)。

推断质量的测量。Takeno 等人(2023)测量了 Laplace 近似与期望传播偏离精确偏斜后验的程度,并提出幻觉信念(hallucination believer):从后验中抽取潜在效用的一个样本,将其视为测得的数据,再套用任一标准采集函数(第 19.3 节)。这一方法后来成为 optuna-dashboard(Optuna 优化库的网页界面)中偏好采样器的基础(Optuna developers,2026b)。

人成为研究问题。与此同时,人机交互研究开始测量优化回路对其中的人有何影响。设计过程由多目标优化器主导时,新手设计者报告的能动感与归属感,低于由自己主导设计过程的新手;这项研究使用的是性能目标,而非比较(Chan 等,2022)(第 32.2 节)。在一次为期 3 个月的现场部署中,多数评分循环从未进入优化阶段,或没有收敛(Ou 等,2022)(第 31.7 节)。专家比新手迭代更多,最终却更不满意(Ou 等,2023)(第 32.6 节)。

相邻领域壮大。2023 年,直接偏好优化(DPO)将 Bradley-Terry 似然置于大语言模型与人类偏好对齐的核心。在这一似然下,一个选项胜过另一个选项的概率是二者效用差的逻辑函数(第 16.4 节)。DPO 直接用人的比较拟合语言模型,而不像基于人类反馈的强化学习(RLHF)那样借助奖励模型(Rafailov 等,2023)。同年,ICML 研讨会 The Many Facets of Preference-Based Learning 将对决赌博机、RLHF、社会选择与优化汇集在一起(ICML,2023)。第 35 章讨论这两个领域之间的往来。

第 26.4 节引用的文献 9
  1. Lin 等人(2022)Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes
  2. Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
  3. Takeno 等人(2023)Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes
  4. Optuna developers(2026b)optuna-dashboard 0.21.0
  5. Chan 等人(2022)Investigating Positive and Negative Qualities of Human-in-the-Loop Optimization for Designing Interaction Techniques
  6. Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures
  7. Ou 等人(2023)The Impact of Expertise in the Loop for Exploring Machine Rationality
  8. Rafailov 等人(2023)Direct Preference Optimization: Your Language Model is Secretly a Reward Model
  9. ICML(2023)The Many Facets of Preference-Based Learning

26.5 2024 至 2026 年:噪声、理论与审视 #

最近三年可分为两个阶段。2024 与 2025 年,理论、高维诊断、语言模型与正当性问题同时推进。2026 年,研究集中于默认流程的缺陷及其更简单的替代方案。

26.5.1 2024 与 2025 年:理论、维度、语言模型与正当性 #

Bradley-Terry 链接下的界。随着乐观算法 POP-BO(Xu 等,2024b)、最大最小下置信界算法(MaxMinLCB)(Pásztor 等,2024)与多轮偏好反馈学习算法(MR-LPF)的提出,Bradley-Terry 链接下有了核化遗憾上界,即保证累积遗憾的增长不快于给定速率的结果;其中 MR-LPF 的上界与标量反馈同阶(Kayal 等,2025)。上界同阶并不说明一次比较与一个数值携带同样多的信息,只说明两者的保证同阶。第 29.4 节列出了每个速率及其假设。

摊销优化器。偏好摊销黑箱优化(PABBO)预先在大量合成任务上训练神经网络,使其直接提出下一对选项;这样,一次查询只需一次前向传播,无需拟合模型、优化采集函数(Zhang 等,2025a)。它是唯一面向成对偏好的摊销优化器(第 27.3 节)。

高维问题的重新诊断。在以数值为观测的普通贝叶斯优化中,一系列论文将人们熟知的高维失效归因于先验与初始化,而非方法本身(Hvarfner 等,2024;Xu 等,2025b;Papenmeier 等,2025b)。补救办法是维度缩放先验(dimension-scaled prior):核函数长度尺度上的一种先验,其典型值随输入个数增大(第 9.5 节)。2024 年 9 月,BoTorch 0.12.0 将大多数模型改用这类先验,却明确排除了 PairwiseGP(Meta Platforms, Inc.,2026e);第 30.1 节考察这一缺口。

语言模型与正当性。大语言模型开始用于对话式偏好引出(Austin 等,2024a)与对齐数据的主动收集(Dwaracherla 等,2024)。人机交互研究则转向群体先验,即把早期用户的偏好迁移给新用户(Li 等,2025a),以及设计者与优化器之间以自然语言进行的协作(Niwa 等,2025)。对齐研究还将偏好优化同样面临的一种担忧加以形式化:从偏好中学习的系统,可能改变其所测量的偏好。Carroll 等人(2024)比较了面向可变偏好的八种对齐概念,发现每一种要么会奖励系统对人施加不当影响,要么过度规避风险;Williams 等人(2025)发现,基于用户反馈优化的学习器,会学会专门针对最易受影响的用户(第 40.3 节)。

26.5.2 2026 年:受到审视的默认流程 #

理论。偏好反馈下的 Thompson 采样(PF-TS)是完全序贯的算法,其上界为 γTT\gamma_T \sqrt{T} 阶(Lazzaro 等,2026);相比之下,MR-LPF 是带有有限候选集和预热期的分批算法,上界为 γTT\sqrt{\gamma_T T} 阶(Kayal 等,2025)。其中 γT\gamma_T 是核函数的最大信息增益(maximum information gain),对光滑的核函数增长很慢(第 6.5 节)。

默认流程的缺陷。2026 年的两篇预印本考察了由 PairwiseGP、Laplace 近似与 EUBO 组成的流程:EUBO 的查询向估计的最优选项坍缩(Wu 与 Gardner,2026);它选出的成对选项与先前查询没有共同输入,致使 Laplace 似然的 Hessian 矩阵秩亏(Shao 等,2026)。第 19.6 节已介绍过这两点。观测模型扩展到了可能失败的实验(Menn 等,2026b);局部偏好贝叶斯优化(同为预印本)将该方法推进到约 100 维(Menn 等,2026a)(第 30.4 节)。

更简单的替代方案与人。在普通的高维贝叶斯优化中,对输入做球面映射、再结合贝叶斯线性回归的方法(第 5.4 节),在 60 至 6,000 维的任务上达到了最先进水平(Doumont 等,2026)。Ax 加入了偏好优化,以及由语言模型将自由文本反馈转换为比较的试验(Meta Platforms, Inc.,2026l;Kobalczyk 等,2026)(第 35.2 节)。2026 年采用强对照条件的人类研究,大多没有发现效应,或发现人手动调节的效果相差无几。用于交互设备原型制作的成本感知贝叶斯优化,以约 67% 的成本达到相同性能,最终质量没有差异(Langerak 等,2026)。在一项有 12 名被试、以性能为目标的研究中,从用户模型学到的先验只在第二、三次迭代时有帮助(Liao 等,2026)。11 名健康成年人用拇指杆遥控器自行调节外骨骼助力,在约 10.9 分钟内使代谢消耗降低 16.6%,与算法调节所报告的结果相当(Schäfer 等,2026)。由此,更简单的方法(包括人的手动调节)成为新方法必须与之比较的对照(第 32.8 节)。Benavoli 与 Azzimonti 的教程也已正式发表,内容是用高斯过程从偏好与选择中学习(Benavoli 与 Azzimonti,2026a);但该领域至今仍没有专门的综述(第 31.8.2 节)。

第 26.5 节引用的文献 26
  1. Xu 等人(2024b)Principled Preferential Bayesian Optimization
  2. Pásztor 等人(2024)Bandits with Preference Feedback: A Stackelberg Game Perspective
  3. Kayal 等人(2025)Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds
  4. Zhang 等人(2025a)PABBO: Preferential Amortized Black-Box Optimization
  5. Hvarfner 等人(2024)Vanilla Bayesian Optimization Performs Great in High Dimensions
  6. Xu 等人(2025b)Standard Gaussian Process is All You Need for High-Dimensional Bayesian Optimization
  7. Papenmeier 等人(2025b)Understanding High-Dimensional Bayesian Optimization
  8. Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
  9. Austin 等人(2024a)Bayesian Optimization with LLM-Based Acquisition Functions for Natural Language Preference Elicitation
  10. Dwaracherla 等人(2024)Efficient Exploration for LLMs
  11. Li 等人(2025a)Efficient Visual Appearance Optimization by Learning from Prior Preferences
  12. Niwa 等人(2025)Cooperative Design Optimization through Natural Language Interaction
  13. Carroll 等人(2024)AI Alignment with Changing and Influenceable Reward Functions
  14. Williams 等人(2025)On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback
  15. Lazzaro 等人(2026)A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback
  16. Wu 与 Gardner(2026)Knowledge Gradient for Preference Learning
  17. Shao 等人(2026)Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization
  18. Menn 等人(2026b)Preferential Bayesian Optimization with Crash Feedback
  19. Menn 等人(2026a)Local Preferential Bayesian Optimization
  20. Doumont 等人(2026)We Still Don't Understand High-Dimensional Bayesian Optimization
  21. Meta Platforms, Inc.(2026l)CHANGELOG (versions 1.2 to 1.3)
  22. Kobalczyk 等人(2026)LILO: Bayesian Optimization with Natural Language Feedback
  23. Langerak 等人(2026)Cost-Aware Bayesian Optimization for Prototyping Interactive Devices
  24. Liao 等人(2026)Efficient Human-in-the-Loop Optimization via Priors Learned from User Models
  25. Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
  26. Benavoli 与 Azzimonti(2026a)A tutorial on learning from preferences and choices with Gaussian Processes

26.6 核心问题如何转移 #

若把这十年看作一连串问题,其间经历了三次转向(推断)。

2017 至 2021 年,问题是:如何向人提问,又如何从回答中推断?对决表述、序列线搜索、画廊与投影、PairwiseGP 和偏斜高斯过程,都回答了这一问题的某个方面。

2022 至 2025 年,问题变为:采集函数是否有原则,是否有理论保证?EUBO 与 qEUBO 以一步贝叶斯最优性回答了前一半;POP-BO、MaxMinLCB 与 MR-LPF 以 Bradley-Terry 链接下的遗憾界回答了后一半。

2025 至 2026 年,问题同时变为四个:观测模型是否正确?人是否按模型假设的方式回答?更简单的方法是否已经足够?系统是否会改变它所测量的偏好?EUBO 的坍缩、秩亏的 Hessian 矩阵、强对照下未发现效应的研究、在高维中胜出的线性模型,以及对齐研究中关于影响的结果,都属于这一阶段。最后这次转向,就是从文献角度看到的本书主旨:瓶颈已经从算法转移到测量(第 45.1 节)。

各时期在 2025 年有所重叠:第二个问题尚在解答之中,第三个问题已经提出,因此图 26.1 在这一年同时标出两者。

要点机制未变,问题在变

2026 年的默认流程,即高斯过程先验加概率单位链接与 Laplace 近似,就是 2005 年的模型。十年间变化的是针对它提出的问题:先是如何提问,继而是查询的选择是否有原则、有保证,最后是描述人的模型究竟是否正确。

后续各章分别承接其中一条线索。第 27 章考察描述人如何回答的模型是否正确;第 28 章考察查询规则是否经得起检验;第 29 章梳理究竟证明了什么;第 30 章分析方法在何处失效、为何失效;第 31 章讨论软件默认做了什么、方法之间如何比较。第七部分讨论关于人的问题,第九部分则从根本上探讨偏好是什么。

26.7 发表与社区 #

2023 年以后研究数量有所增长,但基数很小。arXiv 上摘要同时包含 preferential、Bayesian 与 optimization(或 optimisation)的条目,2023 年有 4 篇,2024 年 5 篇,2025 年 13 篇,2026 年前 9 个月 12 篇(arXiv,2026b);这一计数会遗漏使用其他措辞(例如“dueling”或“human feedback”)的论文(推断)。这些研究分散于机器学习、控制、机器人学与人机交互的各类发表场所,各社区之间很少相互引用:2021 年发表于 Journal of Machine Learning Research 的对决赌博机综述,就没有引用 González 等人 2017 年的论文(Bengs 等,2021)。表 31.6 按学科列出了主要的研究组;证明遗憾界的研究组不做人类研究,做人类研究的研究组很少改动采集函数(推断)。更完整的叙述见第 31.8 节。

第 26.7 节引用的文献 2
  1. arXiv(2026b)Abstract search: preferential AND Bayesian AND (optimization OR optimisation)
  2. Bengs 等人(2021)Preference-based Online Learning with Dueling Bandits: A Survey

26.8 已定、有争议与缺失 #

研究现状已定、有争议与缺失

已定。默认流程在这十年间没有改变:Chu 与 Ghahramani(2005)的高斯过程、概率单位与 Laplace 模型,自 2020 年 4 月起由 BoTorch 的 PairwiseGP 实现(Meta Platforms, Inc.,2026e)。回答无噪声时,EUBO 与 qEUBO 具有一步贝叶斯最优性(Lin 等,2022;Astudillo 等,2023)。从比较中学习的形式化保证,在对决赌博机一侧远早于 2024 年就已存在(Sui 等,2017b;Kumagai,2017);Bradley-Terry 链接下的核化界则始于 2024 年(Xu 等,2024b)。BoTorch 在 2024 年改用维度缩放先验时,明确排除了偏好模型(Meta Platforms, Inc.,2026e)。

有争议。2026 年报告的两项缺陷,即 EUBO 向当前最优点坍缩与 Hessian 矩阵秩亏,在人的任务上是否带来任何代价;两者都只有预印本为据(Wu 与 Gardner,2026;Shao 等,2026)。对照足够强时,偏好优化是否胜过更简单的替代方案:2026 年的受控人类研究发现优势不大或没有优势(Langerak 等,2026;Liao 等,2026;Schäfer 等,2026),而在标量反馈的高维问题中,线性模型达到了最先进水平(Doumont 等,2026)。

缺失。专门的偏好贝叶斯优化综述。社区之间的交流:2021 年 JMLR 上的对决赌博机综述没有引用为该领域命名的论文(Bengs 等,2021)。在相同界面与预算下把被试随机分配到不同采集函数的研究,以及以预注册终点指标与专家手动调节相比较的研究(第 47.4 节)。

第 26.8 节引用的文献 14
  1. Chu 与 Ghahramani(2005)Preference learning with Gaussian processes
  2. Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
  3. Lin 等人(2022)Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes
  4. Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
  5. Sui 等人(2017b)Multi-dueling Bandits with Dependent Arms
  6. Kumagai(2017)Regret Analysis for Continuous Dueling Bandit
  7. Xu 等人(2024b)Principled Preferential Bayesian Optimization
  8. Wu 与 Gardner(2026)Knowledge Gradient for Preference Learning
  9. Shao 等人(2026)Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization
  10. Langerak 等人(2026)Cost-Aware Bayesian Optimization for Prototyping Interactive Devices
  11. Liao 等人(2026)Efficient Human-in-the-Loop Optimization via Priors Learned from User Models
  12. Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
  13. Doumont 等人(2026)We Still Don't Understand High-Dimensional Bayesian Optimization
  14. Bengs 等人(2021)Preference-based Online Learning with Dueling Bandits: A Survey

延伸阅读 #

参考文献

  1. arXiv (2026b). Abstract search: preferential AND Bayesian AND (optimization OR optimisation). arXiv API. 非同行评审引用于 §26.7
  2. Astudillo, R., Lin, Z. J., Bakshy, E., and Frazier, P. (2023). qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization. International Conference on Artificial Intelligence and Statistics. 引用于 §26.4 §26.8
  3. Austin, D. E., Korikov, A., Toroghi, A., and Sanner, S. (2024a). Bayesian Optimization with LLM-Based Acquisition Functions for Natural Language Preference Elicitation. RecSys 2024 (arXiv v2). 引用于 §26.5
  4. Bemporad, A., and Piga, D. (2021). Global optimization based on active preference learning with radial basis functions. Machine Learning. 引用于 §26.3
  5. Benavoli, A., and Azzimonti, D. (2026a). A tutorial on learning from preferences and choices with Gaussian Processes. Foundations and Trends in Machine Learning 19(1):1-120. 引用于 §26.5
  6. Benavoli, A., Azzimonti, D., and Piga, D. (2021c). Preferential Bayesian optimisation with skew gaussian processes. Proceedings of the Genetic and Evolutionary Computation Conference Companion. 引用于 §26.3
  7. Bengs, V., Busa-Fekete, R., El Mesaoudi-Paul, A., and Hüllermeier, E. (2021). Preference-based Online Learning with Dueling Bandits: A Survey. Journal of Machine Learning Research. 引用于 §26.7 §26.8
  8. Bıyık, E., Palan, M., Landolfi, N. C., Losey, D. P., and Sadigh, D. (2019). Asking Easy Questions: A User-Friendly Approach to Active Reward Learning. CoRL 2019. 引用于 §26.2
  9. Brochu, E., de Freitas, N., and Ghosh, A. (2007). Active Preference Learning with Discrete Choice Data. Advances in Neural Information Processing Systems. 引用于 §26.1
  10. Carroll, M., Foote, D., Siththaranjan, A., Russell, S., and Dragan, A. (2024). AI Alignment with Changing and Influenceable Reward Functions. International Conference on Machine Learning. 引用于 §26.5
  11. Chan, L., Liao, Y.-C., Mo, G. B., Dudley, J. J., Cheng, C.-L., Kristensson, P. O., and Oulasvirta, A. (2022). Investigating Positive and Negative Qualities of Human-in-the-Loop Optimization for Designing Interaction Techniques. CHI 2022. 引用于 §26.4
  12. Chu, W., and Ghahramani, Z. (2005). Preference learning with Gaussian processes. Proceedings of the 22nd international conference on Machine learning - ICML '05. 引用于 §26.1 §26.8
  13. Doumont, C., Fan, D., Maus, N., Gardner, J. R., Moss, H., and Pleiss, G. (2026). We Still Don't Understand High-Dimensional Bayesian Optimization. AISTATS 2026 (best student paper). 引用于 §26.5 §26.8
  14. Dwaracherla, V., Asghari, S. M., Hao, B., and Van Roy, B. (2024). Efficient Exploration for LLMs. ICML 2024. 引用于 §26.5
  15. Facebook, Inc. (2022). ax-platform 0.2.6. PyPI. 软件
  16. González, J., Dai, Z., Damianou, A., and Lawrence, N. D. (2017). Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §26.2
  17. Hvarfner, C., Hellsten, E. O., and Nardi, L. (2024). Vanilla Bayesian Optimization Performs Great in High Dimensions. International Conference on Machine Learning. 引用于 §26.5
  18. ICML (2023). The Many Facets of Preference-Based Learning. ICML 2023 workshop page. 非同行评审引用于 §26.4
  19. Kayal, A., Vakili, S., Toni, L., Shiu, D.-S., and Bernacchia, A. (2025). Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds. International Conference on Machine Learning. 引用于 §26.5
  20. Kirschner, J., and Krause, A. (2021). Bias-Robust Bayesian Optimization via Dueling Bandits. International Conference on Machine Learning. 引用于 §26.3
  21. Kobalczyk, K., Lin, Z. J., Letham, B., Zhao, Z., Balandat, M., and Bakshy, E. (2026). LILO: Bayesian Optimization with Natural Language Feedback. ICML 2026. 引用于 §26.5
  22. Koyama, Y., Sato, I., Sakamoto, D., and Igarashi, T. (2017). Sequential line search for efficient visual design optimization by crowds. ACM Transactions on Graphics. 引用于 §26.2
  23. Koyama, Y., Sato, I., and Goto, M. (2020). Sequential Gallery for Interactive Visual Design Optimization. ACM Transactions on Graphics 39(4) (SIGGRAPH 2020). 引用于 §26.3
  24. Kumagai, W. (2017). Regret Analysis for Continuous Dueling Bandit. Advances in Neural Information Processing Systems. 引用于 §26.2 §26.8
  25. Langerak, T., Zhang, R., Wang, Z., Kristensson, P. O., and Oulasvirta, A. (2026). Cost-Aware Bayesian Optimization for Prototyping Interactive Devices. CHI 2026. 引用于 §26.5 §26.8
  26. Lazzaro, J., Buffelli, D., Shiu, D.-s., and Vakili, S. (2026). A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback. International Conference on Artificial Intelligence and Statistics. 引用于 §26.5
  27. Li, Z., Liao, Y.-C., and Holz, C. (2025a). Efficient Visual Appearance Optimization by Learning from Prior Preferences. UIST 2025. 引用于 §26.5
  28. Liao, Y.-C., Belo, J., Moon, H.-S., Steimle, J., and Feit, A. M. (2026). Efficient Human-in-the-Loop Optimization via Priors Learned from User Models. CHI 2026. 引用于 §26.5 §26.8
  29. Lin, Z. J., Astudillo, R., Frazier, P., and Bakshy, E. (2022). Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes. International Conference on Artificial Intelligence and Statistics. 引用于 §26.4 §26.8
  30. Menn, J., Kober, M., Brunzema, P., Stenger, D., and Trimpe, S. (2026a). Local Preferential Bayesian Optimization. arXiv. 预印本引用于 §26.5
  31. Menn, J., Stenger, D., and Trimpe, S. (2026b). Preferential Bayesian Optimization with Crash Feedback. IEEE Robotics and Automation Letters. doi:10.1109/LRA.2026.3665446. 引用于 §26.5
  32. Meta Platforms, Inc. (2026e). BoTorch CHANGELOG. GitHub. 软件引用于 §26.3 §26.5 §26.8
  33. Meta Platforms, Inc. (2026l). CHANGELOG (versions 1.2 to 1.3). GitHub. 软件引用于 §26.5
  34. Mikkola, P., Todorović, M., Järvi, J., Rinke, P., and Kaski, S. (2020). Projective Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §26.3
  35. Niwa, R., Yoshida, S., Koyama, Y., and Ushiku, Y. (2025). Cooperative Design Optimization through Natural Language Interaction. UIST 2025. 引用于 §26.5
  36. Optuna developers (2026b). optuna-dashboard 0.21.0. PyPI. 软件引用于 §26.4
  37. Ou, C., Buschek, D., Mayer, S., and Butz, A. (2022). The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures. Mensch und Computer 2022. 引用于 §26.4
  38. Ou, C., Mayer, S., and Butz, A. (2023). The Impact of Expertise in the Loop for Exploring Machine Rationality. IUI 2023. 引用于 §26.4
  39. Papenmeier, L., Poloczek, M., and Nardi, L. (2025b). Understanding High-Dimensional Bayesian Optimization. ICML 2025, PMLR 267:47902-47923. 引用于 §26.5
  40. Pásztor, B., Kassraie, P., and Krause, A. (2024). Bandits with Preference Feedback: A Stackelberg Game Perspective. Advances in Neural Information Processing Systems. doi:10.52202/079017-0383. 引用于 §26.5
  41. Rafailov, R., Sharma, A., Mitchell, E., Ermon, S., Manning, C. D., and Finn, C. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. 引用于 §26.4
  42. Schäfer, N., Zhao, G., Li, B., Kupnik, M., Seyfarth, A., Beckerle, P., and Grimmer, M. (2026). User preference-based human-in-the-loop tuning of exoskeleton assistance during walking. npj Biomedical Innovations. doi:10.1038/s44385-026-00085-7. 引用于 §26.5 §26.8
  43. Shao, K., Wang, J., Pei, X., and Mesbah, A. (2026). Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization. arXiv. 预印本引用于 §26.5 §26.8
  44. Sui, Y., Zhuang, V., Burdick, J. W., and Yue, Y. (2017b). Multi-dueling Bandits with Dependent Arms. UAI 2017. 引用于 §26.2 §26.8
  45. Sui, Y., Zoghi, M., Hofmann, K., and Yue, Y. (2018a). Advancements in Dueling Bandits. Proceedings of the Twenty-Seventh International Joint Conference on Artificial Intelligence. doi:10.24963/ijcai.2018/776. 引用于 §26.2
  46. Sui, Y., Zhuang, V., Burdick, J., and Yue, Y. (2018b). Stagewise Safe Bayesian Optimization with Gaussian Processes. International Conference on Machine Learning. 引用于 §26.2
  47. Takeno, S., Nomura, M., and Karasuyama, M. (2023). Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes. International Conference on Machine Learning. 引用于 §26.4
  48. Tucker, M., Cheng, M., Novoseller, E., Cheng, R., Yue, Y., Burdick, J. W., and Ames, A. D. (2020a). Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits. IROS 2020. 引用于 §26.3
  49. Tucker, M., Novoseller, E., Kann, C., Sui, Y., Yue, Y., Burdick, J. W., and Ames, A. D. (2020b). Preference-Based Learning for Exoskeleton Gait Optimization. 2020 IEEE International Conference on Robotics and Automation (ICRA). 引用于 §26.3
  50. Williams, M., Carroll, M., Narang, A., Weisser, C., Murphy, B., and Dragan, A. (2025). On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback. ICLR 2025. 引用于 §26.5
  51. Wu, K., and Gardner, J. R. (2026). Knowledge Gradient for Preference Learning. arXiv. 预印本引用于 §26.5 §26.8
  52. Xu, W., Wang, W., Jiang, Y., Svetozarevic, B., and Jones, C. (2024b). Principled Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §26.5 §26.8
  53. Xu, Z., Wang, H., Phillips, J. M., and Zhe, S. (2025b). Standard Gaussian Process is All You Need for High-Dimensional Bayesian Optimization. ICLR 2025 (oral). 引用于 §26.5
  54. Yue, Y., and Joachims, T. (2009). Interactively optimizing information retrieval systems as a dueling bandits problem. Proceedings of the 26th Annual International Conference on Machine Learning. 引用于 §26.1
  55. Zhang, X., Huang, D., Kaski, S., and Martinelli, J. (2025a). PABBO: Preferential Amortized Black-Box Optimization. ICLR 2025. 引用于 §26.5