偏好贝叶斯优化的十年
第四部分按通常的讲法介绍了偏好贝叶斯优化:从比较中学习的高斯过程效用(第 18 章)、选择下一对选项的规则(第 19 章)、查询可以采取的形式(第 20.1 节),以及从对决中学习的赌博机视角(第 21 章)。这种讲法只是一张快照。其中各个部分分别在特定的时间、由特定的社区为回答特定的问题而提出,有几部分后来受到了质疑。
本书这一部分报告 2017 年以来的研究确立了什么、有哪些争议、留下了哪些空白。本章是这一部分的总览。下面按时间顺序叙述这段历史,从该领域得名之前已有的模型一直讲到 2026 年的预印本,以便后续各章分别深入追踪一条线索:观测模型(第 27 章)、采集函数(第 28 章)、理论(第 29 章)、高维问题(第 30 章)以及软件与评测(第 31 章)。
这段历史的走向出人意料。2026 年大多数人运行的流程,即高斯过程先验加概率单位链接与 Laplace 近似,是 2005 年的模型。十年间变化的,与其说是这套机制,不如说是研究者针对它提出的问题。
图中只列出本章讨论的里程碑,外加两个 BoTorch 版本(0.10.0 与 0.18),并未收录全部论文。可以留意以下几点:
- 理论的来源。2021 年以前,理论泳道中的每一项保证都来自对决赌博机社区;面向连续定义域的核化结果始于 2021 年,2024 年起大量出现。
- 人何时进入研究。2022 年以前,“人与应用”泳道中只有两篇外骨骼论文;此后这条泳道逐渐充实,只有 2024 年空缺。
- 哪些尚未经过同行评审。空心圆全部位于 2026 年:对默认流程最新的批评都是预印本。
- 重演这十年。打开“隐藏之后的年份”,选中 2005 年的事件,然后反复按“下一个”,即可看到该领域逐步积累的过程。
引言引用的文献 4
- Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
- Meta Platforms, Inc.(2026l)CHANGELOG (versions 1.2 to 1.3)
- Facebook, Inc.(2022)ax-platform 0.2.6
- Optuna developers(2026b)optuna-dashboard 0.21.0
26.1 2017 年以前 #
在该领域得名之前,三块基石已经存在,分别出自不同的社区。
第一块是模型。Chu 与 Ghahramani(2005)在潜在效用上放置高斯过程先验(潜在效用是为人对每个选项的喜爱程度打分的函数),并通过概率单位(probit)似然将其与比较联系起来: 优于 的概率,等于标准正态分布函数 在缩放后效用差处的取值(第 16.3 节)。这一似然不是高斯形式,后验因而没有闭式解;他们改用 Laplace 近似(Laplace approximation),即以后验峰值为中心的高斯分布来代替后验(第 17.2 节)。这就是第 18 章的模型,二十年后它仍是默认模型。
第二块是交互式系统。Brochu 等人(2007)采用主动偏好学习(由系统自行决定下一步展示哪些选项),让人从候选画廊中挑选,以此设计计算机图形学所需的材质。其流程正是第 19.5 节的循环:展示选项,记录选择,更新模型,再决定下一步展示什么。
第三块是来自信息检索的问题表述。Yue 与 Joachims(2009)将检索系统(例如向用户学习的搜索引擎)的交互式优化表述为对决赌博机(dueling bandit)问题:学习者反复挑选两个选项,只能观察到哪一个获胜(第 21.1 节)。这一表述将在线学习的分析工具,尤其是遗憾界,引入了从比较中学习的研究。
三者各自独立发展:高斯过程偏好学习属于机器学习,画廊属于图形学与交互设计,对决赌博机属于在线学习。此后十年的大部分历程,可以理解为这些社区缓慢而不完全的交汇。
第 26.1 节引用的文献 3
- Chu 与 Ghahramani(2005)Preference learning with Gaussian processes
- Brochu 等人(2007)Active Preference Learning with Discrete Choice Data
- Yue 与 Joachims(2009)Interactively optimizing information retrieval systems as a dueling bandits problem
26.2 2017 至 2019 年:如何提问 #
得名。González 等人(2017)在对决空间(dueling space)上定义了这一问题(对决空间即所有输入对构成的集合),将其命名为“偏好贝叶斯优化”(preferential Bayesian optimization),并提出三个采集函数:纯探索、Copeland 期望改进与对决 Thompson 采样(第 19.2 节)。这篇论文没有给出收敛理论,即没有说明随着查询增多,推荐选项以多快的速度接近最优选项。
赌博机一侧的保证。对于密切相关的问题,对决赌博机社区早已有形式化结果。这些结果所控制的量是遗憾(regret):由于展示的是算法所选的选项而非最优选项,在全部查询上累计损失的效用(第 13 章)。SelfSparring 是一种让多个选项同时对决的方法,其渐近收敛性已得到证明(Sui 等,2017b);Kumagai(2017)在该领域得名的同一年,给出了连续空间上对决赌博机的遗憾界。分阶段安全贝叶斯优化 StageOpt 处理未知的安全约束,其定理针对数值观测;它还有一个偏好变体,该变体本身没有收敛定理,已应用于脊髓刺激(Sui 等,2018b)(第 28.7 节)。
有时会读到这样的说法:在 2024 年的核化遗憾界出现之前,从比较中学习没有任何形式化保证。这一说法有一点是对的:González 等人的高斯过程表述没有给出收敛速率。2018 年的一篇对决赌博机综述指出了这一点,称之为“一种没有收敛速率理论保证的纯贝叶斯优化方法”(a pure Bayesian optimization approach without theoretical guarantees on convergence rate)(Sui 等,2018a)。但若用来描述整个领域,这一说法并不成立。SelfSparring 的渐近收敛结果(Sui 等,2017b)、Kumagai 的连续定义域遗憾界(Kumagai,2017),以及偏好反馈的一项临床应用(StageOpt 的应用(Sui 等,2018b)),都早于 2019 年。准确的说法范围更窄:这一问题的赌博机表述有理论保证,实践者运行的高斯过程流程则没有;并且如第 29 章所述,理论分析的算法与实践中使用的流程至今仍不相同。
改变问题的形式。在图形学中,Koyama 等人(2017)另辟蹊径。他们的序列线搜索(sequential line search)把每次查询变成一个滑块:众包工作者沿设计空间中的一条直线拖动,停在自己最喜欢的点上(第 20.2 节)。这篇论文开启了人机交互领域的一类研究,其主要变量是查询的形式,而非选择查询的规则。
这一时期的问题。这几年的核心问题是如何向人提问。机器学习改进了选择比较的规则,人机交互则主要改变查询的形式,很少改动采集函数(推断)。图中 2019 年没有里程碑,但研究仍在继续,例如允许人回答“差不多”的工作(Bıyık 等,2019)(第 27.2 节)。
第 26.2 节引用的文献 7
- González 等人(2017)Preferential Bayesian Optimization
- Sui 等人(2017b)Multi-dueling Bandits with Dependent Arms
- Kumagai(2017)Regret Analysis for Continuous Dueling Bandit
- Sui 等人(2018b)Stagewise Safe Bayesian Optimization with Gaussian Processes
- Sui 等人(2018a)Advancements in Dueling Bandits
- Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
- Bıyık 等人(2019)Asking Easy Questions: A User-Friendly Approach to Active Reward Learning
26.3 2020 至 2021 年:工具与推断定型 #
默认实现。2020 年 4 月,BoTorch(Meta 基于 PyTorch 构建的开源贝叶斯优化库,第 14.8 节)在 0.2.3 版中加入了 PairwiseGP,即用于成对比较数据的模型(Meta Platforms, Inc.,2026e)。它实现的是概率单位链接加 Laplace 近似,此后这一组合一直是偏好贝叶斯优化中使用最广的实现。也就是说,从 2020 年起该领域有了事实标准,而这一标准正是 2005 年的模型(第 27.5 节)。
子空间中的查询。同年出现的一些方法把每次查询限制在低维子空间中,以处理更多维度:在投影偏好贝叶斯优化中,人沿空间中的一条直线选出最好的点(Mikkola 等,2020);序列画廊(Sequential Gallery)则以网格形式展示设计的一个二维平面(Koyama 等,2020)(第 20.3 节)。在机器人学中,CoSpar 根据穿戴者的偏好学习外骨骼的行走步态(Tucker 等,2020b),LineCoSpar 将其扩展到 6 个步态参数,并在 6 名身体健全的被试身上做了测试(Tucker 等,2020a)。这两篇论文开创了外骨骼应用这一研究方向:第 33.1 节追踪其进展,第 24 章以案例形式完整演示。
精确后验。2021 年,Benavoli 等人(2021c)证明,在概率单位偏好似然下,效用的精确后验是偏斜高斯过程(skew Gaussian process):它与高斯过程一样是函数上的分布,但其边际分布是偏斜的,而非对称的(第 17.6 节)。Laplace 近似这类高斯近似无法表示这种偏斜;自此,后验推断的质量成为争论的焦点(第 27.4 节)。
第一个核化界,以及一种替代方案。同样在 2021 年,Kirschner 与 Krause(2021)给出了核化(kernelized)对决反馈下的第一个累积遗憾界。核化是指假设未知效用在某个核函数所定义的意义下光滑,因此这一结果涵盖连续定义域(第 21.3 节);他们的反馈模型是效用差加噪声,而非偏好模型中的概率单位链接或逻辑链接。控制工程领域独立处理了同一问题:GLISp 将径向基函数代理模型(即若干凸起的加权和)拟合到观测到的偏好上,完全不使用概率模型(Bemporad 与 Piga,2021)(第 27.3 节)。
至 2021 年底,该领域已有一个标准实现,已知这一实现的推断存在弱点,连续定义域的理论也已起步。实际使用的采集函数则大多仍是启发式规则。
第 26.3 节引用的文献 8
- Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
- Mikkola 等人(2020)Projective Preferential Bayesian Optimization
- Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
- Tucker 等人(2020b)Preference-Based Learning for Exoskeleton Gait Optimization
- Tucker 等人(2020a)Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits
- Benavoli 等人(2021c)Preferential Bayesian optimisation with skew gaussian processes
- Kirschner 与 Krause(2021)Bias-Robust Bayesian Optimization via Dueling Bandits
- Bemporad 与 Piga(2021)Global optimization based on active preference learning with radial basis functions
26.4 2022 至 2023 年:决策论转向 #
EUBO。启发式规则让位于有原则的规则。在偏好探索贝叶斯优化(Bayesian optimization with preference exploration,BOPE)中,系统在实验进行的同时,通过比较学习人对实验结果的偏好。针对这一设定,Lin 等人(2022)提出了最优选项期望效用(expected utility of the best option,EUBO;第 19.4 节),并证明它一步贝叶斯最优(one-step Bayes optimal):若会话在再获得一个回答后即结束,任何其他查询都不能得到期望意义下更好的最终推荐(第 19.4.1 节)。Astudillo 等人(2023)将其推广为 qEUBO,用于一次展示多个选项的查询和带逻辑噪声的回答,并证明期望改进经改编的一种批量版本不具有渐近一致性。这就是决策论转向。qEUBO 成为 BoTorch 偏好采集函数的基础;BoTorch、Ax 与 optuna-dashboard 在数月之内即发布了这些新规则(第 31.1 节)。
推断质量的测量。Takeno 等人(2023)测量了 Laplace 近似与期望传播偏离精确偏斜后验的程度,并提出幻觉信念(hallucination believer):从后验中抽取潜在效用的一个样本,将其视为测得的数据,再套用任一标准采集函数(第 19.3 节)。这一方法后来成为 optuna-dashboard(Optuna 优化库的网页界面)中偏好采样器的基础(Optuna developers,2026b)。
人成为研究问题。与此同时,人机交互研究开始测量优化回路对其中的人有何影响。设计过程由多目标优化器主导时,新手设计者报告的能动感与归属感,低于由自己主导设计过程的新手;这项研究使用的是性能目标,而非比较(Chan 等,2022)(第 32.2 节)。在一次为期 3 个月的现场部署中,多数评分循环从未进入优化阶段,或没有收敛(Ou 等,2022)(第 31.7 节)。专家比新手迭代更多,最终却更不满意(Ou 等,2023)(第 32.6 节)。
相邻领域壮大。2023 年,直接偏好优化(DPO)将 Bradley-Terry 似然置于大语言模型与人类偏好对齐的核心。在这一似然下,一个选项胜过另一个选项的概率是二者效用差的逻辑函数(第 16.4 节)。DPO 直接用人的比较拟合语言模型,而不像基于人类反馈的强化学习(RLHF)那样借助奖励模型(Rafailov 等,2023)。同年,ICML 研讨会 The Many Facets of Preference-Based Learning 将对决赌博机、RLHF、社会选择与优化汇集在一起(ICML,2023)。第 35 章讨论这两个领域之间的往来。
第 26.4 节引用的文献 9
- Lin 等人(2022)Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes
- Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
- Takeno 等人(2023)Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes
- Optuna developers(2026b)optuna-dashboard 0.21.0
- Chan 等人(2022)Investigating Positive and Negative Qualities of Human-in-the-Loop Optimization for Designing Interaction Techniques
- Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures
- Ou 等人(2023)The Impact of Expertise in the Loop for Exploring Machine Rationality
- Rafailov 等人(2023)Direct Preference Optimization: Your Language Model is Secretly a Reward Model
- ICML(2023)The Many Facets of Preference-Based Learning
26.5 2024 至 2026 年:噪声、理论与审视 #
最近三年可分为两个阶段。2024 与 2025 年,理论、高维诊断、语言模型与正当性问题同时推进。2026 年,研究集中于默认流程的缺陷及其更简单的替代方案。
26.5.1 2024 与 2025 年:理论、维度、语言模型与正当性 #
Bradley-Terry 链接下的界。随着乐观算法 POP-BO(Xu 等,2024b)、最大最小下置信界算法(MaxMinLCB)(Pásztor 等,2024)与多轮偏好反馈学习算法(MR-LPF)的提出,Bradley-Terry 链接下有了核化遗憾上界,即保证累积遗憾的增长不快于给定速率的结果;其中 MR-LPF 的上界与标量反馈同阶(Kayal 等,2025)。上界同阶并不说明一次比较与一个数值携带同样多的信息,只说明两者的保证同阶。第 29.4 节列出了每个速率及其假设。
摊销优化器。偏好摊销黑箱优化(PABBO)预先在大量合成任务上训练神经网络,使其直接提出下一对选项;这样,一次查询只需一次前向传播,无需拟合模型、优化采集函数(Zhang 等,2025a)。它是唯一面向成对偏好的摊销优化器(第 27.3 节)。
高维问题的重新诊断。在以数值为观测的普通贝叶斯优化中,一系列论文将人们熟知的高维失效归因于先验与初始化,而非方法本身(Hvarfner 等,2024;Xu 等,2025b;Papenmeier 等,2025b)。补救办法是维度缩放先验(dimension-scaled prior):核函数长度尺度上的一种先验,其典型值随输入个数增大(第 9.5 节)。2024 年 9 月,BoTorch 0.12.0 将大多数模型改用这类先验,却明确排除了 PairwiseGP(Meta Platforms, Inc.,2026e);第 30.1 节考察这一缺口。
语言模型与正当性。大语言模型开始用于对话式偏好引出(Austin 等,2024a)与对齐数据的主动收集(Dwaracherla 等,2024)。人机交互研究则转向群体先验,即把早期用户的偏好迁移给新用户(Li 等,2025a),以及设计者与优化器之间以自然语言进行的协作(Niwa 等,2025)。对齐研究还将偏好优化同样面临的一种担忧加以形式化:从偏好中学习的系统,可能改变其所测量的偏好。Carroll 等人(2024)比较了面向可变偏好的八种对齐概念,发现每一种要么会奖励系统对人施加不当影响,要么过度规避风险;Williams 等人(2025)发现,基于用户反馈优化的学习器,会学会专门针对最易受影响的用户(第 40.3 节)。
26.5.2 2026 年:受到审视的默认流程 #
理论。偏好反馈下的 Thompson 采样(PF-TS)是完全序贯的算法,其上界为 阶(Lazzaro 等,2026);相比之下,MR-LPF 是带有有限候选集和预热期的分批算法,上界为 阶(Kayal 等,2025)。其中 是核函数的最大信息增益(maximum information gain),对光滑的核函数增长很慢(第 6.5 节)。
默认流程的缺陷。2026 年的两篇预印本考察了由 PairwiseGP、Laplace 近似与 EUBO 组成的流程:EUBO 的查询向估计的最优选项坍缩(Wu 与 Gardner,2026);它选出的成对选项与先前查询没有共同输入,致使 Laplace 似然的 Hessian 矩阵秩亏(Shao 等,2026)。第 19.6 节已介绍过这两点。观测模型扩展到了可能失败的实验(Menn 等,2026b);局部偏好贝叶斯优化(同为预印本)将该方法推进到约 100 维(Menn 等,2026a)(第 30.4 节)。
更简单的替代方案与人。在普通的高维贝叶斯优化中,对输入做球面映射、再结合贝叶斯线性回归的方法(第 5.4 节),在 60 至 6,000 维的任务上达到了最先进水平(Doumont 等,2026)。Ax 加入了偏好优化,以及由语言模型将自由文本反馈转换为比较的试验(Meta Platforms, Inc.,2026l;Kobalczyk 等,2026)(第 35.2 节)。2026 年采用强对照条件的人类研究,大多没有发现效应,或发现人手动调节的效果相差无几。用于交互设备原型制作的成本感知贝叶斯优化,以约 67% 的成本达到相同性能,最终质量没有差异(Langerak 等,2026)。在一项有 12 名被试、以性能为目标的研究中,从用户模型学到的先验只在第二、三次迭代时有帮助(Liao 等,2026)。11 名健康成年人用拇指杆遥控器自行调节外骨骼助力,在约 10.9 分钟内使代谢消耗降低 16.6%,与算法调节所报告的结果相当(Schäfer 等,2026)。由此,更简单的方法(包括人的手动调节)成为新方法必须与之比较的对照(第 32.8 节)。Benavoli 与 Azzimonti 的教程也已正式发表,内容是用高斯过程从偏好与选择中学习(Benavoli 与 Azzimonti,2026a);但该领域至今仍没有专门的综述(第 31.8.2 节)。
第 26.5 节引用的文献 26
- Xu 等人(2024b)Principled Preferential Bayesian Optimization
- Pásztor 等人(2024)Bandits with Preference Feedback: A Stackelberg Game Perspective
- Kayal 等人(2025)Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds
- Zhang 等人(2025a)PABBO: Preferential Amortized Black-Box Optimization
- Hvarfner 等人(2024)Vanilla Bayesian Optimization Performs Great in High Dimensions
- Xu 等人(2025b)Standard Gaussian Process is All You Need for High-Dimensional Bayesian Optimization
- Papenmeier 等人(2025b)Understanding High-Dimensional Bayesian Optimization
- Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
- Austin 等人(2024a)Bayesian Optimization with LLM-Based Acquisition Functions for Natural Language Preference Elicitation
- Dwaracherla 等人(2024)Efficient Exploration for LLMs
- Li 等人(2025a)Efficient Visual Appearance Optimization by Learning from Prior Preferences
- Niwa 等人(2025)Cooperative Design Optimization through Natural Language Interaction
- Carroll 等人(2024)AI Alignment with Changing and Influenceable Reward Functions
- Williams 等人(2025)On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback
- Lazzaro 等人(2026)A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback
- Wu 与 Gardner(2026)Knowledge Gradient for Preference Learning
- Shao 等人(2026)Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization
- Menn 等人(2026b)Preferential Bayesian Optimization with Crash Feedback
- Menn 等人(2026a)Local Preferential Bayesian Optimization
- Doumont 等人(2026)We Still Don't Understand High-Dimensional Bayesian Optimization
- Meta Platforms, Inc.(2026l)CHANGELOG (versions 1.2 to 1.3)
- Kobalczyk 等人(2026)LILO: Bayesian Optimization with Natural Language Feedback
- Langerak 等人(2026)Cost-Aware Bayesian Optimization for Prototyping Interactive Devices
- Liao 等人(2026)Efficient Human-in-the-Loop Optimization via Priors Learned from User Models
- Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
- Benavoli 与 Azzimonti(2026a)A tutorial on learning from preferences and choices with Gaussian Processes
26.6 核心问题如何转移 #
若把这十年看作一连串问题,其间经历了三次转向(推断)。
2017 至 2021 年,问题是:如何向人提问,又如何从回答中推断?对决表述、序列线搜索、画廊与投影、PairwiseGP 和偏斜高斯过程,都回答了这一问题的某个方面。
2022 至 2025 年,问题变为:采集函数是否有原则,是否有理论保证?EUBO 与 qEUBO 以一步贝叶斯最优性回答了前一半;POP-BO、MaxMinLCB 与 MR-LPF 以 Bradley-Terry 链接下的遗憾界回答了后一半。
2025 至 2026 年,问题同时变为四个:观测模型是否正确?人是否按模型假设的方式回答?更简单的方法是否已经足够?系统是否会改变它所测量的偏好?EUBO 的坍缩、秩亏的 Hessian 矩阵、强对照下未发现效应的研究、在高维中胜出的线性模型,以及对齐研究中关于影响的结果,都属于这一阶段。最后这次转向,就是从文献角度看到的本书主旨:瓶颈已经从算法转移到测量(第 45.1 节)。
各时期在 2025 年有所重叠:第二个问题尚在解答之中,第三个问题已经提出,因此图 26.1 在这一年同时标出两者。
2026 年的默认流程,即高斯过程先验加概率单位链接与 Laplace 近似,就是 2005 年的模型。十年间变化的是针对它提出的问题:先是如何提问,继而是查询的选择是否有原则、有保证,最后是描述人的模型究竟是否正确。
后续各章分别承接其中一条线索。第 27 章考察描述人如何回答的模型是否正确;第 28 章考察查询规则是否经得起检验;第 29 章梳理究竟证明了什么;第 30 章分析方法在何处失效、为何失效;第 31 章讨论软件默认做了什么、方法之间如何比较。第七部分讨论关于人的问题,第九部分则从根本上探讨偏好是什么。
26.7 发表与社区 #
2023 年以后研究数量有所增长,但基数很小。arXiv 上摘要同时包含 preferential、Bayesian 与 optimization(或 optimisation)的条目,2023 年有 4 篇,2024 年 5 篇,2025 年 13 篇,2026 年前 9 个月 12 篇(arXiv,2026b);这一计数会遗漏使用其他措辞(例如“dueling”或“human feedback”)的论文(推断)。这些研究分散于机器学习、控制、机器人学与人机交互的各类发表场所,各社区之间很少相互引用:2021 年发表于 Journal of Machine Learning Research 的对决赌博机综述,就没有引用 González 等人 2017 年的论文(Bengs 等,2021)。表 31.6 按学科列出了主要的研究组;证明遗憾界的研究组不做人类研究,做人类研究的研究组很少改动采集函数(推断)。更完整的叙述见第 31.8 节。
第 26.7 节引用的文献 2
- arXiv(2026b)Abstract search: preferential AND Bayesian AND (optimization OR optimisation)
- Bengs 等人(2021)Preference-based Online Learning with Dueling Bandits: A Survey
26.8 已定、有争议与缺失 #
已定。默认流程在这十年间没有改变:Chu 与 Ghahramani(2005)的高斯过程、概率单位与 Laplace 模型,自 2020 年 4 月起由 BoTorch 的 PairwiseGP 实现(Meta Platforms, Inc.,2026e)。回答无噪声时,EUBO 与 qEUBO 具有一步贝叶斯最优性(Lin 等,2022;Astudillo 等,2023)。从比较中学习的形式化保证,在对决赌博机一侧远早于 2024 年就已存在(Sui 等,2017b;Kumagai,2017);Bradley-Terry 链接下的核化界则始于 2024 年(Xu 等,2024b)。BoTorch 在 2024 年改用维度缩放先验时,明确排除了偏好模型(Meta Platforms, Inc.,2026e)。
有争议。2026 年报告的两项缺陷,即 EUBO 向当前最优点坍缩与 Hessian 矩阵秩亏,在人的任务上是否带来任何代价;两者都只有预印本为据(Wu 与 Gardner,2026;Shao 等,2026)。对照足够强时,偏好优化是否胜过更简单的替代方案:2026 年的受控人类研究发现优势不大或没有优势(Langerak 等,2026;Liao 等,2026;Schäfer 等,2026),而在标量反馈的高维问题中,线性模型达到了最先进水平(Doumont 等,2026)。
缺失。专门的偏好贝叶斯优化综述。社区之间的交流:2021 年 JMLR 上的对决赌博机综述没有引用为该领域命名的论文(Bengs 等,2021)。在相同界面与预算下把被试随机分配到不同采集函数的研究,以及以预注册终点指标与专家手动调节相比较的研究(第 47.4 节)。
第 26.8 节引用的文献 14
- Chu 与 Ghahramani(2005)Preference learning with Gaussian processes
- Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
- Lin 等人(2022)Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes
- Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
- Sui 等人(2017b)Multi-dueling Bandits with Dependent Arms
- Kumagai(2017)Regret Analysis for Continuous Dueling Bandit
- Xu 等人(2024b)Principled Preferential Bayesian Optimization
- Wu 与 Gardner(2026)Knowledge Gradient for Preference Learning
- Shao 等人(2026)Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization
- Langerak 等人(2026)Cost-Aware Bayesian Optimization for Prototyping Interactive Devices
- Liao 等人(2026)Efficient Human-in-the-Loop Optimization via Priors Learned from User Models
- Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
- Doumont 等人(2026)We Still Don't Understand High-Dimensional Bayesian Optimization
- Bengs 等人(2021)Preference-based Online Learning with Dueling Bandits: A Survey
延伸阅读 #
- González 等人(2017)为该领域命名;宜与 Chu 与 Ghahramani(2005)对照阅读,该领域后来采用的是后者的模型,而非对决表述。
- Sui 等人(2018a)与 Bengs 等人(2021)是两篇对决赌博机综述;合起来读,可以看出赌博机社区了解什么、没有引用什么。
- Lin 等人(2022)与 Astudillo 等人(2023)标志着决策论转向。
- Benavoli 与 Azzimonti(2026a)是论述偏好与选择的高斯过程模型最完整的一份文献。
- BoTorch 的更新日志(Meta Platforms, Inc.,2026e)逐版记录了实践者实际能够运行的内容,可作一部简明的历史来读。
参考文献
- (2026b). Abstract search: preferential AND Bayesian AND (optimization OR optimisation). arXiv API. 非同行评审引用于 §26.7
- (2023). qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization. International Conference on Artificial Intelligence and Statistics. 引用于 §26.4 §26.8
- (2024a). Bayesian Optimization with LLM-Based Acquisition Functions for Natural Language Preference Elicitation. RecSys 2024 (arXiv v2). 引用于 §26.5
- (2021). Global optimization based on active preference learning with radial basis functions. Machine Learning. 引用于 §26.3
- (2021). Preference-based Online Learning with Dueling Bandits: A Survey. Journal of Machine Learning Research. 引用于 §26.7 §26.8
- (2019). Asking Easy Questions: A User-Friendly Approach to Active Reward Learning. CoRL 2019. 引用于 §26.2
- (2007). Active Preference Learning with Discrete Choice Data. Advances in Neural Information Processing Systems. 引用于 §26.1
- (2024). AI Alignment with Changing and Influenceable Reward Functions. International Conference on Machine Learning. 引用于 §26.5
- (2022). Investigating Positive and Negative Qualities of Human-in-the-Loop Optimization for Designing Interaction Techniques. CHI 2022. 引用于 §26.4
- (2005). Preference learning with Gaussian processes. Proceedings of the 22nd international conference on Machine learning - ICML '05. 引用于 §26.1 §26.8
- (2026). We Still Don't Understand High-Dimensional Bayesian Optimization. AISTATS 2026 (best student paper). 引用于 §26.5 §26.8
- (2024). Efficient Exploration for LLMs. ICML 2024. 引用于 §26.5
- (2022). ax-platform 0.2.6. PyPI. 软件
- (2017). Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §26.2
- (2024). Vanilla Bayesian Optimization Performs Great in High Dimensions. International Conference on Machine Learning. 引用于 §26.5
- (2023). The Many Facets of Preference-Based Learning. ICML 2023 workshop page. 非同行评审引用于 §26.4
- (2025). Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds. International Conference on Machine Learning. 引用于 §26.5
- (2021). Bias-Robust Bayesian Optimization via Dueling Bandits. International Conference on Machine Learning. 引用于 §26.3
- (2026). LILO: Bayesian Optimization with Natural Language Feedback. ICML 2026. 引用于 §26.5
- (2017). Sequential line search for efficient visual design optimization by crowds. ACM Transactions on Graphics. 引用于 §26.2
- (2020). Sequential Gallery for Interactive Visual Design Optimization. ACM Transactions on Graphics 39(4) (SIGGRAPH 2020). 引用于 §26.3
- (2017). Regret Analysis for Continuous Dueling Bandit. Advances in Neural Information Processing Systems. 引用于 §26.2 §26.8
- (2026). Cost-Aware Bayesian Optimization for Prototyping Interactive Devices. CHI 2026. 引用于 §26.5 §26.8
- (2026). A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback. International Conference on Artificial Intelligence and Statistics. 引用于 §26.5
- (2025a). Efficient Visual Appearance Optimization by Learning from Prior Preferences. UIST 2025. 引用于 §26.5
- (2026). Efficient Human-in-the-Loop Optimization via Priors Learned from User Models. CHI 2026. 引用于 §26.5 §26.8
- (2022). Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes. International Conference on Artificial Intelligence and Statistics. 引用于 §26.4 §26.8
- (2026a). Local Preferential Bayesian Optimization. arXiv. 预印本引用于 §26.5
- (2026b). Preferential Bayesian Optimization with Crash Feedback. IEEE Robotics and Automation Letters. doi:10.1109/LRA.2026.3665446. 引用于 §26.5
- (2026e). BoTorch CHANGELOG. GitHub. 软件引用于 §26.3 §26.5 §26.8
- (2026l). CHANGELOG (versions 1.2 to 1.3). GitHub. 软件引用于 §26.5
- (2020). Projective Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §26.3
- (2025). Cooperative Design Optimization through Natural Language Interaction. UIST 2025. 引用于 §26.5
- (2026b). optuna-dashboard 0.21.0. PyPI. 软件引用于 §26.4
- (2022). The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures. Mensch und Computer 2022. 引用于 §26.4
- (2023). The Impact of Expertise in the Loop for Exploring Machine Rationality. IUI 2023. 引用于 §26.4
- (2025b). Understanding High-Dimensional Bayesian Optimization. ICML 2025, PMLR 267:47902-47923. 引用于 §26.5
- (2024). Bandits with Preference Feedback: A Stackelberg Game Perspective. Advances in Neural Information Processing Systems. doi:10.52202/079017-0383. 引用于 §26.5
- (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. 引用于 §26.4
- (2026). User preference-based human-in-the-loop tuning of exoskeleton assistance during walking. npj Biomedical Innovations. doi:10.1038/s44385-026-00085-7. 引用于 §26.5 §26.8
- (2026). Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization. arXiv. 预印本引用于 §26.5 §26.8
- (2017b). Multi-dueling Bandits with Dependent Arms. UAI 2017. 引用于 §26.2 §26.8
- (2018a). Advancements in Dueling Bandits. Proceedings of the Twenty-Seventh International Joint Conference on Artificial Intelligence. doi:10.24963/ijcai.2018/776. 引用于 §26.2
- (2018b). Stagewise Safe Bayesian Optimization with Gaussian Processes. International Conference on Machine Learning. 引用于 §26.2
- (2023). Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes. International Conference on Machine Learning. 引用于 §26.4
- (2020a). Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits. IROS 2020. 引用于 §26.3
- (2020b). Preference-Based Learning for Exoskeleton Gait Optimization. 2020 IEEE International Conference on Robotics and Automation (ICRA). 引用于 §26.3
- (2025). On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback. ICLR 2025. 引用于 §26.5
- (2026). Knowledge Gradient for Preference Learning. arXiv. 预印本引用于 §26.5 §26.8
- (2024b). Principled Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §26.5 §26.8
- (2025b). Standard Gaussian Process is All You Need for High-Dimensional Bayesian Optimization. ICLR 2025 (oral). 引用于 §26.5
- (2009). Interactively optimizing information retrieval systems as a dueling bandits problem. Proceedings of the 26th Annual International Conference on Machine Learning. 引用于 §26.1
- (2025a). PABBO: Preferential Amortized Black-Box Optimization. ICLR 2025. 引用于 §26.5