贝叶斯优化
第四部分:从比较中学习
EN

设计提问

第 19 章围绕一个问题构建了偏好贝叶斯优化:两个选项中,你更喜欢哪一个?模型选出两个选项,人以一比特作答,如此循环。提出这个问题本身就是一项设计决策,而且它并非唯一可用的问题。系统可以展示四个选项,要求选出最好的一个,或者要求排出顺序;可以给人一个滑块,让人以一个动作搜索整条直线上的设计;也可以允许人回答两个选项看起来差不多、自己不确定,或者实验失败了。

每一种选择都会同时改变三件事:回答需要人付出多少努力,能为模型提供多少信息,以及带有何种噪声。似然是给定效用时各回答出现概率的函数,它必须随之改变,因为似然描述的正是人如何使用某一特定界面。本章逐一讨论成对比较的主要替代形式及其似然,最后归结到决定本章结构的论点:界面是模型的一部分。

20.1 成对、集合与排序 #

成对比较是能够揭示偏好的最小问题,这既是其长处,也是其局限。它容易回答,但回答至多携带一比特信息;在多维设计空间中,一比特只是很小的一步。自然的扩展是一次展示更多选项。展示 qq 个选项并要求选出最好的一个,至多可携带 log⁡2q\log_2 q 比特;要求给出 qq 个选项的完整顺序,至多可携带 log⁡2q!\log_2 q! 比特,四个选项时约为 4.6 比特。这些都是上界,只有在各种回答事先等可能时才能达到(第 16.6 节),但它们表明了利害所在。

20.1.1 从集合中选一个 #

多选项选择的模型可以追溯到 Luce(1959)。设 SS 为展示的选项集合,gg 为潜在效用,则人选中 xi\vx_i 的概率为

P(xi chosen from S)=exp⁡ ⁣(g(xi)/τ)∑xj∈Sexp⁡ ⁣(g(xj)/τ),\Prob(\vx_i \text{ chosen from } S) = \frac{\exp\!\big(g(\vx_i)/\tau\big)}{\sum_{\vx_j \in S} \exp\!\big(g(\vx_j)/\tau\big)},
(20.1)

其中 τ>0\tau > 0 是逻辑链接的尺度(式(16.4)),常称为温度,决定选择的噪声大小:τ\tau 小时,人几乎总是选择最好的选项;τ\tau 大时,选择接近均匀分布。熟悉机器学习的读者会认出,右端就是 softmax 函数。只有两个选项时,它化为 1/(1+e−(g(x1)−g(x2))/τ)1/(1 + e^{-(g(\vx_1) - g(\vx_2))/\tau}),即第 16.4 节介绍的 Bradley-Terry 模型(Bradley 与 Terry,1952)的逻辑链接。

这一公式可以从随机效用的角度解读(第 16.5 节)。假设人感知每个选项的效用时都带有独立的 Gumbel 噪声(Gumbel 分布描述许多随机值中的最大值),并选择感知效用最高的选项,那么 xi\vx_i 胜出的概率恰好就是式(20.1)(McFadden,1974)。第 18 章的成对概率单位模型作同样的假设,只是噪声换成了高斯噪声。两个选项时,两种链接的形状只有细微差别;但对更大的集合,只有 Gumbel 版本有闭式解。

式(20.1)有一个对界面设计很重要的推论。它继承了由 Luce 选择公理导出的无关选项独立性(第 16.4 节):无论集合中还有哪些其他选项,选择 x1\vx_1 与选择 x2\vx_2 的概率之比都是 exp⁡ ⁣((g(x1)−g(x2))/τ)\exp\!\big((g(\vx_1) - g(\vx_2))/\tau\big)。真实的选择有时违反这一性质,例如诱饵效应(又称吸引效应)(Huber 等,1982)。成对比较中没有第三个选项,不会出现这种效应;四个选项的集合则可能出现。这种效应主要出现在选项的各项属性以数字呈现时,属性由直接感知获得时通常不会出现(Frederick 等,2014)。这一点对视觉设计而言令人放心,但并不构成保证(推断)。第 37.2 节回顾了相关证据。

以式(20.1)为似然,其余机制保持不变。第 18.2 节的 Laplace 近似需要对数似然的梯度和曲率。设一次选择在 SS 中各选项上的概率为 pjp_j,则关于 g(xj)g(\vx_j) 的梯度为 (1[j=i]−pj)/τ(\mathbb{1}[j = i] - p_j)/\tau,其中 1[j=i]\mathbb{1}[j = i] 对被选中的选项取 1,否则取 0;在这些选项上,负 Hessian 矩阵为 (diag⁡(p)−pp⊤)/τ2(\operatorname{diag}(\mathbf{p}) - \mathbf{p}\mathbf{p}^\T)/\tau^2,即按概率 p\mathbf{p} 抽取的独热向量的协方差矩阵。该矩阵半正定,满足 Laplace 近似的要求;两个选项时,它就是熟悉的成对项。

20.1.2 更大的集合有帮助吗?#

关于更大集合的证据指向两个方向。Siivola 等人(2021)为两个及以上点上的任意并行反馈推导了似然,并论证批次赢家(batch winner),即集合中的最优选项,是最有用的反馈形式,因为对大批次做完整排序对人而言很费力,有时甚至无法做到,A/B 测试即是如此。他们在六个基准函数上以每批四个点做实验,发现采集函数之间的差异大于反馈类型之间的差异;批量大小在 2 至 6 之间变化时,也没有观察到明显差别。他们的实验至多为四维。qEUBO 的实验(第 19.4 节)采用为集合设计的采集函数,结论恰好相反:达到给定的简单遗憾(最优效用与推荐选项效用之差,第 13.1 节),四选项查询所需的查询次数少于成对查询,而从四个增加到六个带来的额外收益较小,也不够稳定;作者也指出了这与 Siivola 等人结果的反差(Astudillo 等,2023)。分歧可能源于采集函数或噪声水平的不同,但尚无论文将这些因素分离开来(推断)。

关于有限选项集的理论给出了更明确的答案,而答案取决于人报告了什么。考虑下文介绍的 Plackett-Luce 模型和有限选项集。找到近似最优选项的样本复杂度(sample complexity),是指以高概率找到这样一个选项所需的查询次数。从每个 kk 选项集合的赢家中学习,其样本复杂度与从成对比较中学习相同(至多相差常数因子),不随 kk 改善。若改为报告每个集合中的前 mm 名,样本复杂度降为原来的 mm 分之一(Saha 与 Gopalan,2019b)。只有当人报告的不止是哪个选项获胜时,更大的集合才有帮助。对线性效用,2025 年的一项结果证明,在 Plackett-Luce 模型下更大的子集确实有帮助(Lee 等,2025a);截至 2026 年 9 月,这一结果尚未推广到本书的高斯过程模型。第 21 章将再次讨论这些结果。

20.1.3 排序 #

排序可以看作一连串的选择:先选出集合中最好的选项,再从剩余选项中选出最好的,依此类推。在选择公理下,此后的每次选择仍服从剩余选项上的式(20.1)。由此即得整个排序的概率。

推导把排序看作一连串的选择

设 π\pi 将展示的 qq 个选项从最好到最差排列,xπ(1)\vx_{\pi(1)} 排在第一位。

  1. 由概率的链式法则(第 2.4 节),排序的概率等于第一名的概率乘以给定第一名时第二名的概率,依此类推,即对名次 r=1,…,qr = 1, \dots, q 求积,每个因子是给定此前各名次时 xπ(r)\vx_{\pi(r)} 位居第 rr 名的概率。
  2. 给定前 r−1r - 1 个名次,第 rr 名就是从尚未排定的选项 Sr={xπ(r),…,xπ(q)}S_r = \{\vx_{\pi(r)}, \dots, \vx_{\pi(q)}\} 中选出最好的一个。
  3. 依照 Luce 选择公理的思想,假设已排定的选项不影响这次选择,则这次选择服从集合为 SrS_r 的式(20.1)。
  4. 代入即得式(20.2)。最后一个因子(r=qr = q)对应从单元素集合中做选择,等于 1。
P(π)=∏r=1qexp⁡ ⁣(g(xπ(r))/τ)∑s=rqexp⁡ ⁣(g(xπ(s))/τ).\Prob(\pi) = \prod_{r=1}^{q} \frac{\exp\!\big(g(\vx_{\pi(r)})/\tau\big)}{\sum_{s=r}^{q} \exp\!\big(g(\vx_{\pi(s)})/\tau\big)}.
(20.2)

这就是 Plackett-Luce 模型(Plackett,1975;Luce,1959)。在 top-kk 排序中,人只给最好的 kk 个选项排序,只需保留前 kk 个因子。Gumbel 解读在这里同样成立:若每个选项的感知效用都带有独立的 Gumbel 噪声,而人按感知效用排序,则排序服从式(20.2)。

Nguyen 等人(2021)受多项 logit 模型及其排序扩展的启发,构建了一个高斯过程代理模型,可以看作带独立 Gumbel 噪声的高斯过程回归。该模型能处理 top-kk 排序和平局,用变分推断训练,并在合成函数、CIFAR-10 和 SUSHI 偏好数据上做了评估。Benavoli 与 Azzimonti(2026a)的教程将其称为 Plackett-Luce 模型的高斯过程推广。Benavoli 等人(2023)更进一步,让人选择一个子集(例如在 A 至 E 五个选项中,可接受的是 A、B 和 C),用多个潜在效用为这种选择建模,并根据模型对留出选择的预测效果确定潜在效用的个数(交叉验证,第 22.1.2 节);其摘要只报告了模拟结果。截至 2026 年 9 月,我们没有找到更新的、采用 Plackett-Luce 或多项排序似然的高斯过程偏好贝叶斯优化论文。

要点每次展示更多选项,只有回答包含更多信息时才有帮助

展示更多选项可以提高单个回答所能携带的信息量,但前提是人报告的不只是赢家。四个选项而只报告赢家,最坏情况下并不优于成对比较;对同样四个选项排序则可以更好。

第 20.1 节引用的文献 13
  1. Luce(1959)Individual Choice Behavior: A Theoretical Analysis
  2. Bradley 与 Terry(1952)Rank Analysis of Incomplete Block Designs: I. The Method of Paired Comparisons
  3. McFadden(1974)Conditional Logit Analysis of Qualitative Choice Behavior
  4. Huber 等人(1982)Adding Asymmetrically Dominated Alternatives: Violations of Regularity and the Similarity Hypothesis
  5. Frederick 等人(2014)The Limits of Attraction
  6. Siivola 等人(2021)Preferential Batch Bayesian Optimization
  7. Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
  8. Saha 与 Gopalan(2019b)PAC Battling Bandits in the Plackett-Luce Model
  9. Lee 等人(2025a)Preference-based Reinforcement Learning beyond Pairwise Comparisons: Benefits of Multiple Options
  10. Plackett(1975)The Analysis of Permutations
  11. Nguyen 等人(2021)Top-$k$ Ranking Bayesian Optimization
  12. Benavoli 与 Azzimonti(2026a)A tutorial on learning from preferences and choices with Gaussian Processes
  13. Benavoli 等人(2023)Learning Choice Functions with Gaussian Processes

集合与排序比较的仍是系统选出的选项。设计空间有六个或十个参数时,系统给出的几个选项只是稀疏的样本。人对怎样的设计更好看自有判断,但这些判断大多没有得到利用。另一个极端是把每个参数都交给人调节,这同样行不通:即使对设计师而言,直接探索高维空间也很困难(Koyama 与 Igarashi,2018);绝对评分则会因第 16.1.1 节所述的原因失效,因为评分要求对整个设计空间相当熟悉,而新手并不具备这种熟悉程度。

Koyama 等人(2017)找到了一种折中办法:只给人一个滑块。滑块对应设计空间中的一条线段,预览随拖动实时更新,人在设计看起来最好的位置停下。一个回答就是人在一段连续设计上完成的一次一维优化,无需熟悉各个参数。这种方法称为序列线搜索(sequential line search)。

20.2.1 选哪条直线 #

线段由系统选择。得到 tt 个回答后,根据效用的高斯过程后验,令 xt+\vx^+_t 为后验均值最高的已观测设计,xtEI⁡\vx^{\EI}_t 为期望改进最大的设计(第 12.3 节)。下一个滑块连接二者:

St+1={(1−s) xt++s xtEI⁡  :  s∈[0,1]}.S_{t+1} = \big\{ (1 - s)\,\vx^+_t + s\,\vx^{\EI}_t \;:\; s \in [0, 1] \big\}.
(20.3)

一端是目前最好的设计,因此人总可以保留它;另一端是最值得探查的位置。这样,滑块恰好跨越了每个采集函数都要权衡的利用与探索。尚无数据时,第一个滑块连接两个随机点(Koyama 与 Igarashi,2018)。

回答是线段上被选中的点 xt+1c\vx^{\text{c}}_{t+1}。Koyama 等人将其记录为从三个选项中做出的一次选择:被选中的设计胜过两端,即 xc≻{x+,xEI⁡}\vx^{\text{c}} \succ \{\vx^+, \vx^{\EI}\},并在这三个设计上使用式(20.1)的似然(Koyama 等,2020)。这种记录方式丢弃了信息。人偏好被选中的点胜过滑块上的其他每一个点,而不只是胜过两端,这相当于连续统上的比较。作者指出,可以在落败一方加入更多的点,但要付出额外的计算代价。Mikkola 等人(2020)则直接对这个连续统建模:他们把回答视为不可数无穷多次成对比较,将其似然写成对直线不断细分后所得乘积的极限,再用有限个抽样比较来近似。

20.2.2 试一试 #

下图运行算法 20.1,由你操作滑块。设计对象是一幅小型海报风景画,有暖度和鲜艳度两个参数。移动滑块或沿缩略图条拖动,直到画面在你看来最好,然后按“就选这个”。右侧地图显示模型在这两个参数上的后验均值(颜色越深越好)、用过的滑块、选中的设计,以及以橙色标出的下一个滑块,它从目前最好的设计(圆圈)延伸到期望改进最高的点(菱形)。

可以尝试以下几点。如实回答五六个滑块,观察地图上的滑块:随着模型对你最喜欢的区域越来越确定,滑块逐渐变短并聚集;当别处的不确定性使期望改进变大时,远端会跳到新的区域。不移动滑块而直接选择一端,记录就变成一次普通的成对比较,即最好的设计对期望改进设计。在模拟模式下,打开“显示模拟用户的最爱”,再按几次“模拟五次”:在默认噪声下,到第十个滑块时,星形通常已接近隐藏的最爱。将噪声调到 0.2,被选中的点会沿每个滑块分散开;模型假设 τ\tau 固定,因而把这种分散解读为微弱的偏好,收敛也更慢。

地图使这一方法显得很容易,因为在二维中,十几条直线就已靠近空间的大部分区域。但该方法针对的是更高的维度。在六维中,例如照片任务,十几条直线只靠近空间的一小部分,因此关键在于直线的选择:一端把搜索锚定在目前最好的设计上,期望改进则把另一端指向最可能找到更好设计的区域。下文在 5 至 20 维中运行的序列画廊(Sequential Gallery)模拟表明,在这样的维度下子空间的选择有多么重要。

20.2.3 众包实验 #

序列线搜索是为众包设计的:众多有偿工作者各自完成一个小任务(微任务(microtask)),系统再汇总他们的回答。Koyama 与 Igarashi(2018)详细描述了这一流程。每个结果都用了 15 次迭代。每次迭代中,系统发布七个滑块微任务,收到至少五个回答后即进入下一步,以返回的滑块位置的中位数作为选择。每个微任务的报酬为 0.05 美元,因此一个结果花费 5.25 美元;照片示例平均用时约 68 分钟。

在有六个参数的照片色彩增强任务中,研究者随后请众包工作者判断每张照片的四个版本中哪个最好看:原图、众包优化的结果,以及 Adobe Photoshop 和 Lightroom 的自动增强结果。三张照片上,众包优化的版本分别得到 32、26 和 29 票,其他各版本得到 0 至 3 票。从不同初始条件出发的三次运行得到了相似的增强结果,彼此之间的差异在最初四五次迭代内迅速缩小(Koyama 与 Igarashi,2018)。第 25 章分别用成对比较和滑块,完整求解了一个同类的照片增强问题。

这一设置有两个特点,将在本章后文反复出现。其一,对众多工作者取平均,用作者的话说,就是假设“存在一种为众人所共有的共同‘一般’偏好”(第 20.5 节)。其二,滑块回答有其特有的噪声:人能把滑块放得多准、能把相邻设计的差别分辨得多细,这些是人和控件的属性,而非效用的属性。研究滑块与投影查询的论文把这种噪声与其他所有噪声合并为同一个噪声项(推断)。

第 20.2 节引用的文献 4
  1. Koyama 与 Igarashi(2018)Computational Design with Crowds
  2. Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
  3. Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
  4. Mikkola 等人(2020)Projective Preferential Bayesian Optimization

直线只是让人在子空间中搜索的方式之一。另有两种设计推广了这一思路:以网格形式展示的设计平面,以及沿系统所选任意方向的投影。

Koyama 等人(2020)用二维平面代替滑块,用可缩放网格(zoomable grid)代替预览:从平面中采样的设计组成画廊,照片任务中为 5 × 5。人点击最好的设计,网格便以该设计为中心放大两倍;点击固定次数后(他们的实现中为四次),最终的选择即为回答。这种方法称为序列平面搜索,整个交互框架称为序列画廊。

平面的选择方式与直线类似:以当前最好的设计 x+\vx^+ 为中心,以期望改进点为一个顶点,其余摆放方式则以最大化一个新的采集函数为准,即平面上的平均期望改进,该量在 5 × 5 点阵上近似计算。回答记录为在五个代表点上的一次选择:被选中的设计胜过中心和四个顶点。

模拟中每种方法各做 50 次试验。在 5 至 20 维的测试函数上,平面搜索在每个函数、每个迭代次数下都优于线搜索;基于采集函数选取的平面在最初几次迭代之后优于随机平面。一项初步研究有五名学生和一名研究人员参与(一名被试自认为专家,其余五名自认为新手),用该方法增强照片:被试平均在 5.36 次迭代后(标准差 2.69)按下按钮表示满意,一个平面子任务平均用时 14.8 秒。对“我能从网格视图中获得关于可能增强方式的灵感”这一陈述,七点量表上的平均得分为 6.50(标准差 0.548)。作者自己列出了局限:网格只适用于一眼即可辨认的设计,无法处理离散参数,而且已知贝叶斯优化在超过约 20 维时表现很差(Koyama 等,2020)。

20.3.2 投影偏好查询 #

Mikkola 等人(2020)要求人给出沿某一投影(projection)的最佳位置。一次查询由方向 ξ\boldsymbol{\xi} 和参考设计 x\vx 组成;人报告使设计 αξ+x\alpha\boldsymbol{\xi} + \vx 最好的标量 α\alpha,ξ\boldsymbol{\xi} 中为零的坐标保持 x\vx 中的取值。当 ξ\boldsymbol{\xi} 是坐标方向时,查询就是“把这一个旋钮调到最佳值”。在他们的用户实验中,材料科学家每次设定一个坐标,以确定分子在表面上方的位置和朝向。

他们的似然是滑块记录的连续统版本:假设 Thurstone 式的高斯噪声,并将其建模为沿投影的白噪声过程;把报告点胜过投影上其他每一点的概率写成乘积积分,再在 Laplace 近似中用抽样得到的伪比较近似这一积分。以 100 次查询为预算,在 2、6、10 和 20 维的四个测试函数上,一种偏好坐标下降策略在其中三个函数上表现最好,期望改进的投影版本在 20 维函数上表现最好,所有投影变体都明显优于所有成对变体。为说明成对比较携带的信息之少,他们在二维 six-hump camel 函数上用 2,000 次随机对决训练了 González 等人(2017)的对决模型(第 19.2 节)。该模型找到的点的函数值为 0.1052,而全局最小值为 −1.0316;优化其软 Copeland 得分耗时 41 分钟。相比之下,使用随机查询的投影版本在最初几次查询内就达到了这一精度。

该文还提出了两点值得在本章提及的告诫。其一,方向的非零坐标越多,“给人类用户带来的‘认知负担’就越大”,因此对人而言最好的查询,并不是对完美预言机而言最好的查询。其二,人可能根本无法说出沿某个方向的最佳值;作者建议允许“我不知道”这样的回答,并将其留待未来研究(Mikkola 等,2020)。

20.3.3 供算法而非供人使用的直线 #

直线也可以用来约束算法,而不是约束人。用于外骨骼步态调节的 LineCoSpar 在每次迭代中,取一条经过后验均值最高设计的随机直线,在该直线和已访问过的设计上运行 Thompson 采样(第 12.5 节);人仍对步态做成对比较。该方法在六名健全被试调节六个步态参数的实验中得到测试。提出它的原因是,在六维空间上运行该研究组较早的方法 CoSpar(Tucker 等,2020b)不可行(Tucker 等,2020a)。其思路与第 20.2 节相同,即选取一个有希望的一维子空间,只是用于计算而非交互。第 30 章将进一步讨论这类子空间方法。

表 20.1 汇总了以上各种形式。比特一列是可能回答个数的对数,带噪声的回答永远达不到这一上限;该列反映的是各种形式所能携带信息的差异,而非实际携带的信息量。

表 20.1 各种查询形式:人的操作、回答进入似然的方式,以及回答至多能携带的信息量。
形式 人的操作 记录为 至多 示例
成对 二选一 x≻x′\vx \succ \vx' 1 比特 Brochu 等人(2007);第 19 章
qq 选最优 从 qq 个中选一个 式(20.1) log⁡2q\log_2 q 比特 Siivola 等人(2021);Astudillo 等人(2023)
qq 中的 top-kk 给最好的 kk 个排序 式(20.2)的前 kk 个因子 log⁡2q!(q−k)!\log_2 \frac{q!}{(q-k)!} 比特 Nguyen 等人(2021)
滑块 拖到线段上的最佳点 选中点胜过两端,或连续统上的比较 滑块分辨率的 log⁡2\log_2 Koyama 等人(2017)
画廊 在 5 × 5 网格中点击最好的,共四次 选中点胜过中心与各顶点 4log⁡2254 \log_2 25 比特 Koyama 等人(2020)
投影 把一个方向调到最佳值 连续统上的比较 受分辨率限制 Mikkola 等人(2020)
带“差不多” 选 a、b 或都不选 式(20.4) log⁡23\log_2 3 比特 Bıyık 等人(2019)
分级 从“明显是 a”到“明显是 b”的 RR 个有序等级中选一个 式(20.6) log⁡2R\log_2 R 比特 Li 等人(2021);Wu 等人(2025a)

20.3.4 关于查询形式的证据 #

综观各篇论文,证据有一致的方向,也有一致的空白。能让人的一个动作携带更多信息的形式(投影、平面、四选项查询),在提出它们的论文中都胜过了成对比较;而批次赢家与完整排序之间唯一的直接比较发现,两者差别很小(Siivola 等,2021)。但几乎所有比较都是模拟,且每篇论文各用自己的采集函数、预算和模拟噪声。直到 2026 年,才出现首批在同一任务上以真人做的比较。在 GimmBO 中,12 名被试(均有计算机科学或机器学习背景)每人完成 20 次迭代,排序在图像相似度和成功率上胜过滑块;滑块和画廊两种基线最终都开启了多余的适配器,即生成目标图像的那组适配器之外的适配器(适配器是附加在图像模型上的小型微调模块,任务是调节合并各适配器时的权重);序列画廊的用户报告会陷入局部极小值。排序每步用时更长,为 50.5 秒,滑块为 34.7 秒,画廊为 10.6 秒(Liu 等,2026b)。截至 2026 年 9 月,我们没有找到以真人为对象、在相同采集函数和预算下比较成对、批次赢家、排序与滑块的对照研究;除本章介绍的改造后的期望改进和随机子空间外,也没有找到专为滑块、平面或投影查询推导的采集函数。人因方面的证据详见第 32.4 节。

第 20.3 节引用的文献 14
  1. Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
  2. Mikkola 等人(2020)Projective Preferential Bayesian Optimization
  3. González 等人(2017)Preferential Bayesian Optimization
  4. Tucker 等人(2020b)Preference-Based Learning for Exoskeleton Gait Optimization
  5. Tucker 等人(2020a)Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits
  6. Brochu 等人(2007)Active Preference Learning with Discrete Choice Data
  7. Siivola 等人(2021)Preferential Batch Bayesian Optimization
  8. Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
  9. Nguyen 等人(2021)Top-$k$ Ranking Bayesian Optimization
  10. Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
  11. Bıyık 等人(2019)Asking Easy Questions: A User-Friendly Approach to Active Reward Learning
  12. Li 等人(2021)ROIAL: Region of Interest Active Learning for Characterizing Exoskeleton Gait Preference Landscapes
  13. Wu 等人(2025a)Mixed Likelihood Variational Gaussian Processes
  14. Liu 等人(2026b)GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization

20.4 平局、无差异与把握度 #

迄今的每个模型都强制要求作答。人看到两个在自己看来一样的设计,仍必须选一个,这时的选择近似于抛硬币。模型无法区分抛硬币与微弱的偏好,于是把抛硬币的结果解读为某个选项略好的证据。本节考察比“a”或“b”包含更多内容的回答:差不多、不确定、有多确定,以及实验失败。

20.4.1 差不多 #

最简单的扩展是给人第三个按钮。为此建模时,从 Thurstone 的图景出发(第 16.3 节):人感知效用差 Δ=g(xa)−g(xb)\Delta = g(\vx_a) - g(\vx_b) 时带有标准差为 ss 的高斯噪声。再引入无差异阈值(indifference threshold)δ≥0\delta \ge 0,即心理物理学意义上的最小可觉差(第 16.2 节):小于 δ\delta 的差异不报告为偏好。三种回答的概率于是为

P(a)=Φ ⁣(Δ−δs),P(b)=Φ ⁣(−Δ−δs),P(same)=1−P(a)−P(b).\begin{aligned} \Prob(a) &= \Phi\!\left(\frac{\Delta - \delta}{s}\right), \\ \Prob(b) &= \Phi\!\left(\frac{-\Delta - \delta}{s}\right), \\ \Prob(\text{same}) &= 1 - \Prob(a) - \Prob(b). \end{aligned}
(20.4)

当 δ=0\delta = 0 时,中间的回答永远不会出现,模型退化为第 18 章的成对概率单位模型。Benavoli 与 Azzimonti(2026a)的教程所列的九种模型中就有这样一种最小可觉差似然,以形如 ∣g(x)−g(x′)∣/δ≤1\lvert g(\vx) - g(\vx')\rvert / \delta \le 1 的不可区分陈述表达,并将这一思想追溯到 Luce 于 1956 年提出的辨别阈限概念。Erarslan 等人(2025)在扩展的 Thurstone 模型中使用了这种阈值,并报告当 10% 至 20% 的比较为无差异时收益明显;这是一篇 2025 年的预印本。

逻辑版本出自 Bıyık 等人(2019)。他们在主动奖励学习中加入“大致相等”(About Equal)选项,并设定最小可感知差异 δ≥0\delta \ge 0:

P(a)=11+exp⁡(δ−Δ),P(b)=11+exp⁡(δ+Δ),P(same)=(e2δ−1) P(a) P(b).\begin{aligned} \Prob(a) &= \frac{1}{1 + \exp(\delta - \Delta)}, \\ \Prob(b) &= \frac{1}{1 + \exp(\delta + \Delta)}, \\ \Prob(\text{same}) &= \big(e^{2\delta} - 1\big)\,\Prob(a)\,\Prob(b). \end{aligned}
(20.5)

当 δ=0\delta = 0 时,该模型化为 Bradley-Terry 模型。他们的奖励是轨迹特征的线性函数,而非高斯过程;在他们的模拟中,弱偏好查询始终减少了错误回答的数量。目前使用的两种处理方式,即在 Thurstone 模型或逻辑模型中设置阈值,以及像 Nguyen 等人(2021)那样在多项 logit 模型中处理平局,是这一领域已经定型的做法(推断)。

第三个按钮有多大价值?信息论可以给出清晰的回答(第 6.3 节)。设同一个人面对两种界面,其回答服从式(20.4)。有三个按钮时,他如实报告自己的感知。只有两个按钮时,他感知到偏好就报告“a”或“b”,感知不到偏好就抛硬币。

推导强制选择携带的信息不会更多

设 Δ\Delta 为未知的效用差,YY 为三按钮回答,ZZ 为两按钮回答。

  1. ZZ 仅由 YY 决定:YY 为“a”或“b”时 Z=YZ = Y;YY 为“差不多”时,ZZ 是一枚均匀硬币的结果,而硬币与 Δ\Delta 无关。
  2. 因此 Δ→Y→Z\Delta \to Y \to Z 构成一条链,ZZ 只通过 YY 依赖于 Δ\Delta。
  3. 按照数据处理不等式(data-processing inequality),对观测的处理只可能损失关于其成因的信息:对这样的链,I(Δ;Z)≤I(Δ;Y)I(\Delta; Z) \le I(\Delta; Y),其中 II 为互信息(参见 Cover 与 Thomas,2006,第 2 章)。
  4. 该不等式通常严格成立,因为“差不多”本身携带信息(∣Δ∣\lvert\Delta\rvert 很可能很小),而抛硬币抹去了这一信息。

下图显示损失的大小。上方面板绘出式(20.4)中三种回答的概率随效用差的变化,虚线为强制选择下回答“a”的概率。设模型当前对 Δ\Delta 的信念是均值为 mm、离散程度给定的高斯分布,下方面板绘出每种界面下一个回答所携带的关于 Δ\Delta 的比特数。

P(回答 a)P(回答 b)P(回答差不多)强制选择时的 P(a)模型关于 Δ 的信念0.00.20.40.60.81.0概率−4−2024效用差 Δ = g(a) − g(b),以噪声为单位无差异带0.00.51.01.5每个回答的比特数−3−2−10123模型对 Δ 的最佳猜测 m1 比特三种回答强制选择在 m = 0.0 处:三种回答携带 0.59 比特,强制选择携带 0.34 比特(为前者的 58%)。
P(回答 a)P(回答 b)P(回答差不多)强制选择时的 P(a)模型关于 Δ 的信念0.00.20.40.60.81.0概率−4−2024Δ,以噪声为单位无差异带0.00.51.01.5每个回答的比特数−202模型对 Δ 的最佳猜测 m1 比特三种回答强制选择在 m = 0.0 处:三种回答携带 0.59 比特,强制选择携带 0.34 比特(为前者的 58%)。
图 20.2 在式(20.4)的阈值模型下(比较噪声取单位值),“差不多”这一回答的价值。上:各回答的概率随效用差 Δ 的变化,阴影为无差异带;虚线是同一个人不能回答“差不多”、只能抛硬币时回答 a 的概率。灰色凸起是模型关于 Δ 的信念。下:两种界面下单个回答与 Δ 之间的互信息(单位为比特);阴影部分的差距就是抛硬币所损失的信息。这些数值仅作示意,取决于所假设的噪声与阈值。

可以尝试以下几点。将阈值设为零:下方面板中的两条曲线重合,因为没有人会无差异。在模型的猜测为 m=0m = 0(两个选项十分接近)时,将阈值调到 1.5:强制选择只保留了三按钮回答所携带信息的约三分之一。将 mm 移到 3,即模型已认为优劣悬殊的一对:两种界面携带的信息都少于 m=0m = 0 时(三个按钮时为 0.33 比特对 0.57 比特,两个按钮时为 0.14 比特对 0.19 比特),因为回答更容易预测。缩小关于 Δ\Delta 的不确定性:两种界面的比特数都趋向零,这正是采集函数避免询问模型已有把握的对的原因。

解读这幅图时需注意两点。其一,若模型没有“差不多”这一结果,用它拟合一个常常无差异的人的强制选择数据,模型会把抛硬币解读为噪声:噪声水平若参与拟合,就会增大;若固定不变,估计的效用差会缩小,整个估计趋于平坦(推断)。其二,第三个按钮不仅记录行为,还可能改变行为:人们可能为了回避费力的判断而按下它,阈值模型并未描述这种可能(推断)。

20.4.2 不确定,以及有多确定 #

“差不多”表示差异很小。“我不知道”的含义不同:回答者无法判断,原因可能是选项之间的差异方式使人无从权衡。Mikkola 等人提出了这种回答,并将其留待未来研究(第 20.3.2 节);IUI 2023 上的一项研究让被试对四个候选排序,同时把无法判断的候选放入单独的“不知道”区域,以表达不完备偏好(Ou 等,2023)。截至 2026 年 9 月,我们没有找到任何高斯过程偏好贝叶斯优化论文在模型中设置有别于平局的弃权或跳过结果。

把握度评分则相反,提供了更多信息。“明显是 a”“略偏 a”这类分级回答属于序数回答,阈值模型可以直接推广到这种情形:在感知差异上设置切点 c0=−∞<c1<⋯<cR−1<cR=∞c_0 = -\infty < c_1 < \dots < c_{R-1} < c_R = \infty,当感知差异落在 cr−1c_{r-1} 与 crc_r 之间时报告等级 rr,

P(level r)=Φ ⁣(cr−Δs)−Φ ⁣(cr−1−Δs).\Prob(\text{level } r) = \Phi\!\left(\frac{c_r - \Delta}{s}\right) - \Phi\!\left(\frac{c_{r-1} - \Delta}{s}\right).
(20.6)

式(20.4)就是切点为 −δ-\delta 和 δ\delta 的三等级情形。模型还可以引入失误率(lapse rate)λlapse\lambda_{\text{lapse}},即回答为随机失误的概率,此时每个等级的概率为 λlapse/R+(1−λlapse)\lambda_{\text{lapse}}/R + (1 - \lambda_{\text{lapse}}) 乘以上式;这样,一次粗心的点击便不会把后验拖得太远。

以下三项研究展示了已有工作的范围。ROIAL 在外骨骼步态调节中将成对偏好与序数标签(很差、差、中性、好)结合起来,并论证 rr 级序数查询至多产生 log⁡2r\log_2 r 比特,而一次偏好只有一比特;该方法在 3 名被试调节 4 个步态参数的实验中得到测试(Li 等,2021)。预印本 Wu 等人(2025a)将概率单位偏好似然与 Likert 把握度似然(Likert 题项是在一组固定的带标签等级上所做的评分)结合,切点和失误率均可学习;在人对机器人步态的比较上,他们报告 Brier 分数始终更低、F1 分数始终更高,这是两种预测准确度的度量。在一项关于振动触觉反馈的研究中,13 名被试完成了 40 轮成对比较,每次附带一个五级把握度评分,用于设定该次比较的噪声尺度;学到的模型在留出数据上的准确率达到 92.3%(范围为 85% 至 100%)(Zhang 等,2026b)。反应时无需额外提问也能携带类似的信息,这一点与其余扩展一并在第 27.2 节中讨论。

20.4.3 崩溃了 #

有些评估根本得不到可供判断的设计:控制器让机器人摔倒,模拟发散,食谱做出来无法入口。把这类结果强行纳入比较(“崩溃比什么都差”),就把它放到了本不属于它的效用尺度上。现有的扩展改为把它作为第二种结果处理。针对有时无法产生输出的实验,Benavoli 等人(2021c)在偏好之外为每次评估附加有效或无效的标签;C-GLISp 根据对单个设计逐一做出的判断,学习设计可行且令人满意的概率(Zhu 等,2022);CrashPBO 把崩溃报告作为第二种结果,在合成基准上使崩溃减少 63%,并在三个机器人平台上得到验证(Menn 等,2026b)。这些方法的共同模式是两个并列的模型:一个描述可正常工作的设计的效用,一个描述设计能正常工作的概率,二者在采集函数中结合,与约束贝叶斯优化结合目标函数和可行性模型的方式十分相似(第 14.4 节)。

第 20.4 节引用的文献 12
  1. Benavoli 与 Azzimonti(2026a)A tutorial on learning from preferences and choices with Gaussian Processes
  2. Erarslan 等人(2025)Consecutive Preferential Bayesian Optimization
  3. Bıyık 等人(2019)Asking Easy Questions: A User-Friendly Approach to Active Reward Learning
  4. Nguyen 等人(2021)Top-$k$ Ranking Bayesian Optimization
  5. Cover 与 Thomas(2006)Elements of Information Theory
  6. Ou 等人(2023)The Impact of Expertise in the Loop for Exploring Machine Rationality
  7. Li 等人(2021)ROIAL: Region of Interest Active Learning for Characterizing Exoskeleton Gait Preference Landscapes
  8. Wu 等人(2025a)Mixed Likelihood Variational Gaussian Processes
  9. Zhang 等人(2026b)Vibrotactile Preference Learning: Uncertainty-Aware Preference Learning for Personalized Vibration Feedback
  10. Benavoli 等人(2021c)Preferential Bayesian optimisation with skew gaussian processes
  11. Zhu 等人(2022)C-GLISp: Preference-Based Global Optimization Under Unknown Constraints With Applications to Controller Calibration
  12. Menn 等人(2026b)Preferential Bayesian Optimization with Crash Feedback

20.5 多人作答 #

第 20.2.3 节中的众包线搜索取若干工作者滑块位置的中位数,相当于把这些位置视为同一效用的带噪声测量。Koyama 与 Igarashi(2018)明确陈述了这一假设:“存在一种为众人所共有的共同‘一般’偏好”。他们也指出了这一假设的局限:在某些领域,“来自不同背景的人群可能有明显不同的偏好”,而且“当众包是唯一的数据来源时,用户的个人偏好不会在计算中得到体现”。只要回答者不止一人,模型就必须规定他们的效用之间有何关系。

20.5.1 三种立场及涵盖三者的核函数 #

基本立场有三种。一是合并(pool)所有人:只有一个效用,人与人之间的差异归入噪声。二是分开(separate)所有人:每人一个独立的效用,这浪费了其他人的回答所提供的全部信息。三是共享结构(share structure):每个人的效用等于群体效用加上个人偏差。高斯过程用定义在(人,设计)对上的一个核函数表达第三种立场:

k((u,x),(u′,x′))=k0(x,x′)+1[u=u′] k1(x,x′).k\big((u, \vx), (u', \vx')\big) = k_0(\vx, \vx') + \mathbb{1}[u = u']\, k_1(\vx, \vx').
(20.7)

第一项是所有人共有的效用 g0g_0 的协方差;第二项是每个人 uu 的独立偏差 huh_u 的协方差,于是人 uu 的效用为 gu=g0+hug_u = g_0 + h_u。若两个核函数形状相同,信号方差分别为 v0v_0 和 v1v_1,则两个人在同一设计处效用的相关系数为 v0/(v0+v1)v_0/(v_0 + v_1)。令 v1=0v_1 = 0 即为合并,令 v0=0v_0 = 0 即为分开。在这一模型下,新人的模型从群体的后验而非先验出发,其本人的回答再逐步取代群体的影响。

共享 g0g_0 还把所有人置于同一尺度上,这正是第 18.4 节留下的跨人比较效用的问题。比较只能把每个人的效用确定到相差一个平移的程度,而且只能以其本人的噪声为单位;因此,在共同的 g0g_0 上叠加个人偏差的模型,实际上假设了各人的噪声大致相同,除非模型为每个人设置各自的噪声尺度(推断)。

更丰富的版本共享结构,但不假设存在共同的效用。Houlsby 等人(2012)的协同模型将偏好核与用户间共享的低维结构相结合;crowdGPPL 把每个人的效用写成少数几个共享潜在函数的加权组合,即以高斯过程为因子的矩阵分解,并借助随机变分推断扩展到数千名用户和项目(Simpson 与 Gurevych,2020)。一篇 2026 年的预印本以潜在偏好原型的混合代替单一效用(Dubey 等,2026)。

20.5.2 群体先验的作用 #

2024 年以来的交互系统,大多把群体用作帮助新用户起步的先验。Meta-PO 将偏好贝叶斯优化与元学习结合(此处元学习指利用为先前用户拟合的高斯过程模型启动对新用户的搜索),并采用序列画廊界面。在一项有 36 名被试、分三组各 12 人的研究中,达到满意结果所需的迭代次数在不迁移时为 9.54(标准差 2.19),在先前用户追求同一主题时降至 5.86(标准差 1.20),跨主题时降至 7.41(标准差 1.28)(Li 等,2025a)。新用户的目标差异越大,群体的帮助就越小。HOMI 在任何真实用户到来之前,先在模拟用户上训练以神经网络表示的采集函数;在 12 名被试和一个性能目标下,它只在第二、三次迭代时优于基线,从第六次迭代起,所有方法的表现处于同一水平(Liao 等,2026)。

与此相对,一致的证据表明人与人之间差别很大。在一篇 2026 年的预印本中,20 名设计经验各异的被试判断同样的 600 对生成界面,他们的一致性在经机会校正的量表上只有 0.25;该量表上 1 表示完全一致,0 表示机会水平的一致(Krippendorff α;Cohen κ 保留两位小数时与之相同)(Peng 等,2026)。LineCoSpar 发现,不同用户的步态偏好背后的效用各不相同(Tucker 等,2020a)。群体先验能加快最初几次迭代,但尚无研究表明它对与群体不同的人无害(推断)。人因方面的证据汇集于第 32.5 节。

20.5.3 比较能恢复什么、不能恢复什么 #

理论对合并提出了警告。假设许多人(或处于各种未观测情境中的同一个人)回答成对比较,而所有数据只用来拟合一个 Bradley-Terry 效用。Siththaranjan 等人(2024)证明,在有限选项集上、数据无限时,拟合出的效用按选项的 Borda 计数(Borda count)排序,即选项击败随机对手的平均概率,一般并不按期望效用排序;任何使用无限成对数据的方法,都无法保证总能恢复期望效用的顺序。第 21 章将再次遇到 Borda 计数,它是最优选项的定义之一。此外,Chidambaram 等人(2026)表明,若每人只做一次二元比较,群体中偏好的分布完全无法识别;而三个或更多选项之间的比较,即使只是不完整的排序,在满足其他条件时也能识别这一分布。对异质群体而言,成对比较是最弱的反馈形式;这些结果的严格表述见第 29.9 节。

第 20.5 节引用的文献 10
  1. Koyama 与 Igarashi(2018)Computational Design with Crowds
  2. Houlsby 等人(2012)Collaborative Gaussian Processes for Preference Learning
  3. Simpson 与 Gurevych(2020)Scalable Bayesian preference learning for crowds
  4. Dubey 等人(2026)Active Preference Learning over Latent Preference Archetypes for Many-Objective Bayesian Optimization
  5. Li 等人(2025a)Efficient Visual Appearance Optimization by Learning from Prior Preferences
  6. Liao 等人(2026)Efficient Human-in-the-Loop Optimization via Priors Learned from User Models
  7. Peng 等人(2026)Efficient Personalization of Generative User Interfaces
  8. Tucker 等人(2020a)Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits
  9. Siththaranjan 等人(2024)Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
  10. Chidambaram 等人(2026)Direct Preference Optimization with Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences

20.6 界面是模型的一部分 #

本章的每个似然,都是对人借助某一界面完成某一动作的建模。式(20.1)建模的是在集合中点击最好的选项;滑块记录建模的是拖动与停止;式(20.4)建模的是第三个按钮。界面一变,噪声随之改变,每个回答的信息量、所需的努力也随之改变,有时连被测量的偏好本身也会改变。

关于人们如何使用这些界面的证据,使这一点更加具体。在生成式图像搜索中,使用一个滑块时每次迭代用时 17.2 秒,使用四个滑块时为 53.4 秒,但四滑块版本收敛所需的迭代次数更少,被试也更喜欢其灵活性;该研究有三名被试(Chong 等,2021)。在虚拟现实调色中,用户更愿意比较两个选项而非四个(Yuan 等,2025)。一个只要求二元偏好的提示词优化系统,比基线收敛更快、工作负荷更低,但表达能力不及接受文本反馈或手动编辑的基线(Li 等,2026f)。批评画廊界面的研究者指出,每个选项仍由优化器选出,人除了表示喜欢或不喜欢之外,无法表达任何其他意见(Mo 等,2024)。

回答还取决于人此前看过什么:在第 16.1.1 节描述的现场部署中,专家的评分锚定于先前看过的网格模型,并随结果改进而噪声增大(Ou 等,2022)。有一个系统从普通的滑块编辑而非显式查询中学习,其前提假设是每次编辑都在寻求更好的设计;作者指出,他们没有评估这一假设在何种情况下成立(Koyama 与 Goto,2022)。甚至参数化方式也属于界面:一篇 2026 年的预印本论证,向用户展示的表示是交互设计的核心组成部分,而不是预处理步骤;在有 40 名被试的实验中,作者发现学到的五维设计空间优于原有的九个程序化参数(Owaki 等,2026)。

这些发现提示,选择查询形式之前应先回答以下几个问题(推断,依据以上各节):

  • 人要做什么,代价多大?每个回答耗时几秒,疲劳之前能回答多少个。
  • 记录的是什么?哪个似然把动作转化为证据,这种记录又丢弃了哪些信息?
  • 动作会引入什么噪声?知觉分辨率、运动精度,以及费力程度:作答越费力,人越倾向于给出仅仅过得去的回答。
  • 人无法回答时会怎样?平局、跳过、崩溃,或者被迫猜测,而模型会误读这种猜测。
  • 这是谁的偏好?一个人、一个群体,还是处于不断变化情境中的同一个人。

第 32 章从人机交互文献中考察这些问题中与人相关的一面,第 46.4 节则将其转化为建议。

研究现状已定、有争议与缺失

已定。集合选择与排序都有标准似然,即 Luce 选择模型与 Plackett-Luce 模型,二者都有高斯过程版本。在各自原论文的模拟中,滑块、画廊和投影都胜过成对比较。按有限选项的理论,只报告更大集合的赢家,最坏情况下并不优于成对比较,报告前 mm 名则更好。

有争议。多于两个选项的查询在实践中是否有益:两项直接实验采用不同的采集函数,结论相互矛盾。群体先验对与群体不同的人是否安全。

缺失。以人为对象、在相同采集函数和预算下比较各种查询形式的对照研究;专为滑块、平面和投影查询推导的采集函数;有别于平局的弃权回答;刻画界面自身噪声(运动、知觉、费力)如何进入似然的模型。

第 20.6 节引用的文献 7
  1. Chong 等人(2021)Interactive Optimization of Generative Image Modelling using Sequential Subspace Search and Content-based Guidance
  2. Yuan 等人(2025)Personalized Dual-Level Color Grading for 360-degree Images in Virtual Reality
  3. Li 等人(2026f)Preference-Guided Prompt Optimization for Text-to-Image Generation
  4. Mo 等人(2024)Cooperative Multi-Objective Bayesian Design Optimization
  5. Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures
  6. Koyama 与 Goto(2022)BO as Assistant: Using Bayesian Optimization for Asynchronously Generating Design Suggestions
  7. Owaki 等人(2026)Learning Feasibility-Aware Latent Spaces for Preference-Based Exploration of Procedural Automotive Wheel Designs

20.7 习题 #

习题 20.1

(a)证明 q=2q = 2 时 Plackett-Luce 模型式(20.2)即为 Bradley-Terry 模型。(b)四个选项的效用为 g=(2,1,0,0)g = (2, 1, 0, 0),τ=1\tau = 1。计算人按列出的顺序(从第一到第四)给它们排序的概率,以及把第一个选为最好的概率。(c)为什么排序的概率小得多?为什么这并不意味着排序提供的信息更少?

解答

(a)q=2q = 2 时乘积有两个因子。第二个因子对应从单元素集合中做选择,等于 1,因此

P(x1≻x2)=eg1/τeg1/τ+eg2/τ=11+e−(g1−g2)/τ,\Prob(\vx_1 \succ \vx_2) = \frac{e^{g_1/\tau}}{e^{g_1/\tau} + e^{g_2/\tau}} = \frac{1}{1 + e^{-(g_1 - g_2)/\tau}},

即 Bradley-Terry 概率。

(b)各指数项为 e2≈7.39e^2 \approx 7.39、e1≈2.72e^1 \approx 2.72、11、11,总和为 12.11。第一名的概率为 7.39/12.11≈0.617.39/12.11 \approx 0.61,这也是把第一个选为最好的概率。在此条件下,第二名的概率为 2.72/(2.72+1+1)≈0.582.72/(2.72 + 1 + 1) \approx 0.58,第三名为 1/(1+1)=0.51/(1 + 1) = 0.5。整个排序的概率为 0.61×0.58×0.5≈0.180.61 \times 0.58 \times 0.5 \approx 0.18。

(c)排序是 4!=244! = 24 种可能回答之一,赢家只是 4 种之一,因此每个具体排序的可能性都更小。正因为每个回答的概率低,一个回答才能携带更多比特:观察到的排序所排除的可能性,远多于观察到的赢家所排除的。

习题 20.2

证明式(20.5)中三个概率之和为一,且 P(same)\Prob(\text{same}) 在 Δ=0\Delta = 0 时取最大值。取 δ=1\delta = 1(Bıyık 等人(2019)在模拟中使用的设置),该最大值是多少?

解答

记 A=eδ−ΔA = e^{\delta - \Delta}、B=eδ+ΔB = e^{\delta + \Delta},则 P(a)=1/(1+A)\Prob(a) = 1/(1 + A),P(b)=1/(1+B)\Prob(b) = 1/(1 + B),且 AB=e2δAB = e^{2\delta}。于是 P(a)P(b)=1/(1+A+B+e2δ)\Prob(a)\Prob(b) = 1/(1 + A + B + e^{2\delta}),P(a)+P(b)=(2+A+B) P(a)P(b)\Prob(a) + \Prob(b) = (2 + A + B)\,\Prob(a)\Prob(b)。再加上 (e2δ−1)P(a)P(b)(e^{2\delta} - 1)\Prob(a)\Prob(b),即得 (1+A+B+e2δ) P(a)P(b)=1(1 + A + B + e^{2\delta})\,\Prob(a)\Prob(b) = 1。

再看最大值。P(same)\Prob(\text{same}) 正比于 1/(1+A+B+e2δ)1/(1 + A + B + e^{2\delta}),而 A+B=2eδcosh⁡ΔA + B = 2e^{\delta}\cosh\Delta 在 Δ=0\Delta = 0 处最小。此时 A=B=eδA = B = e^{\delta},且

P(same)=e2δ−1(1+eδ)2=eδ−1eδ+1.\Prob(\text{same}) = \frac{e^{2\delta} - 1}{(1 + e^{\delta})^2} = \frac{e^{\delta} - 1}{e^{\delta} + 1}.

当 δ=1\delta = 1 时,该值为 (e−1)/(e+1)≈0.46(e - 1)/(e + 1) \approx 0.46:两个选项实际相同时,模型中的回答者在略少于一半的情况下会说“差不多”。

习题 20.3

在核函数式(20.7)下,取 k0=v0 κk_0 = v_0\,\kappa、k1=v1 κk_1 = v_1\,\kappa,其中 κ\kappa 是满足 κ(x,x)=1\kappa(\vx, \vx) = 1 的共同相关函数。证明两个不同的人在同一设计处效用的相关系数为 v0/(v0+v1)v_0/(v_0 + v_1)。一个新人加入,尚未回答任何问题,模型对其效用作何预测?其方差与群体效用 g0g_0 的方差相比如何?

解答

当 u≠u′u \ne u' 时,协方差为 k0(x,x)=v0k_0(\vx, \vx) = v_0,各自的方差为 v0+v1v_0 + v_1,因此相关系数为 v0/(v0+v1)v_0/(v_0 + v_1)。对新人 uu,gu=g0+hug_u = g_0 + h_u,其中 huh_u 独立于所有数据。其后验均值就是 g0g_0 的后验均值,即群体的估计;其后验方差等于 g0g_0 的后验方差加上 v1v_1。无论群体提供多少数据,在新人本人作答之前,其效用的不确定性至少等于其个人方差。

习题 20.4

在图 20.1 中,不移动滑块而直接选择一端,模型记录了什么?进而论证“选中点胜过两端”这一记录丢弃了滑块回答所含的信息,并给出一种在式(20.1)框架内保留更多信息的方法。

解答

若人保留端点 x+\vx^+,被选中的点与之重合,三个选项的集合退化为两个,记录即为一对 x+≻xEI⁡\vx^+ \succ \vx^{\EI};保留另一端则记录为 xEI⁡≻x+\vx^{\EI} \succ \vx^+。一般而言,人偏好被选中的点胜过滑块上的每一个点,这是连续统上的比较,而记录只保留了其中两个。保留更多信息的一种方法,是把线段上另外 mm 个点(例如等间距的点)加入落败的集合,使这次选择成为式(20.1)中从 m+3m + 3 个选项中做出的选择。这要付出计算代价,因为潜在向量随每个新增点而增长;而且新增的点在同一条直线上彼此靠近,它们的比较高度相关,增加的信息少于其数目所示。Mikkola 等人(2020)则在高斯噪声下取点数趋于无穷的极限。

第 20.7 节引用的文献 2
  1. Bıyık 等人(2019)Asking Easy Questions: A User-Friendly Approach to Active Reward Learning
  2. Mikkola 等人(2020)Projective Preferential Bayesian Optimization

延伸阅读 #

参考文献

  1. Astudillo, R., Lin, Z. J., Bakshy, E., and Frazier, P. (2023). qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization. International Conference on Artificial Intelligence and Statistics. 引用于 §20.1 §20.3
  2. Benavoli, A., and Azzimonti, D. (2026a). A tutorial on learning from preferences and choices with Gaussian Processes. Foundations and Trends in Machine Learning 19(1):1-120. 引用于 §20.1 §20.4
  3. Benavoli, A., Azzimonti, D., and Piga, D. (2021c). Preferential Bayesian optimisation with skew gaussian processes. Proceedings of the Genetic and Evolutionary Computation Conference Companion. 引用于 §20.4
  4. Benavoli, A., Azzimonti, D., and Piga, D. (2023). Learning Choice Functions with Gaussian Processes. Uncertainty in Artificial Intelligence. 引用于 §20.1
  5. Bıyık, E., Palan, M., Landolfi, N. C., Losey, D. P., and Sadigh, D. (2019). Asking Easy Questions: A User-Friendly Approach to Active Reward Learning. CoRL 2019. 引用于 §20.3 §20.4 §20.7
  6. Bradley, R. A., and Terry, M. E. (1952). Rank Analysis of Incomplete Block Designs: I. The Method of Paired Comparisons. Biometrika. 引用于 §20.1
  7. Brochu, E., de Freitas, N., and Ghosh, A. (2007). Active Preference Learning with Discrete Choice Data. Advances in Neural Information Processing Systems. 引用于 §20.3
  8. Chidambaram, K., Seetharaman, K. V., and Syrgkanis, V. (2026). Direct Preference Optimization with Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences. International Conference on Artificial Intelligence and Statistics. 引用于 §20.5
  9. Chong, T. L. H., Shen, I.-C., Sato, I., and Igarashi, T. (2021). Interactive Optimization of Generative Image Modelling using Sequential Subspace Search and Content-based Guidance. Computer Graphics Forum. doi:10.1111/cgf.14188. 引用于 §20.6
  10. Cover, T. M., and Thomas, J. A. (2006). Elements of Information Theory. Wiley. 引用于 §20.4
  11. Dubey, M., De Peuter, S., Wang, W., and Kaski, S. (2026). Active Preference Learning over Latent Preference Archetypes for Many-Objective Bayesian Optimization. arXiv. 预印本引用于 §20.5
  12. Erarslan, A., Sevilla Salcedo, C., Tanskanen, V., Nisov, A., Päiväkumpu, E., Aisala, H., … Mikkola, P. (2025). Consecutive Preferential Bayesian Optimization. arXiv. 预印本引用于 §20.4
  13. Frederick, S., Lee, L., and Baskin, E. (2014). The Limits of Attraction. Journal of Marketing Research. 引用于 §20.1
  14. González, J., Dai, Z., Damianou, A., and Lawrence, N. D. (2017). Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §20.3
  15. Houlsby, N., Huszár, F., Ghahramani, Z., and Hernández-lobato, J. (2012). Collaborative Gaussian Processes for Preference Learning. Advances in Neural Information Processing Systems. 引用于 §20.5
  16. Huber, J., Payne, J. W., and Puto, C. (1982). Adding Asymmetrically Dominated Alternatives: Violations of Regularity and the Similarity Hypothesis. Journal of Consumer Research. 引用于 §20.1
  17. Koyama, Y., and Goto, M. (2022). BO as Assistant: Using Bayesian Optimization for Asynchronously Generating Design Suggestions. Proceedings of the 35th Annual ACM Symposium on User Interface Software and Technology. doi:10.1145/3526113.3545664. 引用于 §20.6
  18. Koyama, Y., and Igarashi, T. (2018). Computational Design with Crowds. Computational Interaction. 引用于 §20.2 §20.5
  19. Koyama, Y., Sato, I., Sakamoto, D., and Igarashi, T. (2017). Sequential line search for efficient visual design optimization by crowds. ACM Transactions on Graphics. 引用于 §20.2 §20.3
  20. Koyama, Y., Sato, I., and Goto, M. (2020). Sequential Gallery for Interactive Visual Design Optimization. ACM Transactions on Graphics 39(4) (SIGGRAPH 2020). 引用于 §20.2 §20.3
  21. Lee, J., Yi, S.-w., and Oh, M.-h. (2025a). Preference-based Reinforcement Learning beyond Pairwise Comparisons: Benefits of Multiple Options. NeurIPS 2025. 引用于 §20.1
  22. Li, K., Tucker, M., Bıyık, E., Novoseller, E., Burdick, J. W., Sui, Y., … Ames, A. D. (2021). ROIAL: Region of Interest Active Learning for Characterizing Exoskeleton Gait Preference Landscapes. ICRA 2021. 引用于 §20.3 §20.4
  23. Li, Z., Liao, Y.-C., and Holz, C. (2025a). Efficient Visual Appearance Optimization by Learning from Prior Preferences. UIST 2025. 引用于 §20.5
  24. Li, Z., Liao, Y.-C., and Holz, C. (2026f). Preference-Guided Prompt Optimization for Text-to-Image Generation. CHI 2026. 引用于 §20.6
  25. Liao, Y.-C., Belo, J., Moon, H.-S., Steimle, J., and Feit, A. M. (2026). Efficient Human-in-the-Loop Optimization via Priors Learned from User Models. CHI 2026. 引用于 §20.5
  26. Liu, C., Ling, S., and Jacobson, A. (2026b). GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization. ACM Transactions on Graphics. doi:10.1145/3811293. 引用于 §20.3
  27. Luce, R. D. (1959). Individual Choice Behavior: A Theoretical Analysis. Wiley. 引用于 §20.1
  28. McFadden, D. (1974). Conditional Logit Analysis of Qualitative Choice Behavior. Frontiers in Econometrics. 引用于 §20.1
  29. Menn, J., Stenger, D., and Trimpe, S. (2026b). Preferential Bayesian Optimization with Crash Feedback. IEEE Robotics and Automation Letters. doi:10.1109/LRA.2026.3665446. 引用于 §20.4
  30. Mikkola, P., Todorović, M., Järvi, J., Rinke, P., and Kaski, S. (2020). Projective Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §20.2 §20.3 §20.7
  31. Mo, G., Dudley, J., Chan, L., Liao, Y.-C., Oulasvirta, A., and Kristensson, P. O. (2024). Cooperative Multi-Objective Bayesian Design Optimization. ACM Transactions on Interactive Intelligent Systems. doi:10.1145/3657643. 引用于 §20.6
  32. Nguyen, Q. P., Tay, S., Low, B. K. H., and Jaillet, P. (2021). Top- Ranking Bayesian Optimization. AAAI 2021. 引用于 §20.1 §20.3 §20.4
  33. Ou, C., Buschek, D., Mayer, S., and Butz, A. (2022). The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures. Mensch und Computer 2022. 引用于 §20.6
  34. Ou, C., Mayer, S., and Butz, A. (2023). The Impact of Expertise in the Loop for Exploring Machine Rationality. IUI 2023. 引用于 §20.4
  35. Owaki, T., Koyama, Y., Nakano, T., Yamaguchi, T., Goto, M., and Sakai, H. (2026). Learning Feasibility-Aware Latent Spaces for Preference-Based Exploration of Procedural Automotive Wheel Designs. arXiv. 预印本引用于 §20.6
  36. Peng, Y.-H., Bigham, J. P., and Wu, J. (2026). Efficient Personalization of Generative User Interfaces. arXiv. 预印本引用于 §20.5
  37. Plackett, R. L. (1975). The Analysis of Permutations. Journal of the Royal Statistical Society: Series C (Applied Statistics). 引用于 §20.1
  38. Saha, A., and Gopalan, A. (2019b). PAC Battling Bandits in the Plackett-Luce Model. Algorithmic Learning Theory. 引用于 §20.1
  39. Siivola, E., Dhaka, A. K., Andersen, M. R., González, J., García Moreno, P., and Vehtari, A. (2021). Preferential Batch Bayesian Optimization. IEEE MLSP 2021. 引用于 §20.1 §20.3
  40. Simpson, E., and Gurevych, I. (2020). Scalable Bayesian preference learning for crowds. Machine Learning. 引用于 §20.5
  41. Siththaranjan, A., Laidlaw, C., and Hadfield-Menell, D. (2024). Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF. ICLR 2024. 引用于 §20.5
  42. Tucker, M., Cheng, M., Novoseller, E., Cheng, R., Yue, Y., Burdick, J. W., and Ames, A. D. (2020a). Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits. IROS 2020. 引用于 §20.3 §20.5
  43. Tucker, M., Novoseller, E., Kann, C., Sui, Y., Yue, Y., Burdick, J. W., and Ames, A. D. (2020b). Preference-Based Learning for Exoskeleton Gait Optimization. 2020 IEEE International Conference on Robotics and Automation (ICRA). 引用于 §20.3
  44. Wu, K., Sanders, C., Letham, B., and Guan, P. (2025a). Mixed Likelihood Variational Gaussian Processes. arXiv. 预印本引用于 §20.3 §20.4
  45. Yuan, L.-P., Dudley, J. J., Kristensson, P. O., and Qu, H. (2025). Personalized Dual-Level Color Grading for 360-degree Images in Virtual Reality. IEEE Transactions on Visualization and Computer Graphics. 引用于 §20.6
  46. Zhang, R., Zhu, X., Pourebadi Khotbehsara, M., Dao, W., Bıyık, E., and Culbertson, H. (2026b). Vibrotactile Preference Learning: Uncertainty-Aware Preference Learning for Personalized Vibration Feedback. UMAP 2026 (per Semantic Scholar). 引用于 §20.4
  47. Zhu, M., Piga, D., and Bemporad, A. (2022). C-GLISp: Preference-Based Global Optimization Under Unknown Constraints With Applications to Controller Calibration. IEEE Transactions on Control Systems Technology. 引用于 §20.4