构建与评估偏好优化系统
偏好贝叶斯优化请人比较选项,再用此人效用的模型拟合这些回答,以此寻找此人最喜欢的设计(第 19 章)。上一章得出两点结论:一次回答混合了稳定偏好、结构化噪声、提问引起的改变与背后并无偏好的回答,因此一次会话既是对偏好的估计,也是对偏好的干预;最大的误差则来自模型对人的假设(第 45 章)。
本章把这一分析转化为建议,供需要构建或评估偏好优化系统的读者参考:首先是判断偏好贝叶斯优化是否合适的三个问题,然后逐一讨论系统的各个部分,最后列出应当默认采用更简单方法的情形。每条建议都来自本书前文报告的证据,或来自我们据此所作的推断,而且没有一条作为整体在偏好贝叶斯优化中检验过。每张表还注明了各条建议是否依赖高斯过程与偏好贝叶斯优化的框架。不依赖框架的建议适用于任何偏好模型,包括第 46.9 节中的简单基线;依赖框架的建议只是框架内部的修补,并不说明框架本身是否选对了。
46.1 选用偏好贝叶斯优化之前的三个问题 #
遇到一个有人参与的个性化或设计新问题时,我们建议先回答三个问题,再决定是否采用偏好贝叶斯优化(推断)。
- 是否存在可以测量的数值目标?如果存在,就用普通的贝叶斯优化(第 11 章)或其他合适的方法优化它,偏好只用作约束或辅助信号。专家的成对输入只有在其判断带有代理模型所缺少的信息时才有价值(第 36.7 节)。按验证误差为分类器调参(第 22 章)与最大化化学反应的产率(第 23 章)都属于这类问题。
- 能否把呈现给此人的维度降到约 10 维或更少?如果不能,应先设计表示。预算为几十至两百次比较时,限制来自每个回答所能携带的信息很少(至多 1 比特)和预算本身,而不是代理模型(推断)。
- 参数很少、最优点又很平坦时,手动自调或粗略搜索是否已经足够?如果可能足够,它就是第一个基线,偏好贝叶斯优化必须胜过它(第 24.5 节)。
如果三个问题都指向偏好贝叶斯优化,基于 BoTorch 中 PairwiseGP 的 qEUBO 是合理的默认选择(第 19.4 节、第 18.6 节);这一选择出于软件生态,而不是与更简单方法比较的结果。会话应当按算法 46.2 加入测量环节。观测模型与人的行为所造成的误差,超过了采集函数之间的差异(第 45.1 节);这些附加环节既能估计这些误差,又能提供区分发现偏好与塑造偏好所需的对照(第 45.5 节)。
- 会话之前,记录此人对自己的品味被系统改变所持的态度。
- 预先确定固定比例的查询,这部分查询不由采集函数选择,而是随机配对,或按平衡顺序排列的配对。随机安排选项出现在左侧还是右侧,或其在画廊中的位置。
- 在“A”与“B”之外,再提供两个回答:“差不多”与“无法比较”。
- 插入几个安慰剂对(placebo pairs),即把同一设计展示两次;再插入几个在不同间隔下出现的重复配对(repeated pairs)。
- 记录每个回答的反应时。
- 标明哪些是系统的提议,如实显示比较历史,并允许此人重置或否决当前最优点。
- 会话结束时,不带系统框架,让最终设计与此人先前拒绝的设计重新比较,并询问此人是否认可最终设计。
- 在约一周后的下一次会话中,重复这一重测。
第 3 至 5 步的理由见第 46.2 节,第 2 步见第 46.4 节,第 4 步另见第 46.5 节,第 7、8 步见第 46.6 节,第 1、6、7、8 步见第 46.8 节。
关于维度的说明。一次比较至多携带 1 比特(第 16.6 节),因此对 20 个参数做 100 次比较,每个参数至多分到 5 比特;由于回答带有噪声、许多查询又是冗余的,实际通常远少于此(推断)。偏好贝叶斯优化在多于少数几个维度上取得成功的案例中,此人面对的维度都已通过设计降低:或降到生成式人体模型的 10 维体型空间,或降到 20 至 30 个扩散模型适配器的合并权重(Koyama 等,2020;Liu 等,2026b),或降到一个 5 维、考虑可行性的潜空间(表 46.8)。
第 46.1 节引用的文献 2
- Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
- Liu 等人(2026b)GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization
46.2 观测模型 #
观测模型承载着最大的误差(第 45.1.3 节)。表 46.1 为它列出了五条建议,没有一条依赖高斯过程框架。
| 建议 | 依据 | 是否依赖高斯过程与偏好贝叶斯优化框架? |
|---|---|---|
| 在两个选项之外提供“差不多”与“无法比较”;分别把它们建模为无差异阈值与不完备(或混合参数),切勿将其解读为 50:50 的回答 | Nielsen 与 Rigotti(2026)(工作论文);Ok 与 Tserenjigmid(2022);Erarslan 等人(2025)(预印本) | 否 |
| 在每次会话中插入几个安慰剂对(同一设计出现两次),以估计虚假偏好率,并校准噪声项或失误项 | O'Mahony 与 Wichchukit(2017) | 否 |
| 让噪声尺度随难度、相似度与反馈类型(成对回答、滑块、评分)变化;不应固定一个偏低的默认值,也不应让所有人共用一个尺度 | Shen 等人(2025b);Ghosal 等人(2023);Keffert 与 Schweizer(2024)(预印本) | 否 |
| 记录反应时;在联合似然中,把这一对的总体价值作为协变量 | Shvartsman 等人(2024);Sawarni 等人(2025);Shevlin 等人(2022) | 记录:否;联合似然已有高斯过程版本 |
| 加入选择历史项,以提高最近被选中选项的价值;估计损失厌恶等行为参数,而不是将其固定 | Zylberberg 等人(2024);Brown 等人(2024) | 否 |
两个额外的回答。强制选择把无差异、犹豫不决与尝试(Ok 与 Tserenjigmid,2022)都变成掷硬币,模型则会把它解读为微弱的偏好;而在允许时,许多人会表示自己无法比较(表 45.2)。“差不多”这一回答有标准的模型,即最小可觉差阈值。一篇 2025 年的预印本报告,在合成基准上,一旦有 10% 至 20% 的比较是无差异的,为这一回答建模的方法就明显优于标准的偏好基线(Erarslan 等,2025)(第 20.4 节)。
安慰剂对。感官科学发现,消费者会在完全相同的样品之间报告偏好,因此把由相同样品组成的配对确立为标准的对照条件(O'Mahony 与 Wichchukit,2017)。在偏好贝叶斯优化中,可以展示两张逐像素相同的渲染图,统计此人偏好其中一张的比率;这一比率能估计有多少回答根本不带偏好,并可用来校准失误项(推断)。
结构化噪声。一篇 2024 年的预印本用一个代表性样本估计风险厌恶,发现标准的期望效用随机效用模型在所有人共用一个噪声尺度时给出失真的估计,在每人各有其尺度时则不会(Keffert 与 Schweizer,2024)。PairwiseGP 把噪声固定为 1,让核函数的幅度(BoTorch 中的输出尺度)代替噪声(第 27.5 节)。
反应时是无需额外成本的信息,反映此人感到两个选项相差多远。高斯过程模型已有结合选择与漂移扩散反应时的联合似然(Shvartsman 等,2024);基于 EZ 扩散模型构造的损失,使线性奖励下偏好学习的误差随奖励幅度的增长由指数级降为多项式级(Sawarni 等,2025)。但在两个高价值选项之间做决定,大多更快、更准确,而不是更慢(Shevlin 等,2022)。因此在会话后期,除非模型中包含这一对的总体价值,否则快速的回答并不意味着差异大(推断)。
选择历史。当前最优点是被比较最多的选项,从选择引起的再评价中获益最多(第 45.4 节);损失厌恶系数的元分析均值为 1.955,但在收益与损失对称且未排序时约为 1.07(表 45.1)。因此两者都应作为待估计的项进入似然,而不是取固定值。
第 46.2 节引用的文献 12
- Nielsen 与 Rigotti(2026)Revealed Incomplete Preferences
- Ok 与 Tserenjigmid(2022)Indifference, indecisiveness, experimentation, and stochastic choice
- Erarslan 等人(2025)Consecutive Preferential Bayesian Optimization
- O'Mahony 与 Wichchukit(2017)The evolution of paired preference tests from forced choice to the use of‘No Preference’options, from preference frequencies to d′ values, from placebo pairs to signal detection
- Shen 等人(2025b)Early versus late noise differentially enhances or degrades context-dependent choice
- Ghosal 等人(2023)The Effect of Modeling Human Rationality Level on Learning Rewards from Multiple Feedback Types
- Keffert 与 Schweizer(2024)Stochastic Monotonicity and Random Utility Models: The Good and The Ugly
- Shvartsman 等人(2024)Response Time Improves Gaussian Process Models for Perception and Preferences
- Sawarni 等人(2025)Preference Learning with Response Time: Robust Losses and Guarantees
- Shevlin 等人(2022)High-value decisions are fast and accurate, inconsistent with diminishing value sensitivity
- Zylberberg 等人(2024)Value construction through sequential sampling explains serial dependencies in decision making
- Brown 等人(2024)Meta-analysis of Empirical Estimates of Loss Aversion
46.3 代理模型 #
代理模型是效用函数上的先验。表 46.2 列出三条建议,其中只有最后一条纯属高斯过程框架内部的问题。
| 建议 | 依据 | 是否依赖高斯过程与偏好贝叶斯优化框架? |
|---|---|---|
| 按领域设定群体先验的权重;群体先验预计只在最初几次迭代中有帮助,应监测个体偏离它有多远 | Vessel 等人(2018);由用户模型得到的先验只在第 2 与第 3 次迭代时显著更好(Liao 等,2026) | 否 |
在高维问题中,先降低此人看到的维度,再考虑线性效用模型;如果保留 PairwiseGP,就改用维度缩放的长度尺度先验,并自行验证 |
Owaki 等人(2026)(预印本);Doumont 等人(2026);Hvarfner 等人(2024) | 前两步:否;第三步是框架内部的修补 |
| 噪声低时,不用 Laplace 近似,改用期望传播或精确的偏斜高斯过程采样 | Takeno 等人(2023);Benavoli 等人(2021c) | 是 |
群体先验。共享的品味因领域而异(表 45.3)。在交互式设计中,用先前用户的模型预训练的先验只在第二与第三次迭代时显著更好,从第六次起,各方法表现相当(Liao 等,2026)。群体先验换来的是更好的起点,而不是更好的结果;随着此人自己的回答不断累积,它的权重应当下降(推断;第 20.5 节)。
高维。PairwiseGP 默认的长度尺度先验,远短于高维空间中设计之间的典型距离( 时约为 0.52 对 2.9),因此默认模型认为,每一次比较对其他任何点几乎都不提供信息(第 27.5 节、第 30.3.2 节)。对于标量反馈,随维度缩放的先验修补了这一问题(Hvarfner 等,2024),采用球面输入映射的贝叶斯线性回归也达到了最先进水平(Doumont 等,2026)。两者都还没有在人的成对反馈上检验过,因此应当先降低此人看到的维度,这在任何模型下都有帮助。图 30.2 提供了第二个理由:在一个标量反馈的玩具问题上,80 次评估之内,采集函数的搜索方式比长度尺度先验更能决定结果(第 30.1.2 节)。
推断。在噪声很低时,Laplace 近似会把后验放错位置,期望传播则会扭曲接近 0 或 1 的对决概率(Takeno 等,2023);对偏斜高斯过程后验的精确采样能避免这两种问题(Benavoli 等,2021c)。在人的噪声水平下这些误差有多大,尚无测量(第 27.4 节),因此这一替换对回答非常一致的人最为重要(推断)。
第 46.3 节引用的文献 7
- Vessel 等人(2018)Stronger shared taste for natural aesthetic domains than for artifacts of human culture
- Liao 等人(2026)Efficient Human-in-the-Loop Optimization via Priors Learned from User Models
- Owaki 等人(2026)Learning Feasibility-Aware Latent Spaces for Preference-Based Exploration of Procedural Automotive Wheel Designs
- Doumont 等人(2026)We Still Don't Understand High-Dimensional Bayesian Optimization
- Hvarfner 等人(2024)Vanilla Bayesian Optimization Performs Great in High Dimensions
- Takeno 等人(2023)Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes
- Benavoli 等人(2021c)Preferential Bayesian optimisation with skew gaussian processes
46.4 采集与查询设计 #
观测模型决定了一次查询记录什么,以及此人无法回答时如何处理(第 20 章);表 46.3 汇集了关于如何选择与呈现查询的证据。
| 建议 | 依据 | 是否依赖高斯过程与偏好贝叶斯优化框架? |
|---|---|---|
| 保留固定比例的随机或平衡查询;随机安排左右位置与画廊中的位置;轮换作为系统提议的选项 | 当偏好不稳定或模型类别有误时,主动学习并不比随机好(Keswani 等,2024);注视对选择有因果效应(Bhatnagar 与 Orquin,2022);Glickman 与 Sharot(2025) | 否 |
| 监测已评估设计上比较图的连通性与代数连通度,避免孤立的配对 | Shah 等人(2016);Hendrickx 等人(2019);Shao 等人(2026)(预印本) | 部分依赖:秩亏涉及 Laplace 近似,连通性对任何 Bradley-Terry 估计都很重要 |
| 当用户之间可能存在差异时,用三个或更多选项的排序代替二元比较;对同时在许多属性上不同的配对施加惩罚 | Chidambaram 等人(2026);Johnston 等人(2017) | 否 |
| 让人用自然语言陈述目标与约束,用比较或排序来做外观上的精细判断;让搜索的状态可见、可编辑 | Niwa 等人(2025);Peng 等人(2026)(预印本) | 否 |
随机与平衡的查询。一项关于道德偏好引出的模拟研究发现,主动学习依赖三个前提:偏好稳定且不受查询顺序影响,模型类别正确,噪声有限。一旦这些前提不成立,主动选择的查询并不比随机查询好,甚至更差(Keswani 等,2024)。保留固定比例的、不由采集函数选择的查询,会损失一些效率,换来的是每次会话内部都有一个不受系统引导的对照组,可用来检验模型的预测(第 46.8 节)。位置也有影响:操控人们注视某个选项的时长,可使其被选中的比例升至 0.541(95% 置信区间为 0.523 至 0.560),这一效应是因果性的,但很小(Bhatnagar 与 Orquin,2022)。因此,随机安排位置、轮换由系统提议的选项,可以防止这类效应朝同一方向累积(推断)。
比较图。如果已评估的设计与已回答的配对分裂成互不相连的几块,回答就无法说明这几块之间孰优孰劣,Laplace 近似也会变得病态(第 18.5 节、图 27.1)。图的代数连通度(algebraic connectivity),即其 Laplace 矩阵的第二小特征值,恰好在图不连通时为零。EUBO 的配对往往会开启新的连通分量(Shao 等,2026)(第 19.6 节),因此这一检查是一份廉价的保险:若下一对会开启新的连通分量,就把其中一个选项换成已经比较过的设计(推断)。
排序与简单的配对。当用户之间存在模型所不知道的差异时,二元比较无法识别用户类型,至少三个选项的排序则可以(Chidambaram 等,2026)。陈述偏好研究的指南指出,选择任务的统计效率与复杂度越高,受访者的一致性越低(Johnston 等,2017);在偏好贝叶斯优化中,复杂的任务就是同时在许多属性上不同的配对(推断)。
用语言表达目标,用比较判断外观。在两项由优化器主导设计的研究中( 与 ;第 45.3.3 节),通过自然语言引导的工作负荷低于通过显式约束引导,而在 187 条自然语言请求中,90.9% 描述的是期望的结果,而不是参数(Niwa 等,2025)。对于外观上的精细判断,比较比文字更有效:据一篇 2026 年的预印本,仅凭 8 次成对判断所做的个性化,对 12 名新用户胜过了所有基线,包括这些用户自己写下的偏好,总体胜率为 60.35%(Peng 等,2026)。读者可以在照片案例研究中,用一张图像亲自尝试比较与线搜索(第 25 章)。
第 46.4 节引用的文献 10
- Keswani 等人(2024)On the Pros and Cons of Active Learning for Moral Preference Elicitation
- Bhatnagar 与 Orquin(2022)A meta-analysis on the effect of visual attention on choice
- Glickman 与 Sharot(2025)How human–AI feedback loops alter human perceptual, emotional and social judgements
- Shah 等人(2016)Estimation from Pairwise Comparisons: Sharp Minimax Bounds with Topology Dependence
- Hendrickx 等人(2019)Graph Resistance and Learning from Pairwise Comparisons
- Shao 等人(2026)Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization
- Chidambaram 等人(2026)Direct Preference Optimization with Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences
- Johnston 等人(2017)Contemporary Guidance for Stated Preference Studies
- Niwa 等人(2025)Cooperative Design Optimization through Natural Language Interaction
- Peng 等人(2026)Efficient Personalization of Generative User Interfaces
46.5 非平稳性 #
偏好若在会话中发生变化,就打破了模型的核心假设。需要区分两种变化。一种是漂移(drift),即效用本身发生移动,原因可能是学习、适应、疲劳或查询引起的改变;另一种是选择规则(choice rule)的变化,即效用不变,但此人把效用转化为回答的方式变了,例如从权衡所有属性,转为只依据变得重要的那一个属性作决定(第 37.5 节)。漂移需要随时间变化的效用,选择规则的变化则需要随时间变化的噪声或链接(推断)。
| 建议 | 依据 | 是否依赖高斯过程与偏好贝叶斯优化框架? |
|---|---|---|
| 在不同间隔下再次展示相同的配对,以区分重测噪声与漂移;调节设备时,安排一个熟悉期,并降低早期比较的权重 | Keswani 等人(2026);成为熟练用户需要约 109 分钟的辅助行走(Poggensee 与 Collins,2021) | 否 |
| 必要时,使用带有快、慢两个尺度的时间核,或为每个参数设置状态空间漂移 | 推断,依据是多个时间尺度上的适应 | 时间核属于高斯过程框架;状态空间漂移不属于 |
重复配对。相同的道德成对问题在 3 至 5 次会话中提出时,6% 至 20% 的回答发生了翻转,对一些被试而言,拟合出的决策模型本身也发生了改变(Keswani 等,2026)。单个重复配对无法区分噪声与变化;在多个间隔下重复的配对则可以,因为噪声不依赖间隔,而漂移依赖间隔(图 46.1)。
可以尝试以下几点:
- 在默认设置下,曲线从间隔 2 个回答时的 72% 降到间隔 40 时的 61%,因为效用差在漂移;在 30 人、每个间隔 4 个重复配对的条件下,测得的点显示出这一下降。把漂移设为 0,曲线就平坦地停在 73%:噪声使人在每个间隔上与自己不一致的程度相同。
- 把“不完备”(不完备回答的比例)升到 0.4,漂移保持为 0。曲线仍然平坦,并降至 58%:除非提供“无法比较”,否则背后没有偏好的回答看起来就像额外的噪声。
- 把“不完备”调回 0,漂移保持为 0,把“引起的改变”(即查询引起的改变)设为 1。曲线再次下降,从 92% 降到 74%:在短间隔下,第一次选择使某个选项变得更有吸引力,此人便重复这一选择。下降的曲线不能区分漂移与引起的改变,只有比较不同的查询顺序才能做到(第 45.4.1 节)。
- 重置图形,然后把“人数”设为 5,把“重复次数”(每人在每个间隔上的重复配对数)设为 1。区间跨度约为 ±33 个百分点。基于重复配对的诊断,需要在每个间隔上汇总所有人,得到一百个量级的重复配对(推断)。
熟悉期。人适应设备所需的时间,长于一次典型的调节会话(在外骨骼辅助行走中,代谢消耗降低了 39%,其中约一半来自训练(Poggensee 与 Collins,2021));在适应完成之前所做的比较,测量的是另一个人(第 24.4 节)。
变化的模型。在确实存在漂移的地方,可以用带有快、慢两个尺度的时间核,或每个参数各自漂移的状态空间模型来表示它(推断);在以月计的时间尺度上,一个稳定成分加上随事件出现、继而衰减的偏离,比随机游走更符合证据(第 42 章)。偏好贝叶斯优化中还没有对漂移效用的建模(第 27.2 节),现有理论也只针对有限臂的情形(第 29.10 节)。
第 46.5 节引用的文献 2
- Keswani 等人(2026)Moral Change or Noise? On Problems of Aligning AI With Temporally Unstable Human Feedback
- Poggensee 与 Collins(2021)How adaptation, training, and customization contribute to benefits from exoskeleton assistance
46.6 停止 #
会话应当何时结束?一个诱人的回答是:在后验已经集中的时候,即模型对最优设计很有把握,而若要求 EUBO 选出一对,它会让当前最优点与自身比较(习题 19.2)。这还不够。只要回答一致,后验就会集中,而选择引起的再评价即使在没有任何稳定偏好时,也能使回答保持一致(图 45.2、习题 45.2)。
| 建议 | 依据 | 是否依赖高斯过程与偏好贝叶斯优化框架? |
|---|---|---|
| 不应把后验集中视为偏好已经稳定的证据,因为选择后的再评价也会使后验集中;应在重复配对的一致率进入平台期、延迟重测复现了结果并通过认可检查之后停止 | 推断,依据为 Zylberberg 等人(2024) | 否 |
| 基于遗憾概率或基于成本的停止规则,须先在成对似然与人不断变化的成本下检验,才能移植过来 | Wilson(2024);Xie 等人(2026) | 是 |
来自标量贝叶斯优化的规则。标量规则在某个设计以至少 的概率达到 最优时停止(Wilson,2024),或在任何点的期望改进都不超过其评估成本时停止(Xie 等,2026);两者都假定高斯过程先验设定正确(第 30.7 节、第 14.7 节)。基于偏好的奖励学习有一个针对参数化奖励模型的最优停止规则(Bıyık 等,2019)。这些规则都还没有移植到偏好贝叶斯优化的成对高斯过程似然上,而且人在每次查询上的成本并不恒定:疲劳会提高成本,熟悉任务则会降低成本。在有规则移植过来之前,算法 46.3 是可行的规则。
把反应时作为停止信号。在会话后期,回答通常会变快。这可能意味着偏好已经稳定,但当把握度的预期增益不再值得付出努力时,人也会停止深思(Bénon 等,2024)。因此,对待更快的回答,需要像对待后验集中一样谨慎(推断)。
人会自己停下。在一次为期 3 个月的现场部署中,549 个评价序列里有 415 个在第一次迭代时就停止了,其余 134 个中只有 16 个得到了令人满意的结果(Ou 等,2022)。人的“够好了”与模型已收敛的后验是不同的信号;为模型设计的停止规则,也必须经得起人自行决定退出的考验。
- 只要模型自身的准则认为还值得收集更多回答,就继续进行,例如仍有挑战者确有机会胜过当前最优点时。
- 一旦满足该准则,检查重复配对的一致率在最近几次重复中是否已不再上升。
- 不带系统框架,让当前最优点与此人先前拒绝的两三个设计重新比较。如果当前最优点落败,就继续。
- 询问此人是否认可这一结果。经济学实验发现,在被要求反思自己认可的原则时,人会修改自己的选择(Nielsen 与 Rehbeck,2022),因此这一问题能提供信息,尽管它本身并不构成正当理由(第 45.3.3 节)。
- 停止,并安排算法 46.2 中的延迟重测。
第 46.6 节引用的文献 7
- Zylberberg 等人(2024)Value construction through sequential sampling explains serial dependencies in decision making
- Wilson(2024)Stopping Bayesian Optimization with Probabilistic Regret Bounds
- Xie 等人(2026)Cost-aware Stopping for Bayesian Optimization
- Bıyık 等人(2019)Asking Easy Questions: A User-Friendly Approach to Active Reward Learning
- Bénon 等人(2024)The online metacognitive control of decisions
- Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures
- Nielsen 与 Rehbeck(2022)When Choices Are Mistakes
46.7 评测 #
一个新的偏好贝叶斯优化方法或系统应当如何评测?目前的做法很薄弱:使用标量测试函数,噪声模型与遗憾定义互不兼容,也没有共享的基准(第 45.1.4 节、第 31.4 节)。下面三条建议针对这些问题,都与框架无关;表 46.6 把它们与其他建议一并汇成一份报告清单。
强基线。交互式贝叶斯优化在设计中的正面结果,大多来自与滑块、参数面板或随机查询的比较;与熟练的手工操作或类似的优化器相比,最终质量通常没有差别。对这些系统最恰当的概括,是以更低的成本达到相同的结果(第 32.8 节)。一个方法若没有与手动调节、随机搜索和线性模型比较过,就不能声称自己是必需的。
加速因子。自驱动实验室报告加速因子,即相对于参照策略,某一策略达到目标需要多少次实验。在 42 项研究与 63 个基准中,报告的加速因子中位数为 6,范围为 1.3 至 100(Adesiji 等,2026)。有人参与的偏好贝叶斯优化研究,可以报告相对于手动搜索或随机搜索的同一指标,使结果在不同任务之间可以比较(推断)。
模拟用户。模拟用户的假设至少要在几个真人身上检验。模拟智能体与其所代替的人只在约 50% 的选择上一致(Schoinas 等,2025)(图 45.1)。一篇 2026 年的预印本发现,用语言模型模拟的用户几乎能完美复现群体层面的排序,但与个人的一致性按 Kendall 计只有 0.11 至 0.22,而人们自己的评分与自己的排序之间的一致性为 0.57(Kirk 等,2026)。用模拟用户得到的结果,在用真人核验之前,只是关于这一模拟的结果(第 31.7 节)。
| 项目 | 报告内容 | 理由 |
|---|---|---|
| 基线 | 手动调节、随机搜索或粗网格搜索、线性效用模型 | 正面结果大多来自较弱的比较对象(第 32.8 节) |
| 设定 | 维度、噪声模型、遗憾的定义、软件及其版本、重复次数 | 方法的排名会随这些因素翻转(第 45.1.1 节) |
| 决策者 | 真人还是模拟用户;收集了哪些偏好信息;如何决定停止 | 交互式多目标优化的规范(第 40.11 节) |
| 成本 | 相对于手动或随机搜索的加速因子,以比较次数与分钟数计 | 典型的收益是更低的成本,而不是更好的结果 |
| 噪声审查 | 多个间隔下重复配对的一致率;安慰剂对上的虚假偏好率 | 区分噪声与漂移(图 46.1) |
| 影响 | 会话期间的偏好偏移,以接受随机或平衡查询顺序的组为参照 | 输出既是估计,也是干预(第 45.5 节) |
| 延迟结果 | 一周后不带框架的重测;条件允许时,还有实际使用中的结果 | 会话中的选择不等于使用中的满意(第 37.2 节) |
| 数据 | 带时间戳、呈现顺序、反应时与重复配对的个体层面比较 | 目前还没有这样的公开数据集(第 31.5 节) |
第 46.7 节引用的文献 3
- Adesiji 等人(2026)Benchmarking self-driving labs
- Schoinas 等人(2025)Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants
- Kirk 等人(2026)PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users
46.8 伦理与正当性 #
系统在学习偏好的同时也在塑造偏好,因此需要规则来界定多大程度的塑造是可以接受的。第 45.5.2 节列出了候选条件;表 46.7 把它们转化为实践。
| 建议 | 依据 | 是否依赖高斯过程与偏好贝叶斯优化框架? |
|---|---|---|
| 除遗憾之外,还要报告会话内的偏好偏移,并设一个接受随机或平衡查询顺序的对照组 | Dean 与 Morgenstern(2022);Carroll 等人(2022) | 否 |
| 审查目标函数与停止规则是否奖励用户变得可预测;标明提议,如实显示历史,并允许重置 | Carroll 等人(2023);Williams 等人(2025) | 否 |
| 会话之前,记录此人对被改变所持的态度;会话之后,经过一段延迟、不带框架地重测;对于有道德分量的决定,梳理选项及其权衡,而不是输出一个决定 | Pettigrew(2023);Kanwal 与 Tran(2026)(研讨会论文);第 41 章 | 否 |
测量偏移,而不只是遗憾。只要移动用户的偏好,就能轻易实现低遗憾(第 45.2 节),因此对能影响用户的系统,单凭遗憾无法作担保。以查询随机或平衡的对照组为参照,测量偏好在会话期间移动了多远,就能使影响变得可见,进而为偏移设定界限(Carroll 等,2022)。
审查激励。基于用户反馈优化的学习器,会学会专门针对最容易被影响的用户(第 45.5.1 节),因此团队可以自问:自己的采集函数与停止规则,是否奖励回答变得更可预测。标明提议、如实显示历史、允许重置,可以使影响始终处在视野之中。一个系统如果既决定展示哪些候选,又从特定结果中获益,就处于说服经济学中发送者的位置,而发送者的偏好与用户不同(第 40.6 节)。
之前与之后。在会话之前记录此人的态度,并在延迟之后不借助系统重测,可以让先前的自我与改变后的自我都有发言权(推断;第 45.5.2 节)。对于有道德分量的决定,关于自主的证据支持这样一种系统:列出选项与权衡,把决定留给人自己(第 41.2 节)。
对于面向消费者部署的系统,这些步骤也有助于合规。欧盟《数字服务法》(Digital Services Act)第 25 条规定,在线平台的提供者不得在界面设计上实质性地扭曲或损害用户作出自由、知情决定的能力(European Union,2022b)。系统性地强化当前首选的采集函数,可能落入这一条文的范围;记录平衡的查询顺序,并以明确的认可检查结束会话,可以同时满足科学效度与这一要求(推断;这是我们对条文的解读,不构成法律意见;第 42.2.3 节)。
第 46.8 节引用的文献 7
- Dean 与 Morgenstern(2022)Preference Dynamics Under Personalized Recommendations
- Carroll 等人(2022)Estimating and Penalizing Induced Preference Shifts in Recommender Systems
- Carroll 等人(2023)Characterizing Manipulation from AI Systems
- Williams 等人(2025)On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback
- Pettigrew(2023)Nudging for changing selves
- Kanwal 与 Tran(2026)Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction
- European Union(2022b)Regulation (EU) 2022/2065 on a Single Market for Digital Services (Digital Services Act)
46.9 更简单的方法何时应当胜出 #
随机搜索完全不从自身的结果中学习,但在若干设定中,没有哪种方法能大幅胜过它(第 1 章)。表 46.8 列出更简单的方法应当作为默认选择或必需基线的情形,并注明建议来自问题本身、来自直接证据,还是来自高斯过程与偏好贝叶斯优化框架内部。
| 情形 | 默认选择或基线 | 理由 | 建议的来源 |
|---|---|---|---|
| 参数很少(约 4 至 6 个),每次评估都必须用身体去感受,最优点可能很平坦 | 手动自调 | 用拇指杆自调,约 11 分钟内使代谢消耗比零力矩条件下穿着外骨骼行走降低 16.6%(Schäfer 等,2026);踝关节力矩的自调在一次试验内用 105 秒收敛(Ingraham 等,2022);3 名截肢者中有 2 名在同一天不同试验中自选的设置不同(Díaz 等,2026) | 与问题契合,且有证据 |
| 最优点平坦,候选难以区分 | 粗网格或离散的候选 | 将偏好贝叶斯优化的离散版本用于假肢时,3 名用户在 93% 的验证试验中认出了自己的最终设置;连续版本的唯一一名用户为 67%(Taddei 等,2026)(预印本) | 与问题契合 |
| 属性可以明确陈述,效用大致线性且可加 | 线性效用模型或自适应联合分析 | 考虑回答误差的自适应贝叶斯问题选择是一种成熟的方法(Sauré 与 Vielma,2019),但对效用平衡的问题存在有记录的估计偏差(Hauser 与 Toubia,2005);线性模型在高维基准上达到了最先进水平(Doumont 等,2026) | 与问题契合;线性模型对人的成对数据是否足够,尚未检验 |
| 名义维度为 20 或更高 | 低维表示(生成模型的潜空间,或考虑可行性的潜空间) | 一个 5 维、考虑可行性的潜空间,比 9 个原始参数给出了更高的形状相似度与更多可行的建议(Owaki 等,2026)(预印本) | 与问题契合 |
| 有多个可测量的目标,且需要避免锚定与损失框架 | 交互式多目标方法,例如 NAUTILUS,它从一个被支配的解出发,每一步都改进所有目标 | Miettinen 等人(2010);代替他人做决定时锚定效应更强(Halstead 等,2026) | 与问题契合 |
| 在有强预训练先验时收集偏好数据,或数据噪声很大 | 随机的同策略采样 | 在语言模型的在线直接偏好优化中,与随机选择相比,主动选择对代理胜率的提升微乎其微(Oh 等,2026b)(研讨会论文);数据噪声大时,大批量的随机搜索可能是不错的选择(Siivola 等,2021) | 证据 |
| 构思阶段,目标尚未形成 | 支持发散的工具,或多样化解的存档 | 构思时使用人工智能图像生成器会导致更多固着,想法更少、多样性更低、原创性更弱()(Wadinambiarachchi 等,2024);结合人类反馈的质量多样性搜索能返回多样且高质量的存档(Ding 等,2024) | 与问题契合 |
| 目标是得出关于群体的结论 | 混入随机查询的设计 | 对于群体参数,自适应贝叶斯设计一贯不如随机设计精确(Gibbard 与 Sadlier,2025) | 证据 |
| 只能做感知上的比较,没有数值目标,维度低,几十至约 200 次比较,手动搜索不可行(例如参数无法直接操控) | 使用 qEUBO 与 PairwiseGP 的偏好贝叶斯优化 |
维护最完善的实现;在这一范围内有正面的人类研究,但对照大多是滑块或随机查询 | 实现的选择来自框架与软件生态 |
案例研究完整演示了其中几种情形:外骨骼案例重现了第一行(第 24.5 节),分类器案例展示了随机搜索在与贝叶斯优化的较量中不落下风(第 22.3 节),照片案例(第 25 章)则是最后一行的一个实例。
总的结论来自证据,而非来自框架:在有人参与的研究中,偏好贝叶斯优化相对于强而简单的基线的优势,尚未得到直接证明。因此,新的研究应当把手动调节、随机搜索或粗网格搜索、线性效用模型列为必需的对照;只与滑块或另一种偏好贝叶斯优化变体比较,无法回答偏好贝叶斯优化究竟是否必要。
第 46.9 节引用的文献 15
- Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
- Ingraham 等人(2022)The role of user preference in the customized control of robotic exoskeletons
- Díaz 等人(2026)User preference in the personalized control of an ankle prosthesis: a case study
- Taddei 等人(2026)Bayesian Preference Elicitation: Human-In-The-Loop Optimization of An Active Prosthesis
- Sauré 与 Vielma(2019)Ellipsoidal Methods for Adaptive Choice-Based Conjoint Analysis
- Hauser 与 Toubia(2005)The Impact of Utility Balance and Endogeneity in Conjoint Analysis
- Doumont 等人(2026)We Still Don't Understand High-Dimensional Bayesian Optimization
- Owaki 等人(2026)Learning Feasibility-Aware Latent Spaces for Preference-Based Exploration of Procedural Automotive Wheel Designs
- Miettinen 等人(2010)NAUTILUS method: An interactive technique in multiobjective optimization based on the nadir point
- Halstead 等人(2026)Multiobjective Optimisation for Others: How Anchoring Effects Change Based on Who Guides the Interaction
- Oh 等人(2026b)Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs
- Siivola 等人(2021)Preferential Batch Bayesian Optimization
- Wadinambiarachchi 等人(2024)The Effects of Generative AI on Design Fixation and Divergent Thinking
- Ding 等人(2024)Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization
- Gibbard 与 Sadlier(2025)Optimal adaptive Bayesian design in choice experiments: performance for the population versus individuals
46.10 已定、有争议与缺失 #
已定。在参数很少的外骨骼调节中,自调达到的代谢节省与算法调节处于同一量级。对于群体层面的参数,自适应贝叶斯设计不如随机设计精确。强制选择无法区分无差异、不完备与噪声。不连通的比较图使其各连通分量之间的相对效用无法确定。
有争议。在语言模型的在线偏好优化之外,随机选择是否也难以被超越(主要证据是一篇研讨会论文)。Laplace 近似的误差在人的噪声水平下是否要紧。维度缩放的长度尺度先验能否在成对反馈下修补默认模型。
缺失。对上述任何一条建议的整体检验,尤其是对加入测量环节的会话与停止规则的检验。一项表明偏好贝叶斯优化在预注册终点指标上胜过手动调节、随机搜索与线性效用模型的研究。设计任务中“无法比较”回答所占比例的测量值。可用于离线核验这些建议的公开数据集。
46.11 习题 #
一个团队希望为每位用户个性化设定助听器声音处理的 12 个参数,会话约有 40 次比较,分两次门诊完成。按算法 46.1 逐步分析。应当构建什么,要求哪些基线,会话中又应加入什么?
六个设计已在配对 (1, 2)、(3, 4)、(5, 6) 与 (1, 3) 中比较过。比较图有几个连通分量?其代数连通度是多少?下一步应当提出哪一类查询?为什么这对先验很强的模型不那么要紧?
解答
这些边把 {1, 2, 3, 4} 连成一个分量,{5, 6} 构成第二个分量,因此共有两个连通分量,代数连通度(即图 Laplace 矩阵的第二小特征值)为 0。到目前为止,没有任何回答说明 5 和 6 与其余四个设计相比如何;任何把 5 或 6 与 1 至 4 中某一个配成一对的查询,都能使图连通。长度尺度较长的高斯过程先验,即使没有比较,也会把相近设计的效用联系起来,因此后验仍然是良定义的;但这时两组之间的偏移量由先验决定,而不是由人决定(第 27.6 节)。
延伸阅读 #
- Schäfer 等人(2026)最清楚地表明,在人在回路的设定中,强而简单的基线可以与算法调节相匹敌。
- Keswani 等人(2024)陈述了主动偏好引出所依赖的前提,并展示了这些前提不成立时的后果。
- O'Mahony 与 Wichchukit(2017)回顾了感官科学早在偏好贝叶斯优化出现之前几十年,就已学会处理强制选择、“无偏好”回答与安慰剂对。
- Dean 与 Morgenstern(2022)与 Carroll 等人(2022)说明了当系统能够移动其正在学习的偏好时,为什么仅有遗憾是不够的。
- Adesiji 等人(2026)阐述了加速因子与增强因子,二者使结果可以在不同任务之间比较。
参考文献
- (2026). Benchmarking self-driving labs. Digital Discovery. 引用于 §46.7
- (2024). The online metacognitive control of decisions. Communications Psychology. doi:10.1038/s44271-024-00071-y. 引用于 §46.6
- (2022). A meta-analysis on the effect of visual attention on choice. Journal of Experimental Psychology: General. 引用于 §46.4
- (2019). Asking Easy Questions: A User-Friendly Approach to Active Reward Learning. CoRL 2019. 引用于 §46.6
- (2024). Meta-analysis of Empirical Estimates of Loss Aversion. Journal of Economic Literature. 引用于 §46.2
- (2022). Estimating and Penalizing Induced Preference Shifts in Recommender Systems. ICML 2022. 引用于 §46.8
- (2023). Characterizing Manipulation from AI Systems. Equity and Access in Algorithms, Mechanisms, and Optimization. 引用于 §46.8
- (2026). Direct Preference Optimization with Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences. International Conference on Artificial Intelligence and Statistics. 引用于 §46.4
- (2022). Preference Dynamics Under Personalized Recommendations. EC 2022. 引用于 §46.8
- (2026). User preference in the personalized control of an ankle prosthesis: a case study. Journal of NeuroEngineering and Rehabilitation. doi:10.1186/s12984-026-01931-w. 引用于 §46.9
- (2024). Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization. ICML 2024. 引用于 §46.9
- (2026). We Still Don't Understand High-Dimensional Bayesian Optimization. AISTATS 2026 (best student paper). 引用于 §46.3 §46.9
- (2025). Consecutive Preferential Bayesian Optimization. arXiv. 预印本引用于 §46.2
- (2022b). Regulation (EU) 2022/2065 on a Single Market for Digital Services (Digital Services Act). Official Journal of the European Union (EUR-Lex). 非同行评审引用于 §46.8
- (2023). The Effect of Modeling Human Rationality Level on Learning Rewards from Multiple Feedback Types. AAAI. 引用于 §46.2
- (2025). Optimal adaptive Bayesian design in choice experiments: performance for the population versus individuals. Marketing Letters. 引用于 §46.9
- (2025). How human–AI feedback loops alter human perceptual, emotional and social judgements. Nature Human Behaviour. doi:10.1038/s41562-024-02077-2. 引用于 §46.4
- (2026). Multiobjective Optimisation for Others: How Anchoring Effects Change Based on Who Guides the Interaction. Journal of Multi-Criteria Decision Analysis. 引用于 §46.9
- (2005). The Impact of Utility Balance and Endogeneity in Conjoint Analysis. Marketing Science. 引用于 §46.9
- (2019). Graph Resistance and Learning from Pairwise Comparisons. ICML. 引用于 §46.4
- (2024). Vanilla Bayesian Optimization Performs Great in High Dimensions. International Conference on Machine Learning. 引用于 §46.3
- (2022). The role of user preference in the customized control of robotic exoskeletons. Science Robotics. 引用于 §46.9
- (2017). Contemporary Guidance for Stated Preference Studies. Journal of the Association of Environmental and Resource Economists. 引用于 §46.4
- (2026). Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction. AAAI-26 Workshop on Machine Ethics. 研讨会论文引用于 §46.8
- (2024). Stochastic Monotonicity and Random Utility Models: The Good and The Ugly. arXiv preprint 2409.00704. 预印本引用于 §46.2
- (2024). On the Pros and Cons of Active Learning for Moral Preference Elicitation. AIES. 引用于 §46.4
- (2026). Moral Change or Noise? On Problems of Aligning AI With Temporally Unstable Human Feedback. AAAI. 引用于 §46.5
- (2026). PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users. arXiv. 预印本引用于 §46.7
- (2020). Sequential Gallery for Interactive Visual Design Optimization. ACM Transactions on Graphics 39(4) (SIGGRAPH 2020). 引用于 §46.1
- (2026). Efficient Human-in-the-Loop Optimization via Priors Learned from User Models. CHI 2026. 引用于 §46.3
- (2026b). GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization. ACM Transactions on Graphics. doi:10.1145/3811293. 引用于 §46.1
- (2010). NAUTILUS method: An interactive technique in multiobjective optimization based on the nadir point. European Journal of Operational Research. 引用于 §46.9
- (2022). When Choices Are Mistakes. American Economic Review. 引用于 §46.6
- (2026). Revealed Incomplete Preferences. Working paper (author's website). 工作论文引用于 §46.2
- (2025). Cooperative Design Optimization through Natural Language Interaction. UIST 2025. 引用于 §46.4
- (2017). The evolution of paired preference tests from forced choice to the use of‘No Preference’options, from preference frequencies to d′ values, from placebo pairs to signal detection. Trends in Food Science & Technology. 引用于 §46.2
- (2026b). Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs. ICLR 2026 Workshop: I Can't Believe It's Not Better (ICBINB). 研讨会论文引用于 §46.9
- (2022). Indifference, indecisiveness, experimentation, and stochastic choice. Theoretical Economics. 引用于 §46.2
- (2022). The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures. Mensch und Computer 2022. 引用于 §46.6
- (2026). Learning Feasibility-Aware Latent Spaces for Preference-Based Exploration of Procedural Automotive Wheel Designs. arXiv. 预印本引用于 §46.3 §46.9
- (2026). Efficient Personalization of Generative User Interfaces. arXiv. 预印本引用于 §46.4
- (2023). Nudging for changing selves. Synthese. 引用于 §46.8
- (2021). How adaptation, training, and customization contribute to benefits from exoskeleton assistance. Science Robotics. 引用于 §46.5
- (2019). Ellipsoidal Methods for Adaptive Choice-Based Conjoint Analysis. Operations Research. 引用于 §46.9
- (2025). Preference Learning with Response Time: Robust Losses and Guarantees. NeurIPS. 引用于 §46.2
- (2026). User preference-based human-in-the-loop tuning of exoskeleton assistance during walking. npj Biomedical Innovations. doi:10.1038/s44385-026-00085-7. 引用于 §46.9
- (2025). Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants. 2025 47th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC). doi:10.1109/embc58623.2025.11253762. 引用于 §46.7
- (2016). Estimation from Pairwise Comparisons: Sharp Minimax Bounds with Topology Dependence. Journal of Machine Learning Research. 引用于 §46.4
- (2026). Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization. arXiv. 预印本引用于 §46.4
- (2025b). Early versus late noise differentially enhances or degrades context-dependent choice. Nature Communications. doi:10.1038/s41467-025-59140-3. 引用于 §46.2
- (2022). High-value decisions are fast and accurate, inconsistent with diminishing value sensitivity. Proceedings of the National Academy of Sciences. 引用于 §46.2
- (2024). Response Time Improves Gaussian Process Models for Perception and Preferences. Uncertainty in Artificial Intelligence. 引用于 §46.2
- (2021). Preferential Batch Bayesian Optimization. IEEE MLSP 2021. 引用于 §46.9
- (2026). Bayesian Preference Elicitation: Human-In-The-Loop Optimization of An Active Prosthesis. arXiv. 预印本引用于 §46.9
- (2023). Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes. International Conference on Machine Learning. 引用于 §46.3
- (2018). Stronger shared taste for natural aesthetic domains than for artifacts of human culture. Cognition. 引用于 §46.3
- (2024). The Effects of Generative AI on Design Fixation and Divergent Thinking. Proceedings of the CHI Conference on Human Factors in Computing Systems. 引用于 §46.9
- (2025). On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback. ICLR 2025. 引用于 §46.8
- (2024). Stopping Bayesian Optimization with Probabilistic Regret Bounds. NeurIPS 2024. 引用于 §46.6
- (2026). Cost-aware Stopping for Bayesian Optimization. International Conference on Machine Learning. 引用于 §46.6
- (2024). Value construction through sequential sampling explains serial dependencies in decision making. eLife. doi:10.7554/eLife.96997. 引用于 §46.2 §46.6