未解决问题与判定实验
偏好贝叶斯优化请人比较选项,再用此人效用的模型拟合这些回答,以此找到此人最喜欢的设计(第 19 章)。此前各章报告了关于它的已知内容:方法、理论、有人参与的研究,以及其他学科对偏好为何物的认识。前两章从这些记录中得出了两点结论。一次比较混合了稳定偏好、结构化噪声、提问引起的改变与背后并无偏好的回答(第 45 章);建立在比较之上的系统应当加入测量环节,并以强而简单的基线为参照来评判(第 46 章)。
本章列出尚属未知的内容。本章汇集十八个未解决问题,为每个问题指出一个实验,以及能对该问题作出判定的结果。第一组问题关于偏好本身,第二组关于理论与维度,第三组关于实践中方法的选择。其中有一个实验,即随机化查询顺序并在一周后重测,会比其他任何实验都更能改变我们的认识;本章对它的描述具体到可以照此实施。本章以及全书以结论收尾。
这些实验都是提议。凡是我们补充的细节(样本量、重测对的数量、实验中某一组如何平衡),都是我们自己的推断,作为设计的起点提出,而不是研究发现。
47.1 关于偏好本身的问题 #
第一组问题决定了应当如何理解一次比较:它是对固定效用的带噪声读出,还是在一定程度上由会话建构的产物。表 47.1 列出了这些问题。
| 问题 | 实验 | 能作出判定的结果 |
|---|---|---|
| 查询顺序会改变最终的偏好吗?(带噪声的偏好发现对偏好支架) | 把人随机分配到不同的查询顺序,一周后重测;见第 47.4 节 | 见第 47.4 节 |
| 当前最优点会因为一再被选中而增值吗? | 在会话中的几个不同延迟处,插入当前最优点与先前被拒选项的比较;按留出配对上的预测对数似然,比较有与没有选择历史项的似然 | 带选择历史项的模型显著更好,且被拒选项重新胜出的比率随延迟上升 |
| 会话内的不一致,有多少来自噪声、漂移或不完备? | 在不同间隔下重复相同的配对,插入安慰剂对,并提供“无法比较”的回答 | 一致率不依赖间隔,说明噪声占主导;一致率随间隔下降,说明存在漂移;安慰剂对给出虚假偏好率;集中在复杂配对上的“无法比较”回答支持第四类回答的存在 |
| 允许不完备回答会改善结果吗? | 在被试内比较强制选择,与提供“差不多”和“无法比较”的界面 | 若允许不完备回答时传递性违背减少、最终设计的延迟重测更常一致,这些额外的回答就应当成为默认 |
| 偏好的层级观适用于设计吗? | 同一批人在几次会话中反复判断抽象目标(例如“舒适”)与具体的参数配置 | 对抽象目标的判断,重测信度显著高于对配置的判断:分层模型成立;信度相等:层级观在设计任务中缺乏实证支持 |
| 群体先验的价值如何随领域而变? | 在面孔或风景上,以及在建筑或艺术品上,比较强群体先验、按群组的先验与弱先验 | 在自然领域中强先验胜出,在文化制品上弱先验或群组先验胜出:按领域设定先验的强度 |
选择历史。选择一个选项会提高它对选择者的价值(Enisman 等,2021;Zylberberg 等,2024),而在偏好贝叶斯优化会话中,当前最优点正是被选中次数最多的选项。检验方法是在留出的回答上比较模型:如果带近期选择项的似然比不带的预测得更好,而且此人拒绝过的选项随着时间推移更可能再次胜出,那么这一效应就存在于设计比较中,而此前从未有人在设计比较中测量过它(第 45.4 节)。
噪声、漂移与不完备。在不同间隔下重复的配对,可以把不依赖间隔的噪声与依赖间隔的漂移区分开。图 46.1 给出一个提醒:引起的改变即使会消退,同样会使一致率随间隔下降,因此仅凭一条下降的曲线无法认定漂移(推断);比较不同的查询顺序则可以(第 47.4 节)。安慰剂对,即同一设计展示两次,可以估计人们在不可能存在偏好之处表达偏好的频率(O'Mahony 与 Wichchukit,2017)。如果“无法比较”的回答集中在复杂的配对上,就说明第 45.4 节中的第四个成分在设计任务中确实存在;在彩票与金钱的实验中,允许时有 40% 至 50% 的被试使用了这种回答(Nielsen 与 Rigotti,2026)。
把不完备回答作为默认。强制选择把无差异、犹豫不决与尝试都变成同一种掷硬币(Ok 与 Tserenjigmid,2022)。如果允许额外的回答能减少传递性违背(选 而不选 ,选 而不选 ,却又选 而不选 ),并使最终设计更经得起延迟重测,那么增加按钮的代价就得到了回报(推断)。
层级观。文献中的一种立场认为,对终极目标的偏好是稳定的,而对中间结果的偏好是在引出过程中形成的(第 45.3.2 节)。稳定性的证据来自自我报告的价值观(Vecchione 等,2020),建构的证据则来自选择,因此这两个层级从未在同一任务上检验过。请同一批人在多次会话中既判断抽象目标,又判断具体配置,就能在偏好贝叶斯优化实际运作的层面检验这一观点。
按领域设定群体先验。面孔与风景的共享品味高,建筑与艺术品则低(Vessel 等,2018)。如果强群体先验在前一类领域中有帮助,而弱先验或群组特定的先验在后一类领域中有帮助,那么先验的强度就是一个应当按领域设定的参数(第 46.3 节)。
第 47.1 节引用的文献 7
- Enisman 等人(2021)Choice changes preferences, not merely reflects them: A meta-analysis of the artifact-free free-choice paradigm
- Zylberberg 等人(2024)Value construction through sequential sampling explains serial dependencies in decision making
- O'Mahony 与 Wichchukit(2017)The evolution of paired preference tests from forced choice to the use of‘No Preference’options, from preference frequencies to d′ values, from placebo pairs to signal detection
- Nielsen 与 Rigotti(2026)Revealed Incomplete Preferences
- Ok 与 Tserenjigmid(2022)Indifference, indecisiveness, experimentation, and stochastic choice
- Vecchione 等人(2020)Stability and change of basic personal values in early adolescence: A 2‐year longitudinal study
- Vessel 等人(2018)Stronger shared taste for natural aesthetic domains than for artifacts of human culture
47.2 关于理论与维度的问题 #
接下来的三个问题决定了理论能保证什么,以及偏好贝叶斯优化的维度限制究竟从何而来(表 47.2)。其中出现了遗憾理论中的两个量(第 45.1.2 节):,即 次查询之后核函数的最大信息增益;,即链接函数斜率倒数的上界。第三个量是 ,它界定效用函数在核函数自身的函数空间中的范数,从而限制效用可以有多粗糙。
| 问题 | 实验或分析 | 能作出判定的结果 |
|---|---|---|
| 逻辑链接或概率单位链接下核化偏好反馈的下界 | 在 Gumbel 噪声或正态噪声下推导显式依赖 的极小极大下界;检查 MR-LPF 的预热常数是否隐藏了 或 | 与 相匹配的下界能确立阶最优性;不匹配则意味着成对反馈确实更昂贵,或者上界还可以改进 |
| 完全序贯算法以及实践中所用流程的阶最优保证 | 分析 Laplace 或期望传播后验加 EUBO 的频率派遗憾,或构造一个使其不一致的反例;尝试去掉序贯算法中多出的 因子 | 一个达到 的序贯算法、一个针对实际流程的保证,或者一个反例 |
| 维度上限主要来自默认先验吗?这在人的比较中是否成立? | 在 50、100 与 200 次比较的预算下,比较使用默认先验的 qEUBO、使用维度缩放先验的 qEUBO、不限制长度尺度的局部方法、线性效用模型与降维后的表示;先在模拟中,再在生成模型 20 至 50 维的潜空间中让真人参与;记录 Laplace 边际似然对超参数的梯度 | 如果维度缩放先验弥合了大部分差距,上限就主要来自默认设置;如果只有降维后的表示有效,限制就来自预算与每次查询的信息量 |
下界。核化偏好反馈的所有遗憾结果都是上界。多轮偏好反馈学习算法(MR-LPF)这一分批算法达到了 ,与标量速率相匹配,但需要一个预热阶段,其常数不依赖于 (Kayal 等,2025);问题在于,这个常数是否隐藏了对 或 的依赖,而后者可能非常大。在逻辑链接或概率单位链接下,还不存在下界(第 29.7 节)。
实践中的流程。理论分析的是建立在频率派核估计量之上的淘汰、乐观与 Thompson 采样;实践中运行的却是 Laplace 后验加 EUBO(第 45.1.2 节)。对这一流程的遗憾分析,或一个表明它可能不收敛的反例,将弥合理论证明与实际使用之间的鸿沟。
维度上限。一种常见的说法是,偏好贝叶斯优化在超过 10 至 20 维时就会失效。证据却指向默认配置的一个性质:PairwiseGP 的长度尺度先验不随维度缩放,因此默认的核函数认为高维空间中的点几乎互不相关(具体的算术见第 46.3 节;另见第 27.5 节与第 30.3.4 节)。对于标量反馈,维度缩放先验修补了这一问题(Hvarfner 等,2024),但在成对反馈与人所能承受的预算下,这一修补尚未检验。所提议的实验可以区分两种解释:如果维度缩放先验弥合了与降维表示之间的大部分差距,上限就是默认设置造成的;如果只有降维表示有效,限制就在于每个回答所携带的信息太少。记录边际似然的梯度,可以看出长度尺度究竟有没有在学习。模拟要放在前面,以免生成模型 20 至 50 维潜空间中的真人实验受到默认先验的混淆。
图 30.2 在一个玩具问题上运行了这一实验的标量版本:一个 6 维函数隐藏在至多 50 个输入之中,比较固定尺度与维度缩放两种先验,以及两种搜索采集函数的方式。图中的长度尺度面板显示长度尺度是否得到学习。在这些运行中,学习与否只是程度之别:在固定尺度先验下,起作用的输入所得的长度尺度只有其余输入的约三分之一,而维度缩放先验则关闭了大部分无关的输入。图中的遗憾曲线说明了为什么这一结果必须结合采集函数的搜索方式来解读。
第 47.2 节引用的文献 2
- Kayal 等人(2025)Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds
- Hvarfner 等人(2024)Vanilla Bayesian Optimization Performs Great in High Dimensions
47.3 关于实践的问题 #
其余的问题决定了应当采用哪些方法(表 47.3)。其中大多数可以通过一个真人实验来解决,即在同一任务上比较少数几种变体。
| 问题 | 实验 | 能作出判定的结果 |
|---|---|---|
| 算法调节胜过手动自调吗? | 相同的被试与相同的时间预算,在外骨骼或假肢上,比较手动自调与成对的偏好贝叶斯优化,平衡条件的先后顺序,并预注册一个客观终点指标 | 代谢或生物力学终点指标、偏好的延迟一致性与所需时间;若无差异,手动自调就应当成为默认 |
| 在真人身上,采集函数之间的差异有多大? | 相同的界面与预算,把人随机分配到 qEUBO、对决 Thompson 采样、最大不确定挑战与随机查询 | 如果这些差异小于人与人之间的差异以及重测噪声,那么采集函数的选择在实践中就是次要问题 |
| 反应时在闭环中有多大价值? | 记录反应时;在闭环中,比较选择与反应时的联合似然(以这一对的总体价值为协变量)与概率单位似然 | 联合似然对留出配对的预测更好,且它所给出的停止时间与延迟重测的一致率相关 |
| 语言模型给出的标签能代替人给出的标签吗? | 相同的任务与同一个语言在回路的流程,分别由真人与用语言模型模拟的决策者作答;比较个体一致性、传递性、位置偏差与最终设计 | 如果个体层面的一致性接近 PRISM-X 中模拟用户的 0.11 至 0.22(人们自己的评分与排序之间的一致性为 0.57),模拟的评价就不能外推到真人(Kirk 等,2026)(预印本) |
| 缺少个体成对判断的公开数据集 | 构建一个带时间戳、呈现顺序、反应时、重复配对与延迟重测的公开数据集,涵盖感知参数、审美设计与设备调节 | 一旦有了它,就可以离线比较链接函数、噪声与漂移模型,以及模拟用户与真实用户之间的差距 |
| EUBO 的坍缩与秩亏的 Hessian 矩阵对真人是否造成任何代价? | 在同一个真人任务上,比较 EUBO、带连通性约束的 EUBO、按先验不确定性缩放的对角修正与精确知识梯度 | 如果这些修正带来显著更好的最终设计或延迟一致性,默认流程就需要改变 |
| 在人的噪声水平下,推断方法要紧吗? | 一个有真人参与的闭环实验,比较 Laplace 近似、期望传播、精确的偏斜高斯过程采样与幻觉信念 | 最终设计没有差异:关于推断的争论在实践中是次要的;有差异:默认实现应当被替换 |
| 为语言模型收集偏好数据时,主动选择何时胜过随机选择? | 相同的模型、标签与计算预算;比较带有显式认知不确定性与信息导向选择的奖励模型、基于不确定性选择的直接偏好优化隐式奖励,以及随机选择;报告胜率与通用能力 | 如果只有带显式后验的变体能可靠地胜过随机选择,那么收益就来自不确定性在何处得到表示 |
| 成对似然的停止规则 | 把成本感知的停止移植到成对似然上,并以延迟重测的一致率与此人的满意度来评判 | 如果移植过来的规则能节省比较次数,又不降低延迟一致率,它就可以成为默认的停止准则 |
手动调节对算法调节。在外骨骼调节中,用拇指杆调节 4 个髋部时机参数的人,约 11 分钟内使代谢消耗降低了 16.6%(Schäfer 等,2026),与其他使用不同设备和控制器的研究所报告的算法调节处于同一量级。还没有研究在相同的被试身上、以预注册终点指标(即在收集数据之前就确定的结果)为准比较过两者(第 33.3 节、第 24.5 节)。人适应设备需要约 109 分钟的辅助行走(Poggensee 与 Collins,2021),因此两种条件的先后顺序必须在被试之间平衡。
在真人身上比较采集函数。表中的候选有四种。一是基于决策论的 qEUBO(第 19.4 节)。二是对决 Thompson 采样:从后验中抽取一个随机样本,取该样本下的最优选项,再让它与和它对决结果最不确定的选项配对。三是最大不确定挑战:让后验均值最大的选项,与在模型看来和它比较结果最不确定的选项对阵。后两种都是较早的启发式方法(第 28.1 节)。四是作为对照的随机查询。我们没有找到在相同界面与预算下把人随机分配到不同采集函数的研究(第 28.9 节)。如果采集函数之间的差异最终小于人与人之间的差异以及重测噪声,那么在实践中,关于采集函数的工作就不如观测模型重要(推断)。
反应时、模拟用户与数据。反应时在真实的人类数据上改进了模型(Shvartsman 等,2024),但还没有在闭环优化中检验过。用语言模型模拟的用户几乎能完美复现群体层面的排序,但与个人的一致性按 Kendall (取值范围为 至 的一种秩相关)计只有 0.11 至 0.22(Kirk 等,2026),因此它们能否在偏好贝叶斯优化循环中代替真人,仍是未决问题(第 35.2.4 节)。一个包含表中所列时间与顺序信息的个体比较公开数据集,是这份清单中大多数离线比较的前提(第 31.5 节)。
默认流程。EUBO 向估计的最大值点坍缩的倾向,以及其孤立配对所导致的 Hessian 矩阵秩亏,记录于 2026 年的预印本(Wu 与 Gardner,2026;Shao 等,2026);Laplace 近似的误差则是在噪声很低时测量的(Takeno 等,2023)。表中的替代方案是期望传播、对偏斜高斯过程后验的精确采样(第 17 章),以及幻觉信念;幻觉信念把单个后验样本当作数据代入(第 19.3 节)。问题在于,这些失效在真人身上、在真实的噪声水平下,是否造成任何代价(第 27.6 节、第 27.4 节)。
语言模型与停止。对于在线直接偏好优化,一篇 2026 年的研讨会论文发现,主动选择相对随机选择的优势微乎其微(Oh 等,2026b);在奖励上引入显式后验能否改变这一点,仍是未决问题(第 35.3.5 节)。来自标量贝叶斯优化的停止规则(Wilson,2024;Xie 等,2026)还没有移植到成对似然上,第 46.6 节解释了人在每次查询上的成本为什么并不恒定。
第 47.3 节引用的文献 10
- Kirk 等人(2026)PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users
- Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
- Poggensee 与 Collins(2021)How adaptation, training, and customization contribute to benefits from exoskeleton assistance
- Shvartsman 等人(2024)Response Time Improves Gaussian Process Models for Perception and Preferences
- Wu 与 Gardner(2026)Knowledge Gradient for Preference Learning
- Shao 等人(2026)Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization
- Takeno 等人(2023)Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes
- Oh 等人(2026b)Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs
- Wilson(2024)Stopping Bayesian Optimization with Probabilistic Regret Bounds
- Xie 等人(2026)Cost-aware Stopping for Bayesian Optimization
47.4 判定实验 #
在上述所有问题中,有一个最能改变我们的认识:查询顺序是否会改变最终的偏好。它的答案将在对每次偏好贝叶斯优化会话的两种解读之间作出判定:一种是带噪声的偏好发现(noisy discovery),即反复的比较还原出原本就存在的偏好;另一种是偏好支架(preference scaffolding)或建构,即提问参与建构了它所测量的偏好(第 45.3 节)。这一实验还提供了判断系统引起的改变是否正当所需的对照(第 45.5 节),其重测也能把噪声与漂移区分开。截至 2026 年 9 月,还没有研究做过这个实验。
47.4.1 设计 #
大体而言,这一设计很简单。每个人都使用相同的候选空间与相同的比较预算。把被试随机分配到三种查询序列之一:由采集函数选择的序列、随机序列或按平衡顺序排列的序列。会话之前,记录每个人对自己的品味被改变所持的态度。在会话结束时以及一周后,不带系统框架,每个人在最终设计与自己早先拒绝的选项之间作选择。算法 47.1 补充了我们会选择的细节,其中每一个数字都是我们的建议(推断)。
- 任务。选择一个感知设计任务,使用一小组固定的渲染候选,例如视觉设计或照片调整的 4 至 6 个参数(第 25 章),使不同人的最终设计可以相互比较,任务也可以在线进行。
- 分组。把每个被试随机分配到三个组之一,各组使用相同的界面与相同的预算,例如 40 次比较:采集组(在
PairwiseGP上使用 qEUBO 或 EUBO)、随机组(均匀随机的配对)与平衡组(每个候选展示的次数相同,顺序在被试之间加以平衡)。每一组都用同一个模型计算最终设计与早期首选,使各组之间的差别只在于问了哪些问题。 - 会话之前。记录被试对自己的品味被改变所持的态度,以及其对该领域的熟悉程度。
- 会话期间。在所有组共用的固定位置上,插入两个安慰剂对,以及几个不同间隔下的重复配对。随机安排左右位置。记录每个回答及其时间与反应时。
- 早期首选。在第 10 个回答之后,记录后验均值最高的设计。
- 会话结束时的重测。会话一结束,就在一个没有标注、也没有历史记录的中性界面中,让最终设计分别与被试在前 10 个回答中拒绝的约 8 个设计对比,顺序与位置随机,并混入填充配对。询问被试是否认可最终设计。
- 延迟重测。一周后,用相同的配对重复第 6 步。
- 分析。在收集数据之前,预注册下文的假设、结果指标与分析方法。
47.4.2 如何判定 #
判定准则分为两部分。如果采集组的最终设计更靠近其自身早期的后验均值,并且其延迟重测的一致频率低于随机组,那么查询引起的改变就是回答中的一个实质性成分。如果最终设计的分布与延迟一致率在各组之间没有差异,那么带噪声的偏好发现就足以解释数据。
我们对图 45.2 中模型的分析提示了一项改进(推断)。在那个模型中,准则的后半部分,即直接比较两组的延迟一致率,即使引起的改变存在且会消退,也可能失效。在图的默认设置下,采集组的最终设计一周后仍比随机组的更常受到偏好(78% 对 73%),因为采集组在会话结束时达到了更高的一致率(88% 对 76%),而这一领先有一部分保留了下来。经得起检验的特征,是一致率从会话结束到延迟重测的下降,并在各组之间比较:采集组下降 10 个百分点,随机组下降 3 个百分点;把引起的改变设为零时,两组的下降都消失了。读者可以设置图中的滑块,读取重测面板,复现这一结果。
这一模型也显示了下降这一指标的局限。当引起的改变持久存在时(“持久部分”滑块设为 1),两组都不会下降,只有准则的前半部分,即最终设计靠近早期首选、各组最终设计的分布不同,仍能检测到它(习题 45.1)。因此,我们会预注册三个对比(推断):
- 主要对比:从会话结束时的重测到延迟重测的平均下降,采集组对随机组(即双重差分)。
- 次要对比:在各组之间比较最终设计与早期首选之间的距离以及最终设计的分布;直接比较各组的延迟一致率。
- 诊断:汇总所有组,按间隔统计重复配对的一致率,并统计安慰剂对上的虚假偏好率;二者如图 46.1 所示,用于区分噪声与漂移。
| 模式 | 解读 |
|---|---|
| 两组都没有下降,最终设计的分布相同 | 带噪声的偏好发现能解释数据 |
| 采集组的下降大于随机组 | 查询引起的改变,至少有一部分是暂时的 |
| 没有下降,但采集组的最终设计更靠近早期首选,且分布不同 | 查询引起的持久改变;它是否可以接受,是正当性问题,而不是测量问题 |
| 所有组的下降相等 | 不依赖于查询的漂移或疲劳 |
| 所有组在两次重测中的一致率都低,复杂配对上有许多“无法比较”的回答 | 噪声与不完备占主导 |
47.4.3 需要多少人 #
这个实验在设备上花费很少,在被试上却花费很大,因为主要结果是两个比例之差之间的一个小差异。图 47.1 给出了规划用的近似:一个人测得的下降会有波动,一是因为每个时间点只有少数几次重测选择,带有二项噪声,二是因为人与人不同;据此,标准的两样本检验所需的每组被试数如图中所标。
在默认值下(下降幅度相差 7 个百分点,每人 8 个重测对,一致率约 80%,人际差异为 0.1),每组约需 161 名被试才能达到 80% 的检验效能,三组共 483 名。把重测对加倍到 16 个,可将人数减至每组 97 名;差异为 10 个百分点、重测对为 16 个时,需要 48 名。重测对的数量是成本最低的调节手段:每一对只花几秒钟,而每增加一名被试,就要多一次会话和一周后的一次回访(推断)。这样的人数对于采用视觉任务的在线研究是可以达到的,对于使用设备的实验室研究则难以企及;这也是先在成本低的场合做这个实验的理由之一。
47.4.4 实践中的注意事项 #
任务应当低风险。这个实验有意包含一个可能比其他组更多地塑造偏好的组。选择在会话之外没有后果的设计任务,在知情同意中说明系统可能影响选择,并在延迟重测之后作事后说明,可以使实验保持在普通研究伦理的范围之内(推断)。
扩展。同一设计每增加一个组,就能回答本章的另一个问题:增加手动自调组,可以回答究竟是否需要算法;增加使用不同采集函数的组,可以回答它们在真人身上相差多少;增加一个提供“差不多”与“无法比较”两个额外回答的组,可以回答不完备回答是否应当成为默认。
为什么还没有人做。这个实验不需要新的方法,只需要下决心去测量系统对其所服务的人产生了什么影响。两次重测、随机组与态度问题,正是算法 46.2 为每次会话推荐的对照,因此一项已经遵循这些建议的研究,本身就已经包含了判定实验的大部分内容。
47.5 已定、有争议与缺失 #
已定。十八个问题中没有一个已定。已定的是它们所立足的基础:选择会大幅改变偏好;强制选择掩盖了不完备偏好;偏好反馈的遗憾界只有上界;PairwiseGP 的默认先验不随维度缩放;不连通的比较图使相对效用无法确定。
有争议。EUBO 的坍缩与秩亏的 Hessian 矩阵对真人是否要紧(2026 年的预印本);推断误差在人的噪声水平下是否要紧(两个研究组对怎样的检验才算贴近现实看法不一);在语言模型的在线偏好优化之外,随机选择是否也难以被超越(一篇研讨会论文)。
缺失。本章中每一个有真人参与的实验:随机化查询顺序与延迟重测;在相同被试身上以预注册终点指标比较手动调节与算法调节;在真人身上比较采集函数;用人的比较检验维度缩放先验;以及个体成对判断的公开数据集。在理论方面,缺少逻辑链接或概率单位链接下的下界。
47.6 展望:问题在何处日益重要 #
上面的未解决问题关乎尚属未知的内容。本节讨论哪些研究值得开展,是本书自己的观点,而不是对证据的总结:其中每一段都可以加上“(推断)”的标记,因此只在此处标注一次。
这里有必要区分两点。贝叶斯优化及其偏好变体,都是对同一个问题的回答:在每次评估都很昂贵时找到好的解;在偏好的情形下,唯一的测量工具是人的判断。第一点是,这一算法家族是否还有很大的发展空间。第二点是,它所回答的问题正变得更重要,还是更不重要。
算法家族。它的前景有限。核心已经成熟:有带多选项形式的决策论采集函数(第 19.4 节),有广泛使用的软件中的默认流程(第 31.1.1 节),还有在上界层面已赶上标量反馈的遗憾理论(第 29.4 节)。有真人参与的证据很少:在图 32.3 的证据图中,用户研究的被试人数中位数为 12,而更简单的方法常常同样好(第 45.1.5 节)。再多一个采集函数不太可能改变这一局面。更好的测量则有可能。
问题本身。它日益重要。系统越来越多地承担生成、适应与个性化的任务,而每一项都需要从少量判断中了解某一个具体的人想要什么。下面的方向是这一问题与研究机会交汇之处,大致从本书核心的测量问题开始,由内向外排列。每个方向都说明已有哪些工作、缺少什么,以及青睐怎样的技能组合。
47.6.1 偏好的测量科学 #
这是与本书论点最贴近的方向。观测模型,即大小恒定的概率单位噪声或逻辑噪声,从未在人类数据上与其他备选模型比较过;依赖比较难度的噪声、反应时、“分辨不出”的回答,以及会话中的漂移,都还是未决问题(第 47.1 节、第 27.2 节)。第 47.4 节的判定实验,即随机化查询顺序并在一周后重测,能把被发现的偏好与被塑造的偏好区分开,但还没有人做过。此外,目前没有个体成对判断的公开数据集(第 31.5 节),因此几乎每一次离线的方法比较都在模拟人身上进行。这项工作成本低,主要是用现有界面花费被试的时间;杠杆作用却很大,因为本书中的每一种方法都建立在观测模型之上。这一方向青睐既能设计严谨的真人实验、又能写出模型的研究者:人机交互或心理物理学,再加上概率机器学习。
47.6.2 个性化生成模型 #
基础模型对一般人喜欢什么是一个强先验,对某个具体的人喜欢什么则是一个弱先验。在这样的先验之上做少量精心选择的比较,恰好就是偏好优化的设定,而且这一先验远好于原始参数上的高斯过程。最早的系统已经出现:GimmBO 搜索 20 至 30 个扩散模型适配器的合并权重(Liu 等,2026b),MultiBO 每轮展示多张图像(Rajagopalan 等,2026),APPO 则隐藏文本提示词,只请人对图像做二元偏好判断,同时由语言模型改写提示词(Li 等,2026f)(第 32.1.6 节)。缺少的有三项:一是以生成模型本身作为代理模型,而不是在其潜空间上放一个高斯过程(第 30.5 节);二是在这类空间的 20 至 50 维上进行真人检验(第 30.3.4 节);三是能把此人特有的喜好与群体喜好区分开的评测(第 32.5 节)。这一方向青睐生成建模与贝叶斯优化、用户研究的结合。
47.6.3 为语言模型选择收集哪些比较 #
奖励模型与直接偏好优化从大规模成对比较中学习,面对的正是本书研究的问题:下一步问哪一对,以及何时停止(第 35.3.3 节、第 35.3.4 节)。这一设定在若干要紧之处有所不同:比较以百万计而不是几十次,评分者众多而不是一个人,目标是群体偏好(第 35.6.2 节)。在这种规模上,主动选择配对是否胜过随机配对,本身尚无定论(第 35.3.5 节);评分者之间的分歧可能是信号而不是噪声,这正是社会选择研究的问题(第 40.7 节)。大部分资金与关注都集中在这里。这一方向青睐大规模机器学习工程与主动学习理论的结合;评分者也是人,因此它也会从上述测量工作中获益。
47.6.4 穿戴在身上的设备 #
外骨骼、假肢、助听器与神经刺激,都具备偏好优化最能发挥作用的条件:比较是自然的,客观测量缓慢或昂贵,而人与人之间的差异超出任何群体默认值所能容许的范围。本书中最有力的真实世界证据就来自这里。贝叶斯优化在 21.4 ± 1.0 分钟内调好了软质外骨骼服的 2 个时机参数(Ding 等,2018);穿戴者用拇指杆遥控器自行调节 4 个参数,用时 10.9 分钟(Schäfer 等,2026);非处方助听器的预设选择已被表述为对决赌博机问题(Vyas 等,2022);一种接受偏好反馈的安全优化变体被用于脊髓刺激(Sui 等,2018b);一篇学位论文在人在回路中调节了视网膜假体的编码器(Fauvel,2021)(第 33 章)。缺少的有三项:在相同被试身上对手动调节与算法调节的正面比较(第 33.3 节),对身体始终安全的探索,以及在身体与偏好不断适应的过程中跟踪同一个人数周的研究。这一方向青睐生物力学或临床研究与安全、非平稳贝叶斯优化的结合。
47.6.5 模拟人与模型评判者 #
真人研究很昂贵,因此几乎每一次方法比较都使用模拟人(第 31.7 节),而如今语言模型还充当评判者与替身用户。一项测量显示了其中的风险:模拟用户几乎完美地复现了群体层面的排序,但与个人的一致性按 Kendall 计只有 0.11 至 0.22(Kirk 等,2026)(第 35.2.4 节)。如果模拟器包含顺序效应与漂移,并用真实的比较数据验证过,离线基准就会有信息量;未经验证的模拟器则使离线基准陷入循环论证。这一方向青睐用户建模与评测方法的结合,并依赖第一个方向将会产出的公开数据集。
47.6.6 专家在回路中的科学与工程 #
自驱动实验室如今会报告优化器比参照策略快多少达到目标(Adesiji 等,2026)。在目标无法用传感器测量的地方,专家判断有帮助,例如打印具有主观品质的物体(Deneault 等,2025);在产率可以测量的地方,专家判断则不及优化器(Shields 等,2021)(第 34.2 节)。缺少的有三项:把测量得到的目标与专家的成对偏好结合起来的模型,把专家时间计为成本的查询,以及回路中有不止一位专家的研究。这一方向青睐领域科学与多目标、成本感知贝叶斯优化的结合。
47.6.7 众人共用一个设置 #
共享办公室里的恒温器、推荐系统,或面向一个群体的设计,都由许多人的偏好同时调节(第 34.1.1 节)。聚合、公平与策略性回答,是社会选择研究了几十年的问题(第 40.7 节);从同一领域先前的人那里学到的先验,可以减少每个新来者需要回答的问题数(第 47.1 节)。这一方向青睐机制设计或社会选择与偏好学习的结合。
47.6.8 为实际部署的流程建立理论 #
核化偏好反馈的所有遗憾结果都是上界;在逻辑链接或概率单位链接下没有下界,而理论所分析的淘汰与乐观算法,也不是软件中运行的那种带 Laplace 近似的决策论采集(第 47.2 节)。对会话中漂移的偏好,几乎还没有理论。这一方向青睐学习理论,并要求与实践有足够的接触,以便分析实际部署的流程。
47.6.9 点击之外的信号 #
一次比较记录的不只是哪个选项胜出,还有此人用了多长时间、犹豫了多少。漂移扩散模型把选择与时间联系起来(第 39.3 节),反应时也在真实的人类数据上改进了模型(Shvartsman 等,2024),但还没有被用于选择下一次查询。眼动与生理信号也是候选。未决的问题是,这些信号中哪些在不同的人与界面之间是稳健的,以及它们能否改进查询的选择,而不只是改进拟合。这一方向青睐认知建模与贝叶斯优化的结合。
47.6.10 把干预当作设计问题 #
如果一次会话能改变偏好,系统就应当能检测到这种改变何时发生,研究也应当说明在什么条件下这种改变是可以接受的(第 45.5.2 节、第 41.2 节)。测量会话内的偏好改变,考虑这种改变的停止规则,以及向人展示其回答如何移动的界面,都是技术问题,而不只是伦理问题。这一方向青睐人机交互与统计学、道德哲学的结合。
| 方向 | 最重要的缺失环节 | 青睐的技能 | 起点 |
|---|---|---|---|
| 测量科学 | 在人类数据上检验过的观测模型;随机化的重测 | 真人实验 + 概率建模 | 第 47.4 节 |
| 生成模型 | 以生成模型作为代理模型;20 至 50 维中的检验 | 生成建模 + 贝叶斯优化 + 用户研究 | 第 32.1.6 节 |
| 语言模型的比较数据 | 主动选择配对在大规模下是否有帮助 | 大规模机器学习 + 主动学习 | 第 35.3.3 节 |
| 穿戴在身上的设备 | 在同一批人身上比较手动调节与算法调节 | 生物力学或临床研究 + 安全贝叶斯优化 | 第 33.3 节 |
| 模拟人 | 用个体数据验证过的模拟器 | 用户建模 + 评测 | 第 31.7 节 |
| 专家在回路 | 把测量得到的目标与专家偏好结合起来 | 领域科学 + 多目标贝叶斯优化 | 第 34.2 节 |
| 众人 | 共享设置下的聚合与公平 | 社会选择 + 偏好学习 | 第 40.7 节 |
| 理论 | 逻辑链接或概率单位链接下的下界 | 学习理论 | 第 47.2 节 |
| 点击之外的信号 | 用反应时来选择查询 | 认知建模 + 贝叶斯优化 | 第 39.3 节 |
| 干预 | 测量会话内的偏好改变 | 人机交互 + 统计学 + 伦理学 | 第 45.5.2 节 |
这些方向的共同之处,正是本书的论点。瓶颈已经从算法转移到测量,大部分有价值的工作,都位于严谨的真人实验与设定良好的模型相交之处。能同时做好这两件事的人很少,而这正是机会所在。
第 47.6 节引用的文献 13
- Liu 等人(2026b)GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization
- Rajagopalan 等人(2026)Personalized Image Generation via Human-in-the-loop Bayesian Optimization
- Li 等人(2026f)Preference-Guided Prompt Optimization for Text-to-Image Generation
- Ding 等人(2018)Human-in-the-Loop Optimization of Hip Assistance with a Soft Exosuit during Walking
- Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
- Vyas 等人(2022)Personalizing over-the-counter hearing aids using pairwise comparisons
- Sui 等人(2018b)Stagewise Safe Bayesian Optimization with Gaussian Processes
- Fauvel(2021)Human-in-the-loop optimization of retinal prostheses encoders
- Kirk 等人(2026)PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users
- Adesiji 等人(2026)Benchmarking self-driving labs
- Deneault 等人(2025)Preferential Bayesian optimization improves the efficiency of printing objects with subjective qualities
- Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis
- Shvartsman 等人(2024)Response Time Improves Gaussian Process Models for Perception and Preferences
47.7 结论 #
2017 至 2026 年间,偏好贝叶斯优化最大的变化不是出现了新的方法论范式,而是注意力的转移。采集函数获得了决策论基础,遗憾理论在上界层面赶上了标量反馈,软件则固定了一条默认流程。与此同时,人们发现这一默认流程的每一层都建立在未经检验的假设之上:长度尺度先验不随维度缩放;比较图不连通时,Laplace 近似是病态的;噪声恒定的概率单位链接从未在人类数据上与替代方案比较过。证据给出了工作的先后次序:先把观测模型和呈现给人的表示做对,再选择采集函数。
关于偏好本身,2017 年以来的证据既不支持纯粹的发现,也不支持纯粹的建构。一次成对判断包含稳定成分、结构化评价噪声、查询引起的改变,以及不完备或有意随机化的回答;其中哪一个占主导,取决于领域、选项的相似程度与会话长度。由此得出的实际结论是:一次偏好贝叶斯优化会话的输出既是估计,也是干预。一项研究如果不随机化查询顺序,也不在延迟之后重测,就无法分辨收敛的究竟是偏好,还是系统对此人的影响;区分两者所需的对照,正是判断这种影响是否正当所需的对照,因此方法论问题与规范性问题可以在同一个实验中得到回答(推断)。
文献中的三种立场由此得到了有限定的支持。偏好的层级观主张稳定性位于宽泛、抽象、自我报告的层面,这一点得到支持;它预测反复查询会收敛到潜在偏好,这一点则得不到支持(第 45.3.2 节)。偏好支架作为对偏好贝叶斯优化所做之事的描述,得到部分支持;但作为一种规范性立场,它需要正当性条件,而事后的认可本身无法提供这些条件(第 45.3.3 节)。至于偏好贝叶斯优化在超过 10 至 20 维时就不再奏效这一常见说法,它描述的是默认配置,而不是偏好反馈的极限(第 30.3.4 节)。
最有可能改变这些结论的工作有四项:随机化查询顺序并做延迟重测;在相同被试身上比较手动自调与算法调节;在 20 至 50 维的表示上用人的比较检验维度缩放先验;建立个体成对判断的公开数据集。前两项可以用现有的设备与界面完成,主要成本是被试的时间;第三项需要先做模拟,以排除默认先验这一混杂因素;第四项是本章中大多数离线比较的前提。在理论方面,最重要的空白是逻辑链接或概率单位链接下的下界。
在这些结果出现之前,证据支持一种审慎的做法:把偏好贝叶斯优化当作几种基线之一;为每一次会话加入测量环节,使它既测量设计,也测量人;并在每一项研究中,测量系统对其所学习的那些人产生了什么影响。
47.8 习题 #
利用图 47.1:一个团队在三组中总共能负担 300 名被试,预期下降幅度相差 7 个百分点。假设一致率约为 80%、人际差异为 0.1,要达到 80% 的检验效能,每人需要多少个重测对?如果人际差异为 0.15 呢?
解答
每组 100 名被试时,一个人下降幅度的方差 必须满足 ,因此 。人际差异为 0.1 时,二项部分 至多为 ,因此 :每人需要 16 个重测对(图中显示 16 对时每组需要 97 名)。人际差异为 0.15 时,二项部分至多为 ,因此 ,超出了图的范围。一旦人与人之间的差异占主导,再增加重测对也几乎无济于事,团队需要更多的被试或更大的预期效应。
以一个有两个参数(峰值力矩及其时机)的踝关节外骨骼为对象,为“算法调节胜过手动自调吗?”这一问题勾勒一个实验。实验有哪些组,顺序如何安排,主要终点指标是什么,对效度的主要威胁又是什么?
解答
采用被试内设计:每个被试都完成两种条件,即手动自调(像踝关节力矩的自调研究那样直接调节两个参数)与成对的偏好贝叶斯优化,时间预算相同,顺序在被试之间加以平衡。预注册的主要终点指标可以是用每种最终设置行走时的代谢消耗,在每种条件结束时的盲法验证阶段中测量;次要终点指标是收敛所需的时间,以及每个人偏好的延迟一致性。主要威胁是适应:人需要 100 分钟量级的辅助行走才能成为熟练用户(Poggensee 与 Collins,2021),因此需要在两种条件开始之前先安排熟悉期,并进行顺序平衡,以免学习效应偏向排在第二位的条件。
第 47.8 节引用的文献 1
- Poggensee 与 Collins(2021)How adaptation, training, and customization contribute to benefits from exoskeleton assistance
延伸阅读 #
- Carroll 等人(2024)与 Dean 与 Morgenstern(2022)解释了当系统能够移动其所测量的偏好时,查询顺序为什么不是细枝末节。
- Keswani 等人(2026)对跨会话重复成对回答的不稳定性所做的测量,是现有研究中最接近的一项,也可作为判定实验中重测的范本。
- Schäfer 等人(2026)是目前表明简单基线可以与算法调节相匹敌的最有力证据,也是手动调节实验的起点。
- Kayal 等人(2025)与 Lazzaro 等人(2026)给出了当前最好的上界及其条件,未来的下界需要与之匹配。
参考文献
- (2026). Benchmarking self-driving labs. Digital Discovery. 引用于 §47.6
- (2024). AI Alignment with Changing and Influenceable Reward Functions. International Conference on Machine Learning.
- (2022). Preference Dynamics Under Personalized Recommendations. EC 2022.
- (2025). Preferential Bayesian optimization improves the efficiency of printing objects with subjective qualities. Digital Discovery. 引用于 §47.6
- (2018). Human-in-the-Loop Optimization of Hip Assistance with a Soft Exosuit during Walking. Science Robotics. 引用于 §47.6
- (2021). Choice changes preferences, not merely reflects them: A meta-analysis of the artifact-free free-choice paradigm. Journal of Personality and Social Psychology. 引用于 §47.1
- (2021). Human-in-the-loop optimization of retinal prostheses encoders. Sorbonne Université. 学位论文引用于 §47.6
- (2024). Vanilla Bayesian Optimization Performs Great in High Dimensions. International Conference on Machine Learning. 引用于 §47.2
- (2025). Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds. International Conference on Machine Learning. 引用于 §47.2
- (2026). Moral Change or Noise? On Problems of Aligning AI With Temporally Unstable Human Feedback. AAAI.
- (2026). PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users. arXiv. 预印本引用于 §47.3 §47.6
- (2026). A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback. International Conference on Artificial Intelligence and Statistics.
- (2026f). Preference-Guided Prompt Optimization for Text-to-Image Generation. CHI 2026. 引用于 §47.6
- (2026b). GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization. ACM Transactions on Graphics. doi:10.1145/3811293. 引用于 §47.6
- (2026). Revealed Incomplete Preferences. Working paper (author's website). 工作论文引用于 §47.1
- (2017). The evolution of paired preference tests from forced choice to the use of‘No Preference’options, from preference frequencies to d′ values, from placebo pairs to signal detection. Trends in Food Science & Technology. 引用于 §47.1
- (2026b). Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs. ICLR 2026 Workshop: I Can't Believe It's Not Better (ICBINB). 研讨会论文引用于 §47.3
- (2022). Indifference, indecisiveness, experimentation, and stochastic choice. Theoretical Economics. 引用于 §47.1
- (2021). How adaptation, training, and customization contribute to benefits from exoskeleton assistance. Science Robotics. 引用于 §47.3 §47.8
- (2026). Personalized Image Generation via Human-in-the-loop Bayesian Optimization. International Conference on Machine Learning. 引用于 §47.6
- (2026). User preference-based human-in-the-loop tuning of exoskeleton assistance during walking. npj Biomedical Innovations. doi:10.1038/s44385-026-00085-7. 引用于 §47.3 §47.6
- (2026). Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization. arXiv. 预印本引用于 §47.3
- (2021). Bayesian reaction optimization as a tool for chemical synthesis. Nature. 引用于 §47.6
- (2024). Response Time Improves Gaussian Process Models for Perception and Preferences. Uncertainty in Artificial Intelligence. 引用于 §47.3 §47.6
- (2018b). Stagewise Safe Bayesian Optimization with Gaussian Processes. International Conference on Machine Learning. 引用于 §47.6
- (2023). Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes. International Conference on Machine Learning. 引用于 §47.3
- (2020). Stability and change of basic personal values in early adolescence: A 2‐year longitudinal study. Journal of Personality. 引用于 §47.1
- (2018). Stronger shared taste for natural aesthetic domains than for artifacts of human culture. Cognition. 引用于 §47.1
- (2022). Personalizing over-the-counter hearing aids using pairwise comparisons. Smart Health. doi:10.1016/j.smhl.2021.100231. 引用于 §47.6
- (2024). Stopping Bayesian Optimization with Probabilistic Regret Bounds. NeurIPS 2024. 引用于 §47.3
- (2026). Knowledge Gradient for Preference Learning. arXiv. 预印本引用于 §47.3
- (2026). Cost-aware Stopping for Bayesian Optimization. International Conference on Machine Learning. 引用于 §47.3
- (2024). Value construction through sequential sampling explains serial dependencies in decision making. eLife. doi:10.7554/eLife.96997. 引用于 §47.1