贝叶斯优化
第十部分:综合
EN

一次比较测量什么

偏好贝叶斯优化请人比较选项,以此寻找此人最喜欢的设计。每个设计都对应一个无法直接观测的数值,即此人对该设计的效用(utility);统计模型把每个回答看作对两个效用的一次带噪声的比较。默认的做法是为效用函数赋予高斯过程先验(光滑函数上的一种分布),再用概率单位链接把两个效用之差转换为选择概率(第 16 章、第 18 章)。采集函数(acquisition function)负责选出下一对选项(第 19 章);经过几十至两百个左右的回答,估计效用最高的设计即为结果。

这一模型假定效用函数固定不变,噪声大小恒定。本章汇集前面各部分就这一假设得到的结果,以回答一个朴素的问题:对“你更喜欢哪一个?”的一次回答,究竟测量了什么?我们的回答是:它同时测量了四个成分,因此一次偏好贝叶斯优化会话既是对偏好的估计,也是对偏好的干预。凡属我们自己的推断,句末都标有“(推断)”。

45.1 瓶颈已经转移 #

2017 至 2026 年间,该领域的大部分精力投入在采集函数与遗憾理论上,两者都有了进展。如今,瓶颈已经从算法转移到测量:一次比较究竟测量了什么,回答应当如何建模,提问本身又会对回答者产生什么影响。目前最大的误差出在两处:一是观测模型(observation model),即模型中描述回答如何由效用产生的部分;二是方法在真人身上的评测方式。

45.1.1 采集函数:从启发式到决策理论 #

2017 至 2021 年间常用的采集规则改编自标量贝叶斯优化(第 28.1 节)。四个相互独立的研究组报告,其中一种规则,即修改后的期望改进,会停滞不前(第 28.4 节);在一个专门构造的实例上,批量期望改进不具有渐近一致性,即使查询次数不受限制,也未必能找到最优选项(Astudillo 等,2023)。取代这些启发式规则的是最优选项期望效用(expected utility of the best option,EUBO):对一对选项,以此人将会选中的那一个的期望效用作为得分(第 19.4 节)。qEUBO 是它的多选项形式。EUBO 是一步贝叶斯最优的,即假如只剩一个问题可问,按它提问就是最好的选择。这一性质在决策分析中有更早的渊源:最适合推荐的选项集合,在短视意义下也是最适合用来提问的集合(Viappiani 与 Boutilier,2020)。EUBO 的缺陷记录于 2026 年的两篇预印本:查询向估计的最大值点坍缩;所选的配对往往在比较图中形成孤立的片段,导致 Laplace 近似的 Hessian 矩阵秩亏(Wu 与 Gardner,2026;Shao 等,2026)。第 19.6 节详述了这两个问题,第 19.5.1 节则在一次有记录的模拟中展示了类似的坍缩。

采集函数的排名会随评价指标、噪声模型与推断方法的不同而翻转。在提出乐观算法 POP-BO 的论文中,qEUBO 的最终解略好,但其累积遗憾(即沿途所展示选项的差距之和,第 13 章)却是 POP-BO 的 2.5 倍以上(Xu 等,2024b)。基于 BoTorch 中 PairwiseGP 模型的 qEUBO 是维护最完善的默认实现(第 27.5 节),但这一地位得自软件生态,而非与更简单方法的比较。

45.1.2 理论:成熟、附带条件、仅有上界 #

偏好反馈的遗憾理论已经成熟,但每个结果都附带条件,而且全部是上界,即保证遗憾随查询次数 TT 增长的速度不超过某一速率。其中有两个量反复出现。γT\gamma_T 是核函数的最大信息增益:设函数从高斯过程先验中抽取,它衡量 TT 个带噪声的观测能揭示该函数多少信息(第 6.5 节)。κ\kappa 是链接函数斜率倒数的上界;当选择概率在 0 或 1 附近饱和时,它会变得很大(第 29.5 节)。在序贯算法中,最大最小下置信界算法(MaxMinLCB)与偏好反馈下的 Thompson 采样(PF-TS)的偏好概率遗憾为 O~(γTT)\tilde O(\gamma_T \sqrt{T})(O~\tilde O 忽略对数因子),常数随 κ\kappa 增大(Pásztor 等,2024;Lazzaro 等,2026);一种分批算法只有在附加条件下才能做得更好(Kayal 等,2025)(第 29.4 节)。在逻辑链接或概率单位链接下,尚无核化的下界(第 29.7 节)。此外,理论所覆盖的是建立在频率派核估计量之上的淘汰式、乐观式与 Thompson 采样式算法;实践中运行的却是 Laplace 后验加 EUBO,对后者只有一步最优性与有限定义域上的一致性结果。没有任何结果把两者联系起来(推断)。

一次比较是否比一个数值观测更昂贵,取决于目标。若目标是单个固定效用下的遗憾,有限臂、线性与核三种设定下的上界都表明,成对比较在阶上并不更昂贵。若目标是识别一个异质的群体,成对数据就是最弱的反馈:拟合二元比较的模型隐含地按 Borda 计数聚合,即按每个选项胜过其他选项的平均概率为其打分(Siththaranjan 等,2024);要识别潜在的用户类型,则需要至少三个选项的排序(Chidambaram 等,2026)。

45.1.3 观测模型是主要瓶颈 #

噪声恒定的概率单位链接仍是默认选择;对它的扩展大多出自同一个研究组,且每项扩展只经过一次评测(第 27 章)。人的回答与“固定效用加大小恒定的噪声”相去甚远。据一篇 2026 年的预印本,20 名受过设计训练的人评判相同的 600 对生成界面,其一致性按 Krippendorff α\alpha 计为 0.25;该指标经过机会校正,0 表示随机水平,1 表示完全一致(Peng 等,2026)。35 名化学家之间的同类指标 Fleiss κ 在两轮中分别为 0.40 与 0.32(Choung 等,2023)。相同的道德成对问题在会话内和会话间重复提出时,平均有 6% 至 20% 的回答发生翻转(Keswani 等,2026)。在视网膜植入物的优化中,视力正常的被试与本应代替他们的模拟智能体只在约 50% 的选择上一致(Schoinas 等,2025)。一项关于风险偏好稳定性的元分析估计了信度(对同一批人在相近时间所做两次测量之间的相关):自我报告的冒险倾向为 0.61,行为测量(如在彩票之间做选择这类标准化任务)只有 0.25(Bagaïni 等,2025)。成对选择属于行为测量,因此在比较之外附加几个陈述偏好问题,或许能承载其中的稳定成分(推断)。图 45.1 把这些数字并列在一起。

随机水平,或无稳定信号完全一致不同的人,相同的配对设计者,生成的界面0(随机水平)1(完全一致)0.25化学家,分子0(随机水平)1(完全一致)0.32 与 0.40同一个人,再问一次同一个问题道德问题,再问一次50%(掷硬币)0%(从不翻转)6% 至 20%模拟替身与真人对比视网膜植入物,模拟智能体50%(随机水平)100%(总是一致)约 50%同一批人测两次(风险偏好)自我报告的冒险倾向0(无稳定信号)1(完全一致)0.61行为选择(彩票)0(无稳定信号)1(完全一致)0.25设计者,生成的界面:Krippendorff α,0.25量表从 0(随机水平)到 1(完全一致);该值位于 25% 处。20 名受过设计训练的人评判了相同的 600 对生成界面(Peng 等,2026 年的预印本)。
随机水平,或无稳定信号完全一致不同的人,相同的配对设计者,生成的界面0(随机水平)1(完全一致)0.25化学家,分子0(随机水平)1(完全一致)0.32 与 0.40同一个人,再问一次同一个问题道德问题,再问一次50%(掷硬币)0%(从不翻转)6% 至 20%模拟替身与真人对比视网膜植入物,模拟智能体50%(随机水平)100%(总是一致)约 50%同一批人测两次(风险偏好)自我报告的冒险倾向0(无稳定信号)1(完全一致)0.61行为选择(彩票)0(无稳定信号)1(完全一致)0.25设计者,生成的界面:Krippendorff α,0.25量表从 0(随机水平)到 1(完全一致);该值位于 25% 处。20 名受过设计训练的人评判了相同的 600 对生成界面(Peng 等,2026 年的预印本)。
图 45.1 人的回答有多一致:本节所引各项研究的结果。每一行是一个不同的统计量,各有其量表,并经过伸缩,使随机水平(或无稳定信号)位于左端,完全一致位于右端。每一行只能读出它在两端之间的位置,行与行之间不能比较大小。翻转越少意味着越一致,因此翻转率按反向绘制。选择一行,可查看对应的研究与统计量。

可以尝试以下几点:

  • 选择翻转率一行。6% 至 20% 的翻转率意味着同一个人会重复自己 80% 至 94% 的回答;靠掷硬币作答的人只会重复 50%。
  • 比较两行信度。两者出自同一项元分析,使用同一个统计量,因此可以相互比较:自我报告的信度(0.61)是行为测量(0.25)的两倍多。

采集函数的模拟研究预设了观测模型,因而无法测量该模型本身有误所带来的误差;与再提出一个采集函数相比,改进似然更有可能改变研究结论(推断)。在无需此人额外付出努力的信号中,反应时(Shvartsman 等,2024;Li 等,2024a)与自述的把握度(Zhang 等,2026b)已在真实的人类数据上改进了模型,但目前仅限于离线拟合,尚未用于闭环优化。

45.1.4 样本小,评测弱 #

交互式设计中采用纯偏好反馈的研究大多招募 6 至 60 人,其他领域的应用研究招募 1 至 35 名评价者,中位数低于 10;验证几乎都是内部的,即由同一个人在事后选出结果(第 32 章、第 34.4 节)。基准同样薄弱:使用 1 至 8 维的标量测试函数,至少六种噪声模型与五种遗憾定义并存,没有共享的基准,也没有个体层面成对判断的公开数据集(第 31 章)。即使是专家自己的代价函数,也可能与其选择不符。一篇 2025 年的预印本报告了一项只有一名专家操作员的机器人调试研究:这位专家设计的代价函数并未完全刻画其本人的选择,即使把权重重新拟合到专家评分最高的那些实验上也是如此(De Witte 等,2025)。因此,由隐藏代价函数定义的合成决策者,可能会高估方法在真人身上的效果(推断)。

45.1.5 更简单的方法常常同样好 #

在若干设定中,更简单的方法表现相当。自行调节外骨骼的人在约 11 分钟内达到的代谢节省,与算法调节处于同一量级(Schäfer 等,2026);采用球面输入映射的贝叶斯线性回归在高维基准上达到了最先进水平(Doumont 等,2026);一篇 2026 年的研讨会论文发现,在语言模型的在线直接偏好优化中,随机选择很难被超越(Oh 等,2026b);摊销式优化器偏好摊销黑箱优化(PABBO)的作者也写道,随机策略常常胜过某些高斯过程基线(Zhang 等,2025a)。理论指出了偏好贝叶斯优化的优势必然来自何处:根据带噪声的比较主动为项目排序时,Bradley-Terry 或 Thurstone 这类参数假设至多带来对数级的增益(Heckel 等,2019)。因此,偏好贝叶斯优化的样本效率应当主要来自核函数在相邻设计之间共享信息,而不是来自链接函数(推断)。

因此,偏好贝叶斯优化仍有证据支持的设定相当狭窄:选项只能通过感知上的比较来评判,没有数值目标,经过表示设计后维度已经很低,预算为几十至约两百次比较。第 46.9 节把这一结论转化为建议,其中包括一项研究在声称偏好贝叶斯优化具有优势之前必须设置哪些基线。

要点误差何在

采集函数如今有了决策论基础,遗憾界也已追平标量反馈;但最要紧的误差来自模型对人的假设,而在观测模型已知的模拟中,这种误差无从显现(推断)。

第 45.1 节引用的文献 24
  1. Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
  2. Viappiani 与 Boutilier(2020)On the equivalence of optimal recommendation sets and myopically optimal query sets
  3. Wu 与 Gardner(2026)Knowledge Gradient for Preference Learning
  4. Shao 等人(2026)Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization
  5. Xu 等人(2024b)Principled Preferential Bayesian Optimization
  6. Pásztor 等人(2024)Bandits with Preference Feedback: A Stackelberg Game Perspective
  7. Lazzaro 等人(2026)A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback
  8. Kayal 等人(2025)Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds
  9. Siththaranjan 等人(2024)Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
  10. Chidambaram 等人(2026)Direct Preference Optimization with Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences
  11. Peng 等人(2026)Efficient Personalization of Generative User Interfaces
  12. Choung 等人(2023)Extracting medicinal chemistry intuition via preference machine learning
  13. Keswani 等人(2026)Moral Change or Noise? On Problems of Aligning AI With Temporally Unstable Human Feedback
  14. Schoinas 等人(2025)Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants
  15. Bagaïni 等人(2025)A systematic review and meta-analyses of the temporal stability and convergent validity of risk preference measures
  16. Shvartsman 等人(2024)Response Time Improves Gaussian Process Models for Perception and Preferences
  17. Li 等人(2024a)Enhancing Preference-based Linear Bandits via Human Response Time
  18. Zhang 等人(2026b)Vibrotactile Preference Learning: Uncertainty-Aware Preference Learning for Personalized Vibration Feedback
  19. De Witte 等人(2025)How to Capture Human Preference: Commissioning of a Robotic Use-Case via Preferential Bayesian Optimisation
  20. Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
  21. Doumont 等人(2026)We Still Don't Understand High-Dimensional Bayesian Optimization
  22. Oh 等人(2026b)Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs
  23. Zhang 等人(2025a)PABBO: Preferential Amortized Black-Box Optimization
  24. Heckel 等人(2019)Active ranking from pairwise comparisons and when parametric assumptions do not help

45.2 各学科改变了什么 #

第九部分汇集了心理学、经济学、神经科学等领域关于偏好的研究结果。2017 年以来,其中一些在预注册复现(在收集数据之前就确定假设与分析方法的研究)中失败,或在校正发表偏倚的元分析中效应缩小;另一些则得到加强,并有了可以写进似然的机制。表 45.1 与表 45.2 只列出对偏好优化有直接影响的结果,两表的最后一列都是我们的推断。效应量 dd 与 gg 以标准差为单位表示条件之间的差异,因此 d=0.06d = 0.06 相当于二十分之一个标准差,d=0.40d = 0.40 是中等效应。

表 45.1 2017 年后被削弱的偏好研究结果及其对偏好贝叶斯优化的含义(最后一列:推断)。
结果 现状 关键证据 对偏好贝叶斯优化的含义(推断)
自我损耗与领域一般性的决策疲劳:做决定会消耗某种有限的资源 削弱至接近零 36 个实验室,d=0.06d = 0.06(Vohs 等,2021);231,076 次分诊电话未显示决策疲劳(Andersson 等,2025) 不应据此设定会话长度;应在任务中测量疲劳
诱导服从失调:人会改变态度,使之与自己被诱导做出的行为一致 未能复现 39 个实验室,N=4,898N = 4{,}898(Vaidis 等,2024) 用再评价而非经典失调来解释选择后的偏好改变
个体内的道德许可:做过好事之后,便允许自己随后失德 偏倚校正后接近零;仅在被人观察时留有声誉效应 gg 在 −0.08-0.08 至 −0.02-0.02 之间(Rotella 等,2026) 在私下进行的会话中,不应为相继回答之间的补偿建模
心境即信息:把当前心境当作关于选项的证据 大幅削弱 9 次复现中多数不显著(Yap 等,2017) 不应按心境安排探索
在最优点附近,价值辨别能力变差 对价值判断不成立;对感知参数成立 在高价值选项之间做决定更快、更准确(Shevlin 等,2022) 接近收敛时价值比较可能变得更准确;感知参数仍以最小可觉差为下限
损失厌恶系数约为 2.25 数值不稳定 元分析均值 1.955(Brown 等,2024);在对称且未排序时约为 1.07(Yechiam 与 Zeif,2025) 不应围绕当前最优点设定固定的不对称似然
吸引(诱饵)效应:加入一个被支配的选项,会抬高与之相近的选项 仅限于以数字呈现的属性 Frederick 等人(2014) 这一机制在感知设计中很弱
表 45.2 2017 年后得到加强或新出现的偏好研究结果及其对偏好贝叶斯优化的含义(最后一列:推断)。
结果 现状 关键证据 对偏好贝叶斯优化的含义(推断)
选择引起的偏好改变:选择一个选项会提高它对选择者的价值 得到加强 d=0.40d = 0.40(Enisman 等,2021);每次选择使被选物品的价值增加约 $0.18(Zylberberg 等,2024) 在似然中加入选择历史项;被比较最多的当前最优点受影响最大
范围归一化:价值按所提供选项的范围作相对编码 得到加强 Bavard 等人(2018);Bavard 与 Palminteri(2023) 效用的尺度是相对于会话而言的;跨会话复用前需重新校准
价值噪声的有效编码:精度集中分配给人预期会遇到的价值 新出现并得到加强 Polanía 等人(2019);Prat-Carrabin 与 Woodford(2022) 噪声随所呈现的价值缩放,固定噪声会误判会话后期的精度
随机效用一致性:重复选择的表现如同从效用的分布中抽取而得 对多数人得到加强;观察到的不可传递性有一部分是真实的 141 名被试中多数满足随机效用(McCausland 等,2020);借助反应时区分噪声与偏好后,两个数据集中分别有 19.24% 与 39.58% 的传递性违背属于真实违背,其余部分两种情况都有可能(Alós-Ferrer 等,2023);噪声的设定会改变推断结论(Bhatia 与 Loomes,2017) 标量效用加噪声适用于多数人,但链接与噪声的形式是实质性的建模选择
不完备偏好与有意的随机化 得到加强,但有限度 允许时,40% 至 50% 的被试报告了不完备,平均为 50 次比较中的 3.3 次(Nielsen 与 Rigotti,2026);约一半人的选择不符合完备偏好加确定性独立,后者是关于把选项与确定结果相混合的一条公理(Cettolin 与 Riedl,2019);多数人选择随机化(Agranov 与 Ortoleva,2025) 提供“无法比较”的回答,并与平局、噪声分开建模
每次比较的信息量 至多 1 比特,但错误率与数值评分处于同一量级 Shah 等人(2016) 决定误差的是比较图的结构,而不是每次查询的比特数

其中两项研究是工作论文(Alós-Ferrer 等,2023;Nielsen 与 Rigotti,2026)。各行在第九部分中有详细讨论:疲劳见第 37.2.1 节,道德许可见第 38.5 节,心境见第 38.4 节,损失厌恶见第 40.1 节,情境效应见第 37.2.3 节,选择引起的改变见第 37.2.2 节,范围归一化见第 37.3.1 节,有效编码见第 39.4 节,随机效用见第 37.4.1 节,不完备偏好见第 40.4 节与第 43.4.2 节。

这些变化有规律可循(推断)。被削弱的大多是两类论据:一类支持会话设计规则(按决策疲劳设定会话长度,按心境安排查询),另一类为方向性偏差设定固定数值(损失厌恶系数、道德许可中的补偿)。得到加强的则是有明确大小、能够对应到似然中某一部分的机制。因此,证据支持的做法是保留少数几种机制,在每个任务中估计其方向与大小,而不是为每一种有记录的偏差各加一个似然项。

偏好贝叶斯优化尚未采用的形式化工具。有五类结果可以用于偏好贝叶斯优化,但截至 2026 年 9 月,我们没有找到使用它们的偏好贝叶斯优化论文:

  1. 比较图理论:比较图 Laplace 矩阵的谱与有效电阻决定成对估计的误差(Shah 等,2016;Hendrickx 等,2019),Hodge 分解(Hodge decomposition)则把比较数据分成两部分,即可由标量效用解释的部分,以及任何标量效用都无法解释的循环部分(Jiang 等,2011;Strang 等,2022)(第 43.3.1 节、第 43.3.2 节);
  2. 表演性预测:区分对目标的学习与对目标的引导(Perdomo 等,2020;Hardt 与 Mendler-Dünner,2025)(第 42.2 节);
  3. 针对诱导偏好偏移的信赖域(Carroll 等,2022):偏好会向系统所展示的内容移动,此时只需移动偏好就能轻易实现低遗憾(Dean 与 Morgenstern,2022),因此需要这种约束;
  4. 行为福利经济学:只有当另一个选项在任何框架下都未被优先选中时,才认为某一选项更有利于此人的福利(Bernheim 与 Rangel,2009),并测量因误解后果而导致的福利损失(Ambuehl 等,2022);
  5. 不完备偏好的多效用表示:只有当一组效用一致认为某一选项更好时,它才算更好(Evren 与 Ok,2011),相关的可识别性结果还能区分无差异、犹豫不决与尝试(Ok 与 Tserenjigmid,2022)。

第一类与最后一类无需新的理论即可直接用于偏好贝叶斯优化的日志与后验,因此应当从这两类入手(推断)。与此相关的一点是:把单个 Bradley-Terry 效用拟合到多人汇总的比较上,本身就是一种聚合规则,而这种规则违反 Pareto 最优性与成对多数一致性(Ge 等,2024)。

第 45.2 节引用的文献 34
  1. Vohs 等人(2021)A Multisite Preregistered Paradigmatic Test of the Ego-Depletion Effect
  2. Andersson 等人(2025)No evidence for decision fatigue using large-scale field data from healthcare
  3. Vaidis 等人(2024)A Multilab Replication of the Induced-Compliance Paradigm of Cognitive Dissonance
  4. Rotella 等人(2026)Observation Moderates the Moral Licensing Effect: A Meta-Analytic Test of Interpersonal and Intrapsychic Mechanisms
  5. Yap 等人(2017)The effect of mood on judgments of subjective well-being: Nine tests of the judgment model
  6. Shevlin 等人(2022)High-value decisions are fast and accurate, inconsistent with diminishing value sensitivity
  7. Brown 等人(2024)Meta-analysis of Empirical Estimates of Loss Aversion
  8. Yechiam 与 Zeif(2025)Loss aversion is not robust: A re-meta-analysis
  9. Frederick 等人(2014)The Limits of Attraction
  10. Enisman 等人(2021)Choice changes preferences, not merely reflects them: A meta-analysis of the artifact-free free-choice paradigm
  11. Zylberberg 等人(2024)Value construction through sequential sampling explains serial dependencies in decision making
  12. Bavard 等人(2018)Reference-point centering and range-adaptation enhance human reinforcement learning at the cost of irrational preferences
  13. Bavard 与 Palminteri(2023)The functional form of value normalization in human reinforcement learning
  14. Polanía 等人(2019)Efficient coding of subjective value
  15. Prat-Carrabin 与 Woodford(2022)Efficient coding of numbers explains decision bias and noise
  16. McCausland 等人(2020)Testing the Random Utility Hypothesis Directly
  17. Alós-Ferrer 等人(2023)Identifying Nontransitive Preferences
  18. Bhatia 与 Loomes(2017)Noisy preferences in risky choice: A cautionary note
  19. Nielsen 与 Rigotti(2026)Revealed Incomplete Preferences
  20. Cettolin 与 Riedl(2019)Revealed preferences under uncertainty: Incomplete preferences and preferences for randomization
  21. Agranov 与 Ortoleva(2025)Ranges of Randomization
  22. Shah 等人(2016)Estimation from Pairwise Comparisons: Sharp Minimax Bounds with Topology Dependence
  23. Hendrickx 等人(2019)Graph Resistance and Learning from Pairwise Comparisons
  24. Jiang 等人(2011)Statistical ranking and combinatorial Hodge theory
  25. Strang 等人(2022)The Network HHD: Quantifying Cyclic Competition in Trait-Performance Models of Tournaments
  26. Perdomo 等人(2020)Performative Prediction
  27. Hardt 与 Mendler-Dünner(2025)Performative Prediction: Past and Future
  28. Carroll 等人(2022)Estimating and Penalizing Induced Preference Shifts in Recommender Systems
  29. Dean 与 Morgenstern(2022)Preference Dynamics Under Personalized Recommendations
  30. Bernheim 与 Rangel(2009)Beyond Revealed Preference: Choice-Theoretic Foundations for Behavioral Welfare Economics *
  31. Ambuehl 等人(2022)Evaluating Deliberative Competence: A Simple Method with an Application to Financial Choice
  32. Evren 与 Ok(2011)On the multi-utility representation of preference relations
  33. Ok 与 Tserenjigmid(2022)Indifference, indecisiveness, experimentation, and stochastic choice
  34. Ge 等人(2024)Axioms for AI Alignment from Human Feedback

45.3 发现,还是建构?#

这些结果背后是一个老问题:反复比较是发现了原本就存在的偏好,还是在一定程度上建构了它?建构观(constructive view)认为,偏好是在引出过程中建构起来的,因此测量会改变被测量的对象;稳定观(stable view)认为,存在一个潜在的偏好,仔细的测量能够将其还原。无论使用者是否意识到,偏好优化都已经站在了其中一边。2017 年以来的证据使两种观点各有一部分得以成立,但不支持任何一个极端。

45.3.1 两种观点各自保留了什么 #

建构观保留了其核心主张:引出过程会改变被测量的对象,改变幅度相当大,而且是通过可以建模的机制。选择一个选项会提高它的价值(表 45.2);一项研究请 59 人为 55 张形变合成的狗图像评分,带学习成分的个体模型对真实呈现顺序所解释的方差,平均比对模拟随机顺序多 17%(Brielmann 等,2024);强制选择则会制造出一部分不一致,这些不一致本来会表现为犹豫(Costa-Gomes 等,2022)。建构观也失去了一些支持性的论据:一项元分析与大规模复现没有发现无意识思维的优势(Nieuwenstein 等,2015);诱导服从效应与心境效应未能复现或已经缩小(表 45.1);Ruth Chang 关于艰难选择的研究,有时被解读为把在“对等”(on a par)选项之间的强制选择视为范畴错误,实际上它把这样的选择看作作出承诺的契机(Chang,2024)。

稳定观保留的主张是:存在一个值得估计的成分。多数人的重复选择满足随机效用(McCausland 等,2020);一篇工作论文发现,在群体层面,行为偏差在 3 年间几乎没有变化(Stango 与 Zinman,2024);风险选择中的一些异常,看起来是对复杂选项估值的错误,而不是偏好本身(Oprea,2024),尽管这一结论尚有争议。稳定观失去的是它最有力的推论,即反复查询会收敛到真实的潜在偏好。Plott 的“被发现的偏好”(discovered preference)假说,只在强制交易之后,或在人们反思了自己认可的公理之后才被观察到(Nielsen 与 Rehbeck,2022;Engelmann 与 Hollard,2010),并非反复比较的自然结果。在现场应用中,偏好贝叶斯优化循环常常在收敛之前就已结束:在一次为期 3 个月的部署中,大多数评价序列在第一次迭代时就停止了(Ou 等,2022)(第 46.6 节)。

45.3.2 层级观 #

这场争论中有一种立场,我们称之为层级观(hierarchical view):对终极目标(舒适、安全、美)的偏好始终存在,而对中间结果(例如某一具体的参数设置)的偏好可能需要引出。作为对稳定性所在层面的描述,层级观大体得到证据支持:稳定性集中在宽泛、抽象、自我报告的层面;一项针对青春期早期的纵向研究发现,75% 的受访者,其价值层级在 2 年间的相关至少为 0.85(Vecchione 等,2020)。

作为对偏好贝叶斯优化的预测,层级观的表现则差一些。选择过程中计算的价值是相对于当前目标而言的:与目标的一致程度比奖励价值更能解释选择及其神经相关物(Frömer 等,2019),因此,稳定的终极目标未必会转化为成对比较上的稳定效用(推断)。反复查询从未被观察到收敛(第 45.3.1 节)。又由于稳定性是用自我报告测量的,而建构是用选择测量的,第 47.1 节描述了一项能在同一设计任务上检验这两个层级的研究。理性疏忽理论认为人以最优方式分配代价高昂的注意力。该理论也并不像层级观的辩护者有时所说的那样,唯独导出逻辑链接:只有在信息成本取 Shannon 熵时,它才导出 logit,而且它可以生成任何加性随机效用模型(Fosgerau 等,2020)。

45.3.3 偏好支架 #

第二种立场是偏好支架(preference scaffolding):偏好贝叶斯优化并非读出一个固定的效用函数,而是帮助人形成偏好的一种结构;因此,评测应当覆盖探索过程以及此人对结果的反思性认可,而不只是最终设计。这一立场的核心是成立的,但有三点限定。其一,并非所有的不一致都是偏好在形成:在重复的离散选择任务中,不稳定集中出现在效用相近的选项与困难的任务上,而且不稳定的受访者与稳定的受访者在潜在偏好上并无差异(Fraser 等,2021)。其二,支架并非中立:当偏好可以被影响时,一项分析比较了八种对齐概念,其中每一种要么偏向不良的影响,要么过度规避风险(Carroll 等,2024);因此,帮助与引导必须借助目标函数本身所不提供的条件来区分(第 45.5 节)。其三,事后的认可本身不能为系统造成的改变提供正当理由,因为被改变的人之所以认可结果,可能只是因为其价值观已被改变(Pettigrew,2023)。

为支架观提出的一个论据不能成立。主动推断理论认为,行动使相对于所偏好观测的意外度最小化。有人说它化解了建构与揭示之间的争论,但它只是把这一争论换了一种编码方式:在贝叶斯优化中,它归结为加权的信息增益采集函数,而权重仍需调节(Millidge 等,2021;Li 等,2026c)(第 39.5 节)。最直接的支持来自 2025 年的一项测量:由贝叶斯优化主导搜索时,设计者得到了更好的结果,但报告的能动感显著降低;通过显式约束进行的协作,在表现上与通过自然语言进行的协作相当,同时给予人更多的能动感(Niwa 等,2025)。这一结果支持由设计者主导的支架,而不是由系统主导的偏好塑造。

第 45.3 节引用的文献 19
  1. Brielmann 等人(2024)Modelling individual aesthetic judgements over time
  2. Costa-Gomes 等人(2022)Choice, deferral, and consistency
  3. Nieuwenstein 等人(2015)On making the right choice: A meta-analysis and large-scale replication attempt of the unconscious thought advantage
  4. Chang(2024)What’s so Hard about Hard Choices?
  5. McCausland 等人(2020)Testing the Random Utility Hypothesis Directly
  6. Stango 与 Zinman(2024)Behavioral Biases Are Temporally Stable
  7. Oprea(2024)Decisions under Risk Are Decisions under Complexity
  8. Nielsen 与 Rehbeck(2022)When Choices Are Mistakes
  9. Engelmann 与 Hollard(2010)Reconsidering the Effect of Market Experience on the "Endowment Effect"
  10. Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures
  11. Vecchione 等人(2020)Stability and change of basic personal values in early adolescence: A 2‐year longitudinal study
  12. Frömer 等人(2019)Goal congruency dominates reward value in accounting for behavioral and neural correlates of value-based decision-making
  13. Fosgerau 等人(2020)Discrete Choice and Rational Inattention: A General Equivalence Result
  14. Fraser 等人(2021)Preference stability in discrete choice experiments. Some evidence using eye-tracking
  15. Carroll 等人(2024)AI Alignment with Changing and Influenceable Reward Functions
  16. Pettigrew(2023)Nudging for changing selves
  17. Millidge 等人(2021)Whence the Expected Free Energy?
  18. Li 等人(2026c)Curiosity is Knowledge: Self-Consistent Learning and No-Regret Optimization with Active Inference
  19. Niwa 等人(2025)Cooperative Design Optimization through Natural Language Interaction

45.4 一次比较的四个成分 #

综合以上各点,我们提出:一次成对回答混合了四个成分,其比例另受两个因素调节(表 45.3;推断)。尚无任何论文检验过这一分解;各成分的比例随对领域的熟悉程度、选项的相似程度与会话长度而变化,因此必须在每个应用中加以估计,而不能事先假定。

表 45.3 成对回答的四个成分与两个调节因素。这一分解是我们的推断;证据一栏注明每项支持的来源。
成分 含义 证据及其来源 在模型中的表示
稳定偏好 可估计的潜在效用 随机效用的检验、偏差的稳定性、价值层级;来自彩票、金钱选择与自我报告,而非设计比较 高斯过程或其他代理模型的潜在效用
结构化评价噪声 随难度、相似度、实验程序、表示的模糊程度与所呈现价值的分布而变化的噪声 早期噪声与晚期噪声(Shen 等,2025b);有效编码;范围归一化;机制有实验支持,在偏好贝叶斯优化中只有离线拟合 异方差噪声;结合反应时的联合似然;每种反馈类型各用一个噪声尺度(Ghosal 等,2023)
查询引起的改变 选择后的再评价、对系统提议的锚定、熟悉与疲劳 选择引起的偏好改变;与有偏的人工智能交互之后偏差会增大(Glickman 与 Sharot,2025);幅度来自自由选择范式,从未在设计比较中测量过 选择历史项;漂移项;以平衡的查询顺序作为对照
不完备或有意随机化的回答 此人无法或不愿比较,或有意随机作答 关于不完备偏好与随机化偏好的实验;来自彩票与金钱选择;在设计比较中所占的比例未知 “无法比较”的回答;混合参数;多效用表示
调节因素 1:品味的共享程度 群体先验的信息量因领域而异 面孔与风景的共享品味高,建筑与艺术品则低;在同一批人中比较风景与建筑外观时,两类判断的信度相同(Vessel 等,2018);个体模型与群体平均相比,中位相关为 0.65 对 0.01(Brielmann 等,2024) 群体先验的权重,作为领域参数或个人参数
调节因素 2:正当性条件 区分帮助形成偏好与引导偏好的规范性条件 候选条件很多,没有共识,在偏好贝叶斯优化中均未检验 不属于似然;属于实验设计与报告的一部分

第一个成分正是默认模型所假定的。第二个成分表明噪声不是单一的数值:它随选项表示方式的模糊程度(早期噪声)与时间压力(晚期噪声)而增大(Shen 等,2025b),取决于此人最近见过的价值(Polanía 等,2019;Bavard 与 Palminteri,2023),在最优点附近还可能使候选在感知上无法区分,一篇 2026 年关于假肢调节的预印本就报告了这种情况(Taddei 等,2026)(表 46.8)。第三个成分在默认模型中根本没有位置。第四个成分在强制选择下无从看到:没有偏好的人也必须作答,而这样的回答看起来就像噪声。

哪个成分占主导取决于领域(推断)。熟悉的领域与宽泛的倾向,更接近对稳定偏好的带噪声发现;新颖、相似、多属性的选项与长时间的会话,则更接近建构与漂移。偏好贝叶斯优化的候选通常是同一设计的相近变体,而在重复的审美评分中,相继项目之间的同化效应与对比效应随刺激相似度的增加而增强(Pombo 等,2023),因此各成分的构成必须在每个应用中实际测量。

45.4.1 一次模拟会话 #

在单次会话之内,四个成分很难区分,因为每个成分都能产生大体一致的回答和越来越集中的后验。图 45.2 用一个模拟说明这一点;模拟中的成分、函数形式与数值都是我们为说明而选定的。一个模拟人比较一条直线上的设计。此人的稳定偏好(stable preference)有两个高度不同的峰。结构化噪声(structured noise)的标准差在差异很大的设计之间为 0.15,在几乎相同的设计之间逐渐升至 0.15 加滑块值。每次选择之后,查询引起的改变(query-induced change)使被选中的设计升高一个滑块值,使被拒绝的设计降低该值的一半;其中大部分在随后的十个回答中消退(每个回答消退剩余部分的 15%),但持久部分(lasting share)会保留下来。不完备回答(incomplete answers)在强制选择下相当于掷硬币,在提供“无法比较”时则表现为“无法比较”。模型采用第 19 章中的默认模型,配对由 EUBO 选出或随机选出。

稳定偏好此刻的效用模型拟合的效用采集顺序(EUBO) · 一周后−0.6−0.4−0.20.00.20.40.6效用早期首选最终设计早期被拒回答(最早的在上)● 选中 · ○ 被拒 · 灰色:背后没有偏好前 100.00.20.40.60.81.0设计不借助系统的重测:此人是否仍更喜欢最终设计?对比前 10 个回答中被拒的设计 · 条:24 个模拟人的均值 · 点:上方这个人0%50% 随机水平100%采集顺序(EUBO)会话结束时88%一周后78%随机顺序会话结束时76%一周后73%
稳定偏好此刻的效用模型拟合的效用采集顺序(EUBO) · 一周后−0.6−0.4−0.20.00.20.40.6效用早期首选最终设计早期被拒回答(最早的在上)前 100.00.20.40.60.81.0设计● 选中 · ○ 被拒 · 灰色:背后没有偏好不借助系统的重测:仍更喜欢最终设计吗?条:24 人均值 · 点:上方这个人0%50% 随机水平100%采集(EUBO)会话结束88%一周后78%随机会话结束76%一周后73%
图 45.2 这是模型的模拟,不是数据。虚线是模拟人的稳定偏好,品红色曲线是此人此刻的效用(稳定部分加引起的改变),蓝色曲线是高斯过程偏好模型(概率单位链接,Laplace 近似)拟合的效用;下一对由 EUBO 选出(从不重复同一对)或随机选出。比较只能把效用确定到相差一个加性常数(第 18.4 节),因此各曲线都已中心化。中间的面板按顺序列出各个回答。底部的面板不借助系统进行重测,检查最终设计(星号)是否仍比前十个回答中被拒的设计(叉号)更受偏好;重测在会话结束时与一周后各做一次,结果为 24 个模拟人的平均。每个模拟人在两种查询顺序下各运行一次,所用的随机抽取相同,这在真实实验中无法做到。所有参数值都只是示意。

可以尝试以下几点:

  • 播放默认会话。蓝色曲线追随的不是虚线,而是品红色曲线上的隆起:此人在哪里不断选择,隆起就在哪里增高。采集顺序几乎在每次查询中都保留当前首选。在采集顺序下,最终设计在会话结束时的重测中胜出 88%,一周后为 78%;随机顺序下则为 76% 与 73%。
  • 把“查询引起的改变”设为 0。每种顺序的两根条形变得等高(采集顺序下为 73% 与 73%,随机顺序下为 71% 与 71%)。再把噪声升到 1:一致率降至 69% 与 65%,两个时间点上相同,因为噪声不会留下时间的痕迹。
  • 把噪声调回 0.3,把不完备回答设为 0.4。一致率向随机水平下降(58% 与 56%),两个时间点上同样相等。勾选“提供‘无法比较’”:模型只拟合真实的回答,一致率回升(74% 与 67%)。
  • 把稳定偏好设为 0(其他设置保持默认)。此时没有任何偏好可供发现,采集顺序却得出一个十分确定的拟合,会话结束时的一致率为 74%,一周后降至 59%;随机顺序下为 55% 与 52%。
  • 把稳定偏好调回 0.4,把“持久部分”设为 1。每种顺序的两根条形又变得等高(采集顺序下为 94%,随机顺序下为 85%):重测无法察觉持久的改变。

由此可以得到两点结论,都是关于这一模型的陈述(推断)。第一,只要回答一致,无论一致的原因是什么,后验都会集中;因此后验集中并不能证明偏好已经稳定,第 46.6 节也不把它用作停止规则。第二,没有哪一项单独的测量能把各成分区分开。引起的改变最清楚的特征,是一致率从会话结束到一周后下降了多少,以及在采集顺序下是否下降得更多。只看延迟一致率会产生误导:在默认设置下,采集顺序的最终设计一周后仍然更常胜出(78% 对 73%),尽管按稳定偏好衡量,它们并不更好。

45.4.2 如何区分各成分 #

表 45.4 列出每个成分在数据中留下的痕迹,以及能将其单独分离出来的测量。这些测量都是对普通会话的低成本补充,第 47.4 节把它们组合成一个实验。

表 45.4 各成分在数据中的表现,以及分离各成分的测量(推断)。
成分 在数据中的特征 分离该成分的测量
稳定偏好 在任何延迟、任何查询顺序下都给出相同的回答 延迟重测与会话结束时的重测一致
结构化评价噪声 困难或相似的配对一致性较低,且与延迟无关 在不同间隔下重复同一配对;反应时
查询引起的改变 回答偏向最近被选中的设计;一致率随延迟下降,在采集顺序下下降更多;最终设计靠近早期首选 比较随机查询顺序与采集顺序,并在会话结束时与一周后各做一次重测
不完备或随机化的回答 相同配对上的虚假偏好率;“无法比较”的回答集中在复杂的配对上 安慰剂对(同一设计展示两次);“无法比较”选项
第 45.4 节引用的文献 9
  1. Shen 等人(2025b)Early versus late noise differentially enhances or degrades context-dependent choice
  2. Ghosal 等人(2023)The Effect of Modeling Human Rationality Level on Learning Rewards from Multiple Feedback Types
  3. Glickman 与 Sharot(2025)How human–AI feedback loops alter human perceptual, emotional and social judgements
  4. Vessel 等人(2018)Stronger shared taste for natural aesthetic domains than for artifacts of human culture
  5. Brielmann 等人(2024)Modelling individual aesthetic judgements over time
  6. Polanía 等人(2019)Efficient coding of subjective value
  7. Bavard 与 Palminteri(2023)The functional form of value normalization in human reinforcement learning
  8. Taddei 等人(2026)Bayesian Preference Elicitation: Human-In-The-Loop Optimization of An Active Prosthesis
  9. Pombo 等人(2023)The intrinsic variance of beauty judgment

45.5 估计与干预 #

如果一次比较混合了这些成分,那么一次偏好贝叶斯优化会话的输出就同时具有两重性质:既是对此人偏好的估计,也是对该偏好的干预。一项研究如果既不随机化查询顺序,也不在延迟之后重测,就无法分辨收敛的究竟是偏好,还是系统对此人的影响。已知选择会大幅改变偏好,但还没有研究在偏好贝叶斯优化会话中直接测量过查询引起的改变;第 47.4 节描述了能够完成这一测量的实验。该实验的对照,正是判断系统造成的改变是否正当所需的对照,因此方法论问题与规范性问题可以在同一个实验中得到回答(推断)。

45.5.1 为什么需要正当性条件 #

有两项结果使正当性成为一个技术问题,而不是事后才考虑的问题。其一,当偏好可以改变时,正当性的标准无法从目标函数中读出:Carroll 等人(2024)比较的八种对齐概念,每一种都以两种方式之一失败(第 45.3.3 节)。其二,基于用户反馈优化的学习器会学会专门针对最容易被影响的用户(Williams 等,2025)。一个奖励快速收敛或干净信号的采集函数,原则上可能偏向那些使此人更可预测的查询,而不是服务于其利益的查询(推断);因此,团队应当审查自己的采集函数与停止规则中是否存在这种激励(第 46.8 节)。

45.5.2 候选条件 #

已有一组可操作的候选条件,但尚无共识。一是尊重此人的元偏好,即其关于自己的偏好可以如何改变的偏好,这一条出自一篇研讨会论文(Ashton 与 Franklin,2022);二是让影响公开可见,并且不给系统使用户更可预测的激励(Carroll 等,2023);三是让用户选择自主的模式(Fischli 等,2026);四是要求在影响有界的前提下获得反思性认可,这种影响不得损害此人的事实信念,并在偏好尚不确定时保留未来的选项,这一条同样出自一篇研讨会论文(Kanwal 与 Tran,2026);五是从改变之前与之后两个自我的立场来评判一次改变(Pettigrew,2023)。

综合这些条件,单用户偏好贝叶斯优化经得起推敲的目标不是“潜在效用”,而是“在影响有界的流程中,用户经反思会认可的效用”(推断)。算法 46.2 使这一目标可以操作:记录此人对自己的品味被改变所持的态度;以随机或平衡的查询顺序为参照,测量偏移并为其设限;在会话结束时以及下一次会话时,不带系统框架地重测最终设计。

第 45.5 节引用的文献 7
  1. Carroll 等人(2024)AI Alignment with Changing and Influenceable Reward Functions
  2. Williams 等人(2025)On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback
  3. Ashton 与 Franklin(2022)Solutions to preference manipulation in recommender systems require knowledge of meta-preferences
  4. Carroll 等人(2023)Characterizing Manipulation from AI Systems
  5. Fischli 等人(2026)Agents, Alignment, and the Many Faces of Autonomy
  6. Kanwal 与 Tran(2026)Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction
  7. Pettigrew(2023)Nudging for changing selves

45.6 已定、有争议与缺失 #

研究现状已定、有争议与缺失

已定。2017 至 2021 年的采集规则存在有记录的失效,EUBO 则有决策论依据。偏好反馈的遗憾理论只提供有条件的上界。领域一般性的决策疲劳、自我损耗、诱导服从失调与个体内的道德许可,都没有经受住大型复现或偏倚校正。选择引起的偏好改变、范围归一化、价值噪声的有效编码与多数人的随机效用一致性都有充分支持;允许时,相当一部分人会报告不完备偏好。

有争议。EUBO 的坍缩与秩亏的 Hessian 矩阵在人的任务上是否造成任何代价(证据来自 2026 年的预印本)。复杂估值错误能否解释风险选择中的异常。偏好贝叶斯优化会话中的不一致,有多少属于偏好的形成,而非围绕稳定目标的结构化误差。层级观对自我报告的价值成立,但对成对的设计判断能否说明什么。

缺失。采用随机化查询顺序与延迟重测,在偏好贝叶斯优化会话中直接测量查询引起的改变(第 47.4 节)。在设计任务中检验四成分分解。在人类数据上比较链接函数,以及漂移效用的模型。带时间戳、呈现顺序与重复配对的个体层面成对判断公开数据集。对采集函数是否偏向使人变得可预测的查询作出证明或否证。经过检验并获得共识的条件,用以判断系统造成的改变何时正当。

45.7 习题 #

两道习题都使用图 45.2。

习题 45.1

把“持久部分”滑块设为 1,其余保持默认。此时每种查询顺序的两根重测条形都等高。查询引起的改变消失了吗?在真实实验中,还有哪些可获得的证据能揭示它?

解答

没有。引起的改变不再消退,一周后此人的偏好就是改变之后的偏好,重测因而无从检测。两种顺序之间仍有差别:采集顺序的最终设计更受偏好(94% 对 85%),因为其查询不断强化同一个首选,尽管按稳定偏好衡量,这些设计并不更好。在真实实验中,剩下的证据是:被随机分配到不同查询顺序的人,最终设计的分布不同,采集顺序下的最终设计靠近各人的早期首选。由于高效的采集规则本来也会较早稳定下来,这一证据弱于延迟之后的下降(推断)。这种持久的改变是否可以接受,是一个正当性问题(第 45.5 节)。

习题 45.2

把稳定偏好设为 0,把查询引起的改变设为 0.12。采集顺序下拟合的效用有一个清晰的峰,会话结束时的重测一致率很高。此人并无稳定偏好,模型却很有把握,试解释其原因,并说明这对停止规则意味着什么。

解答

似然只看到每次比较中哪个选项胜出。在采集顺序下,当前首选出现在大多数查询中,而每一次胜出都通过引起的改变使它进一步升高,因此回答高度一致,而后验所测量的恰恰只是一致性。等待后验集中的停止规则会在此有把握地停下;如果规则还要求重复配对在延迟之后仍然一致,或要求最终设计经受住不借助系统的重测,就不会停下(第 46.6 节)。

延伸阅读 #

参考文献

  1. Agranov, M., and Ortoleva, P. (2025). Ranges of Randomization. Review of Economics and Statistics. 引用于 §45.2
  2. Alós-Ferrer, C., Fehr, E., and Garagnani, M. (2023). Identifying Nontransitive Preferences. University of Zurich. 工作论文引用于 §45.2
  3. Ambuehl, S., Bernheim, B. D., and Lusardi, A. (2022). Evaluating Deliberative Competence: A Simple Method with an Application to Financial Choice. American Economic Review. 引用于 §45.2
  4. Andersson, D., Lindberg, M., Tinghög, G., and Persson, E. (2025). No evidence for decision fatigue using large-scale field data from healthcare. Communications Psychology. 引用于 §45.2
  5. Ashton, H., and Franklin, M. (2022). Solutions to preference manipulation in recommender systems require knowledge of meta-preferences. FAccTRec Workshop (RecSys 2022). 研讨会论文引用于 §45.5
  6. Astudillo, R., Lin, Z. J., Bakshy, E., and Frazier, P. (2023). qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization. International Conference on Artificial Intelligence and Statistics. 引用于 §45.1
  7. Bagaïni, A., Liu, Y., Kapoor, M., Son, G., Bürkner, P.-C., Tisdall, L., and Mata, R. (2025). A systematic review and meta-analyses of the temporal stability and convergent validity of risk preference measures. Nature Human Behaviour. doi:10.1038/s41562-024-02085-2. 引用于 §45.1
  8. Bavard, S., and Palminteri, S. (2023). The functional form of value normalization in human reinforcement learning. eLife. 引用于 §45.2 §45.4
  9. Bavard, S., Lebreton, M., Khamassi, M., Coricelli, G., and Palminteri, S. (2018). Reference-point centering and range-adaptation enhance human reinforcement learning at the cost of irrational preferences. Nature Communications. 引用于 §45.2
  10. Bernheim, B. D., and Rangel, A. (2009). Beyond Revealed Preference: Choice-Theoretic Foundations for Behavioral Welfare Economics *. Quarterly Journal of Economics. 引用于 §45.2
  11. Bhatia, S., and Loomes, G. (2017). Noisy preferences in risky choice: A cautionary note. Psychological Review. 引用于 §45.2
  12. Brielmann, A. A., Berentelg, M., and Dayan, P. (2024). Modelling individual aesthetic judgements over time. Philosophical Transactions of the Royal Society B: Biological Sciences. 引用于 §45.3 §45.4
  13. Brown, A. L., Imai, T., Vieider, F. M., and Camerer, C. F. (2024). Meta-analysis of Empirical Estimates of Loss Aversion. Journal of Economic Literature. 引用于 §45.2
  14. Carroll, M., Dragan, A., Russell, S., and Hadfield-Menell, D. (2022). Estimating and Penalizing Induced Preference Shifts in Recommender Systems. ICML 2022. 引用于 §45.2
  15. Carroll, M., Chan, A., Ashton, H., and Krueger, D. (2023). Characterizing Manipulation from AI Systems. Equity and Access in Algorithms, Mechanisms, and Optimization. 引用于 §45.5
  16. Carroll, M., Foote, D., Siththaranjan, A., Russell, S., and Dragan, A. (2024). AI Alignment with Changing and Influenceable Reward Functions. International Conference on Machine Learning. 引用于 §45.3 §45.5
  17. Cettolin, E., and Riedl, A. (2019). Revealed preferences under uncertainty: Incomplete preferences and preferences for randomization. Journal of Economic Theory. 引用于 §45.2
  18. Chang, R. (2024). What’s so Hard about Hard Choices? Erasmus Journal for Philosophy and Economics. doi:10.23941/ejpe.v17i1.872. 引用于 §45.3
  19. Chidambaram, K., Seetharaman, K. V., and Syrgkanis, V. (2026). Direct Preference Optimization with Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences. International Conference on Artificial Intelligence and Statistics. 引用于 §45.1
  20. Choung, O.-H., Vianello, R., Segler, M., Stiefl, N., and Jiménez-Luna, J. (2023). Extracting medicinal chemistry intuition via preference machine learning. Nature Communications. doi:10.1038/s41467-023-42242-1. 引用于 §45.1
  21. Costa-Gomes, M. A., Cueva, C., Gerasimou, G., and Tejišcák, M. (2022). Choice, deferral, and consistency. Quantitative Economics. 引用于 §45.3
  22. De Witte, S., Taets, J., Retzler, A., Crevecoeur, G., and Lefebvre, T. (2025). How to Capture Human Preference: Commissioning of a Robotic Use-Case via Preferential Bayesian Optimisation. arXiv. 预印本引用于 §45.1
  23. Dean, S., and Morgenstern, J. (2022). Preference Dynamics Under Personalized Recommendations. EC 2022. 引用于 §45.2
  24. Doumont, C., Fan, D., Maus, N., Gardner, J. R., Moss, H., and Pleiss, G. (2026). We Still Don't Understand High-Dimensional Bayesian Optimization. AISTATS 2026 (best student paper). 引用于 §45.1
  25. Engelmann, D., and Hollard, G. (2010). Reconsidering the Effect of Market Experience on the "Endowment Effect". Econometrica. 引用于 §45.3
  26. Enisman, M., Shpitzer, H., and Kleiman, T. (2021). Choice changes preferences, not merely reflects them: A meta-analysis of the artifact-free free-choice paradigm. Journal of Personality and Social Psychology. 引用于 §45.2
  27. Evren, Ö., and Ok, E. A. (2011). On the multi-utility representation of preference relations. Journal of Mathematical Economics. 引用于 §45.2
  28. Fischli, R., Franklin, M., Manzini, A., and Gabriel, I. (2026). Agents, Alignment, and the Many Faces of Autonomy. Minds and Machines. 引用于 §45.5
  29. Fosgerau, M., Melo, E., de Palma, A., and Shum, M. (2020). Discrete Choice and Rational Inattention: A General Equivalence Result. International Economic Review. 引用于 §45.3
  30. Fraser, I., Balcombe, K., Williams, L., and McSorley, E. (2021). Preference stability in discrete choice experiments. Some evidence using eye-tracking. Journal of Behavioral and Experimental Economics. 引用于 §45.3
  31. Frederick, S., Lee, L., and Baskin, E. (2014). The Limits of Attraction. Journal of Marketing Research. 引用于 §45.2
  32. Frömer, R., Dean Wolf, C. K., and Shenhav, A. (2019). Goal congruency dominates reward value in accounting for behavioral and neural correlates of value-based decision-making. Nature Communications. 引用于 §45.3
  33. Ge, L., Halpern, D., Micha, E., Procaccia, A., Shapira, I., Vorobeychik, Y., and Wu, J. (2024). Axioms for AI Alignment from Human Feedback. Advances in Neural Information Processing Systems 37. 引用于 §45.2
  34. Ghosal, G. R., Zurek, M., Brown, D. S., and Dragan, A. D. (2023). The Effect of Modeling Human Rationality Level on Learning Rewards from Multiple Feedback Types. AAAI. 引用于 §45.4
  35. Glickman, M., and Sharot, T. (2025). How human–AI feedback loops alter human perceptual, emotional and social judgements. Nature Human Behaviour. doi:10.1038/s41562-024-02077-2. 引用于 §45.4
  36. Hardt, M., and Mendler-Dünner, C. (2025). Performative Prediction: Past and Future. Statistical Science. 引用于 §45.2
  37. Heckel, R., Shah, N. B., Ramchandran, K., and Wainwright, M. J. (2019). Active ranking from pairwise comparisons and when parametric assumptions do not help. The Annals of Statistics. 引用于 §45.1
  38. Hendrickx, J. M., Olshevsky, A., and Saligrama, V. (2019). Graph Resistance and Learning from Pairwise Comparisons. ICML. 引用于 §45.2
  39. Jiang, X., Lim, L.-H., Yao, Y., and Ye, Y. (2011). Statistical ranking and combinatorial Hodge theory. Mathematical Programming. 引用于 §45.2
  40. Kanwal, M., and Tran, C. (2026). Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction. AAAI-26 Workshop on Machine Ethics. 研讨会论文引用于 §45.5
  41. Kayal, A., Vakili, S., Toni, L., Shiu, D.-S., and Bernacchia, A. (2025). Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds. International Conference on Machine Learning. 引用于 §45.1
  42. Keswani, V., Cousins, C., Nguyen, B., Conitzer, V., Heidari, H., Borg, J. S., and Sinnott-Armstrong, W. (2026). Moral Change or Noise? On Problems of Aligning AI With Temporally Unstable Human Feedback. AAAI. 引用于 §45.1
  43. Lazzaro, J., Buffelli, D., Shiu, D.-s., and Vakili, S. (2026). A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback. International Conference on Artificial Intelligence and Statistics. 引用于 §45.1
  44. Li, S., Zhang, Y., Ren, Z., Liang, C., Li, N., and Shah, J. A. (2024a). Enhancing Preference-based Linear Bandits via Human Response Time. Advances in Neural Information Processing Systems. 引用于 §45.1
  45. Li, Y., Parashar, A., Zhou, E., and Fan, C. (2026c). Curiosity is Knowledge: Self-Consistent Learning and No-Regret Optimization with Active Inference. arXiv preprint 2602.06029. 预印本引用于 §45.3
  46. McCausland, W. J., Davis-Stober, C., Marley, A., Park, S., and Brown, N. (2020). Testing the Random Utility Hypothesis Directly. The Economic Journal. doi:10.1093/ej/uez039. 引用于 §45.2 §45.3
  47. Millidge, B., Tschantz, A., and Buckley, C. L. (2021). Whence the Expected Free Energy? Neural Computation. 引用于 §45.3
  48. Nielsen, K., and Rehbeck, J. (2022). When Choices Are Mistakes. American Economic Review. 引用于 §45.3
  49. Nielsen, K., and Rigotti, L. (2026). Revealed Incomplete Preferences. Working paper (author's website). 工作论文引用于 §45.2
  50. Nieuwenstein, M. R., Wierenga, T., Morey, R. D., Wicherts, J. M., Blom, T. N., Wagenmakers, E.-J., and van Rijn, H. (2015). On making the right choice: A meta-analysis and large-scale replication attempt of the unconscious thought advantage. Judgment and Decision Making. 引用于 §45.3
  51. Niwa, R., Yoshida, S., Koyama, Y., and Ushiku, Y. (2025). Cooperative Design Optimization through Natural Language Interaction. UIST 2025. 引用于 §45.3
  52. Oh, G., Lee, J., Park, J., Yu, Y., Bae, W., and Noh, J. (2026b). Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs. ICLR 2026 Workshop: I Can't Believe It's Not Better (ICBINB). 研讨会论文引用于 §45.1
  53. Ok, E. A., and Tserenjigmid, G. (2022). Indifference, indecisiveness, experimentation, and stochastic choice. Theoretical Economics. 引用于 §45.2
  54. Oprea, R. (2024). Decisions under Risk Are Decisions under Complexity. American Economic Review. 引用于 §45.3
  55. Ou, C., Buschek, D., Mayer, S., and Butz, A. (2022). The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures. Mensch und Computer 2022. 引用于 §45.3
  56. Pásztor, B., Kassraie, P., and Krause, A. (2024). Bandits with Preference Feedback: A Stackelberg Game Perspective. Advances in Neural Information Processing Systems. doi:10.52202/079017-0383. 引用于 §45.1
  57. Peng, Y.-H., Bigham, J. P., and Wu, J. (2026). Efficient Personalization of Generative User Interfaces. arXiv. 预印本引用于 §45.1
  58. Perdomo, J. C., Zrnic, T., Mendler-Dünner, C., and Hardt, M. (2020). Performative Prediction. ICML. 引用于 §45.2
  59. Pettigrew, R. (2023). Nudging for changing selves. Synthese. 引用于 §45.3 §45.5
  60. Polanía, R., Woodford, M., and Ruff, C. C. (2019). Efficient coding of subjective value. Nature Neuroscience. 引用于 §45.2 §45.4
  61. Pombo, M., Brielmann, A. A., and Pelli, D. G. (2023). The intrinsic variance of beauty judgment. Attention, Perception, & Psychophysics. 引用于 §45.4
  62. Prat-Carrabin, A., and Woodford, M. (2022). Efficient coding of numbers explains decision bias and noise. Nature Human Behaviour. 引用于 §45.2
  63. Rotella, A., Jung, J., Chinn, C., and Barclay, P. (2026). Observation Moderates the Moral Licensing Effect: A Meta-Analytic Test of Interpersonal and Intrapsychic Mechanisms. Personality and Social Psychology Bulletin. 引用于 §45.2
  64. Schäfer, N., Zhao, G., Li, B., Kupnik, M., Seyfarth, A., Beckerle, P., and Grimmer, M. (2026). User preference-based human-in-the-loop tuning of exoskeleton assistance during walking. npj Biomedical Innovations. doi:10.1038/s44385-026-00085-7. 引用于 §45.1
  65. Schoinas, E., Rastogi, A., Carter, A., Granley, J., and Beyeler, M. (2025). Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants. 2025 47th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC). doi:10.1109/embc58623.2025.11253762. 引用于 §45.1
  66. Shah, N. B., Balakrishnan, S., Bradley, J., Parekh, A., Ramchandran, K., and Wainwright, M. J. (2016). Estimation from Pairwise Comparisons: Sharp Minimax Bounds with Topology Dependence. Journal of Machine Learning Research. 引用于 §45.2
  67. Shao, K., Wang, J., Pei, X., and Mesbah, A. (2026). Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization. arXiv. 预印本引用于 §45.1
  68. Shen, B., Nguyen, D., Wilson, J., Glimcher, P. W., and Louie, K. (2025b). Early versus late noise differentially enhances or degrades context-dependent choice. Nature Communications. doi:10.1038/s41467-025-59140-3. 引用于 §45.4
  69. Shevlin, B. R. K., Smith, S. M., Hausfeld, J., and Krajbich, I. (2022). High-value decisions are fast and accurate, inconsistent with diminishing value sensitivity. Proceedings of the National Academy of Sciences. 引用于 §45.2
  70. Shvartsman, M., Letham, B., Bakshy, E., and Keeley, S. (2024). Response Time Improves Gaussian Process Models for Perception and Preferences. Uncertainty in Artificial Intelligence. 引用于 §45.1
  71. Siththaranjan, A., Laidlaw, C., and Hadfield-Menell, D. (2024). Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF. ICLR 2024. 引用于 §45.1
  72. Stango, V., and Zinman, J. (2024). Behavioral Biases Are Temporally Stable. Working paper (author's website). 工作论文引用于 §45.3
  73. Strang, A., Abbott, K. C., and Thomas, P. J. (2022). The Network HHD: Quantifying Cyclic Competition in Trait-Performance Models of Tournaments. SIAM Review. 引用于 §45.2
  74. Taddei, S., Koppen, W., Alfio, E., Nuzzo, S., Flynn, L., Diaz, M. A., … Verstraten, T. (2026). Bayesian Preference Elicitation: Human-In-The-Loop Optimization of An Active Prosthesis. arXiv. 预印本引用于 §45.4
  75. Vaidis, D. C., Sleegers, W. W. A., van Leeuwen, F., DeMarree, K. G., Sætrevik, B., Ross, R. M., … Priolo, D. (2024). A Multilab Replication of the Induced-Compliance Paradigm of Cognitive Dissonance. Advances in Methods and Practices in Psychological Science. 引用于 §45.2
  76. Vecchione, M., Schwartz, S. H., Davidov, E., Cieciuch, J., Alessandri, G., and Marsicano, G. (2020). Stability and change of basic personal values in early adolescence: A 2‐year longitudinal study. Journal of Personality. 引用于 §45.3
  77. Vessel, E. A., Maurer, N., Denker, A. H., and Starr, G. G. (2018). Stronger shared taste for natural aesthetic domains than for artifacts of human culture. Cognition. 引用于 §45.4
  78. Viappiani, P., and Boutilier, C. (2020). On the equivalence of optimal recommendation sets and myopically optimal query sets. Artificial Intelligence. 引用于 §45.1
  79. Vohs, K. D., Schmeichel, B. J., Lohmann, S., Gronau, Q. F., Finley, A. J., Ainsworth, S. E., … Albarracín, D. (2021). A Multisite Preregistered Paradigmatic Test of the Ego-Depletion Effect. Psychological Science. 引用于 §45.2
  80. Williams, M., Carroll, M., Narang, A., Weisser, C., Murphy, B., and Dragan, A. (2025). On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback. ICLR 2025. 引用于 §45.5
  81. Wu, K., and Gardner, J. R. (2026). Knowledge Gradient for Preference Learning. arXiv. 预印本引用于 §45.1
  82. Xu, W., Wang, W., Jiang, Y., Svetozarevic, B., and Jones, C. (2024b). Principled Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §45.1
  83. Yap, S. C. Y., Wortman, J., Anusic, I., Baker, S. G., Scherer, L. D., Donnellan, M. B., and Lucas, R. E. (2017). The effect of mood on judgments of subjective well-being: Nine tests of the judgment model. Journal of Personality and Social Psychology. 引用于 §45.2
  84. Yechiam, E., and Zeif, D. (2025). Loss aversion is not robust: A re-meta-analysis. Journal of Economic Psychology. 引用于 §45.2
  85. Zhang, X., Huang, D., Kaski, S., and Martinelli, J. (2025a). PABBO: Preferential Amortized Black-Box Optimization. ICLR 2025. 引用于 §45.1
  86. Zhang, R., Zhu, X., Pourebadi Khotbehsara, M., Dao, W., Bıyık, E., and Culbertson, H. (2026b). Vibrotactile Preference Learning: Uncertainty-Aware Preference Learning for Personalized Vibration Feedback. UMAP 2026 (per Semantic Scholar). 引用于 §45.1
  87. Zylberberg, A., Bakkour, A., Shohamy, D., and Shadlen, M. N. (2024). Value construction through sequential sampling explains serial dependencies in decision making. eLife. doi:10.7554/eLife.96997. 引用于 §45.2