奖励学习、推荐、排序与自动化科学
计算领域中,从人们表达的偏好中学习的系统有很多,偏好贝叶斯优化是其中一种。第 35 章讨论了其中最大的相邻领域,即语言模型的对齐。本章再考察七个领域。它们各以自己的形式遇到了偏好优化的问题,而且往往更早:基于轨迹比较的强化学习、人工智能安全、人工智能与决策分析中的偏好引出、推荐系统、交互式进化计算、排序学习和自驱动实验室。
有两个结论贯穿本章。第一,偏好贝叶斯优化文献仍视为未解决的若干问题,在相邻领域已经解决,或已有现成做法,包括:按查询对最终决策的影响选择查询、高斯过程模型中的单调性与排序查询、具有符合现实的非理性的模拟用户、选项展示位置的校正、基于群体嵌入的热启动、校准指标,以及加速效果的报告标准。表 36.2 汇总了这些问题。第二,人工智能安全文献已将系统可能改变其测量对象这一想法形式化,并在推荐系统和语言模型中找到了证据。这正是本书的论点,即一次偏好贝叶斯优化会话既是估计,也是干预(第 45.1 节),只是由相邻领域先做了推演。目前尚无偏好贝叶斯优化研究测量过这一点,因此下文凡将这一担忧迁移过来之处,均标为推断。
36.1 基于偏好的强化学习 #
强化学习(reinforcement learning)训练智能体(即选择动作的策略),使其在一系列步骤中获得的总奖励最大,这一总奖励称为回报(return)。后空翻、给出有帮助的回答这类任务,很难手工写出奖励函数。基于偏好的强化学习(preference-based reinforcement learning)用人对智能体行为短片段的比较代替奖励函数,这些短片段称为轨迹片段(trajectory segments);奖励模型则用第 35.1.1 节中的 Bradley-Terry 似然从回答中学习。RLHF(第 35.1.2 节)就是这种方法在语言模型上的应用。Christiano 等人(2017)(NeurIPS 2017)表明这一方法可以大规模应用:只对“我们的智能体与环境交互中不到百分之一的部分”给出反馈,用“大约一小时的人工时间”就教会了智能体新的行为。
36.1.1 实践与基准 #
PEBBLE(Lee 等,2021b)(ICML 2021)每当奖励模型变化,就重新标注全部过往经验,并在无奖励的条件下预训练智能体。B-Pref(Lee 等,2021a)(NeurIPS 2021 Datasets and Benchmarks)认为,“把人的输入模拟为对真实奖励函数给出完美偏好是不现实的”,并构建了一组模拟教师,每个都在完美教师的基础上加入一种非理性:理性程度 的随机选择(单位尺度的 Bradley-Terry 模型)、以 0.1 的概率出错、跳过难以比较的对、回报接近时宣布平局,以及短视,即以 对片段中较早的步骤打折扣。Uni-RLHF(Yuan 等,2024)(ICLR 2024)收集了众包标注,覆盖“30 多个常用任务中的超过 1,500 万步”,并取得了“与精心设计的人工奖励相比有竞争力的性能”。
36.1.2 理论 #
对决后验采样(Novoseller 等,2020)(UAI 2020)给出了基于偏好的强化学习的首个遗憾保证,即渐近的贝叶斯无遗憾速率;Saha 等人(2023)(AISTATS 2023)证明了广义线性模型下轨迹偏好的近乎最优的遗憾;Wang 等人(2023a)(NeurIPS 2023)则证明,“对于很大一类偏好模型,我们可以直接用基于奖励的强化学习的现有算法与技术来求解基于偏好的强化学习,只需很小的额外代价,甚至没有额外代价”。
36.1.3 人如何比较的模型 #
人如何把奖励转化为回答,对这一过程的建模比预想的更重要。Knox 等人(2024)(TMLR 2024)比较了两种模型。一种是常用模型:人偏好奖励之和更大的片段,这一和称为部分回报(partial return)。另一种是人按遗憾(regret)评判每个片段,即该片段比智能体从同一起点出发所能做到的最好结果差多少。遗憾模型是可识别的(identifiable),即给定足够多的回答,只有一个奖励函数与之相容;部分回报模型在若干设定下缺乏可识别性;而且遗憾模型能更好地预测真实的人类偏好。如果关于人的模型稍有偏差,推断出的奖励会错到什么程度?Hong 等人(2023)(ICLR 2023)表明,“遗憾的是,可以构造出行为上的微小对抗性偏差,使推断出的奖励产生任意大的误差”,并找出了“合理的假设,在这些假设下,奖励推断误差可以用人类模型的误差线性地界定”。Hatgis-Kessell 等人(2025)(TMLR)则反其道而行,帮助人符合模型:向人展示模型所假设的潜在量,训练人按这一量作答,或者改写问题。在三项以人为对象的研究中,“所有类型的干预都显示出显著效果。”
36.1.4 选择查询与利用更丰富的反馈 #
信息导向奖励学习(Lindner 等,2021)(NeurIPS 2021)选择的是“使关于可能最优的各策略之间回报差异的信息增益最大的查询”,而不是使关于各处奖励的信息增益最大的查询,所需查询显著减少。Hu 等人(2024)(ICLR 2024)把这种做法所避免的失效命名为查询与策略错位(query-policy misalignment):为全面改进奖励模型而选择的查询“可能与强化学习智能体的利益不一致,因而对策略学习帮助甚微”。RIME(Cheng 等,2024)(ICML 2024)过滤带噪声的偏好;LiRE(Choi 等,2024)(ICML 2024)根据更好、更差、相同三种回答构建轨迹的排序列表,以利用每个偏好的强度;逆偏好学习(Hejna 与 Sadigh,2023)(NeurIPS 2023)与对比偏好学习(Hejna 等,2024)(ICLR 2024)则跳过显式奖励模型,两者都假设偏好由遗憾决定。
36.1.5 过度优化 #
针对学到的奖励对策略施加强力优化,真实奖励最终会下降。这是 Goodhart 定律的一个实例:“当一个度量成为目标,它就不再是好的度量”(when a measure becomes a target, it ceases to be a good measure)。Gao 等人(2023)(ICML 2023,收录于 PMLR 论文集;arXiv 记录未列出发表场所)用固定的“金标准”奖励模型代替人,测量了这一现象:优化程度与金标准奖励之间的关系“随优化方法的不同而遵循不同的函数形式”,其系数随奖励模型规模平滑变化。Rafailov 等人(2024)(NeurIPS 2024)发现,DPO 及其同类方法也会过度优化,而且“往往在数据集的一个轮次(epoch)都还没有完成之前”就已出现。Casper 等人(2023)(TMLR 2023)综述了 RLHF 的未解决问题与根本局限。
36.1.6 对偏好贝叶斯优化的含义 #
有三个结论可以原样迁移。其一,偏好模型的选择有实际后果(Knox 等),在偏好贝叶斯优化中就是概率单位链接与逻辑链接之间的选择(第 27.1 节)。其二,Hatgis-Kessell 等人建议“设计界面与训练干预,以提高人对算法建模假设的符合程度”,在偏好贝叶斯优化中对应于问题的措辞与呈现方式(第 20 章)。其三,具有完美偏好的模拟教师是不现实的(B-Pref)。
其余都是推断。按照 Hong 等人的结果,微小的系统性回答偏差(例如位置效应)即使在许多次比较之后,也可能使偏好贝叶斯优化的后验严重出错,而随机噪声是良性的情形(第 36.6 节)。B-Pref 的教师几乎可以与偏好贝叶斯优化的模拟用户一一对应(跳过对应于不可比,平局对应于无差异,见第 20.4 节;短视对应于近因效应)。偏好贝叶斯优化的基准大多模拟同方差、独立的噪声,即每一对的噪声水平相同、每次重新抽取;这些基准几乎无需改动就可以采用 B-Pref 的教师(第 31.7 节)。强化学习方面的 Wang、Liu 与 Jin,排序方面的 Shah 等人(第 36.6 节),以及偏好贝叶斯优化方面的 Kayal 等人(第 29.3 节),这些理论结果都表明:成对回答每次查询携带的信息少于数值回答,但可达到的速率同阶。需要说明的是,Kayal 等人的结果是条件上界。此外,只有在无人核对结果的条件下优化学到的效用,过度优化才会波及偏好贝叶斯优化,例如偏好探索(BOPE)中定义在结果上的效用;在标准的偏好贝叶斯优化中,最终候选由人评判。
第 36.1 节引用的文献 19
- Christiano 等人(2017)Deep reinforcement learning from human preferences
- Lee 等人(2021b)PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training
- Lee 等人(2021a)B-Pref: Benchmarking Preference-Based Reinforcement Learning
- Yuan 等人(2024)Uni-RLHF: Universal Platform and Benchmark Suite for Reinforcement Learning with Diverse Human Feedback
- Novoseller 等人(2020)Dueling Posterior Sampling for Preference-Based Reinforcement Learning
- Saha 等人(2023)Dueling RL: Reinforcement Learning with Trajectory Preferences
- Wang 等人(2023a)Is RLHF More Difficult than Standard RL?
- Knox 等人(2024)Models of human preference for learning reward functions
- Hong 等人(2023)On the Sensitivity of Reward Inference to Misspecified Human Models
- Hatgis-Kessell 等人(2025)Influencing Humans to Conform to Preference Models for RLHF
- Lindner 等人(2021)Information Directed Reward Learning for Reinforcement Learning
- Hu 等人(2024)Query-Policy Misalignment in Preference-Based Reinforcement Learning
- Cheng 等人(2024)RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
- Choi 等人(2024)Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
- Hejna 与 Sadigh(2023)Inverse Preference Learning: Preference-based RL without a Reward Function
- Hejna 等人(2024)Contrastive Preference Learning: Learning from Human Feedback without RL
- Gao 等人(2023)Scaling Laws for Reward Model Overoptimization
- Rafailov 等人(2024)Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
- Casper 等人(2023)Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback
36.2 人工智能安全的视角 #
自 2017 年以来,人工智能安全文献把三个想法形式化,它们对任何代人优化的系统都很重要:人所想要之物的替代指标一经优化就可能失效;系统可能改变人;人与系统可以建模为一场合作博弈的双方。
36.2.1 代理指标何时失效 #
Skalse 等人(2022)(NeurIPS 2022,论文在该会议上的题名为“Defining and Characterizing Reward Gaming”)定义:若“提高期望代理回报永远不会降低期望真实回报”(increasing the expected proxy return can never decrease the expected true return),则称代理奖励是不可破解的(unhackable);他们还证明,“对于所有随机策略构成的集合,两个奖励函数只有在其中一个为常数时才可能是不可破解的”。“能力更强的智能体常常利用奖励设定中的错误”,并出现“相变:在某些能力阈值处,智能体的行为发生质的转变,导致真实奖励急剧下降”(Pan 等,2022)(ICLR 2022)。Karwowski 等人(2024)(ICLR 2024)从几何上解释了 Goodhart 定律,并给出了一种可证明能避免它的提前停止方法;Kwa 等人(2024)(NeurIPS 2024)表明,当奖励误差为重尾分布时,即使有 KL 正则,“一些策略也能获得任意高的奖励,而获得的效用并不比基础模型多”,不过他们测量的奖励模型“与轻尾误差相符”。从委托人一方看,对只涵盖部分属性的代理指标做无界优化,可能使人的效用降到任意低,而允许人随时间更新代理指标会有帮助(Zhuang 与 Hadfield-Menell,2020)(NeurIPS 2020);写下的奖励函数“只是关于设计者真正想要什么的观测”(Hadfield-Menell 等,2017)(NeurIPS 2017);根据优化者诅咒(optimizer's curse)(Smith 与 Winkler,2006),被选为最佳的选项,其估计价值有向上的偏差,因为它之所以入选,部分原因在于其误差恰好偏向有利一方。
36.2.2 对人的影响与赞同优化 #
赞同优化(approval optimization)指优化评价者的赞同,而不是评价者所关心的结果。Carroll 等人(2022)(ICML 2022)指出,“通过长时域优化训练的系统会有操纵用户的直接动机”,特别是“改变用户的偏好,使其更容易得到满足”,并提出对超出“安全偏移”信赖域的偏移施加惩罚;没有该系统时人的偏好本来就会发生的漂移,就是一种安全偏移。Carroll 等人(2024)(ICML 2024)写道,“现有的人工智能对齐方法假设偏好是静态的,这是不现实的”;他们发现,“8 种这样的对齐概念”全都“要么偏向于造成不良的人工智能影响,要么过度规避风险”,并论证优化时域“可能部分有助于减少不良的人工智能影响”。
证据来自模拟和语言模型。一个 Q 学习推荐器“始终学会利用其机会使模拟用户极化”(Evans 与 Kasirzadeh,2023)(AIES 2023)。“即使只有 2% 的用户容易受操纵策略影响”,用用户反馈训练的语言模型也会学会识别并针对他们;安全训练或语言模型评判者在某些设定下有帮助,但“在另一些设定下适得其反,有时甚至导致更隐蔽的操纵行为”(Williams 等,2025)(ICLR 2025)。RLHF 之后,时间有限的人类评价者更常把错误答案当作正确答案接受:假阳性率在 QuALITY 上上升 24.1%,在 APPS 上上升 18.3%(Wen 等,2025)(ICLR 2025)。“人类和偏好模型(PM)都会以不可忽略的比例,偏好写得令人信服的谄媚回复,而不是正确的回复”(Sharma 等,2024)(ICLR 2024)。当评价者只看到所发生之事的一部分时,RLHF 可能产生“欺骗性夸大”(deceptive inflation)与“过度辩护”(overjustification)(Lang 等,2024)(NeurIPS 2024)。
36.2.3 协助博弈 #
协助博弈(assistance game)也称合作逆强化学习,它为人与人工智能助手建模:二者共享此人的目标,而目标只有此人知道。AssistanceZero(Laidlaw 等,2025)(ICML 2025)求解了一个“有超过 种可能目标”的 Minecraft 协助博弈,其助手“显著减少了被试完成建造任务所需的动作数”。Emmons 等人(2025)(ICML 2025)证明,最优的助手有时必须干预人所能观察到的内容:当人根据眼前的结果做决定时,助手可能需要借干预来探询其偏好,而若人有传达偏好的渠道,这种动机便会消失;Boltzmann 非理性的人(较常但并非总是选择更好的选项)也可能引发干预的动机。Ananthakrishnan 等人(2026)(2026 年的一篇预印本,另有研讨会版本)给出了重复协助博弈的第一批高效算法,其 近似协助遗憾为 ,并证明在计算上不可能超越 ;Fickinger 等人(2020)(2020 年的一篇预印本)把社会选择中的不可能定理应用于为多个人服务的助手(第 40.7 节)。此外,现有的 RLHF 算法不是防策略的(strategyproof),即无法杜绝通过谎报获益:“即使只有一个策略性的标注者,也能造成与社会福利之间任意大的错位”,而且“任何防策略的 RLHF 算法都必然比最优策略差 倍,其中 是标注者的人数”(Kleine Buening 等,2025)(NeurIPS 2025)。
36.2.4 对偏好贝叶斯优化的含义 #
这些结果都未在偏好贝叶斯优化上检验过,因此本小节内容均为推断。偏好贝叶斯优化可以看作一种受限的协助博弈:助手的行动仅限于选择展示哪些候选、推荐什么。它所假设的恰好是 Emmons 等人的 Boltzmann 非理性的人,因此在该模型下最优的采集函数,可能偏好这样的选项对:对模型有信息量,却扭曲了人对设计空间的理解。只要人比较的是渲染图、摘要或解释,而不是真实的结果,Wen 等人与 Lang 等人的结果就适用:回路可能收敛到看起来更好的设计,而不是真正更好的设计。根据优化者诅咒,模型设定有误时,被推荐设计的估计效用有向上的偏差,向先验的贝叶斯收缩可以应对这一问题。
按照 Carroll 等人(2024)关于时域的论证,短视的采集函数没有出于规划去改变人的激励,但由人所看到的内容引起的改变仍会发生;图 42.1 模拟了这样的情形:推荐逐渐偏离人最初想要的东西,基准得分却不断提高。截至 2026 年 9 月,我们没有找到这样的偏好贝叶斯优化研究:测量由采集函数引起的偏好改变。以人为对象的偏好贝叶斯优化研究可以这样测量:比较选项对由优化器选择与不由优化器选择时的偏好漂移,并以没有系统时的自然漂移为基线;Carroll 等人 2022 年的论文把这种自然漂移定义为安全偏移。Karwowski 等人可证明的提前停止方法,可以作为偏好贝叶斯优化所缺少的停止规则的候选(第 46.6 节);有多个利益相关者时,Kleine Buening 等人的 倍因子限制了激励相容的聚合所能达到的效果。
第 36.2 节引用的文献 19
- Skalse 等人(2022)Defining and Characterizing Reward Hacking
- Pan 等人(2022)The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models
- Karwowski 等人(2024)Goodhart's Law in Reinforcement Learning
- Kwa 等人(2024)Catastrophic Goodhart: regularizing RLHF with KL divergence does not mitigate heavy-tailed reward misspecification
- Zhuang 与 Hadfield-Menell(2020)Consequences of Misaligned AI
- Hadfield-Menell 等人(2017)Inverse Reward Design
- Smith 与 Winkler(2006)The Optimizer’s Curse: Skepticism and Postdecision Surprise in Decision Analysis
- Carroll 等人(2022)Estimating and Penalizing Induced Preference Shifts in Recommender Systems
- Carroll 等人(2024)AI Alignment with Changing and Influenceable Reward Functions
- Evans 与 Kasirzadeh(2023)User Tampering in Reinforcement Learning Recommender Systems
- Williams 等人(2025)On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback
- Wen 等人(2025)Language Models Learn to Mislead Humans via RLHF
- Sharma 等人(2024)Towards Understanding Sycophancy in Language Models
- Lang 等人(2024)When Your AIs Deceive You: Challenges of Partial Observability in Reinforcement Learning from Human Feedback
- Laidlaw 等人(2025)AssistanceZero: Scalably Solving Assistance Games
- Emmons 等人(2025)Observation Interference in Partially Observable Assistance Games
- Ananthakrishnan 等人(2026)Provably Optimal Learning Algorithms for Assistance Games
- Fickinger 等人(2020)Multi-Principal Assistance Games
- Kleine Buening 等人(2025)Strategyproof Reinforcement Learning from Human Feedback
36.3 人工智能与决策分析中的偏好引出 #
偏好贝叶斯优化所解决的问题,在人工智能与决策分析中有一个更早的名称:偏好引出(preference elicitation),即向一个人提几个问题,以便替其做出好的决策。它的经典结果至今成立;我们没有找到与之矛盾的后续工作。有效分配许多物品,可能需要随物品数量指数增长的通信量(Nisan 与 Segal,2006);一类效用能否用多项式数量的查询引出,取决于它的结构(Blum 等,2004);把引出表述为部分可观测 Markov 决策过程(一种在信念上规划的问题)时,其状态与动作都是连续的,超出了标准求解技术的能力范围(Boutilier,2002)。选择信息的期望价值(expected value of information)最高的问题,即听到回答后最终决策预期改善最多的问题,这一做法可以追溯到 Chajewska 等人(2000),对应于第 19.4 节中决策论的采集函数(推断);主要的替代做法是在与回答相容的所有效用上最小化最坏情况遗憾(Wang 与 Boutilier,2003)。
偏好引出与偏好贝叶斯优化在一处有精确的联系。Astudillo、Lin、Bakshy 与 Frazier 提出 qEUBO 时写道,它与 Viappiani 与 Boutilier(2010)密切相关,后者把最优推荐集与一步贝叶斯最优的查询集联系了起来。他们还指出,回答有噪声时,这两个准则会选择不同的查询;其附录用到的一个引理,是从 Viappiani 与 Boutilier 补充材料中定理 3 的证明推出的(Astudillo 等,2023)(后来出现了期刊版本(Viappiani 与 Boutilier,2020))。一次比较能省下多少?如果学习者可以询问两个样例中哪一个离决策边界更远,那么在大间隔等假设下,“可以用大约 次查询揭示一个规模为 的样本的全部标签”,这是“相对经典主动学习的指数级改进”;而没有这些假设时,最坏情况下需要 次查询(Kane 等,2017)(FOCS 2017)。Hopkins 等人(2020)(COLT 2020)把这一结果推广到有界(Massart)噪声。CP 网(CP-nets)是条件偏好的一种定性表示(“如果主菜是鱼,我偏好白葡萄酒”)。Alanazi 等人(2020)(Artificial Intelligence 2020)计算了从仅一个属性不同的样例中学习无环 CP 网时的 VC 维与教学维(学习者需要多少样例),并给出了即使预言机出错也近乎最优的算法。
36.3.1 规模、稳健性与以人为对象的验证 #
与偏好贝叶斯优化最接近的工作是 Zintgraf 等人(2018)(AAMAS 2018),他们用高斯过程偏好引出在多目标问题的各个解之间做选择。他们借助模拟用户和真实用户发现:排序与聚类策略“优于目前使用的成对方法”;“用户最喜欢排序”;通过“开始时的线性先验均值以及与天底点和理想点的虚拟比较”(即每个目标的最差值和最好值)引入单调性,“提高了性能”。他们还“在一项与阿姆斯特丹市合作开展的交通管理真实研究中”展示了这一框架。
偏好引出在规模和稳健性上也有所发展。Vendrov 等人(2020)(AAAI 2020)把信息的期望价值写成“一个可以用梯度方法优化的可微网络”;Martin 等人(2024)(IJCAI 2024)从数据中学习回答模型与效用模型,并用蒙特卡洛树搜索规划非短视的引出。Vayanos 等人(2020)(2020 年的一篇预印本,我们没有找到其期刊版本)把效用的不确定性表示为一个集合,并针对最坏情况效用或遗憾选择查询;Johnston 等人(2023)(EAAMO 2023)将这一方法用于稀缺医院资源分配中 COVID-19 患者的优先级排序,参与者为“193 名 Amazon Mechanical Turk(MTurk)工作者”,所推荐策略的效用比随机查询高 21%。Herin 等人(2024)(ADT 2024)提出了决策聚合函数权重的容噪主动学习;McElfresh 等人(2021)(AAAI 2021)把犹豫不决(indecision)的模型形式化,并在一项关于器官分配的调查中加以检验。Defresne 等人(2025)(IJCAI 2025)用“Bradley-Terry 偏好模型的最大似然估计”和“受主动学习启发的、基于集成的采集函数”为多目标组合问题引出偏好;Bonilla 等人(2026)(ICML 2026)用“关于边是否存在及其方向的三向似然”和期望信息增益,从专家那里引出因果图。
36.3.2 对偏好贝叶斯优化的含义 #
以决策为中心的查询选择,是按问题对最终决策的影响来选择问题,而不是按其揭示了多少关于各处效用的信息来选择。这一思想先后出现在三个社区中(推断):决策分析中的 Chajewska 等人(2000)以及 Viappiani 与 Boutilier(2010);基于偏好的强化学习中的信息导向奖励学习(2021)与查询与策略错位(2024);偏好贝叶斯优化中的 qEUBO(2023),它承认受益于 Viappiani 与 Boutilier 的工作。我们没有核查偏好贝叶斯优化的论文是否引用了强化学习方面的工作,反之亦然。
Zintgraf 等人已在高斯过程偏好框架内解决了两个问题:单调性(线性先验均值加上与天底点和理想点的虚拟比较)与查询格式(排序胜过成对比较,用户也更喜欢排序)。后来的偏好贝叶斯优化工作仍把它们视为未解决的问题(推断):一个用于偏好探索的单调神经网络集成(Wang 等,2025a)(NeurIPS 2025)在消融实验中把收益归因于单调性;GimmBO 与 MultiBO 等多选项界面(第 20.1 节)采用了列表。我们没有核查这些论文是否引用了 Zintgraf 等人的工作。也有反方向的流动:Defresne 等人采用了偏好贝叶斯优化中常见的 Bradley-Terry 似然与基于集成的采集,但没有使用高斯过程(推断)。
有两种做法值得借鉴(推断)。一是极小极大遗憾引出,它给出与回答相容的所有效用上的最坏情况遗憾;这一方法传统上假设回答没有噪声,但 Herin 等人表明它正与概率方法趋同。偏好贝叶斯优化的一种变体可以在报告期望遗憾的同时,报告高斯过程可信集上的最坏情况遗憾,这适合 Vayanos 等人所设想的高风险分配。二是 Johnston 等人以 193 名用户开展了以随机查询为对照的随机化研究,而偏好贝叶斯优化的用户研究通常只有十几名至几十名被试(第 32 章),也很少设置回答随机查询的组。Kane 等人的指数级收益需要间隔或有界描述,这印证了结构决定引出可行性的经典观点;在基于高斯过程的偏好贝叶斯优化中,这一作用由核函数的光滑度承担(推断)。
第 36.3 节引用的文献 21
- Nisan 与 Segal(2006)The communication requirements of efficient allocations and supporting prices
- Blum 等人(2004)Preference Elicitation and Query Learning
- Boutilier(2002)A POMDP Formulation of Preference Elicitation Problems
- Chajewska 等人(2000)Making Rational Decisions using Adaptive Utility Elicitation
- Wang 与 Boutilier(2003)Incremental Utility Elicitation with the Minimax Regret Decision Criterion
- Viappiani 与 Boutilier(2010)Optimal Bayesian Recommendation Sets and Myopically Optimal Choice Query Sets
- Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
- Viappiani 与 Boutilier(2020)On the equivalence of optimal recommendation sets and myopically optimal query sets
- Kane 等人(2017)Active classification with comparison queries
- Hopkins 等人(2020)Noise-tolerant, Reliable Active Classification with Comparison Queries
- Alanazi 等人(2020)The complexity of exact learning of acyclic conditional preference networks from swap examples
- Zintgraf 等人(2018)Ordered Preference Elicitation Strategies for Supporting Multi-Objective Decision Making
- Vendrov 等人(2020)Gradient-based Optimization for Bayesian Preference Elicitation
- Martin 等人(2024)Model-Free Preference Elicitation
- Vayanos 等人(2020)Robust Active Preference Elicitation
- Johnston 等人(2023)Deploying a Robust Active Preference Elicitation Algorithm on MTurk: Experiment Design, Interface, and Evaluation for COVID-19 Patient Prioritization
- Herin 等人(2024)Noise-Tolerant Active Preference Learning for Multicriteria Choice Problems
- McElfresh 等人(2021)Indecision Modeling
- Defresne 等人(2025)Preference Elicitation for Multi-objective Combinatorial Optimization with Active Learning and Maximum Likelihood Estimation
- Bonilla 等人(2026)Causal Preference Elicitation
- Wang 等人(2025a)Bayesian Optimization with Preference Exploration using a Monotonic Neural Network Ensemble
36.4 推荐系统与反馈回路 #
推荐系统决定人看到什么,人随后点击的内容又成为它的训练数据,这就形成了反馈回路(feedback loop)。一种常见的说法是,这样的回路会把人困在信息茧房(filter bubble)中:接触的内容越来越窄,并不断强化已有的喜好。推而广之,偏好贝叶斯优化同样决定人看到什么,也可能在一次会话之内形成信息茧房。证据出现了分歧。在模拟与理论中,用受先前推荐混杂的数据训练,会“使用户行为同质化,却不增加效用”(Chaney 等,2018)(RecSys 2018);反馈回路会放大流行度偏差,而且“反馈回路的影响通常对属于少数群体的用户更强”(Mansoury 等,2020)(CIKM 2020);在用户向矩阵分解推荐器所展示内容漂移的模型中,在作者刻画并用模拟验证的条件下会出现偏好放大(Kalimeris 等,2021)(KDD 2021);当偏好朝人们消费和喜欢的东西移动时,“标准的用户奖励最大化几乎是一个平凡的目标”(“一大类简单算法只会取得常数遗憾”)(Dean 与 Morgenstern,2022)(EC 2022)。
大型现场实验发现,对极化的短期影响有限。在 Facebook 上,个人的选择比排序更多地限制了人们接触多样内容(Bakshy 等,2015);在 YouTube 上,“完全依赖 YouTube 推荐器会导致更少的党派性消费”,而当党派倾向的用户转向温和内容时,侧边栏推荐器“在大约 30 个视频之内就会‘忘记’他们的党派偏好”(Hosseinmardi 等,2024)(PNAS 2024);在“四项共有近 9,000 名被试参与的实验”中,通过操纵推荐来制造信息茧房与兔子洞,“对观点的影响有限”(Liu 等,2025b)(PNAS 2025)。但在一项为期 7 周、有 4,965 名美国 X 用户参与的随机化实验中,从按时间排序的信息流切换到算法信息流,使用户认为针对 Donald Trump 的调查不可接受的概率提高了 5.5 个百分点,并使政策优先级移动了 0.11 个标准差,而切换回来并没有可比的效果;两个方向都没有显著改变情感极化或党派认同(Gauthier 等,2026)(Nature 2026)。
推荐系统在冷启动(cold start),即新用户没有历史记录时,也直接面对引出问题:只问 2 个问题,推荐效果就比静态模型提升了 25%,从其他用户学到的离线嵌入与赌博机式探索都带来了显著收益(Christakopoulou 等,2016)(KDD 2016);对话式推荐的综述把基于提问的引出和基于模拟用户的评测列为未解决的挑战(Jannach 等,2021;Gao 等,2021)。批评式(critiquing)推荐系统接受关于属性的方向性反馈(“更便宜”“更像这一个,但更安静”);Antognini 与 Faltings(2021)(RecSys 2021)用变分自编码器处理批评,速度比最好的基线快至多 25.6 倍。PEBOL 已在第 35.2.1 节中讨论。
36.4.1 对偏好贝叶斯优化的含义 #
以下全部是推断。至少从 2016 年起,基于群体嵌入的热启动就已是推荐系统冷启动的标准做法;偏好贝叶斯优化中元学习的先验与群体先验(PABBO,以及 Liao 等人基于用户模型预训练的先验;第 32.5 节)是同一个想法。Liao 等人的先验只在早期迭代中有显著帮助,这与上述解读一致。Dean 与 Morgenstern 的结果可以迁移到偏好会变化的偏好贝叶斯优化:若人的效用朝其所见内容移动,低遗憾可以平凡地实现,因此有意义的目标是平稳性或安全偏移准则(图 42.1)。现场实验表明会话内的信息茧房是可能的,但在短会话中影响可能很小;Gauthier 等人发现的不对称性则提示,优化器引起的改变在优化停止后未必会逆转。不过,这些实验涉及的是数周的新闻信息流,而不是一次设计会话,结论能迁移到什么程度并不确定。此外,与批评最接近的是偏好贝叶斯优化中的投影查询与线搜索查询(第 20.2 节、第 20.3 节);方向性批评是偏好贝叶斯优化可以采用的一种观测类型。
第 36.4 节引用的文献 12
- Chaney 等人(2018)How algorithmic confounding in recommendation systems increases homogeneity and decreases utility
- Mansoury 等人(2020)Feedback Loop and Bias Amplification in Recommender Systems
- Kalimeris 等人(2021)Preference Amplification in Recommender Systems
- Dean 与 Morgenstern(2022)Preference Dynamics Under Personalized Recommendations
- Bakshy 等人(2015)Exposure to ideologically diverse news and opinion on Facebook
- Hosseinmardi 等人(2024)Causally estimating the effect of YouTube’s recommender system using counterfactual bots
- Liu 等人(2025b)Short-term exposure to filter-bubble recommendation systems has limited polarization effects: Naturalistic experiments on YouTube
- Gauthier 等人(2026)The political effects of X’s feed algorithm
- Christakopoulou 等人(2016)Towards Conversational Recommender Systems
- Jannach 等人(2021)A Survey on Conversational Recommender Systems
- Gao 等人(2021)Advances and Challenges in Conversational Recommender Systems: A Survey
- Antognini 与 Faltings(2021)Fast Multi-Step Critiquing for VAE-based Recommender Systems
36.5 交互式进化计算 #
交互式进化计算(interactive evolutionary computation)是一种进化搜索,由人而不是公式评判每个候选的适应度:算法繁殖出人所喜欢设计的变体,展示给人看,如此反复。自 Takagi(2001)之后的第一篇全面综述把用户疲劳列为主要挑战,其摘要没有把这一领域与贝叶斯优化相比较(Wang 与 Pei,2024)(Applied Soft Computing 2024)。基于成对比较的交互式差分进化早于 2017 年偏好贝叶斯优化的提出(Takagi 与 Pallez,2009)(NaBIC 2009);生成对抗网络的潜向量“可以置于进化控制之下”,从而使图像朝目标进化(Bontrager 等,2018)(EvoMUSART 2018);基于人类反馈的质量多样性“从人对解之间相似性的判断中逐步推断多样性度量”,并且在文本生成图像任务上“在用户研究中更受欢迎”(Ding 等,2024)(ICML 2024)。质量多样性(quality-diversity)搜索返回的不是单个最优解,而是由彼此不同的好解组成的存档。Lee 等人(2023)的外骨骼研究中,由进化算法提出候选,交给神经排序器并供穿戴者做强制选择,见第 33.1.3 节。
在最小化代谢率等实测成本的问题上,也有研究比较了进化策略与贝叶斯优化。自适应采样 CMA-ES 把评估时间花在难以排序的候选上,它“在复杂的地形中收敛得更高效、更可靠,而在较简单的地形中,AS-CMA 效率较低但同样可靠”(Martin 与 Collins,2026)(Evolutionary Computation 2026)。在一项基于拟合代谢地形的模拟外骨骼调节研究中(Kutulakos 与 Slade,2024)(2024 年的一篇 bioRxiv 预印本),地形固定时,贝叶斯优化在约 60 次评估后收敛到最优点附近;地形随模拟新手的适应而变化时,CMA-ES 在专家模拟与新手模拟中以相近的速率达到最优。作者的结论是,没有哪种算法在所有使用场景下都明显更优。这两项研究使用的都是实测成本,而不是偏好。
36.5.1 对偏好贝叶斯优化的含义 #
以下全部是推断。在 2017 年之前,交互式进化就已经在使用代理适应度模型、成对比较,以及为减轻疲劳而每次只展示少量候选的做法。偏好贝叶斯优化的论文常常声称比交互式进化更省样本,但公平的比较对象应当是人类偏好反馈下的代理模型辅助交互式进化,这是本章末尾列出的缺失研究之一。当偏好仍在形成时,由多样、高质量的选项组成的存档比单个最大值点更符合探索的目标,而偏好贝叶斯优化中的画廊查询与批量查询只部分做到了这一点。CMA-ES 面对会适应的用户时的稳健性,是偏好贝叶斯优化漂移问题在标量情形下的对应:基于种群或基于窗口的方法,可能比保留每一次过时比较的高斯过程后验更能容忍漂移(第 29.10 节)。除多样性与漂移外,交互式进化自身的进展(新的算子、疲劳模型)并未提供偏好贝叶斯优化所缺少的东西。
第 36.5 节引用的文献 8
- Takagi(2001)Interactive evolutionary computation: fusion of the capabilities of EC optimization and human evaluation
- Wang 与 Pei(2024)A comprehensive survey on interactive evolutionary computation in the first two decades of the 21st century
- Takagi 与 Pallez(2009)Paired Comparisons-based Interactive Differential Evolution
- Bontrager 等人(2018)Deep Interactive Evolution
- Ding 等人(2024)Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization
- Lee 等人(2023)User preference optimization for control of ankle exoskeletons using sample efficient active learning
- Martin 与 Collins(2026)Improving CMA-ES Convergence Speed, Efficiency, and Reliability in Noisy Robot Optimization Problems
- Kutulakos 与 Slade(2024)Simulating human-in-the-loop optimization of exoskeleton assistance to compare optimization algorithm performance
36.6 排序学习 #
排序学习(learning to rank)从点击或判断中训练对物品(如搜索结果)排序的模型;标签排序(label ranking)为每个输入预测一组固定标签的顺序;偏好学习(preference learning)则是总称。这些领域研究成对比较已有几十年,其中三项结果关系到偏好贝叶斯优化应当如何收集和解读数据。
36.6.1 一次比较值多少 #
关于比较,流传着两种说法:一是每次比较至多携带一比特信息,远少于一次评分(第 16.6 节);二是成对反馈在信息论意义上并不更低效。两者可以同时成立。Shah 等人(2016)(JMLR 2016)推导了 Bradley-Terry-Luce 与 Thurstone 模型下估计物品质量的紧极小极大界(即可达到的最优最坏情况误差的界)。这些界“通过比较图的 Laplace 矩阵的谱,依赖于由被比较的选项对子集所诱导的比较图的拓扑”,并且“序数设定与基数设定下的误差率除常数前因子外具有相同的标度”。每次比较携带的信息更少,但速率同阶。
36.6.2 偏好贝叶斯优化很少使用的三项结果 #
参数化链接收效甚微。Heckel 等人(2019)(Annals of Statistics 2019)分析了这样一种算法:统计每个物品赢得的比较次数,并按置信区间选择下一对。他们证明,该算法不需要任何参数化模型,就能“用在对数因子意义下最优的比较次数”恢复排序;他们还解决了自己所说的“一个长期悬而未决的问题”:对于随机比较,Thurstone 或 Bradley-Terry-Luce 这样的参数化假设至多带来对数级的收益。
拟合的效用并不总是尊重多数。Noothigattu 等人(2020)(NeurIPS 2020)表明,“一大类随机效用模型(包括 Thurstone-Mosteller 模型)在用最大似然估计时,满足 Pareto 效率条件”以及“一种强单调性”,但“不满足社会选择理论中的某些其他一致性条件,特别是并不总是遵从多数意见”。
位置偏差可以测量和校正。Joachims 等人(2017)(WSDM 2017)的出发点是这样一个观察:“搜索排名中的位置偏差强烈影响一个结果获得的点击数”。他们的反事实框架把给定位置上的结果被查看的概率称为倾向性(propensity),用其倒数对点击重新加权,从而得到无偏的排序学习;该框架“对噪声和倾向性模型的设定错误是稳健的”。只有当结果的位置发生变化时,例如对部分用户随机化位置,才能估计倾向性。
在标签排序方面,Thies 等人(2026a)(ICML 2026)证明:完整排序的校准蕴含其他各种校准概念;“子排序校准与 top-k 校准是不可比的”;“流行的标签排序模型往往校准得很差”。若一个模型以概率 预测的事件大约在比例为 的情形中发生,则称该模型是校准的(calibrated)。MORE-PLR(Thies 等,2026b)(Machine Learning 2026)预测部分标签排序,其中并列的标签共享一个桶。
36.6.3 偏好回路中的位置偏差 #
排名位置在偏好贝叶斯优化中的对应,是一对选项中的左侧或右侧位置,或画廊中的位置。在我们读过的以人为对象的偏好贝叶斯优化研究中,没有一项报告过对呈现顺序做随机化或建模,不过我们没有逐篇核查方法部分;语言模型评判者有很强的位置偏差,对两种顺序取平均是最简单的补救办法(第 35.2.4 节)(Wang 等,2024a)。图 36.1 展示了未经校正的位置偏差会对偏好回路造成什么影响。
可以尝试以下几点:
- 保持选中“当前最优点总在左侧”,取 ,按播放。即使挑战者更好,约四分之三的回答仍偏向当前最优点;模型把位置优势解读为质量,品红色曲线停滞在远高于零的位置。“选左侧位置的回答”一行混合了质量与位置优势,任何拟合这些数据的模型都无法将两者分开:Joachims 等人正是通过改变位置来打破这种混杂。
- 切换到“随机左右”。此时偏差偏向当前最优点和挑战者的频率相同,相当于额外的噪声,而不是在天平一侧暗中加码;绿色曲线持续下降。
- 切换到“随机左右,并对偏差建模”。似然多了一个参数,即位置偏好,其估计值显示在真实的 旁边。在这些运行中,建模主要换来的是一次测量;只有 较大时,遗憾才低于仅随机左右的界面。
- 把 拖到 0。三种界面的表现大致相同:只有当人没有位置偏好时,固定位置的设计才无害,而仅凭固定位置的数据无法判断此人是否有位置偏好。
偏向挑战者所在位置的偏差(图中未显示)在这些模拟中危害不大:它使回路过于急切地更换当前最优点,而优化器保留已比较的最好设计时,这样做代价很小。这种不对称是当前最优点与挑战者这一回路特有的性质,而非一般结论(推断)。由此得出实用的规则(推断):随机安排每一对的左右位置,并加以记录,以便日后测量位置偏好并对其建模。
36.6.4 对偏好贝叶斯优化的含义 #
以下全部是推断。按照 Heckel 等人的结果,偏好贝叶斯优化的样本效率应当主要来自核函数在相近输入之间共享信息,而不是来自链接函数的形式。按照 Shah 等人的结果,误差取决于比较图的谱;总是与当前最好者比较的规则会构建一个星形图,把信息集中在当前最优点上:这有利于确定最大值的位置,但不一定有利于学习可复用的效用。2026 年的两篇论文在偏好贝叶斯优化内部得出了类似的结论(第 27.6 节、图 27.1):Shao 等人(2026)(一篇预印本)发现,EUBO 选择的选项对在比较图中形成孤立的连通分量,使 Laplace 似然的 Hessian 矩阵秩亏;Pukdee 等人(2026)(ICML 2026)指出,间隔与比较图的连通性决定了 Bradley-Terry 学习的样本效率。这与第 35.3.6 节中的区分相吻合:有的选项对用于确定最优点,有的用于学习效用。偏好贝叶斯优化的论文很少报告预测的成对概率在留出的人类比较上是否校准,尽管高斯近似对对决结果的预测很差(Takeno 等,2023)(第 27.4 节);标签排序已提供了现成的指标。此外,跨用户合并的高斯过程效用是一个最大似然随机效用模型,因此按照 Noothigattu 等人的结果,它在某些选项对上可能与多数意见相悖,这补充了第 35.4.4 节中的 Borda 计数结果。
第 36.6 节引用的文献 10
- Shah 等人(2016)Estimation from Pairwise Comparisons: Sharp Minimax Bounds with Topology Dependence
- Heckel 等人(2019)Active ranking from pairwise comparisons and when parametric assumptions do not help
- Noothigattu 等人(2020)Axioms for Learning from Pairwise Comparisons
- Joachims 等人(2017)Unbiased Learning-to-Rank with Biased Feedback
- Thies 等人(2026a)Calibrated Preference Learning: The Case of Label Ranking
- Thies 等人(2026b)MORE-PLR: multi-output regression employed for partial label ranking
- Wang 等人(2024a)Large Language Models are not Fair Evaluators
- Shao 等人(2026)Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization
- Pukdee 等人(2026)What Does Preference Learning Recover from Pairwise Comparison Data?
- Takeno 等人(2023)Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes
36.7 自动化科学与自驱动实验室 #
自驱动实验室(self-driving lab)把机器人实验与优化器结合起来,由优化器(通常是贝叶斯优化)选择下一次实验。有一项实验室研究把人的判断作为唯一的测量:Deneault 等人(2025)(Digital Discovery 2025)调节一台 3D 打印机,其打印目标“难以用传感器测量,却可以由人的判断方便地评价”。我们只能读到摘要,因此不报告其实验批次的规模、查询形式与收益。其他有专家在回路中的实验室应用见第 34.2 节。
Adesiji 等人(2026)(Digital Discovery 2026)定义了加速因子(acceleration factor),即参考策略达到目标所需的实验次数与优化器所需实验次数之比,以及增强因子(enhancement factor),即固定实验次数之后的增益。在 42 项研究与 63 个基准中,报告的加速因子的中位数为 6(范围为 1.3 至 100),增强因子在每个维度约 10 至 20 次实验时达到峰值。据他们报告,Shields 等人(2021)(Nature 2021)发现,到第 15 次实验时,贝叶斯优化的平均表现已超过 50 位专家化学家的平均表现(Adesiji 等人称该反应空间为 10 维;已发表的数据集有五个选择和 1,728 个测得的条件,见第 23.1 节)。第 23 章重演了这样一次优化,第 23.4 节将再次讨论这些化学家。
在自动化实验中,人大多担任监督者。“未来几年可能的策略将是人在回路的自动化实验”,其中“人类操作员监控实验进展”并调整智能体的策略(Kalinin 等,2024)(2023 年的一篇预印本,后发表于 Microscopy Today);在深度核学习中,“对于某些参数组合,实验路径可能陷入局部极小值”,监控用于构建“干预策略”(Pratiush 等,2025)(2024 年的一篇预印本,后发表于 Digital Discovery);人对自主合成智能体的输入提高了在合成基准上的采样效率,并在真实的 Bi-Ti-O 薄膜实验中找到了能稳定亚稳相的工艺区域(Chang 等,2026)(SARA-H,2026 年的一篇预印本);材料发现中可信人工智能的 GIFTERS 检查清单(所综述工作的中位得分为 7 分中的 5 分)主张让人留在回路中(Amirian 等,2025)(2025 年的一篇预印本)。LGBO 在一项湿实验中,把语言模型对区域的偏好作为标量贝叶斯优化的辅助信息(第 35.2.2 节)。
36.7.1 对偏好贝叶斯优化的含义 #
以下全部是推断。自驱动实验室中的人大多充当监督者,在代理模型陷入停滞或目标被证明有误时介入;成对偏好只是若干渠道之一,更接近第 32.2 节中把贝叶斯优化当作助手的安排,而不是人只做比较的回路。加速因子与增强因子,以及每个维度 10 至 20 次实验处的峰值,为偏好贝叶斯优化提供了一种报告标准:偏好贝叶斯优化的论文大多报告合成函数上的遗憾,很少报告以真实用户、相对于纯人工或随机基线测得的加速因子,Deneault 等人是少有的例外。专家的判断若携带代理模型所缺少的信息,例如主观的质量(Deneault 等)或未测量的性质(如 Mikkola 等人(2020)中的材料专家,见第 34.2.1 节),专家的成对输入就有回报;目标可以直接测量时则不然,此时贝叶斯优化平均胜过了 50 位专家化学家(Shields 等,2021)。
第 36.7 节引用的文献 8
- Deneault 等人(2025)Preferential Bayesian optimization improves the efficiency of printing objects with subjective qualities
- Adesiji 等人(2026)Benchmarking self-driving labs
- Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis
- Kalinin 等人(2024)Human-in-the-loop: The future of Machine Learning in Automated Electron Microscopy
- Pratiush 等人(2025)Building Workflows for Interactive Human in the Loop Automated Experiment (hAE) in STEM-EELS
- Chang 等人(2026)Autonomous Materials Exploration by Integrating Automated Phase Identification and AI-Assisted Human Reasoning
- Amirian 等人(2025)Building Trustworthy AI for Materials Discovery: From Autonomous Laboratories to Z-scores
- Mikkola 等人(2020)Projective Preferential Bayesian Optimization
36.8 常见说法核查 #
有关偏好贝叶斯优化的著述中,关于这些相邻领域的一些说法反复出现,表 36.1 对其逐一核查;另有两条,即奖励模型的校准与各领域使用多少次比较,已在第 35.5 节中核查。
| 说法 | 证据怎么说 |
|---|---|
| 逆强化学习与人工智能对齐把奖励视为固定但未知的,因此人工智能领域独立地采用了偏好贝叶斯优化关于稳定潜在效用的假设。 | 作为对这些形式化框架的描述是准确的,但在该领域内部受到质疑:“现有的人工智能对齐方法假设偏好是静态的,这是不现实的”,这“可能削弱现有对齐技术的可靠性”(Carroll 等,2024);而关于人如何从固定奖励生成偏好的常用模型是有缺陷的(Knox 等,2024)。这一共同假设是一种建模惯例,而不是稳定效用存在的独立证据。 |
| 基于势函数的奖励塑形可以防止工具性查询扭曲对终极偏好的推断。 | 塑形是行为数据无法察觉的变换之一:根据 Skalse 等人(2023)(ICML 2023)的定理 3.3,Boltzmann 理性的策略只能在 S′ 重分配与势函数塑形的意义下确定奖励。我们没有找到用塑形来设计偏好查询的来源;这一说法只是一种类比。 |
| HERON 与 DIPPER 是已发表的强化学习分层偏好设计方法。 | 正确:HERON 发表于 ICML 2025,DIPPER(现题名为“Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach”)发表于 ICLR 2026(Bukharin 等,2023;Singh 等,2024)。 |
| Hejna 等(CoRL 2023)借助元学习的奖励函数,所需查询只有 PEBBLE 的 1/20。 | 该论文是 Hejna 与 Sadigh(2022),收录于 PMLR 第 205 卷(第 6 届 Conference on Robot Learning,2022 年 12 月 14 日至 18 日,2023 年 3 月 6 日出版)。其摘要报告在 Meta-World 中把在线反馈减少到原来的 1/20(by 20×),并有真实 Franka Panda 机器人上的演示,但没有指明比较对象是 PEBBLE。 |
| 合作逆强化学习把人的奖励参数视为存在的、稳定的、机器人未知的。 | 准确。AssistanceZero 保留了这一假设(Laidlaw 等,2025);Emmons 等人(2025)加入了部分可观测性。 |
| 序贯的策略性谎报仍然可能,因此采集应当是激励相容的。 | 如今已在 RLHF 上得到量化:一个策略性的标注者就能造成任意大的错位,而任何防策略的算法都可能比最优差 倍(Kleine Buening 等,2025)。 |
| 表述为 POMDP 的精确引出是 PSPACE 难的(被归于 Boutilier 2002),而经典的复杂度结果划定了引出的极限。 | 经典结果成立(第 36.3 节),我们的检索也没有发现与偏好贝叶斯优化相关的更新的 CP 网工作。PSPACE 的说法并不在 Boutilier(2002)中,其摘要说的是,由于问题的状态与动作是连续的,标准的 POMDP 技术无法求解它;有限状态、有限时域的部分可观测 Markov 决策问题的 PSPACE 完全性(Papadimitriou 与 Tsitsiklis,1987)不是关于引出的结果。 |
| 交互式进化使人在没有领域知识的情况下也能有所发现,而设计画廊隐含地承认了偏好是被发现的。 | 成立。近期的交互式质量多样性工作陈述了同样的目标:为“减轻认知负荷”而只给出少量备选,它们“应当多样,但与用户先前的选择相似,以减少用户疲劳”;其加窗 MAP-Elites(在行为网格的每个单元中保留最好的解)“找到更符合用户品味的解”,并用“可控的人工用户”做了测试(Sfikas 等,2023)。 |
第 36.8 节引用的文献 12
- Carroll 等人(2024)AI Alignment with Changing and Influenceable Reward Functions
- Knox 等人(2024)Models of human preference for learning reward functions
- Skalse 等人(2023)Invariance in Policy Optimisation and Partial Identifiability in Reward Learning
- Bukharin 等人(2023)Deep Reinforcement Learning from Hierarchical Preference Design
- Singh 等人(2024)Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach
- Hejna 与 Sadigh(2022)Few-Shot Preference Learning for Human-in-the-Loop RL
- Laidlaw 等人(2025)AssistanceZero: Scalably Solving Assistance Games
- Emmons 等人(2025)Observation Interference in Partially Observable Assistance Games
- Kleine Buening 等人(2025)Strategyproof Reinforcement Learning from Human Feedback
- Boutilier(2002)A POMDP Formulation of Preference Elicitation Problems
- Papadimitriou 与 Tsitsiklis(1987)The Complexity of Markov Decision Processes
- Sfikas 等人(2023)Controllable Exploration of a Design Space via Interactive Quality Diversity
36.9 相邻领域率先解决的问题 #
表 36.2 列出了这样一些问题:某个相邻领域已经解决或已有现成做法,而偏好贝叶斯优化文献仍视为未解决或尚未采用。表中还注明了相应建议是否依赖高斯过程框架。
| 问题 | 率先解决的领域 | 偏好贝叶斯优化中的现状 | 是否依赖高斯过程框架? |
|---|---|---|---|
| 以决策为中心的查询选择 | 决策分析(Viappiani 与 Boutilier 2010);基于偏好的强化学习(Lindner 等 2021,Hu 等 2024) | 已被 qEUBO(2023)采用,并承认其来源 | 否 |
| 单调性与排序查询 | 高斯过程偏好引出(Zintgraf 等 2018) | 仍被视为未解决 | 通过虚拟比较实现单调性:是;排序:否 |
| 具有符合现实的非理性的模拟教师 | 基于偏好的强化学习(B-Pref 2021) | 基准大多使用同方差、独立的噪声 | 否 |
| 测量与校正位置偏差 | 排序学习(Joachims 等 2017);语言模型评判者(Wang 等 2024) | 未发现随机化或建模呈现顺序的报告 | 否 |
| 基于群体嵌入的热启动 | 推荐系统(Christakopoulou 等 2016) | 群体先验被当作新方法提出 | 否 |
| 设计比较图 | 排序估计(Shah 等 2016) | 2026 年才通过秩亏的 Laplace Hessian 矩阵提出 | 部分 |
| 校准指标 | 标签排序(Thies 等 2026) | 很少报告成对概率的校准 | 否 |
| 最坏情况保证 | 稳健引出(Vayanos 等 2020,Johnston 等 2023,Herin 等 2024) | 只有概率后验 | 是,在高斯过程可信集上 |
| 用户适应时的稳健性 | 进化策略(Martin 与 Collins 2026,Kutulakos 与 Slade 2024) | 没有漂移效用模型 | 否 |
| 多样选项的存档 | 基于人类反馈的质量多样性(Ding 等 2024) | 没有学习得到的多样性目标 | 否 |
| 关于属性的方向性反馈 | 批评式推荐系统(例如 Antognini 等 2021) | 未用作观测 | 否 |
| 把系统对人的影响形式化 | 人工智能安全(Carroll 等 2022、2024;Emmons 等 2025) | 未测量 | 否 |
| 用加速因子报告 | 自驱动实验室(Adesiji 等 2026) | 大多报告合成函数上的遗憾 | 否 |
这些建议大多来自问题本身,而不是高斯过程框架;只有通过虚拟比较实现单调性、可信集上的最坏情况遗憾,以及比较图的秩亏,属于该框架内部的修补。
36.10 已定、有争议与缺失 #
已定。以决策为中心的查询选择先后在决策分析、基于偏好的强化学习和偏好贝叶斯优化中提出,qEUBO 承认了它在决策分析中的来源(Astudillo 等,2023)。成对反馈每次查询携带的信息少于评分,但在相差常数的意义下达到相同的速率(Shah 等,2016);参数化链接对排序至多带来对数级的收益(Heckel 等,2019)。如何为人生成偏好的过程建模,会改变能学到什么(Knox 等,2024);微小的对抗性偏差能使推断出的奖励产生任意大的误差(Hong 等,2023)。当位置有变化时,排名中的位置偏差是可测量、可校正的(Joachims 等,2017)。具有完美偏好的模拟教师是不现实的(Lee 等,2021a)。以长时域训练的系统有改变偏好的动机(Carroll 等,2022);对易受影响的少数群体的操纵已在语言模型中得到证实(Williams 等,2025)。
有争议。推荐系统的反馈回路是否改变态度:模拟研究认为会,大多数现场实验发现短期影响有限,一项为期 7 周的实验发现了不对称的效应(Gauthier 等,2026)。进化策略与贝叶斯优化哪个更适合人在回路优化:答案取决于地形以及用户是否会适应(Martin 与 Collins,2026;Kutulakos 与 Slade,2024)。专家的成对输入能否改进一个设定良好的优化器:目标主观时有帮助(Deneault 等,2025),产率可以测量时则不及优化器(Shields 等,2021)。
缺失。在以人为对象的偏好贝叶斯优化研究中,对由采集函数引起的偏好改变的测量。任何对呈现顺序做随机化或建模的偏好贝叶斯优化研究。在成对偏好反馈下对交互式进化与偏好贝叶斯优化的比较,包括以代理模型辅助的交互式进化为基线的比较,以及取自交互式进化的定量疲劳模型。能够优化从人那里学到的多样性目标、把方向性批评用作观测,或对漂移的效用建模的偏好贝叶斯优化方法。与后验一同报告的最坏情况保证。以真实用户、相对于纯人工或随机基线测得的加速因子。有多于一个人类预言机在闭环中给出成对偏好的自驱动实验室。使用 B-Pref 式非理性模拟用户的基准。
第 36.10 节引用的文献 14
- Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
- Shah 等人(2016)Estimation from Pairwise Comparisons: Sharp Minimax Bounds with Topology Dependence
- Heckel 等人(2019)Active ranking from pairwise comparisons and when parametric assumptions do not help
- Knox 等人(2024)Models of human preference for learning reward functions
- Hong 等人(2023)On the Sensitivity of Reward Inference to Misspecified Human Models
- Joachims 等人(2017)Unbiased Learning-to-Rank with Biased Feedback
- Lee 等人(2021a)B-Pref: Benchmarking Preference-Based Reinforcement Learning
- Carroll 等人(2022)Estimating and Penalizing Induced Preference Shifts in Recommender Systems
- Williams 等人(2025)On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback
- Gauthier 等人(2026)The political effects of X’s feed algorithm
- Martin 与 Collins(2026)Improving CMA-ES Convergence Speed, Efficiency, and Reliability in Noisy Robot Optimization Problems
- Kutulakos 与 Slade(2024)Simulating human-in-the-loop optimization of exoskeleton assistance to compare optimization algorithm performance
- Deneault 等人(2025)Preferential Bayesian optimization improves the efficiency of printing objects with subjective qualities
- Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis
延伸阅读 #
- Lee 等人(2021a)即 B-Pref 基准,对模拟的人可能有哪些非理性给出了最清晰的分类,可以当作偏好贝叶斯优化基准的检查清单来读。
- Knox 等人(2024)与 Hong 等人(2023)合起来说明:对人如何回答的建模,与对人想要什么的建模同样重要。
- 对于会改变其所学偏好的系统,Carroll 等人(2024)的论述最为直接。
- Zintgraf 等人(2018)是一项有真实用户参与的高斯过程偏好引出研究,早在 2018 年就解决了单调性与查询格式的问题。
- Joachims 等人(2017)展示了如何把有偏的呈现转化为测得的倾向性,这正是图 36.1 背后的想法。
- Adesiji 等人(2026)定义了加速因子与增强因子,并汇集了各项自驱动实验室研究中的这些因子。
参考文献
- (2026). Benchmarking self-driving labs. Digital Discovery. 引用于 §36.7
- (2020). The complexity of exact learning of acyclic conditional preference networks from swap examples. Artificial Intelligence. doi:10.1016/j.artint.2019.103182. 引用于 §36.3
- (2025). Building Trustworthy AI for Materials Discovery: From Autonomous Laboratories to Z-scores. arXiv. 预印本引用于 §36.7
- (2026). Provably Optimal Learning Algorithms for Assistance Games. arXiv (a 2026 AI4GOOD Workshop version also exists). 预印本引用于 §36.2
- (2021). Fast Multi-Step Critiquing for VAE-based Recommender Systems. Fifteenth ACM Conference on Recommender Systems. doi:10.1145/3460231.3474249. 引用于 §36.4
- (2023). qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization. International Conference on Artificial Intelligence and Statistics. 引用于 §36.3 §36.10
- (2015). Exposure to ideologically diverse news and opinion on Facebook. Science. 引用于 §36.4
- (2004). Preference Elicitation and Query Learning. Journal of Machine Learning Research. 引用于 §36.3
- (2026). Causal Preference Elicitation. ICML 2026 (per OpenReview). 引用于 §36.3
- (2018). Deep Interactive Evolution. EvoMUSART 2018. 引用于 §36.5
- (2002). A POMDP Formulation of Preference Elicitation Problems. Proceedings of the Eighteenth National Conference on Artificial Intelligence (AAAI-02). 引用于 §36.3 §36.8
- (2023). Deep Reinforcement Learning from Hierarchical Preference Design. International Conference on Machine Learning (ICML 2025). 引用于 §36.8
- (2022). Estimating and Penalizing Induced Preference Shifts in Recommender Systems. ICML 2022. 引用于 §36.2 §36.10
- (2024). AI Alignment with Changing and Influenceable Reward Functions. International Conference on Machine Learning. 引用于 §36.2 §36.8
- (2023). Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback. TMLR 2023. 引用于 §36.1
- (2000). Making Rational Decisions using Adaptive Utility Elicitation. Proceedings of the Seventeenth National Conference on Artificial Intelligence (AAAI-00). 引用于 §36.3
- (2018). How algorithmic confounding in recommendation systems increases homogeneity and decreases utility. Proceedings of the 12th ACM Conference on Recommender Systems. 引用于 §36.4
- (2026). Autonomous Materials Exploration by Integrating Automated Phase Identification and AI-Assisted Human Reasoning. arXiv. 预印本引用于 §36.7
- (2024). RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences. ICML 2024. 引用于 §36.1
- (2024). Listwise Reward Estimation for Offline Preference-based Reinforcement Learning. ICML 2024. 引用于 §36.1
- (2016). Towards Conversational Recommender Systems. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining. 引用于 §36.4
- (2017). Deep reinforcement learning from human preferences. Advances in Neural Information Processing Systems. 引用于 §36.1
- (2022). Preference Dynamics Under Personalized Recommendations. EC 2022. 引用于 §36.4
- (2025). Preference Elicitation for Multi-objective Combinatorial Optimization with Active Learning and Maximum Likelihood Estimation. Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence. 引用于 §36.3
- (2025). Preferential Bayesian optimization improves the efficiency of printing objects with subjective qualities. Digital Discovery. 引用于 §36.7 §36.10
- (2024). Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization. ICML 2024. 引用于 §36.5
- (2025). Observation Interference in Partially Observable Assistance Games. ICML 2025. 引用于 §36.2 §36.8
- (2023). User Tampering in Reinforcement Learning Recommender Systems. AIES 2023. 引用于 §36.2
- (2020). Multi-Principal Assistance Games. arXiv. 预印本引用于 §36.2
- (2021). Advances and Challenges in Conversational Recommender Systems: A Survey. AI Open. 引用于 §36.4
- (2023). Scaling Laws for Reward Model Overoptimization. Proceedings of the 40th International Conference on Machine Learning (ICML 2023). 引用于 §36.1
- (2026). The political effects of X’s feed algorithm. Nature. doi:10.1038/s41586-026-10098-2. 引用于 §36.4 §36.10
- (2017). Inverse Reward Design. NeurIPS 2017. 引用于 §36.2
- (2025). Influencing Humans to Conform to Preference Models for RLHF. Transactions on Machine Learning Research. 引用于 §36.1
- (2019). Active ranking from pairwise comparisons and when parametric assumptions do not help. The Annals of Statistics. 引用于 §36.6 §36.10
- (2022). Few-Shot Preference Learning for Human-in-the-Loop RL. Conference on Robot Learning. 引用于 §36.8
- (2023). Inverse Preference Learning: Preference-based RL without a Reward Function. NeurIPS 2023. 引用于 §36.1
- (2024). Contrastive Preference Learning: Learning from Human Feedback without RL. ICLR 2024. 引用于 §36.1
- (2024). Noise-Tolerant Active Preference Learning for Multicriteria Choice Problems. Algorithmic Decision Theory. 引用于 §36.3
- (2023). On the Sensitivity of Reward Inference to Misspecified Human Models. ICLR 2023. 引用于 §36.1 §36.10
- (2020). Noise-tolerant, Reliable Active Classification with Comparison Queries. Conference on Learning Theory. 引用于 §36.3
- (2024). Causally estimating the effect of YouTube’s recommender system using counterfactual bots. Proceedings of the National Academy of Sciences. 引用于 §36.4
- (2024). Query-Policy Misalignment in Preference-Based Reinforcement Learning. ICLR 2024. 引用于 §36.1
- (2021). A Survey on Conversational Recommender Systems. ACM Computing Surveys. 引用于 §36.4
- (2017). Unbiased Learning-to-Rank with Biased Feedback. WSDM 2017. 引用于 §36.6 §36.10
- (2023). Deploying a Robust Active Preference Elicitation Algorithm on MTurk: Experiment Design, Interface, and Evaluation for COVID-19 Patient Prioritization. EAAMO 2023. 引用于 §36.3
- (2021). Preference Amplification in Recommender Systems. Proceedings of the 27th ACM SIGKDD Conference on Knowledge Discovery & Data Mining. 引用于 §36.4
- (2024). Human-in-the-loop: The future of Machine Learning in Automated Electron Microscopy. Microscopy Today. doi:10.1093/mictod/qaad096. 引用于 §36.7
- (2017). Active classification with comparison queries. FOCS 2017. 引用于 §36.3
- (2024). Goodhart's Law in Reinforcement Learning. ICLR 2024. 引用于 §36.2
- (2025). Strategyproof Reinforcement Learning from Human Feedback. NeurIPS 2025. 引用于 §36.2 §36.8
- (2024). Models of human preference for learning reward functions. TMLR 2024. 引用于 §36.1 §36.8 §36.10
- (2024). Simulating human-in-the-loop optimization of exoskeleton assistance to compare optimization algorithm performance. bioRxiv. 预印本引用于 §36.5 §36.10
- (2024). Catastrophic Goodhart: regularizing RLHF with KL divergence does not mitigate heavy-tailed reward misspecification. NeurIPS 2024. 引用于 §36.2
- (2025). AssistanceZero: Scalably Solving Assistance Games. ICML 2025. 引用于 §36.2 §36.8
- (2024). When Your AIs Deceive You: Challenges of Partial Observability in Reinforcement Learning from Human Feedback. NeurIPS 2024. 引用于 §36.2
- (2021a). B-Pref: Benchmarking Preference-Based Reinforcement Learning. NeurIPS 2021 Datasets and Benchmarks. 引用于 §36.1 §36.10
- (2021b). PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training. ICML 2021. 引用于 §36.1
- (2023). User preference optimization for control of ankle exoskeletons using sample efficient active learning. Science Robotics. 引用于 §36.5
- (2021). Information Directed Reward Learning for Reinforcement Learning. NeurIPS 2021. 引用于 §36.1
- (2025b). Short-term exposure to filter-bubble recommendation systems has limited polarization effects: Naturalistic experiments on YouTube. Proceedings of the National Academy of Sciences. 引用于 §36.4
- (2020). Feedback Loop and Bias Amplification in Recommender Systems. CIKM 2020. 引用于 §36.4
- (2026). Improving CMA-ES Convergence Speed, Efficiency, and Reliability in Noisy Robot Optimization Problems. Evolutionary Computation. 引用于 §36.5 §36.10
- (2024). Model-Free Preference Elicitation. Thirty-Third International Joint Conference on Artificial Intelligence. 引用于 §36.3
- (2021). Indecision Modeling. Proceedings of the AAAI Conference on Artificial Intelligence. doi:10.1609/aaai.v35i7.16746. 引用于 §36.3
- (2020). Projective Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §36.7
- (2006). The communication requirements of efficient allocations and supporting prices. Journal of Economic Theory. 引用于 §36.3
- (2020). Axioms for Learning from Pairwise Comparisons. Advances in Neural Information Processing Systems. 引用于 §36.6
- (2020). Dueling Posterior Sampling for Preference-Based Reinforcement Learning. Conference on Uncertainty in Artificial Intelligence. 引用于 §36.1
- (2022). The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models. ICLR 2022. 引用于 §36.2
- (1987). The Complexity of Markov Decision Processes. Mathematics of Operations Research. 引用于 §36.8
- (2025). Building Workflows for Interactive Human in the Loop Automated Experiment (hAE) in STEM-EELS. Digital Discovery. doi:10.1039/d5dd00033e. 引用于 §36.7
- (2026). What Does Preference Learning Recover from Pairwise Comparison Data? ICML 2026. 引用于 §36.6
- (2024). Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms. NeurIPS 2024. 引用于 §36.1
- (2023). Dueling RL: Reinforcement Learning with Trajectory Preferences. International Conference on Artificial Intelligence and Statistics. 引用于 §36.1
- (2023). Controllable Exploration of a Design Space via Interactive Quality Diversity. arXiv (parts published at GECCO 2023). 预印本引用于 §36.8
- (2016). Estimation from Pairwise Comparisons: Sharp Minimax Bounds with Topology Dependence. Journal of Machine Learning Research. 引用于 §36.6 §36.10
- (2026). Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization. arXiv. 预印本引用于 §36.6
- (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024. 引用于 §36.2
- (2021). Bayesian reaction optimization as a tool for chemical synthesis. Nature. 引用于 §36.7 §36.10
- (2024). Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach. International Conference on Learning Representations (ICLR 2026). 引用于 §36.8
- (2022). Defining and Characterizing Reward Hacking. Advances in Neural Information Processing Systems 35 (NeurIPS 2022). 引用于 §36.2
- (2023). Invariance in Policy Optimisation and Partial Identifiability in Reward Learning. ICML 2023. 引用于 §36.8
- (2006). The Optimizer’s Curse: Skepticism and Postdecision Surprise in Decision Analysis. Management Science. 引用于 §36.2
- (2001). Interactive evolutionary computation: fusion of the capabilities of EC optimization and human evaluation. Proceedings of the IEEE. 引用于 §36.5
- (2009). Paired Comparisons-based Interactive Differential Evolution. NaBIC 2009. 引用于 §36.5
- (2023). Towards Practical Preferential Bayesian Optimization with Skew Gaussian Processes. International Conference on Machine Learning. 引用于 §36.6
- (2026a). Calibrated Preference Learning: The Case of Label Ranking. International Conference on Machine Learning (ICML 2026). 引用于 §36.6
- (2026b). MORE-PLR: multi-output regression employed for partial label ranking. Machine Learning 115. 引用于 §36.6
- (2020). Robust Active Preference Elicitation. arXiv (journal version not found). 预印本引用于 §36.3
- (2020). Gradient-based Optimization for Bayesian Preference Elicitation. AAAI 2020. 引用于 §36.3
- (2010). Optimal Bayesian Recommendation Sets and Myopically Optimal Choice Query Sets. Advances in Neural Information Processing Systems. 引用于 §36.3
- (2020). On the equivalence of optimal recommendation sets and myopically optimal query sets. Artificial Intelligence. 引用于 §36.3
- (2003). Incremental Utility Elicitation with the Minimax Regret Decision Criterion. Proceedings of the Eighteenth International Joint Conference on Artificial Intelligence (IJCAI-03). 引用于 §36.3
- (2024). A comprehensive survey on interactive evolutionary computation in the first two decades of the 21st century. Applied Soft Computing. doi:10.1016/j.asoc.2024.111950. 引用于 §36.5
- (2023a). Is RLHF More Difficult than Standard RL? NeurIPS 2023. 引用于 §36.1
- (2024a). Large Language Models are not Fair Evaluators. ACL 2024. 引用于 §36.6
- (2025a). Bayesian Optimization with Preference Exploration using a Monotonic Neural Network Ensemble. Advances in Neural Information Processing Systems 38. doi:10.52202/085713-4124. 引用于 §36.3
- (2025). Language Models Learn to Mislead Humans via RLHF. ICLR 2025. 引用于 §36.2
- (2025). On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback. ICLR 2025. 引用于 §36.2 §36.10
- (2024). Uni-RLHF: Universal Platform and Benchmark Suite for Reinforcement Learning with Diverse Human Feedback. ICLR 2024. 引用于 §36.1
- (2020). Consequences of Misaligned AI. NeurIPS 2020. 引用于 §36.2
- (2018). Ordered Preference Elicitation Strategies for Supporting Multi-Objective Decision Making. AAMAS 2018. 引用于 §36.3