贝叶斯优化
第七部分:人在回路
EN

建成环境、科学与工业

第 32 章与第 33 章考察的是人必须身处回路的偏好优化:设计只有其用户才能评判,装置只有穿戴者才能感受。本章介绍其余的应用。在这些应用中,请人参与的理由没有那么明显,证据的形态也不同。在建筑和车辆领域,舒适度和驾驶风格因人而异,但研究大多使用模拟的居住者和驾驶员。在科学与工程领域,偏好把专家的判断引入原本以实测量为目标的优化,专家通常为 1 至 4 人。在工业领域,软件已经就绪,公开记录则只有基准测试和阐述动机的陈述。随后,本章比较本部分各应用领域中来自真人的证据,最后核查二手叙述中关于这些应用的若干流行说法。

34.1 建筑与车辆 #

34.1.1 热舒适与天然采光 #

舒适度因人而异,居住者也很容易回答关于舒适度的比较,因此建筑是天然的应用对象。证据几乎全部来自模拟。普渡大学的一个研究组在 2017 至 2020 年间,从比较式偏好中学习个人对办公室天然采光的视觉满意度(Xiong 等,2017;Xiong 等,2018;Xiong 等,2020);我们未能获得其样本量和查询次数。预印本 Awalgaonkar 等人(2019)把居住者的回答(“我希望暖一些”“凉一些”或“我很满意”)当作其效用导数的符号,采用约束为单峰的高斯过程,并用合成的居住者加以验证。

POP-BO 是一种乐观的偏好贝叶斯优化方法,带有累积遗憾界(Xu 等,2024b)。论文中包含一个模拟的热舒适任务:偏好由预测平均投票(predicted mean vote,PMV)生成,变量为 2 个或 4 个,例如空气温度和风速;预测平均投票是计算群体平均舒适度评分的标准公式。qEUBO(EUBO 的多选项形式,一次查询展示 qq 个选项,第 19.4 节)找到的最终解略好,但其累积遗憾几乎是 POP-BO 的两倍。作者认为,供暖、通风与空调(heating, ventilation, and air conditioning,HVAC,以下简称暖通空调)的在线控制应当关注累积遗憾,即整个运行过程中的总不适(第 13 章)。另外三篇较新的预印本也是模拟研究:情境偏好贝叶斯优化在建筑模拟平台 BOPTEST 上,于两个模拟月内把居住者效用最多提高 23%(Wang 等,2025d);一个实时优化偏好的控制器在模拟的热舒适任务上接受了评估(Wang 等,2025c);一种对社会影响稳健的共识贝叶斯优化把热舒适作为应用之一(Adachi 等,2025)。

2024 至 2026 年间,所有关于建筑的偏好贝叶斯优化研究都使用模拟的居住者。这是空白,而非否定性的结果:下一项有价值的研究,应是以真实居住者检验基于偏好的暖通空调控制,并在报告最终设置的同时报告累积不适(推断)。

34.1.2 车辆与控制器标定 #

人会误判自己的驾驶。Basu 等人(2017)不是优化研究,其结果显示:用户偏好的驾驶风格明显比自己实际的驾驶更具防御性;他们偏好自以为属于自己的风格,而非自己实际的风格;在不同场景中偏好的风格也不同。因此,从人的驾驶方式中学习的系统,与从人自称的偏好中学习的系统,会得出不同的结果。

一项有真实驾驶员参与的研究。Ran 等人(2023)根据偏好在线个性化车道居中轨迹,并对每个回答的不确定性建模。在固定基座驾驶模拟器中,29 名驾驶员(15 名缺乏经验,14 名有经验)平均经过 11.1 ± 4.6 次查询即收敛,几乎全部少于 20 次;估计出的效用与驾驶员自己的评分一致。

模拟中的控制器标定。模型预测控制器(model predictive controller,MPC)每一步都在对未来的短期预测上做优化,以此选择动作;其中的权重通常由工程师反复试错来标定。Zhu 等人(2021)用 GLISp(第 33.6 节中基于径向基函数的方法)标定模型预测控制器,对象是一个模拟反应器和一辆模拟的车道保持汽车(各 50 次实验);对于汽车,作者即使经过大量试错,也写不出可用于自动标定的评分函数。在后来的研究中,决策者或为合成的,或为作者本人。C-GLISp 为未知约束增加了可行性标签,基准测试中使用合成决策者,驾驶案例中由第一作者担任标定者(Zhu 等,2022);Theiner 等人(2025)用一个基于真实驾驶数据构建的虚拟决策者引导偏好贝叶斯优化,主决策者同样是合成的,收敛快于需要约 70 次迭代的标准偏好贝叶斯优化,后续还有一项多保真度研究(Theiner 等,2026);另有两篇预印本,分别借助合成用户调节车辆悬架(Cercola 等,2026b),以及调节一辆电动赛车的滑移控制,后者只有模拟结果(de Vries 等,2024)。依据评分优化的车内界面研究见第 32.1.4 节。

第 34.1 节引用的文献 16
  1. Xiong 等人(2017)Personalized visual satisfaction profiles from comparative preferences using Bayesian inference
  2. Xiong 等人(2018)Inferring personalized visual satisfaction profiles in daylit offices from comparative preferences using a Bayesian approach
  3. Xiong 等人(2020)Efficient learning of personalized visual preferences in daylit offices: An online elicitation framework
  4. Awalgaonkar 等人(2019)Learning Personalized Thermal Preferences via Bayesian Active Learning with Unimodality Constraints
  5. Xu 等人(2024b)Principled Preferential Bayesian Optimization
  6. Wang 等人(2025d)Personalized Building Climate Control with Contextual Preferential Bayesian Optimization
  7. Wang 等人(2025c)Human-in-the-loop: Real-time Preference Optimization
  8. Adachi 等人(2025)Bayesian Optimization for Building Social-Influence-Free Consensus
  9. Basu 等人(2017)Do You Want Your Autonomous Car To Drive Like You?
  10. Ran 等人(2023)Online Personalized Preference Learning Method Based on In-Formative Query for Lane Centering Control Trajectory
  11. Zhu 等人(2021)Preference-based MPC calibration
  12. Zhu 等人(2022)C-GLISp: Preference-Based Global Optimization Under Unknown Constraints With Applications to Controller Calibration
  13. Theiner 等人(2025)Exploiting Prior Knowledge in Preferential Learning of Individualized Autonomous Vehicle Driving Styles
  14. Theiner 等人(2026)Efficient Controller Learning from Human Preferences and Numerical Data Via Multi-Modal Surrogate Models
  15. Cercola 等人(2026b)Regularized GLISp for sensor-guided human-in-the-loop optimization
  16. de Vries 等人(2024)A Human-optimized Model Predictive Control Scheme and Extremum Seeking Parameter Estimator for Slip Control of Electric Race Cars

34.2 借助专家偏好的科学与工程 #

在各门科学中,偏好的主要作用是把专家的判断引入贝叶斯优化,而这类优化原本以一个实测的标量为目标;每项研究中的真实专家为 1 至 4 人。第 15.3 节介绍以实测量为目标的实验科学中的贝叶斯优化,第 23 章则完整演示一个化学反应的优化过程。

34.2.1 材料与物理科学 #

专业知识明显影响结果。Mikkola 等人(2020)的投影偏好贝叶斯优化让用户用滑块沿一维投影选出最好的点(第 20.3 节)。该方法用于确定樟脑分子在铜表面 Cu(111) 上的位置和取向,每个候选的能量都用密度泛函理论核验;密度泛函理论是计算分子构型能量的一种量子力学方法。每位用户回答了 24 次查询。两位材料科学专家偏好的结构弛豫到约 -1.007 至 -1.030 eV 的能量极小值,一位非专家偏好的结构则弛豫到更浅的局部极小值,约 -0.762 至 -0.771 eV。作者认为这是按专业水平出现的明显分化;该方法还能把人的选择与随机机器人的选择区分开。

对光谱投票。BOARS 用 Thurstone-Mosteller 标度(第 16.3 节)把操作者对实测光谱的赞成票或反对票转化为目标函数,前期由人主导,后期由算法主导,并在一台实时运行的原子力显微镜上做了演示(Biswas 等,2024)。2026 年的预印本 px-BO 用 Bradley-Terry 模型(第 16.4 节)拟合这些投票,然后让代理模型代替人投票,由人定期检查(Biswas 等,2026)。

解释与过度信任的风险。在 CoExBO(第 32.7 节)中,专家在两个附有解释的候选之间做选择(Adachi 等,2024)。在一项有 4 名被试的电池电解液设计中,解释提高了专家的准确率。作者指出,这些收益以专家的比较性知识准确为前提;而且专家往往期望代理模型像神谕一样理解问题,这是过度信任的一种表现。

模拟的专家。BOAP 面向锂离子电极制造,对专家在无法测量的“抽象属性”上的成对偏好建模,但这些偏好是根据已发表的数据集模拟的(Arun Kumar A V 等,2024)。在 Liu 与 Kalinin(2025)对扫描探针显微镜的多目标优化中,人通过目标权重和参考点而非比较来引导优化。Deneault 等人(2025)用偏好贝叶斯优化来优化 3D 打印件的主观品质,这些品质由人评判,而非由传感器测量。

34.2.2 化学与药物发现 #

本章中唯一的大规模专家偏好数据集来自化学领域。MolSkill 在几个月内从诺华的 35 位化学家(分别从事湿实验、计算和分析工作)处收集了 5,000 多次分子成对比较,每一轮的比较对象都由主动学习选出(Choung 等,2023)。一致性中等。在初步轮次中,200 对上的评分者间一致性用 Fleiss κ(Fleiss' kappa)衡量,为 0.40 和 0.32;Fleiss κ 是多位评分者之间校正机遇后的一致性,0 表示机遇水平,1 表示完全一致。20 个重复对上的评分者内一致性用 Cohen κ 衡量,为 0.60 和 0.59,部分化学家低至 0.16 至 0.27。成对分类的 ROC 曲线下面积,即模型把随机抽取的一个受偏好分子排在随机抽取的一个不受偏好分子之前的概率,从 1,000 对时的约 0.6 上升到 5,000 对时的 0.74 以上,且尚未进入平台期。学到的评分比 QED(化学家常用的类药性定量估计)更好地刻画了类药性。MolSkill 是做排序学习的神经网络,不是贝叶斯优化。

其余化学研究使用模拟的专家、单一专家,或根本没有专家。Sundin 等人(2022)主动学习一位化学家的评分函数,在两个以模拟真值为准的案例中,用不到 200 次查询就取得显著改进;演示中有一位药物化学家参与,他每次评判一个分子,而非一对分子。研讨会论文 CheapVS 借助化学家对各性质间权衡的成对偏好,引导对 100,000 个分子的筛选:筛选化合物库的 6%,就找回了一个靶点(EGFR)37 种已知药物中的 16 种,以及另一个靶点(DRD2)58 种中的 37 种;但该研究使用的是合成效用函数和初步的人类数据(专家对 EGFR 的排序约 80% 准确),专家人数我们也未能查到(Dang 等,2025)。研讨会论文 Kristiadi 等人(2024b)用评分函数模拟专家的成对标签;同为研讨会论文的 Hawkins-Hooker 等人(2023)将“偏好贝叶斯优化”用于蛋白质设计,其比较来自实测的适应度;预印本 Haltia 等人(2026)则根据成本,在一次昂贵的评估与一次向专家的查询之间做选择。

34.2.3 在人与算法之间分工 #

Kanarik 等人(2023)在一个设计半导体等离子体刻蚀工艺的虚拟工艺游戏中比较了人与贝叶斯优化。工程师在前期表现良好;接近严格公差时,算法的成本效率要高得多;“人先、计算机后”(human first-computer last)的策略,使达到目标的成本比只靠工程师减少一半。这里的目标是实测的标量,这一结论能在多大程度上推广到偏好驱动的设计,尚不确定。预印本 Weichert 等人(2025)则记录了一个工业案例,加入专家知识反而导致优化失败。

由此可见。化学家之间的一致性约为 0.3 至 0.4,同一位化学家内部约为 0.6。这说明专家的成对直觉可以学习,但彼此之间只是中等程度地共享;因此,为每位专家单独建模或使用混合模型,比合并数据更合适(推断;第 27.2 节)。Mikkola 等人发现的专家与非专家之间的分化,以及 CoExBO 关于专家知识准确的假设,都指向一种尚未检验的失效模式:专家出错或过度自信。CoExBO 的无害保证是迄今主要的设计应对(推断);依赖专家偏好的方法,可以用至少一位故意被误导的专家来检验(推断)。

第 34.2 节引用的文献 15
  1. Mikkola 等人(2020)Projective Preferential Bayesian Optimization
  2. Biswas 等人(2024)A dynamic Bayesian optimized active recommender system for curiosity-driven partially Human-in-the-loop automated experiments
  3. Biswas 等人(2026)Human-AI Collaborative Autonomous Experimentation With Proxy Modeling for Comparative Observation
  4. Adachi 等人(2024)Looping in the Human Collaborative and Explainable Bayesian Optimization
  5. Arun Kumar A V 等人(2024)Enhanced Bayesian Optimization via Preferential Modeling of Abstract Properties
  6. Liu 与 Kalinin(2025)Pareto-Optimal Experimentation: Human-Guided Multi-Objective Bayesian Optimization in Scanning Probe Microscopy
  7. Deneault 等人(2025)Preferential Bayesian optimization improves the efficiency of printing objects with subjective qualities
  8. Choung 等人(2023)Extracting medicinal chemistry intuition via preference machine learning
  9. Sundin 等人(2022)Human-in-the-loop assisted de novo molecular design
  10. Dang 等人(2025)Preferential Multi-Objective Bayesian Optimization for Drug Discovery
  11. Kristiadi 等人(2024b)How Useful is Intermittent, Asynchronous Expert Feedback for Bayesian Optimization?
  12. Hawkins-Hooker 等人(2023)Preferential Bayesian Optimisation for Protein Design with Ranking-Based Fitness Predictors
  13. Haltia 等人(2026)Elicitation-Augmented Bayesian Optimization
  14. Kanarik 等人(2023)Human–machine collaboration for improving semiconductor process development
  15. Weichert 等人(2025)When Less is More: A Story of Failing Bayesian Optimization Due to Additional Expert Knowledge

34.3 工业 #

主要的工业路线:Meta 的偏好探索。偏好探索贝叶斯优化(BOPE,即多结果贝叶斯优化中的偏好探索)交替进行两个步骤:运行实验,以及请决策者比较预测的结果向量(Lin 等,2022)。这篇论文以 A/B 测试工作流为动机,但实验使用的是车辆安全问题(5 个输入,3 个输出)、汽车驾驶室设计问题(7 个输入,9 个输出)以及 DTLZ2 和 OSY 测试问题,并以带噪声的合成效用代替人类决策者。qEUBO 把最优选项期望效用推广到一次展示 qq 个选项的查询(Astudillo 等,2023)。两者均已纳入 BoTorch(Meta Platforms, Inc.,2026d);2026 年 1 月至 6 月间,Ax 1.2 至 1.3 版加入了偏好优化配置、BOPE 效用跟踪、qEUBO 和成对高斯过程(Meta Platforms, Inc.,2026l)(第 31.1.2 节)。语言在回路优化(LILO)借助语言模型把自然语言反馈转化为偏好信号,其评估以语言模型代替决策者(Kobalczyk 等,2026)(第 35 章)。其他面向工业的应用包括横幅广告(第 32.1.1 节)、用于电子设计自动化工具的 RankTuner(Xu 等,2026)、用于推荐的情境对决赌博机(Sankagiri 等,2026)、多准则决策支持(Huber 等,2025)和助听器预设(Vyas 等,2022)。

部署的公开证据。两次网络检索都没有找到 Meta 或其他任何公司量化 BOPE 生产效果的报告。在同行评审文献中,助听器是唯一既有商业机制描述、又有用户评估的领域,而这些评估都有制造商参与(推断,依据作者的所属机构;第 33.4 节)。因此,工具链支持生产环境中的 A/B 测试,但这种用法的公开证据只有基准测试和阐述动机的陈述。通过交错排列结果来比较搜索排序器的对决赌博机,不在我们的检索范围之内。

第 34.3 节引用的文献 9
  1. Lin 等人(2022)Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes
  2. Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
  3. Meta Platforms, Inc.(2026d)Bayesian optimization with preference exploration (BOPE tutorial, documentation v0.18.1)
  4. Meta Platforms, Inc.(2026l)CHANGELOG (versions 1.2 to 1.3)
  5. Kobalczyk 等人(2026)LILO: Bayesian Optimization with Natural Language Feedback
  6. Xu 等人(2026)RankTuner: When Design Tool Parameter Tuning Meets Preference Bayesian Optimization
  7. Sankagiri 等人(2026)Recycling History: Efficient Recommendations from Contextual Dueling Bandits
  8. Huber 等人(2025)Bayesian Preference Elicitation for Decision Support in Multi‐Objective Optimization
  9. Vyas 等人(2022)Personalizing over-the-counter hearing aids using pairwise comparisons

34.4 各领域的证据基础 #

表 34.1 比较第七部分各应用领域中来自真人的证据。表中统计的是本部分引用的研究,而非系统检索的结果;“典型样本”指给出判断的真人人数。最后一行汇集截至 2026 年 9 月、我们的检索未找到任何偏好优化研究的领域。

表 34.1 偏好优化的真人证据(按应用领域)。计数对象为本书这一部分引用的研究。
领域 引用的研究 典型样本(范围) 真人还是模拟的人 主要局限
视觉、界面与生成式设计(偏好反馈) 约 24 多为 10 至 40(3 至 60,不含众包) 大多为真人 对照条件大多较弱,被试大多是新手;没有检验会话内的漂移
基于评分或性能的人在回路优化 约 19 12 至 40(8 至 200) 真人 不是偏好反馈;面对强对照时,最终质量往往没有差别
下肢外骨骼(算法调节) 13(其中 10 项有真人参与),另加 2 项自调基线 2 至 15,中位数约 5 真人,大多是身体健全的年轻成人 只有 2 名截瘫被试;内部验证;几乎没有与手动调节的比较
假肢 1 项偏好贝叶斯优化研究(另有 3 项相关) 2 至 3 名截肢者 真人 样本极小;偏好在各次试验之间不一致
助听器与音频 5(另有 3 项相关) 20 至 35 两者都有 言语清晰度没有改善;评估大多有制造商参与
视觉假体 3 17 名视力正常者;1 项研究样本未知 1 项仅为模拟,2 项有视力正常者参与 没有盲人用户;人与模拟智能体之间的一致率约 50%
脊髓刺激 3 1 至 5 名患者 真人 与医生的比较是定性的;假设反应不会改变
建筑中的热舒适与天然采光 8 普渡大学研究的样本未能获得;其余没有真人 2024 年以来全部为模拟 没有用真实居住者进行的试验
驾驶风格与控制器标定 7(另有 1 项非优化研究) 1 项研究有 29 名驾驶员;其余为作者或合成决策者 大多为模拟 没有在真实道路上的研究;偏好随场景而变
腿式机器人与控制器调节 约 14(含方法与工具论文) 1 位专家或几名实验室成员 真人很少 专家自己的代价函数与其选择不一致;节省的工作量未经量化
主动的基于偏好的奖励学习 8 约 10 名用户 两者都有 大多是线性奖励;高斯过程版本在高维时代价高昂
材料与物理科学 7 1 至 4 位专家 一半以上为模拟 专家与非专家结果分化;对模型过度信任
化学与药物发现 4 35 位化学家(MolSkill,不是贝叶斯优化);其余为 1 人或模拟 大多为模拟 化学家之间的一致性只是中等(κ 为 0.32 至 0.40)
蛋白质设计 1 无 没有人的偏好 “偏好”来自测得的适应度
工业平台与 A/B 测试 6 没有公开的部署数据 合成效用或语言模型模拟 没有量化生产部署的公开报告
未找到研究的领域 0 不适用 不适用 农业;借助感官评价小组的食品与风味;晕动症与运动模拟器的运动线索;人工耳蜗;脑深部电刺激;康复中的功能性电刺激;假肢接受腔、座椅与服装的舒适度;2026 年以前的无人机;真实道路上的驾驶风格;2020 年以后的天然采光;基于人类专家偏好的蛋白质设计;生产环境中的 A/B 测试;激光、焊接与机加工(只有标量贝叶斯优化)

图 34.1 把同一张表画在统一的刻度上。

真人真人与模拟主要为模拟没有人的偏好131030100300每项研究的真人人数(对数刻度)视觉与生成式设计评分或性能的人在回路优化外骨骼假肢助听器与音频视觉假体脊髓刺激建筑没有真人车辆与控制器机器人控制器调节偏好奖励学习材料与物理化学与药物蛋白质设计没有真人工业与 A/B 测试没有真人下肢外骨骼13 项研究,另加 2 项自调基线 · 真人 · 见可穿戴机器人与健康一章典型样本:2 至 15,中位数约 5。主要局限:只有 2 名截瘫被试;内部验证;几乎没有与手动调节的比较。未找到研究的领域:农业;借助感官评价小组的食品与风味;晕动症;人工耳蜗;脑深部电刺激;功能性电刺激;接受腔、座椅与服装的舒适度;2026 年以前的无人机;真实道路上的驾驶;2020 年以后的天然采光;基于人的偏好的蛋白质设计;生产环境中的A/B 测试。
真人真人与模拟主要为模拟没有人的偏好131030100300每项研究的真人人数(对数刻度)视觉与生成式设计评分或性能的人在回路优化外骨骼假肢助听器与音频视觉假体脊髓刺激建筑没有真人车辆与控制器机器人控制器调节偏好奖励学习材料与物理化学与药物蛋白质设计没有真人工业与 A/B 测试没有真人下肢外骨骼13 项研究,另加 2 项自调基线 · 真人 · 见可穿戴机器人与健康一章典型样本:2 至 15,中位数约 5。主要局限:只有 2 名截瘫被试;内部验证;几乎没有与手动调节的比较。未找到研究的领域:农业;借助感官评价小组的食品与风味;晕动症;人工耳蜗;脑深部电刺激;功能性电刺激;接受腔、座椅与服装的舒适度;2026 年以前的无人机;真实道路上的驾驶;2020 年以后的天然采光;基于人的偏好的蛋白质设计;生产环境中的 A/B 测试。
图 34.1 各应用领域的真人证据。每一行对应表 34.1 中的一个领域;细线跨越各项研究的真人人数范围,粗线段表示典型范围,圆点标出单个数值、中位数或单项研究(空心表示不是偏好优化,例如 MolSkill)。颜色表示判断的来源。选择一个领域,可以查看其研究数量和主要局限。数值取自该表,表中注明为近似之处亦为近似值;在对数刻度上,35 人的研究看起来与 200 人的研究相距不远,因此请以面板中的数字为准。

跨领域的规律。在交互式设计之外,每项有真人被试的研究中,给出判断的有 1 至 35 人,中位数低于 10;比较次数为 12 至 50 次,只有一个临床案例达到 564 次试验(第 33.5 节)。验证一致率约为 65% 至 100%,且几乎总是内部验证;与手动调节或专家调节的比较大多是定性的。设计最严谨的研究,即 Søgaard Jensen 等人(2019)的双盲比较,以及 Ingraham 等人(2022)和 Arens 等人(2025)的重复区组,恰恰也是报告了局限的研究:收益只是部分的,偏好随接触而漂移,偏好的设置不同于生理上最佳的设置(推断)。应用也推动了方法的发展:考虑最小可觉差的采集函数、序数标签与坠毁标签、多目标偏好模型以及情境偏好贝叶斯优化,都源于应用,而非基准测试(推断)。

这些证据引出三条建议(推断),它们都不取决于代理模型是否为高斯过程。

  1. 对于参数很少(约 4 至 6 个)的个性化问题,每次评估都要靠身体感受,最优点附近也可能很平坦。这时应先以自调或粗网格搜索作为基线,只有当基线不够好时,才引入偏好贝叶斯优化:用拇指杆自调,约 11 分钟即可使代谢消耗降低 16.6%,偏好时机附近还有 ±8% 的容差(第 33.3 节)。
  2. 新研究应当把手动调节、随机搜索或粗网格搜索以及线性效用模型纳入对照,并测量客观结果;只与另一个偏好优化器或滑块比较,无法说明是否真的需要偏好优化(第 32.8 节)。
  3. 方法论文应当至少用几位真人检验其模拟用户:在视网膜植入物研究中,人与模拟智能体的一致只占约 50%;在机器人研究中,专家自己的代价函数在大部分范围内与其选择不一致(第 33.5 节、第 33.6 节)。

第 46 章把这些建议转化为实用指导,第 46.9 节则讨论更简单的方法何时应当胜出。

第 34.4 节引用的文献 3
  1. Søgaard Jensen 等人(2019)Perceptual Effects of Adjusting Hearing-Aid Gain by Means of a Machine-Learning Approach Based on Individual User Preference
  2. Ingraham 等人(2022)The role of user preference in the customized control of robotic exoskeletons
  3. Arens 等人(2025)Preference-based assistance optimization for lifting and lowering with a soft back exosuit

34.5 常见说法核查 #

关于这些应用的二手叙述反复提到若干说法,原始文献并不支持其现有表述。表 34.2 逐一核查。

表 34.2 对照原始文献核查关于偏好优化应用的说法。
说法 判定 文献显示的情况
Tucker 等的外骨骼步态是 qEUBO 论文的基准之一。 错误 qEUBO 的基准是 Ackley、Alpine1、Hartmann、汽车驾驶室设计问题、Sushi 和一个动画任务(Astudillo 等,2023)。模拟的外骨骼个性化出现在 Astudillo 等的偏好多目标论文中(Astudillo 等,2025)。
ROIAL 刻画了整个偏好地形。 部分正确 ROIAL 只在一个排除了不舒适步态的感兴趣区域内学习,探索的动作空间不到 2%(Li 等,2021)。
Abdelrahman 与 Miller(2022)根据偏好反馈优化室内热环境。 错误 该论文用图神经网络决定何时为个人舒适模型收集居住者的热偏好反馈;它不是偏好贝叶斯优化,也不优化环境(Abdelrahman 与 Miller,2022)。
Hiranaka 等(IROS 2023)从人的评价性反馈中学习基元技能。 部分正确 该论文在参数化的基元技能之上应用基于人类反馈的强化学习;它并不学习技能本身,也不是偏好贝叶斯优化(Hiranaka 等,2023)。
BOARS 于 2023 年发表在 npj Computational Materials 上,CoExBO 是一篇 2023 年的论文,BOAP 被用于自动化科学。 部分正确 BOARS 发表于 2024 年(Biswas 等,2024);CoExBO 发表于 AISTATS 2024(Adachi 等,2024);BOAP 中的专家偏好是根据已发表数据模拟的(Arun Kumar A V 等,2024)。
对决标量化 Thompson 采样是第一个可证明收敛的偏好多目标优化方法,并被应用于自动驾驶和外骨骼。 部分正确 2025 年发表于 TMLR(arXiv 2024);两项应用都是模拟的;“第一个”忽略了 Benavoli 等更早的基于选择函数的多目标优化工作(Astudillo 等,2025;Benavoli 等,2021b)。
偏好贝叶斯优化在体验性领域和人们具备专业知识的领域效果好,在偏好需要建构出来的领域效果差。 未经检验的综合判断 部分支持来自 Mikkola 等研究中专家与非专家之间的分化(Mikkola 等,2020),以及 Ou 等现场部署中的不收敛(Ou 等,2022)。第 45 章讨论这个问题。
第 34.5 节引用的文献 11
  1. Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
  2. Astudillo 等人(2025)Preferential Multi-Objective Bayesian Optimization
  3. Li 等人(2021)ROIAL: Region of Interest Active Learning for Characterizing Exoskeleton Gait Preference Landscapes
  4. Abdelrahman 与 Miller(2022)Targeting occupant feedback using digital twins: Adaptive spatial-temporal thermal preference sampling to optimize personal comfort models
  5. Hiranaka 等人(2023)Primitive Skill-based Robot Learning from Human Evaluative Feedback
  6. Biswas 等人(2024)A dynamic Bayesian optimized active recommender system for curiosity-driven partially Human-in-the-loop automated experiments
  7. Adachi 等人(2024)Looping in the Human Collaborative and Explainable Bayesian Optimization
  8. Arun Kumar A V 等人(2024)Enhanced Bayesian Optimization via Preferential Modeling of Abstract Properties
  9. Benavoli 等人(2021b)Choice functions based multi-objective Bayesian optimisation
  10. Mikkola 等人(2020)Projective Preferential Bayesian Optimization
  11. Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures

34.6 已定、有争议与缺失 #

研究现状已定、有争议与缺失

已定。2024 年以来,所有关于建筑的偏好贝叶斯优化研究都使用模拟的居住者。唯一的大规模专家成对判断数据集,即 35 位化学家给出的 5,000 多对判断,显示专家之间的一致性中等(κ 为 0.32 至 0.40),同一位专家内部的一致性稍高(约 0.6)(Choung 等,2023)。BoTorch 和 Ax 已提供用于多输出实验偏好探索的软件。在各个领域,有真人参与的研究规模都很小,在交互式设计之外通常少于 10 人,且采用内部验证。

有争议。专家偏好能否使科学优化超出实测目标本身所能达到的水平:正面案例只涉及 1 至 4 位专家或模拟的专家,而一个工业案例发现专家知识反而有害。如何在人与算法之间分工:“人先、计算机后”在一个标量目标的游戏中使成本减半(Kanarik 等,2023),但目标为偏好时是否同样成立,仍无定论。出错或过度自信的专家能否被识别,或被安全地忽略;CoExBO 的无害保证给出了部分回答。

缺失。以真实居住者检验基于偏好的暖通空调控制的试验。在真实道路上进行的驾驶风格研究。关于生产环境 A/B 测试中偏好优化的公开、量化报告。农业、借助感官评价小组的食品与风味,或基于人的偏好的蛋白质设计方面的任何研究。控制器标定中偏好优化与实测专家调参时间和质量的比较。方法论文中用真人检验模拟决策者的测试。

第 34.6 节引用的文献 2
  1. Choung 等人(2023)Extracting medicinal chemistry intuition via preference machine learning
  2. Kanarik 等人(2023)Human–machine collaboration for improving semiconductor process development

34.7 习题 #

习题 34.1

在 MolSkill 的两轮初步实验中,化学家在重复对上的评分者内 Cohen κ 平均都约为 0.6。对于二元选择,若两个选项各有一半时间被选中,机遇一致率为 0.5,κ 为 (po−0.5)/(1−0.5)(p_o - 0.5) / (1 - 0.5),其中 pop_o 是观测到的一致率。按这一机遇水平,κ 为 0.6 的化学家会对多大比例的重复对给出相同的回答?如果用第 16 章的概率单位似然为这位化学家建模,并假设每个重复对的效用差都相同,均为 Δ\Delta(以噪声为单位),那么多大的 Δ\Delta 会产生这样的重复一致率?

解答

由 0.6=(po−0.5)/0.50.6 = (p_o - 0.5)/0.5 得 po=0.8p_o = 0.8:这样的化学家对 80% 的重复对给出相同的回答。在概率单位模型下,每个回答以概率 q=Φ(Δ)q = \Phi(\Delta) 偏向较好的分子,两个独立回答一致的概率为 q2+(1−q)2q^2 + (1 - q)^2。令 q2+(1−q)2=0.8q^2 + (1-q)^2 = 0.8,得 2q2−2q+0.2=02q^2 - 2q + 0.2 = 0,所以 q=(1+0.6)/2≈0.887q = (1 + \sqrt{0.6})/2 \approx 0.887,Δ=Φ−1(0.887)≈1.21\Delta = \Phi^{-1}(0.887) \approx 1.21。按模型的单位,一个典型的重复对相距约 1.2 个噪声标准差,远非确定性的评判者。(论文的表格列出的原始重复一致率为 78.9% 至 100%,例如 κ 为 0.58 时对应的一致率为 89.5%,机遇水平取 0.5 时无法重现这一对应;取 po=0.895p_o = 0.895,同样的步骤给出 Δ≈1.59\Delta \approx 1.59,仍是有噪声的评判者。)真实的成对之间 Δ\Delta 各不相同,所以这只是平均意义上的图景,但它说明了为什么无噪声的模拟专家会高估真实专家所能提供的信息。

习题 34.2

POP-BO 与 qEUBO 在一个模拟的热舒适任务上做了比较:qEUBO 找到的最终设置略好,但其累积遗憾几乎是 POP-BO 的两倍。请用一段话解释,为什么建筑运营者仍可能偏好 POP-BO,并描述一个 qEUBO 更为合适的部署场景。

解答

在线暖通空调控制中,每次查询都是真实居住者身处其中的一种室内状况,因此每次不佳的查询都意味着切实经历的不适。累积遗憾把整个运行过程中的这些不适加总起来,而最终设置只在学习结束后才起作用。如果运营者在人们于楼内工作期间调节舒适度,就应当重视累积代价,这有利于 POP-BO。当探索代价低廉或可以离线进行时,qEUBO 是更好的选择,例如在空置的测试房间中调试,或由自愿参加短时校准的居住者参与,此后找到的设置将运行数月。这一区别正是第 13 章中简单遗憾与累积遗憾的区别。

延伸阅读 #

  • Choung 等人(2023)是本章规模最大的专家成对判断数据集,也最清楚地测量了专家之间的一致程度。
  • Mikkola 等人(2020)在一个真实的物理问题上表明回路中的人有多重要:专家与非专家到达了不同的极小值。
  • Lin 等人(2022)阐述了多输出实验中的偏好探索,即工业工具背后的方法。
  • Xu 等人(2024b)包含热舒适模拟,以及在线控制应当关注累积遗憾的论证。
  • Kanarik 等人(2023)是关于人与算法分工的最好证据,不过其目标是实测的。

参考文献

  1. Abdelrahman, M., and Miller, C. (2022). Targeting occupant feedback using digital twins: Adaptive spatial-temporal thermal preference sampling to optimize personal comfort models. Building and Environment 218. 引用于 §34.5
  2. Adachi, M., Planden, B., Howey, D. A., Osborne, M. A., Orbell, S., Ares, N., Muandet, K., and Chau, S. L. (2024). Looping in the Human Collaborative and Explainable Bayesian Optimization. AISTATS 2024. 引用于 §34.2 §34.5
  3. Adachi, M., Chau, S. L., Xu, W., Singh, A., Osborne, M. A., and Muandet, K. (2025). Bayesian Optimization for Building Social-Influence-Free Consensus. arXiv. 预印本引用于 §34.1
  4. Arens, P., Quirk, D. A., Pan, W., Yacoby, Y., Doshi-Velez, F., and Walsh, C. J. (2025). Preference-based assistance optimization for lifting and lowering with a soft back exosuit. Science Advances. doi:10.1126/sciadv.adu2099. 引用于 §34.4
  5. Arun Kumar A V, Shilton, A., Gupta, S., Rana, S., Greenhill, S., and Venkatesh, S. (2024). Enhanced Bayesian Optimization via Preferential Modeling of Abstract Properties. ECML PKDD 2024. 引用于 §34.2 §34.5
  6. Astudillo, R., Lin, Z. J., Bakshy, E., and Frazier, P. (2023). qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization. International Conference on Artificial Intelligence and Statistics. 引用于 §34.3 §34.5
  7. Astudillo, R., Li, K., Tucker, M., Cheng, C. X., Ames, A. D., and Yue, Y. (2025). Preferential Multi-Objective Bayesian Optimization. Transactions on Machine Learning Research. 引用于 §34.5
  8. Awalgaonkar, N., Bilionis, I., Liu, X., Karava, P., and Tzempelikos, A. (2019). Learning Personalized Thermal Preferences via Bayesian Active Learning with Unimodality Constraints. arXiv. 预印本引用于 §34.1
  9. Basu, C., Yang, Q., Hungerman, D., Singhal, M., and Dragan, A. D. (2017). Do You Want Your Autonomous Car To Drive Like You? HRI 2017. 引用于 §34.1
  10. Benavoli, A., Azzimonti, D., and Piga, D. (2021b). Choice functions based multi-objective Bayesian optimisation. arXiv. 预印本引用于 §34.5
  11. Biswas, A., Liu, Y., Creange, N., Liu, Y.-C., Jesse, S., Yang, J.-C., … Vasudevan, R. K. (2024). A dynamic Bayesian optimized active recommender system for curiosity-driven partially Human-in-the-loop automated experiments. npj Computational Materials. 引用于 §34.2 §34.5
  12. Biswas, A., Funakubo, H., and Liu, Y. (2026). Human-AI Collaborative Autonomous Experimentation With Proxy Modeling for Comparative Observation. arXiv. 预印本引用于 §34.2
  13. Cercola, M., Lomuscio, M., Piga, D., and Formentin, S. (2026b). Regularized GLISp for sensor-guided human-in-the-loop optimization. IFAC Journal of Systems and Control. doi:10.1016/j.ifacsc.2026.100368. 引用于 §34.1
  14. Choung, O.-H., Vianello, R., Segler, M., Stiefl, N., and Jiménez-Luna, J. (2023). Extracting medicinal chemistry intuition via preference machine learning. Nature Communications. doi:10.1038/s41467-023-42242-1. 引用于 §34.2 §34.6
  15. Dang, T., Pham, L.-H., Truong, S. T., Glenn, A., Nguyen, W., Pham, E. A., … Luong, T. (2025). Preferential Multi-Objective Bayesian Optimization for Drug Discovery. ICLR 2025 Workshop. 研讨会论文引用于 §34.2
  16. de Vries, W., van Kampen, J., and Salazar, M. (2024). A Human-optimized Model Predictive Control Scheme and Extremum Seeking Parameter Estimator for Slip Control of Electric Race Cars. arXiv. 预印本引用于 §34.1
  17. Deneault, J. R., Kim, W., Kim, J., Gu, Y., Chang, J., Maruyama, B., Myung, J. I., and Pitt, M. A. (2025). Preferential Bayesian optimization improves the efficiency of printing objects with subjective qualities. Digital Discovery. 引用于 §34.2
  18. Haltia, A., Hyvönen, V., and Kaski, S. (2026). Elicitation-Augmented Bayesian Optimization. arXiv. 预印本引用于 §34.2
  19. Hawkins-Hooker, A., Duckworth, P., and Bent, O. (2023). Preferential Bayesian Optimisation for Protein Design with Ranking-Based Fitness Predictors. NeurIPS 2023 MLSB Workshop. 研讨会论文引用于 §34.2
  20. Hiranaka, A., Hwang, M., Lee, S., Wang, C., Fei-Fei, L., Wu, J., and Zhang, R. (2023). Primitive Skill-based Robot Learning from Human Evaluative Feedback. IROS 2023. 引用于 §34.5
  21. Huber, F., Rojas Gonzalez, S., and Astudillo, R. (2025). Bayesian Preference Elicitation for Decision Support in Multi‐Objective Optimization. Journal of Multi-Criteria Decision Analysis. 引用于 §34.3
  22. Ingraham, K. A., Remy, C. D., and Rouse, E. J. (2022). The role of user preference in the customized control of robotic exoskeletons. Science Robotics. 引用于 §34.4
  23. Kanarik, K. J., Osowiecki, W. T., Lu, Y., Talukder, D., Roschewsky, N., Park, S. N., … Gottscho, R. A. (2023). Human–machine collaboration for improving semiconductor process development. Nature. 引用于 §34.2 §34.6
  24. Kobalczyk, K., Lin, Z. J., Letham, B., Zhao, Z., Balandat, M., and Bakshy, E. (2026). LILO: Bayesian Optimization with Natural Language Feedback. ICML 2026. 引用于 §34.3
  25. Kristiadi, A., Strieth-Kalthoff, F., Subramanian, S. G., Fortuin, V., Poupart, P., and Pleiss, G. (2024b). How Useful is Intermittent, Asynchronous Expert Feedback for Bayesian Optimization? AABI 2024. 研讨会论文引用于 §34.2
  26. Li, K., Tucker, M., Bıyık, E., Novoseller, E., Burdick, J. W., Sui, Y., … Ames, A. D. (2021). ROIAL: Region of Interest Active Learning for Characterizing Exoskeleton Gait Preference Landscapes. ICRA 2021. 引用于 §34.5
  27. Lin, Z. J., Astudillo, R., Frazier, P., and Bakshy, E. (2022). Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes. International Conference on Artificial Intelligence and Statistics. 引用于 §34.3
  28. Liu, Y., and Kalinin, S. V. (2025). Pareto-Optimal Experimentation: Human-Guided Multi-Objective Bayesian Optimization in Scanning Probe Microscopy. Nano Letters. 引用于 §34.2
  29. Meta Platforms, Inc. (2026d). Bayesian optimization with preference exploration (BOPE tutorial, documentation v0.18.1). botorch.org. 软件引用于 §34.3
  30. Meta Platforms, Inc. (2026l). CHANGELOG (versions 1.2 to 1.3). GitHub. 软件引用于 §34.3
  31. Mikkola, P., Todorović, M., Järvi, J., Rinke, P., and Kaski, S. (2020). Projective Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §34.2 §34.5
  32. Ou, C., Buschek, D., Mayer, S., and Butz, A. (2022). The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures. Mensch und Computer 2022. 引用于 §34.5
  33. Ran, W., Chen, H., Xia, T., Nishimura, Y., Guo, C., and Yin, Y. (2023). Online Personalized Preference Learning Method Based on In-Formative Query for Lane Centering Control Trajectory. Sensors. doi:10.3390/s23115246. 引用于 §34.1
  34. Sankagiri, S., Etesami, J., Fatemi, P., and Grossglauser, M. (2026). Recycling History: Efficient Recommendations from Contextual Dueling Bandits. Algorithmic Learning Theory. 引用于 §34.3
  35. Søgaard Jensen, N., Hau, O., Bagger Nielsen, J. B., Bundgaard Nielsen, T., and Vase Legarth, S. (2019). Perceptual Effects of Adjusting Hearing-Aid Gain by Means of a Machine-Learning Approach Based on Individual User Preference. Trends in Hearing. doi:10.1177/2331216519847413. 引用于 §34.4
  36. Sundin, I., Voronov, A., Xiao, H., Papadopoulos, K., Bjerrum, E. J., Heinonen, M., … Engkvist, O. (2022). Human-in-the-loop assisted de novo molecular design. Journal of Cheminformatics. doi:10.1186/s13321-022-00667-8. 引用于 §34.2
  37. Theiner, L., Hirt, S., Steinke, A., and Findeisen, R. (2025). Exploiting Prior Knowledge in Preferential Learning of Individualized Autonomous Vehicle Driving Styles. ECC 2025. 引用于 §34.1
  38. Theiner, L., Pfefferkorn, M., Zhao, Y., Hirt, S., and Findeisen, R. (2026). Efficient Controller Learning from Human Preferences and Numerical Data Via Multi-Modal Surrogate Models. European Control Conference. 引用于 §34.1
  39. Vyas, D., Brummet, R., Anwar, Y., Jensen, J., Jorgensen, E., Wu, Y.-H., and Chipara, O. (2022). Personalizing over-the-counter hearing aids using pairwise comparisons. Smart Health. doi:10.1016/j.smhl.2021.100231. 引用于 §34.3
  40. Wang, W., Xu, W., and Jones, C. N. (2025c). Human-in-the-loop: Real-time Preference Optimization. arXiv. 预印本引用于 §34.1
  41. Wang, W., Shi, J., and Jones, C. N. (2025d). Personalized Building Climate Control with Contextual Preferential Bayesian Optimization. arXiv. 预印本引用于 §34.1
  42. Weichert, D., Ernis, G., Worthmann, M., Ryzko, P., and Seifert, L. (2025). When Less is More: A Story of Failing Bayesian Optimization Due to Additional Expert Knowledge. arXiv. 预印本引用于 §34.2
  43. Xiong, J., Lee, S., Karava, P., and Tzempelikos, A. (2017). Personalized visual satisfaction profiles from comparative preferences using Bayesian inference. Energy Procedia. 引用于 §34.1
  44. Xiong, J., Tzempelikos, A., Bilionis, I., Awalgaonkar, N. M., Lee, S., Konstantzos, I., Sadeghi, S. A., and Karava, P. (2018). Inferring personalized visual satisfaction profiles in daylit offices from comparative preferences using a Bayesian approach. Building and Environment. 引用于 §34.1
  45. Xiong, J., Awalgaonkar, N. M., Tzempelikos, A., Bilionis, I., and Karava, P. (2020). Efficient learning of personalized visual preferences in daylit offices: An online elicitation framework. Building and Environment. 引用于 §34.1
  46. Xu, W., Wang, W., Jiang, Y., Svetozarevic, B., and Jones, C. (2024b). Principled Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §34.1
  47. Xu, P., Zheng, S., Ye, Y., Bai, C., Xu, S., Geng, H., Ho, T.-Y., and Yu, B. (2026). RankTuner: When Design Tool Parameter Tuning Meets Preference Bayesian Optimization. IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems. 引用于 §34.3
  48. Zhu, M., Bemporad, A., and Piga, D. (2021). Preference-based MPC calibration. ECC 2021. 引用于 §34.1
  49. Zhu, M., Piga, D., and Bemporad, A. (2022). C-GLISp: Preference-Based Global Optimization Under Unknown Constraints With Applications to Controller Calibration. IEEE Transactions on Control Systems Technology. 引用于 §34.1