贝叶斯优化
第七部分:人在回路
EN

可穿戴机器人、健康与辅助技术

在第 32 章的设计研究中,人评判的是屏幕上的图片。本章中被评判的对象则要通过身体来感受:外骨骼的推力、假肢膝关节的摆动、助听器的声音、视网膜植入物的光点图案、行走机器人的步态。每次评估需要几秒至几分钟,会话时长受疲劳与安全的限制,而最能从中受益的人也最难招募。第 1 章正是以这类情形引出本书的主题:目标函数代价高昂、带有噪声,且只能由当事人报告。

本章涵盖 2017 年至 2026 年 9 月间的可穿戴机器人、助听器、神经假体与机器人控制研究。针对同一问题的其他方法(径向基函数代理模型、线性奖励模型、神经排序器)也与高斯过程模型一并纳入,因为几项被引用最多的研究正是采用这些方法。贯穿本章的主线是测量。研究规模都很小,验证几乎总是内部的,即同一个人后来的选择与模型一致。在测量了客观结果或手动基线的研究中,结论好坏参半:人自行调节髋外骨骼所得的收益,与算法调节处于同一量级;助听器的偏好调节改善了音质,却没有改善言语清晰度。

33.1 外骨骼 #

外骨骼(exoskeleton)是在关节(髋、膝或踝)处施加力矩以辅助行走的可穿戴机器人;柔性的外骨骼服(exosuit)借助织物绑带和缆索起同样的作用。外骨骼的控制器是一条随步态周期(gait cycle)变化的力矩曲线。步态周期即一个跨步,从一次脚跟着地到同一只脚下一次脚跟着地。曲线的形状由几个数值决定:峰值力矩、峰值出现的时机,以及助力开始和结束的时刻。合适的取值因人而异。

33.1.1 引入偏好之前:优化实测的体力消耗 #

这一领域最初优化的是代谢消耗(metabolic cost),即身体消耗的能量,用间接测热法(indirect calorimetry)估计:穿戴者通过面罩呼吸,同时测量氧气和二氧化碳;每个设置都要行走几分钟,读数才能稳定。这种做法称为人在回路优化(human-in-the-loop optimization)。Zhang 等人(2017)以 11 名穿戴踝外骨骼的被试为对象,用进化策略(CMA-ES,第 15.8.1 节)优化力矩模式,代谢能耗比无力矩时降低 24.2 ± 7.4%。Ding 等人(2018)用贝叶斯优化为 8 名被试调节柔性外骨骼服髋部助力的两个时机参数:平均在 21.4 ± 1.0 分钟内找到最优点(这一收敛时间是根据一次 40 分钟的优化事后计算的),与不穿装置行走相比,代谢消耗降低 17.4 ± 3.2%(均值 ± 标准误)。Slade 等人(2022)以一个根据可穿戴传感器估计代谢效应的模型取代面罩:只需行走 32 分钟而非 128 分钟,就得到与代谢优化相同的参数,误差在 5% 以内(9 名被试);在户外行走一小时后,优化所得的助力使跑步机上以 1.5 m/s 行走的代谢消耗比穿普通鞋时降低 23 ± 8%(10 名被试)。

代谢测量缓慢且带噪声,也无法反映舒适度和安全感(Schäfer 等,2026);一篇 2024 年的观点文章(Slade 等,2024)和一篇 2023 年的综述(Ingraham 等,2023)讨论了把主观目标与用户偏好纳入设计空间的问题。另一个复杂因素是适应:在 Poggensee 与 Collins(2021)中,经过训练后的定制助力使代谢率比外骨骼关闭时降低 39%,但其中约一半收益来自训练,约四分之一来自定制;成为熟练用户需要约 109 分钟的辅助行走。对任何优化器而言,响应仍在变化的人都是一个移动的目标(第 39.7 节)。

33.1.2 加州理工学院的研究线索:比较、建议与序数标签 #

加州理工学院的一个研究组(主要论文的第一作者为 Maegan Tucker)以 Atalante 为平台,开创了基于偏好的步态调节中最主要的一条高斯过程研究线索。Atalante 是一种能自平衡的下肢外骨骼,可代替使用者行走。CoSpar 把成对偏好与共同主动反馈(coactive feedback)结合起来,后者指用户主动提出的改进(“步子稍微迈长一点”);它用 Thompson 采样(Thompson sampling)选择下一个步态,即从后验中抽取可能的效用函数,让它们相互竞争(第 12.5 节)(Tucker 等,2020b)。在 3 名身体健全的被试、20 次步态试验中,每名被试对三种步态的盲排序都与后验一致。由于“用户很难一次记住两次以上的试验”,每次试验只与前一次比较。

参数达到 5 个或更多时,CoSpar 便不可行,因此 LineCoSpar 把每次迭代限制在一条随机直线上,直线经过后验均值最高的步态,这正是第 20.2 节的思路(Tucker 等,2020a)。6 名身体健全的新手用 30 次试验优化了 6 个步态参数,每人有 4 个验证偏好,与模型的一致率依次为 75%、100%、100%、25%、100% 与 100%;效用函数因人而异。ROIAL 加入了序数标签(ordinal labels),即为每种步态给出从“很差”到“好”的评分,并且只在排除了不舒适步态的感兴趣区域内学习地形(Li 等,2021)。在 3 名被试、4 个参数、40 次试验的条件下,大多数序数预测与报告的标签相差不超过一级,而搜索探索的动作空间不到 2%:这对穿戴者是舒适的,但学到的地形只覆盖了一个小角落。

唯一一项有完全性截瘫被试的研究。Maegan Tucker 的博士学位论文报告了一项基于偏好的外骨骼研究,被试为完全性运动截瘫患者,这是我们找到的唯一一项此类研究(Tucker,2023)。2 名被试均被归为 ASIA A 级(损伤平面以下无运动和感觉功能),一位使用 Atalante 的经验超过 300 小时,另一位不到 30 小时。研究调节了 3 个获准在欧盟使用的步态参数:第一天用 ROIAL 进行 15 次迭代,第二天用 LineCoSpar 分别进行 15 次和 25 次迭代,每 20 分钟休息 5 分钟以防压疮。每人只能完成一次评估试验,两人都把后验中最好的步态评为“好”。该学位论文还报告了 8 名身体健全的被试。

多个目标。针对每个目标都只能通过偏好观测的多目标优化,Astudillo 等人(2025)提出了一种渐近一致的方法,即对决标量化 Thompson 采样;该方法只在模拟的外骨骼与驾驶任务上做了评估(arXiv 2024,TMLR 2025)。在一篇 2026 年 9 月的预印本中,MO-HILBO 在一台髋膝外骨骼的 3 个控制器参数上同时优化代谢消耗和序数舒适度反馈,3 名被试每人用时 3 至 4 小时;对 Pareto 前沿上各控制器之间的成对排序,代理模型预测正确的占 94%(18 个中的 17 个)(Janwani 等,2026)。

33.1.3 其他研究组 #

神经排序器。Lee 等人(2023)用一个在早先偏好数据上预训练的神经网络排序器,为进化算法提出的踝关节助力设置(4 个参数)打分,穿戴者则在成对设置之间做强制选择。以随机生成的参数为比较对象,该方法收敛到穿戴者偏好参数的平均准确率为 88%,偏好的设置在 43 ± 7 次查询后趋于稳定。这不是高斯过程方法。我们只读到了摘要:摘要没有给出进化算法的名称(一篇后来的预印本称之为 CMA-ES(Liu 等,2026d)),一份第三方概述给出的被试人数 14 也无法与论文核对。

径向基函数代理模型。全向助行机器人 WANDER 用 GLISp 调节 2 个导纳参数(admittance parameters),即推动机器人时感受到的轻重和阻尼大小。GLISp 是 Bemporad 与 Piga 提出的主动偏好学习算法,拟合的是径向基函数代理模型而非高斯过程(Fortuna 等,2024;Bemporad 与 Piga,2021)。实验有 12 名健康成人参加,至多 15 次迭代。与文献中的两种设置相比,线性能量分别降低 17.61% 和 13.93%(均显著);角能量相对第一种设置降低 13.26%(显著),相对第二种升高 3.57%(不显著);加加速度分别降低 1.12%(不显著)和 5.95%(显著)。偏好的虚拟质量与体重相关(r=0.59r = 0.59,p=0.042p = 0.042)。

线性奖励。Ramella 等人(2025)把对髋关节力矩曲线的偏好建模为 6 个特征上的线性奖励,后验用 Metropolis-Hastings 算法采样(第 17.5 节)。8 名健康被试做了 12 次成对比较,每条曲线行走 20 秒。面对扰动后的版本(±2 N·m、步态周期的 ±7%),大多数人保持了原先的偏好,但扰动上升时间时,其中 4 人未通过这一检验。偏好的力矩与穿戴者的动作同步,装置负功率也更低,即装置从穿戴者身上吸收的能量更少。

采集函数中的感知阈值。Arens 等人(2025)为柔性背部外骨骼服优化抬举与放下助力,有 15 名健康被试参加,在 2 个参数上进行 3 个区组、每组 15 次迭代(每组含 3 次隐藏的验证检查)。上置信界(第 12.4 节)考虑了最小可觉差(just noticeable difference,JND),即人能可靠察觉的最小变化(第 16.2 节);最小可觉差单独测得,抬举为 13.1 N,放下为 9.8 N。组内相关系数(intraclass correlation coefficient,ICC)衡量一个人落在同一设置上的一致程度(1 为完全一致),放下为 0.80,抬举为 0.91。从第 1 区组到第 3 区组,偏好的助力分别上升 15% 和 29%,但这一趋势不显著(p=0.181p = 0.181)。

成对偏好与后续代谢测量。在一篇 2026 年的预印本中,Liu 等人(2026d)以 5 名熟悉该装置的健康成人为被试,通过成对比较优化髋部助力的 6 个参数。20 次迭代之后,在 90.7 ± 1.3% 的验证比较中,被试选择了优化后的力矩曲线而非随机曲线;对其中 2 至 3 人的后续测量显示,三种速度下的代谢率比助力关闭时降低 14.5% 至 15.4%,肌肉激活比不穿外骨骼行走时降低 6.7% 至 31.5%(第 33.3 节讨论这些基线)。

情境、逆向模型与感知。一篇 2026 年的预印本回顾性分析了 9 名健康成人的数据,发现相邻工况下的偏好地形往往更相似;模拟表明,这种连续性成立时,跨情境共享数据有帮助,连续性较弱时则造成负迁移(Baek 等,2026)。Park 与 Collins(2026)在学习人的正向模型的同时推断个人奖励,但只在模拟中进行。Maberry 与 Martin(2026)发现,行走中的人要到踝外骨骼刚度变化约 42% 时才能察觉,踝关节角度控制速率则要变化约 49%,均为站立不动时测得数值的三倍以上。一篇有 16 名被试的预印本研究动态贝叶斯优化,处理的是非平稳目标函数,但该目标是实测的髋关节角度,而非偏好(Kim 与 Sergi,2025)。

33.1.4 可穿戴研究一览 #

表 33.1 列出可穿戴装置的研究。表中的“验证”大多是内部的,即把同一个人后来的选择与模型的预测相比较。

表 33.1 2020 至 2026 年外骨骼与假肢研究:基于偏好的调节与自调。出处见正文。
研究 发表场所 被试 参数 比较或试验 验证 客观结果 是否与手动或专家设置比较
CoSpar ICRA 2020 3 名身体健全者 1(也有 2) 20 次步态试验 对 3 种步态的盲排序与后验一致 未测量 否
LineCoSpar IROS 2020 6 名身体健全者 6 30 次,另加 6 次验证 每人 25% 至 100% 偏好与步态的动态性相关 否
ROIAL ICRA 2021 3 名身体健全者 4 40(30 次训练,10 次验证) 大多数序数预测相差不超过一级 未测量 否
Tucker 学位论文 加州理工学院 2023 2 名完全性截瘫患者,另有 8 名身体健全者 3 15;次日 15 与 25 每人一次评估,两人均评为“好” 未测量 否
Lee 等(神经排序器) Science Robotics 2023 未与原文核对 4 43 ± 7 次查询后稳定 相对随机参数 88% 未涉及 否
WANDER(GLISp) ICRA 2024 12 名健康成人 2 至多 15 次迭代 未报告 线性能量降低 13.93% 至 17.61%;其他指标部分显著 文献中的设置;部分更好
Ramella 等(线性奖励) ICRA 2025 8 名健康者 6 个特征 12 次成对比较 面对扰动版本,大多数人保持原偏好 装置负功率更低 否
Arens 等 Science Advances 2025 15 名健康者 2 3 个区组,每组 15 次 ICC 0.80 与 0.91 偏好的助力上升 15% 与 29%(不显著) 否
Liu 等 预印本 2026 5 名健康成人 6 20 90.7% 代谢率比助力关闭时低 14.5% 至 15.4%(2 至 3 名被试) 否
Taddei 等 预印本 2026 2 名截肢者,2 名身体健全者 4 离散版 10.3 ± 2.5(3 名被试);连续版 35.0 ± 6.2(1 名被试) 93% 与 67% 一名截肢者的步态不对称性改善 否
MO-HILBO 预印本 2026 3 3 每人 3 至 4 小时 预测对 94% 的 Pareto 排序 代谢消耗是目标之一 否
Ingraham 等(自调) Science Robotics 2022 24 名身体健全者 2 每次调节约 105 秒 重复性标准差 1.7 N·m 与步态周期的 1.5% 无经验用户逐渐偏向更大的力矩 本身即自调
Schäfer 等(自调) npj Biomedical Innovations 2026 11 名健康成人 4 10.9 分钟内 30.5 个设置 未报告 代谢消耗比零力矩时低 16.6% 本身即自调
Díaz 等(自主探索) JNER 2026 3 名经股骨截肢者 2 每次试验 8 至 14 个设置 3 人中有 2 人在不同试验间不一致 健侧肌肉活动更少 本身即自主探索
第 33.1 节引用的文献 23
  1. Zhang 等人(2017)Human-in-the-loop optimization of exoskeleton assistance during walking
  2. Ding 等人(2018)Human-in-the-Loop Optimization of Hip Assistance with a Soft Exosuit during Walking
  3. Slade 等人(2022)Personalizing exoskeleton assistance while walking in the real world
  4. Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
  5. Slade 等人(2024)On human-in-the-loop optimization of human–robot interaction
  6. Ingraham 等人(2023)Leveraging user preference in the design and evaluation of lower-limb exoskeletons and prostheses
  7. Poggensee 与 Collins(2021)How adaptation, training, and customization contribute to benefits from exoskeleton assistance
  8. Tucker 等人(2020b)Preference-Based Learning for Exoskeleton Gait Optimization
  9. Tucker 等人(2020a)Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits
  10. Li 等人(2021)ROIAL: Region of Interest Active Learning for Characterizing Exoskeleton Gait Preference Landscapes
  11. Tucker(2023)Enabling Robust and User-Customized Bipedal Locomotion on Lower-Body Assistive Devices via Hybrid System Theory and Preference-Based Learning
  12. Astudillo 等人(2025)Preferential Multi-Objective Bayesian Optimization
  13. Janwani 等人(2026)Multi-Objective Human-in-the-Loop Bayesian Optimization of a Lower-Limb Exoskeleton
  14. Lee 等人(2023)User preference optimization for control of ankle exoskeletons using sample efficient active learning
  15. Liu 等人(2026d)Personalized Lower-limb Exoskeleton Assistance via Preference-based Bayesian Optimization
  16. Fortuna 等人(2024)A Personalizable Controller for the Walking Assistive omNi-Directional Exo-Robot (WANDER)
  17. Bemporad 与 Piga(2021)Global optimization based on active preference learning with radial basis functions
  18. Ramella 等人(2025)Rapid Online Learning of Hip Exoskeleton Assistance Preferences
  19. Arens 等人(2025)Preference-based assistance optimization for lifting and lowering with a soft back exosuit
  20. Baek 等人(2026)Context-Continuous Preference Learning for Exoskeleton Personalization
  21. Park 与 Collins(2026)Simultaneous Forward and Inverse Human-in-the-Loop Optimization
  22. Maberry 与 Martin(2026)Just Noticeable Difference of Impedance Parameters While Walking in an Ankle Exoskeleton
  23. Kim 与 Sergi(2025)Validation of Dynamic Bayesian Optimization for a Non-Stationary Human-in-the-Loop Optimization Problem

33.2 假肢 #

动力假肢又多一层约束:穿戴者每一步都依赖这一装置,设置不当便有风险,能参与研究的人也很少。2026 年的预印本 Taddei 等人(2026)调节了一种主动假肢的 4 个参数,被试为 2 名经股骨(transfemoral)截肢者(膝上截肢)和 2 名借助适配器行走的身体健全者。离散版本把最优选项期望效用(EUBO,第 19.4 节)与 LineCoSpar 结合,在一名截肢者和两名身体健全者身上运行,在 10.3 ± 2.5 次迭代(8.5 ± 3.6 分钟)内收敛,验证识别率为 93%;与这名截肢者自己的假肢相比,摆动相不对称性从 -13.4% 改善到 -7.6%,支撑相不对称性从 6.2% 改善到 3.9%。连续版本只在另一名截肢者身上运行,需要 35.0 ± 6.2 次迭代,验证率只有 67%。其中一次试验在第 15 次迭代之后变异性不断增大,作者将其归因于疲劳,并写道:“这些偏好由哪些生物力学变量驱动,仍不清楚”。

Díaz 等人(2026)让 3 名经股骨截肢者在触摸屏网格上(每次试验 8 至 14 个设置)自行探索一种动力膝踝假肢的时机与幅度,探索时不知道具体数值。偏好的设置伴随着健侧较低的肌肉活动和变异较小的肌肉协同,但 3 人中有 2 人在同一天不同试验中偏好的设置并不一致。两项相近的研究不属于偏好贝叶斯优化:在 Alili 等人(2023)中,截肢者选择一条偏好的膝关节运动学曲线,再由强化学习调节器使 12 个控制参数拟合这条曲线;对步态的初步观察未发现偏好的控制与按规范步态调节的控制之间有明显差别。Sun 等人(2024)只在一个步态数据集上验证了个体化的假肢控制,没有在截肢者身上做在线测试。

第 33.2 节引用的文献 4
  1. Taddei 等人(2026)Bayesian Preference Elicitation: Human-In-The-Loop Optimization of An Active Prosthesis
  2. Díaz 等人(2026)User preference in the personalized control of an ankle prosthesis: a case study
  3. Alili 等人(2023)A Novel Framework to Facilitate User Preferred Tuning for a Robotic Knee Prosthesis
  4. Sun 等人(2024)An Individual Prosthesis Control Method with Human Subjective Choices

33.3 与手动调节的比较 #

本章的每一种方法都旨在比手动调节省力,因此最重要的对照就是手动调节。而这恰恰是该领域开展得最少的比较。

人自行调节有多可靠?在 Ingraham 等人(2022)中,12 名无经验和 12 名具备相关知识的身体健全被试自行调节踝外骨骼力矩的大小与时机,调节时不知道具体数值。偏好的设置范围为 7.9 至 19.4 N·m,以及步态周期的 54.1% 至 59.2%;重复性,即同一人多次重复调节所选设置的标准差,为 1.7 N·m 和步态周期的 1.5%;每次调节约用 105 秒;在实验过程中,无经验用户的偏好逐渐偏向更大的力矩;具备相关知识的用户比无经验用户偏好更大的力矩。接触与知识改变的是偏好设置本身,而不只是其周围的噪声。

信息量最大的直接比较。在 Schäfer 等人(2026)中,11 名健康成人在跑步机上行走,同时用拇指杆遥控器自行调节双侧髋外骨骼的 4 个时机参数。他们平均用时 10.9 ± 0.9 分钟(最长 16.2 分钟),尝试设置数的中位数为 30.5 个(范围 16 至 111),几乎总是一次只改变一个参数(占全部调整的 97.5%)。使用偏好的助力行走,代谢能耗比外骨骼处于零力矩时低 16.6 ± 1.1%。把时机移动至多跨步时间的 ±8%,降幅没有显著变化;不同人偏好的时机相差可达跨步的 22.5%。能动感得分(0 至 1)从零力矩时的 0.80 ± 0.07 降至自调助力下的 0.49 ± 0.07(p=0.002p = 0.002):即使是穿戴者自己选择的助力,也削弱了他们对自身动作的掌控感。作者指出,自调所用时间是 Ding 等人(2018)调节 2 个参数所需时间的四分之一,是 Ding 等人事后提取的收敛时间的一半。

对照阅读两项 2026 年的结果。Liu 等人(2026d)用成对贝叶斯优化调节 6 个参数,每次会话(含验证)用时 20.6 ± 4.6 分钟,降幅为 14.5% 至 15.4%。其摘要把基线称为“无助力行走”,但结果部分表明,基线是穿着外骨骼但关闭助力,与 Schäfer 等人的零力矩属于同一类基线;相对于不穿外骨骼行走,三种速度下的降幅为 8.6%、9.3% 和 13.0%。两项研究的装置、参数和速度都不同,不能直接比较;它们表明的是,对于参数很少的问题,手动调节已能达到算法调节所报告的收益量级。图 33.1 把这些结果连同第 33.1.1 节中的代谢优化画在同一张图上。

穿戴者手动调节穿戴者的选择(高斯过程模型)测得的代谢消耗可穿戴传感器模型0102030代谢降幅(%)仅有时间5102050100200调节所用的行走时间(分钟,对数刻度)Schäfer 2026Liu 2026Ding 2018Slade 2022Slade 2022,实验室:传感器(圆点)对呼吸测量(方块)MO-HILBO,每人Schäfer 等 2026髋外骨骼,4 个时机参数,11 名健康成人用拇指杆遥控器自调,用时 10.9 ± 0.9 分钟(最长 16.2 分钟),尝试设置数的中位数为 30.5 个(16 至 111)。代谢消耗比穿着外骨骼以零力矩行走时低 16.6 ± 1.1%;±8% 的时机变化没有造成显著差异。
穿戴者手动调节穿戴者的选择(高斯过程模型)测得的代谢消耗可穿戴传感器模型0102030代谢降幅(%)仅有时间5102050100200调节所用的行走时间(分钟,对数刻度)Schäfer 2026Liu 2026Ding 2018Slade 2022Slade 实验室:32 对 128 分钟MO-HILBOSchäfer 等 2026髋外骨骼,4 个时机参数,11 名健康成人用拇指杆遥控器自调,用时 10.9 ± 0.9 分钟(最长16.2 分钟),尝试设置数的中位数为 30.5 个(16 至111)。代谢消耗比穿着外骨骼以零力矩行走时低16.6 ± 1.1%;±8% 的时机变化没有造成显著差异。
图 33.1 外骨骼与假肢调节研究的并列比较。“时间与收益”视图画出调节所用的行走分钟数与代谢降幅,误差线按原文报告;颜色表示每个设置由什么评判:穿戴者手动调节、穿戴者的成对选择、实测代谢消耗,或可穿戴传感器模型。基线(零力矩或关闭助力、不穿装置、普通鞋)、装置和速度各不相同,因此这张图只提供一个参照框架,而非正面比较;Liu 等人的时间包含验证。“参与者”视图画出被试人数与每人的评估次数,空心标记表示包含临床被试的研究。选择一项研究,可以查看其方案与结果。人数或时间无法核实的研究,不出现在需要该数值的视图中。

可以留意以下几点:

  • 在“时间与收益”中,自调的结果位于左侧,落在优化器调节结果的范围之内,而不是低于它们。
  • 唯一明显高于其他结果的是 Slade 等人的 23%,它以普通鞋为基线,且是在行走一小时之后测得的。
  • 在“参与者”中,几乎所有标记都低于 15 名被试,表示临床被试的空心标记位于 2 至 4。

由此可见。最优点周围 ±8% 的容差、Díaz 等人研究中自选最优点的不一致,以及候选点相近时验证率的下降(Taddei 等人的连续版本为 67%,仅一名被试),都表明最优点附近的偏好地形是平坦的,因此对这类问题,快速的粗略搜索比精确搜索更合适(推断)。感知数据与此吻合:如果行走中的人感觉不到小于约 42% 的刚度变化(Maberry 与 Martin,2026),那么更接近的候选点之间的比较几乎不携带信息,这就为该参数提供了一条有原则的停止规则(推断;第 46.6 节列出的现行规则都没有考虑感知)。

还没有研究在同一批患者身上、以预注册的终点比较偏好贝叶斯优化与专家手动调节。能够回答这一问题的实验并不复杂:相同的被试和时间预算,以平衡的顺序比较自调与成对偏好优化,设置客观终点,并在延迟一段时间后检查当事人是否仍然偏好所得结果。在这一实验完成之前,为有 4 至 6 个参数的装置调参的团队,应当把自调视为必须超越的基线(推断)。第 34.4 节把这一点纳入本书的建议;在第 24 章中,读者可以先后担任两种角色:亲手调节一位模拟行走者,以及让优化器调节它。

第 33.3 节引用的文献 5
  1. Ingraham 等人(2022)The role of user preference in the customized control of robotic exoskeletons
  2. Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
  3. Ding 等人(2018)Human-in-the-Loop Optimization of Hip Assistance with a Soft Exosuit during Walking
  4. Liu 等人(2026d)Personalized Lower-limb Exoskeleton Assistance via Preference-based Bayesian Optimization
  5. Maberry 与 Martin(2026)Just Noticeable Difference of Impedance Parameters While Walking in an Ankle Exoskeleton

33.4 助听器与音频 #

助听器是偏好学习最早进入商业产品的领域之一。助听器对不同频带的放大程度不同。每个频带的增益(gain)和压缩比(compression ratio),即响亮声音相对于轻柔声音的压低程度,通常由听力师根据验配处方(prescription)设定;验配处方是 NAL-NL2 这类把个人听力图映射为设置的公式。早在 2015 年,Nielsen 等人(2015)就用带主动学习的高斯过程做基于感知的个性化;来自制造商 Starkey 研究中心的 Baltzell 等人(2018)用基于偏好的贝叶斯优化发现,听者偏好的压缩比各不相同,而且相比线性增益和 NAL-NL2 处方,他们往往更偏好学到的压缩比。

SoundSense Learn。Søgaard Jensen 等人(2019)的作者来自制造商 Widex 和 FORCE Technology,评估对象是 Widex SoundSense Learn。该系统以高斯过程先验对用户关于 3 个频带增益的效用建模,并从成对比较中学习,用户在比较中用滑块标出偏好的程度(研究中为 20 次比较)。20 名听力受损被试每人调节 12 个声音场景,三种属性(基本音质、聆听舒适度、言语清晰度)各 4 个,助听器戴在声学人体模型上;各次调节所得设置的录音,与 Widex 自己的验配处方给出的两种设置一起接受双盲评分。基本音质普遍提高;聆听舒适度只在交通噪声中提高,在多人交谈的嘈杂声中没有提高;言语清晰度没有显著提高。增益调整的幅度因人差异很大,也无法预测谁会受益。同样来自该制造商的 Balling 等人(2021)描述了一种根据用户输入持续运行的贝叶斯优化机制,并概述了实验室与现场的结果。

预设与对决赌博机。针对非处方助听器,Vyas 等人(2022)把 24 维的配置空间离散化为 15 个预设,并把选择视为对决赌博机(dueling bandit)问题,即从成对胜负中学习的赌博机(第 21 章)。35 名轻度至中度听力损失者每人把每一对预设比较 4 次;随后在模拟中比较各算法,模拟中的每个回答都从某个人记录下来的偏好中抽取。在模拟中,作者的算法找到最佳预设所需比较次数的中位数为 25 次,是最好基线的一半。

其他工作。Ignatenko 等人(2025)提出一种信息论的查询设计,在模拟中以及在一个“真实案例”上做了验证,摘要没有说明该案例所属的领域(我们未能读到全文);Tasnim 等人(2024)综述了用于助听器个性化的机器学习。最接近的人工耳蜗研究是 Gilbert 等人(2022),它让 14 名 MED-EL 用户在固定设置下为音乐评分,而非进行自适应优化。HearClip 是一项用于助听器的贝叶斯偏好引出试验,2008 年 5 月在阿姆斯特丹注册;其记录最后一次更新于 2025 年 9 月 1 日,至今仍把招募状态列为“待定”,没有结果(Amsterdam UMC,2008)。一篇关于音频偏好学习的预印本综述引用了一项音乐生成研究,其标注者一致率为 60%,而文本摘要为 75%;这些是该研究自己的数字,并非汇总估计(Broukhim 等,2025)。

就研究设计而言,助听器的证据是本章最强的,包括与处方设置的双盲比较。这些证据显示出一个反复出现的模式:偏好调节改善了人直接评判的方面(整体音质),却不能可靠地改善装置的根本目标,即听懂言语;而言语理解只以评分的清晰度衡量,没有采用可懂度测试(推断)。商业系统的评估由制造商开展或与其合著,压缩比研究也出自一家制造商的研究中心;我们找到的受控评估没有一项独立于制造商(推断,依据作者的所属机构)。这一领域需要的是一项带有言语可懂度测试的独立评估(推断)。

第 33.4 节引用的文献 10
  1. Nielsen 等人(2015)Perception-based Personalization of Hearing Aids using Gaussian Processes and Active Learning
  2. Baltzell 等人(2018)Efficient characterization of individual differences in compression ratio preference
  3. Søgaard Jensen 等人(2019)Perceptual Effects of Adjusting Hearing-Aid Gain by Means of a Machine-Learning Approach Based on Individual User Preference
  4. Balling 等人(2021)The Collaboration between Hearing Aid Users and Artificial Intelligence to Optimize Sound
  5. Vyas 等人(2022)Personalizing over-the-counter hearing aids using pairwise comparisons
  6. Ignatenko 等人(2025)On preference learning based on sequential Bayesian optimization with pairwise comparison
  7. Tasnim 等人(2024)A Review of Machine Learning Approaches for the Personalization of Amplification in Hearing Aids
  8. Gilbert 等人(2022)Cochlear Implant Compression Optimization for Musical Sound Quality in MED-EL Users
  9. Amsterdam UMC(2008)Personalization of Hearing Aids through Bayesian Preference Elicitation
  10. Broukhim 等人(2025)Preference-Based Learning in Audio Applications: A Systematic Analysis

33.5 神经假体与神经刺激 #

神经假体(neuroprosthesis)通过刺激神经系统替代丧失的功能。在视网膜植入物(retinal implant)中,视网膜上的电极产生称为光幻视的光点,编码器(encoder)把摄像头图像转换为刺激模式;模式的质量取决于一些因患者而异的参数。在脊髓刺激(spinal cord stimulation)中,覆盖在脊髓上的电极阵列能在损伤后恢复部分站立或抓握能力,效果取决于激活哪些电极,以及刺激的频率和幅度。

视觉假体。Fauvel 与 Chalk(2022)用偏好贝叶斯优化为视力正常的观看者调节模拟假体视觉的编码器,报告感知图像质量有显著而稳健的提升,并能迁移到其他任务;bioRxiv 预印本报告了 24 名被试、每次运行 60 次对决,我们未能读到期刊版本以核实这些数字。Granley 等人(2023)仅在模拟患者身上用对决调节深度编码器的 13 个患者特异性参数,约 20 次对决后得到高质量的知觉,约 75 次后接近理想编码器;该方法对模拟的回答噪声以及至多 300% 的阈值设定错误都是稳健的,在后一种情况下收敛到稍差的编码。

后续研究 Schoinas 等人(2025)发表于 2025 年的 IEEE Engineering in Medicine and Biology Society 会议(EMBC),每种条件下与 17 名视力正常的本科生进行 60 次对决。人的选择只有约 50% 与模拟智能体一致;主条件下人的最终损失为 0.27,早先模拟中为 0.07。然而在主条件下,17 名被试中有 16 名偏好优化后的结果;在阈值设定错误的条件下 17 名全部如此,在分布外条件下有 14 名。三项研究的对象都是视力正常者或模拟患者。

脊髓刺激。相关对决赌博机 CorrDuel 让临床医生比较同一患者在两种电极配置下的站立情况,以此选择配置;这是一项有 2 名患者、414 次比较的实时试验(Sui 等,2017a)。临床知识先把 16 通道阵列约 4.3×1074.3 \times 10^7 种配置削减到 10310^3 至 10410^4 的量级;与医生自己选择的比较是定性的:医生选出的配置是算法所找到配置的子集。分阶段安全贝叶斯优化 StageOpt 先只探索有把握安全的设置,再在其中优化(第 14.4 节),其临床部分使用偏好反馈(Sui 等,2018b)。该方法在 10 周内与一名四肢瘫痪患者进行了 564 次抓握治疗试验,从未采样不安全的模式;约 400 次迭代后,根据其所选模式拟合的高斯过程超过了医生的最佳选择。作者指出,该方法假设患者的响应不随时间变化。Zhao 等人(2021)为 E-STAND 试验的 5 名被试建立贝叶斯偏好模型,按被试平均的准确率在交叉验证中为 71.5%,在前瞻性验证中为 65.6%,均显著高于随机水平。一篇作者有重叠的后续论文加入了元学习;其摘要报告的是在合成数据上的验证,未提及患者,我们未能读到全文(Farooqi 等,2025)。

有两点教训尤为突出(推断)。第一,即使任务简单,模拟的人与真人之间的差距也很大,因此模拟患者上的结果不能代替临床证据(第 31.7 节)。第二,StageOpt 与 CorrDuel 这两个临床成功案例与医生选择的比较,要么只是定性的,要么只在单个患者身上进行。

第 33.5 节引用的文献 7
  1. Fauvel 与 Chalk(2022)Human-in-the-loop optimization of visual prosthetic stimulation
  2. Granley 等人(2023)Human-in-the-Loop Optimization for Deep Stimulus Encoding in Visual Prostheses
  3. Schoinas 等人(2025)Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants
  4. Sui 等人(2017a)Correlational Dueling Bandits with Application to Clinical Treatment in Large Decision Spaces
  5. Sui 等人(2018b)Stagewise Safe Bayesian Optimization with Gaussian Processes
  6. Zhao 等人(2021)Optimization of Spinal Cord Stimulation Using Bayesian Preference Learning and Its Validation
  7. Farooqi 等人(2025)An augmented preference-based Bayesian approach for optimizing neuromodulation stimulation parameters using meta learning

33.6 机器人控制与人-机器人交互 #

机器人同样由人来调节:工程师反复调整增益和约束,直到机器人动得“好”;这种判断做出来容易,写成代价函数却难。第 15.4 节介绍以测量值为目标的机器人贝叶斯优化,本节讨论目标为人的判断的情形。

腿式机器人。Tucker 等人(2021)在 AMBER-3M 机器人上用 LineCoSpar 调节一种步态优化的约束,该步态优化基于混合零动态(实现稳定双足步态的一种标准方法);刚性足时用 30 次迭代、装有步态模型未考虑的弹簧时用 50 次迭代,就得到了稳健的行走。Csomay-Shanklin 等人(2022)在 AMBER 上调节控制器增益,最初采样的增益都无法行走,50 次迭代后有 3 组被评为很好;他们也在 Cassie 上做了调节,分别由一位领域专家和一位无经验用户评判。Cosner 等人(2022)依据成对偏好与安全标签,为 Unitree A1 四足机器人调节安全滤波器,在模拟中用了 30 次迭代,在硬件上室内 7 次、室外 3 次。这些研究中,每次都只由一名操作者评判。同一研究组发布了 MATLAB 工具箱 POLAR(Tucker 等,2022),以预印本形式发表。

控制器标定的两个学派。GLISp 一系使用径向基函数代理模型,包括:GLISp(Bemporad 与 Piga,2021);带收敛保证的 GLISp-r(Previtali 等,2023);一个机器人密封规划器,其摘要报告在 20 次试验内得到的沉积质量优于示教编程和手动调节(Roveda 等,2021)(我们只读到了摘要);以及用 15 名博士或硕士研究生验证的协作喷涂(Cella 等,2026)。高斯过程学派包括:根据真实用户的成对反馈调节的模拟比例积分控制器,比多目标替代方法更接近用户期望的响应(Coutinho 等,2024),后续工作发表于 Control Engineering Practice(Coutinho 等,2026);用于个性化等离子体医学的共同主动多目标优化(Shao 等,2024);CrashPBO,允许用户把一次坠毁报告为比任何一次成功实验都差,实验对象为一架做后空翻的四旋翼(3 名实验室成员担任评判者,每人 15 次试验)、一个 Furuta 摆和一台独轮机器人(Menn 等,2026b),这是我们找到的最早的四旋翼偏好调节;以及 2024 年 International Conference on Ubiquitous Robots 上发表的 Franka Panda 机械臂伸手够物演示,该研究没有报告用户研究(Feith 与 Rueckert,2024)。

专家的代价函数与专家的选择。De Witte 等人(2025)的一篇 2025 年预印本给出了这一领域最重要的负面发现。实验中机械臂把方块推向目标,研究调节级联控制器的 4 个时间尺度参数;三种偏好方法在硬件上运行,由一位专家在两次推动之间做选择(2 次随机比较和 13 次算法驱动的比较,每次试验 30 个实验)。偏好贝叶斯优化把系统调到了令专家满意的程度,但专家为描述自身优先考虑而设计的代价函数,与其选择并不完全一致;即使按专家评分最高的推动重新拟合代价函数的权重,也是如此。在代价最低的 10% 实验中,专家很少与代价函数意见相左;超出这一范围,在代价函数的到达目标项上,一致与不一致大致各占一半。在各次迭代中,专家的选择相对一致地遵循总代价,但优先级的转移无法建模为可重复的模式。从对决中学到的高斯过程效用,比专家自己的代价函数更符合专家的决定。实验涉及一位专家;论文没有给出人数。

主动的基于偏好的奖励学习。机器人学习领域的用户研究对照更为严格,大多使用线性奖励。Sadigh 等人(2017)提出主动的基于偏好的奖励学习,依据人在成对轨迹之间的选择学习奖励(第 36.1 节),Bıyık 与 Sadigh(2018)将其扩展到批量查询。DemPref 把示范与偏好结合起来,Fetch 机器人的 15 名用户认为它比逆强化学习(仅从示范中学习奖励)更成功(Palan 等,2019),其期刊版本还包含更多用户研究(Bıyık 等,2022);“Asking Easy Questions”考虑了问题对人而言的难度(Bıyık 等,2019)。使用高斯过程奖励时,10 名用户教 Fetch 机器人玩一种迷你高尔夫的变体,并在 9 点量表上为学到的行为评分:主动高斯过程为 6.9 ± 0.6(均值 ± 标准误),主动线性模型为 3.4 ± 0.7,随机查询的高斯过程为 5.1 ± 0.7(p<0.05p < 0.05)(Bıyık 等,2020)。Myers 等人(2021)从排序中学习奖励;APReL 库汇集了这些算法(Bıyık 等,2021);Kwon 等人(2022)则根据对渲染菜品的比较为日本料理摆盘,被试为模拟用户和 4 名真实用户。

由此可见。控制领域的论文把偏好贝叶斯优化视为反复试错调参的替代方案,但其基线是工程师写不出来的评分函数(如第 34.1 节所述)或专家编写的代价函数,而不是实测的专家调参时间与质量,因此所宣称的调参工作量节省尚未量化(推断),密封研究或许是例外。De Witte 等人还提示,由隐藏代价函数定义的合成决策者,可能高估一种方法在真人身上的效果(推断)。

第 33.6 节引用的文献 23
  1. Tucker 等人(2021)Preference-Based Learning for User-Guided HZD Gait Generation on Bipedal Walking Robots
  2. Csomay-Shanklin 等人(2022)Learning Controller Gains on Bipedal Walking Robots via User Preferences
  3. Cosner 等人(2022)Safety-Aware Preference-Based Learning for Safety-Critical Control
  4. Tucker 等人(2022)POLAR: Preference Optimization and Learning Algorithms for Robotics
  5. Bemporad 与 Piga(2021)Global optimization based on active preference learning with radial basis functions
  6. Previtali 等人(2023)GLISp-r: a preference-based optimization algorithm with convergence guarantees
  7. Roveda 等人(2021)Pairwise Preferences-Based Optimization of a Path-Based Velocity Planner in Robotic Sealing Tasks
  8. Cella 等人(2026)Adaptive Human-Robot Collaborative Painting Combining Preference-Based Optimization and Dynamic Motion Primitives
  9. Coutinho 等人(2024)Human-in-the-loop controller tuning using Preferential Bayesian Optimization
  10. Coutinho 等人(2026)Efficient human-in-the-loop MPC tuning with multi-task preferential Bayesian optimization
  11. Shao 等人(2024)Coactive Preference-Guided Multi-Objective Bayesian Optimization: An Application to Policy Learning in Personalized Plasma Medicine
  12. Menn 等人(2026b)Preferential Bayesian Optimization with Crash Feedback
  13. Feith 与 Rueckert(2024)Integrating Human Expertise in Continuous Spaces: A Novel Interactive Bayesian Optimization Framework with Preference Expected Improvement
  14. De Witte 等人(2025)How to Capture Human Preference: Commissioning of a Robotic Use-Case via Preferential Bayesian Optimisation
  15. Sadigh 等人(2017)Active Preference-Based Learning of Reward Functions
  16. Bıyık 与 Sadigh(2018)Batch Active Preference-Based Learning of Reward Functions
  17. Palan 等人(2019)Learning Reward Functions by Integrating Human Demonstrations and Preferences
  18. Bıyık 等人(2022)Learning Reward Functions from Diverse Sources of Human Feedback: Optimally Integrating Demonstrations and Preferences
  19. Bıyık 等人(2019)Asking Easy Questions: A User-Friendly Approach to Active Reward Learning
  20. Bıyık 等人(2020)Active Preference-Based Gaussian Process Regression for Reward Learning
  21. Myers 等人(2021)Learning Multimodal Rewards from Rankings
  22. Bıyık 等人(2021)APReL: A Library for Active Preference-based Reward Learning Algorithms
  23. Kwon 等人(2022)Physically Consistent Preferential Bayesian Optimization for Food Arrangement

33.7 已定、有争议与缺失 #

研究现状已定、有争议与缺失

已定。在相关研究所检验的意义上,基于偏好的外骨骼调节是有效的:在 12 至 50 次比较的会话中,按每项研究的被试平均,人后来的选择与学到的模型的一致率约为 65% 至 100%。穿戴者的自调在同一人身上可重复,但不同人之间差异很大(Ingraham 等,2022);用拇指杆自调 4 个髋部参数,用时约 11 分钟,代谢消耗比零力矩时降低 16.6%(Schäfer 等,2026)。助听器的偏好调节提高了整体音质,但没有改善言语清晰度(Søgaard Jensen 等,2019)。模拟用户可能与真实用户差别很大(Schoinas 等,2025)。

有争议。对有 4 至 6 个参数的问题,算法调节是否优于手动调节;两项 2026 年的结果在不同装置上处于同一量级。偏好的设置有多少属于当事人自己,又有多少是适应和优化器自身动态的产物:Arens 等人的研究中,偏好在各区组间上升;Ingraham 等人的研究中,无经验用户逐渐偏向更大的力矩;Poggensee 与 Collins 的研究中,定制只贡献了四分之一的收益。专家的判断究竟能否明确写出,目前的证据只来自一位专家(De Witte 等,2025)。

缺失。在相同患者和时间预算下,偏好优化与专家调节或自调的预注册比较。2 名截瘫患者、少数脊髓损伤患者和少数截肢者之外的临床人群。有盲人用户参与的视网膜植入物研究。关于脑深部电刺激、人工耳蜗或康复中功能性电刺激的任何研究,以及 2025 年至 2026 年 9 月间任何新的、经同行评审的助听器或人工耳蜗偏好贝叶斯优化用户研究。对助听器偏好调节的独立评估。以实测的专家调参时间与质量作为控制器标定的基线;有一篇摘要报告了与手动调节的比较,我们未能读到其测量数据(Roveda 等,2021)。评判者不止寥寥数人的四旋翼与四足机器人偏好调节:我们找到了一项只有一名用户的四足机器人研究(Cosner 等,2022),以及一项有 3 名实验室成员参与的四旋翼研究(Menn 等,2026b)(推断,依据上文报告的检索)。

第 33.7 节引用的文献 8
  1. Ingraham 等人(2022)The role of user preference in the customized control of robotic exoskeletons
  2. Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
  3. Søgaard Jensen 等人(2019)Perceptual Effects of Adjusting Hearing-Aid Gain by Means of a Machine-Learning Approach Based on Individual User Preference
  4. Schoinas 等人(2025)Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants
  5. De Witte 等人(2025)How to Capture Human Preference: Commissioning of a Robotic Use-Case via Preferential Bayesian Optimisation
  6. Roveda 等人(2021)Pairwise Preferences-Based Optimization of a Path-Based Velocity Planner in Robotic Sealing Tasks
  7. Cosner 等人(2022)Safety-Aware Preference-Based Learning for Safety-Critical Control
  8. Menn 等人(2026b)Preferential Bayesian Optimization with Crash Feedback

33.8 习题 #

习题 33.1

Liu 等人报告,相对于穿着外骨骼但关闭助力,代谢降幅为 14.5% 至 15.4%;相对于不穿外骨骼行走,降幅为 8.6% 至 13.0%。假设穿着外骨骼但不提供助力,比不穿时行走多消耗 5% 的能量。从相对于关闭助力 15% 的降幅出发,预期相对于不穿外骨骼的降幅是多少?把 Schäfer 等人的 16.6%(相对于零力矩)与 Ding 等人的 17.4%(相对于不穿装置)以及 Liu 等人的 14.5% 至 15.4% 相比较时,这说明了什么?

解答

设 E0E_0 为不穿装置行走的能耗。穿着装置但不提供助力时,Eoff=1.05 E0E_{\text{off}} = 1.05\,E_0。相对于它降低 15%,得 E=0.85×1.05 E0≈0.89 E0E = 0.85 \times 1.05\,E_0 \approx 0.89\,E_0,即相对于不穿装置降低 11%。携带不提供助力的装置本身要消耗能量,所以同样的助力以“关闭助力”为基线时,看起来比以“不穿装置”为基线时更好。

Schäfer 等人的 16.6% 与 Liu 等人的 14.5% 至 15.4% 都以穿着装置但不提供助力为基线,因此可以并列比较(装置、参数和速度仍然不同)。Ding 等人的 17.4% 以不穿装置为基线;若换算为以穿着装置但不提供助力为基线,这个数会更大。因此,经优化器调节的外骨骼服相对于自调髋外骨骼的优势,比原始数字所显示的略大,具体大多少取决于每种装置在不提供助力时穿着所带来的额外消耗。5% 是为本习题所作的假设。

习题 33.2

LineCoSpar 的 6 名被试每人有 4 个验证偏好,与模型的一致率分别为 75%、100%、100%、25%、100% 与 100%。如果一名被试随机作答,4 个全部一致的概率是多少?至少 3 个一致的概率又是多少?由此可见,单个被试的 100% 能提供多少信息?

解答

随机作答时,每个回答一致的概率为 1/2,所以四个全部一致的概率为 (1/2)4=1/16≈6%(1/2)^4 = 1/16 \approx 6\%,至少三个一致的概率为 ((43)+(44))/16=5/16≈31%(\binom{4}{3} + \binom{4}{4})/16 = 5/16 \approx 31\%。单个被试在 4 次检查上的 100% 本身是很弱的证据,在纯猜测下大约是十六分之一的事件。在 6 名被试中出现四个满分,纯属偶然的可能性要小得多,因此整项研究具有信息量;但每人 4 次检查的验证,无法把模型确实捕捉到其偏好的人与只是运气好的人区分开。这也是仅靠少数几次内部检查的验证构成表 33.1 中最弱证据的原因之一。

习题 33.3

Arens 等人测得,抬举助力的最小可觉差为 13.1 N,放下助力为 9.8 N。假设抬举助力的搜索范围为 0 至 80 N。如果相距不到一个最小可觉差的设置之间的比较不携带信息,抬举范围大约有多少个可区分的水平?对于优化这一个参数能有效利用多少次成对比较,这有什么启示?

解答

大约 80/13.1≈680 / 13.1 \approx 6 个可区分的水平。有大约六个水平时,若噪声很小,搜索可以用类似二分法的方式,通过约 log⁡26≈3\log_2 6 \approx 3 次有信息量的比较找到偏好的水平;在现实的噪声下则需要其数倍。相距不到一个最小可觉差的候选点之间的比较,几乎不增加信息。决定有效分辨率的是感知阈值,而不是优化器;这正是 Arens 等人把最小可觉差纳入采集函数的原因,也是本章建议把它用作停止规则的原因。0 至 80 N 的范围是为本习题所作的假设。

延伸阅读 #

参考文献

  1. Alili, A., Nalam, V., Li, M., Liu, M., Feng, J., Si, J., and Huang, H. (2023). A Novel Framework to Facilitate User Preferred Tuning for a Robotic Knee Prosthesis. IEEE Transactions on Neural Systems and Rehabilitation Engineering. 引用于 §33.2
  2. Amsterdam UMC (2008). Personalization of Hearing Aids through Bayesian Preference Elicitation. Trial registry, onderzoekmetmensen.nl. 非同行评审引用于 §33.4
  3. Arens, P., Quirk, D. A., Pan, W., Yacoby, Y., Doshi-Velez, F., and Walsh, C. J. (2025). Preference-based assistance optimization for lifting and lowering with a soft back exosuit. Science Advances. doi:10.1126/sciadv.adu2099. 引用于 §33.1
  4. Astudillo, R., Li, K., Tucker, M., Cheng, C. X., Ames, A. D., and Yue, Y. (2025). Preferential Multi-Objective Bayesian Optimization. Transactions on Machine Learning Research. 引用于 §33.1
  5. Baek, S., Park, S., and Kim, D. (2026). Context-Continuous Preference Learning for Exoskeleton Personalization. arXiv. 预印本引用于 §33.1
  6. Balling, L. W., Mølgaard, L. L., Townend, O., and Nielsen, J. B. B. (2021). The Collaboration between Hearing Aid Users and Artificial Intelligence to Optimize Sound. Seminars in Hearing. doi:10.1055/s-0041-1735135. 引用于 §33.4
  7. Baltzell, L. S., Xia, J., and Kalluri, S. (2018). Efficient characterization of individual differences in compression ratio preference. The Journal of the Acoustical Society of America. doi:10.1121/1.5067390. 引用于 §33.4
  8. Bemporad, A., and Piga, D. (2021). Global optimization based on active preference learning with radial basis functions. Machine Learning. 引用于 §33.1 §33.6
  9. Bıyık, E., and Sadigh, D. (2018). Batch Active Preference-Based Learning of Reward Functions. CoRL 2018. 引用于 §33.6
  10. Bıyık, E., Palan, M., Landolfi, N. C., Losey, D. P., and Sadigh, D. (2019). Asking Easy Questions: A User-Friendly Approach to Active Reward Learning. CoRL 2019. 引用于 §33.6
  11. Bıyık, E., Huynh, N., Kochenderfer, M. J., and Sadigh, D. (2020). Active Preference-Based Gaussian Process Regression for Reward Learning. RSS 2020. 引用于 §33.6
  12. Bıyık, E., Talati, A., and Sadigh, D. (2021). APReL: A Library for Active Preference-based Reward Learning Algorithms. arXiv. 软件引用于 §33.6
  13. Bıyık, E., Losey, D. P., Palan, M., Landolfi, N. C., Shevchuk, G., and Sadigh, D. (2022). Learning Reward Functions from Diverse Sources of Human Feedback: Optimally Integrating Demonstrations and Preferences. IJRR. 引用于 §33.6
  14. Broukhim, A., Shen, Y., Ammanabrolu, P., and Weibel, N. (2025). Preference-Based Learning in Audio Applications: A Systematic Analysis. arXiv. 预印本引用于 §33.4
  15. Cella, C., Ristic, M., Faroni, M., Zanchettin, A. M., and Rocco, P. (2026). Adaptive Human-Robot Collaborative Painting Combining Preference-Based Optimization and Dynamic Motion Primitives. IEEE Robotics and Automation Letters. doi:10.1109/LRA.2026.3683596. 引用于 §33.6
  16. Cosner, R., Tucker, M., Taylor, A., Li, K., Molnár, T., Ubelacker, W., … Ames, A. (2022). Safety-Aware Preference-Based Learning for Safety-Critical Control. Learning for Dynamics and Control Conference. 引用于 §33.6 §33.7
  17. Coutinho, J. P., Castillo, I., and Reis, M. S. (2024). Human-in-the-loop controller tuning using Preferential Bayesian Optimization. IFAC-PapersOnLine. doi:10.1016/j.ifacol.2024.08.306. 引用于 §33.6
  18. Coutinho, J. P., Peng, Y., Rendall, R., Ma, K., Chin, S.-T., Castillo, I., and Reis, M. S. (2026). Efficient human-in-the-loop MPC tuning with multi-task preferential Bayesian optimization. Control Engineering Practice. 引用于 §33.6
  19. Csomay-Shanklin, N., Tucker, M., Dai, M., Reher, J., and Ames, A. D. (2022). Learning Controller Gains on Bipedal Walking Robots via User Preferences. ICRA 2022. 引用于 §33.6
  20. De Witte, S., Taets, J., Retzler, A., Crevecoeur, G., and Lefebvre, T. (2025). How to Capture Human Preference: Commissioning of a Robotic Use-Case via Preferential Bayesian Optimisation. arXiv. 预印本引用于 §33.6 §33.7
  21. Díaz, M. A., Nuzzo, S., Flynn, L., Beckerle, P., Verstraten, T., and De Pauw, K. (2026). User preference in the personalized control of an ankle prosthesis: a case study. Journal of NeuroEngineering and Rehabilitation. doi:10.1186/s12984-026-01931-w. 引用于 §33.2
  22. Ding, Y., Kim, M., Kuindersma, S., and Walsh, C. J. (2018). Human-in-the-Loop Optimization of Hip Assistance with a Soft Exosuit during Walking. Science Robotics. 引用于 §33.1 §33.3
  23. Farooqi, H., Zhao, Z., Darrow, D., Lamperski, A., and Netoff, T. I. (2025). An augmented preference-based Bayesian approach for optimizing neuromodulation stimulation parameters using meta learning. Journal of Neural Engineering. 引用于 §33.5
  24. Fauvel, T., and Chalk, M. (2022). Human-in-the-loop optimization of visual prosthetic stimulation. Journal of Neural Engineering. 引用于 §33.5
  25. Feith, N., and Rueckert, E. (2024). Integrating Human Expertise in Continuous Spaces: A Novel Interactive Bayesian Optimization Framework with Preference Expected Improvement. 2024 21st International Conference on Ubiquitous Robots (UR). doi:10.1109/ur61395.2024.10597501. 引用于 §33.6
  26. Fortuna, A., Lorenzini, M., Leonori, M., Gandarias, J., Balatti, P., Cho, Y., De Momi, E., and Ajoudani, A. (2024). A Personalizable Controller for the Walking Assistive omNi-Directional Exo-Robot (WANDER). ICRA 2024. 引用于 §33.1
  27. Gilbert, M. L., Deroche, M. L. D., Jiradejvong, P., Chan Barrett, K., and Limb, C. J. (2022). Cochlear Implant Compression Optimization for Musical Sound Quality in MED-EL Users. Ear & Hearing. 引用于 §33.4
  28. Granley, J., Fauvel, T., Chalk, M., and Beyeler, M. (2023). Human-in-the-Loop Optimization for Deep Stimulus Encoding in Visual Prostheses. NeurIPS 2023. 引用于 §33.5
  29. Ignatenko, T., Kondrashov, K., Cox, M., and de Vries, B. (2025). On preference learning based on sequential Bayesian optimization with pairwise comparison. Artificial Intelligence. 引用于 §33.4
  30. Ingraham, K. A., Remy, C. D., and Rouse, E. J. (2022). The role of user preference in the customized control of robotic exoskeletons. Science Robotics. 引用于 §33.3 §33.7
  31. Ingraham, K. A., Tucker, M., Ames, A. D., Rouse, E. J., and Shepherd, M. K. (2023). Leveraging user preference in the design and evaluation of lower-limb exoskeletons and prostheses. Current Opinion in Biomedical Engineering. 引用于 §33.1
  32. Janwani, N., Lerner, M. T., Young, A. J., and Tucker, M. (2026). Multi-Objective Human-in-the-Loop Bayesian Optimization of a Lower-Limb Exoskeleton. arXiv. 预印本引用于 §33.1
  33. Kim, G., and Sergi, F. (2025). Validation of Dynamic Bayesian Optimization for a Non-Stationary Human-in-the-Loop Optimization Problem. bioRxiv. 预印本引用于 §33.1
  34. Kwon, Y., Tsurumine, Y., Shimmura, T., Kawamura, S., and Matsubara, T. (2022). Physically Consistent Preferential Bayesian Optimization for Food Arrangement. IEEE Robotics and Automation Letters. 引用于 §33.6
  35. Lee, U. H., Shetty, V. S., Franks, P. W., Tan, J., Evangelopoulos, G., Ha, S., and Rouse, E. J. (2023). User preference optimization for control of ankle exoskeletons using sample efficient active learning. Science Robotics. 引用于 §33.1
  36. Li, K., Tucker, M., Bıyık, E., Novoseller, E., Burdick, J. W., Sui, Y., … Ames, A. D. (2021). ROIAL: Region of Interest Active Learning for Characterizing Exoskeleton Gait Preference Landscapes. ICRA 2021. 引用于 §33.1
  37. Liu, X.-Y., Li, G., Wang, W., and Hou, Z.-G. (2026d). Personalized Lower-limb Exoskeleton Assistance via Preference-based Bayesian Optimization. arXiv. 预印本引用于 §33.1 §33.3
  38. Maberry, A., and Martin, A. E. (2026). Just Noticeable Difference of Impedance Parameters While Walking in an Ankle Exoskeleton. IEEE Transactions on Neural Systems and Rehabilitation Engineering. 引用于 §33.1 §33.3
  39. Menn, J., Stenger, D., and Trimpe, S. (2026b). Preferential Bayesian Optimization with Crash Feedback. IEEE Robotics and Automation Letters. doi:10.1109/LRA.2026.3665446. 引用于 §33.6 §33.7
  40. Myers, V., Bıyık, E., Anari, N., and Sadigh, D. (2021). Learning Multimodal Rewards from Rankings. CoRL 2021. 引用于 §33.6
  41. Nielsen, J., Nielsen, J., and Larsen, J. (2015). Perception-based Personalization of Hearing Aids using Gaussian Processes and Active Learning. IEEE/ACM Transactions on Audio, Speech, and Language Processing. 引用于 §33.4
  42. Palan, M., Landolfi, N. C., Shevchuk, G., and Sadigh, D. (2019). Learning Reward Functions by Integrating Human Demonstrations and Preferences. RSS 2019. 引用于 §33.6
  43. Park, K., and Collins, S. H. (2026). Simultaneous Forward and Inverse Human-in-the-Loop Optimization. CoRL 2026. 引用于 §33.1
  44. Poggensee, K. L., and Collins, S. H. (2021). How adaptation, training, and customization contribute to benefits from exoskeleton assistance. Science Robotics. 引用于 §33.1
  45. Previtali, D., Mazzoleni, M., Ferramosca, A., and Previdi, F. (2023). GLISp-r: a preference-based optimization algorithm with convergence guarantees. Computational Optimization and Applications. 引用于 §33.6
  46. Ramella, G., Ijspeert, A., and Bouri, M. (2025). Rapid Online Learning of Hip Exoskeleton Assistance Preferences. ICRA 2025. 引用于 §33.1
  47. Roveda, L., Maggioni, B., Marescotti, E., Shahid, A. A., Maria Zanchettin, A., Bemporad, A., and Piga, D. (2021). Pairwise Preferences-Based Optimization of a Path-Based Velocity Planner in Robotic Sealing Tasks. IEEE Robotics and Automation Letters. 引用于 §33.6 §33.7
  48. Sadigh, D., Dragan, A., Sastry, S., and Seshia, S. (2017). Active Preference-Based Learning of Reward Functions. Robotics: Science and Systems XIII. 引用于 §33.6
  49. Schäfer, N., Zhao, G., Li, B., Kupnik, M., Seyfarth, A., Beckerle, P., and Grimmer, M. (2026). User preference-based human-in-the-loop tuning of exoskeleton assistance during walking. npj Biomedical Innovations. doi:10.1038/s44385-026-00085-7. 引用于 §33.1 §33.3 §33.7
  50. Schoinas, E., Rastogi, A., Carter, A., Granley, J., and Beyeler, M. (2025). Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants. 2025 47th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC). doi:10.1109/embc58623.2025.11253762. 引用于 §33.5 §33.7
  51. Shao, K., Chakrabarty, A., Mesbah, A., and Romeres, D. (2024). Coactive Preference-Guided Multi-Objective Bayesian Optimization: An Application to Policy Learning in Personalized Plasma Medicine. IEEE Control Systems Letters. 引用于 §33.6
  52. Slade, P., Kochenderfer, M. J., Delp, S. L., and Collins, S. H. (2022). Personalizing exoskeleton assistance while walking in the real world. Nature. 引用于 §33.1
  53. Slade, P., Atkeson, C., Donelan, J. M., Houdijk, H., Ingraham, K. A., Kim, M., … Collins, S. H. (2024). On human-in-the-loop optimization of human–robot interaction. Nature. 引用于 §33.1
  54. Søgaard Jensen, N., Hau, O., Bagger Nielsen, J. B., Bundgaard Nielsen, T., and Vase Legarth, S. (2019). Perceptual Effects of Adjusting Hearing-Aid Gain by Means of a Machine-Learning Approach Based on Individual User Preference. Trends in Hearing. doi:10.1177/2331216519847413. 引用于 §33.4 §33.7
  55. Sui, Y., Yue, Y., and Burdick, J. W. (2017a). Correlational Dueling Bandits with Application to Clinical Treatment in Large Decision Spaces. IJCAI 2017. 引用于 §33.5
  56. Sui, Y., Zhuang, V., Burdick, J., and Yue, Y. (2018b). Stagewise Safe Bayesian Optimization with Gaussian Processes. International Conference on Machine Learning. 引用于 §33.5
  57. Sun, L., Ma, H., An, H., and Wei, Q. (2024). An Individual Prosthesis Control Method with Human Subjective Choices. Biomimetics. doi:10.3390/biomimetics9020077. 引用于 §33.2
  58. Taddei, S., Koppen, W., Alfio, E., Nuzzo, S., Flynn, L., Diaz, M. A., … Verstraten, T. (2026). Bayesian Preference Elicitation: Human-In-The-Loop Optimization of An Active Prosthesis. arXiv. 预印本引用于 §33.2
  59. Tasnim, N. Z., Ni, A., Lobarinas, E., and Kehtarnavaz, N. (2024). A Review of Machine Learning Approaches for the Personalization of Amplification in Hearing Aids. Sensors. doi:10.3390/s24051546. 引用于 §33.4
  60. Tucker, M. (2023). Enabling Robust and User-Customized Bipedal Locomotion on Lower-Body Assistive Devices via Hybrid System Theory and Preference-Based Learning. California Institute of Technology. doi:10.7907/j9hk-xa17. 学位论文引用于 §33.1
  61. Tucker, M., Cheng, M., Novoseller, E., Cheng, R., Yue, Y., Burdick, J. W., and Ames, A. D. (2020a). Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits. IROS 2020. 引用于 §33.1
  62. Tucker, M., Novoseller, E., Kann, C., Sui, Y., Yue, Y., Burdick, J. W., and Ames, A. D. (2020b). Preference-Based Learning for Exoskeleton Gait Optimization. 2020 IEEE International Conference on Robotics and Automation (ICRA). 引用于 §33.1
  63. Tucker, M., Csomay-Shanklin, N., Ma, W.-L., and Ames, A. D. (2021). Preference-Based Learning for User-Guided HZD Gait Generation on Bipedal Walking Robots. ICRA 2021. 引用于 §33.6
  64. Tucker, M., Li, K., Yue, Y., and Ames, A. D. (2022). POLAR: Preference Optimization and Learning Algorithms for Robotics. arXiv. 预印本引用于 §33.6
  65. Vyas, D., Brummet, R., Anwar, Y., Jensen, J., Jorgensen, E., Wu, Y.-H., and Chipara, O. (2022). Personalizing over-the-counter hearing aids using pairwise comparisons. Smart Health. doi:10.1016/j.smhl.2021.100231. 引用于 §33.4
  66. Zhang, J., Fiers, P., Witte, K. A., Jackson, R. W., Poggensee, K. L., Atkeson, C. G., and Collins, S. H. (2017). Human-in-the-loop optimization of exoskeleton assistance during walking. Science. 引用于 §33.1
  67. Zhao, Z., Ahmadi, A., Hoover, C., Grado, L., Peterson, N., Wang, X., … Netoff, T. I. (2021). Optimization of Spinal Cord Stimulation Using Bayesian Preference Learning and Its Validation. IEEE Transactions on Neural Systems and Rehabilitation Engineering. doi:10.1109/tnsre.2021.3113636. 引用于 §33.5