贝叶斯优化
第五部分:案例研究
EN

人在回路中调节外骨骼

在第 23 章中,人选定搜索空间,然后观察优化器在实测产率上运行。本章中,人本身就是测量的一部分。踝关节外骨骼在每一步结束时向下推动足部;若推力大小合适、时机恰当,穿戴者行走时消耗的能量就会减少。合适的大小和时机因人而异,因此要为每位穿戴者单独调节装置:穿戴者穿着装置行走,由优化器选择下一个要尝试的设置。这是人处于回路之中的优化,也是这类优化中记录最详尽的案例之一:奠定这一方法的研究始于 2017 年,第 33 章综述了这些研究及后续研究的发现。

本章从调节者的角度出发,完整地处理一个问题:优化的对象与一次评估的代价、已发表研究的做法、由读者亲自进行的一次调节会话,以及使这一案例富有启发性的两个复杂因素。这两个因素,一是人在测量过程中不断适应,二是研究发现人自己调节这类装置的效果相当好。

开篇须先说明一点。读者无法通过网页穿戴外骨骼,也没有任何已发表的研究公开过一个人完整的代谢地形。因此,本章的每个交互图都基于模拟行走者(simulated walker)运行,这一模型的数值按已发表的测量结果设定。正文会说明哪些数值是测量所得及其出处,哪些是假设。模拟展示的是把已发表的数字综合起来时所蕴含的结果,并不构成新的证据。

24.1 问题 #

24.1.1 装置及其参数 #

外骨骼(exoskeleton)是在关节处施加力矩(使物体转动的力)的可穿戴机器人。控制器在每个步态周期(gait cycle)重复一次力矩曲线;步态周期指同一只脚从一次脚跟着地到下一次脚跟着地之间的间隔。在始于 Zhang 等人(2017)的一系列踝关节外骨骼实验中,力矩曲线由四个数确定:峰值力矩、峰值在步态周期中出现的时刻,以及力矩上升和下降所用的时间(Slade 等,2022)。每个数都限制在安全范围内。峰值力矩按体重归一化,允许范围为每千克体重 0 至 1 N·m(Slade 等,2022);Kutulakos 与 Slade(2024)在重用 Poggensee 与 Collins(2021)数据的预印本中报告,后者实验中的峰值时刻、上升时间和下降时间分别限制在步态周期的 35% 至 55%、10% 至 40% 和 5% 至 20% 之内。

为了让整个问题能在一张图上完整呈现,本章只调节四个参数中的两个:峰值力矩(peak torque),范围为每千克体重 0 至 1 N·m;峰值时刻(peak time),范围为步态周期的 35% 至 55%。一个设置是单位正方形中的一点 x=(x1,x2)\vx = (x_1, x_2),其中 x1x_1 为峰值力矩,x2x_2 为缩放到 [0,1][0, 1] 的峰值时刻。在这一领域,两个参数并非过于简化的规模:Ding 等人(2018)调节的正是两个参数,即髋部助力的峰值时机和结束时机。

24.1.2 优化的对象 #

经典的目标是代谢消耗(metabolic cost),即身体在行走时消耗能量的速率。代谢消耗用间接测热法估计:穿戴者通过面罩呼吸,面罩测量消耗的氧气和产生的二氧化碳。好的设置能使代谢率低于穿着同一装置、关闭电机时行走的代谢率。用这种测量驱动优化器,称为人在回路优化(human-in-the-loop optimization)。

另一个目标是穿戴者的偏好。偏好不需要面罩,涵盖了代谢数值所遗漏的舒适感和稳定感,读取也快得多。它同时也是一个不同的量:在一项髋外骨骼研究中,被试凭感觉选出的设置附近,代谢率并没有明显的最小值;作者推测,被试权衡的不只是费力程度,舒适度即是其中之一(Schäfer 等,2026)。下文两个目标都会出现:前者是带噪声的测量,后者是穿戴者凭感受做出的比较。

24.1.3 一次评估的代价 #

代谢率无法即时读出。设置改变之后,在口部测得的代谢率逐渐趋向新的水平,因为体内的氧储备和氧运输会延迟响应。Selinger 与 Donelan(2014)表明,行走时的响应可以很好地用一阶系统描述,即单位时间内剩余差距按固定比例缩小,时间常数为 42 ± 12 秒(被试间的均值 ± 标准差),而单次呼吸的读数围绕这一响应有很大的离散。等待代谢率稳定下来,每个设置需要数分钟。继 Zhang 等人(2017)之后的实验室方案改为让穿戴者在每个设置上行走两分钟,同时记录呼吸数据,并据此估计响应所趋向的稳态水平;两分钟是每个设置所用时间与估计精度之间的折中(Slade 等,2022)。

这一估计带有噪声。Kutulakos 与 Slade(2024)给出其标准差为代谢率的 4.6%(对两分钟数据做一阶拟合),依据是 Zhang 等人(2017)的实验;该研究的补充材料给出两分钟估计的平均误差为 4%。下图模拟了一次这样的行走。

代谢率(零力矩行走时的 %)406080100120140160060120180240300360在新设置下行走的秒数估计值 89.2%真实值 85%一次呼吸真实响应拟合的响应同样时长的行走重复 60 次所得的估计值5565758595105115标准差 4.4 个百分点(理论值 4.6)
代谢率(%)406080100120140160060120180240300360在新设置下行走的秒数估计值 89.2%真实值 85%一次呼吸真实响应拟合的响应重复 60 次行走5565758595105115标准差 4.4 个百分点(理论值 4.6)
图 24.1 一次评估的模拟。圆点是设置改变后逐次呼吸的代谢率读数,虚线是趋向新水平的真实一阶响应,实线是拟合曲线,其终点水平即为估计值。所用的测量值:42 秒的时间常数(Selinger 与 Donelan,2014),以及两分钟估计 4.6% 的标准差(Kutulakos 与 Slade,2024)。其余均为模拟或假设,包括每三秒一次呼吸,以及约 18% 的逐次呼吸离散;取这一数值,才能重现 4.6% 的标准差。下方的条带显示所选时长下 60 次重复行走得到的估计值。可以改变行走时长,再按“再走一次”。

可以尝试以下几点。行走两分钟时,估计值围绕真实值的标准差为 4.6 个百分点,这是模型设定使然;图中把这个值标为“理论值”,旁边是实际抽到的 60 次行走的离散程度,为 4.4 个百分点。把行走缩短到一分钟,标准差增至两倍以上,达到 10.6 个百分点,因为响应几乎还没有离开起始水平,拟合只能外推。延长到六分钟,标准差降至 1.9 个百分点,代价是三倍的时间。然后把真实变化设为 −3%,查看两分钟时的条带:这样大小的改进,在单次行走中无法分辨。

最后这一观察决定了整个问题的面貌。与良好的通用设置相比,针对个人调节带来的好处只有几个百分点:在 Poggensee 与 Collins(2021)中,通用控制器使训练有素的用户代谢率降低 31%,定制助力则降低 39%。在最优点附近,相邻设置之间的差别小于单次估计的噪声,因此优化器必须借助模型,在多次评估上取平均(习题 24.1)。每次评估两分钟,一小时的会话能做三十次评估。Slade 等人(2022)作为实验室参照运行的代谢优化,用了 128 分钟的行走时间。

24.1.4 人会变化 #

最后一个要素是,行走者不是固定的函数。人会逐渐学会使用外骨骼。在 Poggensee 与 Collins(2021)中,新手用户需要约 109 分钟的辅助行走才能成为熟练用户;最终 39% 的降幅中,训练贡献了约一半,定制约占四分之一;训练后能带来 31% 降幅的通用控制器,在训练前只带来 10%;最佳峰值力矩在整个研究期间持续缓慢增长,作者将其解释为更长时间尺度上的适应。因此,二十分钟的调节会话,所针对的是一个一小时后就已不复存在的人。第 24.4 节将回到这一问题,讨论它对优化器的影响。

第 24.1 节引用的文献 7
  1. Zhang 等人(2017)Human-in-the-loop optimization of exoskeleton assistance during walking
  2. Slade 等人(2022)Personalizing exoskeleton assistance while walking in the real world
  3. Kutulakos 与 Slade(2024)Simulating human-in-the-loop optimization of exoskeleton assistance to compare optimization algorithm performance
  4. Poggensee 与 Collins(2021)How adaptation, training, and customization contribute to benefits from exoskeleton assistance
  5. Ding 等人(2018)Human-in-the-Loop Optimization of Hip Assistance with a Soft Exosuit during Walking
  6. Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
  7. Selinger 与 Donelan(2014)Estimating instantaneous energetic cost during non-steady-state gait

24.2 已有研究的做法 #

在人身上尝试过的调节方式有三种,区别在于由谁评判一个设置。表 24.1 为每一类列出一两项研究及本章所用的数字;第 33.1.4 节给出完整的研究列表,包括被试和验证情况;第 33.3 节讨论这些结果在多大程度上可以相互比较。

表 24.1 调节外骨骼的三种方式,以及本章所用的已发表方案与结果。降幅相对于各研究指定的基线;各研究的基线不同,因此各行并不构成排名。
由谁评判 研究 装置与参数 调节方式 时间与结果
代谢估计 Zhang 等人(2017) 单侧踝关节,4 个参数,11 名被试 进化策略(CMA-ES) 11 人中的 9 人行走 64 分钟;比零力矩低 24.2 ± 7.4%
代谢估计 Ding 等人(2018) 髋部外骨骼服,2 个时机参数,8 名被试 贝叶斯优化 优化 40 分钟,21.4 ± 1.0 分钟后收敛;比不穿装置行走低 17.4 ± 3.2%
代谢估计 Poggensee 与 Collins(2021) 双侧踝关节,4 个参数,新手用户分为三个训练组 CMA-ES(按 Kutulakos 与 Slade(2024)的描述),用于定制助力组 经过约 109 分钟训练后,比装置关闭时低 39%
可穿戴传感器 Slade 等人(2022) 踝关节,4 个参数 根据踝关节运动为设置排序的模型,每个设置 30 秒 在实验室中用 32 分钟,而代谢估计用了 128 分钟
穿戴者的比较 Tucker 等人(2020a) 行走步态,6 个参数,6 名被试 沿随机直线的偏好学习 每人 30 次步态试验和 6 次验证试验
穿戴者的比较 Lee 等人(2023) 踝关节,4 个参数 带有学习得到的排序器的进化算法 经过 43 ± 7 次比较后设置稳定
穿戴者,手动 Ingraham 等人(2022) 踝关节,力矩大小与时机,24 名被试 自调,看不到参数值 每次试验 105 秒收敛
穿戴者,手动 Schäfer 等人(2026) 髋部,4 个时机参数,11 名被试 用拇指杆遥控器自调 10.9 ± 0.9 分钟,30.5 个设置;比零力矩低 16.6 ± 1.1%

表中前几行反复出现两种优化器。贝叶斯优化即第 11 章中的循环:高斯过程对代谢率随设置的变化建模,采集函数选出下一个要行走的设置。Ding 等人(2018)选用贝叶斯优化,是因为它适合信号带噪声、评估次数极少的情形。另一种是协方差矩阵自适应进化策略(covariance matrix adaptation evolution strategy,CMA-ES)(Hansen 与 Ostermeier,2001),第 15.8.1 节已有介绍。它不保留任何地形模型,而是从高斯分布中抽取一小批设置,称为一代(generation),让穿戴者逐一行走,把分布的均值移向较好的一半,沿着有改进的方向调整协方差,如此反复。它对最佳设置的估计就是这一均值。每一代用过之后即被遗忘:评估稀缺时,这显得浪费;而后文将会看到,人发生变化时,这一特点反而使它更能容忍变化。

偏好研究以穿戴者的判断取代面罩。CoSpar 和 LineCoSpar 询问穿戴者在两种步态中更喜欢哪一种,并允许他们提出改进建议(Tucker 等,2020b;Tucker 等,2020a)。前一项研究的作者指出,用户难以记住两次以上的试验,这是只把每次试验与紧邻的前一次比较的理由之一。2026 年的一篇预印本通过成对比较,为 5 名被试调节了髋外骨骼的六个参数,每次会话(含验证)用时 20.6 ± 4.6 分钟(Liu 等,2026d)。

自调研究连优化器也一并去掉。穿戴者手持控制器,改变一个参数,感受结果,满意时即停止。在 Schäfer 等人(2026)中,被试在每个设置上平均用时 18.7 秒,97.5% 的调整一次只改变一个参数。

第 24.2 节引用的文献 12
  1. Zhang 等人(2017)Human-in-the-loop optimization of exoskeleton assistance during walking
  2. Ding 等人(2018)Human-in-the-Loop Optimization of Hip Assistance with a Soft Exosuit during Walking
  3. Poggensee 与 Collins(2021)How adaptation, training, and customization contribute to benefits from exoskeleton assistance
  4. Kutulakos 与 Slade(2024)Simulating human-in-the-loop optimization of exoskeleton assistance to compare optimization algorithm performance
  5. Slade 等人(2022)Personalizing exoskeleton assistance while walking in the real world
  6. Tucker 等人(2020a)Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits
  7. Lee 等人(2023)User preference optimization for control of ankle exoskeletons using sample efficient active learning
  8. Ingraham 等人(2022)The role of user preference in the customized control of robotic exoskeletons
  9. Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
  10. Hansen 与 Ostermeier(2001)Completely Derandomized Self-Adaptation in Evolution Strategies
  11. Tucker 等人(2020b)Preference-Based Learning for Exoskeleton Gait Optimization
  12. Liu 等人(2026d)Personalized Lower-limb Exoskeleton Assistance via Preference-based Bayesian Optimization

24.3 重演一次会话 #

24.3.1 模拟行走者 #

模拟行走者有一个降幅(reduction)R(x,t)R(\vx, t):经过 tt 分钟的辅助行走后,设置 x\vx 使代谢率相对零力矩行走降低的比例。降幅是幅度、力矩项与时机项的乘积:

R(x,t)=A(t)  s(x1; T⋆(t))  exp⁡ ⁣(−(x2−P⋆(t))22⋅0.452),R(\vx, t) = A(t)\; s\big(x_1;\, T^\star(t)\big)\; \exp\!\left(-\frac{\big(x_2 - P^\star(t)\big)^2}{2 \cdot 0.45^2}\right),
(24.1)

其中 T⋆T^\star 和 P⋆P^\star 是行走者的最佳力矩和最佳峰值时刻。力矩项 ss 在零力矩处为零,按 1−((x1−T⋆)/T⋆)21 - \big((x_1 - T^\star)/T^\star\big)^2 上升到 T⋆T^\star 处的 1,超过之后按 1−((x1−T⋆)/0.5)21 - \big((x_1 - T^\star)/0.5\big)^2 下降,因此力矩过大时,行走甚至可能比完全没有力矩更费力。时机项很宽:峰值偏离最佳时刻达步态周期的 4%,已适应的行走者只损失约 3.7 个百分点,小于单次估计的噪声。

适应会使这三个量都发生变化。行走者的适应程度为 a(t)=1−e−t/36a(t) = 1 - e^{-t/36},在 108 分钟时达到 95%。幅度从新手的 A=0.135A = 0.135 增长到熟练者的 0.390.39,最佳峰值时刻移动步态周期的 2.4% 至 4.8%,最佳力矩从每千克体重约 0.45 N·m 上升到约 0.85 N·m,速度是其余各项的一半。每位行走者都有各自的 T⋆T^\star 和 P⋆P^\star,随机抽取。通用设置(generic setting)对所有人相同,位于力矩 0.6、峰值时刻 45% 处。

表 24.2 列出了这些数值的校准依据。

表 24.2 模拟行走者和各调节方式的校准依据。上面几行是所引研究中的测量值;最后几行是没有已发表数值可依的假设。
量 已发表的值 模拟中
训练前,通用设置的降幅 10%(Poggensee 与 Collins,2021) 在 t=0t = 0 时,对图中可能抽到的所有行走者平均为 10.0%
训练后,通用设置的降幅 31%(Poggensee 与 Collins,2021) 对图中可能抽到的所有已适应行走者平均为 31.2%(对第 24.3.3 节的 40 位行走者,均值为 32.1%,中位数为 32.9%)
训练后,定制助力的降幅 39%(Poggensee 与 Collins,2021) 每位已适应行走者在其最优点处均为 39%
成为熟练用户所需的时间 约 109 分钟;最佳峰值力矩增长得更慢(Poggensee 与 Collins,2021) 108 分钟时适应 95%;最佳力矩的适应速度为一半
两分钟代谢估计的噪声 标准差 4.6%(Kutulakos 与 Slade,2024) 高斯噪声,标准差 0.046
两个参数的范围 峰值力矩为每千克体重 0 至 1 N·m(Slade 等,2022);峰值时刻为步态周期的 35% 至 55%(Kutulakos 与 Slade,2024) 相同
每个自调设置所用的时间 18.7 秒(Schäfer 等,2026) 相同
CMA-ES 的设置 每代 4+⌊3ln⁡N⌋4 + \lfloor 3 \ln N \rfloor 个,初始步长为范围的 30%(Kutulakos 与 Slade,2024) N=2N = 2 时每代 6 个,步长 0.3
贝叶斯优化的设置 Matérn 核,探索常数为 2.6 的置信界,探索较少的变体取 0.93(Kutulakos 与 Slade,2024) 相同
新手可能达到的最佳降幅 未找到 t=0t = 0 时为 13.5%(设定为使通用设置给出 10%)
穿戴者的感受 未找到 见下文
凭感受比较两个设置所用的时间 未找到 37.4 秒,两个设置各 18.7 秒

感受信号是模型中最不确定的部分。穿戴者感受到的费力程度,等于代谢消耗 1−R1 - R 加上对高力矩的反感 0.1 (1−aT) x120.1\,(1 - a_T)\,x_1^2;这种反感随行走者的适应而消退(aTa_T 是力矩较慢的适应程度)。这种反感反映了一种已测得的倾向:踝关节外骨骼的新手用户随实验推进而偏好更大的力矩(Ingraham 等,2022);但其大小是人为设定的。每次读取感受到的费力程度都带有标准差为 0.03 的高斯噪声,两次读数之差小于 0.025 时报告为“差不多”。这两个数值是假设;不过这类感知下限确实存在:行走时踝关节外骨骼的刚度,可觉察的最小变化经测量约为 42%(Maberry 与 Martin,2026)。

24.3.2 四种调节方式 #

四种调节方式作用于这一行走者,各自使用一个全新的副本,行走时间相同。

  • 你,手动调节。你选择一个设置,行走者试走 18.7 秒,然后告诉你与上一个设置相比,感觉更轻松、更吃力还是差不多。你始终看不到任何数值。
  • 贝叶斯优化,基于两分钟代谢估计。使用 Matérn 5/2 核的高斯过程对测得的代谢率建模;在四个分散的起始设置之后,下一个设置取使下置信界 μ(x)−2.6 σ(x)\mu(\vx) - 2.6\,\sigma(\vx) 最小之处,这是第 12.4 节中上置信界在最小化问题中的对应形式;推荐的是后验均值最低的设置。
  • CMA-ES,基于同样的估计,每代六个设置,从正方形的中心出发,推荐的是当前的均值。
  • 偏好贝叶斯优化(第 19 章),基于行走者的感受。每次查询是由 EUBO 选出的一对设置(第 19.4 节);行走者把两个设置都试一遍,说出哪一个感觉更轻松;一次比较需要 37.4 秒。推荐的是已比较设置中后验均值效用最高的一个。

在 24 分钟内,这相当于手动尝试 77 个设置、38 次比较或 12 次代谢估计,对 CMA-ES 而言即两代。

0.0350.25400.5450.75501.055峰值力矩(N·m,按每千克体重计)峰值时刻(步态周期的 %)已用行走时间:0.0 / 24 分钟 · 已试 0 个设置按“行走”试一试起始设置。
0.0350.25400.5450.75501.055峰值力矩峰值时刻(步态周期的 %)已用行走时间:0.0 / 24 分钟 · 已试 0 个设置按“行走”开始。
图 24.2 亲自调节一位模拟行走者。这是校准过的模拟,不是数据:行走者的响应遵循式(24.1),采用表 24.2 中的已发表数字(10%、31% 和 39% 的降幅,约 109 分钟的适应期,4.6% 的测量噪声,每个设置 18.7 秒),行走者的感受则是假设。用滑块或点击设置图设定峰值力矩和峰值时刻,按“行走”,读出这个设置与上一个相比的感受(绿色:更轻松;红色:更吃力;灰色:差不多)。按“完成”后,滑块上的设置被保留,图中揭示此刻的真实地形(颜色越深,代谢降幅越大),并让三种优化器在同一行走者的全新副本上以相同的行走时间运行。表格给出每个最终设置的真实代谢降幅:此刻的值,以及(对初次使用装置的行走者)完全适应后的值。“换一位行走者”会抽取一个新的人。

可以尝试以下几点。用五至十分钟的行走时间(约十五至三十个设置)调节默认的行走者(初次使用装置),保留你认为可靠的设置。多数读者会和下图中的模拟人得到相同的体会:大的偏差很容易感觉到,也很容易纠正;接近尾声时,几乎每次改变都感觉“差不多”。然后把表中你的那一行与其他各行比较,并用“显示谁的轨迹”查看每种优化器把评估花在了何处。切换到“已经适应”再调一次:降幅更大,地形更陡,感觉也更分明。最后,在新手身上进行 48 分钟的会话,并用完全部时间:调节过程中行走者的最优点在移动,结束时的最佳力矩已不同于开始时的最佳力矩。

对于没有鼠标等指点设备或缺乏耐心的读者,按钮“让模拟的人来调”会运行一个简单的自调者:它从通用设置出发,一次改变一个参数,只有感觉更轻松时才保留改变,连续失败后缩小步长。下图显示它在默认行走者上的一次会话。

0.0350.25400.5450.75501.055峰值力矩(N·m,按每千克体重计)峰值时刻(步态周期的 %)已用行走时间:10.9 / 24 分钟 · 已试 35 个设置行走 10.9 分钟后的真实代谢降幅调节方式已试现在适应后模拟的人(凭感觉)3520.0%29.6%贝叶斯优化(代谢)518.3%24.1%CMA-ES(代谢)519.6%28.2%偏好贝叶斯优化(感觉)17×218.9%27.5%通用设置018.9%31.2%可能的最优值20.2%39.0%此刻的最优设置;浅色:适应后的最优设置
0.0350.25400.5450.75501.055峰值力矩峰值时刻(步态周期的 %)已用行走时间:10.9 / 24 分钟 · 已试 35 个设置10.9 分钟后的代谢降幅调节方式已试现在适应后模拟的人(凭感觉)3520.0%29.6%贝叶斯优化(代谢)518.3%24.1%CMA-ES(代谢)519.6%28.2%偏好贝叶斯优化(感觉)17×218.9%27.5%通用设置018.9%31.2%可能的最优值20.2%39.0%此刻的最优设置;浅色:适应后的最优设置
图 24.3 一次已完成的会话,完全是模拟的。正文中的模拟人对默认行走者(初次使用装置)调节了 10.9 分钟,即 Schäfer 等人(2026)中的平均时长,共尝试 35 个设置;圆点的颜色表示每个设置相对前一个的感受。星形是保留的设置;正方形、三角形和菱形分别是贝叶斯优化(5 次代谢估计)、CMA-ES(5 次估计,不足一代,因此仍停在中心的起点)和偏好贝叶斯优化(17 次感受比较)在同样 10.9 分钟之后的最终设置;虚线圆圈是通用设置。叉号是行走者此刻的代谢最优点,浅色叉号是适应后的最优点。行走者所依据的已发表数字见表 24.2。

请看图中的表格。10.9 分钟后,行走者可能达到的最佳降幅为 20.2%;四种调节方式分别达到 20.0%(手动)、18.3%(贝叶斯优化)、19.6%(CMA-ES,尚未完成一代,仍推荐其起点)和 18.9%(偏好),未经调节的通用设置为 18.9%。各调节方式之间的差别,以及它们与完全不调节之间的差别,都小于两个百分点。每次代谢估计有 4.6 个百分点的噪声,真实实验要区分这些差别,每个设置需要几十轮评估行走(习题 24.1)。

最后一列的结果令人不安。按行走者适应后的状态评判,这次会话找到的设置带来 24% 至 30% 的降幅,而未经调节的通用设置带来 31.2%。这次会话是为尚不能利用较大力矩的新手调节装置,而适应后的行走者需要大得多的力矩:图中浅色叉号位于力矩 0.88 处,四种调节方式的设置则在 0.35 至 0.5 之间。

24.3.3 多位行走者 #

一位行走者只是个例。在 40 位模拟行走者上运行同样的四种调节方式,对已经适应、因而地形保持不变的行走者,中位数如下。12 分钟后,贝叶斯优化的降幅达到 38.2%,偏好贝叶斯优化为 37.9%,模拟自调者为 37.8%,CMA-ES 为 35.9%;可能的最优值为 39.0%,通用设置为 32.9%。六分钟时,自调者和偏好优化器已达到 37.5%,而此时贝叶斯优化只有三次估计,降幅为 32.7%。CMA-ES 约在 48 分钟后达到 37%,此后保持在这一水平附近。

由此可见,对于保持不变的行走者,除进化策略外,各方法都能在一刻钟内弥补通用设置与最优点之间约六个百分点差距中的大部分;利用穿戴者感受的两种调节方式最先达到,因为在一次代谢估计所需的时间内,它们能测试六个设置。这与研究报告的结果在性质上一致:自调用时约十一分钟(Schäfer 等,2026),两个参数的贝叶斯优化用时约二十一分钟(Ding 等,2018)。这一结论还依赖于一个假设:已适应的穿戴者的感受指向代谢最优点。模拟做出了这一假设,研究却不能保证它成立。

第 24.3 节引用的文献 7
  1. Poggensee 与 Collins(2021)How adaptation, training, and customization contribute to benefits from exoskeleton assistance
  2. Kutulakos 与 Slade(2024)Simulating human-in-the-loop optimization of exoskeleton assistance to compare optimization algorithm performance
  3. Slade 等人(2022)Personalizing exoskeleton assistance while walking in the real world
  4. Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
  5. Ingraham 等人(2022)The role of user preference in the customized control of robotic exoskeletons
  6. Maberry 与 Martin(2026)Just Noticeable Difference of Impedance Parameters While Walking in an Ankle Exoskeleton
  7. Ding 等人(2018)Human-in-the-Loop Optimization of Hip Assistance with a Soft Exosuit during Walking

24.4 人在适应时 #

高斯过程后验把每个观测都视为对同一个固定函数的读数(第 8 章)。而正在学习使用装置的行走者,每隔几分钟就成为一个不同的函数。前十分钟的测量描述的是一个此后已经改变的人,却仍以完全的权重留在数据中。

这一问题的重要性有多方面的证据。Poggensee 与 Collins(2021)中的 109 分钟远长于一次调节会话。人在遇到外骨骼的新行为时,步频、踝关节角度和肌肉活动的变异性先升后降,不同变量的时间尺度各不相同(Abram 等,2022)。偏好也会变化:新手用户随实验推进而偏好更大的力矩(Ingraham 等,2022)。在 Kutulakos 与 Slade(2024)的预印本中,作者在 80 次评估内把一名被试的拟合地形逐渐过渡为另一名被试的地形,以此模拟新手;在固定地形上约 60 次评估即收敛的贝叶斯优化因这一变化而变慢,而 CMA-ES 无论有无这一变化,到达最优点的速度都相近。

下图在本章的行走者上重复了这一实验。

当前推荐的代谢降幅(%,按行走者在该分钟的状态评判)010203040020406080100120辅助行走的分钟数可能的最优值通用设置贝叶斯优化(代谢)CMA-ES(代谢)模拟的自调者偏好贝叶斯优化(感觉)
代谢降幅(%),行走者此刻的状态0102030400306090120辅助行走的分钟数可能的最优值通用设置贝叶斯优化(代谢)CMA-ES(代谢)模拟的自调者偏好贝叶斯优化(感觉)
图 24.4 模拟中适应对各调节方式的影响。此处没有任何数据是测量所得:40 位遵循式(24.1)的模拟行走者,按表 24.2 校准,每种方法对每位行走者各调节一次(会话由 tools/figure-data/cs-exo-race.ts 预先计算)。每条线表示某种调节方式当前的推荐逐分钟能带来的真实代谢降幅,取各行走者的中位数;色带是贝叶斯优化和自调者的四分位距。“评判设置所用的行走者”决定在哪位行走者身上检验推荐:该分钟时的行走者,或完全适应后的行走者,后者才是将来使用装置的人。虚线是可能的最佳降幅,点线是通用设置。偏好优化器只运行了 60 分钟。

从图中可以看出三点。

适应的作用大于调节。对新手按逐分钟的状态评判时,所有线一同上升,前十分钟之后彼此相差在约两个百分点以内。24 分钟时,可能的最佳降幅为 25.9%,各调节方式在 23.2% 至 23.6% 之间,未经调节的通用设置为 23.3%。60 分钟时,各调节方式在 31.4% 至 32.5% 之间,通用设置为 31.3%。使这些线从 15% 升至 35% 的,是行走者自身的学习。模拟以此再现了其校准所依据的发现:训练贡献了约一半的收益,定制约占四分之一(Poggensee 与 Collins,2021)。

早期调好的设置日后会过时。把评判对象切换为“适应后的行走者”。24 分钟后推荐的设置,在适应后的行走者身上带来 26.3% 至 31.1% 的降幅,低于通用设置的 32.9%:优化器忠实地为新手找到了低力矩的设置。中位数越过通用设置,贝叶斯优化要到 56 分钟之后,CMA-ES 要到 60 分钟之后,自调者要到 62 分钟之后;偏好贝叶斯优化在其运行的一小时内始终没有越过。对新用户进行一次短时调节,可能使其日后的效果反而不如完全不调节。

调节方式如何处理旧数据至关重要,而结果未必符合预期。打开“显示贝叶斯优化的变体”。把每次测量的时间作为第三个输入提供给高斯过程,使旧测量对当前预测的影响减小,这是漂移最简单的模型(第 46.5 节)。这种做法在已适应的行走者上略有损失,在新手上则有帮助:120 分钟时,在适应后的行走者身上,降幅为 36.9%,普通模型为 35.2%。减少探索,即把探索常数从 2.6 降到 0.93,在这里反而有害:这一变体最终停在 31.8%,低于通用设置,因为它不断回到对新手最好的区域。Kutulakos 与 Slade(2024)在他们的地形上得到相反的结果:对于模拟的新手,探索较少的变体约在 100 次评估时到达最优点,默认变体则更慢。作者推测(但未加检验),这是因为该变体在估计的最优点附近频繁评估,从而能够跟随移动的最优点;而在 12 个和 20 个参数的固定地形上,同一变体停在了较差的设置上。两项模拟中地形的移动方式不同,而且都不是实验;这种分歧说明,应当针对手头的问题检验探索常数,先用模拟,再用试点会话,那些作者也这样建议。CMA-ES 和自调者不保留长期记忆,无需任何调整就能跟上变化。

实践者应当如何应对?第 46.5 节中的建议正是由此得出:调节开始之前,先让人穿着装置行走一段时间;降低早期测量的权重,或显式地对时间建模;之后再重新调节。一篇关于髋外骨骼的预印本以步行速度为优化目标,有 16 名被试、三个参数,报告称专为变化的响应设计的贝叶斯优化器在有效性、模型准确度和个性化方面都优于标准优化器(Kim 与 Sergi,2026)。对于偏好,同一问题尚无经过检验的解决方案:截至 2026 年 9 月,我们没有找到任何带有效用漂移模型的偏好优化方法(第 29.10 节),而图中的偏好优化器恢复得最慢。

第 24.4 节引用的文献 5
  1. Poggensee 与 Collins(2021)How adaptation, training, and customization contribute to benefits from exoskeleton assistance
  2. Abram 等人(2022)General variability leads to specific adaptation toward optimal movement policies
  3. Ingraham 等人(2022)The role of user preference in the customized control of robotic exoskeletons
  4. Kutulakos 与 Slade(2024)Simulating human-in-the-loop optimization of exoskeleton assistance to compare optimization algorithm performance
  5. Kim 与 Sergi(2026)Validation of Dynamic Bayesian Optimization for Human-in-the-Loop Optimization of Exoskeleton Control at User-Driven Walking Speed

24.5 与自调对比 #

模拟自调者只是十几行不含模型的代码,而在上面的图中,它与各优化器不相上下。这与文献中最有信息量的比较相吻合。在 Schäfer 等人(2026)中,11 名此前没有外骨骼使用经验的人用拇指杆遥控器调节四个髋部时机参数,用时 10.9 ± 0.9 分钟,所得助力使其代谢率相对零力矩降低了 16.6 ± 1.1%。按作者自己的比较,这一用时是 Ding 等人(2018)对两个参数所做优化的四分之一,是该优化收敛所需时间的一半。在 Ingraham 等人(2022)中,24 人在看不到参数值时调节踝关节力矩和时机,每次试验 105 秒即收敛,重复自己的选择时,标准差为 1.7 N·m 和步态周期的 1.5%。第 33.3 节讨论了这些研究,以及将其与使用其他装置和基线的优化器研究相比较时的注意事项。

模拟揭示了其中的原因;这些原因与其说是某种算法的性质,不如说是问题本身的性质。

穿戴者的感知很快。一次感受比较只需几秒钟;一次代谢估计需要两分钟,而且仍有噪声。相同的行走时间内,手动调节能尝试的设置数是代谢估计的六倍。

最优点附近很平坦。在最佳设置附近,降幅的变化既小于测量噪声,也小于人能感觉到的程度。在 Schäfer 等人(2026)中,把某个时机参数移动至多 ±8% 的跨步时间,代谢降幅并无显著变化。粗略而快速的搜索与精确的搜索相比,几乎没有损失。

参数很少。只有两至四个参数时,一次改变一个参数是可行的。但这里没有任何证据表明,二十个参数时同样可行。

模拟还显示了自调在哪些地方出错;偏好优化出错的地方与之相同,因为两者依据的是同一信号。

感受到的不等于测量到的。模拟的新手不喜欢力矩,因此凭感觉调节,无论手动还是借助偏好贝叶斯优化,最终的力矩都低于代谢最优点。对真实的穿戴者,偏好与代谢消耗之间的差距在两个方向上都有记录:Schäfer 等人(2026)中调节髋外骨骼的被试并未停在代谢最小值处;假肢使用者偏好的踝关节刚度使假肢与健侧关节的运动对称,而与代谢率没有显著关系(Clites 等,2021)。装置应服务于两者中的哪一个,是关于目标函数的决定,应在任何调节之前做出。

低于感知下限时,比较只是噪声。一旦每次改变都感觉“差不多”,继续凭感觉调节就成了随机游走。这一下限可以测量,行走时外骨骼刚度的感知下限约为 42%(Maberry 与 Martin,2026),由此可以得到一个有原则的停止提问的时机(推断;第 46.6 节的停止规则尚未包含这一条)。

人自身的选择并不一致。三位截肢者探索动力假肢的设置时,其中两位在同一天的不同试验中选择了不同的设置(Díaz 等,2026)。

这对方法意味着什么?第一,手动调节是偏好优化器必须超越的基线,第 46.1 节把检查这一基线列为构建偏好优化器之前要问的第三个问题。目前还没有研究在同一批人身上、以相同的时间预算和事先确定的终点比较过这两种方式;第 47.4 节描述了这样的实验,本章的图就是它的模拟,但需注意模拟本身的局限:感受信号是我们编写的。第二,模拟遗漏了许多对穿戴者重要的因素。除一个惩罚项外,它不考虑舒适度,也没有安全性、疲劳和能动感;在 Schäfer 等人(2026)中,开启助力后,能动感在 0 至 1 的量表上从 0.80 降至 0.49,尽管助力是被试自己选择的。此外,模拟中的行走者都是健康成年人,与其所依据的研究中几乎所有被试一样(第 33.1.4 节)。

要点本案例为算法补充了什么

在这个问题中,优化器的选择是所有决定中影响最小的一个。评估的形式(两分钟带噪声的呼吸测量,还是几秒钟的感受)、调节的时机(在人学会使用装置之前还是之后),以及装置应服务的目标(测得的费力程度还是偏好),每一项对结果的影响都超过贝叶斯优化、进化策略与细致的手动调节之间的差别。

下一章(第 25 章)完全去掉了测量仪器:唯一的测量是人在一张照片的两个版本之间做出的选择。

第 24.5 节引用的文献 6
  1. Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
  2. Ding 等人(2018)Human-in-the-Loop Optimization of Hip Assistance with a Soft Exosuit during Walking
  3. Ingraham 等人(2022)The role of user preference in the customized control of robotic exoskeletons
  4. Clites 等人(2021)Understanding patient preference in prosthetic ankle stiffness
  5. Maberry 与 Martin(2026)Just Noticeable Difference of Impedance Parameters While Walking in an Ankle Exoskeleton
  6. Díaz 等人(2026)User preference in the personalized control of an ankle prosthesis: a case study

24.6 习题 #

习题 24.1

两分钟代谢估计的标准差为 4.6 个百分点,两个设置实际相差 3 个百分点。按常用标准,即显著性水平 5%、统计功效 80% 的双侧检验(差异不存在时,只在 5% 的实验中报告差异;差异真实存在时,在 80% 的实验中报告差异),每个设置需要行走多少轮才能检测出这一差异?这相当于多少分钟的行走?对 8 个百分点的差异重复计算,这是 Poggensee 与 Collins(2021)中通用助力与定制助力之间的差距。

解答

两组各有 nn 个独立估计时,均值之差的标准差为 σ2/n\sigma\sqrt{2/n}。在 5% 水平、80% 功效下检测差异 Δ\Delta,需要 Δ≥(1.96+0.84) σ2/n\Delta \ge (1.96 + 0.84)\,\sigma\sqrt{2/n},其中 1.96 是绝对值被超过的概率为 5% 的标准正态分位数,0.84 是被超过的概率为 20% 的分位数,因此 n≥2⋅2.82⋅(σ/Δ)2=15.7 (σ/Δ)2n \ge 2 \cdot 2.8^2 \cdot (\sigma/\Delta)^2 = 15.7\,(\sigma/\Delta)^2。取 σ=4.6\sigma = 4.6、Δ=3\Delta = 3:n≥36.9n \ge 36.9,即每个设置 37 轮,共 74 轮,行走 148 分钟。取 Δ=8\Delta = 8:n≥5.2n \ge 5.2,即每个设置 6 轮,共 24 分钟。8 个百分点的差距可以在一次会话中确认;图 24.3 中各调节方式之间不到两个百分点的差距则不能,而且在这 148 分钟里,新用户早已完成了适应(第 24.1.4 节)。

习题 24.2

一次会话持续 24 分钟。统计第 24.3.2 节中四种调节方式各能获得多少观测。CMA-ES 更新其分布多少次?为什么这能解释它在图 24.4 中起步缓慢?为什么同一性质在行走者适应时又保护了它?

解答

手动:24⋅60/18.7=7724 \cdot 60 / 18.7 = 77 个设置。偏好:24⋅60/37.4=3824 \cdot 60 / 37.4 = 38 次比较。代谢估计:24/2=1224 / 2 = 12 次,贝叶斯优化和 CMA-ES 相同。CMA-ES 每代六个设置,可完成两代,因此更新均值两次,第一次在 12 分钟之后。在此之前,它的推荐就是起点。贝叶斯优化则在每次估计之后重新拟合模型。使 CMA-ES 起步缓慢的性质,即每一代只使用一次便丢弃,也意味着行走者作为新手时的测量,一小时后不会再误导它:除了通过这些测量所产生的均值和协方差之外,它的状态中不保留任何早于一代的信息。

习题 24.3

模拟中,每次感受读数带有标准差为 0.03 的高斯噪声;前一次读数比新读数大 0.025 以上时,变化报告为“更轻松”。某个变化实际使感受到的费力程度降低 0.02(两个百分点)。这一变化被报告为更轻松、差不多和更吃力的概率各是多少?正文中的简单自调者在每种情况下如何处理?

解答

两次读数之差服从均值为 0.02、标准差为 0.032=0.04240.03\sqrt{2} = 0.0424 的高斯分布。更轻松:P(d>0.025)=1−Φ((0.025−0.02)/0.0424)=1−Φ(0.118)≈0.45\Prob(d > 0.025) = 1 - \Phi\big((0.025 - 0.02)/0.0424\big) = 1 - \Phi(0.118) \approx 0.45。更吃力:P(d<−0.025)=Φ((−0.025−0.02)/0.0424)=Φ(−1.06)≈0.14\Prob(d < -0.025) = \Phi\big((-0.025 - 0.02)/0.0424\big) = \Phi(-1.06) \approx 0.14。差不多:其余的 0.400.40。自调者只在第一种情况下保留这一改变,因此它丢弃真实的两个百分点改进的次数多于接受的次数,而每次拒绝都要花费两个设置(一次试验,一次返回)。两个百分点的改进,既超出了穿戴者的感知能力,也超出了单次代谢估计的分辨能力,这正是从两个方面看到的平坦最优点。

习题 24.4

幅度和峰值时刻采用 a(t)=1−e−t/36a(t) = 1 - e^{-t/36},力矩采用 aT(t)=1−e−t/72a_T(t) = 1 - e^{-t/72},计算 24 分钟会话之后的适应程度。某位行走者的最佳力矩在新手时为 0.45,熟练后为 0.86。24 分钟后最佳力矩是多少?对于在这次会话中调得完美的设置,这一答案意味着什么?

解答

a(24)=1−e−2/3=0.49a(24) = 1 - e^{-2/3} = 0.49,aT(24)=1−e−1/3=0.28a_T(24) = 1 - e^{-1/3} = 0.28。最佳力矩为 0.45+0.28⋅(0.86−0.45)=0.570.45 + 0.28 \cdot (0.86 - 0.45) = 0.57。在 24 分钟时调得完美的设置,力矩为 0.57,而适应后行走者的最佳力矩为 0.86。在适应后的行走者身上,该设置的力矩项为 1−((0.57−0.86)/0.86)2=0.891 - \big((0.57 - 0.86)/0.86\big)^2 = 0.89,因此即使时机完美,降幅也只有约 0.39⋅0.89=34.6%0.39 \cdot 0.89 = 34.6\%,而可能达到的是 39%。这次会话优化的对象,是一个刚把装置学到一半的人。

第 24.6 节引用的文献 1
  1. Poggensee 与 Collins(2021)How adaptation, training, and customization contribute to benefits from exoskeleton assistance

延伸阅读 #

参考文献

  1. Abram, S. J., Poggensee, K. L., Sánchez, N., Simha, S. N., Finley, J. M., Collins, S. H., and Donelan, J. M. (2022). General variability leads to specific adaptation toward optimal movement policies. Current Biology. 引用于 §24.4
  2. Clites, T. R., Shepherd, M. K., Ingraham, K. A., Wontorcik, L., and Rouse, E. J. (2021). Understanding patient preference in prosthetic ankle stiffness. Journal of NeuroEngineering and Rehabilitation. 引用于 §24.5
  3. Díaz, M. A., Nuzzo, S., Flynn, L., Beckerle, P., Verstraten, T., and De Pauw, K. (2026). User preference in the personalized control of an ankle prosthesis: a case study. Journal of NeuroEngineering and Rehabilitation. doi:10.1186/s12984-026-01931-w. 引用于 §24.5
  4. Ding, Y., Kim, M., Kuindersma, S., and Walsh, C. J. (2018). Human-in-the-Loop Optimization of Hip Assistance with a Soft Exosuit during Walking. Science Robotics. 引用于 §24.1 §24.2 §24.3 §24.5
  5. Hansen, N., and Ostermeier, A. (2001). Completely Derandomized Self-Adaptation in Evolution Strategies. Evolutionary Computation. 引用于 §24.2
  6. Ingraham, K. A., Remy, C. D., and Rouse, E. J. (2022). The role of user preference in the customized control of robotic exoskeletons. Science Robotics. 引用于 §24.2 §24.3 §24.4 §24.5
  7. Kim, G., and Sergi, F. (2026). Validation of Dynamic Bayesian Optimization for Human-in-the-Loop Optimization of Exoskeleton Control at User-Driven Walking Speed. bioRxiv. 预印本引用于 §24.4
  8. Kutulakos, Z., and Slade, P. (2024). Simulating human-in-the-loop optimization of exoskeleton assistance to compare optimization algorithm performance. bioRxiv. 预印本引用于 §24.1 §24.2 §24.3 §24.4
  9. Lee, U. H., Shetty, V. S., Franks, P. W., Tan, J., Evangelopoulos, G., Ha, S., and Rouse, E. J. (2023). User preference optimization for control of ankle exoskeletons using sample efficient active learning. Science Robotics. 引用于 §24.2
  10. Liu, X.-Y., Li, G., Wang, W., and Hou, Z.-G. (2026d). Personalized Lower-limb Exoskeleton Assistance via Preference-based Bayesian Optimization. arXiv. 预印本引用于 §24.2
  11. Maberry, A., and Martin, A. E. (2026). Just Noticeable Difference of Impedance Parameters While Walking in an Ankle Exoskeleton. IEEE Transactions on Neural Systems and Rehabilitation Engineering. 引用于 §24.3 §24.5
  12. Poggensee, K. L., and Collins, S. H. (2021). How adaptation, training, and customization contribute to benefits from exoskeleton assistance. Science Robotics. 引用于 §24.1 §24.2 §24.3 §24.4 §24.6
  13. Schäfer, N., Zhao, G., Li, B., Kupnik, M., Seyfarth, A., Beckerle, P., and Grimmer, M. (2026). User preference-based human-in-the-loop tuning of exoskeleton assistance during walking. npj Biomedical Innovations. doi:10.1038/s44385-026-00085-7. 引用于 §24.1 §24.2 §24.3 §24.5
  14. Selinger, J. C., and Donelan, J. M. (2014). Estimating instantaneous energetic cost during non-steady-state gait. Journal of Applied Physiology. 引用于 §24.1
  15. Slade, P., Kochenderfer, M. J., Delp, S. L., and Collins, S. H. (2022). Personalizing exoskeleton assistance while walking in the real world. Nature. 引用于 §24.1 §24.2 §24.3
  16. Tucker, M., Cheng, M., Novoseller, E., Cheng, R., Yue, Y., Burdick, J. W., and Ames, A. D. (2020a). Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits. IROS 2020. 引用于 §24.2
  17. Tucker, M., Novoseller, E., Kann, C., Sui, Y., Yue, Y., Burdick, J. W., and Ames, A. D. (2020b). Preference-Based Learning for Exoskeleton Gait Optimization. 2020 IEEE International Conference on Robotics and Automation (ICRA). 引用于 §24.2
  18. Zhang, J., Fiers, P., Witte, K. A., Jackson, R. W., Poggensee, K. L., Atkeson, C. G., and Collins, S. H. (2017). Human-in-the-loop optimization of exoskeleton assistance during walking. Science. 引用于 §24.1 §24.2