贝叶斯优化的用武之地
前四章构建了一种方法,本章讨论这一方法在哪些场合物有所值。贝叶斯优化在大多数问题上并不是最好的优化器:如果目标函数可以评估一百万次,或者可以计算梯度,更简单的工具效果更好。贝叶斯优化只在特定的条件组合下才有回报,而采用它的领域,正是这种条件组合常见的领域。
本章是一次概览,而不是一组完整的例题。第五部分完整演示了四个问题:为分类器调参(第 22 章)、优化化学反应(第 23 章)、人在回路中调节外骨骼(第 24 章)以及通过比较增强照片(第 25 章)。本章对每个领域只用几段篇幅,说明一次评估是什么、该领域为何适合或不太适合,以及已发表的结果表明了什么。概览以人结束:此时评估是人的判断,本书的下一部分也从这里开始。最后一节说明贝叶斯优化在最常与之混淆的几类方法中所处的位置。
15.1 何时值得使用 #
以下四个条件成立时,贝叶斯优化的额外开销才值得付出。
- 评估代价高昂。每次评估都要耗费几分钟、几小时、金钱、材料或人的耐心,因此预算是几十或几百次评估,而不是几百万次。此时拟合模型和最大化采集函数的开销(几秒钟)可以忽略不计。
- 没有梯度,也没有解析式。目标函数是黑箱:一次训练、一次实验、一次仿真或一次判断。
- 输入很少,或起作用的输入很少。标准方法至多可处理约二十个输入,借助第 14.6 节的技术还可以更多。
- 噪声在可容忍的范围内,函数具有一定的规律性。相近的输入给出相近的输出,因此模型能从少量评估中推广。
其中某一条不成立时,通常由某种相邻方法接替(第 15.8 节)。表 15.1 列出了这些条件成立的应用,以及每个应用中一次评估的内容和所引研究报告的结果。
| 问题 | 一次评估是 | 研究报告的结果 | 来源 |
|---|---|---|---|
| 为围棋程序 AlphaGo 调参 | 一组自我对弈对局 | 赛前自我对弈胜率从 50% 升至 66.5% | Chen 等人(2018)(预印本) |
| 化学反应的条件 | 一次反应,五个一批 | 平均效率与一致性均优于 50 名化学与工程领域的专家 | Shields 等人(2021) |
| 光催化剂混合物 | 一次由机器人执行的实验 | 8 天内在 10 个变量的空间中完成 688 次实验;混合物活性为原来的 6 倍 | Burger 等人(2020) |
| 电池快充协议 | 一次循环测试,借助早期预测缩短 | 16 天内从 224 个候选中找到高循环寿命的协议 | Attia 等人(2020) |
| 四足机器人的步态 | 一次行走试验 | 所需步态评估次数比局部梯度方法少得多 | Lizotte 等人(2007) |
| 四旋翼飞行器的控制器 | 一次飞行 | 安全、自动地完成调节,无需人工干预 | Berkenkamp 等人(2016) |
| 自由电子激光器的磁铁 | 一次束流测量 | 显著优于该装置现有的优化器 | Duris 等人(2020) |
| Facebook 的一个排序系统 | 一次随机化在线实验 | 在线上实验中得到演示;在带噪声、有约束的合成问题上优于现有方法 | Letham 等人(2019) |
| 柔性外骨骼服的助力时序 | 几分钟的行走,测量能量消耗 | 21.4 ± 1.0 分钟内找到最优值;代谢消耗降低 17.4 ± 3.2% | Ding 等人(2018) |
| 一份曲奇配方 | 烤一批,由品尝者打分 | “曲奇随着时间推移有了显著改进” | Golovin 等人(2017) |
第 15.1 节引用的文献 10
- Chen 等人(2018)Bayesian Optimization in AlphaGo
- Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis
- Burger 等人(2020)A Mobile Robotic Chemist
- Attia 等人(2020)Closed-Loop Optimization of Fast-Charging Protocols for Batteries with Machine Learning
- Lizotte 等人(2007)Automatic Gait Optimization with Gaussian Process Regression
- Berkenkamp 等人(2016)Safe Controller Optimization for Quadrotors with Gaussian Processes
- Duris 等人(2020)Bayesian Optimization of a Free-Electron Laser
- Letham 等人(2019)Constrained Bayesian Optimization with Noisy Experiments
- Ding 等人(2018)Human-in-the-Loop Optimization of Hip Assistance with a Soft Exosuit during Walking
- Golovin 等人(2017)Google Vizier: A Service for Black-Box Optimization
15.2 超参数优化与自动机器学习 #
机器学习模型有一些训练过程本身不决定的设置:学习率、正则化强度、树的深度、层数。每个候选设置都要通过训练模型、在留出数据上测量误差来评估,耗时从几分钟到几天不等。正是这一应用让贝叶斯优化广为人知。Snoek 等人(2012)表明,只要核函数选择得当,并仔细处理模型自身的超参数,贝叶斯优化为卷积网络等模型调参的效果就能达到甚至超过人类专家。在此之前,Bergstra 与 Bengio(2012)已经表明,当只有少数几个超参数起作用时,随机搜索优于网格搜索;Bergstra 等人(2011)则提出了基于模型的序贯方法作为替代。此后的问题一直是:目标函数的模型相比随机采样究竟能多带来多少收益。
模型确有增益,这方面的证据相当广泛。NeurIPS 2020 举办的黑箱优化挑战赛在真实数据集上为标准机器学习模型调参,评分所用的目标函数不对参赛方公开;65 支队伍中有 61 支胜过随机搜索,最好的提交达到随机搜索的水平,所需评估次数不到后者的 1/100(Turner 等,2021)。据 AlphaGo 开发者 2018 年的一篇预印本,在这一围棋程序的开发过程中,其超参数多次用贝叶斯优化调节;其中一次在与 Lee Sedol 对弈之前,把自我对弈的胜率从 50% 提高到 66.5%(Chen 等,2018)。Google 的内部服务 Vizier 被其开发者称为“Google 事实上的参数调节引擎”,所提供的算法中包括贝叶斯优化(Golovin 等,2017)。
超参数优化只是更大范围自动化中的一步。自动机器学习(automated machine learning,AutoML)把算法的选择也视为一个超参数:Auto-WEKA 使用专为这类空间设计的贝叶斯优化方法,在 27 种基础分类器、它们的设置以及特征选择方法上联合搜索,这一空间包含大量类别型选择与条件选择(Thornton 等,2013)。条件空间(只有当算法是森林时,树的数量才有意义)是这类系统常常选用基于树的代理模型、而不选用高斯过程的原因之一(第 14.1.2 节)。
这一领域的两个特点塑造了第 14 章中的方法。一是评估代价差别极大,且有更便宜的近似可用,因此多保真度方法很重要(第 14.7.2 节);二是评估在集群上并行运行,因此批量方法很重要(第 14.3 节)。
这里也需要提醒一点:在小问题上,相对随机搜索的增益可能不大。第 22 章测量了一个双超参数问题的完整地形,发现贝叶斯优化与随机搜索达到的中位误差几乎相同;模型带来的是可靠性,中位数上的差距要到七个超参数时才显现(第 22.4 节)。
第 15.2 节引用的文献 7
- Snoek 等人(2012)Practical Bayesian Optimization of Machine Learning Algorithms
- Bergstra 与 Bengio(2012)Random Search for Hyper-Parameter Optimization
- Bergstra 等人(2011)Algorithms for Hyper-Parameter Optimization
- Turner 等人(2021)Bayesian Optimization is Superior to Random Search for Machine Learning Hyperparameter Tuning: Analysis of the Black-Box Optimization Challenge 2020
- Chen 等人(2018)Bayesian Optimization in AlphaGo
- Golovin 等人(2017)Google Vizier: A Service for Black-Box Optimization
- Thornton 等人(2013)Auto-WEKA: Combined Selection and Hyperparameter Optimization of Classification Algorithms
15.3 实验科学 #
实验室实验几乎天然满足上述四个条件:速度慢,消耗材料,结果无法求导,而且化学家一次只能改变少数几样东西,如催化剂、溶剂、温度、浓度。
化学。Shields 等人(2021)构建了一个用于优化反应条件的框架和开源工具,并用一种少有方法经受过的方式检验了它。他们为一个钯催化反应测量了大型基准数据集,然后请 50 名化学与工程领域的专家参与一个游戏:每人逐批选择实验,并得到测得的产率。贝叶斯优化在平均优化效率(所需实验次数)和一致性(结果的方差)两方面都胜过人的决策。第 23 章在已发表的数据上重演了这次优化,并仔细考察了与化学家的比较:化学家起步更好,后来被超越(第 23.4 节)。
自驱动实验室。由机器人执行实验、优化器无须等待人即可选出下一批实验,这样的装置称为自驱动实验室。Burger 等人(2020)使用了一台移动机器人,它在批量贝叶斯搜索的驱动下“自主运行了 8 天,在一个 10 变量的实验空间中完成了 688 次实验”,找到的光催化剂混合物活性是初始配方的 6 倍。Attia 等人(2020)把贝叶斯优化与一个预测模型结合起来,该模型根据电池最初几次循环预测其最终循环寿命;他们在 16 天内从 224 个候选中找出了高循环寿命的快充协议,而不做早期预测的穷举搜索需要 500 多天(习题 15.2 讨论这一比值能说明什么、不能说明什么)。
一般而言,增益有多大?Adesiji 等人(2026)定义了加速因子(acceleration factor):参照策略达到目标所需的实验次数除以优化器所需的实验次数。在 42 项研究、63 个自驱动实验室基准中,报告的加速因子中位数为 6,范围为 1.3 至 100。同一综述还发现,固定实验次数下的收益先随每个维度的实验次数增加而增长,在每个维度约 10 至 20 次实验时达到峰值。第 36.7 节讨论了这些度量,以及自动化实验中人所承担的工作,主要是监督(Kalinin 等,2024)。
人类专家的位置。专家掌握模型所不知道的知识,模型则具有专家所缺乏的耐心。在一项以受控虚拟游戏形式开展的半导体工艺开发研究中,人类工程师在早期阶段表现出色,而在接近目标的严格容差时,算法的成本效率高得多;先由专家、最后由算法接手的策略,与只靠专家相比,把达到目标的成本降低了一半(Kanarik 等,2023)。专家的输入并不总能带来增益:一篇 2025 年的预印本记录了一个工业案例,加入专家知识反而导致贝叶斯优化失败(Weichert 等,2025)。
第 15.3 节引用的文献 7
- Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis
- Burger 等人(2020)A Mobile Robotic Chemist
- Attia 等人(2020)Closed-Loop Optimization of Fast-Charging Protocols for Batteries with Machine Learning
- Adesiji 等人(2026)Benchmarking self-driving labs
- Kalinin 等人(2024)Human-in-the-loop: The future of Machine Learning in Automated Electron Microscopy
- Kanarik 等人(2023)Human–machine collaboration for improving semiconductor process development
- Weichert 等人(2025)When Less is More: A Story of Failing Bayesian Optimization Due to Additional Expert Knowledge
15.4 机器人与控制 #
机器人控制器的参数(增益、时序、轨迹形状)决定了机器人行走、飞行或抓取的效果。仿真器可以给出建议值,但最终的调节要在硬件上进行,每次试验都耗费时间、磨损机器,偶尔还会造成损坏。试验带有噪声,参数从几个到几十个不等。
步态优化是早期的成功案例。Lizotte 等人(2007)用高斯过程回归为一台四足机器人调节步态,分别以速度和平顺性为目标,所需的步态评估次数比当时使用的局部梯度方法少得多。他们指出了局部方法的三个缺点,而全局模型能消除这些缺点:局部方法会陷入局部最优,每一步之后丢弃之前的评估,而且不对噪声建模。Calandra 等人(2016)在仿真问题和真实机器人上比较了自动步态优化方法,得出结论:机器人学必须用少量实验找到好的参数,因此贝叶斯优化特别适合这一领域。
贝叶斯优化也可以作为更大系统的组成部分。Cully 等人(2015)让一台六足机器人在不到 2 分钟内适应损伤,例如一条腿折断或缺失。部署之前,机器人在仿真中建立了一张包含约 13,000 种高性能步态的地图;受损之后,它在这张地图上运行贝叶斯优化,以仿真性能作为先验。搜索空间由此从控制器参数的高维空间变为行为的低维空间;作者指出,在原始参数空间中运行标准贝叶斯优化,找不到可行的行为。
硬件带来了第 14.4.2 节中的约束:有些参数设置会使机器人损毁。Berkenkamp 等人(2016)用 SafeOpt 为四旋翼飞行器调节控制器,从一个安全但性能较差的控制器出发,只探索以高概率使性能保持在安全阈值之上的参数;调节过程安全、自动地完成,无需人工干预。参数更多、预算更大的问题可以使用信赖域方法(第 14.6.2 节)。
当机器人行为的好坏需要由人判断时(这种步态看起来自然吗?这副外骨骼舒适吗?),目标函数就是人的偏好,所用的方法是第四部分中的方法;第 33.6 节综述了这方面的工作。
第 15.4 节引用的文献 4
- Lizotte 等人(2007)Automatic Gait Optimization with Gaussian Process Regression
- Calandra 等人(2016)Bayesian Optimization for Learning Gaits under Uncertainty
- Cully 等人(2015)Robots That Can Adapt like Animals
- Berkenkamp 等人(2016)Safe Controller Optimization for Quadrotors with Gaussian Processes
15.5 工程设计 #
贝叶斯优化的现代形式源于工程。Jones 等人(1998)的高效全局优化算法针对的是这样的工程问题:评估次数受时间或成本的严格限制,通常是因为每次评估都是一次耗时很长的计算机仿真;基于代理模型的设计还有专门的工程教科书(Forrester 等,2008)。一次机翼绕流仿真可能需要几个小时;设计可能有十几个形状参数;还有一些约束(例如最大应力)与目标函数出自同一次仿真(第 14.4 节)。仿真也有更便宜、更粗糙的版本,这正是多保真度方法的适用场景(第 14.7.2 节)。
实体机器也以同样的方式调节。直线加速器相干光源(Linac Coherent Light Source)是一台自由电子激光器,每天要切换几次配置,每次都需要重新调节。Duris 等人(2020)用贝叶斯优化调节其成组的四极磁铁,所用高斯过程的参数由存档的扫描数据拟合,磁铁之间的相关性则来自一个简单的束流物理模型;这一流程显著优于该装置现有的优化器。这个例子体现了工程中常见的一种模式:核函数并非默认选项,而是编码了关于这台机器的已有知识。
第 15.5 节引用的文献 3
- Jones 等人(1998)Efficient Global Optimization of Expensive Black-Box Functions
- Forrester 等人(2008)Engineering Design via Surrogate Modelling: A Practical Guide
- Duris 等人(2020)Bayesian Optimization of a Free-Electron Laser
15.6 在线实验 #
互联网公司通过随机化实验调节产品:一部分用户看到版本 A,另一部分看到版本 B,然后比较结果。当各版本在连续参数(例如排序函数的权重)上不同时,实验就成为优化问题,每次评估都是一次在真实流量上运行数天的 A/B 测试。
这一场景从三个方面考验该方法。一是噪声大,因为用户行为的波动远大于版本之间的差异。二是评估成批到来,因为多个版本同时运行。三是存在约束:改进某项指标的版本,不能使其他指标变差。Letham 等人(2019)为这一场景提出了带噪声期望改进(第 14.2.2 节),并在 Facebook 的一个排序系统和一个服务器编译器的编译标志上做了演示。Ax 平台把这一方法封装起来,用于一般的自适应实验(Olson 等,2025)。
在线实验也是第 13.1 节中几种评分指标分道扬镳的场合。每个版本都展示给真实用户,因此差的版本在运行期间就会造成损失:累积遗憾很重要,而当版本集合小且固定时,问题就是赌博机问题(第 13.2 节)。此外,结果是多项指标而不是一项,因此必须有人规定它们之间如何权衡。偏好探索正是受这一问题启发而提出的,它通过比较学习决策者对预测结果的效用(Lin 等,2022)。截至 2026 年 9 月,我们没有找到在生产环境的 A/B 测试中量化偏好贝叶斯优化效果的公开报告;已知情况见第 34.3 节的回顾。
第 15.6 节引用的文献 3
- Letham 等人(2019)Constrained Bayesian Optimization with Noisy Experiments
- Olson 等人(2025)Ax: A Platform for Adaptive Experimentation
- Lin 等人(2022)Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes
15.7 人在回路 #
前面的应用中,数值都由仪器产生。在越来越多的应用中,人成为评估的一部分,方式有两种。
人是被优化的系统,结果由仪器测量。可穿戴机器人必须针对穿戴者调节,目标函数可以是生理指标。Ding 等人(2018)以行走的代谢消耗为目标,用贝叶斯优化调节一套柔性外骨骼服髋部助力的峰值时刻与结束时刻,平均在 21.4 ± 1.0 分钟内找到最优值,与不穿设备行走相比,代谢消耗降低了 17.4 ± 3.2%。评估既慢又有噪声:几分钟的行走才得到一次能量消耗的估计。此前,Kim 等人(2017)在一个更简单的任务(寻找使代谢消耗最小的步频)上比较了贝叶斯优化与一种梯度下降方法,报告前者收敛更快(12 分钟),被试之间的差异也更小。人在会话过程中也会逐渐适应设备,因此被优化的函数本身在移动;第 24 章将讨论这一问题。
人就是测量仪器。有些目标函数只以判断的形式存在。为了演示其调参服务,Google 的工程师优化了一份巧克力碎曲奇的配方,参数包括糖、黄油、盐和卡宴辣椒的用量,以及烘烤时间与温度。他们烤出一批批曲奇,公司餐厅的品尝者填写问卷,汇总后的评分再返回给优化器。作者报告说,“曲奇随着时间推移有了显著改进”;这项练习也用到了真实实验所需的功能:标记不可行的配方(黄油太少,面团就无法成形),接受厨师对推荐配方的改动,以及把小规模学到的东西迁移到大规模烘焙中(Golovin 等,2017)。
这类评分是把人的判断引入回路最简单的方式,但有已知的弱点。评分量表既没有固定的零点,也没有固定的单位;不同的人用法不同,同一个人在会话结束时的用法也与开始时不同(第 16.1.1 节)。询问两个选项中哪个更好可以避开量表,代价是每个回答携带的信息更少,而且模型的观测不再是高斯的。这一取舍是第四部分的主题;第 25 章完整演示了一个例子,其中唯一的测量仪器是眼睛。
无论反馈采取什么形式,人在回路时都有三件事会改变(推断,依据本节与第七部分中引用的研究)。预算是人的时间和耐心,只有几十次评估,而不是几百次。噪声来自人,取决于疲劳程度、之前展示过什么,以及问题如何提出。而且,人会亲身经历尝试过的每个选项,因此过程与终点同样重要,这正是累积遗憾与简单遗憾的区别。
第 15.7 节引用的文献 3
- Ding 等人(2018)Human-in-the-Loop Optimization of Hip Assistance with a Soft Exosuit during Walking
- Kim 等人(2017)Human-in-the-Loop Bayesian Optimization of Wearable Device Parameters
- Golovin 等人(2017)Google Vizier: A Service for Black-Box Optimization
15.8 相邻方法 #
贝叶斯优化与其他几个领域共用一套机制,它们的名称很容易混淆。区别主要在于目标:以什么为成功,决定了下一次在何处评估。
15.8.1 五个相邻方法 #
主动学习(active learning)的目标是以尽可能少的已测量输入,得到处处准确的模型。学习者选择让哪些输入被测量(用该领域的术语说,被标注),一种标准规则是不确定性采样(Settles,2009)。第 6.5.1 节已经把它作为收集信息的贪心规则介绍过:询问模型最没有把握的输入,用于高斯过程时,就是在后验方差最大处评估。其机制就是换了采集函数的贝叶斯优化,结果却不同:评估点均匀散开,也覆盖函数值很低、优化器毫无兴趣的区域。
贝叶斯实验设计(Bayesian experimental design)是两者背后的一般理论。它选择使结果期望效用最大的实验,效用则编码了实验的目的(Chaloner 与 Verdinelli,1995)。目的是学习时,效用就是获得的信息;这一准则可追溯到 Lindley(1956),MacKay(1992)又把它变成了选择数据的规则(第 6.4 节)。贝叶斯优化是效用不同的实验设计:效用是找到的最佳点的值。熵搜索(第 12.7 节)寻求关于最大值位置的信息,从而使这一联系变得明确。
赌博机(bandits)为每一次评估计分,而不只是为最终答案计分(第 13 章)。在连续定义域上使用高斯过程模型的赌博机算法,就是以累积遗憾评判的贝叶斯优化(第 13.4 节),上置信界在两者中都适用。两个领域的侧重不同:赌博机研究证明理论保证,通常针对大量廉价的回合;贝叶斯优化研究则为少量昂贵的回合构建方法。
强化学习(reinforcement learning)在状态会随动作而改变的环境中选择动作序列,以最大化随时间累积的奖励(Sutton 与 Barto,2018)。赌博机是只有一个状态的特例:动作影响奖励,但不影响学习者接下来面对的情境。因此,贝叶斯优化解决的是一个简单得多的问题,它常常用在强化学习的外围,而不是取代强化学习:或者像 AlphaGo 那样为学习系统调节超参数,或者像步态优化那样直接在机器人控制器的少数几个参数上搜索,每次评估运行整个控制器,返回一个数。
进化策略(evolution strategies)不借助模型进行搜索。它维护一个候选种群或候选上的一个分布,评估从中抽取的样本,并把分布移向较好的样本。标准方法协方差矩阵自适应进化策略(CMA-ES)为其采样分布自适应地调整一个完整的协方差矩阵(Hansen 与 Ostermeier,2001)。每一步的计算代价都很低,评估次数也不受限制,因此评估便宜且充足时,进化策略是自然的选择。在一个预算为 10,000 次评估的机器人控制基准上,CMA-ES 胜过了所有贝叶斯优化方法,只有与之比较的那个信赖域方法除外(Eriksson 等,2019)。只有几十次评估时,基于模型的方法占优,因为种群仅估计一个方向就需要很多次评估(推断;图 15.1 展示了一个小例子)。一项知名研究用进化策略优化行走时的外骨骼助力,与不施加力矩相比,代谢能量消耗降低了 24.2 ± 7.4%(Zhang 等,2017)。当人对每一代候选进行评分或选择时,这种方法称为交互式进化计算(Takagi,2001);第 36.5 节把它与偏好贝叶斯优化做了比较。
15.8.2 同样的数据,不同的目标 #
下图在贯穿全书的示例目标函数上,以相同的预算运行四种规则:不确定性采样、使用上置信界的贝叶斯优化、一种只保留一个当前点并对其做变异的简单进化策略,以及随机搜索;然后用三种方式为这四种规则评分。
可以尝试以下操作。
从模型误差开始。不确定性采样最终得到的模型最准确:30 次评估后,其误差约为 0.04,而贝叶斯优化与随机搜索都约为 0.06。它的刻线均匀分布在整个定义域上。贝叶斯优化的刻线堆积在较高的峰上,它对函数其余部分的模型在约 15 次评估后就不再改进。
切换到简单遗憾。排名反转。几乎在每次运行中,贝叶斯优化都在 15 次评估以内找到了最大值;30 次评估后,不确定性采样与随机搜索平均仍分别差约 0.03 和 0.05,因为它们从不向峰集中。进化策略在这一指标上最差:在许多次运行中,它爬上离起点最近的峰后便停在那里,因为它没有模型来提示定义域的其余部分尚未探索。
切换到累积遗憾。贝叶斯优化的曲线在约 10 次评估后趋于平坦,因为此后几乎每次评估都在最大值附近。不确定性采样与随机搜索每次评估付出的代价始终不变,最终分别接近 22 和 21,而贝叶斯优化为 7。进化策略在这一指标上优于二者,尽管它的最终答案很差:它把评估花在一个好的点附近,虽然不是最好的点。
退回到 5 次评估。早期各规则很难区分。数据很少时,上置信界由不确定性主导,因此贝叶斯优化起初就是不确定性采样,直到模型有了可以利用的信息,才与之分开(习题 15.3)。
主动学习、贝叶斯优化与赌博机可以共用一个模型,区别只在一行:把后验转化为下一次评估的那条规则。选择方法之前,先确定要为什么计分:模型、最终答案,还是沿途的一切。
15.8.3 如何选择 #
表 15.2 汇总了这一比较。表中的预算是根据本章例子得出的数量级,并非规则(推断)。
| 方法 | 目标 | 是否使用目标函数的模型 | 典型预算 | 何时选用 |
|---|---|---|---|---|
| 贝叶斯优化 | 找到的最佳输入 | 是 | 几十至几百 | 评估昂贵且输入很少 |
| 主动学习 | 处处准确的模型 | 是 | 几十至几千 | 模型本身就是产出 |
| 贝叶斯实验设计 | 任何明确给出的效用,常为信息 | 是 | 几次至几百 | 实验目的可以写成一个效用 |
| 赌博机 | 所有回合的奖励之和 | 可选 | 几千及以上 | 每次评估都有后果 |
| 强化学习 | 动作序列上的奖励 | 可选 | 非常多 | 动作会改变世界的状态 |
| 进化策略 | 找到的最佳输入 | 否 | 几千及以上 | 评估便宜,或维度很高 |
这些方法之间的边界并不严格。TuRBO 从经典局部搜索中借用了信赖域(第 14.6.2 节);BOHB 从赌博机中借用了早停(第 14.7.2 节);知识梯度与熵搜索是以最优点为目标的实验设计准则(第 12.6 节)。贝叶斯优化对这一大家族的贡献,在于为昂贵目标函数建立的显式概率模型,以及在每次评估之前先问这次评估值多少的习惯。下一部分保留这一模型和这一习惯,改变的是观测:观测不再是一个数,而是人在两个选项之间的选择。
第 15.8 节引用的文献 9
- Settles(2009)Active Learning Literature Survey
- Chaloner 与 Verdinelli(1995)Bayesian Experimental Design: A Review
- Lindley(1956)On a Measure of the Information Provided by an Experiment
- MacKay(1992)Information-Based Objective Functions for Active Data Selection
- Sutton 与 Barto(2018)Reinforcement Learning: An Introduction
- Hansen 与 Ostermeier(2001)Completely Derandomized Self-Adaptation in Evolution Strategies
- Eriksson 等人(2019)Scalable Global Optimization via Local Bayesian Optimization
- Zhang 等人(2017)Human-in-the-loop optimization of exoskeleton assistance during walking
- Takagi(2001)Interactive evolutionary computation: fusion of the capabilities of EC optimization and human evaluation
15.9 习题 #
对以下每个问题,说明应首先尝试表 15.2 中的哪种方法,并说明理由。(a)编译器有 30 个数值型编译标志,运行一次基准测试需要 40 ms。(b)实验室每天能做一次聚合物合成,需调节三个工艺参数。(c)新闻网站要在五个标题中为一篇文章选定一个,文章的阅读期是接下来的 6 小时。(d)工程团队需要一个慢速仿真器的快速近似,要求在四个输入的整个取值范围内都准确,供后续研究使用。
解答
(a)进化策略或随机搜索:几十万次评估都负担得起,评估如此便宜时,拟合模型的开销会超过它所节省的评估成本。(b)贝叶斯优化:输入少,预算是几十次评估,每次都很昂贵。(c)赌博机算法,例如 Thompson 采样:共有五个臂,每位看到较差标题的读者都意味着一次损失,而且得分是累积的。(d)主动学习或空间填充设计(第 11.4 节):目标是处处准确的模型,而不是最大值,因此评估应当放在模型不确定的地方。
Attia 等人(2020)报告,他们用 16 天而不是 500 多天找到了好的充电协议。请解释为什么按照 Adesiji 等人(2026)的定义,500/16 并不是贝叶斯优化的加速因子,并说明需要什么额外的比较才能单独分离出优化器的贡献。
解答
这项研究同时改变了两件事:早期预测模型缩短了每次实验,贝叶斯优化减少了实验次数。500 天指的是不做早期预测的穷举搜索,因此约 31 的比值合并了两种效应,而且是按时间而不是按实验次数衡量的。加速因子比较的是在其他条件相同时,使用与不使用优化器达到目标所需的实验次数。要单独分离出这一因子,应让贝叶斯优化与某种参照策略(例如随机搜索或穷举搜索)都使用早期预测,并统计两者达到同一循环寿命所需的实验次数。
第 15.9 节引用的文献 2
- Attia 等人(2020)Closed-Loop Optimization of Fast-Charging Protocols for Batteries with Machine Learning
- Adesiji 等人(2026)Benchmarking self-driving labs
延伸阅读 #
- Shahriari 等人(2016)是一篇按应用组织的贝叶斯优化综述,标题承诺把人从回路中移除;本书则把人放回回路,因此两者可以互为补充。
- Shields 等人(2021)即上文的化学研究,包括与 50 名化学家的对局;第 23 章使用其数据做了完整演示。
- Calandra 等人(2016)在真实机器人上比较了步态优化方法,是在硬件上评测贝叶斯优化的一个严谨范例。
- Letham 等人(2019)介绍了在线实验中的贝叶斯优化,在这一场景中,噪声与约束是主要问题。
- Golovin 等人(2017)介绍了一个大规模使用的调参服务,内容包括迁移学习、早停以及上文的曲奇。
- Settles(2009)综述了主动学习,Chaloner 与 Verdinelli(1995)回顾了贝叶斯实验设计;两者都是了解第 15.8 节中相邻方法的合适起点。
- Lattimore 与 Szepesvári(2020)与 Sutton 与 Barto(2018)分别是赌博机与强化学习的标准教材。
参考文献
- (2026). Benchmarking self-driving labs. Digital Discovery. 引用于 §15.3 §15.9
- (2020). Closed-Loop Optimization of Fast-Charging Protocols for Batteries with Machine Learning. Nature. 引用于 §15.1 §15.3 §15.9
- (2012). Random Search for Hyper-Parameter Optimization. Journal of Machine Learning Research. 引用于 §15.2
- (2011). Algorithms for Hyper-Parameter Optimization. Advances in Neural Information Processing Systems 24 (NeurIPS 2011). 引用于 §15.2
- (2016). Safe Controller Optimization for Quadrotors with Gaussian Processes. IEEE International Conference on Robotics and Automation (ICRA 2016). 引用于 §15.1 §15.4
- (2020). A Mobile Robotic Chemist. Nature. 引用于 §15.1 §15.3
- (2016). Bayesian Optimization for Learning Gaits under Uncertainty. Annals of Mathematics and Artificial Intelligence. 引用于 §15.4
- (1995). Bayesian Experimental Design: A Review. Statistical Science. 引用于 §15.8
- (2018). Bayesian Optimization in AlphaGo. 预印本引用于 §15.1 §15.2
- (2015). Robots That Can Adapt like Animals. Nature. 引用于 §15.4
- (2018). Human-in-the-Loop Optimization of Hip Assistance with a Soft Exosuit during Walking. Science Robotics. 引用于 §15.1 §15.7
- (2020). Bayesian Optimization of a Free-Electron Laser. Physical Review Letters. 引用于 §15.1 §15.5
- (2019). Scalable Global Optimization via Local Bayesian Optimization. Advances in Neural Information Processing Systems 32 (NeurIPS 2019). 引用于 §15.8
- (2008). Engineering Design via Surrogate Modelling: A Practical Guide. Wiley. 引用于 §15.5
- (2017). Google Vizier: A Service for Black-Box Optimization. Proceedings of the 23rd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD 2017). 引用于 §15.1 §15.2 §15.7
- (2001). Completely Derandomized Self-Adaptation in Evolution Strategies. Evolutionary Computation. 引用于 §15.8
- (1998). Efficient Global Optimization of Expensive Black-Box Functions. Journal of Global Optimization. 引用于 §15.5
- (2024). Human-in-the-loop: The future of Machine Learning in Automated Electron Microscopy. Microscopy Today. doi:10.1093/mictod/qaad096. 引用于 §15.3
- (2023). Human–machine collaboration for improving semiconductor process development. Nature. 引用于 §15.3
- (2017). Human-in-the-Loop Bayesian Optimization of Wearable Device Parameters. PLOS ONE. 引用于 §15.7
- (2020). Bandit Algorithms. Cambridge University Press. doi:10.1017/9781108571401.
- (2019). Constrained Bayesian Optimization with Noisy Experiments. Bayesian Analysis. 引用于 §15.1 §15.6
- (2022). Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes. International Conference on Artificial Intelligence and Statistics. 引用于 §15.6
- (1956). On a Measure of the Information Provided by an Experiment. The Annals of Mathematical Statistics. 引用于 §15.8
- (2007). Automatic Gait Optimization with Gaussian Process Regression. Proceedings of the 20th International Joint Conference on Artificial Intelligence (IJCAI 2007). 引用于 §15.1 §15.4
- (1992). Information-Based Objective Functions for Active Data Selection. Neural Computation. 引用于 §15.8
- (2025). Ax: A Platform for Adaptive Experimentation. International Conference on Automated Machine Learning. 引用于 §15.6
- (2009). Active Learning Literature Survey. University of Wisconsin–Madison. 非同行评审引用于 §15.8
- (2016). Taking the Human Out of the Loop: A Review of Bayesian Optimization. Proceedings of the IEEE.
- (2021). Bayesian reaction optimization as a tool for chemical synthesis. Nature. 引用于 §15.1 §15.3
- (2012). Practical Bayesian Optimization of Machine Learning Algorithms. Advances in Neural Information Processing Systems 25 (NeurIPS 2012). 引用于 §15.2
- (2018). Reinforcement Learning: An Introduction. MIT Press. 引用于 §15.8
- (2001). Interactive evolutionary computation: fusion of the capabilities of EC optimization and human evaluation. Proceedings of the IEEE. 引用于 §15.8
- (2013). Auto-WEKA: Combined Selection and Hyperparameter Optimization of Classification Algorithms. Proceedings of the 19th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD 2013). 引用于 §15.2
- (2021). Bayesian Optimization is Superior to Random Search for Machine Learning Hyperparameter Tuning: Analysis of the Black-Box Optimization Challenge 2020. NeurIPS 2020 Competition and Demonstration Track. 引用于 §15.2
- (2025). When Less is More: A Story of Failing Bayesian Optimization Due to Additional Expert Knowledge. arXiv. 预印本引用于 §15.3
- (2017). Human-in-the-loop optimization of exoskeleton assistance during walking. Science. 引用于 §15.8