贝叶斯优化实践
第 13 章最后把理论保证视为设计原则,其中的常数由实验确定。本章讨论这些实验中必须做出的决定。第 11 章的循环和第 12 章的采集函数都是针对一个规整的问题设计的:每次只运行一次评估,返回值的噪声很小;只有一个目标,除了限定输入范围的箱形区域外没有其他约束;输入只有寥寥几个,每次评估的成本相同;预算事先固定。实际问题会违背其中每一条假设,而且往往同时违背好几条。
贝叶斯优化在机器学习中的流行始于一类问题:为模型调节超参数。超参数是学习率、正则化强度这类在训练之前选定、而非从数据中学到的设置。Snoek 等人(2012)表明,贝叶斯优化在调节卷积网络等模型时能够达到甚至超过专家调参的水平;为此,他们必须决定如何为跨越几个数量级的错误率建模、训练有噪声时如何处理、如何同时使用多台机器,以及如何计入耗时几分钟乃至几小时的运行。这些决定各自对应本章的一节。第 22 章在一个真实的分类器上、借助实测的目标函数地形逐一处理同样的决定;本章则提供通用的工具。
本章从模型出发逐步向外展开:先讨论代理模型,再讨论噪声与报告内容,然后依次是批量、约束、多目标、高维和成本。最后介绍实现这些选择的软件及其截至 2026 年 9 月的最新版本。
引言引用的文献 1
- Snoek 等人(2012)Practical Bayesian Optimization of Machine Learning Algorithms
14.1 代理模型的选择 #
高斯过程先验是一组假设:函数值围绕某个均值、具有某种量级;函数在某个长度尺度上变化;函数处处同样光滑。第 8.6 节列出了使这些假设大体成立的常用做法。在贝叶斯优化中,这些假设比在回归中更重要,因为后验不仅用于报告,还要据此决定下一步:错误的长度尺度会把下一次评估引向错误的位置,误差在整个运行中不断累积。
14.1.1 缩放输出与输入 #
标准化输出。默认先验的均值为零、幅度为一,因此拟合之前应将观测值中心化并缩放到单位标准差,预测结果再变换回原尺度。自 0.12.0 版(2024 年 9 月)起,BoTorch 的大多数模型默认执行这一变换,部分原因是其新的默认先验(见第 14.6 节)“在数据未标准化时效果会变差”(will work less well when data is not standardized)(Meta Platforms, Inc.,2026e)。
变换偏斜的输出。错误率、运行时间或反应产率常常跨越几个数量级,并伴有少数极差的评估结果。此时,幅度恒定的高斯过程会把灵活性耗费在这些离群值上。改为对其对数或其他单调变换建模,可使数值更接近先验的预期。单调变换不改变最大值的位置,只改变模型所看到的地形。Cowen-Rivers 等人(2022)研究了 108 个超参数优化任务,发现多数任务都表现出异方差性(噪声大小在定义域上变化)和非平稳性(光滑度在定义域上变化);他们的 HEBO 方法同时学习输入与输出的变换,在 NeurIPS 2020 黑箱优化挑战赛(Black-Box Optimization Challenge)中获得第一名。
缩放输入。将每个输入映射到 ;以乘法方式起作用的输入,先变换到对数尺度:学习率介于 与 之间时,自然的做法是以 为单位搜索,使每个数量级在箱形区域中占相同的份额。不知道合适的变换时,可以通过学习得到。Snoek 等人(2014)用 Beta 分布的累积分布函数扭曲每个输入,该分布的两个参数与核函数的参数一同拟合,使模型能够拉伸函数变化快的区域、压缩函数平坦的区域。
14.1.2 核函数与超参数 #
核函数。径向基函数核(平方指数核)生成的函数无穷次可微,Snoek 等人(2012)认为这“对实际优化问题来说光滑得不现实”(unrealistically smooth for practical optimization problems),并推荐每个输入各有一个长度尺度的 Matérn 5/2 核(第 9.2 节)。这也是多个库的默认设置,例如 Optuna 的高斯过程采样器所用的正是这个核(Optuna contributors,2026)。在 12 个高维基准上的比较中,使用 Matérn 核的标准贝叶斯优化始终跻身最佳方法之列,而径向基函数核常常导致很差的表现,数值上的原因见第 14.6.3 节(Xu 等,2025b)。
超参数。长度尺度、幅度与噪声方差在每一步都要根据数据拟合,方法是最大化边际似然加上各超参数先验的对数(第 9.4 节)。观测很少时,拟合值在相邻两步之间会大幅跳动,单次拟合可能严重偏离。一种补救办法是对超参数取平均,而不是只选一组取值:Snoek 等人(2012)用 Markov 链蒙特卡洛抽取超参数样本(具体用的是切片采样:即使分布的密度只确定到相差一个常数因子,这种方法也能从中抽取样本),再在这些样本上对采集函数取平均。另一种补救办法是改进先验,这是第 14.6 节的主题。无论采用哪种做法,都应不时绘图检查拟合后的模型(第 9.6 节);长度尺度若达到允许范围的边缘,就是一个警告信号。
非连续的输入。整数型设置(如网络层数)和类别型设置(如优化器的选择)需要额外处理,才能用于箱形区域上的核函数。常见的处理方式有:对连续松弛的结果取整;把类别编码为指示变量,每个取值一个;使用能直接处理类别的代理模型。例如,SMAC 专为配置含大量类别参数和条件参数的算法而设计,以随机森林(许多决策树的平均)作为模型(Hutter 等,2011)。第 23 章还会讨论类别选择,那里的类别是化学试剂。
每个库都会替使用者做出上述选择,而这些选择因库而异,同一个库的不同版本之间也不相同。BoTorch 曾在一次发布中同时改变默认的长度尺度先验和输出标准化(Meta Platforms, Inc.,2026e)。运行表现异常,或结果必须可复现时,应记录库的版本,并查明当时的默认值。
第 14.1 节引用的文献 7
- Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
- Cowen-Rivers 等人(2022)HEBO: An Empirical Study of Assumptions in Bayesian Optimisation
- Snoek 等人(2014)Input Warping for Bayesian Optimization of Non-Stationary Functions
- Snoek 等人(2012)Practical Bayesian Optimization of Machine Learning Algorithms
- Optuna contributors(2026)optuna.samplers.GPSampler, Optuna 5.0.0 documentation
- Xu 等人(2025b)Standard Gaussian Process is All You Need for High-Dimensional Bayesian Optimization
- Hutter 等人(2011)Sequential Model-Based Optimization for General Algorithm Configuration
14.2 噪声与当前最优值 #
期望改进衡量相对于当前最优值(incumbent)的改进,当前最优值即迄今为止最好的值(第 12.3 节)。评估精确时,当前最优值是明确的;有噪声时则不然。由此产生两个教科书式循环不涉及的问题:期望改进应以哪个值为基准?运行结束时应报告什么?
14.2.1 赢家诅咒 #
设许多次评估都落在目标函数的顶部附近,真实值都接近最大值,每次评估都受到标准差为 的独立噪声扰动(第 8.3 节)。观测到的最大值来自噪声最有利的那一次,它高估了该输入处的真实值。高估量约为 乘以同样数量的标准正态变量中最大者的期望;25 个变量时,这一期望约为 1.97(习题 14.1)。拍卖理论称之为赢家诅咒:在比较中胜出者,平均而言正是被高估得最多的那一个。
下图在带噪声的评估下运行贝叶斯优化(在贯穿全书的示例目标函数上采用 的上置信界),然后比较两种确定报告内容的方式。
可以尝试以下操作。
查看默认运行。最优观测值声称 1.24,而该输入处的真实值为 0.79。最优后验均值声称 0.83,该输入处的真实值为 0.82,即最大值。两条规则选出的输入都位于高峰上,但只有一条如实报告了它的值。
观察虚线。对各次运行取平均,在每个噪声水平下,最优观测值对真实值的高估量都约为噪声水平的两倍: 时为 0.19, 时为 0.99。后验均值把每个观测值向其邻近点收缩,不会同样受到这种虚高的影响。
比较遗憾曲线。噪声低时,两条规则选出的输入相近。噪声增大后,按后验均值选择在多数噪声水平下遗憾更低,且评估次数越多,差距越大:评估 40 次、 时,按后验均值选择的平均遗憾为 0.10,按最优观测值选择则为 0.18。
14.2.2 在不确定的当前最优值之上改进 #
同样的问题也影响采集函数本身。以观测到的最好值为基准的朴素期望改进,追求的是胜过一次侥幸偏高的观测。Picheny 等人(2013)比较了十种针对带噪声问题的准则,发现两种最自然的选择在全部测试案例中都表现很差:一是把最好的带噪声观测值代入期望改进,二是反复评估后验均值的最小值点;其余准则中哪种最好,则因问题而异。
带噪声期望改进(noisy expected improvement)把当前最优值也视为未知。已评估输入处的真实值不确定,其中的最大者也就不确定;应当取平均的,是候选点相对于这一不确定最优值的改进。Letham 等人(2019)推导了这一准则,并用拟蒙特卡洛积分计算:在候选点与已评估点处联合抽取函数值,再取平均。他们为 Facebook 的在线实验开发了这一准则,那里的每次评估都是方差很大的随机化试验;他们以优化一个排序系统和一个服务器编译器的标志参数为例演示了该准则。在 BoTorch 中,这一准则采用蒙特卡洛形式:在候选点和先前已评估的点上联合抽取函数的后验样本,对每个样本计算最好的候选值超出先前最好评估值多少(未超出则为零),再对样本取平均(Balandat 等,2020);其对数变体在数值上更容易最大化,是目前推荐的做法(Ament 等,2023;Meta Platforms, Inc.,2026e)。
有噪声时,应推荐后验均值最高的输入,并以后验均值作为其值。若这一决定很重要,就在选择之前把最好的几个候选再评估一遍。第 11.2.3 节已对循环提出过同样的建议;噪声使这一建议成为必需。
第 14.2 节引用的文献 5
- Picheny 等人(2013)A Benchmark of Kriging-Based Infill Criteria for Noisy Optimization
- Letham 等人(2019)Constrained Bayesian Optimization with Noisy Experiments
- Balandat 等人(2020)BoTorch: A Framework for Efficient Monte-Carlo Bayesian Optimization
- Ament 等人(2023)Unexpected Improvements to Expected Improvement for Bayesian Optimization
- Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
14.3 批量与并行评估 #
许多评估可以同时进行:计算集群可以同时训练八个模型,实验室机器人一次可以填满一块 96 孔板,诊所一天可以接待好几名被试。第 11 章的循环每得到一个结果才选择下一个输入,会使这些能力大多闲置。批量(batch)方法则一次选择 个输入。
14.3.1 前 q 个点为何是糟糕的批量 #
最直接的批量是采集函数值最大的 个输入,但这是一个糟糕的批量。采集函数是光滑的,排在第二、第三、第四的输入通常就在第一名附近,相当于把几乎相同的问题问了 遍。批量应当最大化的是整个集合的价值。以期望改进为例,应最大化的是批量中最好的点的期望改进:
其中 是第 12.2 节中的当前最优值,期望针对 在这 个输入处的联合后验计算。邻近点强相关,因此加入 的邻居对最大值几乎没有增益: 低时, 也低。Ginsbourger 等人(2010)提出了批量期望改进(q-EI),给出了 时的闭式解,对更大的批量则用蒙特卡洛方法估计。
联合最大化 q-EI 意味着同时搜索 个输入,这是一个 维的问题。实用的方法转而逐点构建批量;每种方法都需要设法处理已经选定但结果尚未知道的点。
14.3.2 假定已知结果 #
Ginsbourger 等人(2010)提出了两种启发式方法。克里金信念(kriging believer)选出期望改进的最大值点,假定该点的结果等于那里的后验均值,把这一虚拟观测加入数据,重新拟合后再选下一个点。常数说谎者(constant liar)做法相同,但使用固定的虚拟值,即谎言值:悲观的谎言值(例如迄今观测到的最差值)会把后选的点推离先选的点,乐观的谎言值则会把它们拉到一起。无论哪种做法,虚拟观测都会缩小所选点周围的后验方差,下一个最大值点于是移向别处。
假定一个确定的结果,是对不确定结果的粗略概括。Snoek 等人(2012)改用积分:从后验中为尚未完成的评估抽取若干虚拟结果,再在这些结果上对采集函数取平均。这正是 BoTorch 中蒙特卡洛采集函数背后的思想。批量点与待定点处的联合后验,用第 12.9 节中的技巧采样,即让固定的随机数通过固定的变换,从而使蒙特卡洛估计成为输入的确定性可微函数(Wilson 等,2018)。BoTorch 进而在整个优化过程中固定这些随机数,这种做法称为样本平均近似(sample average approximation),然后用普通的拟 Newton 法求最大值(Balandat 等,2020)。BoTorch 既可以联合优化批量中的所有点(这是其 optimize_acqf 函数的默认做法),也可以用序贯贪心优化构建批量:选一个候选点,将其加入待定点,再选下一个。对期望改进、上置信界及类似准则,集合的价值具有收益递减的性质,这正是贪心构建效果好的原因(Wilson 等,2018;Balandat 等,2020)。
14.3.3 不需要虚拟观测的批量 #
Thompson 采样无须额外机制即可并行:每个工作节点从后验中抽取各自的函数样本,在样本取最大值处评估,样本的随机性使批量分散开来。Kandasamy 等人(2018)表明,以这种方式把 次评估分配给 个工作节点,本质上等价于依次做 次评估;在对评估时间建模后,异步版本(工作节点完成一次评估后立即开始下一次)在给定时限下的遗憾低于同步版本和顺序版本。
另有两条途径可以避免在批量内部重新拟合模型。González 等人(2016)在每个已选点周围对采集函数施加惩罚,惩罚量由函数变化速度的估计值导出。Desautels 等人(2014)把 GP-UCB 推广到批量情形(GP-BUCB):只用待定输入更新后验方差,这一步不需要任何结果;他们还证明了遗憾界:对某些常用核函数,渐近平均遗憾可以与批量大小无关。
下图以示例目标函数上的四个观测为起点,比较四种规则。
可以尝试以下操作。
比较前 q 名与克里金信念。 时,期望改进最大的四个值位于 附近的相邻输入上,该批量的 q-EI 为 0.195,仅略高于单个最优点自身的 0.174。克里金信念把四个点分别放在四个区域,其中包括 附近的高峰,q-EI 为 0.432。
观察虚拟观测。下方面板中,每个虚拟观测都会压平加入处的期望改进,下一个最大值便出现在别处。此处常数说谎者的谎言值取迄今观测到的最差值,它不仅降低所选点周围的后验方差,也降低那里的后验均值;所得批量与克里金信念不同,q-EI 为 0.402。
尝试 Thompson 采样。每个样本都有各自的最大值点,因此批量的分散来自偶然,而非刻意设计。此处 Thompson 采样的 q-EI 低于克里金信念,但它既不需要重新拟合,也不需要虚拟观测,这正是它能扩展到大批量的原因。
评估几个批量。两三轮之后,批量都集中到高峰上,q-EI 趋近于零:可以获得的改进已所剩无几。此时批量已没有值得探索的地方,更多的预算最好用在别处。
第 14.3 节引用的文献 7
- Ginsbourger 等人(2010)Kriging Is Well-Suited to Parallelize Optimization
- Snoek 等人(2012)Practical Bayesian Optimization of Machine Learning Algorithms
- Wilson 等人(2018)Maximizing Acquisition Functions for Bayesian Optimization
- Balandat 等人(2020)BoTorch: A Framework for Efficient Monte-Carlo Bayesian Optimization
- Kandasamy 等人(2018)Parallelised Bayesian Optimisation via Thompson Sampling
- González 等人(2016)Batch Bayesian Optimization via Local Penalization
- Desautels 等人(2014)Parallelizing Exploration-Exploitation Tradeoffs in Gaussian Process Bandit Optimization
14.4 约束与安全 #
有些输入是不允许的,而原因未必能事先知道。由允许范围构成的箱形区域,或输入之间的线性约束(例如各比例之和必须为一),在评估之前就已知道,由采集函数的优化器处理。更难的情形是约束本身需要测量:训练超出内存上限、反应生成过多不需要的副产物、设计未通过压力测试。这类黑箱约束(black-box constraints)与目标函数一样评估代价高昂,而且往往来自同一次实验。
14.4.1 考虑约束的期望改进 #
标准做法是除目标函数外,再为每个约束 各建一个高斯过程。若在模型中约束与目标函数相互独立,则候选点的期望改进(只计可行的改进)可以分解为两个因子:
其中 以迄今观测到的最好可行值为基准计算;各约束彼此独立时,可行概率是若干高斯累积分布函数的乘积。Gardner 等人(2014)把它描述为“恰好是 x̂ 相对于迄今最好可行点的标准期望改进,再以 x̂ 可行的概率加权”(precisely the standard expected improvement of x̂ over the best feasible point so far weighted by the probability that x̂ is feasible),并表明它能找到可行的最优点,“即使在小的可行区域导致标准方法失败时”(even when small feasible regions cause standard methods to fail)也是如此。Gelbart 等人(2014)将同样的约束加权期望改进用于事先未知的约束,例如在某些输入下会崩溃的仿真;Letham 等人(2019)则把带噪声期望改进推广到带噪声的约束。习题 14.2 推导了这一乘积。
有两种情形需要注意。其一,若尚未找到任何可行点,就不存在当前最优值,合理的首要目标是先找到可行点,例如单独最大化可行概率(推断)。其二,乘积较大,既可能来自几乎确定可行的适度改进,也可能来自可行性不确定的大幅改进;式(14.2)将两者视为等价,而这只有当失败的评估除评估本身外不造成任何代价时才成立。
14.4.2 不安全的评估不可接受时 #
有时失败的评估代价要大得多。机器人控制器让四旋翼飞行器坠毁,刺激参数伤害病人,推荐导致用户流失,这些都不能仅视为损失了一次评估。此时要求每一次评估都以高概率安全,而不仅是最终答案安全。
Sui 等人(2015)提出的 SafeOpt 适用于这样的情形:每次评估时,目标函数本身都必须保持在安全阈值之上。SafeOpt 维护一个安全集(safe set):根据模型的置信区间,再加上关于函数变化速度的假设,可以确认某些输入的值高于阈值,这些输入构成安全集。SafeOpt 只在安全集内部评估,并在两类输入之间选择:可能是最好安全点的输入,以及评估后可能扩大安全集的输入。从一个已知安全的输入出发,安全集随证据积累向外扩张。作者证明了 SafeOpt 会收敛到不离开安全区域即可到达的最好点,并在电影推荐和治疗性脊髓刺激上做了演示,后者的刺激参数必须对病人保持安全(Sui 等,2015)。后来的一个变体把安全区域的扩张与区域内部的优化分开处理(Sui 等,2018b)。
安全的代价是可达范围受限。如果远处某个区域与起点之间隔着不安全的输入,安全方法就无法跳过去,因此可能永远找不到全局最优点;它找到的是与起点连通的最好的最优点。第 15.4 节还会讨论机器人学中的安全优化。
第 14.4 节引用的文献 5
- Gardner 等人(2014)Bayesian Optimization with Inequality Constraints
- Gelbart 等人(2014)Bayesian Optimization with Unknown Constraints
- Letham 等人(2019)Constrained Bayesian Optimization with Noisy Experiments
- Sui 等人(2015)Safe Exploration for Optimization with Gaussian Processes
- Sui 等人(2018b)Stagewise Safe Bayesian Optimization with Gaussian Processes
14.5 多目标 #
模型应当既准确又快速,反应应当产率高、废物少,假肢应当既舒适又高效。多个目标相互冲突时,通常不存在单一的最好输入,只存在权衡。
14.5.1 Pareto 前沿与超体积 #
若一个输入在每个目标上都不差于另一个输入,且至少在一个目标上严格更好,则称前者支配(dominates)后者。不被任何其他输入支配的输入构成 Pareto 集(Pareto set),其目标值构成 Pareto 前沿(Pareto front)。Pareto 前沿好比一张菜单,列出了所有可能的最佳权衡,决策者最终从中选择。多目标贝叶斯优化力求用很少的评估得到这一前沿的良好近似。
要用一个数比较前沿的不同近似,标准的度量是超体积(hypervolume),即迄今找到的点在目标空间中所支配的体积,计算到某个参考点为止;参考点标出各目标可接受的最差值。超体积越大,说明前沿越靠外、分布越广。由此产生两类采集函数。
标量化。通过加权组合把多个目标合为一个,再对其使用任意单目标采集函数。ParEGO 每次迭代随机抽取新的权重向量,经过多次迭代,前沿的各个部分都能得到关注。它以归一化成本的增广 Chebyshev 函数为点打分,即加权成本中的最大者加上加权和的 0.05 倍;与单纯的加权和不同,该函数可以在前沿非凸部分上的点处取得最小值(Knowles,2006)。
超体积改进。以评估某个候选点后超体积的期望增量为其打分(Emmerich 等,2006)。这一准则直接以前沿为目标,但目标较多时计算代价很高。Daulton 等人(2020)推导了批量版本 qEHVI,借助自动微分得到精确梯度,使梯度方法优化它变得可行;Daulton 等人(2021)又将其推广到带噪声的观测(qNEHVI),对当前前沿的不确定性积分。他们表明该准则对超体积是一步贝叶斯最优的,并把批量选择的代价从批量大小的指数级降到多项式级。
14.5.2 由人决定权衡时 #
前沿是一张菜单,仍需有人从中挑选。这个人往往对各种权衡有自己的偏好,而这种偏好本可以从一开始就引导搜索,省去花在无人需要的那部分前沿上的评估。Lin 等人(2022)提出在实验与偏好探索(preference exploration)之间交替:向决策者展示成对的预测结果,从其选择中学习关于结果的效用函数,再优化期望效用。从比较中学习效用是第四部分的主题;这是它与标量贝叶斯优化直接交汇的地方之一。
第 14.5 节引用的文献 5
- Knowles(2006)ParEGO: A Hybrid Algorithm with On-line Landscape Approximation for Expensive Multiobjective Optimization Problems
- Emmerich 等人(2006)Single- and Multiobjective Evolutionary Optimization Assisted by Gaussian Random Field Metamodels
- Daulton 等人(2020)Differentiable Expected Hypervolume Improvement for Parallel Multi-Objective Bayesian Optimization
- Daulton 等人(2021)Parallel Bayesian Optimization of Multiple Noisy Objectives with Expected Hypervolume Improvement
- Lin 等人(2022)Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes
14.6 高维问题 #
前面的例子只有一两个输入,实际问题的输入则更多:第 22.4 节中的分类器有七个超参数,控制器、化工过程和工程设计往往有十几个甚至更多。随着输入个数 增大,有三方面同时变难。第一,搜索的体积呈指数增长(第 11.3 节计算过,在六维立方体中,一次评估能提供信息的部分占比多么小)。第二,立方体中的点彼此相距更远,平均距离按 增长,长度尺度固定的核函数因此会把每一对点都视为互不相关。第三,采集函数几乎处处平坦,难以最大化(第 12.9.1 节)。
过去的经验法则是,贝叶斯优化适用于至多 10 或 20 个输入的问题(Frazier,2018)。2024 年以来的研究改变了这条法则应有的表述,第 30 章详细介绍了相关争论。本节介绍几类主要方法,以及实践者目前可以采取的做法。
14.6.1 假设结构 #
较早的做法假设函数虽然定义在许多输入上,实际却比表面看起来简单。
低有效维度。若输入空间中只有少数方向重要,搜索就可以在随机的低维子空间中进行。REMBO 在维度很小的随机线性嵌入中优化;据其作者报告,只要内在维度很低,它可以求解维度高达数十亿的问题;作者还用它调节了一个混合整数规划求解器的 47 个离散参数(Wang 等,2016)。Letham 等人(2020)找出了这类嵌入中有损性能的设计选择,并表明纠正这些选择能显著改进该方法,在为机器人学习步态策略的任务上也是如此。
加性结构。若函数是若干项之和,每一项只依赖少数几个输入,那么以低维核函数之和构成的核,只需少得多的评估就能学到。对这类加性函数,Kandasamy 等人(2015)证明遗憾对维度只呈线性依赖。
稀疏相关性。若只有部分输入重要,但事先不知道是哪些,可以为长度尺度设定倾向于忽略多数输入的先验,使每个相关输入的重要性都必须由数据来证明。SAASBO 正是如此:它采用稀疏诱导先验,并用 Hamiltonian 蒙特卡洛(一种利用梯度的采样方法)对长度尺度取平均(Eriksson 与 Jankowiak,2021)。
14.6.2 局部搜索 #
另一种做法承认高维函数的全局模型难以奏效,转而做局部搜索。TuRBO 维护一个信赖域(trust region),即以迄今最好点为中心的箱形区域,并只在其中运行贝叶斯优化(Eriksson 等,2019)。箱形区域的初始边长为单位立方体边长的 0.8,沿长度尺度较长的输入方向拉伸,沿长度尺度较短的方向收缩。连续三次改进后,边长加倍;连续 次失败后(批量大小为一时),边长减半;边长缩小到 以下时,放弃该区域,在别处重新开始。多个信赖域可以同时运行,通过 Thompson 采样争夺评估机会。在 14 维的机器人推物任务和 60 维的漫游车轨迹问题上,预算分别为 10,000 次和 20,000 次评估,TuRBO 的表现优于参与比较的其他贝叶斯优化方法和局部优化器(Eriksson 等,2019)。
14.6.3 修正先验 #
第三种做法改变了实践。这种做法认为,标准贝叶斯优化在高维中失败的原因很平凡,在于默认的长度尺度先验。若先验的尺度固定,且偏好零点几的长度尺度,这在二维中是合理的,因为二维中点与点之间的典型距离约为 0.6。而在 50 维中,典型距离约为 2.9,每一对点都相隔好几个长度尺度,核函数把它们视为互不相关,模型便无法学习。Hvarfner 等人(2024)让长度尺度先验随维度的平方根缩放,发现做此改动后,标准贝叶斯优化在五个真实任务中的三个上表现最好,胜过专为高维设计的方法。他们还注意到旧的默认设置实际在做什么:在六维 Hartmann 函数上,该运行“实际上是先做一次初始随机搜索,再做 140 次迭代的局部搜索”(effectively performing an initial random search followed by 140 iterations of local search)。BoTorch 在 0.12.0 版中将这种缩放先验设为默认:位置参数为 、尺度参数为 的对数正态分布,其众数按 增长(Meta Platforms, Inc.,2026k;Meta Platforms, Inc.,2026e);习题 14.3 给出了具体数值。
另外两个研究组从优化角度得出了相互印证的诊断:初始长度尺度很短时,用于拟合超参数的梯度在数值上消失,拟合因而停滞不前;合理的初始化即使不借助任何特殊先验,也能在很大程度上解决这一问题(Xu 等,2025b;Papenmeier 等,2025b)。
同一分析也给出了第 14.1.2 节中留待解释的数值原因,即径向基函数核为何会在 Matérn 核不失败的地方失败。设 为两个输入之间以初始长度尺度为单位的距离;在高维中,几乎每一对输入的这一距离都很大。对径向基函数核(该论文写作 ),核函数值对长度尺度的导数以 的某个倍数为界,一旦 超过 6.58,该量就低于双精度运算的精度。对 Matérn 5/2 核,相应的因子为 ,它缩小得慢得多,直到 才降到同一水平。因此,在相同的初始长度尺度下,Matérn 核的拟合在高得多的维度中仍能继续更新(Xu 等,2025b)。
这一修正为何有效,目前仍有争议。Papenmeier 等人(2025b)认为,极高维中的成功在很大程度上来自局部搜索行为,而非拟合良好的全局模型;Doumont 等人(2026)用线性模型在 60 至 6,000 维的任务上取得了最先进的结果,并据此得出结论:代理模型的表达力和预测精度未必能转化为优化性能。第 30.2 节列出了相关证据。
下图在一个答案已知的问题上展示这两种效应:标准测试函数六维 Hartmann 函数混在若干无关输入之中,使总维度为 6、10、20 或 50。
可以尝试以下操作。
从 50 维、“仅全局”搜索开始。候选点从立方体中均匀抽取时,两种贝叶斯优化都进展甚微:80 次评估后,固定先验的中位遗憾为 0.89,缩放先验为 1.21,随机搜索为 1.75。在 50 维中,均匀候选点几乎从不落在采集函数有信息量的区域(第 12.9.1 节),因此评估结果始终平平。下方面板显示了这对模型的影响:在所示的运行中,模型只为六个重要输入中的一个赋予了较短的长度尺度。
切换到“全局 + 局部”搜索。将最好点的扰动加入候选点后,两种先验的中位遗憾都降到约 0.18。在这些运行中,采集函数的搜索方式比模型所用的先验更重要,这正是 Papenmeier 等人(2025b)的观点。
切换到 20 维,比较两种先验下的长度尺度。在缩放先验下,六个相关输入的长度尺度低于 1,其余多数输入的长度尺度接近 20:模型已识别出哪些输入重要。在固定先验下,所有长度尺度都停留在约 0.2 至 2 之间:相关输入的长度尺度仍然较短,但只短约 3 倍,而缩放先验下两者相差约 40 倍。遗憾曲线之间的差别远小于模型之间的差别。
降到 6 维。没有无关输入时,除随机搜索外的各种方法都能达到很小的遗憾,上述选择的影响也小得多。
14.6.4 实践中的做法 #
面对输入多于约十个的问题,实践者可以采取以下步骤,各步按证据支持的强弱排序(推断,依据上述研究)。
- 降低优化器面对的维度:固定经验表明不重要的输入;若存在更低维的参数化,就在其中搜索。
- 使用新版库,采用维度缩放的长度尺度先验或稳健的初始化;自 2024 年起,这已是 BoTorch 标准模型的默认设置(Meta Platforms, Inc.,2026e)。
- 对采集函数同时做全局搜索和局部搜索:从最好点的扰动出发,每次只扰动部分坐标,TuRBO 的候选集和 BoTorch 的相应选项都是这样做的(第 12.9.1 节)。也可以直接使用信赖域方法。
- 几十次评估后,检查拟合出的长度尺度。若所有输入的长度尺度都相同,且等于先验的起始值,说明超参数拟合根本没有更新。
第 14.6 节引用的文献 12
- Frazier(2018)A Tutorial on Bayesian Optimization
- Wang 等人(2016)Bayesian Optimization in a Billion Dimensions via Random Embeddings
- Letham 等人(2020)Re-Examining Linear Embeddings for High-Dimensional Bayesian Optimization
- Kandasamy 等人(2015)High Dimensional Bayesian Optimisation and Bandits via Additive Models
- Eriksson 与 Jankowiak(2021)High-Dimensional Bayesian Optimization with Sparse Axis-Aligned Subspaces
- Eriksson 等人(2019)Scalable Global Optimization via Local Bayesian Optimization
- Hvarfner 等人(2024)Vanilla Bayesian Optimization Performs Great in High Dimensions
- Meta Platforms, Inc.(2026k)botorch/models/utils/gpytorch_modules.py
- Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
- Xu 等人(2025b)Standard Gaussian Process is All You Need for High-Dimensional Bayesian Optimization
- Papenmeier 等人(2025b)Understanding High-Dimensional Bayesian Optimization
- Doumont 等人(2026)We Still Don't Understand High-Dimensional Bayesian Optimization
14.7 成本与停止 #
循环计数的是评估次数,但预算通常是时间或金钱,而各次评估的成本并不相同:训练有 1,000 个隐藏单元的网络比只有 10 个的耗时更长,高温下的反应消耗更多能量,长时间的步行试验会使被试疲劳。忽视成本的方法会毫不犹豫地在一次评估上耗费一整天,而一次稍差但便宜得多的评估本可以使它变得多余。
14.7.1 关注成本 #
最简单的修正是除以成本。Snoek 等人(2012)用第二个高斯过程为每次训练的时长建模,并最大化每秒期望改进(expected improvement per second)。更有理论依据的规则来自经济学。在潘多拉魔盒(Pandora's box)问题中,搜寻者打开成本已知、回报不确定的盒子,希望扣除已付成本后得到最好的回报;其最优解是为每个盒子计算一个指数,即 Gittins 指数。Xie 等人(2024)表明,这一指数可以用作成本感知贝叶斯优化的采集函数,即 Pandora's Box Gittins 指数(PBGI),并发现它表现良好,尤其是在中高维问题中,没有显式成本时也是如此。
14.7.2 同一评估的低成本版本 #
评估往往可以牺牲精度以降低成本:减少训练轮数、只在数据子集上训练、使用更粗的仿真网格。这些选择称为保真度(fidelities)。多保真度方法跨保真度对目标函数联合建模,把大部分预算用在便宜而粗糙的评估上,把昂贵的评估留给有希望的输入。
- Swersky 等人(2013)用多任务高斯过程为相关任务建模(例如同一模型分别在小数据集和大数据集上训练),借助便宜的任务加速昂贵任务的优化。
- FABOLAS 把验证误差建模为超参数与训练子集大小的函数;在其作者的实验中,它找到好配置的速度常比其他贝叶斯优化方法或 Hyperband 快 10 至 100 倍(Klein 等,2017)。
- BOCA 处理连续取值的近似程度,例如同时考虑数据量和训练迭代次数(Kandasamy 等,2017);Wu 等人(2019)的轨迹感知知识梯度(trace-aware knowledge gradient)还利用了一次训练产生的整条学习曲线。
- Hyperband 不是贝叶斯方法:它将许多随机配置各训练很短的时间,只继续训练有希望的配置(Li 等,2018);BOHB 用模型取代其中的随机采样,在其作者的实验中始终优于贝叶斯优化和 Hyperband(Falkner 等,2018)。
第 22 章展示了一个真实调参问题中成本的变化幅度(该问题中相差 350 倍),以及这对方法选择的影响。
14.7.3 何时停止 #
多数运行在预算耗尽时停止。更好的规则是在继续评估得不偿失时停止;2023 年以来,已有几条这样的规则具备理论保证。
- Ishibashi 等人(2023)以相邻两步的期望最小简单遗憾之差作为停止准则。
- Wilson(2024)的规则是:在模型下,若某个已评估点以至少 的概率处于最优值的 范围之内,则停止;他们还表明,在温和的技术假设下,采用高斯过程先验的贝叶斯优化会满足这一条件。
- Xie 等人(2026)(据其 arXiv 页面,已被 ICML 2026 接收)仅当某个点的期望改进超过其评估成本时才继续。与 PBGI 或单位成本对数期望改进搭配时,所得策略的成本调整后的简单遗憾(cost-adjusted simple regret)在期望意义下有界;这一遗憾即第 13.1 节中的简单遗憾加上已付出的总成本。
每条保证都以模型为前提,因此其可靠程度取决于模型的超参数;各条保证还假设成本已知或可以学到。成本是人的时间与注意力时,这两个假设都值得怀疑;第 30.7 节讨论了评估来自人的判断时如何停止。
第 14.7 节引用的文献 11
- Snoek 等人(2012)Practical Bayesian Optimization of Machine Learning Algorithms
- Xie 等人(2024)Cost-aware Bayesian Optimization via the Pandora's Box Gittins Index
- Swersky 等人(2013)Multi-Task Bayesian Optimization
- Klein 等人(2017)Fast Bayesian Optimization of Machine Learning Hyperparameters on Large Datasets
- Kandasamy 等人(2017)Multi-fidelity Bayesian Optimisation with Continuous Approximations
- Wu 等人(2019)Practical Multi-fidelity Bayesian Optimization for Hyperparameter Tuning
- Li 等人(2018)Hyperband: A Novel Bandit-Based Approach to Hyperparameter Optimization
- Falkner 等人(2018)BOHB: Robust and Efficient Hyperparameter Optimization at Scale
- Ishibashi 等人(2023)A stopping criterion for Bayesian optimization by the gap of expected minimum simple regrets
- Wilson(2024)Stopping Bayesian Optimization with Probabilistic Regret Bounds
- Xie 等人(2026)Cost-aware Stopping for Bayesian Optimization
14.8 软件 #
多数实践者使用现成的库,本章中的许多决定由库的默认设置代为做出。表 14.1 列出了面向标量反馈贝叶斯优化的主要开源库,版本、日期和维护状态均截至 2026 年 9 月。
| 库 | 基于 | 说明 | 许可证 | 最新版本 |
|---|---|---|---|---|
| BoTorch(Balandat 等,2020) | PyTorch、GPyTorch | 蒙特卡洛采集函数、批量、约束、多目标、多保真度;自 0.12.0 起默认使用维度缩放先验和标准化 | MIT | 0.18.1,2026 年 6 月 8 日(Meta Platforms, Inc.,2026i) |
| Ax(Olson 等,2025) | BoTorch | 基于 BoTorch 的实验管理:搜索空间、试验、存储、自动选择方法 | MIT | 1.3.1,2026 年 6 月 9 日(Meta Platforms, Inc.,2026a) |
| Optuna(Akiba 等,2019) | 自有实现;高斯过程采样器使用 PyTorch | 默认采样器是 TPE,一种基于密度的方法(Bergstra 等,2011);自 3.6.0 起提供高斯过程采样器(Optuna contributors,2026) | MIT | 5.0.0,2026 年 9 月 7 日(Optuna developers,2026a) |
| SMAC3(Lindauer 等,2022) | 自有实现 | 随机森林或高斯过程代理模型;跨问题实例的算法配置 | BSD-3-Clause | 2.4.1,2026 年 9 月 10 日(AutoML.org,2026) |
| HEBO(Cowen-Rivers 等,2022) | PyTorch | 输入与输出扭曲,采集函数集成 | MIT | 0.3.6,2024 年 11 月 4 日(Huawei Noah's Ark Lab,2024) |
| Trieste | GPflow、TensorFlow | TensorFlow 生态中的高斯过程贝叶斯优化 | Apache-2.0 | 4.6.0,2026 年 6 月 17 日(Secondmind Labs,2026) |
| scikit-optimize | scikit-learn | 接口简单;代码仓库已归档 | BSD-3-Clause | 0.10.2,2024 年 6 月 4 日(scikit-optimize contributors,2024) |
| GPyOpt | GPy | 代码仓库已于 2023 年 1 月 17 日归档 | BSD-3-Clause | 1.2.6,2020 年 3 月 19 日(SheffieldML,2023) |
| Dragonfly | 自有实现 | 实际上已不再维护 | MIT | 0.1.7,2022 年 10 月 1 日(Dragonfly developers,2022) |
以下几点可供选择时参考。BoTorch 是研究型库:灵活,提供最新的采集函数,要求使用者具备一定的 PyTorch 知识。Ax 对 BoTorch 做了封装,面向希望运行实验而非编写采集函数的用户。Optuna 广泛用于机器学习的超参数优化,其默认采样器并非高斯过程;它的高斯过程采样器使用每个输入各有一个长度尺度的 Matérn 5/2 核,以及期望改进的对数形式及其约束、批量和多目标变体(Optuna contributors,2026)。SMAC 适合含大量类别参数和条件参数的问题。在这些库中,BoTorch 和 Ax 的核心包支持从比较中学习;第 31.1 节综述了偏好贝叶斯优化的软件。
import torch
from botorch.models import SingleTaskGP
from botorch.models.transforms import Normalize
from botorch.fit import fit_gpytorch_mll
from botorch.acquisition import qLogNoisyExpectedImprovement
from botorch.optim import optimize_acqf
from gpytorch.mlls import ExactMarginalLogLikelihood
# 玩具数据:对一个 3 输入函数做 12 次带噪声评估,目标为最大化
X = torch.rand(12, 3, dtype=torch.double) # n x d 的输入
Y = -(X - 0.5).square().sum(dim=-1, keepdim=True) # n x 1 的输出
Y = Y + 0.05 * torch.randn_like(Y)
bounds = torch.tensor([[0.0] * 3, [1.0] * 3], dtype=torch.double) # 2 x d:下界、上界
model = SingleTaskGP(X, Y, input_transform=Normalize(d=X.shape[-1]))
# 输出默认会被标准化(BoTorch >= 0.12)
fit_gpytorch_mll(ExactMarginalLogLikelihood(model.likelihood, model))
acqf = qLogNoisyExpectedImprovement(model, X_baseline=X)
batch, _ = optimize_acqf(acqf, bounds=bounds, q=4, sequential=True,
num_restarts=10, raw_samples=512)
optimize_acqf 执行算法 12.1 的多起点梯度上升:先筛选 raw_samples 个拟随机起点,再从其中有希望的点出发,运行 num_restarts 次 L-BFGS-B;设置 sequential=True 时,逐点构建含 4 个点的批量;默认的 sequential=False 则联合优化这 4 个点(Balandat 等,2020)。这段代码可在 BoTorch 0.18.1 下直接运行。
第 14.8 节引用的文献 16
- Balandat 等人(2020)BoTorch: A Framework for Efficient Monte-Carlo Bayesian Optimization
- Meta Platforms, Inc.(2026i)botorch release history
- Olson 等人(2025)Ax: A Platform for Adaptive Experimentation
- Meta Platforms, Inc.(2026a)ax-platform release history
- Akiba 等人(2019)Optuna: A Next-generation Hyperparameter Optimization Framework
- Bergstra 等人(2011)Algorithms for Hyper-Parameter Optimization
- Optuna contributors(2026)optuna.samplers.GPSampler, Optuna 5.0.0 documentation
- Optuna developers(2026a)optuna 5.0.0
- Lindauer 等人(2022)SMAC3: A Versatile Bayesian Optimization Package for Hyperparameter Optimization
- AutoML.org(2026)smac 2.4.1
- Cowen-Rivers 等人(2022)HEBO: An Empirical Study of Assumptions in Bayesian Optimisation
- Huawei Noah's Ark Lab(2024)HEBO 0.3.6
- Secondmind Labs(2026)trieste 4.6.0
- scikit-optimize contributors(2024)scikit-optimize 0.10.2
- SheffieldML(2023)GPyOpt (archived)
- Dragonfly developers(2022)dragonfly-opt 0.1.7
14.9 习题 #
25 次评估都位于最大值点,真实值为 ,噪声 相互独立。证明最大观测值的期望为 ,其中 是 个独立标准正态变量中最大者的期望,并把 写成积分。其值为 ;将其与图 14.1 中的虚线以及粗略近似 比较。
解答
最大观测值为 ,其中 服从标准正态分布,因此 次评估时其期望为 。 个独立标准正态变量中最大者的分布函数为 ,密度为 ,所以 。数值计算得 。图中的虚线即 25 次评估后的平均高估量, 时为 0.19, 时为 0.99,接近 ,尽管这 25 次评估并非都位于顶部。近似值 偏高,它只是一个收敛很慢的展开式的首项。
设在 处评估的效用为:若 处所有约束都满足,则为改进量 ,否则为 0。证明:若在后验下 与约束值 相互独立,则期望效用就是式(14.2)。若某个约束与目标函数相关,例如最快的模型同时也占用最多内存,情况会有什么变化?
解答
效用为 ,其中 。若 与该指示函数相互独立,乘积的期望就等于期望的乘积:,即以最好可行值为基准的 乘以可行概率。存在相关性时,这一分解不再成立。若较高的目标值往往伴随着违反约束,该乘积就会高估期望效用,因为改进恰恰在最不可能可行的地方最大;此时需要对目标函数和约束联合建模,并用蒙特卡洛方法估计期望。
位置参数为 、尺度参数为 的对数正态分布,其众数为 。BoTorch 维度缩放长度尺度先验的参数为 ,,计算其众数;并在 时,与单位立方体中两个均匀随机点之间的均方根距离 比较。
解答
众数为 : 时分别为 0.29、0.65、1.45,典型距离分别为 0.58、1.29、2.89。两者之比为常数 ,因此在任何维度下,典型的点对都相隔约两个长度尺度。若采用众数在 0.5 附近的固定先验, 时它们将相隔约 5.8 个长度尺度,此时径向基函数核的值为 ,约为 。
在 处加入一个无噪声的虚拟观测,其值等于后验均值 。证明后验均值处处不变,而 处的后验方差变为零。这对克里金信念的下一个选择有何影响?悲观的常数谎言值又会如何改变这一选择?
解答
依次应用式(8.2),在 处加入观测 会使 处的均值改变 ,其中 是当前的后验协方差。 时修正量为零,因此均值处处不变。方差的更新不依赖于 ,在 处方差变为 。因此 处的期望改进降为 ,附近方差已缩小之处的期望改进也随之下降,下一个最大值点于是移开,但移开的距离仅限于方差缩小所及的范围。悲观的谎言值 还会降低 周围的后验均值,进一步减小那里的期望改进,把下一个点推得更远。
延伸阅读 #
- Snoek 等人(2012)是将贝叶斯优化引入机器学习实践的论文,短短几页涵盖了 Matérn 5/2 核、对超参数取平均、每秒期望改进和并行评估。
- Balandat 等人(2020)介绍了 BoTorch 的设计:蒙特卡洛采集函数、样本平均近似和“一次性”(one-shot)知识梯度。其附录说明了如何最大化采集函数。
- Garnett(2023)在第 9 章讨论实现,在第 11 章讨论约束、批量、成本和多目标等扩展。
- Eriksson 等人(2019)与 Hvarfner 等人(2024)篇幅简短、易于阅读,分别从相反的方向切入高维贝叶斯优化;第 30 章介绍了此后的进展。
- Letham 等人(2019)展示了贝叶斯优化在真实在线实验中的运行,涉及噪声与约束,并说明了每个选择背后的理由。
参考文献
- (2019). Optuna: A Next-generation Hyperparameter Optimization Framework. Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD 2019). 引用于 §14.8
- (2023). Unexpected Improvements to Expected Improvement for Bayesian Optimization. Advances in Neural Information Processing Systems 36 (NeurIPS 2023). 引用于 §14.2
- (2026). smac 2.4.1. PyPI. 软件引用于 §14.8
- (2020). BoTorch: A Framework for Efficient Monte-Carlo Bayesian Optimization. Advances in Neural Information Processing Systems 33 (NeurIPS 2020). 引用于 §14.2 §14.3 §14.8
- (2011). Algorithms for Hyper-Parameter Optimization. Advances in Neural Information Processing Systems 24 (NeurIPS 2011). 引用于 §14.8
- (2022). HEBO: An Empirical Study of Assumptions in Bayesian Optimisation. Journal of Artificial Intelligence Research. 引用于 §14.1 §14.8
- (2020). Differentiable Expected Hypervolume Improvement for Parallel Multi-Objective Bayesian Optimization. Advances in Neural Information Processing Systems 33 (NeurIPS 2020). 引用于 §14.5
- (2021). Parallel Bayesian Optimization of Multiple Noisy Objectives with Expected Hypervolume Improvement. Advances in Neural Information Processing Systems 34 (NeurIPS 2021). 引用于 §14.5
- (2014). Parallelizing Exploration-Exploitation Tradeoffs in Gaussian Process Bandit Optimization. Journal of Machine Learning Research. 引用于 §14.3
- (2026). We Still Don't Understand High-Dimensional Bayesian Optimization. AISTATS 2026 (best student paper). 引用于 §14.6
- (2022). dragonfly-opt 0.1.7. PyPI. 软件引用于 §14.8
- (2006). Single- and Multiobjective Evolutionary Optimization Assisted by Gaussian Random Field Metamodels. IEEE Transactions on Evolutionary Computation. 引用于 §14.5
- (2021). High-Dimensional Bayesian Optimization with Sparse Axis-Aligned Subspaces. Uncertainty in Artificial Intelligence. 引用于 §14.6
- (2019). Scalable Global Optimization via Local Bayesian Optimization. Advances in Neural Information Processing Systems 32 (NeurIPS 2019). 引用于 §14.6
- (2018). BOHB: Robust and Efficient Hyperparameter Optimization at Scale. International Conference on Machine Learning. 引用于 §14.7
- (2018). A Tutorial on Bayesian Optimization. arXiv. 预印本引用于 §14.6
- (2014). Bayesian Optimization with Inequality Constraints. Proceedings of the 31st International Conference on Machine Learning (ICML 2014). 引用于 §14.4
- (2023). Bayesian Optimization. Cambridge University Press.
- (2014). Bayesian Optimization with Unknown Constraints. Conference on Uncertainty in Artificial Intelligence (UAI 2014). 引用于 §14.4
- (2010). Kriging Is Well-Suited to Parallelize Optimization. Computational Intelligence in Expensive Optimization Problems. 引用于 §14.3
- (2016). Batch Bayesian Optimization via Local Penalization. International Conference on Artificial Intelligence and Statistics. 引用于 §14.3
- (2024). HEBO 0.3.6. PyPI. 软件引用于 §14.8
- (2011). Sequential Model-Based Optimization for General Algorithm Configuration. Learning and Intelligent Optimization (LION 5). 引用于 §14.1
- (2024). Vanilla Bayesian Optimization Performs Great in High Dimensions. International Conference on Machine Learning. 引用于 §14.6
- (2023). A stopping criterion for Bayesian optimization by the gap of expected minimum simple regrets. International Conference on Artificial Intelligence and Statistics. 引用于 §14.7
- (2015). High Dimensional Bayesian Optimisation and Bandits via Additive Models. International Conference on Machine Learning. 引用于 §14.6
- (2017). Multi-fidelity Bayesian Optimisation with Continuous Approximations. International Conference on Machine Learning. 引用于 §14.7
- (2018). Parallelised Bayesian Optimisation via Thompson Sampling. International Conference on Artificial Intelligence and Statistics. 引用于 §14.3
- (2017). Fast Bayesian Optimization of Machine Learning Hyperparameters on Large Datasets. Artificial Intelligence and Statistics. 引用于 §14.7
- (2006). ParEGO: A Hybrid Algorithm with On-line Landscape Approximation for Expensive Multiobjective Optimization Problems. IEEE Transactions on Evolutionary Computation. 引用于 §14.5
- (2019). Constrained Bayesian Optimization with Noisy Experiments. Bayesian Analysis. 引用于 §14.2 §14.4
- (2020). Re-Examining Linear Embeddings for High-Dimensional Bayesian Optimization. Advances in Neural Information Processing Systems 33 (NeurIPS 2020). 引用于 §14.6
- (2018). Hyperband: A Novel Bandit-Based Approach to Hyperparameter Optimization. Journal of Machine Learning Research. 引用于 §14.7
- (2022). Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes. International Conference on Artificial Intelligence and Statistics. 引用于 §14.5
- (2022). SMAC3: A Versatile Bayesian Optimization Package for Hyperparameter Optimization. Journal of Machine Learning Research. 引用于 §14.8
- (2026a). ax-platform release history. PyPI. 软件引用于 §14.8
- (2026e). BoTorch CHANGELOG. GitHub. 软件引用于 §14.1 §14.2 §14.6
- (2026i). botorch release history. PyPI. 软件引用于 §14.8
- (2026k). botorch/models/utils/gpytorch_modules.py. GitHub. 软件引用于 §14.6
- (2025). Ax: A Platform for Adaptive Experimentation. International Conference on Automated Machine Learning. 引用于 §14.8
- (2026). optuna.samplers.GPSampler, Optuna 5.0.0 documentation. Read the Docs. 软件引用于 §14.1 §14.8
- (2026a). optuna 5.0.0. PyPI. 软件引用于 §14.8
- (2025b). Understanding High-Dimensional Bayesian Optimization. ICML 2025, PMLR 267:47902-47923. 引用于 §14.6
- (2013). A Benchmark of Kriging-Based Infill Criteria for Noisy Optimization. Structural and Multidisciplinary Optimization. 引用于 §14.2
- (2024). scikit-optimize 0.10.2. PyPI; the GitHub repository is archived. 软件引用于 §14.8
- (2026). trieste 4.6.0. PyPI. 软件引用于 §14.8
- (2023). GPyOpt (archived). GitHub. 软件引用于 §14.8
- (2012). Practical Bayesian Optimization of Machine Learning Algorithms. Advances in Neural Information Processing Systems 25 (NeurIPS 2012). 引用于 §14.1 §14.3 §14.7
- (2014). Input Warping for Bayesian Optimization of Non-Stationary Functions. International Conference on Machine Learning. 引用于 §14.1
- (2015). Safe Exploration for Optimization with Gaussian Processes. Proceedings of the 32nd International Conference on Machine Learning (ICML 2015). 引用于 §14.4
- (2018b). Stagewise Safe Bayesian Optimization with Gaussian Processes. International Conference on Machine Learning. 引用于 §14.4
- (2013). Multi-Task Bayesian Optimization. Advances in Neural Information Processing Systems 26 (NeurIPS 2013). 引用于 §14.7
- (2016). Bayesian Optimization in a Billion Dimensions via Random Embeddings. Journal of Artificial Intelligence Research. 引用于 §14.6
- (2024). Stopping Bayesian Optimization with Probabilistic Regret Bounds. NeurIPS 2024. 引用于 §14.7
- (2018). Maximizing Acquisition Functions for Bayesian Optimization. Advances in Neural Information Processing Systems 31 (NeurIPS 2018). 引用于 §14.3
- (2019). Practical Multi-fidelity Bayesian Optimization for Hyperparameter Tuning. Uncertainty in Artificial Intelligence (UAI 2019). 引用于 §14.7
- (2024). Cost-aware Bayesian Optimization via the Pandora's Box Gittins Index. NeurIPS 2024. 引用于 §14.7
- (2026). Cost-aware Stopping for Bayesian Optimization. International Conference on Machine Learning. 引用于 §14.7
- (2025b). Standard Gaussian Process is All You Need for High-Dimensional Bayesian Optimization. ICLR 2025 (oral). 引用于 §14.1 §14.6