高维问题与贝叶斯优化格局的变化
一条广为流传的经验法则认为,贝叶斯优化适用于少数几个输入,输入超过 10 或 20 个便不再奏效。Frazier 的教程(一篇许多论文都引用的预印本)称该方法“最适合维度低于 20 的连续定义域上的优化”(Frazier,2018);一篇 2025 年的论文将通行看法概括为“优化变量的个数不应超过 15 或 20”(Xu 等,2025b)。这条法则用于偏好贝叶斯优化似乎更为稳妥:一次比较至多携带一个比特,第 19 章中的方法也几乎从未在 20 维以上测试过。
2024 年至 2026 年 9 月,标量反馈下的贝叶斯优化研究(即第三部分中的普通设定,每次评估返回一个数值)出现了四项对偏好有意义的变化:研究者把高维中的失效归因于长度尺度先验及其初始化,而非维度本身;预训练代理模型进入了主要的软件库;语言模型进入了优化循环;成本感知停止规则有了理论保证。本章依次讨论这四项变化,并逐一考察其中哪些结论可以迁移到成对比较似然上。
引言引用的文献 2
- Frazier(2018)A Tutorial on Bayesian Optimization
- Xu 等人(2025b)Standard Gaussian Process is All You Need for High-Dimensional Bayesian Optimization
30.1 诊断:长度尺度先验 #
问题的核心量是核函数的长度尺度(lengthscale;第 9.1 节、第 9.2 节)。粗略地说,它表示沿某个输入移动多远之后,函数值与起点处的值基本无关。软件为长度尺度设定先验,并通过最大化边际似然与对数先验之和来拟合它(第 9.4 节):从先验的众数(mode),即最可能的取值出发,沿梯度方向迭代。
30.1.1 四篇论文,同一诊断 #
Hvarfner 等人(2024)(ICML 2024)将标准高斯过程贝叶斯优化在高维中的失效,归因于常用先验赋予目标函数的复杂度:长度尺度大小固定时,这类先验假定输入众多的函数过于复杂,远非现有数据所能学会。他们的修正是让长度尺度先验随维度缩放。经此改动,标准贝叶斯优化在五个真实任务中的三个(Mopta08 与 Ant 除外)上表现最好,胜过专为高维设计的方法。他们还观察到常用先验对搜索过程的影响:在 6 维 Hartmann 函数上,采用传统先验并以最大后验估计拟合的贝叶斯优化,“实际上是在做一次初始随机搜索,再接 140 次迭代的局部搜索”。BoTorch 将这一修正实现为对数正态先验,位置参数为 ( 为输入维度),尺度参数为 ;长度尺度初始化为先验的众数,并约束在 0.025 以上(Meta Platforms, Inc.,2026k)。
Xu 等人(2025b)(ICLR 2025)在 12 个基准上比较了多种方法,发现采用 Matérn 核的标准贝叶斯优化始终位居前列,而径向基函数(平方指数)核常常失败。他们将失败追溯到初始长度尺度:初始值过短时,用于拟合长度尺度的梯度会消失(vanish),即小到优化器根本无法移动长度尺度。若将核函数写作 ,则每个长度尺度梯度中都含有同一个因子;一旦缩放距离 超过 6.58,该因子便低于双精度运算的舍入单位。在一项输入均匀采样的数值检验中,径向基函数核的梯度在初始值为 0.5 或 0.693 时从 200 维开始消失,初始值为 1 时从 400 维开始消失,初始值为 时直到 600 维都没有消失;稳健的初始化无需额外的先验即可解决这一问题。
Papenmeier 等人(2025b)(ICML 2025)同样发现,“高斯过程初始化方案造成的梯度消失,是高维贝叶斯优化失败的一个主要原因”;而且只需对长度尺度做最大似然估计、不加任何先验,就足以达到最先进的性能。初始长度尺度取常数 时,他们的运行结果在 124 维的 Mopta08 和 180 维的 Lasso-DNA 基准上令人满意,但在 888 维的 Ant 和 6,392 维的 Humanoid 任务上失败。Hvarfner 等人(2025)(NeurIPS 2025)进一步指出,空间填充的初始设计,即启动循环的常用方式(第 11.4 节),不利于超参数的学习;他们在选取最初的点时,也兼顾这些点为超参数提供的信息。
四篇论文的诊断一致:长度尺度的先验或初始值大小固定时,随着维度增长,点与点之间的核函数值会坍缩到零附近,超参数的梯度也随之坍缩。让长度尺度随维度的平方根缩放,无论通过先验还是通过最大似然拟合的初始值实现,都能消除与专门高维方法之间的大部分差距(推断,综合以上论文)。
30.1.2 直观理解这一诊断 #
为什么是维度的平方根?因为典型距离正是按这一速度增长。下面的推导只需用到均匀随机数的期望。
设 与 相互独立,均服从单位立方体 上的均匀分布,记二者之间的距离为 。
- 距离的平方可按坐标分解为 ,其中 ;各坐标相互独立,因此各 也相互独立。
- 考虑单个坐标。设 相互独立,均服从 上的均匀分布,则 ,。展开平方得 ,即 。
- 由期望的线性性,。均方根距离为 : 时约为 1.3, 时约为 2.9, 时约为 4.1。
- 类似地可算得 ,故 ;再由独立性得 。
- 相对于均值的离散程度为 ,随 增大而减小:在高维中,几乎任意两点之间的距离都相差无几。
- 对 本身,将平方根在 附近做一阶展开,得其标准差约为 ,化简为 ,与维度无关。因此,距离的分布是一个宽度固定的鼓包,其位置按 向右移动。
- 按 BoTorch 的约定,径向基函数核为 。在典型距离处,。 固定时,它随 线性下降: 时,每增加约 7.4 维,核函数值就下降一个数量级。
- 若改为 ,指数为 ,与维度无关。BoTorch 维度缩放先验的众数为 ,即 ,故 ,指数约为 1.99;无论维度多少,典型点对的核函数值都是 。
- 边际似然对长度尺度的每个梯度都经由核函数值计算:对每个输入各有一个长度尺度 的径向基函数核,。 坍缩时,梯度的每一项都随之坍缩。
图 30.1 将这一点直观地呈现出来。读者可选择维度;上图为两个随机点之间距离的精确分布,下图为各默认设置在每个距离上的核函数值。
可以尝试以下几点:
- 从 开始。两个长度尺度都落在距离的分布范围内,两种核函数给出的典型点对核函数值都在 0.1 至 1 之间。
- 调到 ,即经验法则的边界。此时典型点对相距约 3.5 个 PairwiseGP 长度尺度,核函数值接近 ;维度缩放的长度尺度则随距离一同右移,典型核函数值仍约为 0.14。
- 时,在 PairwiseGP 默认设置下,典型点对相距 5.6 个长度尺度,核函数值为 :涉及某个点的比较,对其他典型点处的效用几乎不提供任何信息。
- 继续增大维度。PairwiseGP 的典型核函数值在约 处降到双精度线以下,到 时接近 ;蓝色圆点则随中位距离右移,高度不变。
- 切换到 optuna-dashboard。其 Matérn 3/2 核按 而非 衰减,因此尽管长度尺度更短, 时典型点对仍有 。Xu 等人发现 Matérn 核远不易出现梯度消失,其机制正在于此。
由这张图还可以定出两种说法各自对应的维度(我们的计算)。在 PairwiseGP 的默认设置下,典型点之间的核函数值从约 起便接近于零(此时 约为 ),但要到约 120 维以上才低于双精度舍入单位。Xu 等人的阈值 6.58 针对的是不含因子 的核函数的梯度因子 ;在 BoTorch 的约定下,它对应 ,典型点对约在 时达到这一值(推断)。在偏好研究所涉及的 20 至 100 维中,默认的偏好模型处于核函数值接近于零的区间:超参数梯度即使没有因舍入而丢失,也已经很小。
接下来的问题是,这种先验信念会如何影响整个优化过程。图 30.2 重放了标量贝叶斯优化的若干次记录运行。目标函数是以无关输入填充的 6 维 Hartmann 函数;先验取两种之一;期望改进在两种候选集之一上最大化:只取均匀随机候选点,或在这些候选点之外再加入对目前最佳点的扰动,后者正是 Papenmeier 等人指出的局部移动。只有六个输入起作用,因此这是有效维度较低的有利情形。
第 9.5.1 节对这些运行有详细解读:维度缩放先验如设计所愿,给起作用的六个输入赋予较短的长度尺度,并使其余大部分输入不起作用,但这一差别在遗憾上几乎看不出来。采集函数的搜索加入局部扰动时,两种先验在 6 至 50 维的每个维度上都达到 0.08 至 0.19 的中位遗憾,随机搜索则为 1.26 至 1.75;只用全局随机候选点时,两者在 50 维上都进展甚微(中位遗憾在固定尺度先验下为 0.89,在缩放先验下为 1.21)。在这些运行中,采集函数如何搜索比模型采用哪种先验更重要,这正是第 30.2 节中 Papenmeier 等人的观点。六个种子、一个测试函数和 80 次评估不足以了结这场争论;而且预算增加时,已正确识别出相关输入的维度缩放先验是更好的模型(推断)。
第 30.1 节引用的文献 5
- Hvarfner 等人(2024)Vanilla Bayesian Optimization Performs Great in High Dimensions
- Meta Platforms, Inc.(2026k)botorch/models/utils/gpytorch_modules.py
- Xu 等人(2025b)Standard Gaussian Process is All You Need for High-Dimensional Bayesian Optimization
- Papenmeier 等人(2025b)Understanding High-Dimensional Bayesian Optimization
- Hvarfner 等人(2025)Informed Initialization for Bayesian Optimization and Active Learning
30.2 修正为何有效:尚有争议 #
这些论文对问题出在哪里看法一致,对修正为何有效却意见分歧。三种解释相互竞争:维度缩放的模型本身就是良好的全局代理模型;成功来自局部搜索;基准问题比其维度所显示的更容易。
局部搜索的解释。Papenmeier 等人(2025b)给出经验证据,表明“贝叶斯优化在极高维问题(1,000 维量级)上的良好表现来自局部搜索行为,而非拟合良好的代理模型”。他们的方法 MSR 由两部分组成:以维度缩放的初始长度尺度做最大似然估计;为采集函数的搜索提供起始候选点。这些候选点由观测点中最好的 5% 扰动而来,其中一半扰动全部坐标,另一半扰动一个平均约含 20 个坐标的随机子集。MSR 在 124 维的 Mopta08 和 888 维的 Ant 任务上胜过维度缩放先验,在其他任务上略逊。
基准容易的解释。同一篇论文在正文和附录 D 中论证,180 维的 Lasso-DNA 和 124 维的 Mopta08 这两个常用基准“并不像其名义上的输入变量个数所显示的那样真正高维”:在已找到的最优解中,许多变量位于搜索空间的边界上,而且各方法都收敛到相近的、较长的长度尺度。作者警告,算法有“‘过拟合’于这些基准”的风险。
最有力的挑战。Doumont 等人(2026)获得了 AISTATS 2026 最佳学生论文奖。该文先将输入映射到球面上,再用贝叶斯线性回归(即采用线性核的高斯过程)取代高斯过程。这一映射至关重要:他们证明,线性模型若配以随后验均值和方差递增的采集函数,所提出的点总有至少一个坐标落在搜索空间的边界上,球面映射则消除了这种拉力。该方法在 60 至 6,000 维的任务上达到了最先进方法的水平;线性模型的计算成本随数据量线性增长,因此他们在分子任务上将其扩展到 20,000 多个观测。他们的分析表明,“模型的表达力和在随机测试点上的预测精度,未必能转化为在自适应选取的数据上的优化性能”。另有两项相关结果涉及搜索本身:一是衡量采集函数探索程度的指标及其与性能的关系(Papenmeier 等,2025a)(UAI 2025);二是 Thompson 采样的候选集随维度增长而呈指数级稀疏(Fan 与 Pleiss,2026)(AISTATS 2026)。
Doumont 等人反对的观点是:表达力强的非参数模型是成功的关键;他们并不反对把维度缩放作为一种做法(推断)。无论机制如何,实践的方向是清楚的:在常见的高维基准上,简单的方法(例如带输入映射的线性模型,或带局部扰动的最大似然)与复杂的方法表现相当。
第 30.2 节引用的文献 4
- Papenmeier 等人(2025b)Understanding High-Dimensional Bayesian Optimization
- Doumont 等人(2026)We Still Don't Understand High-Dimensional Bayesian Optimization
- Papenmeier 等人(2025a)Exploring Exploration in Bayesian Optimization
- Fan 与 Pleiss(2026)Adaptive Candidate Point Thompson Sampling for High-Dimensional Bayesian Optimization
30.3 重述维度上限 #
偏好优化文献中常见一种说法:高斯过程偏好贝叶斯优化在 10 至 20 维以上会失效。本节对照证据检验这一说法,并代之以一个注明适用条件的表述。
30.3.1 偏好研究涉足过的维度 #
偏好贝叶斯优化的经验研究几乎都限于 20 维以内。早期的子空间方法把每次查询限制在穿过当前最优点的一维或二维切片上(第 20.2 节、第 20.3 节):序列线搜索(Koyama 等,2017)让人操作一个滑块;序列画廊(Sequential Gallery)的平面搜索(Koyama 等,2020)在合成的 Rosenbrock 函数上做到了 20 维,处理过 12 维的照片增强和 10 维的人体体形空间,并将 20 维以上列为未解决的问题;投影偏好贝叶斯优化(PPBO)(Mikkola 等,2020)最高在 20 维 Ackley 函数上测试过,该实验共耗时 24 小时。Astudillo 等人(2023)将其 4 至 7 维的 qEUBO 实验称为中等维度(大于 3)上更具挑战性的问题,并指出早先的工作大多局限于低维。有人类被试参与的维度最高的研究是 GimmBO(Liu 等,2026b)(SIGGRAPH North America 2026,发表于 ACM Transactions on Graphics),它根据偏好优化 20 至 30 个扩散模型适配器的合并权重。其用户研究的输入为 20 维,12 名被试在三种界面上各完成 20 次迭代;其两阶段后端利用了稀疏性和受限的权重范围。
30.3.2 软件的默认设置 #
偏好软件没有跟进标量方面的修正。BoTorch 0.12.0(2024 年 9 月 17 日)将大多数模型改为维度缩放的对数正态先验,其更新日志明确写道:“唯一没有改变的模型,是全贝叶斯模型和 PairwiseGP”(Meta Platforms, Inc.,2026e)。在 0.18.1(2026 年 6 月 8 日)中,PairwiseGP 默认仍采用径向基函数核与 Gamma(2.4, 2.7) 长度尺度先验(Meta Platforms, Inc.,2026h);optuna-dashboard 0.21.0(2026 年 9 月 10 日)的偏好采样器默认采用 Matérn 3/2 核与 Gamma(5, 10) 先验(Optuna developers,2026c;Optuna developers,2026b)。两者都与维度无关(表 31.2)。据 BoTorch 源代码计算,单位立方体上维度缩放先验的众数(也是其初始长度尺度)在 、10、20、50 与 100 时分别约为 0.29、0.65、0.92、1.45 与 2.05,而 PairwiseGP 在所有维度上都约为 0.52,optuna-dashboard 为 0.4。随机点之间相距约 , 时为 2.9, 时为 4.1。按第 30.1.2 节对程度的区分,默认的偏好模型正处于 Xu 等人与 Papenmeier 等人所指出的区间(推断,经计算;未在 PairwiseGP 上直接验证)。
30.3.3 从比较中学习长度尺度 #
如何从成对数据中学习长度尺度,这一问题本身就很少有人研究。第 27.6 节列出了现有做法,从配合 Laplace 模型证据的弱 Gamma 先验(BoTorch),到几乎将长度尺度固定的紧对数正态先验(Koyama 等,2020)。在 BoTorch 的概率单位参数化中,噪声尺度固定为 1,因此输出尺度相当于噪声水平的倒数;输出尺度和长度尺度都只能从比较中联合学习(Meta Platforms, Inc.,2026h)。我们没有找到任何研究检验在人类可承受的预算(几十到一两百次比较)下能否从比较中识别长度尺度或输出尺度,也没有找到任何论文把 Hvarfner 等人的维度缩放先验、Xu 等人的稳健初始化或 MSR 初始化用于成对似然或排序似然。这两个问题在任何人参与之前即可通过模拟回答:在上述预算下,由已知长度尺度模拟出比较并据此拟合模型,分别加入和不加维度缩放先验,检查拟合能否恢复这些长度尺度,并考察 Laplace 模型证据下超参数梯度的形态(推断)。
理论方面,Ziomek 等人(2024)(NeurIPS 2024)指出,若目标函数在尚未探索的区域更粗糙,长度尺度的最大似然估计就可能设定错误。他们的方法同时保留若干个候选长度尺度,其遗憾(第 13 章)与已知超参数时的遗憾只相差一个 因子,早先的 A-GP-UCB 则相差一个 因子;但该方法尚未与成对似然结合。
30.3.4 重述后的说法 #
因此,证据支持将 10 至 20 维法则视为对默认配置的经验描述,而非偏好反馈固有的极限:标量方面的证据表明,同样的经验阈值主要源于默认先验,而偏好软件仍在使用这类先验(推断)。更准确的表述如下。
采用固定尺度(不随维度缩放)的长度尺度先验和全局采集函数时,高斯过程偏好贝叶斯优化在约 10 至 20 维以上性能下降。标量方面的证据表明,当评估次数约为维度的十倍、且有效维度较低时,维度缩放先验结合局部搜索或信赖域搜索可以在几十到几百维上奏效。在 50 至 200 次比较的预算下,这一结论对人类的成对反馈是否成立,是第 30.3.3 节中的未解决问题。
这一表述依赖五个条件,见表 30.1。
| 条件 | 内容 | 依据 |
|---|---|---|
| 预算 | 标量方面的成功案例所用观测数约与维度相当或更多( 高达 6,000 时约 1,000 个观测);局部偏好贝叶斯优化每个维度约用十次比较(64 维时约 640 次,102 维时约 1,500 次);一次真人会话通常容许几十到一两百次比较 | Doumont 等 2026;Menn 等 2026;(推断) |
| 每次查询的信息量 | 每次查询至多一个比特;与梯度相比,Laplace 后验均值的 Hessian 矩阵对长度尺度、核矩阵的条件数和采样点的局部几何更为敏感 | Menn 等 2026,引理 1 及其后的讨论;Kayal 等 2025(Kayal 等,2025)只给出速率 |
| 人的噪声 | 现有的高维偏好研究模拟的是同方差噪声(函数值域的 10%);真实比较存在不可传递性、漂移和疲劳,这些论文均未对其建模 | Menn 等 2026;第 31.7 节 |
| 有效维度 | 取得成功的基准往往只有少数变量有影响,或最优点位于边界上;GimmBO 在 20 至 30 维上依赖稀疏结构 | Papenmeier 等 2025,附录 D;Liu 等 2026 |
| 起始点 | 局部方法需要合理的初始区域,否则会停留在较差的局部最优点 | Menn 等 2026 |
重述后的表述还需附带一点提醒:维度缩放先验并不能使长度尺度从数据中变得可识别,它以更强的光滑性先验信念代替数据,仅当真实效用确实光滑或有效维度较低时才有帮助(推断)。
30.3.5 20 维以上的做法 #
对于输入超过 20 个的偏好问题,按证据支持程度从高到低,可选做法如下(推断)。第一,降低人所面对的维度:例如像序列画廊处理体形空间那样,在生成模型的低维潜空间中优化;或像 Granley 等人(2023)(NeurIPS 2023)那样,只优化少数几个因患者而异的参数。第二,鉴于 Doumont 等人的结果,考虑采用线性效用模型。这两种做法都源于问题本身的结构,不依赖高斯过程框架。第三,若保留 PairwiseGP,则为其传入维度缩放的核函数,或采用 Xu 等人或 Papenmeier 等人的初始化,并先在模拟比较上自行验证结果:这属于高斯过程框架内部的修补,尚未在成对反馈下检验过。
from botorch.models import PairwiseGP
from botorch.models.utils.gpytorch_modules import get_covar_module_with_dim_scaled_prior
from gpytorch.kernels import ScaleKernel
D = X.shape[-1]
# 除非 covar_module 是 ScaleKernel,否则 PairwiseGP 会报错。自定义的
# ScaleKernel 不会沿用默认设置的输出尺度先验
# ([0.01, 100] 上的 SmoothedBox)及其约束([0.005, 200]);如有需要,
# 请自行添加。基础核函数是径向基函数核,长度尺度先验为
# LogNormal(sqrt(2) + log(D)/2, sqrt(3)),初始化在众数处。
covar = ScaleKernel(get_covar_module_with_dim_scaled_prior(ard_num_dims=D))
model = PairwiseGP(X, comparisons, covar_module=covar)
注释内容依据两个源文件的实现(Meta Platforms, Inc.,2026h;Meta Platforms, Inc.,2026k)。
第 30.3 节引用的文献 13
- Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
- Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
- Mikkola 等人(2020)Projective Preferential Bayesian Optimization
- Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
- Liu 等人(2026b)GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization
- Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
- Meta Platforms, Inc.(2026h)BoTorch PairwiseGP source code pairwise_gp.py
- Optuna developers(2026c)optuna-dashboard PreferentialGPSampler source code gp.py
- Optuna developers(2026b)optuna-dashboard 0.21.0
- Ziomek 等人(2024)Bayesian Optimisation with Unknown Hyperparameters: Regret Bounds Logarithmically Closer to Optimal
- Kayal 等人(2025)Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds
- Granley 等人(2023)Human-in-the-Loop Optimization for Deep Stimulus Encoding in Visual Prostheses
- Meta Platforms, Inc.(2026k)botorch/models/utils/gpytorch_modules.py
30.4 局部偏好贝叶斯优化 #
将偏好贝叶斯优化推进到约 100 维的唯一工作,是 Menn 等人(2026a)提出的局部偏好贝叶斯优化,该文为预印本(第 1 版发布于 2026 年 6 月 1 日,第 2 版发布于 6 月 8 日)。作者认为,现有方法“由于采用全局搜索,难以高效地优化超出低维和中等维度的问题”。他们从标量高维优化中借鉴了两种思路。TuRPBO 是 TuRBO 的偏好版本:TuRBO 把每次查询限制在一个信赖域(trust region)内,即围绕当前最优点的一个盒子,成功后扩大,失败后缩小。GIPBO 与 PrefSQP 则沿后验的导数方向前进:PrefSQP 得名于序列二次规划,依据 Laplace 后验均值的梯度和 Hessian 矩阵(二阶导数矩阵)确定每一步。
实验涵盖 8、16、32、64 与 96 维的高斯过程样本路径;Hartmann(6 维)、Rosenbrock(16 维)、Levy(32 维)与 Styblinski-Tang(64 维)测试函数;以及 MuJoCo 中 Hopper(33 维)与 Walker2D(102 维)两个模拟机器人的线性控制策略。预算在合成任务上为 次评估,在策略搜索上为 次随机预热评估加 次迭代,其中 为维度;对大多数方法, 次评估产生 次比较。比较以高斯噪声模拟,标准差为函数值域的 10%。模型为采用径向基函数核的 BoTorch PairwiseGP,长度尺度在单位立方体上约束在 [0.05, 0.5] 内。基线为 qEUBO、配合期望改进的幻觉信念(第 19.3 节)、GLISp(第 27.3 节)和 Sobol 序列(一组准随机、均匀分布的点)。
局部方法“在高维、短长度尺度的问题上表现出色”。作者也指出了局限:对非常光滑的函数,局部性帮助不大;“只有两个初始点时,局部方法可能陷入较差的局部最优,表现不如全局基线”;局部偏好贝叶斯优化在“先验知识或现有控制器提供了合理的起始区域时”最有用;合成基准和策略搜索基准“并不能完全刻画人类偏好的结构”。
这一比较存在混杂。[0.05, 0.5] 的长度尺度约束适用于所有基于 PairwiseGP 的方法,包括 qEUBO 基线。它排除了维度缩放先验会选取的较长长度尺度(50 维时约 1.45,100 维时约 2.05),使全局基线处于 Xu 等人与 Papenmeier 等人所指出的退化区间。作者给出的理由是局部方法需要避免步长过大;论文没有引用 Hvarfner 等人、Xu 等人或 Papenmeier 等人的任何一篇。凡是需要学习超参数的设定,都存在这种混杂;论文在高斯过程样本路径上还报告了超参数已知的设定(真实长度尺度为 0.1 与 0.5),此时该界不起约束作用。公平的检验应当先为 qEUBO 配上维度缩放先验,再与局部方法比较(推断)。图 30.3 显示了 64 维时这一影响的大小。
从查询设计的角度看,局部方法延续了第 30.3.1 节中的子空间方法和 LineCoSpar(Tucker 等,2020a)的思路:缩小每次查询必须搜索的区域(推断)。
第 30.4 节引用的文献 2
- Menn 等人(2026a)Local Preferential Bayesian Optimization
- Tucker 等人(2020a)Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits
30.5 预训练代理模型与上下文代理模型 #
应对数据稀缺的另一条途径,是从大量合成问题中学习先验本身。先验拟合网络(prior-data fitted network,PFN)是一种神经网络,在从选定的函数先验中抽取的海量小数据集上训练;输入一个新的小数据集,只需一次前向传播即可输出后验预测分布,无需任何拟合。这就是上下文学习(in-context learning):数据集是输入,而非训练集。TabPFN 是面向表格数据的这类模型。Müller 等人(2025)(ICML 2025)在一篇立场论文中主张,先验拟合网络是数据稀缺问题中贝叶斯预测的未来。BoTorch 在 0.14.0(2025 年 5 月 6 日)中集成了 PFN 代理模型,到 0.17.0(2026 年 2 月)又陆续加入了 Ax 兼容、蒙特卡洛采集函数和带噪声批量期望改进(Meta Platforms, Inc.,2026e)。这些模型位于 botorch_community 包中,该包没有成对模型或偏好模型。
校准方面的证据来自超参数优化。Rogers 与 Ponnada(2026)(据 Amazon Science 页面为 AutoML 2026 论文;我们没有找到 arXiv 版本)将 TabPFN v2 用作零样本代理模型,不在当前任务上做任何训练。在超参数优化基准 HPO-B 的 16 个搜索空间上,预算为 50 次试验时,它胜过 7 个基线中的 5 个,与另外 2 个持平;其 95% 区间的经验覆盖率在 HPO-B 上为 0.94,在第二个基准 YAHPO-Gym 上为 0.95,即本应包含 95% 真实值的区间实际包含了 94% 至 95%。作者列出的局限包括:每个搜索空间只有五个随机种子、需要 GPU、所有评估都来自超参数优化基准。高维方面只有一篇论文:GIT-BO(Yu 等,2026)(ICLR 2026)利用 TabPFN v2 预测均值的梯度找出主动子空间(active subspace),即函数变化最大的少数几个方向;在 20 个基准、60 个问题变体(最高 500 维)上,它报告的性能与运行时间之间的权衡优于四种面向高维的高斯过程方法,其中包括 Hvarfner 等人的维度缩放先验。作者承认,该方法内存占用较大,并依赖基础模型的容量。
完全摊销的优化器日益增多。摊销优化器事先在许多任务上一次性训练完毕,新任务只需前向传播。例如 ZeroShotOpt(Meindl 等,2025)(预印本)在 12 种贝叶斯优化变体的轨迹上预训练;又如 TAMO(Zhang 等,2026a)(ICLR 2026),一个多目标上下文优化器,其作者预计性能对合成的高斯过程语料较为敏感。
用于人类比较时的三个限制。将这些方法移植到成对偏好上,会遇到三个障碍。
- 除 PABBO 外,没有在比较数据上训练的模型。PABBO 是唯一面向成对偏好的摊销优化器,其主张与局限见第 27.3 节;TAMO 将其引为基于二元反馈的摊销优化,并把偏好反馈留作未来工作。我们没有找到任何在比较数据上训练、并与偏好采集函数配合使用的 PFN 或 TabPFN 代理模型;这类采集函数如 EUBO 或贝叶斯分歧主动学习(BALD,它选择模型的各种合理假设对其答案分歧最大的查询)。
- PFN 无法区分噪声与无知。Bergna 等人(2026)(2026 年的一篇预印本)表明,标准 PFN 输出的是带噪声观测的预测分布,而且“一般而言,仅凭后验预测分布无法识别认知与偶然的这种划分,即使该分布精确已知”。认知不确定性(epistemic uncertainty)指模型尚不知道、但可以学到的部分;偶然不确定性(aleatoric uncertainty)指再多数据也无法消除的噪声。为潜在信号和噪声分别设置输出头进行训练,可以缓解这一问题。人类比较中的噪声属于偶然不确定性,而 BALD 类成对采集函数需要的是认知部分,标准 PFN 无法将其分离(推断)。
- 先验必须与人的效用相似。成对反馈每次查询携带的信息很少,这正是强先验最能发挥作用之处;但先验必须符合人类效用的形态。PABBO 的合成先验在训练与评估配置中相同:长度尺度取自一个中心在 1/3 附近、截断到 [0.05, 2] 的分布,核函数为径向基函数核以及 Matérn 5/2、3/2 与 1/2 核(Zhang 等,2025a;Zhang,2025)。这是一般的函数先验,而非人类效用的先验(推断)。
第 30.5 节引用的文献 9
- Müller 等人(2025)Position: The Future of Bayesian Prediction Is Prior-Fitted
- Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
- Rogers 与 Ponnada(2026)Zero-shot Bayesian optimization with TabPFN: Competitive with state-of-the-art without per-task training
- Yu 等人(2026)GIT-BO: High-Dimensional Bayesian Optimization with Tabular Foundation Models
- Meindl 等人(2025)ZeroShotOpt: Towards Zero-Shot Pretrained Models for Efficient Black-Box Optimization
- Zhang 等人(2026a)In-Context Multi-Objective Optimization
- Bergna 等人(2026)Decoupled PFNs: Identifiable Epistemic-Aleatoric Decomposition via Structured Synthetic Priors
- Zhang 等人(2025a)PABBO: Preferential Amortized Black-Box Optimization
- Zhang(2025)PABBO code repository: evaluation config evaluate.yaml
30.6 语言模型:作为优化器与作为组件 #
语言模型以两种角色进入了贝叶斯优化,迄今两者的结果截然相反。本节讨论标量方面;两者关系的完整讨论见第 35 章,在偏好循环中的用法见第 35.2 节。
作为自主优化器,受控实验给出的证据是负面的。Gupta 等人(2025)(EMNLP 2025 Findings)在基因扰动和分子性质任务上发现,将真实结果替换为随机置换的标签,语言模型智能体的表现不受影响,而线性赌博机和高斯过程优化等经典方法始终胜出。反馈打乱后表现依然不变的优化器,并没有利用反馈。
作为高斯过程的组件,证据是正面的。GOLLuM(Ranković 等,2026)(Nature Machine Intelligence 2026)通过边际似然联合训练语言模型嵌入与高斯过程。在 23 个化学与材料任务上,实验次数为 50 时,它覆盖了前 5% 候选中的 36.3%,基于固定嵌入的高斯过程则为 26.5%;它达到传统贝叶斯优化水平所需的迭代次数,中位数少 41%。LGBO(Yuan 等,2026)(ICLR 2026)把语言模型对有希望区域的判断用作高斯过程均值的平移,并证明其在最坏情况下也不会显著差于标准贝叶斯优化。人的先验不一定来自语言模型:Xu 等人(2024a)(NeurIPS 2024)证明,借助专家建议,即使建议是对抗性的,收敛也不比没有建议时慢。
这些结果指向同一种设计(推断):外部先验经由均值或采集函数进入,并设有保护措施,最终决定由高斯过程做出。在偏好贝叶斯优化中,语言在回路优化(LILO)(Kobalczyk 等,2026)已能把自由文本反馈转化为供 PairwiseGP 使用的成对标签;对此还需另作提醒(推断):语言模型生成的比较是带有系统性偏差的相关标签,而非独立的概率单位噪声,而 PairwiseGP 的似然并不对共同偏差建模。
第 30.6 节引用的文献 5
- Gupta 等人(2025)LLMs for Bayesian Optimization in Scientific Domains: Are We There Yet?
- Ranković 等人(2026)Large language models as uncertainty-calibrated optimizers for experimental discovery
- Yuan 等人(2026)Unleashing LLMs in Bayesian Optimization: Preference-Guided Framework for Scientific Discovery
- Xu 等人(2024a)Principled Bayesian Optimisation in Collaboration with Human Experts
- Kobalczyk 等人(2026)LILO: Bayesian Optimization with Natural Language Feedback
30.7 成本感知停止 #
每个优化循环都必须停止;回路中有人参与时,停止的代价有了新的形式。第 14.7.3 节介绍了三条带有理论保证的标量规则(Ishibashi 等,2023;Wilson,2024;Xie 等,2026)。其中考虑成本的一条来自 Xie 等人(2026)(ICML 2026):只要某个点的期望改进超过其评估成本,就继续优化。该规则与第 14.7.1 节中的 Pandora's Box Gittins 指数(PBGI)(Xie 等,2024)或单位成本对数期望改进结合时,可为期望的成本调整简单遗憾给出上界;作者称,这是相关贝叶斯优化中第一个保证不比立即停止更差的结果。从论文中可以看出三点局限:其一,保证是针对未平滑的规则证明的,而 8 维实验用 20 次迭代的移动平均来平滑停止信号;其二,保证是贝叶斯意义上的,即在假定的高斯过程先验下成立,而在两个 NATS-Bench 数据集(CIFAR-100 与 ImageNet16-120)上结果稍差,作者将其归因于模型可能设定错误;其三,主要实验中的成本是运行时间的拟合代理量(Xie 等,2026)。BoTorch 0.18.1 中没有 PBGI 采集函数(Meta Platforms, Inc.,2026e)。
偏好方面的结果。偏好方面唯一明确的最优停止规则是 Bıyık 等人(2019)(CoRL 2019)的定理 3:从信息增益中减去每次查询的成本,当可达到的最佳值变为负数时停止提问。该规则假设参数化的奖励模型,而非基于比较的高斯过程。实践中,系统让人自行决定何时停止:在序列画廊的用户研究中,被试平均在 5.36 次迭代后按下“满意”(satisfied)按钮,尽管实验要求他们继续到 15 次迭代(Koyama 等,2020)。停止的时机因人而异。Ou 等人(2023)(IUI 2023)的研究有 60 名被试参与,涉及文本、照片和三维网格任务;其中专家迭代次数更多,表达的偏好更清晰,满意度更低,新手则更容易满意,也更早结束(第 32.6 节)。
缺口很明确(推断)。成本感知停止在偏好上的自然形式,是将下一次比较的 EUBO 增益与人做这次比较的成本相比较;但没有论文推导出这样的规则,也没有论文在带 Laplace 后验的概率单位似然或 Bradley-Terry 似然下证明类似的保证。这些保证依赖于正确设定的先验,而长度尺度又难以在较小的成对比较预算下识别,因此恰在最需要保证之处,保证最弱。Wilson 的规则只需要潜在函数的后验样本,PairwiseGP 能提供这些样本,因此从机制上说该规则可用;但它在 Laplace 近似和人的噪声下是否可靠,尚未检验。这些论文中的成本是运行时间;人的成本则随疲劳和学习而变化,违背了成本已知或可学习的假设。跨用户迁移同样未经检验:Hvarfner 等人(2026)(2026 年的一篇预印本)发现,多任务高斯过程“即使在最简单的非平凡情形中,也会错误估计任务间的相关性”,这一情形即源任务与目标任务之间存在仿射关系;在人与人之间迁移效用模型还另有一个问题:效用只能识别到相差一个单调变换的程度。在这样的规则出现之前,实际的停止规则仍是人自己给出的“满意”,同时记录后验均值在相邻迭代之间的移动幅度(推断)。
第 30.7 节引用的文献 9
- Ishibashi 等人(2023)A stopping criterion for Bayesian optimization by the gap of expected minimum simple regrets
- Wilson(2024)Stopping Bayesian Optimization with Probabilistic Regret Bounds
- Xie 等人(2026)Cost-aware Stopping for Bayesian Optimization
- Xie 等人(2024)Cost-aware Bayesian Optimization via the Pandora's Box Gittins Index
- Meta Platforms, Inc.(2026e)BoTorch CHANGELOG
- Bıyık 等人(2019)Asking Easy Questions: A User-Friendly Approach to Active Reward Learning
- Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
- Ou 等人(2023)The Impact of Expertise in the Loop for Exploring Machine Rationality
- Hvarfner 等人(2026)Pitfalls and Remedies for Multi-Task Bayesian Optimization
30.8 已定、有争议与缺失 #
已定。在标量反馈下,固定尺度的长度尺度先验或初始值会在高维中使核函数值趋于零、超参数梯度趋于消失,而维度缩放的先验或初始值能消除与专门高维方法之间的大部分差距(Hvarfner 等,2024;Xu 等,2025b;Papenmeier 等,2025b)。BoTorch 的 PairwiseGP 与 optuna-dashboard 的默认长度尺度先验都不随维度缩放。PABBO 是唯一面向成对偏好的摊销优化器。在一项受控检验中,充当自主优化器的语言模型对其反馈并不敏感。
有争议。高维优化成功的原因:良好的全局代理模型、局部搜索,还是基准本身容易。局部偏好贝叶斯优化相对于全局方法的优势,是否源于施加在全局基线上的长度尺度约束。预训练代理模型在高维中的样本效率,目前只有 GIT-BO 一篇论文。先验设定错误时,成本感知停止的保证会受到什么影响。
缺失。成对似然下对维度缩放先验或稳健初始化的检验。Laplace 边际似然下对超参数梯度的测量。预算为 50 至 200 次比较、维度在 30 维以上的人类成对反馈研究。在比较数据上训练并校准的先验拟合网络。针对成对似然和人的疲劳设计的停止规则。
第 30.8 节引用的文献 3
- Hvarfner 等人(2024)Vanilla Bayesian Optimization Performs Great in High Dimensions
- Xu 等人(2025b)Standard Gaussian Process is All You Need for High-Dimensional Bayesian Optimization
- Papenmeier 等人(2025b)Understanding High-Dimensional Bayesian Optimization
30.9 习题 #
取 形式的长度尺度,可使 中均匀随机点之间典型的径向基函数核值与维度无关。 取何值时,典型点对恰好相距一个长度尺度,即均方根距离处的核函数值为 ?BoTorch 的选择与之相比如何?
解答
均方根距离处 ,故指数为 。令其等于 ,得 ,即 :长度尺度恰为均方根距离 。BoTorch 先验的众数对应 ,是这一值的一半,因此典型点对起初相距约两个长度尺度,核函数值接近 ,与图 30.1 一致。
利用第 30.1.2 节中推导的第 7 步,即均方根距离处 ,估计在 PairwiseGP 默认设置()下,典型点对的核函数值从多少维起低于 ,又从多少维起低于双精度舍入单位 ,并与图中结果比较。
解答
解出 ,得 ,其中 。 时,,。 时,,。图中的核函数值是在中位距离而非均方根距离处计算的,第二个阈值在图中位于 与 之间。10 至 20 维的法则恰好处在第一个阈值之下。
optuna-dashboard 的 Matérn 3/2 核为 ,其中 , 为距离,先验众数为 。证明在典型距离处, 大致按 而非 下降,并估计典型点对的核函数值降至 时的维度。
解答
较大时指数项占主导,;又 ,故 ,是 的平方根函数,而非线性函数。解 得 ,于是 ,,超出了图的范围。径向基函数核的默认设置在 附近就已降至同一数值。Xu 等人发现 Matérn 核远不易出现梯度消失(Xu 等,2025b),其机制正是这种较慢的衰减。(他们针对 Matérn 5/2 核给出的阈值 涉及梯度中的因子;此处的 524 则是 optuna-dashboard 的 Matérn 3/2 核函数值降至 的位置。)
第 30.9 节引用的文献 1
- Xu 等人(2025b)Standard Gaussian Process is All You Need for High-Dimensional Bayesian Optimization
延伸阅读 #
- Hvarfner 等人(2024)正是改变了默认设置的论文;其附录讨论传统先验如何影响探索,本身就值得一读。
- Xu 等人(2025b)用两页篇幅给出了梯度论证,并以数值检验说明梯度何时真正消失。
- Papenmeier 等人(2025b)与 Doumont 等人(2026)代表机制之争的双方;Doumont 等人关于线性模型与边界的定理 1 简短而出人意料。
- Menn 等人(2026a)是局部偏好贝叶斯优化与信赖域偏好贝叶斯优化的参考文献;其局限性一节宜与超参数表对照阅读。
- Xie 等人(2026)对带保证的停止规则给出了最清楚的表述,也是构造偏好版本的自然起点。
参考文献
- (2023). qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization. International Conference on Artificial Intelligence and Statistics. 引用于 §30.3
- (2026). Decoupled PFNs: Identifiable Epistemic-Aleatoric Decomposition via Structured Synthetic Priors. arXiv. 预印本引用于 §30.5
- (2019). Asking Easy Questions: A User-Friendly Approach to Active Reward Learning. CoRL 2019. 引用于 §30.7
- (2026). We Still Don't Understand High-Dimensional Bayesian Optimization. AISTATS 2026 (best student paper). 引用于 §30.2
- (2026). Adaptive Candidate Point Thompson Sampling for High-Dimensional Bayesian Optimization. AISTATS 2026. 引用于 §30.2
- (2018). A Tutorial on Bayesian Optimization. arXiv. 预印本
- (2023). Human-in-the-Loop Optimization for Deep Stimulus Encoding in Visual Prostheses. NeurIPS 2023. 引用于 §30.3
- (2025). LLMs for Bayesian Optimization in Scientific Domains: Are We There Yet? Findings of the Association for Computational Linguistics: EMNLP 2025. 引用于 §30.6
- (2024). Vanilla Bayesian Optimization Performs Great in High Dimensions. International Conference on Machine Learning. 引用于 §30.1 §30.8
- (2025). Informed Initialization for Bayesian Optimization and Active Learning. NeurIPS 2025. 引用于 §30.1
- (2026). Pitfalls and Remedies for Multi-Task Bayesian Optimization. arXiv. 预印本引用于 §30.7
- (2023). A stopping criterion for Bayesian optimization by the gap of expected minimum simple regrets. International Conference on Artificial Intelligence and Statistics. 引用于 §30.7
- (2025). Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds. International Conference on Machine Learning. 引用于 §30.3
- (2026). LILO: Bayesian Optimization with Natural Language Feedback. ICML 2026. 引用于 §30.6
- (2017). Sequential line search for efficient visual design optimization by crowds. ACM Transactions on Graphics. 引用于 §30.3
- (2020). Sequential Gallery for Interactive Visual Design Optimization. ACM Transactions on Graphics 39(4) (SIGGRAPH 2020). 引用于 §30.3 §30.7
- (2026b). GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization. ACM Transactions on Graphics. doi:10.1145/3811293. 引用于 §30.3
- (2025). ZeroShotOpt: Towards Zero-Shot Pretrained Models for Efficient Black-Box Optimization. arXiv. 预印本引用于 §30.5
- (2026a). Local Preferential Bayesian Optimization. arXiv. 预印本引用于 §30.4
- (2026e). BoTorch CHANGELOG. GitHub. 软件引用于 §30.3 §30.5 §30.7
- (2026h). BoTorch PairwiseGP source code pairwise_gp.py. GitHub. 软件引用于 §30.3
- (2026k). botorch/models/utils/gpytorch_modules.py. GitHub. 软件引用于 §30.1 §30.3
- (2020). Projective Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §30.3
- (2025). Position: The Future of Bayesian Prediction Is Prior-Fitted. ICML 2025 (position paper). 引用于 §30.5
- (2026b). optuna-dashboard 0.21.0. PyPI. 软件引用于 §30.3
- (2026c). optuna-dashboard PreferentialGPSampler source code gp.py. GitHub. 软件引用于 §30.3
- (2023). The Impact of Expertise in the Loop for Exploring Machine Rationality. IUI 2023. 引用于 §30.7
- (2025a). Exploring Exploration in Bayesian Optimization. Conference on Uncertainty in Artificial Intelligence. 引用于 §30.2
- (2025b). Understanding High-Dimensional Bayesian Optimization. ICML 2025, PMLR 267:47902-47923. 引用于 §30.1 §30.2 §30.8
- (2026). Large language models as uncertainty-calibrated optimizers for experimental discovery. Nature Machine Intelligence. doi:10.1038/s42256-026-01283-z. 引用于 §30.6
- (2026). Zero-shot Bayesian optimization with TabPFN: Competitive with state-of-the-art without per-task training. AutoML Conference 2026 (per Amazon Science page). 引用于 §30.5
- (2020a). Human Preference-Based Learning for High-dimensional Optimization of Exoskeleton Walking Gaits. IROS 2020. 引用于 §30.4
- (2024). Stopping Bayesian Optimization with Probabilistic Regret Bounds. NeurIPS 2024. 引用于 §30.7
- (2024). Cost-aware Bayesian Optimization via the Pandora's Box Gittins Index. NeurIPS 2024. 引用于 §30.7
- (2026). Cost-aware Stopping for Bayesian Optimization. International Conference on Machine Learning. 引用于 §30.7
- (2024a). Principled Bayesian Optimisation in Collaboration with Human Experts. NeurIPS 2024. 引用于 §30.6
- (2025b). Standard Gaussian Process is All You Need for High-Dimensional Bayesian Optimization. ICLR 2025 (oral). 引用于 §30.1 §30.8 §30.9
- (2026). GIT-BO: High-Dimensional Bayesian Optimization with Tabular Foundation Models. International Conference on Learning Representations. 引用于 §30.5
- (2026). Unleashing LLMs in Bayesian Optimization: Preference-Guided Framework for Scientific Discovery. ICLR 2026. 引用于 §30.6
- (2025). PABBO code repository: evaluation config evaluate.yaml. GitHub. 软件引用于 §30.5
- (2025a). PABBO: Preferential Amortized Black-Box Optimization. ICLR 2025. 引用于 §30.5
- (2026a). In-Context Multi-Objective Optimization. International Conference on Learning Representations. 引用于 §30.5
- (2024). Bayesian Optimisation with Unknown Hyperparameters: Regret Bounds Logarithmically Closer to Optimal. NeurIPS 2024. 引用于 §30.3