贝叶斯优化
第五部分:案例研究
EN

优化化学反应

第 22 章调节的是软件设置:一次评估只需几秒钟计算,设置都是数值。本章转到实验室。这里的设置是选用哪些化学品、在什么温度下反应;一次评估就是一个化学反应,运行和分析需要数小时;而且通常有几个反应同时进行。

本章围绕 Shields 等人(2021)展开,该研究于 2021 年发表在 Nature 上。作者包括普林斯顿大学和 Bristol-Myers Squibb 的化学家以及计算机科学家,他们对一个反应的全部 1,728 种可能版本逐一进行实验,测量了每个版本的产物量。每个结果都已知,因此优化过程可以回放:本章图中的一次“实验”,就是查出实验室测得的产率。作者还请 50 位化学家和工程师通过一个游戏优化同一反应,游戏返回的正是这些真实结果,玩家的选择也已公开。两份数据都以 MIT 许可证发布在公开代码库中(Shields,2021;Shields 与 Li,2020),该许可证允许再分发,因此下面的图直接使用实测数据。

本章先介绍这一反应及尝试一个版本的代价,再讨论分类器问题中没有出现的一个问题:高斯过程如何衡量化学品之间的相似性。随后读者亲自参与化学家们做过的游戏,并观察优化器如何完成同一游戏。最后两节报告该研究与人类专家对比的结果,以及由机器人执行实验时会有哪些变化。

引言引用的文献 3
  1. Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis
  2. Shields(2021)EDBO: Experimental Design via Bayesian Optimization
  3. Shields 与 Li(2020)EvML: Expert versus Machine Learning

23.1 问题 #

23.1.1 反应与产率 #

化学反应把起始原料转化为产物。该研究中的反应是直接芳基化(direct arylation):把一个由碳原子构成的环(芳基,这里是氟代苯环)连接到称为咪唑的含氮小环上,连接位置原本只有一个氢原子。产物是 5-(2-fluorophenyl)-1-methyl-1H-imidazole-4-carbonitrile。这一反应与 BMS-911543 商业合成中的一个关键步骤有关,BMS-911543 是一种抑制 JAK2 酶的候选药物(Shields 等,2021)。

这一反应需要多种辅助成分。连接由钯催化剂(catalyst)完成,催化剂能加快反应而自身不被消耗;配体(ligand)是与钯结合的分子,影响钯的催化效果。碱(base)除去反应释放的酸,溶剂(solvent)是溶解所有物质的液体。另有两个连续条件构成完整的配方:起始原料的浓度(concentration)和温度(temperature)。反应的结果是产率(yield),即起始原料最终转化为目标产物的百分比。产率 100% 表示原料毫无浪费,0% 表示反应没有发生。

表 23.1 列出了该研究允许的选择,每种组合都是一个可能的实验:12×4×4×3×3=1,72812 \times 4 \times 4 \times 3 \times 3 = 1{,}728。

表 23.1 直接芳基化基准的搜索空间(Shields 等,2021)。12 种配体由专家从 70 种候选膦中选出。
选择 选项
配体(12) BrettPhos、PPhtBu2、tBPh-CPhos、PCy3 HBF4、PPh3、X-Phos、P(fur)3、PPh2Me、GorlosPhos HBF4、JackiePhos、CgMe-PPh、PPhMe2
碱(4) KOAc、KOPiv、CsOAc、CsOPiv(钾或铯的乙酸盐或新戊酸盐)
溶剂(4) BuOAc(乙酸丁酯)、对二甲苯、BuCN(丁腈)、DMAc(二甲基乙酰胺)
浓度(3) 0.057、0.1、0.153 M(摩尔每升)
温度(3) 90、105、120 °C

23.1.2 一次实验的代价 #

尝试反应的一个版本,要把化学品混入小瓶,加热,再测量生成了多少产物。作者写道,“许多反应需要数小时乃至数天才能进行完全”,因此实验分批并行,而不是逐个进行(Shields 等,2021)。下文介绍的游戏为玩家提供的实验台空间是每个工作日五个实验,一个“月”为 20 天。

为构建这一基准,作者采用高通量实验(high-throughput experimentation,HTE),即并行运行大量微型化反应,将全部 1,728 种组合各运行一次。每个反应都“没有重复”测量(Shields 等,2021),因此每种组合恰好只有一个实测产率,数据无法说明重复实验会相差多少。这与分类器一章相反:那里每个设置都有五次重复测量;这里的回放是确定性的,测量噪声真实存在,只是无法看到。

23.1.3 地形 #

1,728 个反应大多效果很差。产率的中位数为 8.1%,均值为 19.4%;494 个反应(29%)完全没有产物。只有 67 个达到 80%,18 个达到 90%,5 个达到 99%。这五个反应都使用同一种配体 CgMe-PPh;产率达到 100% 的两个反应是 CgMe-PPh 搭配乙酸铯或新戊酸铯,以 DMAc 为溶剂,浓度 0.153 M,温度 105 °C(根据公开数据计算;tools/figure-data/cs-chem-arylation.py 会输出这些汇总结果)。

配体的影响最大。对其他所有条件取平均,X-Phos(52.8%)和 CgMe-PPh(50.2%)的产率最高,三种小的膦(PPhMe2、PPhtBu2、PPh2Me)几乎没有产物(0.3%、0.4%、2.0%)。仿照第 22.4.1 节衡量超参数的方法,以单个选择所解释的产率方差比例来衡量,配体解释 48%,溶剂 8%,温度 3%,碱 1%,浓度 0.2%。这些主效应合计 60%;其余 40% 来自各选择的共同作用,例如某种配体只在部分溶剂中有效。

23.1.4 实验开始前的选择 #

作者写道:“反应优化真正始于定义搜索空间”(Shields 等,2021)。在任何优化器或玩家接触这一问题之前,已经做出了三个决定。第一,由人从 70 种候选中选出 12 种配体;论文明确指出,这一选择“基于宝贵的专家知识,而非机器学习”。第二,两个连续条件各简化为三个水平,空间因而有限,穷举测量才成为可能。第三,目标只有产率:数据中没有试剂成本、溶剂安全性或产物纯度的任何信息,而这些都是工艺化学家要权衡的因素(推断)。下文的所有结果都只针对按此定义的空间。

第 23.1 节引用的文献 1
  1. Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis

23.2 试剂编码 #

高斯过程根据它认为相似的反应的产率来预测一个反应的产率,而核函数通过输入之间的距离来定义“相似”(第 9 章)。温度有天然的距离:105 °C 位于 90 与 120 之间。配体则没有。“BrettPhos 减去 X-Phos”毫无意义;若把配体编号为 1 至 12,模型会误以为配体 3 位于配体 2 和配体 4 之间。循环开始之前,每种试剂都需要转换为向量。该研究比较了三种方式,其中两个极端最能说明问题所在。

23.2.1 独热编码 #

最简单的编码为每个选项分配一个独立的坐标。一种配体表示为由 12 个数组成的向量,该配体所在位置为 1,其余全为 0:BrettPhos 是 (1,0,…,0)(1, 0, \dots, 0),PPhtBu2 是 (0,1,0,…,0)(0, 1, 0, \dots, 0),依此类推。这就是独热编码(one-hot encoding)。一个反应的编码由配体、碱和溶剂的向量以及浓度和温度的水平拼接而成。

推导独热向量上的核函数隐含的假设

设 ea\mathbf{e}_a 与 eb\mathbf{e}_b 是配体 aa 与 bb 的独热向量。

  1. 若 a≠ba \ne b,两个向量恰有两个坐标不同,各相差 1,因此 ∥ea−eb∥2=2\lVert \mathbf{e}_a - \mathbf{e}_b \rVert^2 = 2。若 a=ba = b,距离为 0。
  2. 因此,对只有配体不同的两个反应,无论是哪一对不同的配体,平方距离都是 2/ℓlig22 / \ell_{\text{lig}}^2,其中 ℓlig\ell_{\text{lig}} 是配体的长度尺度(每个选择一个,与第 9.2 节相同)。
  3. 平稳核只通过这一距离依赖于输入(第 9.1 节),因此这类反应之间的先验相关性只有一个取值:BrettPhos 与 X-Phos 之间的相关性,同 BrettPhos 与 PPh3 之间完全相同。

因此,独热模型能够学到配体重要与否(通过缩小 ℓlig\ell_{\text{lig}}),却学不到哪些配体彼此相似。测量 BrettPhos 之后,模型对其他每种配体获得的信息都相同。对各选项一无所知时,这是合理的假设;化学知识已经相当丰富时,这一假设就造成了浪费。

23.2.2 描述符编码 #

另一种做法用计算得到的性质来描述每个分子,这些性质称为描述符(descriptors)。Shields 等人(2021)用密度泛函理论(density functional theory,DFT)计算描述符,这是针对分子中电子的量子力学计算;记录的量包括最外层电子轨道的能量、偶极矩(电荷分布的不均匀程度)以及各原子上的电荷。每个配体分子由此得到 1,358 个在不同配体之间有变化的数值,碱为 231 个,溶剂为 116 个。采用描述符后,电子性质和空间位阻性质相近的两种配体,在核函数看来也相近,用其中一种测得的产率可以为另一种提供信息。假设也从“所有配体彼此同样不同”变为“产率随这些性质光滑变化”,后者合乎情理,但并无保证。

每种配体上千个坐标,远超高斯过程所需,而这里恰好有一条精确的捷径。12 个点总位于至多 11 维的空间中,因此把描述符标准化,再旋转到其主成分(principal components)上(即离散程度最大的方向,由奇异值分解求得)之后,11 个坐标就能无损地描述 12 种配体;同理,4 种碱用 3 个坐标,4 种溶剂也用 3 个坐标。下文的回放使用这些旋转后的描述符,分子之间的所有距离都得以保留,只差每个选择各一个比例因子。

23.2.3 该研究的发现 #

论文在另外六个有公开数据的反应上调校优化器,即一个 Suzuki-Miyaura 偶联和五个 Buchwald-Hartwig 偶联,并比较了 DFT 描述符、开源化学信息学库 Mordred 生成的描述符以及独热编码(Shields 等,2021)。平均损失(loss),即数据集中最高产率与优化器找到的最高产率之差,在三种编码之间“基本无法区分”(Welch tt 检验 p>0.05p > 0.05;该检验比较两个均值,不假定方差相等)。差别在于最坏情况:在从不同随机起点出发的多次运行中,使用 DFT 描述符时,每个反应的最大损失至多为 5% 的产率,Mordred 至多为 15%,独热编码至多为 8%。作者保留了 DFT 描述符,并指出“在实际应用中,多种反应编码都能取得可以接受的性能”。

要点编码即先验

在测量任何反应之前,编码就已决定了模型把哪些反应视为相似。独热编码假定各选项互不相关;描述符则假定各选项之间的相似程度与其计算性质的相似程度一致。两者都不是从产率中学到的,因此选择编码与选择核函数一样,都是建模假设。

第 23.2 节引用的文献 1
  1. Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis

23.3 回放优化过程 #

23.3.1 亲自尝试 #

在观察优化器之前,先像那 50 位玩家一样亲自尝试这一问题。下图即按论文规则设置的游戏,只是预算为 50 次实验而非 100 次:到第 50 次实验时,50 位玩家中已有 44 位停止。每批最多选择五个反应,运行这一批,读出产率,再规划下一批。

你50 位化学家(均值)每位化学家论文的优化器(50 次运行的均值)BrettPhosPPhtBu2tBPh-CPhosPCy3 HBF4PPh3X-PhosP(fur)3PPh2MeGorlosPhos HBF4JackiePhosCgMe-PPhPPhMe2BuOAc对二甲苯BuCNDMAc每个配体内的行:碱 KOAc、KOPiv、CsOAc、CsOPiv。每个溶剂内的列:90、105、120 °C,每个温度下依次为 0.057、0.1、0.153 M。0%100%实测产率还剩 50 次实验(共 50 次)下一批:点击最多五个单元格,或在上方设好条件后按“添加”。1020304050实验次数0255075100目前的最高产率(%)运行一批之后即可与 50 位化学家比较。
你化学家(均值)每位化学家论文的优化器BrettPhosPPhtBu2tBPh-CPhosPCy3 HBF4PPh3X-PhosP(fur)3PPh2MeGorlosPhos HBF4JackiePhosCgMe-PPhPPhMe2BuOAc对二甲苯BuCNDMAc每个配体内的行:KOAc、KOPiv、CsOAc、CsOPiv。每个溶剂内的列:90、105、120 °C,每个温度下依次为 0.057、0.1、0.153 M。0%100%实测产率还剩 50 次实验(共 50 次)下一批:点击最多五个单元格,或在上方设好条件后按“添加”。1020304050实验次数0255075100目前的最高产率(%)运行一批之后即可与 50 位化学家比较。
图 23.1 Shields 等人(2021)的反应优化游戏,使用其真实数据。图中显示全部 1,728 个反应:每四行组成的横带对应一种配体(四行即四种碱),每九列组成的区块对应一种溶剂(三个温度,每个温度下三种浓度)。点击单元格可把最多五个反应排入一批,也可以设定五个条件后按“添加”,然后按“运行这一批”;每次实验揭示实验室测得的产率,没有任何模拟。右侧:你目前的最高产率(品红色),对照原游戏中的 50 位玩家(细线;中性色粗线为其均值,已停止的玩家保持其最后的最高值)以及论文中优化器 50 次运行的均值(虚线)。玩家的选择取自 EvML 代码库(Shields 与 Li,2020)。

游戏过程中有两点值得注意。第一批最难,因为图上的一切都还未知;玩家们在这一批中运用了化学知识,第 23.4 节表明这确实有帮助。此后各批需要权衡:是确认一个有希望的区域,还是测试一种尚未尝试的配体。如果结束时仍未找到高于 99% 的产率,可以打开“显示全部产率”,查看 CgMe-PPh 所在的横带。

23.3.2 优化器 #

图中的优化器以简化形式重新实现了论文的方法,并非论文的代码。代理模型是标准化产率上的高斯过程,在编码上使用 Matérn 5/2 核,每个选择(配体、碱、溶剂、浓度、温度)各有一个长度尺度。论文通过最大化边际似然拟合长度尺度,所用的 Gamma 先验偏好较长的长度尺度,从而“假定大多数维度是无关的”(Shields 等,2021)。本书的实现从一个简短的候选值列表中为每个长度尺度选值,从另一个列表中为噪声方差选值,依据是边际似然,外加对较长长度尺度的轻微偏好(第 9.3 节)。这些列表以及该偏好的中心,是在同一数据集上试过几种取值后确定的,相当于在测试问题上做了少量调参;论文则在其他反应上调参,避免了这一问题。采集函数是期望改进(第 12.3 节),采用论文的探索偏移量 0.01,在所有尚未运行的反应上求最大值。

新的要素是批量。期望改进为单个实验打分,但实验台一次运行五个实验,而得分最高的五个反应通常彼此几乎相同。论文采用克里金信念(kriging believer)(Ginsbourger 等,2010):逐个挑选反应组成一批,每挑出一个,就把模型在该处的预测当作已经测得的结果。

算法 23.1 克里金信念批量选择

输入:已拟合的高斯过程,尚未运行的反应集合 RR,批量大小 qq。

  1. 对 j=1,…,qj = 1, \dots, q:
    1. 在当前模型下选择 xj←arg max⁡x∈REI⁡(x)\vx_j \leftarrow \argmax_{\vx \in R} \EI(\vx)。
    2. 从 RR 中移除 xj\vx_j。
    3. 把伪观测 (xj,μ(xj))(\vx_j, \mu(\vx_j))(即模型自身的均值预测)加入数据,并用相同的核超参数更新后验。
  2. 运行这 qq 个反应,用实测产率替换伪观测。

第 1.3 步不改变后验均值,但使 xj\vx_j 处的不确定性坍缩,并缩小其附近的不确定性,于是与 xj\vx_j 相似的反应的期望改进下降,下一个选择转向别处(原因见习题 14.4;习题 23.3 将其应用于反应数据)。第 14.3 节对批量采集有更一般的讨论。论文报告,在其六个开发用反应上,预算为 50 时,每批五个与每次一个的平均效果相当(p>0.05p > 0.05)(Shields 等,2021)。

本次贝叶斯优化运行随机选择50 位化学家(均值)每位化学家论文的优化器(50 次运行的均值)BrettPhosPPhtBu2tBPh-CPhosPCy3 HBF4PPh3X-PhosP(fur)3PPh2MeGorlosPhos HBF4JackiePhosCgMe-PPhPPhMe2BuOAc对二甲苯BuCNDMAc每个配体内的行:碱 KOAc、KOPiv、CsOAc、CsOPiv。每个溶剂内的列:90、105、120 °C,每个温度下依次为 0.057、0.1、0.153 M。0%100%实测产率第 6 批(5 次实验):CgMe-PPh、KOPiv、DMAc、0.153 M、120 °C:99.8%CgMe-PPh、CsOAc、DMAc、0.153 M、120 °C:99.2%CgMe-PPh、KOAc、BuOAc、0.153 M、120 °C:52.5%CgMe-PPh、CsOPiv、DMAc、0.153 M、120 °C:92.2%CgMe-PPh、KOAc、DMAc、0.057 M、120 °C:96.6%第 6 批时模型看重什么(1 / 长度尺度):配体碱溶剂浓度温度1020304050实验次数0255075100目前的最高产率(%)
本次运行随机选择化学家(均值)每位化学家论文的优化器BrettPhosPPhtBu2tBPh-CPhosPCy3 HBF4PPh3X-PhosP(fur)3PPh2MeGorlosPhos HBF4JackiePhosCgMe-PPhPPhMe2BuOAc对二甲苯BuCNDMAc每个配体内的行:KOAc、KOPiv、CsOAc、CsOPiv。每个溶剂内的列:90、105、120 °C,每个温度下依次为 0.057、0.1、0.153 M。0%100%实测产率第 6 批(5 次实验):CgMe-PPh、KOPiv、DMAc、0.153 M、120 °C:99.8%CgMe-PPh、CsOAc、DMAc、0.153 M、120 °C:99.2%CgMe-PPh、KOAc、BuOAc、0.153 M、120 °C:52.5%CgMe-PPh、CsOPiv、DMAc、0.153 M、120 °C:92.2%CgMe-PPh、KOAc、DMAc、0.057 M、120 °C:96.6%第 6 批时模型看重什么(1 / 长度尺度):配体碱溶剂浓度温度1020304050实验次数0255075100目前的最高产率(%)
图 23.2 在 1,728 个实测反应上回放贝叶斯优化。左:本次运行已尝试的反应,按实测产率着色;圆环标出最近一批,列在下方,并附模型对每个选择的权重(拟合长度尺度的倒数;柱越高,产率随该选择变化越快)。右:目前的最高产率,分别为本次运行(橙色)、使用相同随机种子的随机选择(紫色)、50 位有记录的化学家(细线;中性色粗线为其均值),以及论文自身的 50 次运行(虚线,均值)。可以改变编码、批量大小,以及第一批是随机选取还是取自某位有记录的化学家;“新一轮运行”换一个随机起点。所有产率均为实测;优化器的选择由简化的重新实现(lib/cs-chem.ts)在浏览器中计算,并非论文的代码。

可以尝试以下几点:

逐批查看。最初几批中,权重柱都很短:只有十几个产率,且大多接近零,模型无法分辨哪个选择重要,于是保留先验所偏好的较长长度尺度。大约到第四批,配体的权重柱通常会凸显出来。在 50 次运行中,20 次实验后拟合长度尺度的中位数为:配体 1,溶剂 2,碱、浓度和温度均为 4,即先验所偏好的值(tools/figure-data/cs-chem-race.ts)。这一顺序与第 23.1.3 节中的主效应一致,而它仅由 1,728 个产率中的 20 个学得。

切换到独热编码。前几批会发生变化,因为模型不再认为相似的配体给出相似的产率。观察这次运行是否仍能找到 CgMe-PPh 所在的横带,以及需要多久。

使用化学家的第一批。前五个实验改为某位有记录的玩家的前五个实验(每次运行换一位玩家)。平均而言,橙色曲线的起点因此更高,五次实验后为 64.8%,随机起点为 50.0%,但并非每次运行都如此:图初始显示的那次运行,随机抽到的第一批恰好很好(76.7%),而分配到的玩家的第一批只达到 20.6%。多按几次“新一轮运行”,观察第一批之后曲线如何变化。

显示全部产率,查看这次运行搜索过哪些区域、错过了什么。

23.3.3 各策略的 50 次运行 #

一次运行只反映一次运气。表 23.2 汇总了每种变体各 50 次运行的结果,并列出论文自身的运行和有记录的化学家。

表 23.2 在实测的直接芳基化数据上,10、20、30 和 50 次实验后找到的最高产率,取 50 次运行的均值(玩家:50 位有记录的化学家,已停止的玩家保持其最后的最高值)。最后一列:前 50 次实验内找到至少 99% 产率的运行数,括号中为这些运行所需实验次数的中位数;化学家和论文的运行最多进行到 100 次实验,第 50 次之后的发现不计入。论文的运行取自其 EvML 代码库;本书实现的运行、随机选择和化学家的曲线由 tools/figure-data/cs-chem-race.ts 计算。除特别注明外,每批五个。
策略 10 20 30 50 ≥ 99%(中位数)
随机选择 65.1% 75.5% 81.8% 88.8% 50 次中 4 次(40)
50 位化学家 79.8% 88.4% 92.9% 94.2% 50 次中 24 次(22)
论文的优化器,随机起点 74.1% 91.6% 97.5% 99.8% 50 次中 46 次(19.5)
论文的优化器,化学家起点 74.0% 91.5% 98.9% 99.9% 50 次中 50 次(22.5)
本书实现,描述符 64.0% 82.7% 97.1% 99.9% 50 次中 50 次(26)
本书实现,独热 66.3% 85.4% 95.2% 99.6% 50 次中 48 次(27)
本书实现,描述符,每批 1 个 54.8% 87.4% 99.3% 100.0% 50 次中 50 次(22)
本书实现,描述符,每批 10 个 65.1% 82.5% 91.5% 98.5% 50 次中 44 次(31)
本书实现,描述符,化学家起点 67.4% 79.3% 93.1% 99.9% 50 次中 49 次(31)

这张表有五点值得注意。

随机选择很少找到最佳反应。1,728 个反应中有五个达到 99%;按随机顺序进行实验,50 次运行中只有 4 次在前 50 个实验内找到其中之一。平均而言,随机选择约需 288 次实验(习题 23.1)。每个版本的贝叶斯优化都在 50 次运行中至少有 44 次找到了这样的反应。

本书简化的优化器起步较慢,随后赶上。10 次和 20 次实验后,论文的优化器领先 9 至 10 个百分点的产率;到 30 次实验时,两者相差不到半个百分点。论文在另外六个反应上调校先验,其运行在去除高度相关的描述符之后,用完整的描述符集合编码同样的化学信息(Shields 等,2021);本书的实现则对长度尺度做粗略搜索。最终结果对这些细节不敏感,早期阶段则较为敏感(推断)。

在这里,独热编码并不差多少。在 50 次运行中,独热编码在 10 次和 20 次实验后领先于描述符,在 30 次和 50 次时落后;50 次运行中有 2 次未能找到 99% 的产率,描述符则一次也没有错过。这与论文的发现一致:平均表现相近,描述符的最坏情况更好。在这一数据集上,配体起主导作用;模型一旦学到“配体很重要,且 CgMe-PPh 效果好”,在试过 CgMe-PPh 之后,就不再需要知道哪些配体彼此相似(推断)。

批量大小是实验次数与天数之间的权衡。按实验次数计,批量越小效率越高:达到 99% 所需实验次数的中位数,每次一个为 22,每批五个为 26,每批十个为 31,而且每批十个时 50 次运行中有 6 次未能达到。按轮数计,顺序则相反:中位数分别为每次一个 22 轮、每批五个 6 轮、每批十个 4 轮。一轮相当于实验台上的一天时,较大的批量能更早完成,代价是更多的反应。

化学家的第一批只对第一批有帮助。以玩家自己的前五个实验为起点,五次实验后的最高产率从 50.0% 提高到 64.8%,论文的优化器和本书的实现都是如此。这一优势没有延续下去。无论从哪种起点出发,论文的优化器在 20 次实验后都达到 91.5%;本书的实现从化学家起点出发反而不如从随机起点出发(20 次后为 79.3% 对 82.7%,达到 99% 所需实验次数的中位数为 31 对 26)。作者自己的分析用 Welch tt 检验逐批比较两种起点:差异在第一批显著(p=0.004p = 0.004),在随后五批不显著(pp 介于 0.13 至 0.98)(Shields 与 Li,2020)。一个可能的原因是多样性:50 位玩家中有 7 位在整个第一批中只测试了一种配体,平均每位玩家的第一批覆盖 3.8 种配体,而五个随机反应覆盖 4.2 种。与较差但更多样的起点相比,较好但狭窄的起点让模型对其他配体了解得更少(推断;参见第 11.4 节)。

第 23.3 节引用的文献 3
  1. Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis
  2. Shields 与 Li(2020)EvML: Expert versus Machine Learning
  3. Ginsbourger 等人(2010)Kriging Is Well-Suited to Parallelize Optimization

23.4 与人类专家对比 #

与化学家的对比是 Shields 等人(2021)中最受关注的部分,其基础是一个精心设计的游戏。玩家得到该反应、12 种配体、4 种碱、4 种溶剂以及浓度和温度的各个水平,须在“一个月”内找到最佳条件,“每个工作日”运行一批五个实验。游戏最多允许 20 批,共 100 次实验,“约占实验空间的 6%”。“虽然这个游戏旨在模拟固定实验预算下的反应优化,但数据是真实的”:每次实验返回高通量数据中的实测产率。50 位“来自学术界和工业界的化学家与工程师专家”参加了游戏,优化器则从不同的随机起点出发,将同一游戏重复了 50 次(Shields 等,2021)。根据公开记录,30 位玩家来自制药行业,19 位来自学术界,1 位来自其他领域;按职位分,有 15 位工艺化学家、12 位研究生、11 位工程师、6 位博士后研究人员、3 位教职人员和 3 位药物化学家(Shields 与 Li,2020)。

论文报告了四项发现(Shields 等,2021)。

  1. 化学家的起步更好。“人类的初始选择显著(p<0.05p < 0.05)优于随机选择,平均而言,他们在第一批实验中发现的条件产率高出 15%。”在公开记录中,第一批之后的平均最高产率,玩家为 64.8%,优化器的随机起点为 50.0%。
  2. 优化器在三批之内超过了化学家。用作者的话说,“即使采用随机初始化,在三批、每批五个实验之内,优化器的平均表现就超过了人类。”
  3. 优化器更稳定。它“在实验预算内以 100% 的比例达到了 >99% 的产率”;在记录中,50 位玩家中有 28 位在停止之前找到了至少 99% 的产率。
  4. 优化器找到了专家未曾预料的配体。最佳条件使用 CgMe-PPh,而“据我们所知”,它“尚未被用作咪唑直接芳基化的配体。因此,有经验的化学家一开始往往不会考察这种配体。”在记录中,50 位玩家中有 3 位从它开始,24 位从 BrettPhos 开始;50 位中有 46 位最终试过 CgMe-PPh,其中一半最迟在第 10 次实验时就已试过。

比较的复杂之处在于,玩家认为已找到最优时可以停止,而大多数玩家确实停止了:玩家实验次数的中位数是 25,只有一位做满了全部 100 次(Shields 与 Li,2020)。比较第 15 次实验之后的平均值,实际上是拿优化器与仍在继续的玩家比较。因此,作者为人类平均值设定了上下界。若停止的玩家即使继续也找不到更好的结果(下界),人类平均值与原始平均值相近;对原始数据和这一下界,逐批进行的 Welch tt 检验都表明,第五批之后优化器的平均表现更好。若每位停止的玩家都会在紧接着的下一批达到 100%,即作者称为“不现实”的上界,人类平均值则“紧随”优化器,差异不显著(Shields 等,2021)。

这一对比有若干局限值得指出,而且是所有人机对比研究共有的那类局限(推断)。研究只涉及一个反应,空间中的配体由专家选定,因此专家知识在游戏开始之前就已介入。玩家不承担材料成本,不会遇到分析失败,也不必兼顾其他项目。此外,“平均更好”掩盖了离散程度:有两位玩家在前两批之内就找到了高于 99% 的产率,而优化器自身的运行需要 8 至 70 次实验才能做到(Shields 与 Li,2020)。

论文随后将这一方法用于两个规模过大、无法穷举测量的反应(Shields 等,2021)。Mitsunobu 反应把一个醇与另一个分子偶联,共有 180,000 种可能的配置;Bristol-Myers Squibb 使用的标准条件平均产率为 60%(两次重复分别为 59% 和 60%),而每批十个的贝叶斯优化“只用了四轮、每轮十个实验”,就找到了产率达 99% 的“三组不同的反应条件”。脱氧氟化反应把醇羟基替换为氟原子,共有 312,500 种配置;标准条件的产率为 36%(35% 和 36%),优化器每批五个,三轮之内即超过这一水平,十轮时达到 69%。对 Mitsunobu 反应,作者指出最佳条件位于“通常不会去搜索的反应空间区域”;在两个反应中,最佳条件都与标准条件大不相同。

要点专家在何处发挥作用

在这项研究中,化学家的知识在第一批实验和搜索空间的选择上发挥了作用,此后发挥作用的则是优化器的记账。人最有用的贡献,是在游戏开始之前做出的。

第 23.4 节引用的文献 2
  1. Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis
  2. Shields 与 Li(2020)EvML: Expert versus Machine Learning

23.5 从单个反应到自驱动实验室 #

回放掩盖了实际实验中无法回避的后勤问题。实验由机器人执行、优化器无须等待人就选定下一块板时,这种系统称为自驱动实验室(self-driving lab),贝叶斯优化通常是其中的决策者(第 36.7 节)。芳基化研究的三个特点在这种场合变得至关重要。

批量由硬件决定。一块板的孔数固定,分析仪器一次处理一块板,因此批量大小由设备而非优化器决定。第 23.3.3 节中以更多反应换取更少轮数的权衡,取决于一轮的代价(第 14.3 节)。

真实的化学问题带来约束和多个目标。有些组合会产生沉淀,有些在高温下不安全;产率也很少是唯一的目标,成本、纯度和废物量同样重要。这些因素成为对可运行实验的约束,以及需要权衡的额外目标(第 14.4 节;第 14.5 节)。基准数据集不含这些因素,这也是它既是一个干净的测试、又是一个简化的测试的部分原因。

收益以参照策略为基准衡量。Adesiji 等人(2026)的加速因子(acceleration factor;第 15.3 节)定义为参照策略达到目标所需的实验次数除以优化器所需的次数;在他们调研的研究中,其中位数为 6。在芳基化数据上,可以精确地做同样的计算(习题 23.1):随机选择平均约需 288 次实验才能找到 99% 的产率,而论文的优化器在 50 次运行(每次最多 100 个实验)中所需次数的中位数为 20,加速因子约为 14(推断,依据公开的运行结果)。以 90% 为目标时(有 18 个反应达到),随机选择约需 91 次,优化器的中位数为 17.5 次,加速因子约为 5。

在这些实验室中,人并没有离开回路,只是角色发生了变化。在自动化显微镜领域,Kalinin 等人(2024)在 2023 年的一篇预印本(后发表于 Microscopy Today)中认为,“未来几年可能的策略将是人在回路的自动化实验”,由人监控进展并调整智能体的策略;Pratiush 等人(2025)是 2024 年的一篇预印本,后发表于 Digital Discovery,该研究发现在某些设置下,实验路径可能“陷入局部极小值”,监控正是为此而设。结果的质量带有主观性时,人的判断本身就成为测量:Deneault 等人(2025)用偏好贝叶斯优化调节 3-D 打印机,以人对打印件的判断作为唯一的测量,并报告这提高了打印这类具有主观品质的物体的效率。这正是第四部分的情形:人就是目标函数本身,而不是它的监督者。

语言模型也进入了同一回路,效果好坏参半。作为自主优化器,它们在受控测试中表现不佳:Gupta 等人(2025)发现,把真实的实验结果换成随机打乱的标签,并不影响语言模型智能体在基因扰动和分子性质任务上的表现,而高斯过程优化等经典方法始终表现更好。作为编码的来源(即第 23.2 节的主题),语言模型则有所助益:GOLLuM 通过边际似然将反应的语言模型嵌入与高斯过程联合训练,在 23 个化学与材料任务上,50 次实验后的前 5% 覆盖率达到 36.3%,而固定嵌入加高斯过程为 26.5%,以少 41% 的实验达到了常规贝叶斯优化的水平(Ranković 等,2026)。在这两种情形中,保有不确定性并做出决策的都是高斯过程。

要点本案例为方法补充了什么

优化器中除编码之外,没有任何部分是化学所特有的。优化器之外的一切则都是:允许使用哪些试剂、实验台上能容纳多少个实验、专家已经知道什么,以及除产率之外“最好”还意味着什么。

下一章(第 24 章)以另一种方式让人留在回路中:目标函数在人的身体上测量,而且在优化器学习的同时,人也在变化。

第 23.5 节引用的文献 6
  1. Adesiji 等人(2026)Benchmarking self-driving labs
  2. Kalinin 等人(2024)Human-in-the-loop: The future of Machine Learning in Automated Electron Microscopy
  3. Pratiush 等人(2025)Building Workflows for Interactive Human in the Loop Automated Experiment (hAE) in STEM-EELS
  4. Deneault 等人(2025)Preferential Bayesian optimization improves the efficiency of printing objects with subjective qualities
  5. Gupta 等人(2025)LLMs for Bayesian Optimization in Scientific Domains: Are We There Yet?
  6. Ranković 等人(2026)Large language models as uncertainty-calibrated optimizers for experimental discovery

23.6 习题 #

习题 23.1

从 NN 个反应中按均匀随机的顺序、不重复地进行实验,其中 kk 个反应是“好的”。证明:直到找到第一个好反应为止(含该反应),实验次数的期望为 (N+1)/(k+1)(N + 1)/(k + 1)。对芳基化数据,分别以 99%(k=5k = 5)和 90%(k=18k = 18)为目标计算这一期望,并与论文的优化器比较,后者所需实验次数的中位数分别为 20 和 17.5。

解答

kk 个好反应把其余 N−kN - k 个反应分成 k+1k + 1 个间隔(第一个好反应之前、相邻两个好反应之间、最后一个好反应之后)。在随机顺序中,每个坏反应落入任一间隔的可能性相同,因此每个间隔平均有 (N−k)/(k+1)(N - k)/(k + 1) 个坏反应。找到第一个好反应所需的实验,是第一个间隔中的坏反应再加上它本身:(N−k)/(k+1)+1=(N+1)/(k+1)(N - k)/(k + 1) + 1 = (N + 1)/(k + 1)。取 N=1,728N = 1{,}728:k=5k = 5 时为 1,729/6≈2881{,}729 / 6 \approx 288,k=18k = 18 时为 1,729/19=911{,}729 / 19 = 91。与优化器的中位数相比,加速因子约为 288/20≈14288 / 20 \approx 14 和 91/17.5≈591 / 17.5 \approx 5。目标越稀少,模型的帮助越大,因为随机搜索要为浪费掉的每一个反应付出代价。

习题 23.2

利用第 23.2.1 节中的推导:设一个独热模型在某一种碱、溶剂、浓度和温度下测量了 CgMe-PPh,得到很高的产率。比较模型的后验均值对以下两个反应的预测:(a)换用另一种碱的 CgMe-PPh;(b)使用同一种碱的 X-Phos。哪些长度尺度决定了答案?改用描述符时会有什么变化?

解答

反应(a)与已测反应只在碱上不同,二者的相关性由 ℓbase\ell_{\text{base}} 决定;碱的长度尺度较长时,相关性高,(a)的后验均值被拉向实测产率。反应(b)只在配体上不同,其相关性由 ℓlig\ell_{\text{lig}} 通过固定的平方距离 2/ℓlig22 / \ell_{\text{lig}}^2 决定;若模型学到的配体长度尺度较短,相关性就低,(b)几乎不会被拉高,其他每种配体也都如此。改用描述符后,对(b)的拉动取决于 X-Phos 在描述符空间中与 CgMe-PPh 的距离:二者计算性质相似时拉动强,否则弱,而且每种配体各不相同。

习题 23.3

习题 14.4 表明,克里金信念在 x1\vx_1 处的伪观测不改变后验均值,并把 x1\vx_1 处的后验方差置为零。将这一结论应用于反应数据。一批中的第一个选择是 CgMe-PPh 搭配某一种碱、溶剂、浓度和温度。在第 23.2.1 节的独热编码下,加入伪观测后,哪些尚未尝试的反应损失的期望改进最多,哪些几乎没有损失?改用描述符后有何变化?这对两种编码下一批五个反应的多样性意味着什么?

解答

x\vx 处的方差下降 Cov⁡[f(x),f(x1)]2/Var⁡[f(x1)]\Cov[f(\vx), f(\vx_1)]^2 / \Var[f(\vx_1)],因此一个反应损失的期望改进,与核函数把它和所选反应联系的紧密程度成正比。在独热编码下,这一相关性只取决于五个选择中哪些不同,以及这些选择的长度尺度。配体相同、只在长度尺度较长的选择上不同的反应(碱、浓度或温度;第 23.3 节中的拟合使这些长度尺度保持较长),几乎就是所选反应的副本,会失去几乎全部期望改进。配体不同的反应沿配体方向都处于相同的平方距离 2/ℓlig22/\ell_{\text{lig}}^2,因此配体长度尺度较短时,它们几乎没有损失,其余十一种配体也受到同等对待。于是下一个选择会更换配体,但除后验均值之外,模型没有理由偏好某一种新配体。改用描述符后,计算性质与 CgMe-PPh 相近的配体也会失去期望改进,相距较远的则保留下来,因此克里金信念会把一批反应分散到化学性质不同的配体上,而不只是分散到标签不同的配体上。

延伸阅读 #

  • Shields 等人(2021)即本章回放的研究,包括基准、编码、批量方法、与 50 位化学家对比的游戏以及两项应用。其 Methods 部分给出了代理模型和采集函数的设置。
  • Shields(2021)是作者的软件,也是 1,728 个实测产率和描述符的来源;Shields 与 Li(2020)收录了游戏记录和作者的统计分析。两者均采用 MIT 许可证。脚本 tools/figure-data/cs-chem-arylation.py 按固定的提交版本下载这两份数据,并生成图中使用的精简副本。
  • Ginsbourger 等人(2010)提出了克里金信念,以及为高斯过程选择批量点的相关启发式方法。
  • Adesiji 等人(2026)定义了加速因子和增强因子,并汇总了各项自驱动实验室研究中的这两个指标。
  • Ranković 等人(2026)展示了如何把学习得到的语言模型嵌入用作高斯过程中的反应编码。
  • 第 36.7 节与第 34.2.2 节综述了自驱动实验室,以及化学家和其他专家参与优化回路的研究。

参考文献

  1. Adesiji, A. D., Wang, J., Kuo, C.-S., and Brown, K. A. (2026). Benchmarking self-driving labs. Digital Discovery. 引用于 §23.5
  2. Deneault, J. R., Kim, W., Kim, J., Gu, Y., Chang, J., Maruyama, B., Myung, J. I., and Pitt, M. A. (2025). Preferential Bayesian optimization improves the efficiency of printing objects with subjective qualities. Digital Discovery. 引用于 §23.5
  3. Ginsbourger, D., Le Riche, R., and Carraro, L. (2010). Kriging Is Well-Suited to Parallelize Optimization. Computational Intelligence in Expensive Optimization Problems. 引用于 §23.3
  4. Gupta, R., Hartford, J., and Liu, B. (2025). LLMs for Bayesian Optimization in Scientific Domains: Are We There Yet? Findings of the Association for Computational Linguistics: EMNLP 2025. 引用于 §23.5
  5. Kalinin, S. V., Liu, Y., Biswas, A., Duscher, G., Pratiush, U., Roccapriore, K., Ziatdinov, M., and Vasudevan, R. (2024). Human-in-the-loop: The future of Machine Learning in Automated Electron Microscopy. Microscopy Today. doi:10.1093/mictod/qaad096. 引用于 §23.5
  6. Pratiush, U., Roccapriore, K. M., Liu, Y., Duscher, G., Ziatdinov, M., and Kalinin, S. V. (2025). Building Workflows for Interactive Human in the Loop Automated Experiment (hAE) in STEM-EELS. Digital Discovery. doi:10.1039/d5dd00033e. 引用于 §23.5
  7. Ranković, B., Griffiths, R.-R., and Schwaller, P. (2026). Large language models as uncertainty-calibrated optimizers for experimental discovery. Nature Machine Intelligence. doi:10.1038/s42256-026-01283-z. 引用于 §23.5
  8. Shields, B. J. (2021). EDBO: Experimental Design via Bayesian Optimization. GitHub repository, MIT License; direct arylation data in experiments/data/direct_arylation, commit 9b41eac. 软件
  9. Shields, B. J., and Li, J. (2020). EvML: Expert versus Machine Learning. GitHub repository, MIT License; reaction optimization game records and analysis, commit 9fb4655. 软件引用于 §23.3 §23.4
  10. Shields, B. J., Stevens, J., Li, J., Parasram, M., Damani, F., Alvarado, J. I. M., … Doyle, A. G. (2021). Bayesian reaction optimization as a tool for chemical synthesis. Nature. 引用于 §23.1 §23.2 §23.3 §23.4