优化化学反应
第 22 章调节的是软件设置:一次评估只需几秒钟计算,设置都是数值。本章转到实验室。这里的设置是选用哪些化学品、在什么温度下反应;一次评估就是一个化学反应,运行和分析需要数小时;而且通常有几个反应同时进行。
本章围绕 Shields 等人(2021)展开,该研究于 2021 年发表在 Nature 上。作者包括普林斯顿大学和 Bristol-Myers Squibb 的化学家以及计算机科学家,他们对一个反应的全部 1,728 种可能版本逐一进行实验,测量了每个版本的产物量。每个结果都已知,因此优化过程可以回放:本章图中的一次“实验”,就是查出实验室测得的产率。作者还请 50 位化学家和工程师通过一个游戏优化同一反应,游戏返回的正是这些真实结果,玩家的选择也已公开。两份数据都以 MIT 许可证发布在公开代码库中(Shields,2021;Shields 与 Li,2020),该许可证允许再分发,因此下面的图直接使用实测数据。
本章先介绍这一反应及尝试一个版本的代价,再讨论分类器问题中没有出现的一个问题:高斯过程如何衡量化学品之间的相似性。随后读者亲自参与化学家们做过的游戏,并观察优化器如何完成同一游戏。最后两节报告该研究与人类专家对比的结果,以及由机器人执行实验时会有哪些变化。
引言引用的文献 3
- Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis
- Shields(2021)EDBO: Experimental Design via Bayesian Optimization
- Shields 与 Li(2020)EvML: Expert versus Machine Learning
23.1 问题 #
23.1.1 反应与产率 #
化学反应把起始原料转化为产物。该研究中的反应是直接芳基化(direct arylation):把一个由碳原子构成的环(芳基,这里是氟代苯环)连接到称为咪唑的含氮小环上,连接位置原本只有一个氢原子。产物是 5-(2-fluorophenyl)-1-methyl-1H-imidazole-4-carbonitrile。这一反应与 BMS-911543 商业合成中的一个关键步骤有关,BMS-911543 是一种抑制 JAK2 酶的候选药物(Shields 等,2021)。
这一反应需要多种辅助成分。连接由钯催化剂(catalyst)完成,催化剂能加快反应而自身不被消耗;配体(ligand)是与钯结合的分子,影响钯的催化效果。碱(base)除去反应释放的酸,溶剂(solvent)是溶解所有物质的液体。另有两个连续条件构成完整的配方:起始原料的浓度(concentration)和温度(temperature)。反应的结果是产率(yield),即起始原料最终转化为目标产物的百分比。产率 100% 表示原料毫无浪费,0% 表示反应没有发生。
表 23.1 列出了该研究允许的选择,每种组合都是一个可能的实验:。
| 选择 | 选项 |
|---|---|
| 配体(12) | BrettPhos、PPhtBu2、tBPh-CPhos、PCy3 HBF4、PPh3、X-Phos、P(fur)3、PPh2Me、GorlosPhos HBF4、JackiePhos、CgMe-PPh、PPhMe2 |
| 碱(4) | KOAc、KOPiv、CsOAc、CsOPiv(钾或铯的乙酸盐或新戊酸盐) |
| 溶剂(4) | BuOAc(乙酸丁酯)、对二甲苯、BuCN(丁腈)、DMAc(二甲基乙酰胺) |
| 浓度(3) | 0.057、0.1、0.153 M(摩尔每升) |
| 温度(3) | 90、105、120 °C |
23.1.2 一次实验的代价 #
尝试反应的一个版本,要把化学品混入小瓶,加热,再测量生成了多少产物。作者写道,“许多反应需要数小时乃至数天才能进行完全”,因此实验分批并行,而不是逐个进行(Shields 等,2021)。下文介绍的游戏为玩家提供的实验台空间是每个工作日五个实验,一个“月”为 20 天。
为构建这一基准,作者采用高通量实验(high-throughput experimentation,HTE),即并行运行大量微型化反应,将全部 1,728 种组合各运行一次。每个反应都“没有重复”测量(Shields 等,2021),因此每种组合恰好只有一个实测产率,数据无法说明重复实验会相差多少。这与分类器一章相反:那里每个设置都有五次重复测量;这里的回放是确定性的,测量噪声真实存在,只是无法看到。
23.1.3 地形 #
1,728 个反应大多效果很差。产率的中位数为 8.1%,均值为 19.4%;494 个反应(29%)完全没有产物。只有 67 个达到 80%,18 个达到 90%,5 个达到 99%。这五个反应都使用同一种配体 CgMe-PPh;产率达到 100% 的两个反应是 CgMe-PPh 搭配乙酸铯或新戊酸铯,以 DMAc 为溶剂,浓度 0.153 M,温度 105 °C(根据公开数据计算;tools/figure-data/cs-chem-arylation.py 会输出这些汇总结果)。
配体的影响最大。对其他所有条件取平均,X-Phos(52.8%)和 CgMe-PPh(50.2%)的产率最高,三种小的膦(PPhMe2、PPhtBu2、PPh2Me)几乎没有产物(0.3%、0.4%、2.0%)。仿照第 22.4.1 节衡量超参数的方法,以单个选择所解释的产率方差比例来衡量,配体解释 48%,溶剂 8%,温度 3%,碱 1%,浓度 0.2%。这些主效应合计 60%;其余 40% 来自各选择的共同作用,例如某种配体只在部分溶剂中有效。
23.1.4 实验开始前的选择 #
作者写道:“反应优化真正始于定义搜索空间”(Shields 等,2021)。在任何优化器或玩家接触这一问题之前,已经做出了三个决定。第一,由人从 70 种候选中选出 12 种配体;论文明确指出,这一选择“基于宝贵的专家知识,而非机器学习”。第二,两个连续条件各简化为三个水平,空间因而有限,穷举测量才成为可能。第三,目标只有产率:数据中没有试剂成本、溶剂安全性或产物纯度的任何信息,而这些都是工艺化学家要权衡的因素(推断)。下文的所有结果都只针对按此定义的空间。
第 23.1 节引用的文献 1
- Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis
23.2 试剂编码 #
高斯过程根据它认为相似的反应的产率来预测一个反应的产率,而核函数通过输入之间的距离来定义“相似”(第 9 章)。温度有天然的距离:105 °C 位于 90 与 120 之间。配体则没有。“BrettPhos 减去 X-Phos”毫无意义;若把配体编号为 1 至 12,模型会误以为配体 3 位于配体 2 和配体 4 之间。循环开始之前,每种试剂都需要转换为向量。该研究比较了三种方式,其中两个极端最能说明问题所在。
23.2.1 独热编码 #
最简单的编码为每个选项分配一个独立的坐标。一种配体表示为由 12 个数组成的向量,该配体所在位置为 1,其余全为 0:BrettPhos 是 ,PPhtBu2 是 ,依此类推。这就是独热编码(one-hot encoding)。一个反应的编码由配体、碱和溶剂的向量以及浓度和温度的水平拼接而成。
因此,独热模型能够学到配体重要与否(通过缩小 ),却学不到哪些配体彼此相似。测量 BrettPhos 之后,模型对其他每种配体获得的信息都相同。对各选项一无所知时,这是合理的假设;化学知识已经相当丰富时,这一假设就造成了浪费。
23.2.2 描述符编码 #
另一种做法用计算得到的性质来描述每个分子,这些性质称为描述符(descriptors)。Shields 等人(2021)用密度泛函理论(density functional theory,DFT)计算描述符,这是针对分子中电子的量子力学计算;记录的量包括最外层电子轨道的能量、偶极矩(电荷分布的不均匀程度)以及各原子上的电荷。每个配体分子由此得到 1,358 个在不同配体之间有变化的数值,碱为 231 个,溶剂为 116 个。采用描述符后,电子性质和空间位阻性质相近的两种配体,在核函数看来也相近,用其中一种测得的产率可以为另一种提供信息。假设也从“所有配体彼此同样不同”变为“产率随这些性质光滑变化”,后者合乎情理,但并无保证。
每种配体上千个坐标,远超高斯过程所需,而这里恰好有一条精确的捷径。12 个点总位于至多 11 维的空间中,因此把描述符标准化,再旋转到其主成分(principal components)上(即离散程度最大的方向,由奇异值分解求得)之后,11 个坐标就能无损地描述 12 种配体;同理,4 种碱用 3 个坐标,4 种溶剂也用 3 个坐标。下文的回放使用这些旋转后的描述符,分子之间的所有距离都得以保留,只差每个选择各一个比例因子。
23.2.3 该研究的发现 #
论文在另外六个有公开数据的反应上调校优化器,即一个 Suzuki-Miyaura 偶联和五个 Buchwald-Hartwig 偶联,并比较了 DFT 描述符、开源化学信息学库 Mordred 生成的描述符以及独热编码(Shields 等,2021)。平均损失(loss),即数据集中最高产率与优化器找到的最高产率之差,在三种编码之间“基本无法区分”(Welch 检验 ;该检验比较两个均值,不假定方差相等)。差别在于最坏情况:在从不同随机起点出发的多次运行中,使用 DFT 描述符时,每个反应的最大损失至多为 5% 的产率,Mordred 至多为 15%,独热编码至多为 8%。作者保留了 DFT 描述符,并指出“在实际应用中,多种反应编码都能取得可以接受的性能”。
在测量任何反应之前,编码就已决定了模型把哪些反应视为相似。独热编码假定各选项互不相关;描述符则假定各选项之间的相似程度与其计算性质的相似程度一致。两者都不是从产率中学到的,因此选择编码与选择核函数一样,都是建模假设。
第 23.2 节引用的文献 1
- Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis
23.3 回放优化过程 #
23.3.1 亲自尝试 #
在观察优化器之前,先像那 50 位玩家一样亲自尝试这一问题。下图即按论文规则设置的游戏,只是预算为 50 次实验而非 100 次:到第 50 次实验时,50 位玩家中已有 44 位停止。每批最多选择五个反应,运行这一批,读出产率,再规划下一批。
游戏过程中有两点值得注意。第一批最难,因为图上的一切都还未知;玩家们在这一批中运用了化学知识,第 23.4 节表明这确实有帮助。此后各批需要权衡:是确认一个有希望的区域,还是测试一种尚未尝试的配体。如果结束时仍未找到高于 99% 的产率,可以打开“显示全部产率”,查看 CgMe-PPh 所在的横带。
23.3.2 优化器 #
图中的优化器以简化形式重新实现了论文的方法,并非论文的代码。代理模型是标准化产率上的高斯过程,在编码上使用 Matérn 5/2 核,每个选择(配体、碱、溶剂、浓度、温度)各有一个长度尺度。论文通过最大化边际似然拟合长度尺度,所用的 Gamma 先验偏好较长的长度尺度,从而“假定大多数维度是无关的”(Shields 等,2021)。本书的实现从一个简短的候选值列表中为每个长度尺度选值,从另一个列表中为噪声方差选值,依据是边际似然,外加对较长长度尺度的轻微偏好(第 9.3 节)。这些列表以及该偏好的中心,是在同一数据集上试过几种取值后确定的,相当于在测试问题上做了少量调参;论文则在其他反应上调参,避免了这一问题。采集函数是期望改进(第 12.3 节),采用论文的探索偏移量 0.01,在所有尚未运行的反应上求最大值。
新的要素是批量。期望改进为单个实验打分,但实验台一次运行五个实验,而得分最高的五个反应通常彼此几乎相同。论文采用克里金信念(kriging believer)(Ginsbourger 等,2010):逐个挑选反应组成一批,每挑出一个,就把模型在该处的预测当作已经测得的结果。
输入:已拟合的高斯过程,尚未运行的反应集合 ,批量大小 。
- 对 :
- 在当前模型下选择 。
- 从 中移除 。
- 把伪观测 (即模型自身的均值预测)加入数据,并用相同的核超参数更新后验。
- 运行这 个反应,用实测产率替换伪观测。
第 1.3 步不改变后验均值,但使 处的不确定性坍缩,并缩小其附近的不确定性,于是与 相似的反应的期望改进下降,下一个选择转向别处(原因见习题 14.4;习题 23.3 将其应用于反应数据)。第 14.3 节对批量采集有更一般的讨论。论文报告,在其六个开发用反应上,预算为 50 时,每批五个与每次一个的平均效果相当()(Shields 等,2021)。
可以尝试以下几点:
逐批查看。最初几批中,权重柱都很短:只有十几个产率,且大多接近零,模型无法分辨哪个选择重要,于是保留先验所偏好的较长长度尺度。大约到第四批,配体的权重柱通常会凸显出来。在 50 次运行中,20 次实验后拟合长度尺度的中位数为:配体 1,溶剂 2,碱、浓度和温度均为 4,即先验所偏好的值(tools/figure-data/cs-chem-race.ts)。这一顺序与第 23.1.3 节中的主效应一致,而它仅由 1,728 个产率中的 20 个学得。
切换到独热编码。前几批会发生变化,因为模型不再认为相似的配体给出相似的产率。观察这次运行是否仍能找到 CgMe-PPh 所在的横带,以及需要多久。
使用化学家的第一批。前五个实验改为某位有记录的玩家的前五个实验(每次运行换一位玩家)。平均而言,橙色曲线的起点因此更高,五次实验后为 64.8%,随机起点为 50.0%,但并非每次运行都如此:图初始显示的那次运行,随机抽到的第一批恰好很好(76.7%),而分配到的玩家的第一批只达到 20.6%。多按几次“新一轮运行”,观察第一批之后曲线如何变化。
显示全部产率,查看这次运行搜索过哪些区域、错过了什么。
23.3.3 各策略的 50 次运行 #
一次运行只反映一次运气。表 23.2 汇总了每种变体各 50 次运行的结果,并列出论文自身的运行和有记录的化学家。
| 策略 | 10 | 20 | 30 | 50 | ≥ 99%(中位数) |
|---|---|---|---|---|---|
| 随机选择 | 65.1% | 75.5% | 81.8% | 88.8% | 50 次中 4 次(40) |
| 50 位化学家 | 79.8% | 88.4% | 92.9% | 94.2% | 50 次中 24 次(22) |
| 论文的优化器,随机起点 | 74.1% | 91.6% | 97.5% | 99.8% | 50 次中 46 次(19.5) |
| 论文的优化器,化学家起点 | 74.0% | 91.5% | 98.9% | 99.9% | 50 次中 50 次(22.5) |
| 本书实现,描述符 | 64.0% | 82.7% | 97.1% | 99.9% | 50 次中 50 次(26) |
| 本书实现,独热 | 66.3% | 85.4% | 95.2% | 99.6% | 50 次中 48 次(27) |
| 本书实现,描述符,每批 1 个 | 54.8% | 87.4% | 99.3% | 100.0% | 50 次中 50 次(22) |
| 本书实现,描述符,每批 10 个 | 65.1% | 82.5% | 91.5% | 98.5% | 50 次中 44 次(31) |
| 本书实现,描述符,化学家起点 | 67.4% | 79.3% | 93.1% | 99.9% | 50 次中 49 次(31) |
这张表有五点值得注意。
随机选择很少找到最佳反应。1,728 个反应中有五个达到 99%;按随机顺序进行实验,50 次运行中只有 4 次在前 50 个实验内找到其中之一。平均而言,随机选择约需 288 次实验(习题 23.1)。每个版本的贝叶斯优化都在 50 次运行中至少有 44 次找到了这样的反应。
本书简化的优化器起步较慢,随后赶上。10 次和 20 次实验后,论文的优化器领先 9 至 10 个百分点的产率;到 30 次实验时,两者相差不到半个百分点。论文在另外六个反应上调校先验,其运行在去除高度相关的描述符之后,用完整的描述符集合编码同样的化学信息(Shields 等,2021);本书的实现则对长度尺度做粗略搜索。最终结果对这些细节不敏感,早期阶段则较为敏感(推断)。
在这里,独热编码并不差多少。在 50 次运行中,独热编码在 10 次和 20 次实验后领先于描述符,在 30 次和 50 次时落后;50 次运行中有 2 次未能找到 99% 的产率,描述符则一次也没有错过。这与论文的发现一致:平均表现相近,描述符的最坏情况更好。在这一数据集上,配体起主导作用;模型一旦学到“配体很重要,且 CgMe-PPh 效果好”,在试过 CgMe-PPh 之后,就不再需要知道哪些配体彼此相似(推断)。
批量大小是实验次数与天数之间的权衡。按实验次数计,批量越小效率越高:达到 99% 所需实验次数的中位数,每次一个为 22,每批五个为 26,每批十个为 31,而且每批十个时 50 次运行中有 6 次未能达到。按轮数计,顺序则相反:中位数分别为每次一个 22 轮、每批五个 6 轮、每批十个 4 轮。一轮相当于实验台上的一天时,较大的批量能更早完成,代价是更多的反应。
化学家的第一批只对第一批有帮助。以玩家自己的前五个实验为起点,五次实验后的最高产率从 50.0% 提高到 64.8%,论文的优化器和本书的实现都是如此。这一优势没有延续下去。无论从哪种起点出发,论文的优化器在 20 次实验后都达到 91.5%;本书的实现从化学家起点出发反而不如从随机起点出发(20 次后为 79.3% 对 82.7%,达到 99% 所需实验次数的中位数为 31 对 26)。作者自己的分析用 Welch 检验逐批比较两种起点:差异在第一批显著(),在随后五批不显著( 介于 0.13 至 0.98)(Shields 与 Li,2020)。一个可能的原因是多样性:50 位玩家中有 7 位在整个第一批中只测试了一种配体,平均每位玩家的第一批覆盖 3.8 种配体,而五个随机反应覆盖 4.2 种。与较差但更多样的起点相比,较好但狭窄的起点让模型对其他配体了解得更少(推断;参见第 11.4 节)。
第 23.3 节引用的文献 3
- Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis
- Shields 与 Li(2020)EvML: Expert versus Machine Learning
- Ginsbourger 等人(2010)Kriging Is Well-Suited to Parallelize Optimization
23.4 与人类专家对比 #
与化学家的对比是 Shields 等人(2021)中最受关注的部分,其基础是一个精心设计的游戏。玩家得到该反应、12 种配体、4 种碱、4 种溶剂以及浓度和温度的各个水平,须在“一个月”内找到最佳条件,“每个工作日”运行一批五个实验。游戏最多允许 20 批,共 100 次实验,“约占实验空间的 6%”。“虽然这个游戏旨在模拟固定实验预算下的反应优化,但数据是真实的”:每次实验返回高通量数据中的实测产率。50 位“来自学术界和工业界的化学家与工程师专家”参加了游戏,优化器则从不同的随机起点出发,将同一游戏重复了 50 次(Shields 等,2021)。根据公开记录,30 位玩家来自制药行业,19 位来自学术界,1 位来自其他领域;按职位分,有 15 位工艺化学家、12 位研究生、11 位工程师、6 位博士后研究人员、3 位教职人员和 3 位药物化学家(Shields 与 Li,2020)。
论文报告了四项发现(Shields 等,2021)。
- 化学家的起步更好。“人类的初始选择显著()优于随机选择,平均而言,他们在第一批实验中发现的条件产率高出 15%。”在公开记录中,第一批之后的平均最高产率,玩家为 64.8%,优化器的随机起点为 50.0%。
- 优化器在三批之内超过了化学家。用作者的话说,“即使采用随机初始化,在三批、每批五个实验之内,优化器的平均表现就超过了人类。”
- 优化器更稳定。它“在实验预算内以 100% 的比例达到了 >99% 的产率”;在记录中,50 位玩家中有 28 位在停止之前找到了至少 99% 的产率。
- 优化器找到了专家未曾预料的配体。最佳条件使用 CgMe-PPh,而“据我们所知”,它“尚未被用作咪唑直接芳基化的配体。因此,有经验的化学家一开始往往不会考察这种配体。”在记录中,50 位玩家中有 3 位从它开始,24 位从 BrettPhos 开始;50 位中有 46 位最终试过 CgMe-PPh,其中一半最迟在第 10 次实验时就已试过。
比较的复杂之处在于,玩家认为已找到最优时可以停止,而大多数玩家确实停止了:玩家实验次数的中位数是 25,只有一位做满了全部 100 次(Shields 与 Li,2020)。比较第 15 次实验之后的平均值,实际上是拿优化器与仍在继续的玩家比较。因此,作者为人类平均值设定了上下界。若停止的玩家即使继续也找不到更好的结果(下界),人类平均值与原始平均值相近;对原始数据和这一下界,逐批进行的 Welch 检验都表明,第五批之后优化器的平均表现更好。若每位停止的玩家都会在紧接着的下一批达到 100%,即作者称为“不现实”的上界,人类平均值则“紧随”优化器,差异不显著(Shields 等,2021)。
这一对比有若干局限值得指出,而且是所有人机对比研究共有的那类局限(推断)。研究只涉及一个反应,空间中的配体由专家选定,因此专家知识在游戏开始之前就已介入。玩家不承担材料成本,不会遇到分析失败,也不必兼顾其他项目。此外,“平均更好”掩盖了离散程度:有两位玩家在前两批之内就找到了高于 99% 的产率,而优化器自身的运行需要 8 至 70 次实验才能做到(Shields 与 Li,2020)。
论文随后将这一方法用于两个规模过大、无法穷举测量的反应(Shields 等,2021)。Mitsunobu 反应把一个醇与另一个分子偶联,共有 180,000 种可能的配置;Bristol-Myers Squibb 使用的标准条件平均产率为 60%(两次重复分别为 59% 和 60%),而每批十个的贝叶斯优化“只用了四轮、每轮十个实验”,就找到了产率达 99% 的“三组不同的反应条件”。脱氧氟化反应把醇羟基替换为氟原子,共有 312,500 种配置;标准条件的产率为 36%(35% 和 36%),优化器每批五个,三轮之内即超过这一水平,十轮时达到 69%。对 Mitsunobu 反应,作者指出最佳条件位于“通常不会去搜索的反应空间区域”;在两个反应中,最佳条件都与标准条件大不相同。
在这项研究中,化学家的知识在第一批实验和搜索空间的选择上发挥了作用,此后发挥作用的则是优化器的记账。人最有用的贡献,是在游戏开始之前做出的。
第 23.4 节引用的文献 2
- Shields 等人(2021)Bayesian reaction optimization as a tool for chemical synthesis
- Shields 与 Li(2020)EvML: Expert versus Machine Learning
23.5 从单个反应到自驱动实验室 #
回放掩盖了实际实验中无法回避的后勤问题。实验由机器人执行、优化器无须等待人就选定下一块板时,这种系统称为自驱动实验室(self-driving lab),贝叶斯优化通常是其中的决策者(第 36.7 节)。芳基化研究的三个特点在这种场合变得至关重要。
批量由硬件决定。一块板的孔数固定,分析仪器一次处理一块板,因此批量大小由设备而非优化器决定。第 23.3.3 节中以更多反应换取更少轮数的权衡,取决于一轮的代价(第 14.3 节)。
真实的化学问题带来约束和多个目标。有些组合会产生沉淀,有些在高温下不安全;产率也很少是唯一的目标,成本、纯度和废物量同样重要。这些因素成为对可运行实验的约束,以及需要权衡的额外目标(第 14.4 节;第 14.5 节)。基准数据集不含这些因素,这也是它既是一个干净的测试、又是一个简化的测试的部分原因。
收益以参照策略为基准衡量。Adesiji 等人(2026)的加速因子(acceleration factor;第 15.3 节)定义为参照策略达到目标所需的实验次数除以优化器所需的次数;在他们调研的研究中,其中位数为 6。在芳基化数据上,可以精确地做同样的计算(习题 23.1):随机选择平均约需 288 次实验才能找到 99% 的产率,而论文的优化器在 50 次运行(每次最多 100 个实验)中所需次数的中位数为 20,加速因子约为 14(推断,依据公开的运行结果)。以 90% 为目标时(有 18 个反应达到),随机选择约需 91 次,优化器的中位数为 17.5 次,加速因子约为 5。
在这些实验室中,人并没有离开回路,只是角色发生了变化。在自动化显微镜领域,Kalinin 等人(2024)在 2023 年的一篇预印本(后发表于 Microscopy Today)中认为,“未来几年可能的策略将是人在回路的自动化实验”,由人监控进展并调整智能体的策略;Pratiush 等人(2025)是 2024 年的一篇预印本,后发表于 Digital Discovery,该研究发现在某些设置下,实验路径可能“陷入局部极小值”,监控正是为此而设。结果的质量带有主观性时,人的判断本身就成为测量:Deneault 等人(2025)用偏好贝叶斯优化调节 3-D 打印机,以人对打印件的判断作为唯一的测量,并报告这提高了打印这类具有主观品质的物体的效率。这正是第四部分的情形:人就是目标函数本身,而不是它的监督者。
语言模型也进入了同一回路,效果好坏参半。作为自主优化器,它们在受控测试中表现不佳:Gupta 等人(2025)发现,把真实的实验结果换成随机打乱的标签,并不影响语言模型智能体在基因扰动和分子性质任务上的表现,而高斯过程优化等经典方法始终表现更好。作为编码的来源(即第 23.2 节的主题),语言模型则有所助益:GOLLuM 通过边际似然将反应的语言模型嵌入与高斯过程联合训练,在 23 个化学与材料任务上,50 次实验后的前 5% 覆盖率达到 36.3%,而固定嵌入加高斯过程为 26.5%,以少 41% 的实验达到了常规贝叶斯优化的水平(Ranković 等,2026)。在这两种情形中,保有不确定性并做出决策的都是高斯过程。
优化器中除编码之外,没有任何部分是化学所特有的。优化器之外的一切则都是:允许使用哪些试剂、实验台上能容纳多少个实验、专家已经知道什么,以及除产率之外“最好”还意味着什么。
下一章(第 24 章)以另一种方式让人留在回路中:目标函数在人的身体上测量,而且在优化器学习的同时,人也在变化。
第 23.5 节引用的文献 6
- Adesiji 等人(2026)Benchmarking self-driving labs
- Kalinin 等人(2024)Human-in-the-loop: The future of Machine Learning in Automated Electron Microscopy
- Pratiush 等人(2025)Building Workflows for Interactive Human in the Loop Automated Experiment (hAE) in STEM-EELS
- Deneault 等人(2025)Preferential Bayesian optimization improves the efficiency of printing objects with subjective qualities
- Gupta 等人(2025)LLMs for Bayesian Optimization in Scientific Domains: Are We There Yet?
- Ranković 等人(2026)Large language models as uncertainty-calibrated optimizers for experimental discovery
23.6 习题 #
从 个反应中按均匀随机的顺序、不重复地进行实验,其中 个反应是“好的”。证明:直到找到第一个好反应为止(含该反应),实验次数的期望为 。对芳基化数据,分别以 99%()和 90%()为目标计算这一期望,并与论文的优化器比较,后者所需实验次数的中位数分别为 20 和 17.5。
解答
个好反应把其余 个反应分成 个间隔(第一个好反应之前、相邻两个好反应之间、最后一个好反应之后)。在随机顺序中,每个坏反应落入任一间隔的可能性相同,因此每个间隔平均有 个坏反应。找到第一个好反应所需的实验,是第一个间隔中的坏反应再加上它本身:。取 : 时为 , 时为 。与优化器的中位数相比,加速因子约为 和 。目标越稀少,模型的帮助越大,因为随机搜索要为浪费掉的每一个反应付出代价。
利用第 23.2.1 节中的推导:设一个独热模型在某一种碱、溶剂、浓度和温度下测量了 CgMe-PPh,得到很高的产率。比较模型的后验均值对以下两个反应的预测:(a)换用另一种碱的 CgMe-PPh;(b)使用同一种碱的 X-Phos。哪些长度尺度决定了答案?改用描述符时会有什么变化?
解答
反应(a)与已测反应只在碱上不同,二者的相关性由 决定;碱的长度尺度较长时,相关性高,(a)的后验均值被拉向实测产率。反应(b)只在配体上不同,其相关性由 通过固定的平方距离 决定;若模型学到的配体长度尺度较短,相关性就低,(b)几乎不会被拉高,其他每种配体也都如此。改用描述符后,对(b)的拉动取决于 X-Phos 在描述符空间中与 CgMe-PPh 的距离:二者计算性质相似时拉动强,否则弱,而且每种配体各不相同。
习题 14.4 表明,克里金信念在 处的伪观测不改变后验均值,并把 处的后验方差置为零。将这一结论应用于反应数据。一批中的第一个选择是 CgMe-PPh 搭配某一种碱、溶剂、浓度和温度。在第 23.2.1 节的独热编码下,加入伪观测后,哪些尚未尝试的反应损失的期望改进最多,哪些几乎没有损失?改用描述符后有何变化?这对两种编码下一批五个反应的多样性意味着什么?
解答
处的方差下降 ,因此一个反应损失的期望改进,与核函数把它和所选反应联系的紧密程度成正比。在独热编码下,这一相关性只取决于五个选择中哪些不同,以及这些选择的长度尺度。配体相同、只在长度尺度较长的选择上不同的反应(碱、浓度或温度;第 23.3 节中的拟合使这些长度尺度保持较长),几乎就是所选反应的副本,会失去几乎全部期望改进。配体不同的反应沿配体方向都处于相同的平方距离 ,因此配体长度尺度较短时,它们几乎没有损失,其余十一种配体也受到同等对待。于是下一个选择会更换配体,但除后验均值之外,模型没有理由偏好某一种新配体。改用描述符后,计算性质与 CgMe-PPh 相近的配体也会失去期望改进,相距较远的则保留下来,因此克里金信念会把一批反应分散到化学性质不同的配体上,而不只是分散到标签不同的配体上。
延伸阅读 #
- Shields 等人(2021)即本章回放的研究,包括基准、编码、批量方法、与 50 位化学家对比的游戏以及两项应用。其 Methods 部分给出了代理模型和采集函数的设置。
- Shields(2021)是作者的软件,也是 1,728 个实测产率和描述符的来源;Shields 与 Li(2020)收录了游戏记录和作者的统计分析。两者均采用 MIT 许可证。脚本 tools/figure-data/cs-chem-arylation.py 按固定的提交版本下载这两份数据,并生成图中使用的精简副本。
- Ginsbourger 等人(2010)提出了克里金信念,以及为高斯过程选择批量点的相关启发式方法。
- Adesiji 等人(2026)定义了加速因子和增强因子,并汇总了各项自驱动实验室研究中的这两个指标。
- Ranković 等人(2026)展示了如何把学习得到的语言模型嵌入用作高斯过程中的反应编码。
- 第 36.7 节与第 34.2.2 节综述了自驱动实验室,以及化学家和其他专家参与优化回路的研究。
参考文献
- (2026). Benchmarking self-driving labs. Digital Discovery. 引用于 §23.5
- (2025). Preferential Bayesian optimization improves the efficiency of printing objects with subjective qualities. Digital Discovery. 引用于 §23.5
- (2010). Kriging Is Well-Suited to Parallelize Optimization. Computational Intelligence in Expensive Optimization Problems. 引用于 §23.3
- (2025). LLMs for Bayesian Optimization in Scientific Domains: Are We There Yet? Findings of the Association for Computational Linguistics: EMNLP 2025. 引用于 §23.5
- (2024). Human-in-the-loop: The future of Machine Learning in Automated Electron Microscopy. Microscopy Today. doi:10.1093/mictod/qaad096. 引用于 §23.5
- (2025). Building Workflows for Interactive Human in the Loop Automated Experiment (hAE) in STEM-EELS. Digital Discovery. doi:10.1039/d5dd00033e. 引用于 §23.5
- (2026). Large language models as uncertainty-calibrated optimizers for experimental discovery. Nature Machine Intelligence. doi:10.1038/s42256-026-01283-z. 引用于 §23.5
- (2021). EDBO: Experimental Design via Bayesian Optimization. GitHub repository, MIT License; direct arylation data in experiments/data/direct_arylation, commit 9b41eac. 软件
- (2020). EvML: Expert versus Machine Learning. GitHub repository, MIT License; reaction optimization game records and analysis, commit 9fb4655. 软件引用于 §23.3 §23.4
- (2021). Bayesian reaction optimization as a tool for chemical synthesis. Nature. 引用于 §23.1 §23.2 §23.3 §23.4