贝叶斯优化
第五部分:案例研究
EN

通过比较增强照片

偏好各章讲解方法时,所用的设计都小到可以一览无余:第 19 章中色轮上的一个色相,第 20.2 节中只有两个旋钮的平面海报地形。真实的设计任务并非如此。一张照片有十几项相互影响的调整,无人能写出为其打分的函数;能衡量一个版本好看与否的唯一仪器是人,而人会疲倦,会改变主意,在不同屏幕上看到的画面也各不相同。

本章的问题是真实的,因为读者本人就是问题的一部分。图中展示一张真实的照片,读者通过比较不同版本来增强它:或从两个版本中选出较好的一个,或沿调整空间中的一条直线滑动。这正是 Koyama 等人(2017)与 Koyama 等人(2020)为照片色彩增强研究过的两种查询形式。算法就是第 18 章与第 19 章中构建的算法,未作任何改动,只是参数从一两个变成了六个。本章先描述问题及一次判断的代价,然后讨论提出第一个问题之前必须做出的决定,接着介绍照片上的两种查询形式,最后考察一次会话能揭示参与者的哪些情况,并与已发表研究的发现相对照。

引言引用的文献 2
  1. Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
  2. Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization

25.1 问题 #

25.1.1 一张照片和六项调整 #

这张照片由 Aleš Krivec 于 2014 年 10 月 19 日在斯洛文尼亚的 Zelenci 自然保护区拍摄,并依 CC0 1.0 置于公有领域(Wikimedia Commons 上的“Zelenci 2014 (2).jpg”,最初发布于 Unsplash)。选用这张照片,是因为下面提供的每一项调整都会影响它的观感。画面中有明亮的天空和受光的山壁,调整过度就会过曝;有幽暗的森林,细节隐没在阴影中;有金色的草地,会随白平衡变成橙色或橄榄色;还有绿松石色的水面,偏暖的设置会使其黯淡。多数改变在改善一个区域的同时会损害另一个区域,因此不存在所有观看者都公认最好的设置。

设计(design)指六项调整的一组设定,每项是一个数 ui∈[0,1]u_i \in [0, 1],ui=0.5u_i = 0.5 对应未经改动的照片。表 25.1 列出各项调整的作用及其范围。将每项调整映射到单位区间是通常的约定,Ou 等人(2023)研究中的照片增强器也是如此;这样,同一个核长度尺度在各个方向上的含义大致相同。

表 25.1 六项调整。每项将 u∈[0,1]u \in [0, 1] 映射为一个设置,u=0.5u = 0.5 对应原始照片。EV 为曝光值,即档:增加一档,光量加倍。
调整 作用 u=0u = 0 时 u=1u = 1 时
曝光 提亮或压暗;暗部色调按 2EV2^{\text{EV}} 缩放,白色保持不变 −1-1 EV +1+1 EV
对比度 以中灰为中心拉伸或压平色调 ×0.66\times 0.66 ×1.52\times 1.52
饱和度 使每种颜色远离或靠近其对应的灰色 ×0.5\times 0.5 ×2\times 2
色温 此消彼长地调整红与蓝 偏冷 偏暖
色调 此消彼长地调整绿与品红 偏绿 偏品红
阴影 提亮或加深较暗的三分之一色调 更深 提亮

在进行任何优化之前,可以先按照片编辑器的方式尝试这个问题:六个滑块。

你编辑的版本原图曝光+0.0 EV对比度×1.00饱和度×1.00色温+0.00色调+0.00阴影+0.00每项调整取其范围的两端,其余按你的设置曝光更暗更亮对比度平淡强烈饱和度素淡鲜艳色温偏冷偏暖色调偏绿偏品红阴影更深提亮
你编辑的版本原图曝光 +0.0 EV对比度 ×1.00饱和度 ×1.00色温 +0.00色调 +0.00阴影 +0.00每项调整的两端曝光更暗更亮对比度平淡强烈饱和度素淡鲜艳色温偏冷偏暖色调偏绿偏品红阴影更深提亮
图 25.1 在一张真实照片上手动调节表 25.1 的六项调整(Zelenci,斯洛文尼亚,Aleš Krivec 摄,CC0 1.0,来自 Wikimedia Commons)。移动滑块编辑图片,原图始终显示在旁边。每对小图显示一项调整取其范围两端时的效果,其余五项保持你设定的值,因此小图会随编辑而变化。这里的一切都不是模拟或学习得到的。找出你最喜欢的版本,记下它的六个设置,稍后与比较会话的结果对照。

可以先用一分钟尝试。滑块移动起来很容易,结果却难以确定:改善水面可能使草地变差,增加曝光就需要减少阴影提亮,很快便难以判断最后一次改动是否有益。Koyama 与 Igarashi(2018)描述了同样的体验:滑块“以复杂的方式”影响图片,因此设计者只能反复试错,一边探索一边在头脑中建立设计空间的模型;随着参数增加,探索会变得“非常乏味”。本章其余部分就是把这一难题交给优化器。

其中三项调整是乘性的,其范围在对数尺度上对称:饱和度减半与加倍是同样大的改变。出于同样的原因,第 22.1.3 节中分类器的超参数也在对数尺度上搜索。这些调整之间还存在相互作用。曝光与阴影提亮都会使画面变亮,一项过多,可以减少另一项来抵消。饱和度与对比度都会增强视觉冲击,色温与色调都会改变白平衡。因此,一个设计的效用并非六个独立偏好之和;这也是在全部六项上联合建立高斯过程较为合理的原因之一。

图在浏览器中用 SVG 滤镜对图像施加这些调整:先用查找表实现色调曲线(曝光、阴影、对比度),再用颜色矩阵处理饱和度、色温和色调。在像素数组上做同样的计算只需十几行代码。

代码实现在图像数组上施加六项调整
import numpy as np

def enhance(img, u):
    """img: H x W x 3 sRGB values in [0, 1]; u: six numbers in [0, 1]."""
    ev, c, s, t, m, a = (np.asarray(u) - 0.5) * 2   # 每个都在 [-1, 1] 内
    k = 2.0 ** ev                                    # 以档为单位的曝光
    y = k * img / (1 + (k - 1) * img)                # 缩放暗部色调,保持 0 和 1 不变
    y = y + 0.14 * a * y * (1 - y) ** 2 / (4 / 27)   # 提亮或加深阴影
    y = np.clip(0.5 + 2.0 ** (0.6 * c) * (y - 0.5), 0, 1)   # 对比度
    luma = (y @ np.array([0.2126, 0.7152, 0.0722]))[..., None]
    y = np.clip(luma + 2.0 ** s * (y - luma), 0, None)      # 饱和度
    gain = np.array([1 + 0.11 * t + 0.03 * m,        # 色温:红色增加,蓝色减少
                     1 + 0.015 * t - 0.07 * m,       # 色调:绿色减少
                     1 - 0.13 * t + 0.03 * m])
    return np.clip(y * gain, 0, 1)

这一滤镜有意从简。完整的照片编辑器功能远不止于此,例如可以为阴影、中间调和高光分别设置色彩平衡;序列画廊的照片增强器有 12 个参数,其中就包括这种三路色彩平衡(Koyama 等,2020)。参数个数取六,与 2017 年的序列线搜索相同,后者的参数为亮度、对比度、饱和度,以及红、绿、蓝三色的色彩平衡(Koyama 与 Igarashi,2018)。

25.1.2 为什么眼睛是唯一的目标 #

工程师的第一反应是寻找公式。图像质量指标和自动增强都已存在,每个照片编辑器都有“自动”按钮。但自动增强体现的是别人的品味,是从别人的数据中学来的;而这里的问题是:眼前这位观看者想要什么。Koyama 与 Igarashi(2018)曾让众包工作者从一张照片的四个版本中选出看起来最好的一个,四个版本分别是原图、他们以众包驱动的优化结果,以及 Adobe Photoshop 和 Lightroom 的自动增强结果。三张照片的优化版本分别获得 32、26 和 29 票;原图获得 0、2 和 0 票,Photoshop 版本获得 0、2 和 1 票,Lightroom 版本获得 1、3 和 3 票。

目标还取决于用途,用途由指示语设定,而各项已发表研究的设定不尽相同。序列线搜索只要求众包工作者调节滑块,直到图像看起来最好(Koyama 等,2017)。在同一系列工作的一项成对比较任务中,工作者需选出“更适合用在杂志或产品广告中”的照片(Koyama 与 Igarashi,2018)。序列画廊的被试则设想把照片上传到自己的 Facebook 或 Instagram 账号,并使之吸引朋友(Koyama 等,2020)。这些指示语未必对应相同的最优点(推断)。下面的图只问你更喜欢哪个版本;请自行决定这张图片的用途,并始终保持不变。

让人给出数值,效果也不会好。在 1 至 10 的量表上打分,需要了解设计空间其余部分的样子,而新手对此并不了解;比较则“即使对非专家来说也很容易回答”(Koyama 与 Igarashi,2018)。相关证据见第 16.1.1 节。因此,测量手段是比较,仪器是人,而这台仪器的每一种性质(噪声、漂移、耐心)都会成为优化问题的性质。

25.1.3 一次判断的代价 #

一次判断的代价以秒计,而非以小时计。在已发表研究中最接近的类比里,11 位专业设计师比较横幅广告的颜色变体,每个任务 50 对,搜索空间分别有 12 个和 6 个参数;平均每次选择用时 4.2 秒,范围为 1.0 至 23.1 秒(Iwai 等,2025)。更丰富的查询用时更长:序列画廊的一个平面平均用时 14.8 秒(Koyama 等,2020)。单个滑块的用时,最接近的测量来自另一类任务:三名被试引导生成式图像模型接近参考图像,每人五张参考图像;一个滑块时每次迭代平均用时 17.2 秒,四个滑块时为 53.4 秒(Chong 等,2021)。4.2 秒与 17.2 秒都不是在照片增强任务上测得的。关于照片任务中滑块与配对的用时对比,我们只找到一项相对测量:在以参考图像为目标的众包色彩增强中,滑块任务的用时长于二选一任务,但不到其两倍;其中包括阅读指示语与反复回答质量控制问题的时间(Koyama 等,2017)。

真正起约束作用的是注意力。序列画廊研究中的被试平均在 5.36 次迭代后按下“满意”按钮(标准差 2.69)(Koyama 等,2020);在第 32.3 节所述为期三个月的现场部署中,多数评价序列根本没有进入优化器(Ou 等,2022)。序列线搜索的众包版本,耐心是花钱买来的:15 次迭代,每次七个滑块任务,每个任务支付 0.05 美元(第 20.2.3 节)。一次个人会话大约能投入十至三十个回答,与图 19.1 中的比较次数同一量级,但现在的问题是六维的。

另有两项代价从不出现在测试函数中。其一,每个回答都带有噪声:同一个人两次看到同一对,有时会给出不同的回答;第 16.3 节将此建模为每个选项感知效用上的噪声。其二,仪器还包括显示屏。序列画廊的研究固定了显示设备,即一台配鼠标的 13 英寸 MacBook Pro(Koyama 等,2020);而读者是在亮度和颜色都未知的屏幕上阅读本书,所处的光线环境也无从得知。白天在手机上看起来最好的版本,夜里在显示器上可能显得刺眼(推断)。

第 25.1 节引用的文献 7
  1. Ou 等人(2023)The Impact of Expertise in the Loop for Exploring Machine Rationality
  2. Koyama 与 Igarashi(2018)Computational Design with Crowds
  3. Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
  4. Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
  5. Iwai 等人(2025)Constrained Preferential Bayesian Optimization and Its Application in Banner Ad Design
  6. Chong 等人(2021)Interactive Optimization of Generative Image Modelling using Sequential Subspace Search and Content-based Guidance
  7. Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures

25.2 第一个问题之前 #

本节的每个选择都在任何数据到来之前做出,而每一个都会影响优化器能找到的结果。表 25.2 将三个已发表照片增强系统的选择与本章各图的选择并列。

表 25.2 第一个问题之前做出的选择:三个已发表的照片增强系统与本章各图。
序列线搜索(2017) 序列画廊(2020) Ou 等(2023) 本章
参数 6 个:亮度、对比度、饱和度,红、绿、蓝平衡 12 个:亮度、对比度、饱和度,阴影、中间调、高光的色彩平衡 5 个,在 [0,1][0, 1] 中:亮度、对比度、饱和度、色温、色调 6 个,在 [0,1][0, 1] 中:表 25.1
指示语 调节滑块,直到图像看起来最好 让照片对 Facebook 或 Instagram 上的朋友有吸引力 改善并增强照片的颜色 你更喜欢哪个版本?
由谁回答 众包工作者;每次迭代取至少 5 个滑块回答的中位数 一个人 一个人(每个任务 20 人) 你,或模拟品味
问题 从最佳设计到期望改进设计的滑块,从随机位置开始 平面上可缩放的 5 × 5 网格 对 4 个版本排序,设有“我不知道”区域 一对,或沿整条直线的滑块,从随机位置开始
回答记录为 所选点优于滑块两端(3 选项选择) 所选点优于平面的中心和 4 个顶点 4 个版本的排序 成对比较
模型 高斯过程;超参数取带对数正态先验的最大后验估计 ARD Matérn 5/2 核,对数正态先验,σ2=0.01\sigma^2 = 0.01 BoTorch,把 EUBO 扩展到排序;未说明核函数 Matérn 5/2,一个固定的长度尺度,EUBO 或期望改进
起点 两个随机设计之间的滑块 随机平面 4 轮拟随机(Sobol)设计 原图对随机编辑
停止 15 次迭代 15 次迭代;记录何时按下“满意”按钮 “我满意了”按钮,至多 20 次迭代 你停止时,至多 24 个回答

表中第一列出自 Koyama 等人(2017)与 Koyama 与 Igarashi(2018),第二列出自 Koyama 等人(2020),第三列出自 Ou 等人(2023)。本节其余部分解释最后一列的选择,并说明它们与已发表的选择有何不同、为何不同。

范围。表 25.1 中的范围决定了优化器能够到达的区域。范围太窄,会排除观看者想要的效果;范围太宽,大部分体积会被荒谬的图片占据,而在六维中,体积决定一切。在本章的范围内均匀抽取的设计几乎总比原图差:原图位于中心,而多数随机设置至少会把一项调整推向极端。后文的图 25.4 显示了其后果:经过二十对随机配对,模拟观看者得到的推荐并不比未经改动的照片更好。这里的范围是目测设定的,对这张照片而言,从“明显不足”延伸到“明显过度”。

核函数。效用模型采用第 18 章的高斯过程:Matérn 5/2 核,各方向长度尺度均为 0.4,先验方差为 1,概率单位噪声 σ=0.5\sigma = 0.5,用 Laplace 近似拟合(第 18.2 节)。这些值是固定的,不从回答中学习。仅凭二十个一比特的回答学习六个长度尺度(第 9.2 节)很不稳定;第 30.3.3 节指出,在这样的预算下这是否可行,尚无研究检验。Koyama 等人经由另一途径得到了同样的实际结论:他们在核超参数上使用 σ2=0.01\sigma^2 = 0.01 的对数正态先验,几乎没有给长度尺度留下变动的余地(Koyama 等,2020)。0.4 与 0.5 是通过运行模拟会话选定的;在真人参与之前,这是设定此类数值的诚实做法。

可见的差异。第 19.4 节的采集函数对人眼一无所知。不加限制时,EUBO 经常提出两个相近到人眼无法分辨的版本,这是第 19.6 节所述向当前最优点坍缩的一种表现。一项振动触觉偏好研究的作者在讨论局限时,针对触觉指出了同样的问题:非常相似的信号“可能在感知上无法区分”,邻近点之间的比较“被反应噪声主导”(Zhang 等,2026b)。因此,图中只考虑两个设置的欧氏距离不小于 0.2 的配对,以此粗略代替这一空间中的最小可觉差。允许回答“差不多”(第 20.4.1 节)是有原则的替代方案;这里的界面仍只保留两个按钮。

候选池。在一维中,图 19.1 为 36 种色相两两组成的每一对打分。六维中没有可供穷举的网格,因此每个问题之前,图会从范围中均匀抽取 160 个设置,对当前最佳猜测做 60 个小的随机扰动,再加上此前比较过的所有设置。这一候选池至多约有 250 个设置,图用闭式解式(19.3)为池中的每一对打分,每个问题约 30,000 对。局部扰动不可或缺:均匀抽取的点在每个坐标上都落在最佳猜测 0.1 以内的概率为 0.26≈6×10−50.2^6 \approx 6 \times 10^{-5};没有这些扰动,候选池几乎永远不会包含会话后期所需的小幅改进。

推荐。最佳猜测取已比较设置中后验均值最高者,这正是序列线搜索确定 x+\vx^+ 的规则(Koyama 与 Igarashi,2018)。将推荐限定在人实际看过的设置上,就保证了推荐的图片一定有人看过。

起点。第一个问题将原图与一个随机编辑并列比较。原图保留在数据中,此后的每个回答都通过比较图(第 18.5 节)与它相连;图中也始终在最佳猜测旁边显示原图。序列画廊研究中恰有一位被试提出了这一要求,希望“在增强过程中把原图放在旁边以便比较”;这位被试还发现某个任务的初始照片已令人满意,不确定是否该在一开始就按“满意”按钮(Koyama 等,2020)。无法推荐原图的系统会偏向改变(推断)。

第 25.2 节引用的文献 5
  1. Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
  2. Koyama 与 Igarashi(2018)Computational Design with Crowds
  3. Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
  4. Ou 等人(2023)The Impact of Expertise in the Loop for Exploring Machine Rationality
  5. Zhang 等人(2026b)Vibrotactile Preference Learning: Uncertainty-Aware Preference Learning for Personalized Vibration Feedback

25.3 比较版本 #

下面就是以你为预言机的循环。请选出你更喜欢的版本,重复十几次或更多。每次都如实选择,没有正确答案。

你更喜欢照片的哪个版本?AB最佳猜测:原图原图沿每项调整学到的效用,其余调整固定在最佳猜测曝光+0.0 EV更暗更亮AB对比度×1.00平淡强烈AB饱和度×1.00素淡鲜艳AB色温+0.00偏冷偏暖AB色调+0.00偏绿偏品红AB阴影+0.00更深提亮AB选中的版本,从早到晚还没有回答。第一个问题把原图与一个随机编辑放在一起比较。
你更喜欢哪个?AB最佳猜测:原图原图每项调整上学到的效用曝光+0.0 EV更暗更亮AB对比度×1.00平淡强烈AB饱和度×1.00素淡鲜艳AB色温+0.00偏冷偏暖AB色调+0.00偏绿偏品红AB阴影+0.00更深提亮AB选中的版本,从早到晚还没有回答。
图 25.2 通过比较增强一张真实照片。照片是真实的(Zelenci,斯洛文尼亚,Aleš Krivec 摄,CC0 1.0,来自 Wikimedia Commons),你的回答也是真实的;在“你”模式下,关于你品味的一切都不是模拟的。点击你更喜欢的版本。模型在表 25.1 的六项调整上,用概率单位似然与 Laplace 近似从你的回答中学习高斯过程效用;下一对是在约 250 个候选设置中、两者相距至少 0.2 的配对里 EUBO 最高的一对。这一对下方是:最佳猜测(黄色圆环),即已比较设置中后验均值最高者,与原图并排显示;以及其余五项固定于最佳猜测时,沿每项调整学到的效用(线:后验均值;色带:95% 可信区间;星形:最佳猜测;A 与 B:当前这一对)。“重问之前的一对”会把你先前的某一对左右调换后再问一次,事先不作说明,事后在历史记录中标出。在“模拟品味”模式下,改由隐藏的效用回答,带有模拟噪声 σ;模型自身的噪声固定不变,不随之调整。

两张大图就是当前的问题。其下方并排显示模型当前的最佳猜测与原图,读者随时可以检查这次会话是否胜过不做任何改动。六个小面板显示模型学到的内容:每个面板是后验效用(第 18 章)沿一项调整的切片,其余五项固定在最佳猜测处。有峰的曲线表示“这项调整对你很重要,你喜欢它取这里的值”,色带很宽的平坦曲线则表示“尚无信息”。字母 A 与 B 标出当前问题中两个版本在各项调整上的位置,由此可以看出这个问题在探查什么。

可以尝试以下几点。回答十至十五对,观察哪些面板最先变尖:最先变尖的面板,对应你的回答最为明确的调整。留意面板中的字母 A 与 B。第一个问题同时改变所有调整;后续问题往往使多数调整几乎相等,只改变少数几项,因此每个回答探查的空间范围越来越小(在模拟会话中,第一个问题的两个版本在全部六项调整上的差异都超过 0.1,到第十个问题时只有两三项如此)。回答十几次之后,比较最佳猜测与原图,如实判断自己更喜欢哪一个。然后按几次“重问之前的一对”,照常回答;它测量的是什么,留待第 25.5.1 节讨论。

阅读面板时需注意两点。其一,切片并非全貌:它显示的是在最佳猜测处,效用沿一项调整如何变化;调整之间存在相互作用时,阴影设置不同,最佳曝光也可能不同。其二,纵轴没有单位。比较只能在相差平移与缩放的意义下确定效用差异(第 18.4 节),因此能读出的是每条曲线的形状和六条曲线的相对高低,而不是具体数值。

切换到“模拟品味”,可以观察同一循环改由隐藏效用作答的情形。模拟品味有一个最爱的设置,效用从该处按二次函数下降,各项调整的权重不同(曝光与色温最重要,色调最不重要),并包含上文所述曝光与阴影的相互作用。按几次“模拟五次”,再显示最爱:最佳猜测旁的原图会换成最爱的图片,面板中的虚线标出最爱的设置,状态行报告最佳猜测的效用差距(utility gap),即模拟效用在最爱处的值减去在最佳猜测处的值,并列出原图的差距作为对照。差距为零即为完美。

25.4 沿直线搜索 #

一对比较为模型提供一比特信息;一个滑块则提供一次完整的一维搜索,由人来完成:人沿设计空间中的一条直线移动,观察图片的变化,停在看起来最好的位置。这就是第 20.2 节介绍过的序列线搜索(Koyama 等,2017),现在用于真实照片。

拖动滑块,直到照片看起来最好,然后选定它。原图随机编辑最佳猜测:原图原图沿每项调整学到的效用,其余调整固定在最佳猜测曝光+0.0 EV更暗更亮对比度×1.00平淡强烈饱和度×1.00素淡鲜艳色温+0.00偏冷偏暖色调+0.00偏绿偏品红阴影+0.00更深提亮选中的版本,从早到晚还没有回答。第一个问题把原图与一个随机编辑放在一起比较。
滑到最好处,然后选定。原图随机编辑最佳猜测:原图原图每项调整上学到的效用曝光+0.0 EV更暗更亮对比度×1.00平淡强烈饱和度×1.00素淡鲜艳色温+0.00偏冷偏暖色调+0.00偏绿偏品红阴影+0.00更深提亮选中的版本,从早到晚还没有回答。
图 25.3 同一张照片、同一个模型,改用滑块。照片和你的回答都是真实的。滑块沿一条直线运行,该直线经过目前最好的版本(轨道上的星形)和相对它期望改进最高的版本(菱形),并向两端延伸到调整范围的边界;第一个回答之前,直线经过原图和一个随机编辑。沿缩略图条拖动或使用按钮,然后按“就选这个”。每次选择记录为至多四个成对比较:所选版本优于滑块两端,以及滑块上三分之一和三分之二处的点,与所选点相距 0.15 以内的点除外。面板中的橙色条表示滑块在各项调整上的跨度,圆点表示其当前位置。“模拟品味”模式是模拟的,与图 25.2 相同;模拟的人在滑块上 41 个带噪声的位置中挑选最好的一个。

此图在两个方面偏离了已发表的方法,两者都是实践者需要面对的选择。

哪条直线。Koyama 等人(2017)让滑块从目前最好的设计 x+\vx^+ 延伸到相对它期望改进最高的设计 xEI⁡\vx^{\EI}(第 20.2.1 节),并提到可以选择将线段按固定因子(如 1.25)放大。本章使用同样的两个点,但把线段向两端一直延伸到范围边界。这样,人既可以要求比所提议的改变更多,也可以要求更少;滑块覆盖的范围也足够大,差异清晰可见。在任何回答之前,直线经过原图,以及配对图开头所用的同一个随机编辑。这种延伸是否有益取决于噪声,下文的比较将说明这一点。已发表方法中有一个细节得到保留:每个问题中滑块都从随机位置开始。Koyama 等人(2017)这样做是“为了减少认知偏差”,即旋钮恰好停留的位置对人的牵引(一种锚定效应,第 37.2.3 节)。

一次选择如何记录。Koyama 等人把一次滑块回答记录为三选一,即所选设计对两个端点,采用式(20.1)的选择似然(Koyama 等,2017;Koyama 等,2020)。本章模型只有第 18 章的成对概率单位似然,因此图把这次选择记录为至多四个独立的比较:所选点优于两个端点,以及滑块上三分之一和三分之二处的点。这夸大了证据。四个比较出自同一次判断,误差并不独立,模型却把它们当作四个独立的回答,因而变得过于自信(习题 25.2)。Mikkola 等人(2020)持相反的观点,认为一次滑块回答相当于不可数无穷多个比较,并用有限样本近似由此得到的似然;两种记录方式都丢弃了一个事实:人一次看到的是整个连续区间。

可以尝试以下几点。沿缩略图条慢慢拖动,留意直线上有多大一部分明显不对;回答中的大部分信息,在于你避开了哪些区域。几个回答之后,直线在面板中变短,因为期望改进点向最佳猜测靠拢。若把旋钮移到星形处并选定,这个回答就表示目前最好的设计优于直线上的所有点,这是一个很强的陈述。

25.4.1 配对还是滑块?#

两种形式的取舍在于每个回答的信息量与用时。已发表的比较来自众包。Koyama 等人(2017)在以参考图像为目标的众包照片色彩增强中,将他们的滑块与二选一、四选一两种形式相比较,每个条件运行三次。工作者的任务是匹配目标图片,而非表达偏好。滑块的误差随迭代下降得更快;滑块任务的用时长于比较任务,但不到其两倍。截至 2026 年 9 月,我们没有找到这样的研究:在照片任务上,针对个人自己的偏好,以相同的模型和预算比较这两种形式。下面预先计算的模拟以图 25.2 的模拟品味为对象,运行四种提问策略(EUBO 配对、随机配对、已发表的滑块线段、整条直线的滑块),每种十六次。

推荐结果的效用差距(越低越好)0.00.20.40.60.81.01.21.402468101214161820回答数原图配对,EUBO配对,随机滑块,已发表的线段滑块,整条直线16 次会话的终点(20 个回答之后)曝光对比度饱和度色温色调阴影00.5(原图)1配对,EUBO滑块,整条直线隐藏的最爱
效用差距0.00.20.40.60.81.01.21.405101520回答数原图配对,EUBO配对,随机滑块,已发表的线段滑块,整条直线各次会话的终点曝光对比度饱和度色温色调阴影00.5(原图)1配对,EUBO滑块,整条直线隐藏的最爱
图 25.4 四种提问方式的模拟回放。此图中的一切都是模拟的:品味(与图 25.2 相同的隐藏最爱)、其噪声 σ,以及(通过开关控制的)漂移;只有模型与提问规则与交互图相同。上:每个回答之后推荐结果的效用差距(0 为隐藏的最爱;点线为未经改动的照片),取 16 次会话的中位数(线)与四分位距(色带),各次会话仅在候选池、第一个编辑与回答噪声上不同。横轴为“秒数”时,每对计 4.2 秒,每次滑块回答计 17.2 秒;这两个时间取自任务不同的两项研究,一项是专业设计师在横幅广告的两个颜色变体之间选择(Iwai 等,2025),另一项是三名被试移动生成式图像模型的一个滑块以接近参考图像(Chong 等,2021);它们在此只是假设,而非对本任务的测量。下:每项调整上的 16 个最终推荐(20 个回答之后),上排圆点为 EUBO 配对,下排圆点为整条直线的滑块,并标出隐藏的最爱;开启漂移时,标出最爱的起点(实线)与终点(虚线)。各次会话由 tools/figure-data/cs-photo-race.ts 预先计算。

按回答数计,滑块在早期领先,后来两种形式趋于一致。在默认噪声(σ=0.1\sigma = 0.1)下,五个回答之后,EUBO 配对的效用差距中位数为 0.37,已发表的滑块和整条直线的滑块分别为 0.34 和 0.30;二十个回答之后,EUBO 配对为 0.14,已发表的滑块为 0.08,整条直线为 0.14,而未经改动的照片为 0.49。在低噪声(σ=0.05\sigma = 0.05)下,三者的终值彼此相差在 0.02 以内。在高噪声(σ=0.25\sigma = 0.25)下,整条直线的滑块最为稳健,二十个回答后效用差距中位数为 0.16,而 EUBO 配对为 0.31,已发表的线段为 0.34。随机配对的结果值得警惕:默认噪声下,二十个回答之后,16 次会话中只有 7 次的推荐优于未经改动的照片;可见在此设置下,EUBO 配对远远领先于随机配对。第 19.5.1 节记录的运行给出了相反的排序:约二十个回答之后,EUBO 并不优于随机配对。但那里的设置不同:设计是生成的,模拟品味不同,一对中的两个选项之间没有最小距离,最佳猜测取自整个候选池而非已比较的设置。这些差异中究竟是哪一项造成了逆转,我们尚未分辨(推断)。

按秒计,情形则相反,前提是借自第 25.1.3 节的计时适用于本任务。将横轴切换到“秒数”,即每对计 4.2 秒、每次滑块回答计 17.2 秒:在二十对所需的 84 秒内,滑块会话只能完成约五个回答,效用差距中位数仍约为 0.3,而配对已降至 0.14。而且模拟本身对滑块有所偏袒:模拟的人以独立噪声评估 41 个位置并保留最好的一个,如此细致的搜索,真人在 17 秒内未必能完成。这一逆转还依赖于两种用时之比约为四的假设。若滑块回答的用时是配对的两倍(即 Koyama 等人(2017)对众包任务报告的上限),滑块会话在这 84 秒内可给出十个回答,效用差距中位数达到 0.17 至 0.18,接近配对的 0.14(推断)。因此,模拟并不能给出定论;它指出的是,得出定论需要哪些数字:每个回答的用时,以及滑块回答相对于成对回答的噪声,二者都须在同一批人、同一任务上测量(推断)。GimmBO 是 2026 年在同一任务上比较不同界面的一项研究:12 名被试通过合并图像模型适配器来匹配目标图像,由贝叶斯优化驱动的排序界面,比手动调节的一组滑块达到了更高的目标相似度和成功率,每步交互用时为 50.5 秒对 34.7 秒(Liu 等,2026b)。第 32.4 节将这项研究与其他形式比较一并报告。

第 25.4 节引用的文献 6
  1. Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
  2. Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
  3. Mikkola 等人(2020)Projective Preferential Bayesian Optimization
  4. Iwai 等人(2025)Constrained Preferential Bayesian Optimization and Its Application in Banner Ad Design
  5. Chong 等人(2021)Interactive Optimization of Generative Image Modelling using Sequential Subspace Search and Content-based Guidance
  6. Liu 等人(2026b)GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization

25.5 一次会话揭示了什么 #

以自己为对象运行一次会话,就会看到测试函数所掩盖的三件事:人对同一问题并不总是给出相同的回答;品味可能在回答过程中移动;结果取决于碰巧被问到了哪些问题。每一项在已发表的研究中都有对应,但研究所能提供的信息都不如人们期望的多。

25.5.1 一致性 #

“重问之前的一对”会把会话早期的一对左右调换后再次展示,历史记录随后将这次回答标为“相同”或“反转”。在第 16.3 节的模型下,反转的概率形式很简单。设此人以概率 p=Φ(Δ/(2 σ))p = \Phi\big(\Delta / (\sqrt{2}\,\sigma)\big) 偏好 A 胜过 B,其中 Δ\Delta 为效用差,σ\sigma 为每个选项上的噪声,则两次独立回答一致的概率为

a=p2+(1−p)2=12+12(2p−1)2.a = p^2 + (1 - p)^2 = \tfrac12 + \tfrac12 (2p - 1)^2 .
(25.1)

一致率永远不低于一半;只有差异远大于噪声的配对,一致率才会达到一;对于此人觉得几乎相等的配对,它接近于掷硬币。取 p=0.8p = 0.8,即相当明确的偏好,两次回答一致的概率也只有 68%。因此,回答反转本身并不说明粗心。若在模型认为明确的配对上反转比例很高,才说明模型的噪声尺度对此人而言过小,后验过于自信(习题 25.1)。

式(25.1)假设第二次回答独立于第一次,而记忆可能从两个方向破坏这一假设:人可能直接重复记得的回答,回想的努力本身也可能增加噪声。在重复美感评分的实验中,只评价单个刺激时,回忆记忆贡献了测得方差的一半;刺激集合含九个或更多刺激时,它只使方差增加约 10%(Pombo 等,2023)。因此,图会调换左右,从不提示重复,并且只重复至少两个回答之前的配对;严谨的研究应把重复的间隔拉得更大。

在会话中重复配对成本很低,但截至 2026 年 9 月,我们没有找到任何基于偏好的设计优化研究这样做,即在会话后期重新询问早期的比较,以检验一致性或漂移(第 32.3 节)。最接近的证据是间接的。17 名视力正常的被试为模拟的视网膜植入视觉做个性化设置时,他们的选择只有约 50% 与模拟智能体的预测一致(Schoinas 等,2025);可见模拟的人可能难以替代真人。在 Ou 等人(2023)的照片任务中,照片编辑经验较多的被试表达无差异(把版本放在同一评分区域)的频率显著高于新手(p=0.015p = 0.015):有经验的眼睛判定的平局更多,而非更少。

25.5.2 漂移 #

品味可能在一次会话中移动:适应了鲜艳的版本后,原图开始显得沉闷;注意到起初并非标准的东西,例如水的颜色;或者出于疲劳。Koyama 等人(2020)假设用户的感知函数“不随时间变化”,然而他们的六名被试中有一人报告,自己选择设计时“依据的是我一开始并没有的标准”。本章的模型没有时间概念,它把第一分钟与第十分钟给出的回答,当作同一效用的两次带噪声读数。

在图 25.4 中打开“品味在会话中漂移”。此时模拟的最爱会在二十个回答期间稳步移动,朝更高的饱和度、更暖的色温、更低的对比度方向,总共移动约 0.3。效用差距曲线变得平缓,因为目标在移动;下方面板显示各次会话的终点相对于最爱起点和终点的位置。在两个较低的噪声水平下,终点落在两者之间:投影到漂移方向上,最终推荐平均位于从起始最爱到最终最爱路程的 13% 至 56% 处,具体取决于提问策略。在最高噪声下,EUBO 会话完全没有朝新的最爱移动。假设效用固定的模型会对整个会话取平均,因此推荐的是此人平均而言喜欢的设置,而非其当下喜欢的设置(推断,依据这些模拟)。补救办法有随时间变化的效用,或对旧回答施加遗忘因子,见第 46.5 节的讨论;这些办法都未在照片任务中检验过。

图中的漂移是为说明而人为设定的。在二十次比较的会话中,观看者偏好的饱和度移动得有多快,甚至是否移动,目前都不清楚。能够回答这一问题的实验,即在会话末尾以随机化的提问顺序重新询问早期配对,正是第 47.4 节所描述的实验。

25.5.3 顺序 #

即使品味固定,碰巧被问到哪些问题也会改变会话的终点。图 25.4 的下方面板显示了相同模拟品味、相同噪声下十六次会话的最终推荐;这些会话仅在随机候选池、第一个随机编辑和各回答的噪声上不同。在默认噪声下,按表 25.1 的单位尺度,最终设置在每项调整上的标准差为 0.05 至 0.12;曝光上的 0.07 约合 0.14 EV。离散程度在曝光上最小,而曝光正是模拟品味最看重的调整;在色调上则属于最大之列,而色调是它最不看重的调整。这说明后验在按预期工作:效用平坦之处,回答无法确定设置,而设错的代价也小。

关于顺序的已发表证据来自众包。Koyama 等人(2017)在同一张照片上从不同的随机起始条件出发,将序列线搜索重复三次,并测量三次运行之间的差异随迭代的变化,差异分别以参数设置之间的距离和每像素平均感知色差衡量:差异在前四五次迭代中迅速缩小,三次运行趋于相似的增强效果。作者认为这支持了他们的假设,即众包人群共享同一个优度函数;他们也补充说,若有些人偏好一种风格、另一些人偏好另一种,这一假设可能不成立。不过,每次迭代的回答是至少五名工作者滑块位置的中位数,这一做法平均掉了单个人的大部分噪声。据我们所知,单个人的结果在多大程度上依赖其提问顺序,尚未在照片增强会话中测量过。判断研究提供了预期这种效应存在的理由。以艺术照片和人脸为刺激时,中性图片出现在较受偏好的图片之后,比出现在较不受偏好的图片之后更受偏好;控制反应偏差后,类似的趋势依然存在(Chang 等,2017)。七项美感评分实验表明,只要刺激多样、来自不同的物体类别,序列依赖就不影响评分的方差(Pombo 等,2023)。同一张照片的不同版本恰恰与多样相反,因此这一令人宽慰的结论不能推广到本任务(推断);这些序列效应的综述见第 37.3.2 节。

25.5.4 停止,以及这是谁的结果 #

会话在人停下时结束,而已发表的数字表明,这一时刻来得相当早。序列画廊的被试平均在 5.36 个平面后就满意了(Koyama 等,2020)。Ou 等人(2023)的设置是:五项取值于 [0,1][0, 1] 的照片调整,优化器接手之前先有四轮拟随机版本,至多 20 次迭代。照片编辑经验较多的被试运行的迭代次数显著多于新手(p=0.008p = 0.008);作者将研究结论概括为:新手更容易满意、更早结束,专家则探索得更远,报告的满意度也更低。满意不等于收敛:人的“够好了”与模型趋于平坦的后验是两种不同的停止信号,原因见第 46.6 节。

一次会话引出的另一个问题是:这是谁的结果?在众包版本中,结果属于一个群体:作者指出,“当众包是唯一的数据来源时”,单个用户的偏好“不会反映在计算中”,而不同背景的人群可能有明显不同的偏好(Koyama 与 Igarashi,2018)。在本章的图中,结果属于一个人:在一块屏幕上、在某一天得出,连同随之而来的噪声与漂移。第 32.5 节介绍了一系列工作,它们借助其他用户的会话,为新用户的会话提供更好的起始先验。

要点案例为算法增添了什么

第 19 章的算法原封不动地在六维的真实照片上运行。案例增添的是算法之外的一切:边界明显过度但不至荒谬的范围与单位、通过模拟选定的固定核设置、两个版本之间的最小可见差异、始终可见的原图、用于测量人的噪声的几对重复配对,以及每个回答用时的记录。这些都不会出现在测试函数中,而每一项都会改变答案。

第 25.5 节引用的文献 7
  1. Pombo 等人(2023)The intrinsic variance of beauty judgment
  2. Schoinas 等人(2025)Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants
  3. Ou 等人(2023)The Impact of Expertise in the Loop for Exploring Machine Rationality
  4. Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
  5. Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
  6. Chang 等人(2017)Sequential effects in preference decision: Prior preference assimilates current preference
  7. Koyama 与 Igarashi(2018)Computational Design with Crowds

25.6 习题 #

习题 25.1

设某次会话重复了五个早先的配对,其中三个得到相同的回答,并假定这五对难度相同。利用式(25.1),3/53/5 的一致率意味着 pp 取何值?效用差与噪声之比 Δ/σ\Delta / \sigma 是多少?若模型对这些配对预测的是 p=0.95p = 0.95,可以得出什么结论?

解答

由 a=12+12(2p−1)2a = \tfrac12 + \tfrac12(2p - 1)^2 与 a=0.6a = 0.6 得 (2p−1)2=0.2(2p - 1)^2 = 0.2,故 2p−1=0.4472p - 1 = 0.447,p≈0.72p \approx 0.72。于是 Δ/(2σ)=Φ−1(0.72)≈0.59\Delta / (\sqrt{2}\sigma) = \Phi^{-1}(0.72) \approx 0.59,Δ/σ≈0.84\Delta / \sigma \approx 0.84:对此人而言,这些配对的差异小于一个噪声标准差。预测 p=0.95p = 0.95 的模型期望的一致率为 0.952+0.052=0.9050.95^2 + 0.05^2 = 0.905;在这一预测下,5 次中有 3 次一致不太可能出现(一致率为 0.905 时,5 次中至多 3 次一致的概率约为 0.07),因此模型的噪声尺度很可能过小,后验过于自信。不过,五次重复为数很少,aa 的估计的标准误约为 0.2。

习题 25.2

滑块图把一次选择记录为至多四个成对比较。假设四个落败者的效用相同,从而四个似然项相同,乘积为 Φ(z)4\Phi(z)^4,其中 z=(gc−gℓ)/(2σ)z = (g_c - g_\ell)/(\sqrt{2}\sigma)。它与单次比较的似然相比如何?与四次独立比较相比又如何?试提出一种简单的修正。

解答

Φ(z)4\Phi(z)^4 恰好是四次独立回答都偏向所选点时的似然,因此后验的自信程度,就如同此人被问了四个独立的问题且每次都与自己一致,而实际上只做了一次判断。一种修正是对来自滑块的似然项做回火:把 kk 个项中的每一项都取 1/k1/k 次幂;落败者相似时,这样可以恢复一个回答应有的权重。另一种是对来自滑块的比较使用更大的噪声尺度。第三种是采用式(20.1)的选择似然,每个滑块回答只贡献一项,这正是 Koyama 等人的做法。

习题 25.3

假设曝光范围为 ±3\pm 3 EV 而非 ±1\pm 1 EV,其他一切不变,包括单位尺度上 0.4 的长度尺度。此时 0.4 的长度尺度相当于多少档?随机设计和候选池会受到什么影响?

解答

单位区间现在跨越 6 EV 而非 2 EV,0.4 的长度尺度因而对应 2.4 EV 而非 0.8 EV:模型假设效用以档计的变化慢了三倍,会把观看者能察觉的差异平滑掉。曝光范围的大部分现在暗得或亮得荒谬,随机设计更可能很差,候选池中均匀抽取的部分也大多浪费在无人会选的设置上。修正办法是缩窄范围、只为曝光使用更短的长度尺度(每个输入一个长度尺度,第 9.2 节),或两者兼用。

习题 25.4

候选池包含 160 个均匀设置、60 个对最佳猜测的扰动,以及已比较过的设置。池中有 250 个设置时,EUBO 要为多少对打分?图为什么不直接使用 220 个均匀设置?计算一个均匀设置在全部六个坐标上都落在某个给定设置 0.1 以内的概率,并与一维中的相应概率比较。

解答

共 250⋅249/2=31,125250 \cdot 249 / 2 = 31{,}125 对。在一维中,均匀点落在给定点(远离边界)0.1 以内的概率为 0.2;在六维中为 0.26=6.4×10−50.2^6 = 6.4 \times 10^{-5},因此 220 个均匀设置中含有一个如此接近最佳猜测的设置的概率约为 1.4%1.4\%。会话后期有用的问题是对最佳猜测的小幅改进,而只有局部扰动能提供这样的候选。同样的观察也促成了高维贝叶斯优化中的信赖域(第 14.6 节):维度较多时,好的候选必须在最佳点附近寻找,因为均匀样本几乎从不落在那里。

延伸阅读 #

  • Koyama 等人(2017)提出了序列线搜索,并将其应用于六参数的照片色彩增强,由众包作答。
  • Koyama 与 Igarashi(2018)是一部专著中关于众包计算设计的一章,介绍了众包流程、与 Photoshop 和 Lightroom 的投票对比,以及从不同起始条件出发的三次运行。
  • Koyama 等人(2020)用平面上的可缩放网格(序列画廊)取代了滑块,并报告了一项 12 参数照片增强的小型用户研究,其中引用了被试的原话。
  • Ou 等人(2023)在三个任务中比较新手与专家,其中之一是照片色彩增强,使用基于 EUBO 的优化器和排序界面。
  • Iwai 等人(2025)与专业设计师合作,在横幅广告的颜色变体上运行成对偏好优化,每个任务 50 次比较,点击率约束由机器处理。
  • Mikkola 等人(2020)把类似滑块的回答视为无穷多个比较,并推导了相应的似然。

参考文献

  1. Chang, S., Kim, C.-Y., and Cho, Y. S. (2017). Sequential effects in preference decision: Prior preference assimilates current preference. PLOS ONE. 引用于 §25.5
  2. Chong, T. L. H., Shen, I.-C., Sato, I., and Igarashi, T. (2021). Interactive Optimization of Generative Image Modelling using Sequential Subspace Search and Content-based Guidance. Computer Graphics Forum. doi:10.1111/cgf.14188. 引用于 §25.1 §25.4
  3. Iwai, K., Kumagae, Y., Koyama, Y., Hamasaki, M., and Goto, M. (2025). Constrained Preferential Bayesian Optimization and Its Application in Banner Ad Design. Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence. 引用于 §25.1 §25.4
  4. Koyama, Y., and Igarashi, T. (2018). Computational Design with Crowds. Computational Interaction. 引用于 §25.1 §25.2 §25.5
  5. Koyama, Y., Sato, I., Sakamoto, D., and Igarashi, T. (2017). Sequential line search for efficient visual design optimization by crowds. ACM Transactions on Graphics. 引用于 §25.1 §25.2 §25.4 §25.5
  6. Koyama, Y., Sato, I., and Goto, M. (2020). Sequential Gallery for Interactive Visual Design Optimization. ACM Transactions on Graphics 39(4) (SIGGRAPH 2020). 引用于 §25.1 §25.2 §25.4 §25.5
  7. Liu, C., Ling, S., and Jacobson, A. (2026b). GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization. ACM Transactions on Graphics. doi:10.1145/3811293. 引用于 §25.4
  8. Mikkola, P., Todorović, M., Järvi, J., Rinke, P., and Kaski, S. (2020). Projective Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §25.4
  9. Ou, C., Buschek, D., Mayer, S., and Butz, A. (2022). The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures. Mensch und Computer 2022. 引用于 §25.1
  10. Ou, C., Mayer, S., and Butz, A. (2023). The Impact of Expertise in the Loop for Exploring Machine Rationality. IUI 2023. 引用于 §25.1 §25.2 §25.5
  11. Pombo, M., Brielmann, A. A., and Pelli, D. G. (2023). The intrinsic variance of beauty judgment. Attention, Perception, & Psychophysics. 引用于 §25.5
  12. Schoinas, E., Rastogi, A., Carter, A., Granley, J., and Beyeler, M. (2025). Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants. 2025 47th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC). doi:10.1109/embc58623.2025.11253762. 引用于 §25.5
  13. Zhang, R., Zhu, X., Pourebadi Khotbehsara, M., Dao, W., Bıyık, E., and Culbertson, H. (2026b). Vibrotactile Preference Learning: Uncertainty-Aware Preference Learning for Personalized Vibration Feedback. UMAP 2026 (per Semantic Scholar). 引用于 §25.2