通过比较增强照片
偏好各章讲解方法时,所用的设计都小到可以一览无余:第 19 章中色轮上的一个色相,第 20.2 节中只有两个旋钮的平面海报地形。真实的设计任务并非如此。一张照片有十几项相互影响的调整,无人能写出为其打分的函数;能衡量一个版本好看与否的唯一仪器是人,而人会疲倦,会改变主意,在不同屏幕上看到的画面也各不相同。
本章的问题是真实的,因为读者本人就是问题的一部分。图中展示一张真实的照片,读者通过比较不同版本来增强它:或从两个版本中选出较好的一个,或沿调整空间中的一条直线滑动。这正是 Koyama 等人(2017)与 Koyama 等人(2020)为照片色彩增强研究过的两种查询形式。算法就是第 18 章与第 19 章中构建的算法,未作任何改动,只是参数从一两个变成了六个。本章先描述问题及一次判断的代价,然后讨论提出第一个问题之前必须做出的决定,接着介绍照片上的两种查询形式,最后考察一次会话能揭示参与者的哪些情况,并与已发表研究的发现相对照。
引言引用的文献 2
- Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
- Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
25.1 问题 #
25.1.1 一张照片和六项调整 #
这张照片由 Aleš Krivec 于 2014 年 10 月 19 日在斯洛文尼亚的 Zelenci 自然保护区拍摄,并依 CC0 1.0 置于公有领域(Wikimedia Commons 上的“Zelenci 2014 (2).jpg”,最初发布于 Unsplash)。选用这张照片,是因为下面提供的每一项调整都会影响它的观感。画面中有明亮的天空和受光的山壁,调整过度就会过曝;有幽暗的森林,细节隐没在阴影中;有金色的草地,会随白平衡变成橙色或橄榄色;还有绿松石色的水面,偏暖的设置会使其黯淡。多数改变在改善一个区域的同时会损害另一个区域,因此不存在所有观看者都公认最好的设置。
设计(design)指六项调整的一组设定,每项是一个数 , 对应未经改动的照片。表 25.1 列出各项调整的作用及其范围。将每项调整映射到单位区间是通常的约定,Ou 等人(2023)研究中的照片增强器也是如此;这样,同一个核长度尺度在各个方向上的含义大致相同。
| 调整 | 作用 | 时 | 时 |
|---|---|---|---|
| 曝光 | 提亮或压暗;暗部色调按 缩放,白色保持不变 | EV | EV |
| 对比度 | 以中灰为中心拉伸或压平色调 | ||
| 饱和度 | 使每种颜色远离或靠近其对应的灰色 | ||
| 色温 | 此消彼长地调整红与蓝 | 偏冷 | 偏暖 |
| 色调 | 此消彼长地调整绿与品红 | 偏绿 | 偏品红 |
| 阴影 | 提亮或加深较暗的三分之一色调 | 更深 | 提亮 |
在进行任何优化之前,可以先按照片编辑器的方式尝试这个问题:六个滑块。
可以先用一分钟尝试。滑块移动起来很容易,结果却难以确定:改善水面可能使草地变差,增加曝光就需要减少阴影提亮,很快便难以判断最后一次改动是否有益。Koyama 与 Igarashi(2018)描述了同样的体验:滑块“以复杂的方式”影响图片,因此设计者只能反复试错,一边探索一边在头脑中建立设计空间的模型;随着参数增加,探索会变得“非常乏味”。本章其余部分就是把这一难题交给优化器。
其中三项调整是乘性的,其范围在对数尺度上对称:饱和度减半与加倍是同样大的改变。出于同样的原因,第 22.1.3 节中分类器的超参数也在对数尺度上搜索。这些调整之间还存在相互作用。曝光与阴影提亮都会使画面变亮,一项过多,可以减少另一项来抵消。饱和度与对比度都会增强视觉冲击,色温与色调都会改变白平衡。因此,一个设计的效用并非六个独立偏好之和;这也是在全部六项上联合建立高斯过程较为合理的原因之一。
图在浏览器中用 SVG 滤镜对图像施加这些调整:先用查找表实现色调曲线(曝光、阴影、对比度),再用颜色矩阵处理饱和度、色温和色调。在像素数组上做同样的计算只需十几行代码。
import numpy as np
def enhance(img, u):
"""img: H x W x 3 sRGB values in [0, 1]; u: six numbers in [0, 1]."""
ev, c, s, t, m, a = (np.asarray(u) - 0.5) * 2 # 每个都在 [-1, 1] 内
k = 2.0 ** ev # 以档为单位的曝光
y = k * img / (1 + (k - 1) * img) # 缩放暗部色调,保持 0 和 1 不变
y = y + 0.14 * a * y * (1 - y) ** 2 / (4 / 27) # 提亮或加深阴影
y = np.clip(0.5 + 2.0 ** (0.6 * c) * (y - 0.5), 0, 1) # 对比度
luma = (y @ np.array([0.2126, 0.7152, 0.0722]))[..., None]
y = np.clip(luma + 2.0 ** s * (y - luma), 0, None) # 饱和度
gain = np.array([1 + 0.11 * t + 0.03 * m, # 色温:红色增加,蓝色减少
1 + 0.015 * t - 0.07 * m, # 色调:绿色减少
1 - 0.13 * t + 0.03 * m])
return np.clip(y * gain, 0, 1)
这一滤镜有意从简。完整的照片编辑器功能远不止于此,例如可以为阴影、中间调和高光分别设置色彩平衡;序列画廊的照片增强器有 12 个参数,其中就包括这种三路色彩平衡(Koyama 等,2020)。参数个数取六,与 2017 年的序列线搜索相同,后者的参数为亮度、对比度、饱和度,以及红、绿、蓝三色的色彩平衡(Koyama 与 Igarashi,2018)。
25.1.2 为什么眼睛是唯一的目标 #
工程师的第一反应是寻找公式。图像质量指标和自动增强都已存在,每个照片编辑器都有“自动”按钮。但自动增强体现的是别人的品味,是从别人的数据中学来的;而这里的问题是:眼前这位观看者想要什么。Koyama 与 Igarashi(2018)曾让众包工作者从一张照片的四个版本中选出看起来最好的一个,四个版本分别是原图、他们以众包驱动的优化结果,以及 Adobe Photoshop 和 Lightroom 的自动增强结果。三张照片的优化版本分别获得 32、26 和 29 票;原图获得 0、2 和 0 票,Photoshop 版本获得 0、2 和 1 票,Lightroom 版本获得 1、3 和 3 票。
目标还取决于用途,用途由指示语设定,而各项已发表研究的设定不尽相同。序列线搜索只要求众包工作者调节滑块,直到图像看起来最好(Koyama 等,2017)。在同一系列工作的一项成对比较任务中,工作者需选出“更适合用在杂志或产品广告中”的照片(Koyama 与 Igarashi,2018)。序列画廊的被试则设想把照片上传到自己的 Facebook 或 Instagram 账号,并使之吸引朋友(Koyama 等,2020)。这些指示语未必对应相同的最优点(推断)。下面的图只问你更喜欢哪个版本;请自行决定这张图片的用途,并始终保持不变。
让人给出数值,效果也不会好。在 1 至 10 的量表上打分,需要了解设计空间其余部分的样子,而新手对此并不了解;比较则“即使对非专家来说也很容易回答”(Koyama 与 Igarashi,2018)。相关证据见第 16.1.1 节。因此,测量手段是比较,仪器是人,而这台仪器的每一种性质(噪声、漂移、耐心)都会成为优化问题的性质。
25.1.3 一次判断的代价 #
一次判断的代价以秒计,而非以小时计。在已发表研究中最接近的类比里,11 位专业设计师比较横幅广告的颜色变体,每个任务 50 对,搜索空间分别有 12 个和 6 个参数;平均每次选择用时 4.2 秒,范围为 1.0 至 23.1 秒(Iwai 等,2025)。更丰富的查询用时更长:序列画廊的一个平面平均用时 14.8 秒(Koyama 等,2020)。单个滑块的用时,最接近的测量来自另一类任务:三名被试引导生成式图像模型接近参考图像,每人五张参考图像;一个滑块时每次迭代平均用时 17.2 秒,四个滑块时为 53.4 秒(Chong 等,2021)。4.2 秒与 17.2 秒都不是在照片增强任务上测得的。关于照片任务中滑块与配对的用时对比,我们只找到一项相对测量:在以参考图像为目标的众包色彩增强中,滑块任务的用时长于二选一任务,但不到其两倍;其中包括阅读指示语与反复回答质量控制问题的时间(Koyama 等,2017)。
真正起约束作用的是注意力。序列画廊研究中的被试平均在 5.36 次迭代后按下“满意”按钮(标准差 2.69)(Koyama 等,2020);在第 32.3 节所述为期三个月的现场部署中,多数评价序列根本没有进入优化器(Ou 等,2022)。序列线搜索的众包版本,耐心是花钱买来的:15 次迭代,每次七个滑块任务,每个任务支付 0.05 美元(第 20.2.3 节)。一次个人会话大约能投入十至三十个回答,与图 19.1 中的比较次数同一量级,但现在的问题是六维的。
另有两项代价从不出现在测试函数中。其一,每个回答都带有噪声:同一个人两次看到同一对,有时会给出不同的回答;第 16.3 节将此建模为每个选项感知效用上的噪声。其二,仪器还包括显示屏。序列画廊的研究固定了显示设备,即一台配鼠标的 13 英寸 MacBook Pro(Koyama 等,2020);而读者是在亮度和颜色都未知的屏幕上阅读本书,所处的光线环境也无从得知。白天在手机上看起来最好的版本,夜里在显示器上可能显得刺眼(推断)。
第 25.1 节引用的文献 7
- Ou 等人(2023)The Impact of Expertise in the Loop for Exploring Machine Rationality
- Koyama 与 Igarashi(2018)Computational Design with Crowds
- Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
- Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
- Iwai 等人(2025)Constrained Preferential Bayesian Optimization and Its Application in Banner Ad Design
- Chong 等人(2021)Interactive Optimization of Generative Image Modelling using Sequential Subspace Search and Content-based Guidance
- Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures
25.2 第一个问题之前 #
本节的每个选择都在任何数据到来之前做出,而每一个都会影响优化器能找到的结果。表 25.2 将三个已发表照片增强系统的选择与本章各图的选择并列。
| 序列线搜索(2017) | 序列画廊(2020) | Ou 等(2023) | 本章 | |
|---|---|---|---|---|
| 参数 | 6 个:亮度、对比度、饱和度,红、绿、蓝平衡 | 12 个:亮度、对比度、饱和度,阴影、中间调、高光的色彩平衡 | 5 个,在 中:亮度、对比度、饱和度、色温、色调 | 6 个,在 中:表 25.1 |
| 指示语 | 调节滑块,直到图像看起来最好 | 让照片对 Facebook 或 Instagram 上的朋友有吸引力 | 改善并增强照片的颜色 | 你更喜欢哪个版本? |
| 由谁回答 | 众包工作者;每次迭代取至少 5 个滑块回答的中位数 | 一个人 | 一个人(每个任务 20 人) | 你,或模拟品味 |
| 问题 | 从最佳设计到期望改进设计的滑块,从随机位置开始 | 平面上可缩放的 5 × 5 网格 | 对 4 个版本排序,设有“我不知道”区域 | 一对,或沿整条直线的滑块,从随机位置开始 |
| 回答记录为 | 所选点优于滑块两端(3 选项选择) | 所选点优于平面的中心和 4 个顶点 | 4 个版本的排序 | 成对比较 |
| 模型 | 高斯过程;超参数取带对数正态先验的最大后验估计 | ARD Matérn 5/2 核,对数正态先验, | BoTorch,把 EUBO 扩展到排序;未说明核函数 | Matérn 5/2,一个固定的长度尺度,EUBO 或期望改进 |
| 起点 | 两个随机设计之间的滑块 | 随机平面 | 4 轮拟随机(Sobol)设计 | 原图对随机编辑 |
| 停止 | 15 次迭代 | 15 次迭代;记录何时按下“满意”按钮 | “我满意了”按钮,至多 20 次迭代 | 你停止时,至多 24 个回答 |
表中第一列出自 Koyama 等人(2017)与 Koyama 与 Igarashi(2018),第二列出自 Koyama 等人(2020),第三列出自 Ou 等人(2023)。本节其余部分解释最后一列的选择,并说明它们与已发表的选择有何不同、为何不同。
范围。表 25.1 中的范围决定了优化器能够到达的区域。范围太窄,会排除观看者想要的效果;范围太宽,大部分体积会被荒谬的图片占据,而在六维中,体积决定一切。在本章的范围内均匀抽取的设计几乎总比原图差:原图位于中心,而多数随机设置至少会把一项调整推向极端。后文的图 25.4 显示了其后果:经过二十对随机配对,模拟观看者得到的推荐并不比未经改动的照片更好。这里的范围是目测设定的,对这张照片而言,从“明显不足”延伸到“明显过度”。
核函数。效用模型采用第 18 章的高斯过程:Matérn 5/2 核,各方向长度尺度均为 0.4,先验方差为 1,概率单位噪声 ,用 Laplace 近似拟合(第 18.2 节)。这些值是固定的,不从回答中学习。仅凭二十个一比特的回答学习六个长度尺度(第 9.2 节)很不稳定;第 30.3.3 节指出,在这样的预算下这是否可行,尚无研究检验。Koyama 等人经由另一途径得到了同样的实际结论:他们在核超参数上使用 的对数正态先验,几乎没有给长度尺度留下变动的余地(Koyama 等,2020)。0.4 与 0.5 是通过运行模拟会话选定的;在真人参与之前,这是设定此类数值的诚实做法。
可见的差异。第 19.4 节的采集函数对人眼一无所知。不加限制时,EUBO 经常提出两个相近到人眼无法分辨的版本,这是第 19.6 节所述向当前最优点坍缩的一种表现。一项振动触觉偏好研究的作者在讨论局限时,针对触觉指出了同样的问题:非常相似的信号“可能在感知上无法区分”,邻近点之间的比较“被反应噪声主导”(Zhang 等,2026b)。因此,图中只考虑两个设置的欧氏距离不小于 0.2 的配对,以此粗略代替这一空间中的最小可觉差。允许回答“差不多”(第 20.4.1 节)是有原则的替代方案;这里的界面仍只保留两个按钮。
候选池。在一维中,图 19.1 为 36 种色相两两组成的每一对打分。六维中没有可供穷举的网格,因此每个问题之前,图会从范围中均匀抽取 160 个设置,对当前最佳猜测做 60 个小的随机扰动,再加上此前比较过的所有设置。这一候选池至多约有 250 个设置,图用闭式解式(19.3)为池中的每一对打分,每个问题约 30,000 对。局部扰动不可或缺:均匀抽取的点在每个坐标上都落在最佳猜测 0.1 以内的概率为 ;没有这些扰动,候选池几乎永远不会包含会话后期所需的小幅改进。
推荐。最佳猜测取已比较设置中后验均值最高者,这正是序列线搜索确定 的规则(Koyama 与 Igarashi,2018)。将推荐限定在人实际看过的设置上,就保证了推荐的图片一定有人看过。
起点。第一个问题将原图与一个随机编辑并列比较。原图保留在数据中,此后的每个回答都通过比较图(第 18.5 节)与它相连;图中也始终在最佳猜测旁边显示原图。序列画廊研究中恰有一位被试提出了这一要求,希望“在增强过程中把原图放在旁边以便比较”;这位被试还发现某个任务的初始照片已令人满意,不确定是否该在一开始就按“满意”按钮(Koyama 等,2020)。无法推荐原图的系统会偏向改变(推断)。
第 25.2 节引用的文献 5
- Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
- Koyama 与 Igarashi(2018)Computational Design with Crowds
- Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
- Ou 等人(2023)The Impact of Expertise in the Loop for Exploring Machine Rationality
- Zhang 等人(2026b)Vibrotactile Preference Learning: Uncertainty-Aware Preference Learning for Personalized Vibration Feedback
25.3 比较版本 #
下面就是以你为预言机的循环。请选出你更喜欢的版本,重复十几次或更多。每次都如实选择,没有正确答案。
两张大图就是当前的问题。其下方并排显示模型当前的最佳猜测与原图,读者随时可以检查这次会话是否胜过不做任何改动。六个小面板显示模型学到的内容:每个面板是后验效用(第 18 章)沿一项调整的切片,其余五项固定在最佳猜测处。有峰的曲线表示“这项调整对你很重要,你喜欢它取这里的值”,色带很宽的平坦曲线则表示“尚无信息”。字母 A 与 B 标出当前问题中两个版本在各项调整上的位置,由此可以看出这个问题在探查什么。
可以尝试以下几点。回答十至十五对,观察哪些面板最先变尖:最先变尖的面板,对应你的回答最为明确的调整。留意面板中的字母 A 与 B。第一个问题同时改变所有调整;后续问题往往使多数调整几乎相等,只改变少数几项,因此每个回答探查的空间范围越来越小(在模拟会话中,第一个问题的两个版本在全部六项调整上的差异都超过 0.1,到第十个问题时只有两三项如此)。回答十几次之后,比较最佳猜测与原图,如实判断自己更喜欢哪一个。然后按几次“重问之前的一对”,照常回答;它测量的是什么,留待第 25.5.1 节讨论。
阅读面板时需注意两点。其一,切片并非全貌:它显示的是在最佳猜测处,效用沿一项调整如何变化;调整之间存在相互作用时,阴影设置不同,最佳曝光也可能不同。其二,纵轴没有单位。比较只能在相差平移与缩放的意义下确定效用差异(第 18.4 节),因此能读出的是每条曲线的形状和六条曲线的相对高低,而不是具体数值。
切换到“模拟品味”,可以观察同一循环改由隐藏效用作答的情形。模拟品味有一个最爱的设置,效用从该处按二次函数下降,各项调整的权重不同(曝光与色温最重要,色调最不重要),并包含上文所述曝光与阴影的相互作用。按几次“模拟五次”,再显示最爱:最佳猜测旁的原图会换成最爱的图片,面板中的虚线标出最爱的设置,状态行报告最佳猜测的效用差距(utility gap),即模拟效用在最爱处的值减去在最佳猜测处的值,并列出原图的差距作为对照。差距为零即为完美。
25.4 沿直线搜索 #
一对比较为模型提供一比特信息;一个滑块则提供一次完整的一维搜索,由人来完成:人沿设计空间中的一条直线移动,观察图片的变化,停在看起来最好的位置。这就是第 20.2 节介绍过的序列线搜索(Koyama 等,2017),现在用于真实照片。
此图在两个方面偏离了已发表的方法,两者都是实践者需要面对的选择。
哪条直线。Koyama 等人(2017)让滑块从目前最好的设计 延伸到相对它期望改进最高的设计 (第 20.2.1 节),并提到可以选择将线段按固定因子(如 1.25)放大。本章使用同样的两个点,但把线段向两端一直延伸到范围边界。这样,人既可以要求比所提议的改变更多,也可以要求更少;滑块覆盖的范围也足够大,差异清晰可见。在任何回答之前,直线经过原图,以及配对图开头所用的同一个随机编辑。这种延伸是否有益取决于噪声,下文的比较将说明这一点。已发表方法中有一个细节得到保留:每个问题中滑块都从随机位置开始。Koyama 等人(2017)这样做是“为了减少认知偏差”,即旋钮恰好停留的位置对人的牵引(一种锚定效应,第 37.2.3 节)。
一次选择如何记录。Koyama 等人把一次滑块回答记录为三选一,即所选设计对两个端点,采用式(20.1)的选择似然(Koyama 等,2017;Koyama 等,2020)。本章模型只有第 18 章的成对概率单位似然,因此图把这次选择记录为至多四个独立的比较:所选点优于两个端点,以及滑块上三分之一和三分之二处的点。这夸大了证据。四个比较出自同一次判断,误差并不独立,模型却把它们当作四个独立的回答,因而变得过于自信(习题 25.2)。Mikkola 等人(2020)持相反的观点,认为一次滑块回答相当于不可数无穷多个比较,并用有限样本近似由此得到的似然;两种记录方式都丢弃了一个事实:人一次看到的是整个连续区间。
可以尝试以下几点。沿缩略图条慢慢拖动,留意直线上有多大一部分明显不对;回答中的大部分信息,在于你避开了哪些区域。几个回答之后,直线在面板中变短,因为期望改进点向最佳猜测靠拢。若把旋钮移到星形处并选定,这个回答就表示目前最好的设计优于直线上的所有点,这是一个很强的陈述。
25.4.1 配对还是滑块?#
两种形式的取舍在于每个回答的信息量与用时。已发表的比较来自众包。Koyama 等人(2017)在以参考图像为目标的众包照片色彩增强中,将他们的滑块与二选一、四选一两种形式相比较,每个条件运行三次。工作者的任务是匹配目标图片,而非表达偏好。滑块的误差随迭代下降得更快;滑块任务的用时长于比较任务,但不到其两倍。截至 2026 年 9 月,我们没有找到这样的研究:在照片任务上,针对个人自己的偏好,以相同的模型和预算比较这两种形式。下面预先计算的模拟以图 25.2 的模拟品味为对象,运行四种提问策略(EUBO 配对、随机配对、已发表的滑块线段、整条直线的滑块),每种十六次。
按回答数计,滑块在早期领先,后来两种形式趋于一致。在默认噪声()下,五个回答之后,EUBO 配对的效用差距中位数为 0.37,已发表的滑块和整条直线的滑块分别为 0.34 和 0.30;二十个回答之后,EUBO 配对为 0.14,已发表的滑块为 0.08,整条直线为 0.14,而未经改动的照片为 0.49。在低噪声()下,三者的终值彼此相差在 0.02 以内。在高噪声()下,整条直线的滑块最为稳健,二十个回答后效用差距中位数为 0.16,而 EUBO 配对为 0.31,已发表的线段为 0.34。随机配对的结果值得警惕:默认噪声下,二十个回答之后,16 次会话中只有 7 次的推荐优于未经改动的照片;可见在此设置下,EUBO 配对远远领先于随机配对。第 19.5.1 节记录的运行给出了相反的排序:约二十个回答之后,EUBO 并不优于随机配对。但那里的设置不同:设计是生成的,模拟品味不同,一对中的两个选项之间没有最小距离,最佳猜测取自整个候选池而非已比较的设置。这些差异中究竟是哪一项造成了逆转,我们尚未分辨(推断)。
按秒计,情形则相反,前提是借自第 25.1.3 节的计时适用于本任务。将横轴切换到“秒数”,即每对计 4.2 秒、每次滑块回答计 17.2 秒:在二十对所需的 84 秒内,滑块会话只能完成约五个回答,效用差距中位数仍约为 0.3,而配对已降至 0.14。而且模拟本身对滑块有所偏袒:模拟的人以独立噪声评估 41 个位置并保留最好的一个,如此细致的搜索,真人在 17 秒内未必能完成。这一逆转还依赖于两种用时之比约为四的假设。若滑块回答的用时是配对的两倍(即 Koyama 等人(2017)对众包任务报告的上限),滑块会话在这 84 秒内可给出十个回答,效用差距中位数达到 0.17 至 0.18,接近配对的 0.14(推断)。因此,模拟并不能给出定论;它指出的是,得出定论需要哪些数字:每个回答的用时,以及滑块回答相对于成对回答的噪声,二者都须在同一批人、同一任务上测量(推断)。GimmBO 是 2026 年在同一任务上比较不同界面的一项研究:12 名被试通过合并图像模型适配器来匹配目标图像,由贝叶斯优化驱动的排序界面,比手动调节的一组滑块达到了更高的目标相似度和成功率,每步交互用时为 50.5 秒对 34.7 秒(Liu 等,2026b)。第 32.4 节将这项研究与其他形式比较一并报告。
第 25.4 节引用的文献 6
- Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
- Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
- Mikkola 等人(2020)Projective Preferential Bayesian Optimization
- Iwai 等人(2025)Constrained Preferential Bayesian Optimization and Its Application in Banner Ad Design
- Chong 等人(2021)Interactive Optimization of Generative Image Modelling using Sequential Subspace Search and Content-based Guidance
- Liu 等人(2026b)GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization
25.5 一次会话揭示了什么 #
以自己为对象运行一次会话,就会看到测试函数所掩盖的三件事:人对同一问题并不总是给出相同的回答;品味可能在回答过程中移动;结果取决于碰巧被问到了哪些问题。每一项在已发表的研究中都有对应,但研究所能提供的信息都不如人们期望的多。
25.5.1 一致性 #
“重问之前的一对”会把会话早期的一对左右调换后再次展示,历史记录随后将这次回答标为“相同”或“反转”。在第 16.3 节的模型下,反转的概率形式很简单。设此人以概率 偏好 A 胜过 B,其中 为效用差, 为每个选项上的噪声,则两次独立回答一致的概率为
一致率永远不低于一半;只有差异远大于噪声的配对,一致率才会达到一;对于此人觉得几乎相等的配对,它接近于掷硬币。取 ,即相当明确的偏好,两次回答一致的概率也只有 68%。因此,回答反转本身并不说明粗心。若在模型认为明确的配对上反转比例很高,才说明模型的噪声尺度对此人而言过小,后验过于自信(习题 25.1)。
式(25.1)假设第二次回答独立于第一次,而记忆可能从两个方向破坏这一假设:人可能直接重复记得的回答,回想的努力本身也可能增加噪声。在重复美感评分的实验中,只评价单个刺激时,回忆记忆贡献了测得方差的一半;刺激集合含九个或更多刺激时,它只使方差增加约 10%(Pombo 等,2023)。因此,图会调换左右,从不提示重复,并且只重复至少两个回答之前的配对;严谨的研究应把重复的间隔拉得更大。
在会话中重复配对成本很低,但截至 2026 年 9 月,我们没有找到任何基于偏好的设计优化研究这样做,即在会话后期重新询问早期的比较,以检验一致性或漂移(第 32.3 节)。最接近的证据是间接的。17 名视力正常的被试为模拟的视网膜植入视觉做个性化设置时,他们的选择只有约 50% 与模拟智能体的预测一致(Schoinas 等,2025);可见模拟的人可能难以替代真人。在 Ou 等人(2023)的照片任务中,照片编辑经验较多的被试表达无差异(把版本放在同一评分区域)的频率显著高于新手():有经验的眼睛判定的平局更多,而非更少。
25.5.2 漂移 #
品味可能在一次会话中移动:适应了鲜艳的版本后,原图开始显得沉闷;注意到起初并非标准的东西,例如水的颜色;或者出于疲劳。Koyama 等人(2020)假设用户的感知函数“不随时间变化”,然而他们的六名被试中有一人报告,自己选择设计时“依据的是我一开始并没有的标准”。本章的模型没有时间概念,它把第一分钟与第十分钟给出的回答,当作同一效用的两次带噪声读数。
在图 25.4 中打开“品味在会话中漂移”。此时模拟的最爱会在二十个回答期间稳步移动,朝更高的饱和度、更暖的色温、更低的对比度方向,总共移动约 0.3。效用差距曲线变得平缓,因为目标在移动;下方面板显示各次会话的终点相对于最爱起点和终点的位置。在两个较低的噪声水平下,终点落在两者之间:投影到漂移方向上,最终推荐平均位于从起始最爱到最终最爱路程的 13% 至 56% 处,具体取决于提问策略。在最高噪声下,EUBO 会话完全没有朝新的最爱移动。假设效用固定的模型会对整个会话取平均,因此推荐的是此人平均而言喜欢的设置,而非其当下喜欢的设置(推断,依据这些模拟)。补救办法有随时间变化的效用,或对旧回答施加遗忘因子,见第 46.5 节的讨论;这些办法都未在照片任务中检验过。
图中的漂移是为说明而人为设定的。在二十次比较的会话中,观看者偏好的饱和度移动得有多快,甚至是否移动,目前都不清楚。能够回答这一问题的实验,即在会话末尾以随机化的提问顺序重新询问早期配对,正是第 47.4 节所描述的实验。
25.5.3 顺序 #
即使品味固定,碰巧被问到哪些问题也会改变会话的终点。图 25.4 的下方面板显示了相同模拟品味、相同噪声下十六次会话的最终推荐;这些会话仅在随机候选池、第一个随机编辑和各回答的噪声上不同。在默认噪声下,按表 25.1 的单位尺度,最终设置在每项调整上的标准差为 0.05 至 0.12;曝光上的 0.07 约合 0.14 EV。离散程度在曝光上最小,而曝光正是模拟品味最看重的调整;在色调上则属于最大之列,而色调是它最不看重的调整。这说明后验在按预期工作:效用平坦之处,回答无法确定设置,而设错的代价也小。
关于顺序的已发表证据来自众包。Koyama 等人(2017)在同一张照片上从不同的随机起始条件出发,将序列线搜索重复三次,并测量三次运行之间的差异随迭代的变化,差异分别以参数设置之间的距离和每像素平均感知色差衡量:差异在前四五次迭代中迅速缩小,三次运行趋于相似的增强效果。作者认为这支持了他们的假设,即众包人群共享同一个优度函数;他们也补充说,若有些人偏好一种风格、另一些人偏好另一种,这一假设可能不成立。不过,每次迭代的回答是至少五名工作者滑块位置的中位数,这一做法平均掉了单个人的大部分噪声。据我们所知,单个人的结果在多大程度上依赖其提问顺序,尚未在照片增强会话中测量过。判断研究提供了预期这种效应存在的理由。以艺术照片和人脸为刺激时,中性图片出现在较受偏好的图片之后,比出现在较不受偏好的图片之后更受偏好;控制反应偏差后,类似的趋势依然存在(Chang 等,2017)。七项美感评分实验表明,只要刺激多样、来自不同的物体类别,序列依赖就不影响评分的方差(Pombo 等,2023)。同一张照片的不同版本恰恰与多样相反,因此这一令人宽慰的结论不能推广到本任务(推断);这些序列效应的综述见第 37.3.2 节。
25.5.4 停止,以及这是谁的结果 #
会话在人停下时结束,而已发表的数字表明,这一时刻来得相当早。序列画廊的被试平均在 5.36 个平面后就满意了(Koyama 等,2020)。Ou 等人(2023)的设置是:五项取值于 的照片调整,优化器接手之前先有四轮拟随机版本,至多 20 次迭代。照片编辑经验较多的被试运行的迭代次数显著多于新手();作者将研究结论概括为:新手更容易满意、更早结束,专家则探索得更远,报告的满意度也更低。满意不等于收敛:人的“够好了”与模型趋于平坦的后验是两种不同的停止信号,原因见第 46.6 节。
一次会话引出的另一个问题是:这是谁的结果?在众包版本中,结果属于一个群体:作者指出,“当众包是唯一的数据来源时”,单个用户的偏好“不会反映在计算中”,而不同背景的人群可能有明显不同的偏好(Koyama 与 Igarashi,2018)。在本章的图中,结果属于一个人:在一块屏幕上、在某一天得出,连同随之而来的噪声与漂移。第 32.5 节介绍了一系列工作,它们借助其他用户的会话,为新用户的会话提供更好的起始先验。
第 19 章的算法原封不动地在六维的真实照片上运行。案例增添的是算法之外的一切:边界明显过度但不至荒谬的范围与单位、通过模拟选定的固定核设置、两个版本之间的最小可见差异、始终可见的原图、用于测量人的噪声的几对重复配对,以及每个回答用时的记录。这些都不会出现在测试函数中,而每一项都会改变答案。
第 25.5 节引用的文献 7
- Pombo 等人(2023)The intrinsic variance of beauty judgment
- Schoinas 等人(2025)Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants
- Ou 等人(2023)The Impact of Expertise in the Loop for Exploring Machine Rationality
- Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
- Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
- Chang 等人(2017)Sequential effects in preference decision: Prior preference assimilates current preference
- Koyama 与 Igarashi(2018)Computational Design with Crowds
25.6 习题 #
设某次会话重复了五个早先的配对,其中三个得到相同的回答,并假定这五对难度相同。利用式(25.1), 的一致率意味着 取何值?效用差与噪声之比 是多少?若模型对这些配对预测的是 ,可以得出什么结论?
解答
由 与 得 ,故 ,。于是 ,:对此人而言,这些配对的差异小于一个噪声标准差。预测 的模型期望的一致率为 ;在这一预测下,5 次中有 3 次一致不太可能出现(一致率为 0.905 时,5 次中至多 3 次一致的概率约为 0.07),因此模型的噪声尺度很可能过小,后验过于自信。不过,五次重复为数很少, 的估计的标准误约为 0.2。
滑块图把一次选择记录为至多四个成对比较。假设四个落败者的效用相同,从而四个似然项相同,乘积为 ,其中 。它与单次比较的似然相比如何?与四次独立比较相比又如何?试提出一种简单的修正。
解答
恰好是四次独立回答都偏向所选点时的似然,因此后验的自信程度,就如同此人被问了四个独立的问题且每次都与自己一致,而实际上只做了一次判断。一种修正是对来自滑块的似然项做回火:把 个项中的每一项都取 次幂;落败者相似时,这样可以恢复一个回答应有的权重。另一种是对来自滑块的比较使用更大的噪声尺度。第三种是采用式(20.1)的选择似然,每个滑块回答只贡献一项,这正是 Koyama 等人的做法。
假设曝光范围为 EV 而非 EV,其他一切不变,包括单位尺度上 0.4 的长度尺度。此时 0.4 的长度尺度相当于多少档?随机设计和候选池会受到什么影响?
解答
单位区间现在跨越 6 EV 而非 2 EV,0.4 的长度尺度因而对应 2.4 EV 而非 0.8 EV:模型假设效用以档计的变化慢了三倍,会把观看者能察觉的差异平滑掉。曝光范围的大部分现在暗得或亮得荒谬,随机设计更可能很差,候选池中均匀抽取的部分也大多浪费在无人会选的设置上。修正办法是缩窄范围、只为曝光使用更短的长度尺度(每个输入一个长度尺度,第 9.2 节),或两者兼用。
候选池包含 160 个均匀设置、60 个对最佳猜测的扰动,以及已比较过的设置。池中有 250 个设置时,EUBO 要为多少对打分?图为什么不直接使用 220 个均匀设置?计算一个均匀设置在全部六个坐标上都落在某个给定设置 0.1 以内的概率,并与一维中的相应概率比较。
解答
共 对。在一维中,均匀点落在给定点(远离边界)0.1 以内的概率为 0.2;在六维中为 ,因此 220 个均匀设置中含有一个如此接近最佳猜测的设置的概率约为 。会话后期有用的问题是对最佳猜测的小幅改进,而只有局部扰动能提供这样的候选。同样的观察也促成了高维贝叶斯优化中的信赖域(第 14.6 节):维度较多时,好的候选必须在最佳点附近寻找,因为均匀样本几乎从不落在那里。
延伸阅读 #
- Koyama 等人(2017)提出了序列线搜索,并将其应用于六参数的照片色彩增强,由众包作答。
- Koyama 与 Igarashi(2018)是一部专著中关于众包计算设计的一章,介绍了众包流程、与 Photoshop 和 Lightroom 的投票对比,以及从不同起始条件出发的三次运行。
- Koyama 等人(2020)用平面上的可缩放网格(序列画廊)取代了滑块,并报告了一项 12 参数照片增强的小型用户研究,其中引用了被试的原话。
- Ou 等人(2023)在三个任务中比较新手与专家,其中之一是照片色彩增强,使用基于 EUBO 的优化器和排序界面。
- Iwai 等人(2025)与专业设计师合作,在横幅广告的颜色变体上运行成对偏好优化,每个任务 50 次比较,点击率约束由机器处理。
- Mikkola 等人(2020)把类似滑块的回答视为无穷多个比较,并推导了相应的似然。
参考文献
- (2017). Sequential effects in preference decision: Prior preference assimilates current preference. PLOS ONE. 引用于 §25.5
- (2021). Interactive Optimization of Generative Image Modelling using Sequential Subspace Search and Content-based Guidance. Computer Graphics Forum. doi:10.1111/cgf.14188. 引用于 §25.1 §25.4
- (2025). Constrained Preferential Bayesian Optimization and Its Application in Banner Ad Design. Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence. 引用于 §25.1 §25.4
- (2018). Computational Design with Crowds. Computational Interaction. 引用于 §25.1 §25.2 §25.5
- (2017). Sequential line search for efficient visual design optimization by crowds. ACM Transactions on Graphics. 引用于 §25.1 §25.2 §25.4 §25.5
- (2020). Sequential Gallery for Interactive Visual Design Optimization. ACM Transactions on Graphics 39(4) (SIGGRAPH 2020). 引用于 §25.1 §25.2 §25.4 §25.5
- (2026b). GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization. ACM Transactions on Graphics. doi:10.1145/3811293. 引用于 §25.4
- (2020). Projective Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §25.4
- (2022). The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures. Mensch und Computer 2022. 引用于 §25.1
- (2023). The Impact of Expertise in the Loop for Exploring Machine Rationality. IUI 2023. 引用于 §25.1 §25.2 §25.5
- (2023). The intrinsic variance of beauty judgment. Attention, Perception, & Psychophysics. 引用于 §25.5
- (2025). Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants. 2025 47th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC). doi:10.1109/embc58623.2025.11253762. 引用于 §25.5
- (2026b). Vibrotactile Preference Learning: Uncertainty-Aware Preference Learning for Personalized Vibration Feedback. UMAP 2026 (per Semantic Scholar). 引用于 §25.2