为什么请人做比较
第三部分中的每种方法都假设,评估一次目标函数会返回一个数:验证准确率、产率、行走速度。当目标函数是人的判断时,最直接的数是评分(“按 1 至 10 分,这个有多好?”),最直接的做法是把评分当作测量值,输入第 8 章的高斯过程。第 1.4 节已经指出,这一做法会遇到困难:人不擅长给出这样的数,而在两样东西中指出更喜欢哪一样,人要擅长得多。
本章把这一提醒精确化。首先请读者在自己身上做一个实验,然后把观察到的现象归纳为模型:一次比较是对两个隐藏效用之差的带噪声测量;选择模型(choice model)是把这个差映射为各个回答概率的规则,也就是本部分后续各章都要用到的似然。
随后,第 17 章处理使用这些似然在数学上付出的代价,第 18 章把它们与高斯过程结合,第 19 章则在此基础上做优化。
16.1 以人为目标函数 #
先看下图。图中要求以两种方式判断灰色色块。在评分任务中,一块色块单独出现在深色或浅色背景上,为它打一个 1(最暗)至 9(最亮)的分。在比较任务中,两块色块并排出现,指出哪一块更亮。两种任务各做十几次或更多,如实作答、不回头修改,然后查看底部的面板。
柱状图对两种任务提出同一个问题,因此二者可以直接比较。单次评分本身回答不了这个问题:两次评分是在不同时刻对不同色块给出的,必须事后放在一起对照。一次比较则在单个试次内就能回答。模拟观察者呈现的模式,正是本节其余部分要解释的。它的评分只在约十次中的七次里把相差一级的色块排对顺序,而它的比较几乎从不出错。这些数值是示意性的,并非实测:每次评分在真实等级上加入 0.6 级的偏移(深色背景上向上,浅色背景上向下)、量表使用方式的缓慢漂移,以及标准差为 0.8 级的噪声,再取整到量表上;每次比较只在差值上受到 0.5 级的噪声,因为两块色块共享同样的背景与漂移。只做十几次时,读者自己的数值会更嘈杂,但差距通常一目了然,因为两种任务对作答者的要求不同。
16.1.1 评分为何困难 #
第一个原因是,单独呈现时人能分辨的等级,远少于并排呈现时。Miller(1956)汇集了一系列实验:听者或观看者需要给单个刺激一个数来识别它,与上面的评分任务相同。对于纯音的音高,传递的信息稳定在约 2.5 比特,相当于听者从不混淆的约六个等级;在他回顾的所有一维属性上,平均值为 2.6 比特,标准差只有 0.6 比特。图 16.1 中的九个等级多于 Miller 发现的典型值(六个左右),但任意两个相邻等级并排呈现时都很容易分辨。针对这一限制,Miller 列出的第一个补救办法是以相对判断代替绝对判断。
第二个原因是,数值取决于情境。无论周围是什么,色块都是同一种灰,但同样的灰放在深色背景上,看起来比放在浅色背景上更亮。这就是 Thurstone 早已在灰度值上注意到的同时对比(Thurstone,1927);图中的散点图可以显示评分是否随背景偏移。对真实事物的评分也有类似的依赖,依赖的是紧邻其前出现的内容。对照片和人脸的偏好评分会向前一项的评分靠拢,即使控制了反应偏差,这种拉力依然存在(Chang 等,2017)。在 220 万条 Yelp 评分和 420 万条 Amazon 评分中,评论者的评分反而偏离其先前的评分,这是一种对比效应(Vinson 等,2019)。吸引力评分平均而言会偏向前一张面孔,但某个人受牵引的程度在不同序列之间并不稳定(Kramer 与 Cartledge,2026)。方向取决于具体场景,依赖本身则是可靠的。
第三个原因是,人对量表的使用并不均匀。一百多年前,Hollingworth(1910)描述了判断的趋中倾向(central tendency of judgment):对量值的估计会向此人见过的刺激范围的中部漂移,因此小的值被高估,大的值被低估。评分量表很可能以同样的方式向中部压缩(推断)。
这些效应恰恰出现在本书关注的场景中。在一项为期 3 个月的部署中,偏好引导的优化器用于处理三维网格,由两位专业美术师为候选网格打分。优化过程缺乏应对“不一致且相互矛盾的人类判断”的机制,系统展示的内容还会通过启发式偏差和损失厌恶影响后来的回答;访谈表明,人会锚定在先前看到的网格上,在一连串越来越好的结果之后,判断会失去精度(Ou 等,2022)。Koyama 与 Igarashi(2018)认为,绝对评分要求熟悉整个设计空间,初次接触这一空间的人并不具备这种熟悉度;两个选项之间的比较则可以立即作答。第 25 章完整演示了一个这样的问题:通过在不同版本之间做选择来调整一张照片。
16.1.2 比较为何有效 #
比较并不能消除这些效应,而是让其中许多效应相互抵消。如果心情、背景,或者对“5”在量表上所处位置的感觉使两个选项偏移了相同的量,二者之差就不受影响,而一次比较只报告这个差的符号。Thurstone 在 1927 年就提出了这一论点:以“比平时稍微宽厚、宽容一些的心情”看两份书写样本,会同时提高对两者的印象,在这个程度上,两种印象共同变化(Thurstone,1927)。第 16.3 节说明这种共同变化如何在比较中消去。
评分把人的偏好与当时决定其量表的一切因素混在一起。比较报告的是差的符号,而差会抵消使两个选项同等偏移的任何因素。
人做比较比打分更可靠,直接证据来自多个领域。信息检索中,评估者判断两篇文档中哪一篇更好地回答了查询;这种偏好判断比分级判断更快、更一致(Clarke 等,2021)。一篇 2014 年的预印本报告了在 Amazon Mechanical Turk 上开展的多种任务实验:与数值评分相比,成对比较每个回答的噪声更低,收集通常也更快,但每个回答携带的信息更少(Shah 等,2014)。一项研究考察人们在市场中如何报告偏好,发现被试报告基数信息(对某物偏好多少)比报告序数信息(偏好哪一个)更难(Budish 与 Kessler,2022)。
这种优势并不普遍,有必要了解它在何处失效。162 人相隔 2 周重复一项健康估值任务,离散选择有 76.4% 前后相同(kappa 为 0.528;kappa 是经机会校正的一致性度量,1 表示完全一致);数值型的时间权衡法则达到 0.958 的组内相关系数(方差中来自人与人之间差异、而非不同测量场合之间差异的比例),尽管其数值只有 59.3% 前后完全相同(Xie 等,2022)。风险偏好方面,一项针对重测相关的元分析发现,自我报告的冒险倾向比彩票选择之类的行为测量在时间上更稳定,估计的信度分别为 0.61 和 0.25(Bagaïni 等,2025)。这些测量并非针对同一刺激的比较与评分,因此不能就此下定论;它们表明,“用比较代替评分”是关于具体任务的假设,而不是定律。在 2026 年之前,我们没有找到这样的研究:以真实用户在同一设计任务上对比成对比较、画廊、滑块、排序和评分;反馈形式之间的首批直接比较出现在 2026 年(第 32.4 节)。在本书最关心的场合,比较的理由也最充分:没有外部单位可以锚定评分时,以及情境在会话中漂移时(推断)。
第 16.1 节引用的文献 13
- Miller(1956)The magical number seven, plus or minus two: Some limits on our capacity for processing information
- Thurstone(1927)A Law of Comparative Judgment
- Chang 等人(2017)Sequential effects in preference decision: Prior preference assimilates current preference
- Vinson 等人(2019)Decision contamination in the wild: Sequential dependencies in online review ratings
- Kramer 与 Cartledge(2026)Sequential effects in facial attractiveness judgements: No evidence of stable individual differences
- Hollingworth(1910)The Central Tendency of Judgment
- Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures
- Koyama 与 Igarashi(2018)Computational Design with Crowds
- Clarke 等人(2021)Assessing Top- Preferences
- Shah 等人(2014)When is it Better to Compare than to Score?
- Budish 与 Kessler(2022)Can Market Participants Report Their Preferences Accurately (Enough)?
- Xie 等人(2022)Discrete choice experiment with duration versus time trade-off: a comparison of test–retest reliability of health utility elicitation approaches in SF-6Dv2 valuation
- Bagaïni 等人(2025)A systematic review and meta-analyses of the temporal stability and convergent validity of risk preference measures
16.2 心理物理学 #
如果判断带有噪声,能否利用噪声本身来测量某种东西?这正是 19 世纪心理物理学的研究纲领。心理物理学研究物理刺激如何映射为感觉,它给出的答案塑造了本章的每一个模型。
出发点是这样一个观察:足够小的差无法可靠地分辨。请人提起两个重物并说出哪个更重,其能察觉的最小差,即最小可觉差(just-noticeable difference),会随重物本身的重量增大,而且大致成正比,因此最小可觉差与重量之比基本不变。Fechner 将这一规律命名为 Weber 定律(Weber's law),名称源自 Ernst Heinrich Weber 的提举重物实验,并以此为基础展开研究(Fechner,1860)。如果每个最小可觉差都是感觉上相等的一步,那么从阈限开始向上计数步数,所得感觉就随强度的对数增长,这就是 Fechner 定律(Fechner's law)。Fechner 还把测量辨别力的方法系统化,其中包括如今称为恒定刺激法(method of constant stimuli)的方法:多次呈现固定的标准刺激与比较刺激,记录比较刺激被判断为更大的频率。
恒定刺激法给出的正是本章所关心的曲线。以真实差值为横轴,以回答“比较刺激更重”的比例为纵轴作图,曲线从接近 0 处平滑上升,在两者相等处经过二分之一,最后接近 1。这条 S 形曲线就是心理测量函数(psychometric function)。其陡峭程度度量观察者的噪声:精确的观察者曲线陡峭,噪声大的观察者曲线平缓。最小可觉差通常由它定义,即能在固定比例的试次中判断正确的差,这一比例常取 75%。
换一种方法,就会得到另一条定律。Stevens(1957)不请人做比较,而是请人直接给出数值(“如果这个声音是 10,那个声音有多响?”),这种方法称为量值估计法。所得数值随强度的幂增长,而非随其对数增长,指数取决于感觉连续体。两条定律在各自的方法之内都能很好地描述数据。本书从中得到的教训是:人直接给出的数并不是感觉的中性读数,而要经过此人自己从感觉到数值的映射;辨别数据测量的则是另一种东西,即两样东西被混淆的频率。比较以人的噪声为单位测量效用,正如 Fechner 以最小可觉差为单位计量感觉。第 18.4 节将进一步讨论这一点对学得的效用意味着什么。
现代心理物理学细化了这一图景,但没有推翻它。价值判断中的一部分噪声和偏差,如今可以用有效编码来解释:大脑会根据最近遇到的价值范围调整自身的量表,因此同一选项在不同情境下可能得到不同的估值(Bavard 等,2018)。第 37.3 节与第 39.4 节详细介绍了这方面的工作;在这里,它提供了又一个理由,说明人的量表在会话中可能发生移动。
第 16.2 节引用的文献 3
- Fechner(1860)Elemente der Psychophysik
- Stevens(1957)On the Psychophysical Law
- Bavard 等人(2018)Reference-point centering and range-adaptation enhance human reinforcement learning at the cost of irrational preferences
16.3 Thurstone 的比较判断 #
Fechner 的心理物理学需要物理量表(克或分贝)来度量刺激。Thurstone(1927)去掉了这一要求。用他的话说,比较判断律“不仅适用于物理刺激强度的比较,也适用于定性的比较判断,例如对样本优劣的判断”,比如书写样本、儿童画作,或对公共议题的看法。正是这一步使比较可以用于偏好:一个人有多喜欢某种颜色,没有物理量表可言,但仍然可以有心理量表。
Thurstone 的模型包含三个要素。观察者每看一次刺激,刺激都会唤起一个辨别过程(discriminal process),即心理量表上的一个值。这个过程每次都有波动,因此观察者在不同场合对同一对刺激会给出不同回答。过程最常出现的值是该刺激的量表值(scale value),波动的标准差是该刺激的辨别离散度(discriminal dispersion)。每一次,观察者都报告当时过程值较高的那个刺激更好。
Thurstone 对量表的定义使波动服从正态分布,从而可以计算每个回答的概率。记刺激 与 在某一次唤起的过程分别为 与 。
记 为回答“”的观测比例, 为相应的标准正态离差,上述结果就是 Thurstone 比较判断律:
第 16.1 节所说的共同偏移,就体现在相关系数 中。若某种心情同时提高了对两份样本的印象,两者的波动便同向变化,,差的方差随之缩小,共同部分相互抵消。Thurstone 也注意到了相反的情形。在同时对比中,一块灰色挨着更深的灰色时显得更亮,更深的那块则显得更暗,于是波动反向变化,,差随之放大(Thurstone,1927)。
一般而言,式(16.1)中的未知量太多,无法拟合,因此 Thurstone 列出了五种情形,假设逐步加强。最后也是最简单的第五种情形(Case V)假设所有辨别离散度相等且相关系数为零(Thurstone 认为它“对于粗略测量是合理的”)。在共同的离散度 下,概率变为
这就是概率单位(probit)选择模型,名称来自 probability unit(概率单位),这是标准正态离差的旧称。这一公式可以这样理解:选择 的概率只取决于量表值之差(以噪声为单位),差为零时概率为二分之一。把量表值 换成设计 的效用函数 ,式(16.2)就是 Chu 与 Ghahramani 偏好模型的似然(Chu 与 Ghahramani,2005),第 18 章及其后各章都会用到它。
Thurstone 则反过来用这一模型做测量。以 为单位,第五种情形给出 ,即其论文中的式(4)。若 75% 的判断认为 优于 ,则 , 比 高约 。若 99% 的判断偏好 ,差距约为 。对许多对刺激收集这样的差距,就能把每个刺激放到同一个量表上,全程无须任何物理测量。
假设在 69% 的判断中 优于 ,在 84% 的判断中 优于 。第五种情形给出 ,以及 。如果模型成立,,于是模型预测在 的判断中 优于 。因此,观测第三个比例就构成一次检验:各段差距必须能够相加。若严重不符,说明这些选项并不位于同一个噪声相等的量表上,这正是第 16.7 节讨论的主题。
Thurstone 还注意到,不同比例所含的信息并不相等。0.99 的比例与 0.55 的比例对相应量表差的确定程度不同(Thurstone,1927):在 0 或 1 附近,比例的微小变化对应差的巨大变化,因此结果几乎确定的一对刺激,几乎无法说明两个选项相距多远。第 16.6 节将对此作精确的表述。
第 16.3 节引用的文献 2
- Thurstone(1927)A Law of Comparative Judgment
- Chu 与 Ghahramani(2005)Preference learning with Gaussian processes
16.4 Bradley、Terry 与 Luce #
四分之一个世纪之后,研究成对比较实验的统计学家循另一条路径得到了第二个模型。Bradley 与 Terry(1952)为每个选项 赋予一个正的价值(worth),并令
把价值写成效用的指数 (其中尺度 为正),再将分子分母同除以 ,式(16.3)就变为
即缩放后效用差的逻辑函数(logistic function),也称 logit 模型。与第五种情形一样,它只取决于效用之差,平局时等于二分之一,差很大时趋近 0 或 1。尺度 相当于噪声: 很小时,选择几乎是确定的。
Luce(1959)把这一模型从成对推广到集合。由他的选择公理(choice axiom)可知,从任意选项集合 中选择 的概率为
其中权重 为正;当 时,这一规则如今通常称为 softmax。对只含两个选项的集合,它就是 Bradley-Terry 模型。同样的思路还给出一个排序模型:按式(16.5)从全集中选出排第一的选项,再从剩余选项中选出第二个,依此类推。Plackett(1975)针对排列发展了这一模型,称为 Plackett-Luce 模型。当一个人对几个选项排序,而不是回答一次对决(duel)时,第 20.1.3 节会用到它。对决是这一领域对单次成对比较的称呼,本书其余部分也沿用这一说法。
这一公理有一个很强的推论。对同一集合中的两个选项 与 ,把式(16.5)相除,得 ,与 中的其他选项无关。这一性质就是无关选项独立性(independence of irrelevant alternatives):选茶而不选咖啡的几率,不取决于是否还提供果汁。这一性质用起来方便,却常常不成立。一个思想实验可以说明原因:一家咖啡馆提供咖啡和茶,某人选两者的次数各占一半;再加一壶完全相同的咖啡,本不应带来多大变化,然而按式(16.5),两壶咖啡合起来会占去三分之二的选择。
真实的选择以更微妙的方式违反这一性质。加入第三个选项,可能使原有两个选项之一更有吸引力(吸引效应,又称诱饵效应),可能使居中的选项更有吸引力(折中效应),也可能主要从与它最相似的选项那里分走份额(相似性效应)。这些情境效应在群体平均上成立,但个体很少同时表现出全部三种,而平均可能产生任何个体都没有表现出的模式(Liew 等,2016)。被占优的选项甚至能使占优于它的选项显得更差,这种排斥效应取决于选项的呈现方式(Spektor 等,2018)。一篇综述把情境效应的出现、消失与反转归因于选项的空间布局、属性的具体程度,以及人们考虑的时长(Spektor 等,2021)。单纯的对决没有第三个选项,经典效应需要选项集合才能发生作用;画廊,以及先前查询中仍留在记忆里的选项,可能把这些效应带回来(推断)。第 37.2 节报告了这方面的证据,第 20.6 节讨论其对界面设计的意义。
第 16.4 节引用的文献 6
- Bradley 与 Terry(1952)Rank Analysis of Incomplete Block Designs: I. The Method of Paired Comparisons
- Luce(1959)Individual Choice Behavior: A Theoretical Analysis
- Plackett(1975)The Analysis of Permutations
- Liew 等人(2016)The appropriacy of averaging in the study of context effects
- Spektor 等人(2018)When the Good Looks Bad: An Experimental Exploration of the Repulsion Effect
- Spektor 等人(2021)The elusiveness of context effects in decision making
16.5 随机效用模型 #
概率单位模型与 logit 模型看起来是两个毫不相干的公式,实际上是同一思想的两个实例。经济学家把这一思想发展成分析选择的主要框架,即随机效用模型(random utility model)。每个选项 有一个系统效用 ;每一次,人感知到的是 ,其中 是随机噪声;人选择感知效用最大的选项。Thurstone 的辨别过程就是带高斯噪声的随机效用。McFadden(1974)证明,当各噪声项相互独立且服从 Gumbel 分布(也称双指数分布或第一类极值分布)时,选择概率恰好是 Luce 规则式(16.5),其中 。这就是条件 logit 模型(conditional logit model),它成为经济学中离散选择分析的起点(第 40.9 节)。
因此,选择模型是关于噪声的一种断言:高斯噪声给出概率单位模型,Gumbel 噪声给出 logit 模型。把效用差变为选择概率的曲线也称为链接函数(link function),简称链接;下文称之为概率单位链接与逻辑链接。Yellott(1977)研究了 Luce 公理、Thurstone 理论与双指数分布之间的联系。对两个选项而言,这一联系简短到可以直接推导。
设 与 是尺度为 的独立 Gumbel 变量。两者共同的位置平移在差中抵消,因此可取标准形式,其累积分布函数为 ,密度为 。令 。
- 当 时选择 。以 为条件,再对 取平均(全概率公式),得 。
- 代换 。于是 ,且 ,因为 。当 从 变到 时, 从 变到 。
- 积分变为 。
- 在 上的积分为 ,所以 ,即 时的逻辑函数式(16.4)。
下图把随机效用模型具体化。上方面板显示给定差值与噪声下两个选项的感知效用。每按一次播放就模拟一次:此人对每个选项各感知到一个值(以三角形标出),并选择较高者。中间面板显示选择 的概率随效用差的变化,以及迄今各次中选择 的比例。
可以做以下尝试:
- 缩小噪声。随着 减小,曲线变陡,趋向阶跃:没有噪声的人总是选择较好的选项,此时概率无法反映它究竟好多少。随着 增大,曲线处处变平,趋向二分之一。
- 切换噪声。图中让两种噪声分布的标准差相同,对 Gumbel 噪声而言,这意味着尺度 。此时两条曲线几乎重合,最大差距约为 0.023,出现在差值约为感知差 的 0.68 个标准差处。
- 观察尾部。差别出现在远离零的地方。当效用差为 的 3 个标准差时,逻辑链接给较差选项的概率约为 0.0043,概率单位链接约为 0.0013,前者是后者的 3.2 倍。在 4 个标准差处,这一比值约为 22。
- 打开代价面板。对于违背效用差的回答,模型在对数似然上付出的惩罚,在逻辑链接下随差值线性增长,在概率单位链接下则按二次增长。一个出人意料的回答对概率单位模型的拉动远大于对 logit 模型的拉动。
- 按播放。每一次都是新的抽取。60 次之后,选择 的比例通常落在曲线的区间之内,但任何单个回答都可能偏向任一方。
后两点在实践中很重要。一个人一时疏忽,或看错了一对选项,就会给出远在尾部的回答。在概率单位链接下,这个回答可能主导拟合;在逻辑链接下,其影响是有界的。BoTorch 的概率单位链接实现把 的自变量截断到 ,从而为任何单次比较的惩罚设了上限;第 27.5 节将考察这一保护措施(Meta Platforms, Inc.,2026g)。
文献中的概率单位链接至少有三种写法:,噪声 加在每个选项上,如式(16.2);,噪声 加在差上;,噪声并入 的尺度。BoTorch 的 PairwiseGP 使用 ,即每个选项上的噪声固定为 1(Meta Platforms, Inc.,2026g)。三者以不同单位描述同一个模型,但若把一篇论文中的噪声值照搬进另一篇论文的公式,就会差一个 因子。比较概率单位链接与逻辑链接时同样要注意:应匹配标准差,即 ,而不是匹配原始参数。
噪声究竟是什么?随机效用模型对此不持立场。随机性可以是一个人时刻变化的波动,如 Thurstone 设想的单个观察者;可以是分析者观察不到的选项属性;也可以是样本中不同人之间的差异。对于回答一连串比较的单个人,第一种解释最自然,而且可以检验。McCausland 等人(2020)请 141 名被试在五张彩票中做选择,从每个至少含两张彩票的子集中各选 6 次,并应用了一组不等式:只要选择概率由任何一个随机效用模型生成,就必须满足这些不等式。大多数被试与随机效用一致,只有 4 人表现出违反随机效用的强证据。
本节所有模型还共有一个性质,它影响着第四部分的其余内容。选择概率只通过 (或 )依赖于效用。给每个效用加上同一个常数,结果不变;把每个效用加倍、同时把噪声加倍,结果也不变。因此,比较只能在相差一个平移的意义下确定效用,而且只能以噪声为单位。第 18.4 节推导了这对高斯过程效用的含义。
概率单位模型与 logit 模型是同一个模型(随机效用,选择看起来更好的选项),分别对应高斯噪声与 Gumbel 噪声。二者在接近平局时一致,在尾部不同:对于意外回答究竟有多意外,二者判断不一。
第 16.5 节引用的文献 4
- McFadden(1974)Conditional Logit Analysis of Qualitative Choice Behavior
- Yellott(1977)The relationship between Luce's Choice Axiom, Thurstone's Theory of Comparative Judgment, and the double exponential distribution
- Meta Platforms, Inc.(2026g)BoTorch pairwise likelihood source code likelihoods/pairwise.py
- McCausland 等人(2020)Testing the Random Utility Hypothesis Directly
16.6 一次比较携带的信息 #
1 至 9 分量表上的一次评分,原则上可以携带 比特。一次比较只有两种可能的回答,因此至多携带 1 比特:一个回答所提供的关于任何事物的信息,都以该回答的熵为上界,而二元回答的熵至多为 比特(第 6.3 节)。大多数比较携带的信息要少得多。要确定少多少、哪些比较携带的信息最多,需要把选择模型与模型已有的信念结合起来。
设模型对差值 的信念为高斯分布 :最佳猜测为 ,不确定性为 。回答服从概率单位模型式(16.2),每个选项上的噪声为 ;记 为差上的噪声。提问之前,模型把选择概率在其信念上取平均,以此预测回答。
模型自身的不确定性叠加在人的噪声之上。对于模型不确定的一对选项,预测值比模型已知差值时更接近二分之一。第 18.3 节正是用这一公式,由高斯过程后验预测新的比较。
回答能提供多少信息?回答之所以不确定,有两个原因:模型不知道 ;即使知道,人也有噪声。只有第一种不确定性可以通过提问减少,因此回答所携带的关于 的信息,等于总不确定性减去噪声部分:
其中 是概率为 的是非回答的熵(以比特计),期望对信念 取。第一项是预测回答的熵;第二项是已知 时回答仍保留的熵,在模型认为合理的取值上取平均。这一分解是 Houlsby 等人(2011)提出的贝叶斯分歧主动学习(Bayesian active learning by disagreement)准则的基础,他们也将其用于偏好学习:信息量最大的问题,是模型无法预测其答案、而模型若知道真相就能预测其答案的问题。
由图可以看出,为什么有两类选项对几乎提供不了信息。可以做以下尝试:
- 已知的近似平局。把均值设为零,并缩小信念的离散程度 。预测的回答如同掷硬币,有整整 1 比特的不确定性,但几乎全部来自人的噪声。回答几乎不携带信息,、 时只有 0.006 比特,因为模型已经知道两个选项几乎相等。
- 已知的差距。把均值移到远离零处。回答已成定局,两个熵都降向零,信息也随之降向零:、、 时约为 0.02 比特。
- 悬而未决的问题。均值接近零、离散程度相对于噪声很大时,模型无法预测回答,而若知道 就能预测。这正是值得提问的比较:、、 时约为 0.6 比特,并随着噪声消失升向整整 1 比特。
- 噪声大的人。增大 。点线向虚线靠拢,每次比较提供的信息都更少。噪声无法靠设计消除,它决定了每个回答的代价。
因此,最有用的比较是把模型不确定其顺序的选项配成一对,这种不确定要相对于人的噪声来衡量。第 19.3 节与第 19.4 节中的采集规则,以及第 20 章中的查询设计,背后都是这一直觉。
每个回答的比特数较少,并不一定意味着学习更慢。针对在 Thurstone 模型与 Bradley-Terry 模型下估计一组固定选项效用的问题,Shah 等人(2016)证明了极小极大界,即任何方法在最坏情况下所能保证的最佳误差。他们发现,误差依赖于比较图的拓扑(哪些对被比较过),这种依赖通过图 Laplace 矩阵的特征值体现,图 Laplace 矩阵记录了哪些对被比较过;他们还发现,在相差常数因子的意义下,序数设定与基数设定的误差率具有相同的标度。每次比较携带的信息少于一次数值测量,但误差随数据增多而缩小的速率相同(推断)。第 18.5 节解释了比较图是什么,以及为什么其结构对高斯过程效用同样重要。
一个相关结果削弱了链接函数的作用。对于根据带噪声的比较主动为一组物品排序的问题,Heckel 等人(2019)证明,一种不假设任何参数模型的简单计数方法在相差对数因子的意义下是最优的,因此 Bradley-Terry 或 Thurstone 这类参数假设至多带来对数级的增益。这提示偏好贝叶斯优化的样本效率主要来自核函数在相近输入之间共享信息,而不是来自链接的确切形式(推断)。
设计参数越多,这一点越突出。比较两种在四个参数上不同的外骨骼步态(Li 等,2021),或比较由九个参数控制的两种三维网格简化结果(Ou 等,2022),仍然至多得到 1 比特,而需要区分的设计数量却随参数个数指数增长。有人参与的会话很少超过几十次比较(第七部分),因此任何选择模型都无法从一次会话中提取超过几十比特的信息。其余信息只能来自两方面:关于效用如何在设计空间中变化的假设,即第 18 章的核函数;以及选择哪些对来提问,这是第 19 章的主题(推断)。
第 16.6 节引用的文献 5
- Houlsby 等人(2011)Bayesian Active Learning for Classification and Preference Learning
- Shah 等人(2016)Estimation from Pairwise Comparisons: Sharp Minimax Bounds with Topology Dependence
- Heckel 等人(2019)Active ranking from pairwise comparisons and when parametric assumptions do not help
- Li 等人(2021)ROIAL: Region of Interest Active Learning for Characterizing Exoskeleton Gait Preference Landscapes
- Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures
16.7 需要留意的假设 #
本章的每个模型,以及第 18 章在其基础上构建的高斯过程偏好模型,都对作答者做了假设。这些假设是合理的出发点,而且每一个都经过了检验。表 16.1 列出了这些假设及相应证据;表后各段补充表格容纳不下的内容。
| 假设 | 证据表明 | 本书何处再谈 |
|---|---|---|
| 每个回答背后都是同一个稳定的效用 | 选择会改变偏好:对 43 项排除了伪影的研究所做的元分析发现,偏移为 个标准差 | 第 37.2 节、第 46.5 节 |
| 给定效用时,各回答相互独立 | 选择与评分依赖于先前的试次 | 第 37.3 节 |
| 偏好满足传递性 | 大多数人符合随机效用;特定设计中存在真正的循环 | 第 37.4 节、第 21 章 |
| 每一对的噪声都相同 | 噪声的设定方式会改变推断出的偏好 | 第 37.4 节、第 27.2 节 |
| 每一次强制选择都反映偏好 | 即使两份样品完全相同,人们也会报告偏好 | 第 20.4 节 |
| 选择不依赖于其他选项 | 情境效应存在,但有条件 | 第 37.2 节、第 20.1 节 |
| 效用量表在不同会话之间固定不变 | 价值会适应最近的范围 | 第 37.3 节 |
稳定性。这些模型把人看作固定的效用加上噪声。但选择本身会改变人的喜好。一项元分析汇总了 43 项采用自由选择范式、并排除了已知伪影的研究(N = 2,191),发现人们在两个相似选项之间做出选择后,会把选中的选项评得更高,把放弃的选项评得更低,效应量为 ,即偏移 0.40 个标准差(95% 置信区间为 0.32 至 0.49),且没有发表偏倚的证据(Enisman 等,2021)。序贯抽样的解释说明了部分机制:每次选择都会提高被选选项的价值、降低被放弃选项的价值,而同一对选项之间重复选择的一致性,会随间隔试次的增多而下降(Zylberberg 等,2024)。因此,不断展示当前最爱选项的优化器,可能正在强化这一偏爱(推断)。
独立性。似然把各个回答的概率相乘,仿佛每个回答都是一次全新的抽取。刚才描述的序列依赖,以及第 16.1 节中评分的序列效应,都表明回答在一定程度上依赖于此前的经历。这些效应在平均意义上可靠,但在个体内部不稳定(Kramer 与 Cartledge,2026),因此难以逐人校正。
传递性。带独立噪声的随机效用模型在概率意义上满足传递性:如果 通常胜过 , 通常胜过 ,那么 通常胜过 。直接检验大多支持这一点(McCausland 等,2020),但观察到的循环并非都是噪声。一篇 2023 年的工作论文利用反应时把噪声与偏好区分开,发现传递性违反会减少,但不会消失:在两个重新分析的数据集中,按被试平均,带有显示偏好的循环分别有 19.24% 和 13.83% 属于违反,最常见的来源是属性之间一连串的小权衡(Alós-Ferrer 等,2023)。依照 Steinhaus-Trybula 悖论设计的彩票同样显示,即使考虑了带噪声的传递偏好,循环仍是最常见的模式(Butler 与 Pogrebna,2018)。第 21 章讨论在不存在效用时还能优化什么。
同质噪声。第五种情形与 logit 模型对每一对都赋予相同的噪声。在风险选择中,噪声的设定方式会改变推断结果:把偏好中的噪声与作答中的噪声结合起来,可能使期望值最大化者看起来厌恶风险或寻求风险(Bhatia 与 Loomes,2017);而在同质噪声下,推断出的风险厌恶可能呈现非单调性,Apesteguia 与 Ballester(2018)因此转而推荐随机参数模型。第 27.2 节列出了允许噪声变化的偏好模型。
强制选择。对决不提供“都不”或“我分不出来”这样的选项。在感官科学中,消费者即使被要求在两份相同的样品之间做选择,仍会报告偏好,这正是该领域转而采用“无偏好”选项和安慰剂对的原因(O'Mahony 与 Wichchukit,2017)。第 20.4 节讨论允许平局的似然。
情境与量表。这些模型假设两个选项之间的选择不依赖于此前还看到过什么,并假设效用量表在每次会话中都相同。第 16.4 节中的情境效应和第 16.2 节中的范围适应都与此相悖。如果一个人的价值按一次会话中所见的范围归一化,那么在这次会话中学到的效用就处在该会话特有的量表上,在另一次会话中复用时需要重新校准(推断)。
这并不意味着使用这些模型是错误的,而是意味着模型的输出是在可检验假设下的估计。检验的办法包括:在会话后期重复几对早期出现过的选项,允许平局,随机安排选项出现在哪一侧,以及把拟合出的噪声水平与观察到的回答反转率相比较。第九部分探讨了这些检验背后更深层的问题:重复的比较是发现了偏好,还是在一定程度上制造了偏好(第 45 章)。
第 16.7 节引用的文献 9
- Enisman 等人(2021)Choice changes preferences, not merely reflects them: A meta-analysis of the artifact-free free-choice paradigm
- Zylberberg 等人(2024)Value construction through sequential sampling explains serial dependencies in decision making
- Kramer 与 Cartledge(2026)Sequential effects in facial attractiveness judgements: No evidence of stable individual differences
- McCausland 等人(2020)Testing the Random Utility Hypothesis Directly
- Alós-Ferrer 等人(2023)Identifying Nontransitive Preferences
- Butler 与 Pogrebna(2018)Predictably intransitive preferences
- Bhatia 与 Loomes(2017)Noisy preferences in risky choice: A cautionary note
- Apesteguia 与 Ballester(2018)Monotone Stochastic Choice Models: The Case of Risk and Time Preferences
- O'Mahony 与 Wichchukit(2017)The evolution of paired preference tests from forced choice to the use of‘No Preference’options, from preference frequencies to d′ values, from placebo pairs to signal detection
16.8 习题 #
在一次口味测试中, 在 75% 的试次中胜过 , 在 75% 的试次中胜过 , 在 84% 的试次中胜过 。在第五种情形下取 ,把三个选项放到同一个量表上,并检验三个比例是否与之一致。标准差匹配的逻辑模型对 与 的比较会给出什么预测?
解答
由式(16.2),。如果量表一致,则 ,第五种情形预测 。观测到的 84% 更低,因此各段差距加不起来:要么不同对之间的噪声不同(第一至第四种情形允许这一点),要么这些比例是带噪声的估计。标准差匹配时,逻辑模型的尺度为 ,于是 对 的概率为 ,与概率单位模型几乎相同。在曲线中部,两种链接几乎无法区分,这样的检验分辨不出二者。
把逻辑链接的推导推广到 个选项。设 ,其中噪声为尺度 的独立标准 Gumbel 噪声。证明选项 的感知效用最大的概率为 ,即 Luce 规则式(16.5)。
解答
以 为条件。当对每个 都有 时,选项 1 获胜;由独立性,其概率为 。与前面一样代换 ,使 ,并记 。概率为 。分子分母同乘 ,即得 。
利用式(16.7)证明,一次比较携带的信息在以下情况下趋于零:(a)对任意固定的 与 ,;(b)对固定的 与 ,。再证明当 、 固定且 时,信息趋于 1 比特。
解答
(a)当 时,信念集中于 ,所以第二项中的期望趋于 ;由于 ,第一项也趋于同一值。两者之差趋于零。(b)当 增大时, 趋于 0 或 1,所以第一项趋于零;第二项非负且不大于第一项(因为信息永不为负),所以它也趋于零。(c)当 时,对任意 ,第一项都是 比特。当 时,对每个 , 都趋于 0 或 1,所以第二项趋于零,信息趋于 1 比特:差的符号如同公平硬币时,一个无噪声的回答恰好值 1 比特。
延伸阅读 #
- Thurstone(1927)篇幅短小、易于阅读;文中定义了辨别过程,陈述了比较判断律,并列出了五种情形。
- Bradley 与 Terry(1952)提出了如今以他们命名的成对比较模型;Luce(1959)发展了选择公理及其推论;Plackett(1975)将其推广到排序。
- McFadden(1974)由带 Gumbel 噪声的随机效用推导出条件 logit 模型;Yellott(1977)把 Luce、Thurstone 与双指数分布联系起来。
- Miller(1956)是经典论述,说明绝对判断携带的信息何其有限,以及相对判断为何有帮助。
- Fechner(1860)与 Stevens(1957)代表了一场争论的两方:用辨别还是用直接给出的数值来测量感觉。
- Shah 等人(2016)与 Shah 等人(2014)分别从理论上和众包实验中比较了序数测量与基数测量。
- Houlsby 等人(2011)推导了第 16.6 节中的信息准则,并将其应用于偏好学习。
参考文献
- (2023). Identifying Nontransitive Preferences. University of Zurich. 工作论文引用于 §16.7
- (2018). Monotone Stochastic Choice Models: The Case of Risk and Time Preferences. Journal of Political Economy. 引用于 §16.7
- (2025). A systematic review and meta-analyses of the temporal stability and convergent validity of risk preference measures. Nature Human Behaviour. doi:10.1038/s41562-024-02085-2. 引用于 §16.1
- (2018). Reference-point centering and range-adaptation enhance human reinforcement learning at the cost of irrational preferences. Nature Communications. 引用于 §16.2
- (2017). Noisy preferences in risky choice: A cautionary note. Psychological Review. 引用于 §16.7
- (1952). Rank Analysis of Incomplete Block Designs: I. The Method of Paired Comparisons. Biometrika. 引用于 §16.4
- (2022). Can Market Participants Report Their Preferences Accurately (Enough)? Management Science. 引用于 §16.1
- (2018). Predictably intransitive preferences. Judgment and Decision Making. 引用于 §16.7
- (2017). Sequential effects in preference decision: Prior preference assimilates current preference. PLOS ONE. 引用于 §16.1
- (2005). Preference learning with Gaussian processes. Proceedings of the 22nd international conference on Machine learning - ICML '05. 引用于 §16.3
- (2021). Assessing Top- Preferences. ACM Transactions on Information Systems. 引用于 §16.1
- (2021). Choice changes preferences, not merely reflects them: A meta-analysis of the artifact-free free-choice paradigm. Journal of Personality and Social Psychology. 引用于 §16.7
- (1860). Elemente der Psychophysik. Breitkopf und Härtel. 引用于 §16.2
- (2019). Active ranking from pairwise comparisons and when parametric assumptions do not help. The Annals of Statistics. 引用于 §16.6
- (1910). The Central Tendency of Judgment. The Journal of Philosophy, Psychology and Scientific Methods. 引用于 §16.1
- (2011). Bayesian Active Learning for Classification and Preference Learning. arXiv. 预印本引用于 §16.6
- (2018). Computational Design with Crowds. Computational Interaction. 引用于 §16.1
- (2026). Sequential effects in facial attractiveness judgements: No evidence of stable individual differences. Perception. 引用于 §16.1 §16.7
- (2021). ROIAL: Region of Interest Active Learning for Characterizing Exoskeleton Gait Preference Landscapes. ICRA 2021. 引用于 §16.6
- (2016). The appropriacy of averaging in the study of context effects. Psychonomic Bulletin & Review. 引用于 §16.4
- (1959). Individual Choice Behavior: A Theoretical Analysis. Wiley. 引用于 §16.4
- (2020). Testing the Random Utility Hypothesis Directly. The Economic Journal. doi:10.1093/ej/uez039. 引用于 §16.5 §16.7
- (1974). Conditional Logit Analysis of Qualitative Choice Behavior. Frontiers in Econometrics. 引用于 §16.5
- (2026g). BoTorch pairwise likelihood source code likelihoods/pairwise.py. GitHub. 软件引用于 §16.5
- (1956). The magical number seven, plus or minus two: Some limits on our capacity for processing information. Psychological Review. 引用于 §16.1
- (2017). The evolution of paired preference tests from forced choice to the use of‘No Preference’options, from preference frequencies to d′ values, from placebo pairs to signal detection. Trends in Food Science & Technology. 引用于 §16.7
- (2022). The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures. Mensch und Computer 2022. 引用于 §16.1 §16.6
- (1975). The Analysis of Permutations. Journal of the Royal Statistical Society: Series C (Applied Statistics). 引用于 §16.4
- (2014). When is it Better to Compare than to Score? arXiv. 预印本引用于 §16.1
- (2016). Estimation from Pairwise Comparisons: Sharp Minimax Bounds with Topology Dependence. Journal of Machine Learning Research. 引用于 §16.6
- (2018). When the Good Looks Bad: An Experimental Exploration of the Repulsion Effect. Psychological Science. 引用于 §16.4
- (2021). The elusiveness of context effects in decision making. Trends in Cognitive Sciences. 引用于 §16.4
- (1957). On the Psychophysical Law. Psychological Review. 引用于 §16.2
- (1927). A Law of Comparative Judgment. Psychological Review. 引用于 §16.1 §16.3
- (2019). Decision contamination in the wild: Sequential dependencies in online review ratings. Behavior Research Methods. 引用于 §16.1
- (2022). Discrete choice experiment with duration versus time trade-off: a comparison of test–retest reliability of health utility elicitation approaches in SF-6Dv2 valuation. Quality of Life Research. 引用于 §16.1
- (1977). The relationship between Luce's Choice Axiom, Thurstone's Theory of Comparative Judgment, and the double exponential distribution. Journal of Mathematical Psychology. 引用于 §16.5
- (2024). Value construction through sequential sampling explains serial dependencies in decision making. eLife. doi:10.7554/eLife.96997. 引用于 §16.7