设计、感官科学、艺术与健康
前两章探讨了偏好从何而来,以及一组比较能为模型提供哪些信息。本章转向以询问人们对设计物的看法为业的学科,涉及设计师与工程师、建筑师与规划师、组织消费者评审小组的食品科学家、音乐与视觉美学的研究者,以及在治疗决策前引出患者优先事项的健康研究者。其中许多学科几十年来一直在大规模地应对测量问题,偏好贝叶斯优化在每项用户研究中遇到的也正是这些问题。它们最可迁移的答案,是感官科学的安慰剂对(第 44.5.1 节)。本章最后汇总偏好贝叶斯优化无需新理论即可从本书这一部分采用的方法(第 44.9 节)。
44.1 设计研究 #
设计研究长期以来把创造力描述为问题与解决方案的协同演化(co-evolution):设计师在设计过程中发现自己想要什么(Dorst 与 Cross,2001)。但“协同演化”指的是一族不同的概念:有的指问题与解决方案相互改变,有的只指注意力在两者之间交替。而且,类似的并行过程见于各种创造性工作,因此协同演化看来是创造性工作的一般特征,并非设计所特有(Crilly,2021a;Crilly,2021b)。产品创新方法的情况更糟。Kano 模型(Kano model)把产品属性分为“必备”属性与“魅力”属性。Chapman 与 Callegaro(2022)让 1,501 人在几秒之内两次回答该模型的同一条目,只有 39% 的人再次给出相同的“期望”回答;这是一篇在从业者会议上报告的工作论文,未经同行评审。
设计固着是最明确的新证据。设计固着(design fixation)指沿用自己见过的范例特征的倾向,即使这些特征有缺陷,或任务要求的是新东西。在一项以新手工程师为对象的大型实验中,Leahy 等人(2020)向一半学生展示给定的范例,让另一半学生自行提出第一个概念。看过范例的学生对范例的固着,反而少于对照组学生对自己第一个概念的固着。这修正了 Jansson 与 Smith(1991)的经典实验,该实验一直假定对照条件不存在固着。在一项被试间实验()中,Wadinambiarachchi 等人(2024)发现,构思阶段使用人工智能图像生成器的被试,对初始范例的固着更强,产生的想法更少、更单一、更缺乏原创性;这些效应取决于被试撰写提示词与构思的方式。另一项研究考察设计师如何与优化器协作(Mo 等,2024):18 名被试中有 12 名更偏好设计师与优化器合作的模式,由优化器主导的模式带来的控制感最低(比较第 32.2 节)。
对偏好贝叶斯优化的含义。偏好贝叶斯优化的画廊是系统提供的一系列范例;若将其用于构思而非调节参数,应当预期会出现 Wadinambiarachchi 等人观察到的固着与多样性丧失(推断)。当前最优点即用户上一次选中的设计,相当于设计师自己的第一个概念,可能锚定之后的比较(推断)。选择本身会改变价值,这使锚定的可能性更大:在一个针对重复食物选择拟合的再评价模型中,每次选择都使被选零食的价值提高约 0.18 美元,并使被拒零食的价值降低同样的幅度(Zylberberg 等,2024)。定期与并非由当前最优点衍生的多样化设计相比较,是一种实用的检查(推断)。Kano 模型中的“必备”属性是带阈值的效用,更适合表示为约束或铰链形分量(第 14.4 节),但 Kano 分类过于不可靠,不能用作硬性先验(推断)。我们没有找到测量偏好贝叶斯优化会话内固着的研究,例如与看到随机画廊的对照组相比较的研究。
第 44.1 节引用的文献 9
- Dorst 与 Cross(2001)Creativity in the Design Process: Co-Evolution of Problem-Solution
- Crilly(2021a)The Evolution of“Co-evolution”(Part I): Problem Solving, Problem Finding, and Their Interaction in Design and Other Creative Practices
- Crilly(2021b)The Evolution of“Co-evolution”(Part II): The Biological Analogy, Different Kinds of Co-evolution, and Proposals for Conceptual Expansion
- Chapman 与 Callegaro(2022)Kano Analysis: A Critical Survey Science Review
- Leahy 等人(2020)Design Fixation From Initial Examples: Provided Versus Self-Generated Ideas
- Jansson 与 Smith(1991)Design Fixation
- Wadinambiarachchi 等人(2024)The Effects of Generative AI on Design Fixation and Divergent Thinking
- Mo 等人(2024)Cooperative Multi-Objective Bayesian Design Optimization
- Zylberberg 等人(2024)Value construction through sequential sampling explains serial dependencies in decision making
44.2 建筑学 #
人们常认为建筑学中存在普遍的空间偏好,由此有人建议把普遍的“好”作为先验编码,与个人偏好分开。Jay Appleton 的瞭望庇护理论(prospect-refuge theory)认为,人们偏爱能看见他人而不被他人看见的地方;这一理论得到的定量支持并不一致。一项针对 34 项定量研究的元分析发表于本部分所覆盖时期稍早之前(Dosen 与 Ostwald,2016),发现瞭望在 31 次检验中的 19 次(61%)得到支持,庇护在 27 次检验中只有 8 次(30%)得到支持;论文自身总结中的 53% 与 22%,是这两个因素在 36 项支持性发现中所占的比例,而不是支持率。庇护主要在自然环境的研究中得到支持(景观研究中 8 次检验有 5 次,室内研究中 17 次有 2 次);在 29 项有调查结果的研究中,有 16 项的被试不超过 20 人。感知维度的情况好一些:Coburn 等人(2020)让 798 名被试在 16 个量表上为 200 张室内图像评分,连贯性、吸引力与家居感三个成分解释了评分方差的 90%;这一结构在独立样本()中得到了复现。
共享的品味与个人的品味。2017 年以来的关键结果出自 Vessel 等人(2018)。个体之间的一致性,在面孔与景观上较高,在建筑外观、建筑室内与艺术品上较低。被试内比较显示,景观上的一致性显著高于建筑外观,而每个人自身评分的信度在两者之间没有差异。作者提出,对自然类事物的品味是共享的,对文化人造物的品味则因人而异。专业知识使品味进一步分化:年轻建筑师与匹配的外行为捷克独栋住宅评分,总体均值相同(5.08 对 5.09),但建筑师给现代住宅与木屋的评分更高,给目录式住宅与“麦氏豪宅”(McMansions)的评分更低(Šafárová 等,2019)。
对偏好贝叶斯优化的含义。一致性低而信度相同,意味着基于群体平均的先验对个人的建筑品味几乎没有指导作用。建筑主要需要逐人学习,景观或面孔则可以更多地借助群体数据;因此,在信息性群体先验与弱先验之间如何选择,取决于领域(推断;第 31.2 节)。把代理模型定义在少数几个感知维度上,而不是几十个原始几何参数上,可以降低有效维度(推断;第 30 章)。建筑师替客户运行偏好贝叶斯优化时,除非客户也在回路中,否则优化的是建筑师本人的效用(推断)。鉴于人们对建筑的一致性很低,不应把普遍的建筑之“好”编码为先验(推断)。
第 44.2 节引用的文献 4
- Dosen 与 Ostwald(2016)Evidence for prospect-refuge theory: a meta-analysis of the findings of environmental preference research
- Coburn 等人(2020)Psychological and neural responses to architectural interiors
- Vessel 等人(2018)Stronger shared taste for natural aesthetic domains than for artifacts of human culture
- Šafárová 等人(2019)Differences between young architects' and non-architects' aesthetic evaluation of buildings
44.3 城市规划 #
城市感知调查是机器学习之外规模最大的成对视觉比较实际应用。这类调查以 Place Pulse 2.0(Dubey 等,2016)为基础,该数据集沿“更安全”“更有活力”等维度收集了街景图像之间的比较。Quintana 等人(2025)(方法细节见其 arXiv 版本)让来自五个国家、在人口统计学上均衡的 1,000 名被试每人做 50 次成对比较,并提供“两者对我来说一样”这一选项。他们用赛程强度(Strength of Schedule)方法为图像评分,该方法按被战胜图像的强弱为每次获胜记分;选用它是因为每张图像所需的比较次数少于 TrueSkill 评分系统(4 次对 22 至 29 次)。组间差异最多来自性别,“安全”维度上尤其如此;在 Place Pulse 上训练的视觉 Transformer 相对于人类评分,高估了“有活力”等正面指标。在参与式预算(participatory budgeting)中,居民决定如何使用一部分公共预算。Benade 等人(2017)(期刊版本见 Benadè 等,2021)发现,阈值认可(threshold approval)投票,即每位投票者认可对自己价值超过某一阈值的项目,在失真(distortion,即只有序数信息可用时,所选结果的福利比可能的最好结果低多少)与遗憾两方面,定性上都优于背包投票与价值排序。
对偏好贝叶斯优化的含义。聚合异质群体的成对判断,会使学到的得分产生偏差,并掩盖子群体之间的差异;因此,面向群体或公共事务的偏好贝叶斯优化,应当对应答者的协变量建模,或为每个群体分别保留代理模型(推断;第 20.5 节)。城市调查把明确的无差异选项视为标准配置,强制选择界面则丢弃了这一信号(推断;第 20.4 节)。有多个利益相关方时,查询形式是一个会产生社会选择后果的设计变量(推断;第 40.7 节)。
第 44.3 节引用的文献 4
- Dubey 等人(2016)Deep Learning the City: Quantifying Urban Perception at a Global Scale
- Quintana 等人(2025)Global urban visual perception varies across demographics and personalities
- Benade 等人(2017)Preference Elicitation For Participatory Budgeting
- Benadè 等人(2021)Preference Elicitation for Participatory Budgeting
44.4 材料与工程设计 #
工程设计领域产生过偏好贝叶斯优化的一个直接前身:Ren 与 Papalambros(2011)把设计偏好引出表述为优化问题,在汽车外观造型的用户测试中,结合使用支持向量机与高效全局优化。2017 年以来,Kanarik 等人(2023)在受控的虚拟工艺游戏中,比较了人类工程师与贝叶斯优化算法设计半导体等离子体刻蚀工艺的表现。人类在早期表现良好;在接近严格公差时,算法的成本效率高得多;“人先、计算机后”的策略使达到目标的成本比只靠人类时降低一半。Nandy 与 Goucher-Lambert(2025)用交互式贝叶斯优化,为每位被试()优化参数化马克杯的感知舒适度,优化或从零开始,或从更早一组被试()的数据出发;交互式模型在对齐意图与生成设计方面优于非交互式模型。2025 年的一篇论文(Huber 等,2025)根据成对比较,为决策者在 Pareto 集上的效用构建了贝叶斯模型,在多达九个目标的问题上做了测试,并公开了代码。
对偏好贝叶斯优化的含义。工作流程应当规划从人到算法的交接,而不是自始至终采用单一模式;但 Kanarik 等人的证据针对的是有客观指标的专家搜索,能否迁移到由品味驱动的设计尚不确定(推断;比较第 23.4 节)。在预先计算的 Pareto 前沿上做成对采集,是多目标优化之后引入设计师偏好的一种实用方式(第 14.5 节、第 40.11 节)。
第 44.4 节引用的文献 4
- Ren 与 Papalambros(2011)A Design Preference Elicitation Query as an Optimization Process
- Kanarik 等人(2023)Human–machine collaboration for improving semiconductor process development
- Nandy 与 Goucher-Lambert(2025)Exploring the Effectiveness of Interactive Preference Learning for Adapting Designs to Abstract Semantic Attributes
- Huber 等人(2025)Bayesian Preference Elicitation for Decision Support in Multi‐Objective Optimization
44.5 食品与感官科学 #
食品科学家长期对消费者做成对偏好测试(O'Mahony 与 Wichchukit,2017)。对于人们被问及“你更喜欢哪一个?”时如何作答,他们发现了一些令人不安的情况。有一项著名的结果需要先审慎看待。在 Morrot 等人(2001)的研究中,白葡萄酒用无味染料染成红色后,54 名品酒者(波尔多的酿酒学学生)用描述红葡萄酒的嗅觉术语来描述它。有一种解读认为,颜色完全压倒了化学感觉信息,这对偏好数据是毁灭性的。这一效应确实存在,也得到了概念性复现,但当时的任务是选择描述词,而不是陈述偏好或喜爱程度。在 Wang 与 Spence(2019)的研究中,有葡萄酒经验的被试认为,染成桃红色外观的白葡萄酒与桃红葡萄酒的相似程度,远高于它与完全相同的白葡萄酒的相似程度;然而,这款染色酒的受喜爱程度低于两种真酒中的任何一种,被试也觉得它有些不同。Spence(2020)综述了环境光颜色、背景音乐等情境因素对品尝的影响,这些影响深刻,有时可以预测。
44.5.1 成对偏好测试与安慰剂对 #
对偏好贝叶斯优化最有用的经验,是成对偏好测试的方法论。O'Mahony 与 Wichchukit(2017)回顾了这一方法的历史。最先采用的是强制选择,因为其二项统计很简单,但消费者因此无法表示“无偏好”。后来发现,消费者会在本应完全相同的刺激之间报告偏好,于是安慰剂对(placebo pairs),即由两个相同样本组成的对,成为对照条件。奠基性的研究把这一发现写进了标题:“消费者在不应有偏好时报告了偏好”(Consumers report preferences when they should not)(Marchisano 等,2003)。频次指标(选择每个样本的消费者人数)后来又辅以信号检测论中的辨别力指数 ,即两个刺激之间的感知距离,以感知噪声的标准差为单位;这一指数能更准确地度量偏好的强度。
感官科学用 Thurstone 模型(Thurstonian models)解读这类数据,偏好贝叶斯优化所用的正是这一模型(第 16.3 节)。带“无偏好”选项的成对偏好测试,在技术上等同于 2-AC 方案(“两个备选项,另设一个无差别选项”)。其 Thurstone 模型有两个参数:两个刺激之间的距离 ,以及决策阈值 ,感知差异低于该阈值时,人报告无偏好。这一模型与累积概率单位模型密切相关,后者即第 27.2 节中的序数似然(Christensen 等,2012)。
- 在第 16.3 节的 Thurstone 模型中,人对两个选项的感知,都是在各自效用之上叠加标准差为 的独立高斯噪声,因此感知到的差异为 ,其中 为真实差异。
- 在 2-AC 模型中,若 ,人报告“无偏好”;否则偏好 所支持的选项。
- 安慰剂对的 。由高斯分布的对称性,人仍然陈述偏好的概率为 。
- 解出阈值,得 。虚假偏好率 对应 ;强制选择界面的 ,按其构造必然有 。
- 因此,安慰剂对识别的是此人相对于自身噪声的平局阈值。带平局的偏好贝叶斯优化似然恰恰需要这个量,而它无法从强制选择中学到。
在图 44.1 中,读者可以做一次带安慰剂对的简短成对偏好测试。请像参加研究那样作答,作答完毕再看结果。
值得留意以下几点:
- 在成对测试中,消费者常在相同的样本之间陈述偏好(Marchisano 等,2003);可以核对你自己是否也是如此。你在相同的对上陈述的每个偏好都是“虚假偏好”:在偏好贝叶斯优化会话中,它会作为一个设计胜过另一个设计的证据进入似然。
- 若你的虚假偏好大多给了同一侧,回答就带有位置偏差;只要左右位置平衡,似然就可以用左右位置项(式(43.1))吸收这一偏差。
- 大多数偏好贝叶斯优化研究默认采用强制选择界面,这种界面会把每个相同的对都记录为一次偏好。
有几项研究对这一方法作了改进。Halim 等人(2020)发现,把安慰剂对放在目标对之后,会提高“无偏好”回答的比例,但并不总是显著。Xia 等人(2020)发现,对某些产品,这一效应较弱,因为同一产品的样本之间差异很大,“相同”的对其实并不真正相同。信度方面,Nijman 等人(2022)让 62 名被试在酒吧与集中场所测试中各参加两场,为一款啤酒的喜爱程度及其唤起的十种情绪评分。组内相关系数(intraclass correlation coefficient,ICC)在此指评分方差中由被试之间的稳定差异(而非场次之间的噪声)造成的比例。在全部十一项评分上,ICC 在酒吧中平均为 0.66(±0.1),在集中场所测试中平均为 0.60(±0.15);单看喜爱程度,ICC 在 0.58 至 0.76 之间。
对偏好贝叶斯优化的含义。偶尔呈现相同的对,即同一设计出现两次,就能估计用户的虚假偏好率;允许平局回答,并用平局与安慰剂数据拟合概率单位似然中的噪声项或失误项,可以校准模型。感官科学中的 Thurstone 模型就是偏好贝叶斯优化的概率单位似然,因此这种迁移在数学上是直接的, 也不过是以噪声标准差为单位的效用差(推断)。“相同”的对必须真正相同,即使用同一随机种子与同样的渲染,否则安慰剂即受到污染(推断)。享乐评分的重测相关约为 0.6 至 0.7,这为感官刺激跨会话的一致性提供了合理的预期;若偏好贝叶斯优化的后验远比这更有把握,很可能是对单次会话过拟合了(推断)。
第 44.5 节引用的文献 9
- O'Mahony 与 Wichchukit(2017)The evolution of paired preference tests from forced choice to the use of‘No Preference’options, from preference frequencies to d′ values, from placebo pairs to signal detection
- Morrot 等人(2001)The Color of Odors
- Wang 与 Spence(2019)Drinking through rosé-coloured glasses: Influence of wine colour on the perception of aroma and flavour in wine experts and novices
- Spence(2020)Wine psychology: basic & applied
- Marchisano 等人(2003)Consumers report preferences when they should not: a cross-cultural study
- Christensen 等人(2012)Estimation of the Thurstonian Model for the 2-AC Protocol
- Halim 等人(2020)Paired preference tests and placebo placement: 1. Should placebo pairs be placed before or after the target pair?
- Xia 等人(2020)Paired preference tests and placebo placement: 2. Unraveling the effects of stimulus variance
- Nijman 等人(2022)The stability of self-reported emotional response and liking of beer in context
44.6 经验美学与音乐 #
经验美学有几条广为人知的原理。Berlyne 的 Wundt 曲线(Wundt curve)认为,喜爱度在中等复杂度或中等新颖度处达到峰值;加工流畅性(processing fluency)则认为,刺激越容易加工,所得评价越正面。倒 U 形在群体层面得到了充分支持:Chmiel 与 Schubert(2017)综述的 57 项音乐研究中,有 50 项(87.7%)符合复杂度或唤醒度与喜爱度之间的(分段)倒 U 形关系,不过作者指出,这一模型可能与 Berlyne 的唤醒机制并不吻合。然而,Güçlütürk 等人(2016)根据 30 名被试对灰度图像的评分表明,群体的倒 U 形由两簇人组成:一簇人的喜爱度随复杂度下降,另一簇则随复杂度上升。图 44.2 展示了两类单调变化的个体如何合成一个任何个体都不具有的倒 U 形。
两组各占一半时,总体在复杂度 0.5 附近达到峰值;位于该处的设计带给每组的喜爱度,只有针对该组的设计的约 70%。把“喜爱度上升者的比例”调到 25%,上升组成为少数,此时少数群体只得到其最佳水平的约三分之一。
流畅性的作用也并非一律正面。Graf 与 Landwehr(2017)发现,对椅子与灯具,流畅性经由愉悦感影响吸引力,在自动加工下尤其如此;在控制加工下,不流畅的设计则可以通过引发兴趣而获得吸引力。愉悦还取决于此前出现过什么。Cheung 等人(2019)用机器学习模型量化了美国 Billboard 流行歌曲中 80,000 个和弦的不确定性与意外度:和弦在低不确定性的情境中令人意外,或在高不确定性的情境中不令人意外时,最令人愉悦。关于重复,证据相互矛盾。Gold 等人(2019)发现,刺激重复 7 次会降低喜爱度,但不会消除对中等复杂度的偏好;在 Madison 与 Schiölde(2017)的研究中,40 首陌生乐曲在约 4 周内每首聆听 28 次,喜爱度在每个复杂度水平上都单调上升。时间尺度以及聆听是否出于自愿,或许可以解释这一差异,但尚无研究解决这一问题。
2017 年以来:一种关于审美价值的计算理论。Brielmann 与 Dayan(2022)提出的模型中,观察者的感觉认知状态是关于刺激的生成模型,审美价值由两部分组成:一是即时的感觉奖励,即刺激的流畅性,以刺激在当前状态下的似然度量;二是这一状态向长期预期的刺激分布靠近或远离时,预期未来奖励的变化。Brielmann 等人(2024)让 59 名被试为 55 张经变形合成的狗的图像评分。采用深度卷积网络 VGG-16 特征的个体模型,对逐试次喜爱度的刻画达到中位数 0.65 的相关系数,总体平均则只有 0.01;对实际的呈现顺序,学习成分比对模拟的随机顺序平均多解释 17% 的方差。
对偏好贝叶斯优化的含义。在 Brielmann-Dayan 模型中,每看到一个刺激,观察者的状态都会更新,因此潜在效用既是刺激的函数,也是由查询序列驱动的状态的函数:在偏好引出中,每次查询同时也是一次写入(推断;第 42.2 节)。画廊的顺序是刺激的一部分;多次展示当前最优点,可能降低也可能提高其价值,取决于时间尺度(推断)。对个性化内容,个体模型大幅胜过总体平均(0.65 对 0.01),因此必须为每个用户分别建立代理模型,深度网络特征可以用作输入空间(推断)。总体层面的倒 U 形可能是相反的单调偏好的混合;因此,主张采集函数以最佳新颖度区间为目标的提议,其前提是每个人都有倒 U 形,而这一点并未确立(推断)。快速的画廊式判断可能偏向流畅、典型的设计,较慢的比较则可能偏向有趣的设计(推断)。Brielmann 与 Dayan 那样的观察者状态模型,可以用来刻画偏好贝叶斯优化代理模型的非平稳性(第 46.5 节)(推断)。
第 44.6 节引用的文献 8
- Chmiel 与 Schubert(2017)Back to the inverted-U for music preference: A review of the literature
- Güçlütürk 等人(2016)Liking versus Complexity: Decomposing the Inverted U-curve
- Graf 与 Landwehr(2017)Aesthetic Pleasure versus Aesthetic Interest: The Two Routes to Aesthetic Liking
- Cheung 等人(2019)Uncertainty and Surprise Jointly Predict Musical Pleasure and Amygdala, Hippocampus, and Auditory Cortex Activity
- Gold 等人(2019)Predictability and Uncertainty in the Pleasure of Music: A Reward for Learning?
- Madison 与 Schiölde(2017)Repeated Listening Increases the Liking for Music Regardless of Its Complexity: Implications for the Appreciation and Aesthetics of Music
- Brielmann 与 Dayan(2022)A computational model of aesthetic value
- Brielmann 等人(2024)Modelling individual aesthetic judgements over time
44.7 健康科学与药理学 #
健康研究在三种场合引出患者的偏好:治疗决策之前、监管机构审批医疗产品时,以及卫生技术评估中。其主要的陈述偏好方法是离散选择实验(discrete choice experiment,DCE),应答者在由属性描述的假想备选方案之间做选择(第 40.9 节)。这种方法与偏好贝叶斯优化很接近,但发展过程相互独立;2018 至 2023 年间,共发表了 1,279 项健康领域的 DCE(Nouwens 等,2025)。药理学为反对稳定偏好提供了一个常被援引的论据:药物可以改变选择。这一论点的实质站得住,只是流传中的引文有误(表 44.1)。操纵血清素会改变道德判断以及对不公平出价的反应(Crockett 等,2008;Crockett 等,2010),在 2010 年的研究中,这种改变在高共情个体身上更明显;帕金森病中的冲动控制障碍主要与多巴胺激动剂有关(Voon 等,2006;Weintraub 等,2010)。
陈述的选择能预测真实的选择吗?关于外部效度(external validity),Quaife 等人(2018)汇总了 8 项研究(其中 6 项纳入元分析):灵敏度为 88%(实际接受某一选项的人中,DCE 预测到的比例),特异度为 34%(实际拒绝的人中,DCE 预测到的比例),ROC 曲线下面积为 0.60(0.5 为随机水平)。Zhang 等人(2025b)把这一分析更新到 14 项研究(其中 10 项纳入元分析):灵敏度 89%,特异度 52%,曲线下面积 0.81,研究间的异质性非常高( 为 95% 至 97%,即变异中不能归因于偶然的比例)。对于预防性的、需要主动选择加入的决策,预测效果更好。图 44.3 把这两组合并估计换算为人数。
可以尝试以下几点:
- 默认设置采用 Quaife 等人的估计,且一半的人接受该选项。此时实验预测 77 人会接受,其中 44 人(57%)确实接受。33 个实心品红色点,是被实验误判为接受的拒绝者。
- 切换到“Zhang 等人(2025),10 项研究”。特异度更高,误判的接受减少到 24 个:预测 69 人接受,其中 45 人确实接受(65%)。
- 把“实际接受者的比例(示意)”降到 20%。采用 Quaife 等人的估计,预测 71 人会接受,其中只有 18 人(25%)确实接受;采用 Zhang 等人的估计,则分别为 56 人与 18 人(32%)。大多数人会拒绝时,陈述的“是”几乎说明不了什么。
信度与对方法的依赖。Xie 等人(2022)在 2 周后对 162 人进行重测,发现 76.4% 的 DCE 选择前后相同(Cohen κ 为 0.528,即经偶然一致校正的一致性)。时间权衡法询问一个人愿意用多少年的完全健康,换取在较差状态下更长的寿命;该方法的组内相关系数为 0.958,有 59.3% 的数值前后相同。在 Whichello 等人(2023)的研究中,459 名患糖尿病的荷兰成年人以平衡的顺序完成了一项 DCE 与摆动赋权(swing weighting,一种直接方法,询问把每个属性从最差水平移到最好水平有多重要;第 40.10 节)。两种方法都把成本与精度排在最前,但 DCE 中最重要与最不重要属性的权重相差 14.9 倍,摆动赋权只相差 1.4 倍;Veldwijk 等人(2024)在 307 名肺癌患者中同样发现,DCE 的权重更为分散。
自适应引出与决策辅助工具。Gonzalez Sepulveda 等人(2023)的“患者偏好诊断”以更早一次调查得到的潜在偏好类别为先验,提出自适应的选择问题,把患者归入已知的某种偏好表型。在首次肩关节前脱位的应用中(共四个类别),连续两个问题之后,后验类别概率达到 87% 至 89%;这些只是模拟结果。一篇纳入 209 项随机试验、107,698 名参与者的 Cochrane 综述(Stacey 等,2024)发现,决策辅助工具(decision aids)很可能提高知情后的价值观与所做选择之间的一致性(相对危险度 1.75,95% 置信区间 1.44 至 2.13;21 项研究;中等确定性),在决策后悔上则没有差异。测得的偏好还可能因被测对象变化之外的原因而漂移:反应转移(response shift)指观察到的变化不能完全由目标构念的变化来解释(Vanier 等,2021)。
对偏好贝叶斯优化的含义。这是本章最强的联系之一;以下均为推断。以群体潜在类别为先验、再加两个自适应问题,这一做法对应到偏好贝叶斯优化中,就是从早先用户那里学到的效用函数混合先验:早期查询识别类别,后续查询在类别内细化(第 20.5 节),不过其在真实患者身上的准确性尚不清楚。陈述的选择能很好地预测实际接受,却难以预测拒绝;因此,在将偏好贝叶斯优化会话的“赢家”视为用户的真实选择之前,应当在实际使用中加以验证。成对的偏好贝叶斯优化是一种基于选择的方法,其学到的权衡可能比直接评分所得更极端(14.9 对 1.4)。2 周后约 76% 的二元健康选择前后相同,这为重复的成对判断提供了一个现实的噪声下限。除模拟遗憾之外,还可以用价值一致性与决策后悔,把偏好贝叶斯优化当作决策辅助工具来评测(第 46.7 节)。在面向辅助设备的长期偏好贝叶斯优化中(第 33 章),漂移可能是反应转移,而非偏好改变,仅靠随时间变化的核函数无法区分两者。临床上的偏好贝叶斯优化还应把用药状态与用药时间记录为协变量。我们没有找到任何使用基于高斯过程的偏好贝叶斯优化或采集函数的健康 DCE 研究或共同决策研究。
第 44.7 节引用的文献 13
- Nouwens 等人(2025)The Evolving Landscape of Discrete Choice Experiments in Health Economics: A Systematic Review
- Crockett 等人(2008)Serotonin Modulates Behavioral Reactions to Unfairness
- Crockett 等人(2010)Serotonin selectively influences moral judgment and behavior through effects on harm aversion
- Voon 等人(2006)Prevalence of repetitive and reward-seeking behaviors in Parkinson disease
- Weintraub 等人(2010)Impulse Control Disorders in Parkinson Disease: A Cross-Sectional Study of 3090 Patients
- Quaife 等人(2018)How well do discrete choice experiments predict health choices? A systematic review and meta-analysis of external validity
- Zhang 等人(2025b)Prediction accuracy of discrete choice experiments in health-related research: a systematic review and meta-analysis
- Xie 等人(2022)Discrete choice experiment with duration versus time trade-off: a comparison of test–retest reliability of health utility elicitation approaches in SF-6Dv2 valuation
- Whichello 等人(2023)Discrete choice experiment versus swing-weighting: A head-to-head comparison of diabetic patient preferences for glucose-monitoring devices
- Veldwijk 等人(2024)Comparing Discrete Choice Experiment with Swing Weighting to Estimate Attribute Relative Importance: A Case Study in Lung Cancer Patient Preferences
- Gonzalez Sepulveda 等人(2023)Patient-Preference Diagnostics: Adapting Stated-Preference Methods to Inform Effective Shared Decision Making
- Stacey 等人(2024)Decision aids for people facing health treatment or screening decisions
- Vanier 等人(2021)Response shift in patient-reported outcomes: definition, theory, and a revised model
44.8 常见说法核查 #
表 44.1 汇总了本章核查过的说法,它们来自设计、感官、艺术与健康领域。
| 说法 | 文献显示的情况 | 节 |
|---|---|---|
| 在葡萄酒中,颜色完全压倒味觉和嗅觉,对偏好数据造成毁灭性后果 | 颜色会使言语描述产生偏差,且可以复现;但当时的任务是选择描述词,而品尝者仍然察觉到了差别 | 第 44.5 节 |
| 瞭望庇护理论已经确立 | 瞭望在 31 次检验中有 19 次得到支持(61%),庇护在 27 次中有 8 次(30%);庇护主要在景观中得到支持 | 第 44.2 节 |
| Kano 模型表明深层需求是稳定的 | 几秒之内只有 39% 的“期望”回答得到重复 | 第 44.1 节 |
| 越流畅,越受喜爱 | 对快速判断成立;在审慎加工下,不流畅的设计可以凭借引发兴趣胜出 | 第 44.6 节 |
| 喜爱度随复杂度呈倒 U 形 | 在群体层面成立;在一个数据集中,它是上升型与下降型个体的混合 | 第 44.6 节 |
| SSRI 会改变道德偏好(Crockett 等,Science 2010) | PNAS 2010(西酞普兰);Science 2008 研究的是色氨酸耗竭;实质结论成立 | 第 44.7 节 |
| 13.6% 的左旋多巴患者会出现冲动控制障碍(Voon 等,Annals of Neurology 2006) | Voon 等发表于 Neurology:使用多巴胺激动剂者中为 13.7%;13.6% 出自 Weintraub 等(2010);主要与激动剂有关,左旋多巴的使用也与之独立相关 | 第 44.7 节 |
44.9 偏好贝叶斯优化可以直接采用的方法 #
表 44.2 按构建偏好贝叶斯优化系统的顺序,汇总了本章与上一章中足够可靠、无需新理论即可使用的方法;第 42 章补充了评测与部署方面的对照措施,第 46 章则把这些内容转化为建议。第三列为本书的推断。
| 方法 | 证据 | 偏好贝叶斯优化中改变什么(推断) |
|---|---|---|
| 安慰剂对:同一选项出现两次(第 44.5.1 节) | O'Mahony 与 Wichchukit(2017);Halim 等人(2020);Xia 等人(2020) | 用相同的对上的回答校准噪声项或失误项 |
| “无偏好”选项 | O'Mahony 与 Wichchukit(2017);Quintana 等人(2025) | 加入平局似然(第 20.4 节),而不是把无差异解读为随机选择 |
| 把“无法决定”与“差不多”分开建模(第 43.4.2 节) | Ok 与 Tserenjigmid(2022);Cettolin 与 Riedl(2019) | 区分无差异、犹豫不决与尝试 |
| 按反馈类型分别拟合噪声尺度(第 43.5 节) | Ghosal 等人(2023) | 对成对比较、滑块和评分分别估计噪声 |
| 位置项、默认项与选择历史项(式(43.1)) | Matějka 与 McKay(2015);Enisman 等人(2021) | 把接近无差异时的倾斜变成可以估计的信号;平衡左右位置与顺序 |
| 与并非由当前最优点衍生的多样化设计比较(第 44.1 节) | Wadinambiarachchi 等人(2024);Leahy 等人(2020) | 在画廊中加入多样化的候选,并测量固着 |
| 潜在类别先验加简短的自适应诊断(第 44.7 节) | Gonzalez Sepulveda 等人(2023)(模拟) | 用早期查询识别用户的偏好类别 |
| 在品味因人而异之处使用逐人模型(第 44.2 节) | Vessel 等人(2018);Brielmann 等人(2024) | 建筑与艺术用逐人的代理模型;面孔与景观用群体数据 |
| 比较图诊断与 Hodge 诊断(第 43.3.1 节、第 43.3.2 节) | Hendrickx 等人(2019);Jiang 等人(2011) | 检查效用的锚定程度,并将循环比例与偶然水平对比 |
| 重测基准 | Nijman 等人(2022);Xie 等人(2022) | 若后验的把握远高于 0.6 至 0.7 的 ICC 或 76% 的重复选择一致率,则予以标记 |
| 价值一致性、决策后悔与使用中的验证 | Stacey 等人(2024);Quaife 等人(2018);Zhang 等人(2025b) | 在模拟遗憾之外报告人的结果;在实际使用中验证“赢家” |
若一项研究只能承担少数几项改动,以下五项的证据与成本之比最高,除带平局的似然外,都不需要新的软件(推断):
- 在会话中混入相同的对,占查询的百分之几,并报告虚假偏好率。
- 提供“无偏好”(必要时还有“无法决定”),并对其建模。
- 针对具体的人与界面拟合噪声尺度,而不是将其固定。
- 随机分出对照组,使用随机或平衡的查询顺序;在会话结束时或几天之后,重测一些早期的对。
- 在遗憾之外,报告一项人的结果,例如重测时的认可、价值一致性或实际使用情况。
第 44.9 节引用的文献 21
- O'Mahony 与 Wichchukit(2017)The evolution of paired preference tests from forced choice to the use of‘No Preference’options, from preference frequencies to d′ values, from placebo pairs to signal detection
- Halim 等人(2020)Paired preference tests and placebo placement: 1. Should placebo pairs be placed before or after the target pair?
- Xia 等人(2020)Paired preference tests and placebo placement: 2. Unraveling the effects of stimulus variance
- Quintana 等人(2025)Global urban visual perception varies across demographics and personalities
- Ok 与 Tserenjigmid(2022)Indifference, indecisiveness, experimentation, and stochastic choice
- Cettolin 与 Riedl(2019)Revealed preferences under uncertainty: Incomplete preferences and preferences for randomization
- Ghosal 等人(2023)The Effect of Modeling Human Rationality Level on Learning Rewards from Multiple Feedback Types
- Matějka 与 McKay(2015)Rational Inattention to Discrete Choices: A New Foundation for the Multinomial Logit Model
- Enisman 等人(2021)Choice changes preferences, not merely reflects them: A meta-analysis of the artifact-free free-choice paradigm
- Wadinambiarachchi 等人(2024)The Effects of Generative AI on Design Fixation and Divergent Thinking
- Leahy 等人(2020)Design Fixation From Initial Examples: Provided Versus Self-Generated Ideas
- Gonzalez Sepulveda 等人(2023)Patient-Preference Diagnostics: Adapting Stated-Preference Methods to Inform Effective Shared Decision Making
- Vessel 等人(2018)Stronger shared taste for natural aesthetic domains than for artifacts of human culture
- Brielmann 等人(2024)Modelling individual aesthetic judgements over time
- Hendrickx 等人(2019)Graph Resistance and Learning from Pairwise Comparisons
- Jiang 等人(2011)Statistical ranking and combinatorial Hodge theory
- Nijman 等人(2022)The stability of self-reported emotional response and liking of beer in context
- Xie 等人(2022)Discrete choice experiment with duration versus time trade-off: a comparison of test–retest reliability of health utility elicitation approaches in SF-6Dv2 valuation
- Stacey 等人(2024)Decision aids for people facing health treatment or screening decisions
- Quaife 等人(2018)How well do discrete choice experiments predict health choices? A systematic review and meta-analysis of external validity
- Zhang 等人(2025b)Prediction accuracy of discrete choice experiments in health-related research: a systematic review and meta-analysis
44.10 已定、有争议与缺失 #
已定。消费者会在相同的样本之间陈述偏好,因此感官科学使用安慰剂对与“无偏好”选项。系统提供的范例,包括人工智能图像生成器的输出,会加重固着、降低想法的多样性。对面孔与景观的品味是共享的,对建筑与艺术品的品味因人而异;在对两者做过比较的研究中,评分的信度相同。对个性化内容,喜爱度的个体模型远胜于总体平均(0.65 对 0.01)。对同一批人,基于选择的赋权与直接赋权给出不同的权衡(14.9 对 1.4)。决策辅助工具很可能提高选择与价值观的一致性。颜色会使对葡萄酒的言语描述产生偏差,这一结果可以复现。
有争议。倒 U 形描述的是个体,还是只描述群体。重复会提高还是降低喜爱度。从人到算法的交接在有客观指标的专家搜索中有帮助,在由品味驱动的设计中是否同样有帮助。陈述的选择对真实拒绝的预测有多好(特异度 34% 至 52%)。协同演化是否为设计所特有。
缺失。在偏好贝叶斯优化会话内测量固着,并以随机画廊为对照。设计师的成对偏好跨会话的重测一致性。在食品或风味领域借助人类感官评审小组开展的偏好贝叶斯优化。测量呈现方式在多大程度上改变的是偏好,而不是描述。面向公共空间、由采集函数驱动、有居民参与的成对比较循环。使用基于高斯过程的偏好贝叶斯优化的健康 DCE 研究或共同决策研究。把 Brielmann 与 Dayan 那样的观察者状态模型,用作偏好贝叶斯优化代理模型的非平稳性。
44.11 习题 #
在一项预实验中,被试在 30% 的安慰剂对上陈述了偏好。利用第 44.5.1 节中的推导,以噪声 为单位,Thurstone 模型推断出的平局阈值 是多少?第二个界面把虚假偏好率降到 10%。在模型中,什么发生了变化?在界面中,又可能是什么发生了变化?
解答
时,。 时,。在模型中,要么报告无偏好的阈值相对升高,要么感知噪声相对降低;仅凭安慰剂对,只能识别出两者之比。在界面中,可能是“无偏好”选项变得更显眼,或是呈现顺序改变了(Halim 等人发现,把安慰剂对放在目标对之后会增加“无偏好”回答)。要区分这两种解释,研究还需要差别大小已知的对。
某偏好贝叶斯优化系统用随机的纹理种子渲染每个设计,因此同样的参数两次渲染的结果永远不会完全一样。在这个系统中,安慰剂对会出现什么问题?对估计出的虚假偏好率会有什么影响,Xia 等人(2020)对此有何提示?
解答
同一组参数的两次渲染不再是相同的刺激,因此“安慰剂”对包含一个真实的感知差别,尽管很小。对这类对的回答,把虚假偏好与对纹理的真实辨别混在一起,估计出的虚假偏好率因而有偏;Xia 等人在同一食品产品的样本存在差异时,发现的正是这种情况。解决办法是用同一种子渲染安慰剂对;若渲染之间的差异本身就是产品的一部分,则用同一设计的成对渲染单独测量这种差异。
第 44.11 节引用的文献 1
- Xia 等人(2020)Paired preference tests and placebo placement: 2. Unraveling the effects of stimulus variance
延伸阅读 #
- O'Mahony 与 Wichchukit(2017)讲述了成对偏好测试的历史,从强制选择到安慰剂对和 ;这是本书这一部分中最能直接迁移的方法。
- Christensen 等人(2012)说明,带“无偏好”选项的偏好测试,其 Thurstone 模型如何成为累积概率单位模型。
- Vessel 等人(2018)在不同领域中区分了共享的品味与个人的品味。
- Brielmann 与 Dayan(2022)提出审美价值的计算理论,把喜爱度与观察者不断变化的状态联系起来。
- Stacey 等人(2024)是关于决策辅助工具的 Cochrane 综述,其结局指标可供偏好贝叶斯优化的评测借用。
参考文献
- (2017). Preference Elicitation For Participatory Budgeting. Proceedings of the AAAI Conference on Artificial Intelligence. 引用于 §44.3
- (2021). Preference Elicitation for Participatory Budgeting. Management Science. 引用于 §44.3
- (2022). A computational model of aesthetic value. Psychological Review. 引用于 §44.6
- (2024). Modelling individual aesthetic judgements over time. Philosophical Transactions of the Royal Society B: Biological Sciences. 引用于 §44.6 §44.9
- (2019). Revealed preferences under uncertainty: Incomplete preferences and preferences for randomization. Journal of Economic Theory. 引用于 §44.9
- (2022). Kano Analysis: A Critical Survey Science Review. Sawtooth Software Conference Proceedings (practitioner conference, not peer-reviewed). 工作论文引用于 §44.1
- (2019). Uncertainty and Surprise Jointly Predict Musical Pleasure and Amygdala, Hippocampus, and Auditory Cortex Activity. Current Biology. 引用于 §44.6
- (2017). Back to the inverted-U for music preference: A review of the literature. Psychology of Music. 引用于 §44.6
- (2012). Estimation of the Thurstonian Model for the 2-AC Protocol. Food Quality and Preference. 引用于 §44.5
- (2020). Psychological and neural responses to architectural interiors. Cortex. 引用于 §44.2
- (2021a). The Evolution of“Co-evolution”(Part I): Problem Solving, Problem Finding, and Their Interaction in Design and Other Creative Practices. She Ji: The Journal of Design, Economics, and Innovation. 引用于 §44.1
- (2021b). The Evolution of“Co-evolution”(Part II): The Biological Analogy, Different Kinds of Co-evolution, and Proposals for Conceptual Expansion. She Ji: The Journal of Design, Economics, and Innovation. 引用于 §44.1
- (2008). Serotonin Modulates Behavioral Reactions to Unfairness. Science. 引用于 §44.7
- (2010). Serotonin selectively influences moral judgment and behavior through effects on harm aversion. Proceedings of the National Academy of Sciences. 引用于 §44.7
- (2001). Creativity in the Design Process: Co-Evolution of Problem-Solution. Design Studies. 引用于 §44.1
- (2016). Evidence for prospect-refuge theory: a meta-analysis of the findings of environmental preference research. City, Territory and Architecture. 引用于 §44.2
- (2016). Deep Learning the City: Quantifying Urban Perception at a Global Scale. Computer Vision – ECCV 2016. 引用于 §44.3
- (2021). Choice changes preferences, not merely reflects them: A meta-analysis of the artifact-free free-choice paradigm. Journal of Personality and Social Psychology. 引用于 §44.9
- (2023). The Effect of Modeling Human Rationality Level on Learning Rewards from Multiple Feedback Types. AAAI. 引用于 §44.9
- (2019). Predictability and Uncertainty in the Pleasure of Music: A Reward for Learning? The Journal of Neuroscience. 引用于 §44.6
- (2023). Patient-Preference Diagnostics: Adapting Stated-Preference Methods to Inform Effective Shared Decision Making. Medical Decision Making. 引用于 §44.7 §44.9
- (2017). Aesthetic Pleasure versus Aesthetic Interest: The Two Routes to Aesthetic Liking. Frontiers in Psychology. 引用于 §44.6
- (2016). Liking versus Complexity: Decomposing the Inverted U-curve. Frontiers in Human Neuroscience. 引用于 §44.6
- (2020). Paired preference tests and placebo placement: 1. Should placebo pairs be placed before or after the target pair? Food Research International. 引用于 §44.5 §44.9
- (2019). Graph Resistance and Learning from Pairwise Comparisons. ICML. 引用于 §44.9
- (2025). Bayesian Preference Elicitation for Decision Support in Multi‐Objective Optimization. Journal of Multi-Criteria Decision Analysis. 引用于 §44.4
- (1991). Design Fixation. Design Studies. 引用于 §44.1
- (2011). Statistical ranking and combinatorial Hodge theory. Mathematical Programming. 引用于 §44.9
- (2023). Human–machine collaboration for improving semiconductor process development. Nature. 引用于 §44.4
- (2020). Design Fixation From Initial Examples: Provided Versus Self-Generated Ideas. Journal of Mechanical Design. 引用于 §44.1 §44.9
- (2017). Repeated Listening Increases the Liking for Music Regardless of Its Complexity: Implications for the Appreciation and Aesthetics of Music. Frontiers in Neuroscience. 引用于 §44.6
- (2003). Consumers report preferences when they should not: a cross-cultural study. Journal of Sensory Studies. 引用于 §44.5
- (2015). Rational Inattention to Discrete Choices: A New Foundation for the Multinomial Logit Model. American Economic Review. 引用于 §44.9
- (2024). Cooperative Multi-Objective Bayesian Design Optimization. ACM Transactions on Interactive Intelligent Systems. doi:10.1145/3657643. 引用于 §44.1
- (2001). The Color of Odors. Brain and Language. 引用于 §44.5
- (2025). Exploring the Effectiveness of Interactive Preference Learning for Adapting Designs to Abstract Semantic Attributes. Journal of Mechanical Design. 引用于 §44.4
- (2022). The stability of self-reported emotional response and liking of beer in context. Food Quality and Preference. doi:10.1016/j.foodqual.2022.104603. 引用于 §44.5 §44.9
- (2025). The Evolving Landscape of Discrete Choice Experiments in Health Economics: A Systematic Review. PharmacoEconomics. 引用于 §44.7
- (2017). The evolution of paired preference tests from forced choice to the use of‘No Preference’options, from preference frequencies to d′ values, from placebo pairs to signal detection. Trends in Food Science & Technology. 引用于 §44.5 §44.9
- (2022). Indifference, indecisiveness, experimentation, and stochastic choice. Theoretical Economics. 引用于 §44.9
- (2018). How well do discrete choice experiments predict health choices? A systematic review and meta-analysis of external validity. The European Journal of Health Economics. 引用于 §44.7 §44.9
- (2025). Global urban visual perception varies across demographics and personalities. Nature Cities. 引用于 §44.3 §44.9
- (2011). A Design Preference Elicitation Query as an Optimization Process. Journal of Mechanical Design. 引用于 §44.4
- (2019). Differences between young architects' and non-architects' aesthetic evaluation of buildings. Frontiers of Architectural Research. 引用于 §44.2
- (2020). Wine psychology: basic & applied. Cognitive Research: Principles and Implications. 引用于 §44.5
- (2024). Decision aids for people facing health treatment or screening decisions. Cochrane Database of Systematic Reviews. 引用于 §44.7 §44.9
- (2021). Response shift in patient-reported outcomes: definition, theory, and a revised model. Quality of Life Research. 引用于 §44.7
- (2024). Comparing Discrete Choice Experiment with Swing Weighting to Estimate Attribute Relative Importance: A Case Study in Lung Cancer Patient Preferences. Medical Decision Making. 引用于 §44.7
- (2018). Stronger shared taste for natural aesthetic domains than for artifacts of human culture. Cognition. 引用于 §44.2 §44.9
- (2006). Prevalence of repetitive and reward-seeking behaviors in Parkinson disease. Neurology. 引用于 §44.7
- (2024). The Effects of Generative AI on Design Fixation and Divergent Thinking. Proceedings of the CHI Conference on Human Factors in Computing Systems. 引用于 §44.1 §44.9
- (2019). Drinking through rosé-coloured glasses: Influence of wine colour on the perception of aroma and flavour in wine experts and novices. Food Research International. 引用于 §44.5
- (2010). Impulse Control Disorders in Parkinson Disease: A Cross-Sectional Study of 3090 Patients. Archives of Neurology. 引用于 §44.7
- (2023). Discrete choice experiment versus swing-weighting: A head-to-head comparison of diabetic patient preferences for glucose-monitoring devices. PLOS ONE. 引用于 §44.7
- (2020). Paired preference tests and placebo placement: 2. Unraveling the effects of stimulus variance. Food Research International. 引用于 §44.5 §44.9 §44.11
- (2022). Discrete choice experiment with duration versus time trade-off: a comparison of test–retest reliability of health utility elicitation approaches in SF-6Dv2 valuation. Quality of Life Research. 引用于 §44.7 §44.9
- (2025b). Prediction accuracy of discrete choice experiments in health-related research: a systematic review and meta-analysis. eClinicalMedicine. 引用于 §44.7 §44.9
- (2024). Value construction through sequential sampling explains serial dependencies in decision making. eLife. doi:10.7554/eLife.96997. 引用于 §44.1