经济学、决策理论与运筹学
偏好贝叶斯优化对人的建模可以概括为一句话:存在一个稳定的效用函数,对“你更喜欢哪个?”的每次回答,都是透过少量高斯噪声对这一函数的读取。经济学用了一个世纪检验这句话的每个部分。第 16.5 节中的概率单位链接与逻辑链接源自计量经济学;存在回答误差时的自适应提问,是营销科学的日常工作;决策理论家则追问过,人是否必须能为每一对选项排出先后。本部分讨论的学科中,没有哪一个比经济学更接近这一方法。
本章先讨论单次选择能显示什么,再讨论偏好的聚合与表示,然后讨论实践者如何引出偏好,最后考察相关实验的复现情况。贯穿全章的有两项发现。第一,偏好贝叶斯优化论文视为新问题的若干问题,在其他领域早有成熟的处理,汇总于第 40.13 节;偏好贝叶斯优化的新贡献在于连续设计空间上的非参数代理模型,而不在于自适应提问本身。第二,最常被提议纳入偏好似然的行为参数,如损失厌恶系数与贴现因子,恰恰是大小最难复现的量。
40.1 行为经济学 #
行为经济学记录了人相对于教科书中理性选择者模型的系统性偏离。偏好贝叶斯优化借用最多的是损失厌恶(loss aversion):同等大小的损失比收益显得更重,两者权重之比即损失厌恶系数。Tversky 与 Kahneman 估计该系数约为 2.25(Tversky 与 Kahneman,1992)。损失与收益都相对于一个参照点(reference point)计算;在 Kőszegi 与 Rabin 的模型中,参照点是人理性预期的结果(Kőszegi 与 Rabin,2006)。用于偏好贝叶斯优化时,论证如下:当前最好的设计成为参照点,在某方面更差的挑战者因而被编码为损失,于是当前最优点附近的似然应有约 2 倍的不对称。其他提议包括:在迭代之间引入现时偏差,即相对于将来的结果过分看重眼前的结果,常用准双曲贴现建模(在每期稳定贴现之外,再把每个延迟的结果额外乘以一个固定的缩小因子);用模糊厌恶描述用户对后验的信任,模糊厌恶指相对于未知的概率更偏好已知的概率,如 Ellsberg 的罐子(Ellsberg,1961);以及在多用户场景中假定相当比例的人纯粹自私。
这些说法在方向上成立,在大小上大多不成立。损失厌恶与参照点是前景理论(prospect theory)的两个组成部分。前景理论是 Kahneman 与 Tversky 关于风险下选择的理论:结果按收益与损失估值,概率的权重也不均匀,小概率的权重高于应有水平,大概率的权重低于应有水平(概率加权)。其定性模式在 19 个国家、4,098 名被试、13 种语言中得到复现,只是效应较小,国家间的差异也很明显(Ruggeri 等,2020)。损失厌恶的大小存在争议,如图 40.1 所示。一项元分析(对已发表估计的统计合并)汇总了 150 篇文章中的 607 个估计,得到均值 1.955(95% 区间 1.820 至 2.102)(Brown 等,2024)。将累积前景理论(该理论的 1992 年版本)拟合到个体在混合赌局(结果可能是收益,也可能是损失)之间的选择上,得到 1.31(95% 置信区间 1.10 至 1.53),研究间异质性占总变异的 91.6%(Walasek 等,2024)。一项再分析涵盖 84 篇论文中的 163 个估计(n = 149,218),发现该系数取决于任务设计:损失小于收益且各项按大小顺序呈现时,系数约为 2.33;收益与损失对称且无序时,系数约为 1.07,与 1 无显著差异(Yechiam 与 Zeif,2025)。
可以尝试以下几点:
- 在默认值 2.25(Tversky 与 Kahneman 的估计)处,竖线位于两个合并区间之外:高于 1.820 至 2.102,远高于 1.10 至 1.53。
- 将竖线移到 1.53 至 1.82 之间的任意位置。它不在任何一个区间内,也没有哪个取值同时落在两个区间内:两项合并估计互不重叠。
- 将竖线设为 1。它低于两个区间,但紧邻对称、无序呈现下约 1.07 的估计;这一条件最接近并排展示两个设计的情形。
支撑这些说法的机制同样经不起检验。在一项真实努力实验(被试为获得报酬完成一项实际任务)中,努力程度对预期变化的反应明显非单调,与 Kőszegi-Rabin 类模型预测的单调反应相反(Gneezy 等,2017)。禀赋效应(endowment effect)指拥有者放弃一件物品时的要价高于买方愿出的价格(Kahneman 等,1990);据一篇工作论文报告,在面向 4,000 名美国成年人的四次有激励的调查(回答有真实的金钱后果)中,禀赋效应与风险前景上的损失厌恶几乎没有关系(Chapman 等,2023)。List 对交易者的田野实验发现,市场经验会减弱禀赋效应(List,2003;List,2004),这一结果被解读为重复提问会使偏好收敛;但让被试反复交易后,这种不对称在后来的测试中消失了,作者认为其主要原因是对交易的不确定(Engelmann 与 Hollard,2010)。经验带来学习,但其机制并非偏好收敛。
其他参数更不可靠。一项元分析汇总了 28 篇采用凸时间预算(被试在较早与较晚两个日期之间分配一笔预算)的文章中的 220 个估计,发现平均而言存在现时偏差,异质性很大,选择性报告的程度不高(Imai 等,2021)。双曲模式(对眼前一小段延迟的不耐心远大于对将来同样长的延迟)在完全没有支付延迟的任务中几乎同样明显;因此,即使潜在的贴现函数是指数型的,即每期按相同比率贴现,由复杂性导致的误差也会产生看似双曲型的选择(Enke 等,2025)。把异象解读为对复杂选项估值时的误差(Oprea,2024),这一观点本身也有争议(第 40.12 节)。模糊厌恶在中等概率的收益上得到复现,但在损失或低概率的情形中,多数被试是模糊中性或模糊寻求的(Kocher 等,2018)。一个社会偏好的结构混合模型把人分为少数几种类型,每种类型有各自的偏好参数;该模型找到三种随时间稳定的关注他人的类型(也考虑他人所得的类型),没有找到纯粹自私的类型(Bruhin 等,2019),不过后来一项研究确实识别出一种“以自私为主”的类型(Fehr 等,2026)。默认选项的效应平均而言是稳健的:58 项研究(合计 n = 73,675)的效应为 Cohen's d = 0.68(95% 置信区间 0.53 至 0.83),其中 d 是均值之差除以标准差;但效应变异很大,有若干零结果,还有两个负效应(Jachimowicz 等,2019)。
对偏好贝叶斯优化的含义。似然不应在当前最优点附近固定约 2 倍的不对称。偏好贝叶斯优化通常对称地并排展示两个设计,而 Yechiam 与 Zeif 正是在这一条件下发现系数接近 1;如果要为不对称建模,应将其作为每个用户各自的参数,且先验包含 1(推断)。在迭代之间使用准双曲贴现不适合这一场景,因为迭代之间只相隔几分钟,也没有任何结果要留待日后消费;可以借鉴的是,测得的不耐心部分反映了复杂性,这提示噪声应随比较难度增大(第 27.2 节)(推断)。有多个用户时,类型的稳定性意味着,用户类型的有限混合或分层先验(每个用户的参数取自共享的群体分布)比各用户完全独立的模型更合适(推断)。此外,会话的初始设计本身就是默认选项,应在会话之间和用户之间随机化或加以平衡(推断)。
第 40.1 节引用的文献 20
- Tversky 与 Kahneman(1992)Advances in prospect theory: Cumulative representation of uncertainty
- Kőszegi 与 Rabin(2006)A Model of Reference-Dependent Preferences
- Ellsberg(1961)Risk, Ambiguity, and the Savage Axioms
- Ruggeri 等人(2020)Replicating patterns of prospect theory for decision under risk
- Brown 等人(2024)Meta-analysis of Empirical Estimates of Loss Aversion
- Walasek 等人(2024)A meta-analysis of loss aversion in risky contexts
- Yechiam 与 Zeif(2025)Loss aversion is not robust: A re-meta-analysis
- Gneezy 等人(2017)The Limits of Expectations-Based Reference Dependence
- Kahneman 等人(1990)Experimental Tests of the Endowment Effect and the Coase Theorem
- Chapman 等人(2023)Willingness to Accept, Willingness to Pay, and Loss Aversion
- List(2003)Does Market Experience Eliminate Market Anomalies?
- List(2004)Neoclassical Theory Versus Prospect Theory: Evidence from the Marketplace
- Engelmann 与 Hollard(2010)Reconsidering the Effect of Market Experience on the "Endowment Effect"
- Imai 等人(2021)Meta-Analysis of Present-Bias Estimation using Convex Time Budgets
- Enke 等人(2025)Complexity and Time
- Oprea(2024)Decisions under Risk Are Decisions under Complexity
- Kocher 等人(2018)Ambiguity aversion is not universal
- Bruhin 等人(2019)The many Faces of Human Sociality: Uncovering the Distribution and Stability of Social Preferences
- Fehr 等人(2026)Social Preferences and Redistributive Politics
- Jachimowicz 等人(2019)When and why defaults influence decisions: a meta-analysis of default effects
40.2 显示偏好与稳定偏好 #
显示偏好(revealed preference)是经济学家根据选择而非提问推断偏好的方法:若一个人在 也可选时选择了 ,就称 被显示为优于 。对于从预算集(给定价格与收入下买得起的商品组合的集合)中做出的选择,存在某个效用函数能解释全部选择,当且仅当这些选择满足广义显示偏好公理(Generalized Axiom of Revealed Preference,GARP):显示偏好关系中不能有包含严格偏好的环。Afriat 的临界成本效率指数(Afriat,1972)衡量数据距离通过检验有多远:把每个预算都缩小为原来的 倍后所有违背都会消失,满足这一条件的最大比例 即为该指数。因此,指数为 0.95 意味着,只要允许此人浪费 5% 的钱,其选择就是一致的。在 Andreoni 与 Miller 关于利他行为的实验中,176 名被试里有 18 人违背了至少一条显示偏好公理,指数低于 0.95 的只有 3 人(Andreoni 与 Miller,2002)。Plott 的发现偏好假说认为,偏好起初并不现成,而是在完成任务的经验中逐渐发现的(Plott,2001)。结合这一假说,上述结果支持关于偏好贝叶斯优化的一个强论断:迭代提问会收敛到一个人真实的潜在偏好。
这种解读需要三点限定。其一,这些检验的功效指数“最好被看作功效的序数度量而非基数度量”(Andreoni 等,2013)(一篇工作论文),即它们能按功效为检验排序,却不能说明两个检验相差多少,因此通过率高未必意味着检验严格。其二,一致性未必能跨领域延续:一篇 2025 年的预印本发现,实验中风险选择的一致性得分,与同一批人超市购物的一致性不相关(Chen 等,2025b)。其三,强制选择本身就会制造不一致:当被试可以付出少量代价推迟选择时,他们主动做出的选择“总体上更一致”,推迟与选择合在一起,符合不完备偏好下的占优选择模型(Costa-Gomes 等,2022),这是第 40.8 节的主题。发现偏好假说则得到了直接支持。Nielsen 与 Rehbeck 在有激励的条件下询问被试希望自己的选择满足哪些公理;被试常常修改相互冲突的彩票选择,使之符合这些公理(Nielsen 与 Rehbeck,2022)。
对偏好贝叶斯优化的含义。一次会话的比较日志,就是二元菜单上的显示偏好数据。对这类数据,GARP 归结为一个简单条件:由每个获胜选项指向其落败选项的有向图中不能有环。系统可以在整个会话中对第 18.5 节的比较图做环检测来检查这一条件,无需高斯过程(推断);不过采集函数会把查询集中在当前最优点附近,因此在会话后期这类检验的功效很低,日志中没有环只是微弱的证据(推断)。
import networkx as nx
def revealed_cycles(duels):
"""duels: (winner, loser) pairs from one session.
Returns every cycle of the revealed-preference graph; an empty
list means some utility function explains all answers."""
g = nx.DiGraph()
g.add_edges_from(duels)
return list(nx.simple_cycles(g))
# 翻转后能消除所有环的最少回答构成一个最小反馈弧集:
# 一般情形下是 NP 困难的,对会话大小的日志则很小。
日志中出现环时,将环展示给用户,询问要修改哪个回答,这就是 Nielsen 与 Rehbeck 的程序:通过反思发现偏好,而不是通过重复达到收敛(推断)。提供“没有明确偏好”这一回答,并在似然中加入第三种结果(第 20.4 节),应能减少人为制造的不一致(推断)。
第 40.2 节引用的文献 7
- Afriat(1972)Efficiency Estimation of Production Functions
- Andreoni 与 Miller(2002)Giving According to GARP: An Experimental Test of the Consistency of Preferences for Altruism
- Plott(2001)Rational Individual Behavior in Markets and Social Choice Processes: The Discovered Preference Hypothesis
- Andreoni 等人(2013)The Power of Revealed Preference Tests: Ex-Post Evaluation of Experimental Design
- Chen 等人(2025b)How General Are Measures of Choice Consistency? Evidence from Experimental and Scanner Data
- Costa-Gomes 等人(2022)Choice, deferral, and consistency
- Nielsen 与 Rehbeck(2022)When Choices Are Mistakes
40.3 内生偏好与变化的偏好 #
偏好贝叶斯优化假定,所学习的效用不会因学习过程本身而改变。如果偏好由所研究的制度、选择或经历本身塑造,经济学家就称之为内生偏好(endogenous preferences)。机器学习中的漂移模型与非平稳赌博机(处理收益随时间变化的重复选择的方法,第 13.2 节)把变化视为外生的,即来自外部;而建构出来的偏好是内生地变化的。若偏好是内生的,按人们所持偏好评判结果的传统福利经济学便失去了立足点;Dold 追问,在这样的世界里,“福利分析与规范经济学是否仍然可能”(Dold,2023)。Infante、Lecouteux 与 Sugden 批评了行为福利经济学的“偏好净化”,即在观察到的错误背后寻找一个内在理性主体的偏好(Infante 等,2016)。按照这一批评,偏好贝叶斯优化会话找到的最优点,反映的可能是一种自我强化的建构,而不是一项发现。经验上的回答仍是 Nielsen 与 Rehbeck 的结果:它支持经当事人本人认可的有限净化,而不支持由第三方实施的净化。
有几种福利标准不依赖稳定偏好。Bernheim 与 Rangel 提出:两个选项同时出现时,只有在任何框架(呈现选择的方式)下第二个选项都从未被选在第一个之前,第一个选项才算对此人更好(Bernheim 与 Rangel,2009)。Sugden 的机会标准按制度提供的机会而非稳定偏好来评判制度;这一标准阐述于一本书中,我们通过一篇书评核实了该书的存在(Engelen,2019)。借助一种适用于误解后果者的福利度量,研究者发现,传统指标把两种金融教育干预评为同样有益,尽管只有其中一种降低了错误的平均严重程度(Ambuehl 等,2022)。
对偏好贝叶斯优化的含义。偏好在会话中发生变化时,系统需要明确的福利标准。将 Bernheim-Rangel 规则用于会话日志:只有在任何观察到的框架中、任何时刻, 都从未被选在 之前,才推荐设计 而非设计 ;否则,报告没有被其他任何设计明确胜过的设计集合(推断)。按照 Ambuehl 等人的思路,可以在标明属性的简化框架中,将最终设计与其主要备选再比较一次;两个框架之间的分歧,可用于估计结果在多大程度上源于误解而非偏好(推断)。Nielsen 与 Rehbeck 的认可步骤,在经济学中对应于停止时的反思认可检查(第 46.6 节)(推断),但存在第 41.2 节所解释的局限:如果正是系统改变了偏好,事后认可本身不能证明这一改变是正当的。
我们没有找到任何经济学论文为偏好因引出过程本身而改变的人定义福利(区别于由消费、制度或世界观引起的改变)。偏好贝叶斯优化造成的正是这种情形。
第 40.3 节引用的文献 5
- Dold(2023)Endogenous preferences: a challenge to constitutional political economy’s normative foundation?
- Infante 等人(2016)Preference purification and the inner rational agent: a critique of the conventional wisdom of behavioural welfare economics
- Bernheim 与 Rangel(2009)Beyond Revealed Preference: Choice-Theoretic Foundations for Behavioral Welfare Economics *
- Engelen(2019)The Community of Advantage: A Behavioral Economist’s Defence of the Market, Robert Sugden. Oxford University Press, 2018, xxii + 320 pages
- Ambuehl 等人(2022)Evaluating Deliberative Competence: A Simple Method with an Application to Financial Choice
40.4 随机选择 #
同一个问题问两次,人们常给出不同的回答。随机效用模型(random utility models,第 16.5 节)对此的解释是,每个选项的效用含有一个随机成分;第 27.1 节的概率单位链接与逻辑链接,分别是带高斯噪声与带 Gumbel 噪声的随机效用模型(Gumbel 分布的密度是偏斜的钟形曲线,两个独立的 Gumbel 随机变量之差服从逻辑分布,由此得到 logit)。一种由来已久的观点通常追溯到 McFadden(McFadden,1981):这种随机性既可以代表同一个人在不同场合之间的变异,也可以代表人与人之间的差异,还可以代表偏好真正的不稳定,而三种解读在形式上等价。新的实验把三者区分开来。Agranov 与 Ortoleva 把同一个问题间隔很久或紧接着重复提出,并告知被试问题会重复,结果“两种情况下绝大多数被试都表现出随机选择”(Agranov 与 Ortoleva,2017)。后来一项研究允许被试在选择列表(一张二元选择表,其中一个选项固定,另一个逐行变化)的每一行上随机化,结果“大多数被试在大多数问题上选择了随机化”(Agranov 与 Ortoleva,2025);综述见 Agranov 与 Ortoleva(2022)。有意随机化是无法为两个选项排序的一种外在表现;人们在获准表达时有多常直接说明这一点,见第 40.8 节。
2017 年以来,有两条研究路线与偏好贝叶斯优化直接相关。在基于学习的随机选择(learning-based stochastic choice)中,贝叶斯概率单位模型从依赖情境的数据中识别稳定偏好,并能容纳随机效用模型无法容纳的吸引效应与折中效应(在某个选项旁加入一个相似但更差的选项,或一个更极端的选项,该选项会因此得益)(Natenzon,2019)。效用不确定的反应时模型(response-time models with uncertain utility)把选择视为最优序贯抽样:每次观察一条带噪声的信息,每次观察后决定是否继续。这类模型表明,“只要主体的先验信念正确,主体选择快速决定时,选择更可能是正确的”,这比第 39.3 节中经典的漂移扩散模型更符合数据(Fudenberg 等,2018)。
对偏好贝叶斯优化的含义。评价噪声、随机偏好与有意随机化如今各有经验上的特征,每一种都可以有自己的似然成分:评价噪声用概率单位链接或逻辑链接,随机偏好用每次判断时从后验中重新抽取的效用函数,有意随机化用第三种结果或显式的混合参数(推断)。立即重复同一对选项,并把每次不一致都视为噪声,会把评价噪声与有意随机化混为一谈;重测的选项对应当间隔开来,重复选项对上 50/50 的回答也不应自动解读为无差异(推断)。像 Natenzon 的贝叶斯概率单位模型那样让比较噪声依赖于相似度,可以使似然吸收第 37.2 节中的部分情境效应(推断)。此外,Fudenberg 等人预测,先验正确时,快的选择就是准确的选择;这与漂移扩散模型的直觉(慢的选择意味着价值差异小)不同。在把反应时纳入似然(第 27.2 节)之前,应先检验设计比较中成立的是哪一种模式(推断)。
第 40.4 节引用的文献 6
- McFadden(1981)Econometric Models of Probabilistic Choice
- Agranov 与 Ortoleva(2017)Stochastic Choice and Preferences for Randomization
- Agranov 与 Ortoleva(2025)Ranges of Randomization
- Agranov 与 Ortoleva(2022)Revealed Preferences for Randomization: An Overview
- Natenzon(2019)Random Choice and Learning
- Fudenberg 等人(2018)Speed, Accuracy, and the Optimal Timing of Choices
40.5 理性疏忽 #
理性疏忽(rational inattention)刻画这样的选择者:无法接收关于选项的全部信息,需要决定获取多少信息,并为注意力付出成本。即使此人的效用固定,选择也会带有噪声,因为有时仔细查看并不值得。这一理论由 Sims 提出(Sims,2003),Matějka 与 McKay 将其用于离散选择(Matějka 与 McKay,2015):当注意力成本与 Shannon 互信息(第 6.3 节)成正比时,最优行为是广义多项 logit(把 logit 规则推广到多个选项,并按先验信念平移),
其中 是选项 的真实价值, 是单位信息的成本, 是查看之前选择 的概率,概括了选择者的先验信念。有人据此论证,偏好似然中的噪声有规范性的基础:即使效用完全稳定,以最优方式分配注意力的人回答时也带有噪声。
这一基础比上述论证所说的更窄。在 Bregman 信息成本(该论文定义的一类成本,Shannon 成本是其特例)下,对给定的先验,理性疏忽的选择概率“可以取任何加性随机效用离散选择模型的形式”,即每个选项的效用等于固定值加随机项的任何模型(Fosgerau 等,2020)。实验中,被试确实像理性疏忽所预测的那样根据激励调整注意力,但结果在定性上与对 Shannon 熵线性的成本不符(Shannon 熵是不确定性的标准度量,这种成本与此人的不确定性平均减少多少成正比)(Dean 与 Neligh,2023)。在 Shannon 成本下,logit 的基础作为定理成立,但支持这种成本的经验证据很弱;更宽泛的论断,即效用稳定时最优注意力仍会产生随机选择,依然成立。
对偏好贝叶斯优化的含义。似然应当是异方差的:两个设计在用户的感知度量下越接近,比较的噪声越大;用户越在意,噪声越小(推断)。先验的作用相当于平移效用,即式(40.1)中的 项:相信系统的当前最优点大概不错的用户,即使偏好稳定,也会偏向它。交互研究中报告的对系统提议的锚定(第 32.3 节),由此无需任何偏好改变即可得到解释;只有改变用户对选项来源的信念的设计,例如隐藏哪个选项是系统的提议,才能区分这两种解释(推断)。此外,理性疏忽可以产生任何加性随机效用模型,因此无法在概率单位链接与逻辑链接之间做出裁决,只有对数据的拟合才能(推断)。
第 40.5 节引用的文献 4
- Sims(2003)Implications of rational inattention
- Matějka 与 McKay(2015)Rational Inattention to Discrete Choices: A New Foundation for the Multinomial Logit Model
- Fosgerau 等人(2020)Discrete Choice and Rational Inattention: A General Equivalence Result
- Dean 与 Neligh(2023)Experimental Tests of Rational Inattention
40.6 信息经济学 #
在贝叶斯说服(Bayesian persuasion)即信息设计中,发送者事先承诺接收者所见信息如何依赖于世界的状态,并通过选择这一规则引导接收者的行动(Kamenica 与 Gentzkow,2011)。在 Kamenica 与 Gentzkow 的例子中,法官只在有罪概率至少为一半时定罪,有罪的先验概率为 0.3,而负责设计调查的检察官可以得到 60% 的定罪率。有人据此论证,在偏好贝叶斯优化中,选择展示哪些候选本身就是信息设计,并由此引出伦理问题。与引出问题更接近的是激励相容:如果如实回答符合回答者的利益,支付规则就是激励相容的;如果在这一规则下,真实的人而非理想化的人确实如实回答,它就是行为激励相容的。二值化评分规则是为信念报告付酬的标准方法,它违背了行为激励相容的两个弱条件:向被试解释激励,反而增加了他们偏离如实报告的程度(Danz 等,2022)。
对偏好贝叶斯优化的含义。偏好贝叶斯优化的信息结构与说服相反:用户持有(或正在形成)偏好,系统试图学习它,因此选择查询是引出问题或筛选问题,即由缺乏信息的一方设计问题,把信息引出来。说服适用于另一个问题:所展示的候选如何改变用户关于何者可以实现、何者为好的信念;用户不确定如何评价选项本身时,这个问题最为重要(推断)。伦理上的论证以较窄的形式成立:既决定展示哪些候选、又从特定结果中获益的系统,是偏好与用户不同的发送者,说服框架给出了它能在多大程度上推动用户选择的界限(推断);第 46.8 节将回到这一点。如果用户研究为“准确”的回答付酬,支付规则应当简单,也不宜详细解释其运作机制(推断)。
第 40.6 节引用的文献 2
- Kamenica 与 Gentzkow(2011)Bayesian Persuasion
- Danz 等人(2022)Belief Elicitation and Behavioral Incentive Compatibility
40.7 社会选择与机制设计 #
社会选择理论(social choice theory)研究如何把许多人的偏好合并为一个集体排序或决定,并按每条规则满足或违背哪些公理来评判它;机制设计(mechanism design)设计规则,使按自身利益行事的参与者仍会透露设计者需要的信息。经典结果是一系列不可能定理。Arrow 不可能定理指出,对三个或更多选项,没有任何排序规则能同时满足一小组合理的公理(Arrow,1950);Gibbard-Satterthwaite 定理指出,对三个或更多结果,任何非独裁(总是听从某个固定投票者)的投票规则,都可能受某个投票者操纵(Gibbard,1973;Satterthwaite,1975)。偏好学习与社会选择相结合时,通常引用的工具还有:Black 的单峰偏好(沿一条共同的轴,每个人的偏好在其最喜欢的点两侧都逐渐下降)(Black,1948)、May 关于多数规则的定理(May,1952)、Harsanyi 的效用加权和(Harsanyi,1955),以及 Vickrey-Clarke-Groves 机制,它向每个参与者收取其报告给其他所有人造成的成本,用金钱使说真话成为最优(Vickrey,1961;Clarke,1971;Groves,1973)。Chichilnisky 的拓扑定理常被表述为:在连续的偏好空间上,没有社会选择函数能同时满足全体一致(若所有人意见一致,规则即照此决定)与匿名性(规则平等对待所有人);但该定理讨论的只是连续的聚合映射(Chichilnisky,1980),常见表述漏掉了对规则的这一连续性要求。
主要的进展是,社会选择理论如今已直接用于从合并的比较中学习效用,而这正是多用户偏好贝叶斯优化中的聚合问题(第 20.5 节)。Ge 等人(2024)表明,Bradley-Terry-Luce 模型及其广泛的推广“不满足基本公理”:任何由非递减凸损失定义的聚合规则,都违背 Pareto 最优性(Pareto optimality)与成对多数一致性(pairwise majority consistency)。前者要求,若所有人都偏好 胜过 ,输出也应如此;后者要求,若每一对上的多数意见都与某个排序一致,输出就应是这个排序。Siththaranjan 等人(2024)表明,在隐藏异质性下,标准的偏好学习隐含地按 Borda 计数(Borda count)聚合,即按每个选项在所有人中平均胜过多少其他选项为其打分。一篇 2025 年的预印本表明,标准的正则化最大似然对近似克隆不稳健(加入某个选项的近似副本,不应显著改变学到的奖励),而按相似度加权可以恢复这一性质(Procaccia 等,2025)。
对偏好贝叶斯优化的含义。如果多用户系统把所有人的比较都放进同一个带概率单位似然或 Bradley-Terry 似然的高斯过程,就会继承这些公理上的缺陷。替代做法是为每个用户分别拟合后验,再用明确的规则聚合;或者在分歧很大时报告效用的分布(推断)。采集函数会在当前最优点周围生成许多几乎相同的候选,这正是克隆的情形:即使只有一个用户,一簇几乎相同的比较也可能主导拟合,按相似度加权是一种补救(推断)。对基数效用函数取平均是连续的、匿名的、全体一致的,因此 Chichilnisky 的障碍并不妨碍对后验均值取平均。真正的困难在于,每个用户的效用尺度只是相对于该用户自身的噪声方差确定的(第 18.4 节),因此取平均之前要先做人际归一化,即决定一个用户的效用单位如何与另一个用户的相比较,这是 Harsanyi 意义上的规范性选择(推断)。在单用户偏好贝叶斯优化中,策略性误报只会伤害用户自己;当用户有多个、设计有三个或更多、聚合又非独裁式时,Gibbard-Satterthwaite 定理便适用(推断)。
第 40.7 节引用的文献 13
- Arrow(1950)A Difficulty in the Concept of Social Welfare
- Gibbard(1973)Manipulation of Voting Schemes: A General Result
- Satterthwaite(1975)Strategy-proofness and Arrow's conditions: Existence and correspondence theorems for voting procedures and social welfare functions
- Black(1948)On the Rationale of Group Decision-making
- May(1952)A Set of Independent Necessary and Sufficient Conditions for Simple Majority Decision
- Harsanyi(1955)Cardinal Welfare, Individualistic Ethics, and Interpersonal Comparisons of Utility
- Vickrey(1961)Counterspeculation, Auctions, and Competitive Sealed Tenders
- Clarke(1971)Multipart pricing of public goods
- Groves(1973)Incentives in Teams
- Chichilnisky(1980)Social choice and the topology of spaces of preferences
- Ge 等人(2024)Axioms for AI Alignment from Human Feedback
- Siththaranjan 等人(2024)Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
- Procaccia 等人(2025)Clone-Robust AI Alignment
40.8 决策理论 #
决策理论为理性选择陈述公理,并推导由此得出的结论,其中最著名的是:满足 Savage 公理的人,其行为如同在某种概率信念下最大化期望效用。Savage 本人把他的理论限定于可能性可以事先列举的“小世界”(small worlds)(Savage,1954);Binmore 论证,贝叶斯决策理论不能推广到“大世界”(large worlds)(Binmore,2009)。创意设计空间看起来正是大世界,在其中期望一个完备的偏好序是不合理的。Debreu 的表示定理意味着,连续的效用表示需要连续的偏好;而字典序偏好(按一个属性排序,只在完全打平时才用下一个属性区分)根本无法用任何实值效用表示(Debreu,1983)。因此,高斯过程效用预设了连续性。完备性的经典替代是 Bewley 的 Knight 式决策理论:它去掉完备性公理,并加入一个惰性假设,即备选方案只有在优于现状时才会被接受(Bewley,2002)。
如果对每一对选项 与 ,此人要么偏好 ,要么偏好 ,要么认为两者无差异,偏好关系就是完备的(complete)。如果对某些选项对三者都不成立,即此人无法比较它们,偏好关系就是不完备的(incomplete)。在多效用(multi-utility)表示中,此人有一组效用函数 ,当且仅当对每个 都有 时,他偏好 胜过 ;当 中的成员意见不一时, 与 不可比。无差异(对所有 都有 )与不可比是两种不同的状态。
2017 至 2026 年最重要的进展是,不完备性得到了直接测量。Cettolin 与 Riedl 发现,约一半被试的选择与完备偏好加确定性独立性的模型不一致(确定性独立性是指,把两个选项以相同比例与同一个确定结果混合,不会改变哪一个更受偏好);这些人中约一半的行为符合不完备偏好,概率加权、选择误差、后悔厌恶与不可传递的无差异等解释均已排除(Cettolin 与 Riedl,2019)。Nielsen 与 Rigotti 在一篇工作论文中直接引出了不完备性(Nielsen 与 Rigotti,2026)。允许表达不完备性时,约 40% 至 50% 的被试表达了不完备偏好,而强制选择产生了更多不一致:强制选择中传递性违背的比例为 4.0%,不强制选择时所表达的严格偏好中则为 1.7%。报告过不完备性的被试,平均在 50 次比较中有 3.3 次如此报告;比较对象刻意设计得较复杂时,76% 的被试报告了不完备性。意识扩展下的决策理论为后出现的选项补充了一条规则:发现新的可能性时,信念按“逆贝叶斯主义”(reverse Bayesianism)更新,即保持旧可能性之间的相对概率,把一部分概率质量移给新的可能性(Karni 与 Vierø,2013)。
强制的二元似然会如何处理不是偏好的回答?在图 40.2 中,读者要在几套公寓之间做选择,这些公寓的居住面积与通勤时间此消彼长;除了选出其中一套,也可以回答“无法比较”,或请求掷硬币。强制选择模型只有一个权重,采用第 27.1 节的概率单位似然,并把每个“无法比较”都当作被迫选择时只能掷出的那枚硬币的结果。第二个模型遵循定义 40.1:回答者持有一组可容许的权重,“无法比较”意味着这组权重跨越了这对公寓的打平点。
可以尝试以下几点:
- 每一对都只用“公寓 A”或“公寓 B”回答。此时两个模型对权重所在位置和候选清单的判断大致一致。除非回答把权重推到轴的一端,集合模型的曲线处处低于一半:从不选“无法比较”的回答指向一个极窄的集合,它可能位于该区域的任何位置。
- 按“重置”后重新回答,每当觉得难以取舍时,就选“无法比较”或“替我掷硬币”。每个这样的回答都使强制模型向某个由硬币选定的权重收窄,而集合模型则扩大可容许权重的范围,在候选清单上保留更多公寓。
- 切换到“模拟的人”,按“全部模拟”,并打开“揭晓模拟的权重”。在默认运行中,强制模型把 90% 的信念放在权重 0.43 至 0.57 上,并以 0.71 的概率认为公寓 4 最好;集合模型保留公寓 3、4 与 5,即在此人真实权重范围内某处最好的几套公寓。强制模型的把握来自硬币。
对偏好贝叶斯优化的含义。查询应当包含“无法比较”这一回答,似然也应当对它建模。按照 Bewley 的多效用解读,只有整组效用都同意时,一个设计才优于另一个。系统可以不返回单个最优点,而返回在每个后验样本下都不被其他设计胜过的那些设计;不过,后验样本的离散程度衡量的是系统对此人的不确定性,而不是此人自身的不完备性,除非“无法比较”的回答进入似然并扩大集合,如图 40.2 的中间面板所示(推断)。这些证据也限定了一种担忧,即强制选择是一种范畴错误:报告不完备性的人只在少数比较中如此报告,平均 50 次中 3.3 次,尽管设计比较往往确实复杂(推断)。逆贝叶斯主义给出了一条规则,可以在会话中途扩展设计空间而无需重新开始;这是对“大世界”反驳的形式化回答,但目前还没有偏好贝叶斯优化系统实现它(推断)。字典序规则与硬性限制,如第 40.10 节中的否决阈值,更适合表示为约束(第 14.4 节),而不宜强行纳入光滑的效用(推断)。
第 40.8 节引用的文献 8
- Savage(1954)The Foundations of Statistics
- Binmore(2009)Rational Decisions
- Debreu(1983)Representation of a Preference Ordering by a Numerical Function
- Bewley(2002)Knightian decision theory. Part I
- Cettolin 与 Riedl(2019)Revealed preferences under uncertainty: Incomplete preferences and preferences for randomization
- Nielsen 与 Rigotti(2026)Revealed Incomplete Preferences
- Karni 与 Vierø(2013)“Reverse Bayesianism”: A Choice-Based Theory of Growing Awareness
- Agranov 与 Ortoleva(2025)Ranges of Randomization
40.9 离散选择与联合分析 #
联合分析(conjoint analysis)是源自市场营销的一种调查方法。回答者在属性(价格、尺寸、品牌)各不相同的产品描述之间做选择或为其评分,再由模型(通常是 logit)估计每个属性水平的部分价值(part-worth)效用。基于选择的联合分析一次展示几个产品描述,请回答者选出最喜欢的一个,因而是偏好贝叶斯优化的近亲,只是用参数化的(通常是线性的)效用代替了高斯过程。自适应(adaptive)设计根据已有的回答选择每一个问题。其中一条原则是效用平衡(utility balance),即挑选各选项预测效用几乎相等的问题;采集函数偏爱结果最不确定的选项对时,做的正是这件事。早在偏好贝叶斯优化出现之前,营销科学就已有多面体自适应设计(Toubia 等,2003;Toubia 等,2004)、加入回答误差与信息性先验的概率版本(Toubia 等,2007)、利用管理者对参数的先验信念的贝叶斯设计(SÁndor 与 Wedel,2001)、针对混合 logit 模型的设计(Sándor 与 Wedel,2002),以及根据每位回答者先前的回答调整问题的序贯贝叶斯设计。在模拟中,最后这种设计在回答准确度低时依然表现良好,而多面体方法则不然(Yu 等,2011)。
这一领域也记录了自适应提问的一个已知陷阱。Hauser 与 Toubia 表明,自适应的、效用平衡的度量型问题(回答者在成对比较中说明自己对某个产品描述偏好多少,而不只是偏好哪一个)会使部分价值估计相互之间产生相对偏差。其机制是一种类似赢家诅咒的内生性:问题是根据当前估计选出的,因此回答并不独立于这些估计。效用平衡的问题也可能效率低下,而收缩估计(把每位回答者的估计拉向样本平均)并未消除这些偏差;不过在他们的数据中,偏差与低效的量级与回答误差相当(Hauser 与 Toubia,2005)。他们的分析只涉及这类度量型问题。2017 年以来,Sauré 与 Vielma 用正态分布近似后验,把回答误差纳入一种近似贝叶斯方法,并允许通过优化选择问题(Sauré 与 Vielma,2019);Gibbard 与 Sadlier 发现,对于群体层面的参数,最优自适应贝叶斯设计的估计准确度“一致地比随机设计差”,因此这类设计适合关注样本中具体个人的研究(Gibbard 与 Sadlier,2025)。
环境经济学用陈述偏好(stated preference)调查为不在市场上出售的物品(如清洁的河流)估值:回答者说明自己愿意为所描述的某种改变支付多少,或在成本不同的几个描述方案中做选择。有人认为,这些方法与偏好贝叶斯优化同构,只是各自独立发展。Johnston 等人 2017 年的指南(Johnston 等,2017)比 Kenneth Arrow 主持的 1993 年专家组的指南(NOAA Panel on Contingent Valuation,1993)更进一步,指出:单次二元选择是最直接满足激励相容的形式;问题顺序应在回答者之间随机化;随着统计效率与选择复杂度上升,回答者选择的一致性会下降。一项大型选择实验在重复作答的陈述偏好研究中发现了稳健的顺序效应(Day 等,2012)。
对偏好贝叶斯优化的含义。Hauser 与 Toubia 发现的赢家诅咒偏差,是否会出现在高斯过程所估计的效用大小或长度尺度中,尚未得到检验。按其机制,小效应相对于大效应会被夸大;混入随机查询是一种现成的补救办法,以群体结论为目标的研究本来也需要这样做(推断)。挑选信息量最大的查询的采集函数,也往往会提高选择复杂度、降低回答一致性,因此这一权衡应纳入采集函数的设计,例如对同时在许多属性上不同的选项对施加惩罚(推断)。偏好贝叶斯优化与这一领域的区别在于代理模型,即连续设计空间上的高斯过程或其他非参数模型;采用这种代理模型的自适应联合分析研究,是第 40.14 节列出的空白之一。
第 40.9 节引用的文献 12
- Toubia 等人(2003)Fast Polyhedral Adaptive Conjoint Estimation
- Toubia 等人(2004)Polyhedral Methods for Adaptive Choice-Based Conjoint Analysis
- Toubia 等人(2007)Probabilistic Polyhedral Methods for Adaptive Choice-Based Conjoint Analysis: Theory and Application
- SÁndor 与 Wedel(2001)Designing Conjoint Choice Experiments Using Managers' Prior Beliefs
- Sándor 与 Wedel(2002)Profile Construction in Experimental Choice Designs for Mixed Logit Models
- Yu 等人(2011)Individually adapted sequential Bayesian conjoint-choice designs in the presence of consumer heterogeneity
- Hauser 与 Toubia(2005)The Impact of Utility Balance and Endogeneity in Conjoint Analysis
- Sauré 与 Vielma(2019)Ellipsoidal Methods for Adaptive Choice-Based Conjoint Analysis
- Gibbard 与 Sadlier(2025)Optimal adaptive Bayesian design in choice experiments: performance for the population versus individuals
- Johnston 等人(2017)Contemporary Guidance for Stated Preference Studies
- NOAA Panel on Contingent Valuation(1993)Report of the NOAA Panel on Contingent Valuation, January 11, 1993
- Day 等人(2012)Ordering effects and choice set awareness in repeat-response stated preference studies
40.10 多准则决策分析 #
多准则决策分析(multi-criteria decision analysis,MCDA)是源自运筹学的一族方法,帮助决策者对按多个相互冲突的准则(如成本、安全与舒适)评判的选项排序或做出选择。补偿式(compensatory)方法允许一个准则上的所得抵消另一个准则上的所失,加权和即属此类;非补偿式(non-compensatory)方法则不允许。级别优先方法 ELECTRE(Roy,1968)与 PROMETHEE(Brans 与 Vincke,1985)逐个准则地比较选项,并设有无差异、偏好与否决(veto)阈值;否决是指某个准则上的差距大到其他方面的任何优势都无法弥补。层次分析法(Saaty,1977)从成对的比率判断中导出权重;TOPSIS 按选项到理想点与负理想点的距离排序(Hwang 与 Yoon,1981)。
与偏好贝叶斯优化最接近的是稳健序数回归(robust ordinal regression):它利用与决策者的成对陈述相容的每一个加性价值函数(每个准则一个价值函数,再求和)对选项排序(Greco 等,2008)。它报告两种关系:若每个相容的价值函数都把 排得至少与 一样高,则 必然(necessarily)优于 ;若至少有一个这样的价值函数,则称可能(possibly)优于。Corrente 等人将这种方法与机器学习中的偏好学习做了比较(Corrente 等,2013)。2017 年以来,Ciomek、Kadziński 与 Tervonen 比较了用于成对引出的问题选择启发式,并在实验中验证了其中最好的一种:101 名被试回答成对问题,按四个准则为 10 种手机套餐排序(Ciomek 等,2017)。Grillo、Kotłowski 与 Kadziński 在线性模型与 Bradley-Terry 模型下,为贝叶斯方法与正则化最大似然证明了遗憾界(Grillo 等,2025);这里的正则化最大似然即跟随正则化领先者,每次回答后都对迄今的全部回答重新拟合,并用惩罚项防止估计跳变。Huber、Rojas Gonzalez 与 Astudillo 根据成对比较建立决策者效用的贝叶斯模型,通过平衡探索与利用选择查询,并在多达九个目标的问题上做了测试(Huber 等,2025)。
对偏好贝叶斯优化的含义。必然关系与可能关系分别对应后验概率为 1 与大于 0 的偏好。同时报告两者,可以为用户提供一份可解释的总结,说明其比较已经确定了什么(推断);图 40.2 中“集合:P(未被击败)”一行就是这类总结。否决阈值表达了光滑的高斯过程效用无法表达的硬性限制,这支持把某些偏好作为约束处理(推断)。我们没有找到任何研究在同一项以人为对象的任务上,比较稳健序数回归的问题选择启发式与偏好采集函数;这一实验现在就可以开展。
第 40.10 节引用的文献 9
- Roy(1968)Classement et choix en présence de points de vue multiples
- Brans 与 Vincke(1985)Note—A Preference Ranking Organisation Method: (The PROMETHEE Method for Multiple Criteria Decision-Making)
- Saaty(1977)A scaling method for priorities in hierarchical structures
- Hwang 与 Yoon(1981)Multiple Attribute Decision Making: Methods and Applications, A State-of-the-Art Survey
- Greco 等人(2008)Ordinal regression revisited: Multiple criteria ranking using a set of additive value functions
- Corrente 等人(2013)Robust ordinal regression in preference learning and ranking
- Ciomek 等人(2017)Heuristics for prioritizing pair-wise elicitation questions with additive multi-attribute value models
- Grillo 等人(2025)Ordinal regression meets online learning: Interactive preference learning for multiple criteria choice and ranking with provable guarantees
- Huber 等人(2025)Bayesian Preference Elicitation for Decision Support in Multi‐Objective Optimization
40.11 交互式多目标优化 #
在多目标优化(第 14.5 节)中,多个目标相互冲突,答案是一条 Pareto 前沿(Pareto front),即这样一些设计:要在任何一个目标上改进,都必然使另一个目标变差。交互式(interactive)方法让人类决策者在优化过程中陈述偏好,把搜索引向前沿上他们喜欢的部分。人工智能中有一条相关的研究路线,按信息价值(Chajewska 等,2000)以及极小极大遗憾选择查询;后者推荐这样的选项:在所有仍与回答相容的效用下,其最坏情况损失最小。这条路线上的一篇期刊论文证明,在贝叶斯框架与极小极大遗憾框架下,大小为 的最优推荐集同时也是大小为 的最优选择查询,因此“在好的推荐与好的查询之间无须权衡”;分析涵盖无噪声的回答以及常数噪声与逻辑噪声,摘要称这些结果对这类噪声是稳健的(Viappiani 与 Boutilier,2020)。2010 年会议版本的摘要称,对于有噪声的回答,它给出的是最坏情况保证(Viappiani 与 Boutilier,2010),这提示结论是有界的损失,而非精确的等价;我们没有核对定理本身。qEUBO 按所展示的 个候选中最大效用的期望为这组候选打分(第 19.4 节),后来有研究将其作为一种决策论的采集函数提出并加以分析(Astudillo 等,2023);上述等价性是这一族方法更早的基础。
交互式多目标优化也早在偏好贝叶斯优化之前,就设计出了能抵抗锚定的交互方式。NAUTILUS 方法从最差的点出发,让决策者每一步都改进所有目标而不牺牲任何一个,从而同时避免了锚定与损失框架(Miettinen 等,2010)。锚定也得到了测量:128 名被试在一个双目标问题上使用交互式目标规划,结果出现了锚定,使决策者错过了自己最偏好的解;当他们使用他人的偏好时,锚定更强(Halstead 等,2026)。这一领域还有评测规范:一篇关于如何评估交互式方法的综述,记录了决策者的类型(效用函数或价值函数、人工决策者或真人)与偏好信息的类型(Afsar 等,2021);一份可复用的问卷与实验设计,则为与人类决策者的比较提供了支持(Afsar 等,2022)。
对偏好贝叶斯优化的含义。标准的交互方式,即当前最优点对挑战者,要求在一个属性与另一个属性之间取舍;只做改进的 NAUTILUS 式路径,无须估计损失厌恶参数就能回应关于参照依赖的担忧,而在会话之间变换初始设计可以抵消锚定(推断)。偏好贝叶斯优化的用户研究应采用这一领域的评测规范:报告决策者是真人还是模拟用户、收集了哪些偏好信息,以及如何决定停止(第 31.7 节、第 46.7 节)(推断)。
第 40.11 节引用的文献 8
- Chajewska 等人(2000)Making Rational Decisions using Adaptive Utility Elicitation
- Viappiani 与 Boutilier(2020)On the equivalence of optimal recommendation sets and myopically optimal query sets
- Viappiani 与 Boutilier(2010)Optimal Bayesian Recommendation Sets and Myopically Optimal Choice Query Sets
- Astudillo 等人(2023)qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization
- Miettinen 等人(2010)NAUTILUS method: An interactive technique in multiobjective optimization based on the nadir point
- Halstead 等人(2026)Multiobjective Optimisation for Others: How Anchoring Effects Change Based on Who Guides the Interaction
- Afsar 等人(2021)Assessing the Performance of Interactive Multiobjective Optimization Methods: A Survey
- Afsar 等人(2022)Designing empirical experiments to compare interactive multiobjective optimization methods
40.12 实验经济学中的复现 #
上面几节都依赖行为研究的发现,因此这些发现的复现情况很重要。总体而言,复现情况尚可。两本顶级经济学期刊发表的 18 项实验室实验中,有 11 项(61%)得到复现,即效应在相同方向上显著,复现出的效应平均为原效应的 66%(Camerer 等,2016)。2010 至 2015 年间发表于 Nature 与 Science 的 21 项社会科学实验中,有 13 项(62%)在相同方向上显著复现,复现的效应量平均约为原效应的 50%(Camerer 等,2018)。Economic Inquiry 举办了一个分两部分的专题讨论,主题是可重复性与可复现性,主要关注非实验研究(Bokhari 等,2025a;Bokhari 等,2025b)。表 40.1 列出了被提议作为偏好模型组成部分的具体发现及其状态;本章已引用的文献只写作者与年份。
| 发现 | 提议的用途 | 状态 | 依据 |
|---|---|---|---|
| 约 2.25 的损失厌恶系数 | 在当前最优点附近固定不对称 | 有争议;合并估计从约 1.07 至 1.955 不等 | Brown 等 2024;Walasek 等 2024;Yechiam 与 Zeif 2025 |
| 风险与时间异象源于复杂性 | 随难度增大的噪声 | 有争议 | Banki 等 2025 以及 Oprea 的回应 |
| 禀赋效应可由损失厌恶解释 | 当前最优点的不对称价值 | 被削弱 | Chapman 等 2023(工作论文) |
| 吸引(诱饵)效应 | 候选通过诱饵重塑效用 | 局限于程式化的数字呈现 | Frederick、Lee 与 Baskin 2014 |
| 默认效应 | 初始设计相当于默认选项 | 平均而言稳健;存在异质性,有零效应与负效应 | Jachimowicz 等 2019 |
| 现状偏差 | 当前最优点的优势 | 在 4 个决策情境中的 3 个得到复现 | Xiao 等 2021 |
表中有四项依据前文尚未介绍。关于风险与时间异象的复杂性解释,Banki、Simonsohn、Walatka 与 Wu 2025 年的一篇工作论文(Banki 等,2025)得出了与 Oprea 相反的结论;Oprea 回应称,这一相反结论主要源于使用中位数,若改用均值,偏离仍高度显著(Oprea,2025)。这一争论尚无定论。Frederick、Lee 与 Baskin 发现,吸引效应可能局限于每个产品维度都是数字的程式化呈现;当消费者亲身体验产品,或者哪怕只有一个属性以感知方式呈现时,该效应通常就会消失(Frederick 等,2014)。在两项预注册的复现研究(分析计划在收集数据之前提交;n = 311 与 n = 316)中,现状偏差在四个决策情境中的三个得到有力支持,在第四个中没有得到实质性支持(Xiao 等,2021)。
对偏好贝叶斯优化的含义。为偏好似然提议的行为参数,所依据的恰恰是大小最不稳定的那些发现;这些效应的方向比大小更可靠,因此似然不应固定其大小(推断)。吸引效应的局限尤其值得注意:偏好贝叶斯优化常用于颜色、形状与运动这类感知设计,而 Frederick 等人发现,诱饵效应恰恰在这类情形中很少出现。有人担心,加入候选会通过诱饵重塑效用地形;至少就这一机制而言,这一担忧被削弱了,不过除法归一化(第 39.4 节)对不熟悉的选项可能仍然适用(推断)。
第 40.12 节引用的文献 8
- Camerer 等人(2016)Evaluating replicability of laboratory experiments in economics
- Camerer 等人(2018)Evaluating the replicability of social science experiments in Nature and Science between 2010 and 2015
- Bokhari 等人(2025a)Introduction to the symposium on reproducibility and replicability in economics: Part I
- Bokhari 等人(2025b)Introduction to the symposium on reproducibility and replicability in economics: Part II
- Banki 等人(2025)Decisions under Risk Are Decisions under Complexity: Comment
- Oprea(2025)Initial Reply to Banki, Simonsohn, Walatka and Wu (2025)
- Frederick 等人(2014)The Limits of Attraction
- Xiao 等人(2021)Revisiting status quo bias: Replication of Samuelson and Zeckhauser (1988)
40.13 别处已解决的问题 #
上面各节逐一发现,偏好贝叶斯优化论文视为新问题的那些问题,在相邻领域中已有成熟的处理。表 40.2 将它们汇总在一起;最后一列是本章对每种处理之含义的解读,其中每一项都是推断。
| 问题 | 别处更早的处理 | 偏好贝叶斯优化中的做法 | 含义 |
|---|---|---|---|
| 存在回答误差时的自适应贝叶斯提问 | 联合分析设计:Sándor 与 Wedel(2001、2002);Yu、Goos 与 Vandebroek(2011);Toubia 等(2003 至 2007);Sauré 与 Vielma(2019) | 另起一条路线,基于高斯过程后验 | 新意在于非参数代理模型;以自适应联合分析作为基线 |
| 自适应问题带来的偏差 | 效用平衡问题的赢家诅咒偏差(Hauser 与 Toubia 2005) | 未检查 | 检验效用大小与长度尺度是否被扭曲;混入随机查询 |
| 锚定与损失框架 | NAUTILUS 在每一步改进所有目标(Miettinen 等 2010);锚定已被测量(Halstead 等 2026) | 当前最优点对挑战者;有人提议在似然中加入损失厌恶 | 采用只做改进的路径;随机化初始设计 |
| 推荐集与查询集 | 最优推荐集就是最优选择查询(Viappiani 与 Boutilier 2010、2020) | qEUBO(Astudillo 等 2023) | EUBO 类采集函数有更早的决策论基础 |
| 以人为对象时的不确定性与问题选择 | 必然关系与可能关系(Greco、Mousseau 与 Słowiński 2008);用 101 人检验过的启发式(Ciomek、Kadziński 与 Tervonen 2017) | 后验均值的最大化点;在模拟用户上测试 | 报告后验概率为 1 或大于 0 的关系;在同一项以人为对象的任务上比较启发式 |
| 顺序、激励、复杂度 | 随机化顺序;单次二元选择;一致性随复杂度下降(Johnston 等 2017;Day 等 2012) | 很少涉及 | 惩罚在许多属性上不同的选项对;随机化顺序 |
| 以人为对象的评测 | 针对人类决策者的规范与设计(Afsar、Miettinen 与 Ruiz 2021;Afsar 等 2022) | 大多用模拟用户;不报告停止规则 | 报告决策者、偏好信息与停止规则 |
| 从许多人得到一个效用 | Bradley-Terry 似然违背 Pareto 最优性(Ge 等 2024) | 所有比较合并到同一个高斯过程中 | 先为每个用户分别拟合,再用明确的规则聚合 |
40.14 已定、有争议与缺失 #
已定。前景理论的定性模式可以复现,只是效应比最初报告的小(Ruggeri 等,2020)。损失厌恶的方向是可靠的,但其大小取决于任务设计,从对称、无序呈现下的约 1.07 到有序呈现下的约 2.33 不等(Yechiam 与 Zeif,2025)。随机选择可以在实验中区分为评价噪声、随机偏好与有意随机化(Agranov 与 Ortoleva,2017;Agranov 与 Ortoleva,2025)。强制选择会增加不一致(Costa-Gomes 等,2022);据一篇工作论文报告,在允许表达时,约 40% 至 50% 的人表达了不完备偏好(Nielsen 与 Rigotti,2026)。用最大似然把一个 Bradley-Terry 效用拟合到合并的比较上,是一种违背 Pareto 最优性与成对多数一致性的聚合规则(Ge 等,2024),在隐藏异质性下近似于 Borda 计数(Siththaranjan 等,2024)。最优推荐集就是最优选择查询(Viappiani 与 Boutilier,2020)。在营销科学中,存在回答误差时的自适应贝叶斯提问比偏好贝叶斯优化早了十多年。采用 Shannon 成本的理性疏忽导出 logit 模型,采用 Bregman 成本时则可以导出任何加性随机效用模型(Fosgerau 等,2020)。
有争议。复杂性能否解释风险与时间异象(Oprea 对 Banki 等人)。自私类型所占的比例。预期是否决定参照点。Shannon 成本能否描述人的注意力(Dean 与 Neligh,2023)。禀赋效应是否源于损失厌恶。鉴于对检验功效与跨领域普适性的疑虑,较高的显示偏好一致性能否表明存在稳定的潜在偏好。
缺失。检验在设计空间中,“比当前最优点差”是否被编码为损失。为偏好因引出过程本身而改变的人定义福利。在连续设计空间上采用高斯过程或其他非参数代理模型的自适应联合分析研究;在同一项以人为对象的任务上,对多准则决策分析的问题选择启发式与偏好采集函数的正面比较。检验自适应问题的赢家诅咒偏差是否会扭曲高斯过程的效用估计。实现逆贝叶斯主义或为“无法比较”回答建模的偏好贝叶斯优化系统(参见第 27.7 节)。在设计比较中检验,快的回答究竟是准确的回答,还是相距较远的选项之间的回答。
第 40.14 节引用的文献 11
- Ruggeri 等人(2020)Replicating patterns of prospect theory for decision under risk
- Yechiam 与 Zeif(2025)Loss aversion is not robust: A re-meta-analysis
- Agranov 与 Ortoleva(2017)Stochastic Choice and Preferences for Randomization
- Agranov 与 Ortoleva(2025)Ranges of Randomization
- Costa-Gomes 等人(2022)Choice, deferral, and consistency
- Nielsen 与 Rigotti(2026)Revealed Incomplete Preferences
- Ge 等人(2024)Axioms for AI Alignment from Human Feedback
- Siththaranjan 等人(2024)Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
- Viappiani 与 Boutilier(2020)On the equivalence of optimal recommendation sets and myopically optimal query sets
- Fosgerau 等人(2020)Discrete Choice and Rational Inattention: A General Equivalence Result
- Dean 与 Neligh(2023)Experimental Tests of Rational Inattention
延伸阅读 #
- Strzalecki(2025)是随机选择领域的参考书,内容包括随机效用及其替代方案,以及从选择频率中能识别出什么。
- Agranov 与 Ortoleva(2022)简要综述了表明人们有时会有意随机化的实验。
- Nielsen 与 Rigotti(2026)(工作论文)与 Cettolin 与 Riedl(2019)是对不完备偏好最直接的两项测量;添加“无法比较”按钮之前,宜先阅读这两篇。
- Johnston 等人(2017)把几十年的陈述偏好实践提炼为指南,这些指南几乎可以原样用于偏好查询设计。
- Hauser 与 Toubia(2005)最清楚地说明了自适应问题如何使其所估计的量产生偏差。
- Viappiani 与 Boutilier(2020)证明了推荐集与查询集的等价性,EUBO 类采集函数正以此为基础。
- Ge 等人(2024)逐条对照公理,说明了把所有人的比较合并到一个 Bradley-Terry 模型中会带来什么后果。
- Miettinen 等人(2010)与 Afsar 等人(2021)分别介绍了一种避免锚定的交互设计,以及以人为对象评测这类设计的规范。
参考文献
- (1972). Efficiency Estimation of Production Functions. International Economic Review. 引用于 §40.2
- (2021). Assessing the Performance of Interactive Multiobjective Optimization Methods: A Survey. ACM Computing Surveys. 引用于 §40.11
- (2022). Designing empirical experiments to compare interactive multiobjective optimization methods. Journal of the Operational Research Society. 引用于 §40.11
- (2017). Stochastic Choice and Preferences for Randomization. Journal of Political Economy. 引用于 §40.4 §40.14
- (2022). Revealed Preferences for Randomization: An Overview. AEA Papers and Proceedings. 引用于 §40.4
- (2025). Ranges of Randomization. Review of Economics and Statistics. 引用于 §40.4 §40.8 §40.14
- (2022). Evaluating Deliberative Competence: A Simple Method with an Application to Financial Choice. American Economic Review. 引用于 §40.3
- (2002). Giving According to GARP: An Experimental Test of the Consistency of Preferences for Altruism. Econometrica. 引用于 §40.2
- (2013). The Power of Revealed Preference Tests: Ex-Post Evaluation of Experimental Design. Working paper (author's website). 工作论文引用于 §40.2
- (1950). A Difficulty in the Concept of Social Welfare. Journal of Political Economy. 引用于 §40.7
- (2023). qEUBO: A Decision-Theoretic Acquisition Function for Preferential Bayesian Optimization. International Conference on Artificial Intelligence and Statistics. 引用于 §40.11
- (2025). Decisions under Risk Are Decisions under Complexity: Comment. SSRN. 工作论文引用于 §40.12
- (2009). Beyond Revealed Preference: Choice-Theoretic Foundations for Behavioral Welfare Economics *. Quarterly Journal of Economics. 引用于 §40.3
- (2002). Knightian decision theory. Part I. Decisions in Economics and Finance. 引用于 §40.8
- (2009). Rational Decisions. Princeton University Press. 引用于 §40.8
- (1948). On the Rationale of Group Decision-making. Journal of Political Economy. 引用于 §40.7
- (2025a). Introduction to the symposium on reproducibility and replicability in economics: Part I. Economic Inquiry. 引用于 §40.12
- (2025b). Introduction to the symposium on reproducibility and replicability in economics: Part II. Economic Inquiry. 引用于 §40.12
- (1985). Note—A Preference Ranking Organisation Method: (The PROMETHEE Method for Multiple Criteria Decision-Making). Management Science. 引用于 §40.10
- (2024). Meta-analysis of Empirical Estimates of Loss Aversion. Journal of Economic Literature. 引用于 §40.1
- (2019). The many Faces of Human Sociality: Uncovering the Distribution and Stability of Social Preferences. Journal of the European Economic Association. 引用于 §40.1
- (2016). Evaluating replicability of laboratory experiments in economics. Science. 引用于 §40.12
- (2018). Evaluating the replicability of social science experiments in Nature and Science between 2010 and 2015. Nature Human Behaviour. 引用于 §40.12
- (2019). Revealed preferences under uncertainty: Incomplete preferences and preferences for randomization. Journal of Economic Theory. 引用于 §40.8
- (2000). Making Rational Decisions using Adaptive Utility Elicitation. Proceedings of the Seventeenth National Conference on Artificial Intelligence (AAAI-00). 引用于 §40.11
- (2023). Willingness to Accept, Willingness to Pay, and Loss Aversion. National Bureau of Economic Research. 工作论文引用于 §40.1
- (2025b). How General Are Measures of Choice Consistency? Evidence from Experimental and Scanner Data. arXiv. 预印本引用于 §40.2
- (2017). Heuristics for prioritizing pair-wise elicitation questions with additive multi-attribute value models. Omega. 引用于 §40.10
- (1971). Multipart pricing of public goods. Public Choice. 引用于 §40.7
- (2013). Robust ordinal regression in preference learning and ranking. Machine Learning. 引用于 §40.10
- (2022). Choice, deferral, and consistency. Quantitative Economics. 引用于 §40.2 §40.14
- (2022). Belief Elicitation and Behavioral Incentive Compatibility. American Economic Review. 引用于 §40.6
- (2012). Ordering effects and choice set awareness in repeat-response stated preference studies. Journal of Environmental Economics and Management. 引用于 §40.9
- (2023). Experimental Tests of Rational Inattention. Journal of Political Economy. 引用于 §40.5 §40.14
- (1983). Representation of a Preference Ordering by a Numerical Function. Mathematical Economics: Twenty Papers of Gerard Debreu. 引用于 §40.8
- (2023). Endogenous preferences: a challenge to constitutional political economy’s normative foundation? Constitutional Political Economy. 引用于 §40.3
- (1961). Risk, Ambiguity, and the Savage Axioms. The Quarterly Journal of Economics. 引用于 §40.1
- (2019). The Community of Advantage: A Behavioral Economist’s Defence of the Market, Robert Sugden. Oxford University Press, 2018, xxii + 320 pages. Economics and Philosophy. 非同行评审引用于 §40.3
- (2010). Reconsidering the Effect of Market Experience on the "Endowment Effect". Econometrica. 引用于 §40.1
- (2025). Complexity and Time. Journal of the European Economic Association. 引用于 §40.1
- (2020). Discrete Choice and Rational Inattention: A General Equivalence Result. International Economic Review. 引用于 §40.5 §40.14
- (2014). The Limits of Attraction. Journal of Marketing Research. 引用于 §40.12
- (2018). Speed, Accuracy, and the Optimal Timing of Choices. American Economic Review. 引用于 §40.4
- (2024). Axioms for AI Alignment from Human Feedback. Advances in Neural Information Processing Systems 37. 引用于 §40.7 §40.14
- (1973). Manipulation of Voting Schemes: A General Result. Econometrica. 引用于 §40.7
- (2025). Optimal adaptive Bayesian design in choice experiments: performance for the population versus individuals. Marketing Letters. 引用于 §40.9
- (2017). The Limits of Expectations-Based Reference Dependence. Journal of the European Economic Association. 引用于 §40.1
- (2008). Ordinal regression revisited: Multiple criteria ranking using a set of additive value functions. European Journal of Operational Research. 引用于 §40.10
- (2025). Ordinal regression meets online learning: Interactive preference learning for multiple criteria choice and ranking with provable guarantees. European Journal of Operational Research. doi:10.1016/j.ejor.2025.05.045. 引用于 §40.10
- (1973). Incentives in Teams. Econometrica. 引用于 §40.7
- (2026). Multiobjective Optimisation for Others: How Anchoring Effects Change Based on Who Guides the Interaction. Journal of Multi-Criteria Decision Analysis. 引用于 §40.11
- (1955). Cardinal Welfare, Individualistic Ethics, and Interpersonal Comparisons of Utility. Journal of Political Economy. 引用于 §40.7
- (2005). The Impact of Utility Balance and Endogeneity in Conjoint Analysis. Marketing Science. 引用于 §40.9
- (2025). Bayesian Preference Elicitation for Decision Support in Multi‐Objective Optimization. Journal of Multi-Criteria Decision Analysis. 引用于 §40.10
- (1981). Multiple Attribute Decision Making: Methods and Applications, A State-of-the-Art Survey. Springer. 引用于 §40.10
- (2021). Meta-Analysis of Present-Bias Estimation using Convex Time Budgets. The Economic Journal. 引用于 §40.1
- (2016). Preference purification and the inner rational agent: a critique of the conventional wisdom of behavioural welfare economics. Journal of Economic Methodology. 引用于 §40.3
- (2019). When and why defaults influence decisions: a meta-analysis of default effects. Behavioural Public Policy. 引用于 §40.1
- (2017). Contemporary Guidance for Stated Preference Studies. Journal of the Association of Environmental and Resource Economists. 引用于 §40.9
- (1990). Experimental Tests of the Endowment Effect and the Coase Theorem. Journal of Political Economy. 引用于 §40.1
- (2011). Bayesian Persuasion. American Economic Review. 引用于 §40.6
- (2013).“Reverse Bayesianism”: A Choice-Based Theory of Growing Awareness. American Economic Review. 引用于 §40.8
- (2018). Ambiguity aversion is not universal. European Economic Review. 引用于 §40.1
- (2006). A Model of Reference-Dependent Preferences. The Quarterly Journal of Economics. 引用于 §40.1
- (2003). Does Market Experience Eliminate Market Anomalies? The Quarterly Journal of Economics. 引用于 §40.1
- (2004). Neoclassical Theory Versus Prospect Theory: Evidence from the Marketplace. Econometrica. 引用于 §40.1
- (2015). Rational Inattention to Discrete Choices: A New Foundation for the Multinomial Logit Model. American Economic Review. 引用于 §40.5
- (1952). A Set of Independent Necessary and Sufficient Conditions for Simple Majority Decision. Econometrica. 引用于 §40.7
- (1981). Econometric Models of Probabilistic Choice. Structural Analysis of Discrete Data with Econometric Applications. 引用于 §40.4
- (2010). NAUTILUS method: An interactive technique in multiobjective optimization based on the nadir point. European Journal of Operational Research. 引用于 §40.11
- (2019). Random Choice and Learning. Journal of Political Economy. 引用于 §40.4
- (2022). When Choices Are Mistakes. American Economic Review. 引用于 §40.2
- (2026). Revealed Incomplete Preferences. Working paper (author's website). 工作论文引用于 §40.8 §40.14
- (1993). Report of the NOAA Panel on Contingent Valuation, January 11, 1993. National Oceanic and Atmospheric Administration. 非同行评审引用于 §40.9
- (2024). Decisions under Risk Are Decisions under Complexity. American Economic Review. 引用于 §40.1
- (2025). Initial Reply to Banki, Simonsohn, Walatka and Wu (2025). Data Colada. 非同行评审引用于 §40.12
- (2001). Rational Individual Behavior in Markets and Social Choice Processes: The Discovered Preference Hypothesis. Information, Finance and General Equilibrium: Collected Papers on the Experimental Foundations of Economics and Political Science, Volume III. 引用于 §40.2
- (2025). Clone-Robust AI Alignment. arXiv. 预印本引用于 §40.7
- (1968). Classement et choix en présence de points de vue multiples. Revue française d'informatique et de recherche opérationnelle. 引用于 §40.10
- (2020). Replicating patterns of prospect theory for decision under risk. Nature Human Behaviour. 引用于 §40.1 §40.14
- (1977). A scaling method for priorities in hierarchical structures. Journal of Mathematical Psychology. 引用于 §40.10
- (2002). Profile Construction in Experimental Choice Designs for Mixed Logit Models. Marketing Science. 引用于 §40.9
- (2001). Designing Conjoint Choice Experiments Using Managers' Prior Beliefs. Journal of Marketing Research. 引用于 §40.9
- (1975). Strategy-proofness and Arrow's conditions: Existence and correspondence theorems for voting procedures and social welfare functions. Journal of Economic Theory. 引用于 §40.7
- (2019). Ellipsoidal Methods for Adaptive Choice-Based Conjoint Analysis. Operations Research. 引用于 §40.9
- (1954). The Foundations of Statistics. Wiley. 引用于 §40.8
- (2003). Implications of rational inattention. Journal of Monetary Economics. 引用于 §40.5
- (2024). Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF. ICLR 2024. 引用于 §40.7 §40.14
- (2025). Stochastic Choice Theory. Cambridge University Press.
- (2003). Fast Polyhedral Adaptive Conjoint Estimation. Marketing Science. 引用于 §40.9
- (2004). Polyhedral Methods for Adaptive Choice-Based Conjoint Analysis. Journal of Marketing Research. 引用于 §40.9
- (2007). Probabilistic Polyhedral Methods for Adaptive Choice-Based Conjoint Analysis: Theory and Application. Marketing Science. 引用于 §40.9
- (1992). Advances in prospect theory: Cumulative representation of uncertainty. Journal of Risk and Uncertainty. 引用于 §40.1
- (2010). Optimal Bayesian Recommendation Sets and Myopically Optimal Choice Query Sets. Advances in Neural Information Processing Systems. 引用于 §40.11
- (2020). On the equivalence of optimal recommendation sets and myopically optimal query sets. Artificial Intelligence. 引用于 §40.11 §40.14
- (1961). Counterspeculation, Auctions, and Competitive Sealed Tenders. The Journal of Finance. 引用于 §40.7
- (2024). A meta-analysis of loss aversion in risky contexts. Journal of Economic Psychology. 引用于 §40.1
- (2021). Revisiting status quo bias: Replication of Samuelson and Zeckhauser (1988). Meta-Psychology. 引用于 §40.12
- (2025). Loss aversion is not robust: A re-meta-analysis. Journal of Economic Psychology. 引用于 §40.1 §40.14
- (2011). Individually adapted sequential Bayesian conjoint-choice designs in the presence of consumer heterogeneity. International Journal of Research in Marketing. 引用于 §40.9