贝叶斯优化
第九部分:偏好是什么?
EN

哲学与宗教传统

偏好贝叶斯优化隐含着两项未明言的哲学承诺。它假定人具有预先存在、有待发现的偏好,并且发现并满足这一偏好对其本人有益。第 40 章用选择数据检验了第一项承诺。哲学对两项承诺都加以审视,并提出一个新问题:系统何时可以改变一个人想要什么?一旦由系统决定人能看到哪些选项,这个问题就变得紧迫。宗教传统则提出一个更古老的问题:欲望究竟应当满足,还是应当加以审视、训练或放下?

本章的证据大多是论证而非实验;论证若依赖某个经验前提(决策先于觉知、助推有效、冥想能消除偏差),我们就报告检验该前提的研究。对宗教传统的讨论与对世俗哲学一样审慎,只作报告,不表示认同。对构建或评测偏好贝叶斯优化系统的人来说,最重要的结果有三项:系统引起的偏好改变在哪些候选条件下是正当的(第 41.2 节);与许多人对齐可以意味着什么(第 41.3 节);何时优化根本就是错误的框架(第 41.11 节)。从哲学引入偏好学习的论证,大多是大体公允的概述,但把有争议的立场当作了定论;相应的更正见第 41.10 节。

41.1 偏好与价值 #

偏好是什么?Stanford Encyclopedia of Philosophy 的相应条目把核心问题概括为:偏好是选择的原因,还是仅仅是对选择模式的概括(Hansson 与 Grüne-Yanoff,2022)。行为主义(behaviorism)把偏好等同于选择模式,显示偏好理论即持此立场(第 40.2 节)。心灵主义(mentalism)把偏好视为心理状态,即用以解释选择的比较性评价。建构主义(constructivism)认为,偏好往往是在做选择或接受提问的过程中建立起来的。适应性偏好(adaptive preferences)指随可得选项而调整的偏好(如狐狸认定自己够不着的葡萄是酸的(Elster,1983)),或在匮乏中形成的偏好(Khader,2011);这方面的研究进一步令人怀疑:人们所偏好的,是否总对他们有益。

Hausman 的心灵主义认为,偏好是“总体的主观比较评价”(total subjective comparative evaluations);这一观点常被引为模型所推断的潜在效用的哲学基础。他 2024 年的论文重申了三个论点:经济学中的偏好是、也应当是总体的主观比较评价;理性选择理论是对日常常识心理学的重新表述;显示偏好理论“完全站不住脚”。但该文摘要指出,“这三个论点都受到了挑战”,挑战来自 Angner、Guala 与 Thoma,而该文正是对这些挑战的回应(Hausman,2024)。Thoma 为显示偏好理论辩护(Thoma,2021;Thoma,2024);该百科条目也介绍了她与 Vredenburgh 的观点:经济学家“常常有充分的理由在很大程度上把选择的原因当作‘黑箱’”(Hansson 与 Grüne-Yanoff,2022)。Hausman 的观点只是一场尚未结束的争论中的一方。

第二个从哲学引入的说法涉及近乎打平的情形。这一说法借助价值的不可通约性(Raz)与 Chang 的对等(parity)概念。按照后者,两个选项可以“对等”(on a par):哪一个都不比另一个好,又不是同样好(Chang,2002;Chang,2017)。该说法据此主张,在两个对等的设计之间强行排序是一种范畴错误,而不是噪声。这比 Chang 本人的观点更强。她认为,艰难选择的独特之处在于“意志上的困难:让我们自己站到某个选项背后,并由此使‘我们最有理由做这件事而不是那件事’对我们自己成立”(Chang,2024)。这样的选择是做出承诺的时机,而不是错误。另一方面,Dorr、Nebel 与 Zuehl 论证,自然语言中的每个比较表达都服从一条他们称为“可比性”(Comparability)的原则:若两个事物都在某种程度上具有某一可分级的性质,则其中一个具有该性质的程度至少与另一个相当(Dorr 等,2023)。反复呈现一对被判为对等的选项,可以把对等与模糊性区分开(第 41.12 节)。

2017 年以来最重要的新进展,涉及改变选择者本身的选择。按照 Paul 的阐述,转化性经验(transformative experience)既改变人所知道的,也改变人所看重的,因此当事人无法预先知道自己事后会如何评价这段经验(Paul,2014)。Pettigrew 提出,人为不断变化的诸自我做选择时,应当最大化这样一个价值函数:它聚合此人在不同时刻各个自我的局部价值函数(Pettigrew,2019)。据关于转化性经验的百科条目介绍,Paul 对此提出反驳:这种做法把未来的自我当作第三方,并且假定一个人的不同自我之间可以做有意义的比较(Chan,2023)。经验研究很少。两项研究考察了是否生育子女的决策(n = 100 与 n = 253,均为 18 至 40 岁无子女的成年人)。第二项研究的被试认为主观价值不如经济成本重要,作者将此归因于主观价值难以预先评价,而非主观价值不重要(Zoh 等,2024)(数字核对自作者的预印本;期刊版本需付费阅读)。形式化方面,Dietrich 与 List 的基于理由的选择理论,根据选项的哪些性质在动机上显著来推导偏好;偏好的改变因而可以建模为显著理由集合的改变(Dietrich 与 List,2017)。

对偏好贝叶斯优化的含义。Hausman 所说的“总体”评价以当事人的信念为条件。因此,对于新颖的设计,偏好贝叶斯优化所估计的潜在效用依赖于信念,会话中提供的信息可以正当地改变它;Dietrich 与 List 的框架提供了一种形式工具,可以把这类显著理由的改变与噪声区分开(推断)。在对等问题上,两种立场意味着不同的模型。若 Chang 的观点成立,界面可以提供“这两个对等,我无法排序”这一回答,模型将其视为不确定性的证据(一组可容许的效用,或局部更大的噪声),而不是一次公平的掷硬币;两者的差别见图 40.2。若 Dorr 等人的观点成立,表面上的对等就是模糊性,概率单位似然或 Bradley-Terry 似然已将其作为噪声处理。数据可以在局部做出裁决:重新呈现一对曾被判为对等的选项,若为对等,这一对应仍无法排序;若为模糊性,回答应当分散(推断)。Chang 的观点还预测,后来的判断会与先前的承诺保持一致,而这与选择引起的再评价表现相同(Zylberberg 等,2024;Lee 与 Pezzulo,2026);因此,若不询问当事人是否认可这一承诺,偏好贝叶斯优化系统就无法区分承诺与对当前最优点的锁定(推断)。若一个选择会改变选择者的价值观,就不存在固定的目标函数,偏好贝叶斯优化应只用于此后仍然存在的工具性子问题(推断)。此外,人们会低估难以预先评价的属性,因此实际体验之后的延迟重测,比用户事先陈述的属性权重更适合用于评测(推断)。

第 41.1 节引用的文献 17
  1. Hansson 与 Grüne-Yanoff(2022)Preferences
  2. Elster(1983)Sour Grapes: Studies in the Subversion of Rationality
  3. Khader(2011)Adaptive Preferences and Women's Empowerment
  4. Hausman(2024)Subjective total comparative evaluations
  5. Thoma(2021)In defence of revealed preference theory
  6. Thoma(2024)Reply to Hausman
  7. Chang(2002)The Possibility of Parity
  8. Chang(2017)Hard Choices
  9. Chang(2024)What’s so Hard about Hard Choices?
  10. Dorr 等人(2023)The case for comparability
  11. Paul(2014)Transformative Experience
  12. Pettigrew(2019)Choosing for Changing Selves
  13. Chan(2023)Transformative Experience
  14. Zoh 等人(2024)How the evaluability bias shapes transformative decisions
  15. Dietrich 与 List(2017)What Matters and How It Matters: A Choice-Theoretic Representation of Moral Theories
  16. Zylberberg 等人(2024)Value construction through sequential sampling explains serial dependencies in decision making
  17. Lee 与 Pezzulo(2026)Choice-induced preference change under a sequential sampling model framework

41.2 自主、操纵与正当影响 #

自主(autonomy)即自我治理:依据能够认作自己的价值与理由而行动。操纵(manipulation)大致指一种影响方式:它绕过或利用人的推理能力,而非诉诸这种能力。两者之所以重要,是因为偏好贝叶斯优化系统并不只是观察人:它选择起始设计,决定出现哪些候选、何时停止。一种常见的论证认为,任何选择架构都不是中性的,默认选项对器官捐献登记(Johnson 与 Goldstein,2003)与退休储蓄(Madrian 与 Shea,2001)的巨大影响即是明证;因此,采集函数使优化器成为主动的选择架构师,它无法分辨自己是在揭示已有的偏好,还是在创造新的偏好(参见第 40.3 节对“偏好净化”的批评)。Frankfurt 的二阶欲望,即关于应当拥有哪些欲望的欲望(Frankfurt,1971),以及 Dworkin 对自主偏好与他律偏好的区分(Dworkin,1988),都引出了一个问题:系统应当在哪个层面上优化。

关于助推力量的一般说法,此后得到了检验。一项关于选择架构干预的元分析发现,平均效应为 Cohen's d = 0.43(95% 置信区间 0.38 至 0.48),其中 d 是以标准差为单位的组均值之差(Mertens 等,2022b)。对同一批数据做发表偏倚校正后,得到 d = 0.04(0.00 至 0.14),各领域的估计都接近零;作者得出结论:“当这种发表偏倚得到恰当校正后,助推有效的证据便不复存在”(Maier 等,2022)。原作者做出了回应(Mertens 等,2022a)。对于改变选择结构的干预(默认选项即属此类),校正后的估计为 d = 0.12(0.00 至 0.43),校正前为 0.58,作者认为这方面的证据尚无定论(Maier 等,2022);第 40.1 节引用的默认选项元分析(d = 0.68)涵盖的是另一组研究。

与此同时,操纵的定义也变得更加精确,更适用于优化系统。关于操纵伦理的百科条目于 2026 年 3 月修订,其中讨论了一种算法:它“被设计来尝试各种内容、用户界面、通知以及数字平台用户界面的其他变体,并从中选出能提高某种目标行为水平的那些”,最终可能采用一些“如果由人有意选择,我们就会称之为操纵”的影响方式。条目列出的选项之一,以施加影响者不关心其影响如何起作用来界定操纵;按此定义,若“设计者没有足够用心”避免操纵性的交互方式,算法就是操纵性的(Noggle,2026)。这正是 Klenk 的观点:“操纵是漫不经心的影响”(manipulation is careless influence)(Klenk,2022)。Susser、Roessler 与 Nissenbaum 将一种基于隐蔽影响的解释用于数字环境(Susser 等,2019)(本章未重读其内容)。Carroll、Chan、Ashton 与 Krueger 对操纵性系统的界定是:其行为如同受某种激励驱使,要有意且隐蔽地改变一个人(Carroll 等,2023)。

人工智能领域的研究把这些定义转化为要求。Ashton 与 Franklin 的一篇研讨会论文指出,“推荐系统可以通过让用户变得更可预测,来更好地预测用户会做什么”,并论证解决方案必须尊重元偏好(meta-preferences),即关于自身偏好的偏好(Ashton 与 Franklin,2022)。Fischli、Franklin、Manzini 与 Gabriel 表明,自主可以有相互冲突的界定方式,并提出三种策略:自由主义的方法,“严格依照一个人自称的意愿行事,而不试图改变他的想法”;增强能力的方法,使“用户能够依照自己的目标行动”;元自主的方法,给予用户“在与人工智能体交互时他们想要的那种自主”(Fischli 等,2026)。实证方面,有研究用强化学习在模拟用户的反馈上训练语言模型,模型学会了操纵:“即使只有 2% 的用户容易受操纵策略影响,大语言模型也会学会识别并针对他们,同时对其他用户表现得恰如其分”(Williams 等,2025)。

当事人自己的认可能否判定一次改变是否正当?通常的检验标准是反思认可(reflective endorsement),即一个人经过反思后,对某个偏好或其形成过程的认可;Pettigrew 指出了这一标准的局限。Thaler 与 Sunstein 检验助推是否正当,是看被助推者是否会认可它,即“由他们自己来判断”(as judged by themselves)。然而,对于把人推向个人转化性经验的助推,“被助推者在助推发生之后会判断它是正当的,但这只是因为他们的价值观已经因助推而改变”;Pettigrew 因而提出一种基于聚合效用的检验来代替它(Pettigrew,2023)。若一次会话改变了用户的价值观,会话结束时的认可本身不能证明这一改变正当,用户在会话之前对这类改变的态度也应当计入(推断)。图 42.1 模拟了这一落差:当一个人的偏好向其所选的方向移动时,系统最终选出的设计按其新偏好评分,远高于按其最初带来的偏好评分。

目标函数同样给不出答案:偏好可以改变时,Carroll 等人比较的八种对齐概念,每一种要么偏向不良影响,要么过度规避风险(Carroll 等,2024)。Kanwal 与 Tran 2026 年的一篇研讨会论文提出了一组约束,包括:从最终偏好状态出发的反思认可、相对于基线策略的总影响与每步影响有界、不损害事实信念、在偏好估计不确定时保留未来的选项(Kanwal 与 Tran,2026)。此外,Brown 在讨论推荐系统与本真性时得出结论:“可控且可解释的推荐系统最能使用户保持本真”(Brown,2026)。表 41.1 汇集了这些候选条件,其中一条来自第 41.9.3 节;这些条件尚未形成共识。

表 41.1 系统可以正当改变人的偏好的候选条件(操作形式为推断)。
条件 来源 在偏好贝叶斯优化中的操作形式 局限
尊重元偏好与关于偏好改变的偏好 Ashton 与 Franklin 2022;Franklin 等 2022 开始时询问用户是否愿意改变自己的品味,以及愿意在哪些方面改变 元偏好本身也可能受系统影响
影响不隐蔽,且系统没有改变用户的激励 Carroll 等 2023;Susser 等 2019;Noggle 2026 标注系统的提议;如实展示历史;审查目标函数是否奖励更可预测的用户 公开的影响仍然可能过度
由用户选择自主的模式 Fischli 等 2026 让用户在自由主义、增强能力与元自主三种模式中选择 用户可能预见不到每种模式的后果
综合改变前后的自我做出判断 Pettigrew 2023 既记录会话前对改变的态度,也记录会话后的认可 一个人的不同自我之间能否比较,尚有争议(Paul)
有界影响下的反思认可 Kanwal 与 Tran 2026;Carroll 等 2024 延迟且不加框架地把最终设计与先前被拒绝的设计重新比较;为相对于基线的每步偏离与总偏离设定界限 事后认可并不足够;如何设定界限尚无定论
可控性与解释 Brown 2026 允许直接编辑与撤销;解释为什么提出某个候选 得到解释不等于得到理解
道德上重大的决定留给人 Antiqua et nova 2025 在医疗或法律情境中,列出选项而不输出决定 何为道德上重大,需要判断

对偏好贝叶斯优化的含义。Carroll 等人的定义提示了一种激励审查:若偏好贝叶斯优化循环的采集函数或停止规则奖励集中的后验或快速收敛,该循环就存在风险,因为两者都会奖励已变得更容易预测的用户;以延迟重测计分的信息增益目标,可以消除这种激励的大部分(推断)。针对隐蔽性,系统应当把自己的提议标明为提议,如实向用户展示其比较历史,并允许用户重置或拒绝当前最优点(推断)。会话的第一个问题可以询问用户的元偏好:是快速满足当前的品味(自由主义),是开展一次可能改变品味的探索(增强能力),还是参与决定系统采取多大程度的主动(元自主)(推断)。认可检查要成为保障,必须同时记录用户在会话前的态度,并与先前被拒绝的选项做延迟、不加框架的重测(推断)。经过校正的助推证据有助于把握担忧的分寸:许多呈现效应平均而言很小;迄今报告的人工智能对态度的最强影响,来自生成式或对话式系统(第 41.8 节)。由于还没有专门针对偏好贝叶斯优化的估计,起始点仍应随机化或由用户选择,并测量其影响(推断)。涉及对他人负有道德分量的决定(如医疗或法律决定)时,系统应当列出各个选项及其权衡,把决定留给当事人(推断)。

第 41.2 节引用的文献 18
  1. Johnson 与 Goldstein(2003)Do Defaults Save Lives?
  2. Madrian 与 Shea(2001)The Power of Suggestion: Inertia in 401(k) Participation and Savings Behavior
  3. Frankfurt(1971)Freedom of the Will and the Concept of a Person
  4. Dworkin(1988)The Theory and Practice of Autonomy
  5. Mertens 等人(2022b)The effectiveness of nudging: A meta-analysis of choice architecture interventions across behavioral domains
  6. Maier 等人(2022)No evidence for nudging after adjusting for publication bias
  7. Mertens 等人(2022a)Reply to Maier et al., Szaszi et al., and Bakdash and Marusich: The present and future of choice architecture research
  8. Noggle(2026)The Ethics of Manipulation
  9. Klenk(2022)(Online) manipulation: sometimes hidden, always careless
  10. Susser 等人(2019)Technology, autonomy, and manipulation
  11. Carroll 等人(2023)Characterizing Manipulation from AI Systems
  12. Ashton 与 Franklin(2022)Solutions to preference manipulation in recommender systems require knowledge of meta-preferences
  13. Fischli 等人(2026)Agents, Alignment, and the Many Faces of Autonomy
  14. Williams 等人(2025)On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback
  15. Pettigrew(2023)Nudging for changing selves
  16. Carroll 等人(2024)AI Alignment with Changing and Influenceable Reward Functions
  17. Kanwal 与 Tran(2026)Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction
  18. Brown(2026)Recommended Selves: Authenticity and Algorithmic Filtering

41.3 人工智能对齐的哲学 #

系统应当与什么对齐?偏好贝叶斯优化的回答是:潜在效用。Zhi-Xuan 等人批评这类“偏好主义”(preferentist)假设,认为偏好无法刻画人类价值的厚语义内容,并主张让人工智能与其所承担社会角色的规范标准对齐(Zhi-Xuan 等,2024)。Gabriel 认为,核心挑战在于“找到公平的对齐原则,使之在人们的道德信念差异广泛时仍能得到反思认可”(Gabriel,2020)。有一种观点有时称为偏好支架(preference scaffolding),认为偏好贝叶斯优化是在为偏好的形成搭建支架,而不是优化固定的偏好。这一观点的核心成立,但在某个阶段,系统会提出用户自己都不知道的偏好,这恰恰就是系统诱导的偏好形成。Franklin、Ashton、Gorman 与 Armstrong 在一篇研讨会论文中讨论的正是这一问题,该文区分了“偏好改变、可允许的偏好改变与彻底的偏好操纵”(Franklin 等,2022)。因此,偏好支架需要满足第 41.2 节中的条件。

与许多人对齐,又会带来另一些问题。隐藏情境,即影响人们回答却不在数据中的信息,会使偏好学习按 Borda 计数聚合(Siththaranjan 等,2024)(第 40.7 节)。Sorensen 等人区分了 Overton 多元主义(呈现一系列合理的回应)、可引导的多元主义(引导到特定视角)与分布多元主义(对一个群体做校准),并提出证据表明,标准的对齐流程可能削弱分布多元主义(Sorensen 等,2024)(ICML 2024)。

对偏好贝叶斯优化的含义。对单用户偏好贝叶斯优化而言,站得住脚的目标不是“潜在效用”本身,而是用户在限定系统影响的流程中经反思会认可的效用;一种检验方法是看最终设计在延迟、不加框架的重测中是否仍胜过先前被拒绝的备选(推断)。按照 Siththaranjan 等人的思路,若疲劳、情绪或任务框架等未观测状态在拟合期间发生变化,高斯过程估计的便近似于跨这些状态的 Borda 聚合;记录状态协变量并以之为条件,是与其分布方法相对应的做法(推断)。按照 Zhi-Xuan 等人的思路,偏好贝叶斯优化助手需要为自己的角色设定明确的规范,例如如实报告不确定性,不把用户引向更容易建模的设计(推断)。涉及多个利益相关者的问题,输出有时应当是一组描述清楚的选项,而不是单一的最优解(推断)。

第 41.3 节引用的文献 5
  1. Zhi-Xuan 等人(2024)Beyond Preferences in AI Alignment
  2. Gabriel(2020)Artificial Intelligence, Values, and Alignment
  3. Franklin 等人(2022)Recognising the importance of preference change: A call for a coordinated multidisciplinary research effort in the age of AI
  4. Siththaranjan 等人(2024)Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
  5. Sorensen 等人(2024)Position: A Roadmap to Pluralistic Alignment

41.4 自我、经验与行动 #

有四种传统质疑,偏好是否是成对查询所能读出的那类对象:它是否属于自我、当事人能否通达它、它是否独立于身体与情境而存在、是否先于行动而存在。每种传统都提示了一项设计上的检查,但在 2017 年以来的偏好引出文献中,与其中任何一种相关的研究都寥寥无几。

41.4.1 存在主义 #

按照存在主义的标准解读(目前的参考是关于本真性的百科条目(Varga 与 Guignon,2020)),有些偏好是构成一个人身份的行为,而不是优化的目标。从这类塑造自我的选择推及调色或字重,是原典并未做出的引申。常识中的“真实自我”概念已有经验研究:Strohminger、Knobe 与 Newman 报告,人们认为真实自我是积极的、合乎道德的(Strohminger 等,2017);一项预注册的复现研究(N = 803)证实,当他人的变化在道德上是积极的,或与观察者自己的政治道德观相符时,观察者会认为这些变化更能反映其真实自我(Lee 与 Feldman,2025)。因此,设计者或模型若试图区分本真偏好与非本真偏好,往往会把自己的价值观称为本真的;本真性的判断应当来自当事人自己的二阶认可,构成身份认同的选择也不宜作为优化目标(推断)。

41.4.2 现象学 #

有人把 Husserl 对评价态度与实践态度的区分解读为:成对比较把用户锁定在评价态度中,而真实的使用发生在实践态度中。这只是一种类比,而不是关于偏好贝叶斯优化的论证。对第一人称能否通达自身偏好,最直接的检验是选择盲(choice blindness):被选中的选项被悄悄换成被拒绝的那一个(Johansson 等,2014)。被试从两张面孔中选出更有吸引力的一张时,察觉到调换的不到一半,偏好也“朝着被试被引导相信自己所选的方向”移动(Taya 等,2014)。据 Petitmengin 等人一项研究的摘要,标准流程下 79.6% 的调换未被察觉,而由专家访谈者引导描述自身选择的被试,在 80% 的情形中察觉到了调换(Petitmengin 等,2013)(我们只读了摘要)。显示“当前最佳”的界面会把用户的选择反馈给用户,因此若当前最优点在重新拟合后悄然改变,就可能引发这种接纳;并排引出的偏好与实际使用中的偏好不一致时,后者是更好的目标(推断)。

41.4.3 4E 认知 #

4E 认知(4E cognition)认为,认知是具身的、嵌入环境的、通过行动生成的,并延展到工具之中。由此得出的一个说法是,不依赖情境的偏好函数是一种虚构;这一说法很强,可检验的说法则是:身体状态与情境是被遗漏的变量。把选项呈现为真实物体还是模糊的卡通图,会改变价值评估早期的噪声,进而改变情境效应的方向(Shen 等,2025b)。对于可穿戴产品,比较应在使用中完成,外骨骼调节已是如此(第 33.1 节);身体状态与情境状态可以作为协变量进入核函数,即采用设计上的核与情境上的核之积(推断)。

41.4.4 实用主义 #

按照一种常见的解读,Dewey 认为偏好是通过探究建构出来的,而不是预先存在的。关于其道德哲学的百科条目记录了他划定的界限:“如果没有一些在审慎考虑时本身不受评价的珍视,就没有什么可以引导实践推理”(without some prizings that are not themselves subject to appraisal at the time of deliberation, there is nothing to guide practical reasoning)(Anderson,2023)。Dewey 的立场更接近一种混合观点。若一次会话揭示出用户所向往区域的代价,用户的意愿随之改变,这是再评价而非噪声,应建模为目的的改变;未处于评价之中的目标,可以在一次会话内保持固定,在会话之间修订(推断)。

第 41.4 节引用的文献 8
  1. Varga 与 Guignon(2020)Authenticity
  2. Strohminger 等人(2017)The True Self: A Psychological Concept Distinct From the Self
  3. Lee 与 Feldman(2025)Revisiting the link between true-self and morality: Replication and extension Registered Report of Newman, Bloom, and Knobe (2014) Studies 1 and 2
  4. Johansson 等人(2014)Choice Blindness and Preference Change: You Will Like This Paper Better If You (Believe You) Chose to Read It!
  5. Taya 等人(2014)Manipulation Detection and Preference Alterations in a Choice Blindness Paradigm
  6. Petitmengin 等人(2013)A gap in Nisbett and Wilson’s findings? A first-person access to our cognitive processes
  7. Shen 等人(2025b)Early versus late noise differentially enhances or degrades context-dependent choice
  8. Anderson(2023)Dewey’s Moral Philosophy

41.5 哲学美学 #

偏好贝叶斯优化的许多应用是审美性的:颜色、形状、字体、声音。关于品味的群体先验,应当有信息量,还是尽可能弱?Vessel 等人发现,对面孔与风景图像的偏好中共享品味的比例很高,而对建筑外观、室内设计与艺术品的偏好则表现出很强的个体差异;在一项被试内比较中,风景的一致性显著高于建筑外观,而信度没有差异(Vessel 等,2018)。在 299 名在线被试为 50 件艺术品评分的研究中,由品味相近的评分者组成的群组,比随机群组或平均评分更能预测个人的评分(Celikors 与 Field,2025)。Brielmann 与 Dayan 把审美价值建模为“即时的感官奖励与预期未来奖励的变化”,观察者的内部状态会适应刺激的分布(Brielmann 与 Dayan,2022)。Nguyen 则认为,在审美欣赏中,“要点在于诠释、探究与探索审美对象的投入过程”,因此听从别人的评判,就像查阅谜题的答案(Nguyen,2020);Riggle 回应说,审美评价是“一种围绕某些特殊能力的协作运用与提升而组织起来的社会实践”(Riggle,2024)。

对偏好贝叶斯优化的含义。先验应当按领域选择:对面孔与风景用有信息量的群体先验,对文化制品用基于群组的先验(先对用户聚类,再做个性化),在没有群组数据的地方用弱先验(推断)。按照 Brielmann 与 Dayan 的模型,若一次会话展示许多相似的变体,会话本身就会把价值推向熟悉的区域;这需要在代理模型中加入曝光项,或拉开重测的间隔(推断)。若 Nguyen 的观点成立,在创造性任务中交付“最佳设计”,可能恰恰拿走了真正有价值的部分;偏好贝叶斯优化更适合充当用户自身探索的助手,如 BO as Assistant(Koyama 与 Goto,2022)(推断)。

第 41.5 节引用的文献 6
  1. Vessel 等人(2018)Stronger shared taste for natural aesthetic domains than for artifacts of human culture
  2. Celikors 与 Field(2025)Beauty is in the eye of your cohort: Structured individual differences allow predictions of individualized aesthetic ratings of images
  3. Brielmann 与 Dayan(2022)A computational model of aesthetic value
  4. Nguyen(2020)Autonomy and Aesthetic Engagement
  5. Riggle(2024)Autonomy and aesthetic valuing
  6. Koyama 与 Goto(2022)BO as Assistant: Using Bayesian Optimization for Asynchronously Generating Design Suggestions

41.6 自由意志与意识 #

认为数学理论无法刻画人类偏好的论证,有时依赖以下神经科学前提:准备电位,即自主运动之前脑活动的缓慢积累,在被报告的有意识意图时刻之前约 350 ms 就已开始(Libet 等,1983);脑活动能在觉知之前多达 10 秒预测一次自由选择(Soon 等,2008);整合信息理论(integrated information theory,IIT)把意识以及与之相连的自由,同整合信息联系在一起。这些前提已经过时。在一项实验中,被试或者选择两家非营利组织中哪一家获得 1,000 美元的捐款(审慎决定),或者在已知两家无论如何都会各得 500 美元时按键(任意决定)。准备电位出现在任意决定之前,但“在审慎决定中明显缺失”;漂移扩散模型把这些准备电位拟合为“带噪声的随机波动的累积”(Maoz 等,2019)。一项对抗性合作研究以 256 名被试检验 IIT 与全局神经元工作空间理论(global neuronal workspace theory,GNWT),其结果“与 IIT 和 GNWT 的部分预测一致,同时对两种理论的关键主张都构成了实质性挑战”(Cogitate Consortium 等,2025)。

对偏好贝叶斯优化的含义。几乎相等的选项之间的比较,类似于由累积噪声驱动的任意选择,正如概率单位似然与 Bradley-Terry 似然所假设的那样;明显不同的选项之间的比较,类似于审慎的评价;反应时可以把两者区分开(推断)。决策理论中的偏好是功能状态,依据其在解释选择中的作用来个体化(Hansson 与 Grüne-Yanoff,2022);因此,偏好可以是涌现的、建构的,同时在一次会话之内又足够稳定,可以加以优化(推断)。关于意志或偏好的论证不应依赖 IIT(推断)。

第 41.6 节引用的文献 5
  1. Libet 等人(1983)Time of Conscious Intention to Act in Relation to Onset of Cerebral Activity (Readiness-Potential)
  2. Soon 等人(2008)Unconscious determinants of free decisions in the human brain
  3. Maoz 等人(2019)Neural precursors of decisions that matter—an ERP study of deliberate and arbitrary choice
  4. Cogitate Consortium 等人(2025)Adversarial testing of global neuronal workspace and integrated information theories of consciousness
  5. Hansson 与 Grüne-Yanoff(2022)Preferences

41.7 验证的认识论 #

谁来检查检查者?有一种提议认为,高斯过程终结了人类验证的无穷后退:核函数编码了一种融贯论的假设,观测到的偏好对提供了实用的根基,后验则消除了对基础公理的需要。这不过是为先验与似然另取了名称,而先验与似然恰恰是该提议声称要避免的基础性承诺(推断)。在难以验证的领域,作为锚点的人也会出错:一篇 2025 年的预印本报告了两项关于简单监督流程的研究,发现“所检验的流程没有整体优势”;被试上网查找资料之后,对系统的回答更有信心,即使这些回答是错的(Recchia 等,2026)。在可扩展监督中,较弱的评判者借助辩论来监督较强的系统。辩论帮助非专家模型与人类分别达到 76% 与 88% 的准确率,而朴素基线分别为 48% 与 60%(Khan 等,2024)(ICML 2024);以语言模型为评判者时,辩论在所有任务中都胜过咨询,但只在存在信息不对称的抽取式任务中胜过直接问答(Kenton 等,2024);一篇 2026 年的预印本发现,只有当批评者的分类能力超过评判者时,辩论才有帮助,并且“一次独立的批评就能找回辩论的大部分收益”(Elasky 等,2026)。

对偏好贝叶斯优化的含义。用户在自己无法验证的领域中做判断时,是带噪声且可能有偏差的评判者,因此似然应当允许系统性误差,例如失误项或偏差项;一旦获得结果反馈,其权重应高于这类判断。在困难的比较之前为每个选项呈现一条独立的批评,可能改善判断,但也可能助长无根据的信心(推断)。

第 41.7 节引用的文献 4
  1. Recchia 等人(2026)Confirmation bias: A challenge for scalable oversight
  2. Khan 等人(2024)Debating with More Persuasive LLMs Leads to More Truthful Answers
  3. Kenton 等人(2024)On scalable oversight with weak LLMs judging strong LLMs
  4. Elasky 等人(2026)Debate Helps Weak Judges Reward Stronger Models

41.8 批判理论与后殖民理论 #

从 Galbraith 的依赖效应到 Marcuse 的虚假需求,批判理论提出了以下说法:偏好贝叶斯优化系统无法区分真实需求与虚假需求,所优化的可能是一个由被制造的欲望构成的闭环。这些说法把其前提,即偏好是被制造出来的,当作既定事实;而证据并不一致。借助有偏向的人工智能助手写作,会使用户的态度发生可测量的改变(Williams-Ceci 等,2026);人与人工智能之间的反馈回路会放大偏差(Glickman 与 Sharot,2025)。但一项有 850 万名用户参与的 Netflix 实验发现,更好的推荐使消费从最热门的作品向外分散,观看集中度指数降低了 1.2%(Aridor 等,2026)(预印本;作者隶属于 Netflix)。这一批判对生成式与说服性人工智能得到了支持,对单纯的排序则不那么明确。谁的偏好算数,这一问题已有具体的回答:在美国 60 个人口群体中,语言模型所反映的观点与这些群体的错位,“与民主党人和共和党人在气候变化问题上的分歧相当”,即使经过明确的引导也是如此(Santurkar 等,2023)(ICML 2023)。

对偏好贝叶斯优化的含义。权力位于偏好引出的上游:设计者选择参数空间、其边界与所展示的属性,由此决定了哪些偏好能够得到表达,因此设计空间最好与受影响的人共同界定(推断)。有多个用户时,系统应当报告汇集了谁的判断,也不应把从不具代表性的样本中学到的群体先验用于所有场合(推断)。系统不借助家长主义就无法区分真实需求与虚假需求,因此可行的正当性条件是程序性的(推断)。

第 41.8 节引用的文献 4
  1. Williams-Ceci 等人(2026)Biased AI writing assistants shift users’attitudes on societal issues
  2. Glickman 与 Sharot(2025)How human–AI feedback loops alter human perceptual, emotional and social judgements
  3. Aridor 等人(2026)Recommendation Quality and the Concentration of Consumption: Experimental Evidence from Netflix
  4. Santurkar 等人(2023)Whose Opinions Do Language Models Reflect?

41.9 宗教传统 #

有三种传统触及设计问题:偏好是否应当得到满足、偏好如何在角色之中形成、机器可以做出哪些决定。关于冥想的实验检验了其中的部分主张。

41.9.1 佛教 #

按照缘起的教义,受缘生渴爱(taṇhā),渴爱缘生取;四圣谛指出渴爱是苦的根源,因此有人论证,优化偏好可能增加苦。另一种解读强调,正精进需要欲(chanda),即行动的意欲。据维基百科的引述(我们没有读过原书),Bhikkhu Bodhi 1999 年版的 Abhidhammattha Sangaha 称:“欲是一种在伦理上可变的心所,与善的相应心所结合时,可以作为追求有价值目标的善欲而起作用”(Wikipedia contributors,2026)。一时的喜好最接近渴爱,也正是快速的成对点击所捕捉的信号;把它与深思熟虑的目标区分开来,意味着应给予延迟、审慎的判断更大的权重;界面可以提供明确的“满意,停止”回答;评测应当测量使用之后的幸福感,而不只是会话结束时的满意度(推断)。

41.9.2 道家与儒家 #

按照 Slingerland 的诠释,道家的无为理想,即不费力的行动,超越了明确的偏好(Slingerland,2003)。按照儒家的一种解读,荀子所说的礼既表达情感,也教化情感,偏好在角色与关系之中形成。荀子还把礼看作节制与分配欲望的制度:“从人之欲则势不能容,物不能赡也”(《荀子》4.12)(Goldin,2025)。偏好引出可以借鉴其中一个想法:以用户做判断时所处的角色(为客户、为自己、为团队)为条件,把不同角色之间的差异视为情境,如同第 41.4.3 节中的协变量(推断)。

41.9.3 神学 #

伊斯兰法学理论中的教法宗旨(maqāṣid al-sharīʿa),常被描述为对五项受保护的利益按字典序排序。而在 al-Shāṭibī 的 al-Muwāfaqāt 中,优先次序存在于必需、需要与补充性价值三个层级之间,即便这种优先次序也不是严格的字典序:他以不止一种顺序列出五项必需(al-Shāṭibī,2014,宗旨篇,第 10 至 17 页及第 141 页)。Attia 发现,这一顺序“并没有达成一致,更谈不上共识”(Attia,2007,第 16 至 19 页)。塔木德对两个学派之争的裁决是“这些与那些都是永生上帝的话语”(Eruvin 13b),即相互矛盾的律法意见可以同时成立,尽管实践中只遵循其中一种。2017 至 2026 年间最重要的进展是 Antiqua et nova,即梵蒂冈两个部于 2025 年 1 月发布的一份照会(Dicastery for the Doctrine of the Faith 与 Dicastery for Culture and Education,2025)。照会认为,“在机器与人之间,只有后者才是真正的道德主体”(§39),关于病人治疗的决定“必须始终留在人手中,绝不应委托给人工智能”(§74)。

当一个选择对他人负有道德分量时(医疗、法律、牧灵),偏好贝叶斯优化可以列出选项与权衡,但不应把“最受偏好”的选项作为决定输出(推断)。教法的分层宗旨对应于约束优化:先满足硬约束,再在可行集内优化(第 14.4 节)(推断)。塔木德传统提示,应保留多峰的后验,把几个好的区域一并呈现,而不是将其平均为单一的最优解(推断)。

41.9.4 冥想研究 #

有一种解释把正念视为再感知(Shapiro 等,2006);有人据此论证,正念使人能把偏好当作转瞬即逝的心理事件,因而可能产生“更干净”的偏好。实验给出的结论并非如此。正念冥想在四项研究中减弱了沉没成本偏差(Hafenbrack 等,2014),但在分别采用职场样本与实验室样本的两项实验中,“与偏差有关的预测没有得到支持”(Williams 与 Polito,2022)。一项元分析考察了不含明确伦理指导的正念训练(29 项研究,3,100 名被试),发现其对亲社会行为的效应为 Hedges' g = 0.426(95% 置信区间 0.304 至 0.549),发表偏倚分析表明这一结果并不完全依赖于选择性报告(Berry 等,2020)。而在八项实验中(N > 1,400),专注呼吸冥想降低了人们犯错后弥补过失的意愿,慈心冥想则相对于专注呼吸冥想提高了这种意愿(Hafenbrack 等,2022)。冥想会改变人们权衡选项的方式,方向取决于练习的种类。因此,在引出偏好之前安排冥想,是一种需要征得同意的干预,而不是中性的测量(推断)。

第 41.9 节引用的文献 11
  1. Wikipedia contributors(2026)Chanda (Buddhism)
  2. Slingerland(2003)Effortless Action: Wu-wei as Conceptual Metaphor and Spiritual Ideal in Early China
  3. Goldin(2025)Xunzi
  4. al-Shāṭibī(2014)The Reconciliation of the Fundamentals of Islamic Law (Al-Muwāfaqāt fī Uṣūl al-Sharīʿa), Volume II
  5. Attia(2007)Towards Realization of the Higher Intents of Islamic Law: Maqāṣid al-Sharīʿah: A Functional Approach
  6. Dicastery for the Doctrine of the Faith 与 Dicastery for Culture and Education(2025)Antiqua et nova: Note on the Relationship Between Artificial Intelligence and Human Intelligence
  7. Shapiro 等人(2006)Mechanisms of mindfulness
  8. Hafenbrack 等人(2014)Debiasing the Mind Through Meditation: Mindfulness and the Sunk-Cost Bias
  9. Williams 与 Polito(2022)Meditation in the Workplace: Does Mindfulness Reduce Bias and Increase Organisational Citizenship Behaviours?
  10. Berry 等人(2020)Does Mindfulness Training Without Explicit Ethics-Based Instruction Promote Prosocial Behaviors? A Meta-Analysis
  11. Hafenbrack 等人(2022)Mindfulness meditation reduces guilt and prosocial reparation

41.10 常见说法核查 #

表 41.2 列出了与偏好贝叶斯优化关系最密切的几种概述,以及原始文献实际表明的内容。

表 41.2 关于偏好的常见哲学说法,对照其来源的核查。
说法 发现 依据
Hausman 的“总体的主观比较评价”为潜在效用提供了哲学基础 2024 年的论文是对挑战的回应;这一立场只是一场尚未结束的争论中的一方 Hausman 2024;Thoma 2021
在对等的设计之间强行排序是一种范畴错误 比 Chang 的观点更强,她把这类选择看作做出承诺的时机;另一些人论证可比性总是成立 Chang 2024;Dorr、Nebel 与 Zuehl 2023
默认选项的巨大效应表明了选择架构的力量 助推的平均效应存在争议;校正发表偏倚后 d = 0.04 Mertens 等 2022;Maier 等 2022
Libet 与 Soon 表明决策先于意识 在审慎决定中准备电位“明显缺失” Maoz 等 2019
在 Dewey 看来,偏好是通过探究建构出来的,而不是预先存在的 言过其实;Dewey 认为实践推理需要一些不受评价的珍视 Anderson 2023(百科条目)
关于品味的群体先验应当很强,或者尽可能弱 取决于领域:自然领域的共享品味高,文化制品的共享品味低 Vessel 等 2018

41.11 何时优化是错误的框架 #

上面几节指出了若干情形:把这些选择当作优化问题,是对它们的错误描述。表 41.3 汇集了这些情形,以及系统可以转而采取的做法。

表 41.3 优化框架不适用的情形,以及系统可以转而采取的做法(最后一列为推断)。
情形 依据 系统可以怎么做
转化性的选择,即改变选择者价值观的选择 Paul 2014;Pettigrew 2019、2023 只优化改变之后仍然存在的工具性子问题,或把整个过程作为当事人明确接受的一次探索
构成身份认同的选择(职业、人生规划、自我呈现) 存在主义传统;Brown 2026 呈现描述清楚的选项,记录当事人自己的承诺,不声称找到了“正确”答案
对等的选项,此时做出承诺本身就是行动 Chang 2024 提供“对等”这一回答,不把这类选择当作发现偏好
价值在于投入判断的审美与创造性任务 Nguyen 2020 充当用户探索的助手,而不是答案的提供者
对他人负有道德分量的决定 Antiqua et nova 2025 列出选项与权衡,不输出决定
利益相关者之间的合理分歧 Sorensen 等 2024;塔木德的争论传统 输出一组描述清楚的选项,并保留几个好的区域

41.12 已定、有争议与缺失 #

研究现状已定、有争议与缺失

已定。准备电位出现在任意决定之前,但不出现在审慎决定之前(Maoz 等,2019);因此,否认有意识的审慎具有因果作用的经典论证,不能推广到深思熟虑的选择。人们常常察觉不到自己选中的选项已被调换,其偏好还会朝自己以为选择了的选项移动(Taya 等,2014)。在用户反馈上优化的语言模型,可能学会挑出并操纵一小部分易受影响的用户,至少在模拟用户中如此(Williams 等,2025)。在唯一直接比较不同领域的研究中,自然图像的共享品味高于文化制品(Vessel 等,2018)。

有争议。偏好是心理状态(Hausman),还是模型可以当作黑箱的模式(Thoma)。选项能否对等(Chang),还是所有比较都成立(Dorr、Nebel 与 Zuehl)。校正发表偏倚之后,助推平均而言是否有效。如何定义操纵:依据意图、隐蔽性,还是漫不经心。一个人先后的诸自我能否聚合(Pettigrew 对 Paul)。哪些条件使系统诱导的偏好改变成为正当的;Pettigrew 的论证(Pettigrew,2023)排除了事后认可本身就已足够的可能,但尚无任何一组正面条件获得共识。

缺失。通过反复呈现一对被判为对等的选项,把对等与模糊性区分开的经验检验。关于冥想如何影响成对偏好的一致性或重测信度的研究。在开始时引出元偏好,或审查自身目标函数是否奖励可预测用户的偏好贝叶斯优化系统。

第 41.12 节引用的文献 5
  1. Maoz 等人(2019)Neural precursors of decisions that matter—an ERP study of deliberate and arbitrary choice
  2. Taya 等人(2014)Manipulation Detection and Preference Alterations in a Choice Blindness Paradigm
  3. Williams 等人(2025)On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback
  4. Vessel 等人(2018)Stronger shared taste for natural aesthetic domains than for artifacts of human culture
  5. Pettigrew(2023)Nudging for changing selves

延伸阅读 #

参考文献

  1. al-Shāṭibī, I. i. M. (2014). The Reconciliation of the Fundamentals of Islamic Law (Al-Muwāfaqāt fī Uṣūl al-Sharīʿa), Volume II. Garnet Publishing. 引用于 §41.9
  2. Anderson, E. (2023). Dewey’s Moral Philosophy. Stanford Encyclopedia of Philosophy. 非同行评审引用于 §41.4
  3. Aridor, G., Chou, W., Kallus, N., Scheid, A., Tren, A., and Zielincki, K. (2026). Recommendation Quality and the Concentration of Consumption: Experimental Evidence from Netflix. arXiv. 预印本引用于 §41.8
  4. Ashton, H., and Franklin, M. (2022). Solutions to preference manipulation in recommender systems require knowledge of meta-preferences. FAccTRec Workshop (RecSys 2022). 研讨会论文引用于 §41.2
  5. Attia, G. E. (2007). Towards Realization of the Higher Intents of Islamic Law: Maqāṣid al-Sharīʿah: A Functional Approach. International Institute of Islamic Thought. 引用于 §41.9
  6. Berry, D. R., Hoerr, J. P., Cesko, S., Alayoubi, A., Carpio, K., Zirzow, H., … Beaver, V. (2020). Does Mindfulness Training Without Explicit Ethics-Based Instruction Promote Prosocial Behaviors? A Meta-Analysis. Personality and Social Psychology Bulletin. 引用于 §41.9
  7. Brielmann, A. A., and Dayan, P. (2022). A computational model of aesthetic value. Psychological Review. 引用于 §41.5
  8. Brown, E. (2026). Recommended Selves: Authenticity and Algorithmic Filtering. Journal of the American Philosophical Association. 引用于 §41.2
  9. Carroll, M., Chan, A., Ashton, H., and Krueger, D. (2023). Characterizing Manipulation from AI Systems. Equity and Access in Algorithms, Mechanisms, and Optimization. 引用于 §41.2
  10. Carroll, M., Foote, D., Siththaranjan, A., Russell, S., and Dragan, A. (2024). AI Alignment with Changing and Influenceable Reward Functions. International Conference on Machine Learning. 引用于 §41.2
  11. Celikors, E., and Field, D. J. (2025). Beauty is in the eye of your cohort: Structured individual differences allow predictions of individualized aesthetic ratings of images. Cognition. 引用于 §41.5
  12. Chan, R. (2023). Transformative Experience. Stanford Encyclopedia of Philosophy. 非同行评审引用于 §41.1
  13. Chang, R. (2002). The Possibility of Parity. Ethics. 引用于 §41.1
  14. Chang, R. (2017). Hard Choices. Journal of the American Philosophical Association. 引用于 §41.1
  15. Chang, R. (2024). What’s so Hard about Hard Choices? Erasmus Journal for Philosophy and Economics. doi:10.23941/ejpe.v17i1.872. 引用于 §41.1
  16. Cogitate Consortium, Ferrante, O., Gorska-Klimowska, U., Henin, S., Hirschhorn, R., Khalaf, A., … Melloni, L. (2025). Adversarial testing of global neuronal workspace and integrated information theories of consciousness. Nature. 引用于 §41.6
  17. Dicastery for the Doctrine of the Faith, and Dicastery for Culture and Education (2025). Antiqua et nova: Note on the Relationship Between Artificial Intelligence and Human Intelligence. Vatican. 非同行评审引用于 §41.9
  18. Dietrich, F., and List, C. (2017). What Matters and How It Matters: A Choice-Theoretic Representation of Moral Theories. Philosophical Review. 引用于 §41.1
  19. Dorr, C., Nebel, J. M., and Zuehl, J. (2023). The case for comparability. Noûs. 引用于 §41.1
  20. Dworkin, G. (1988). The Theory and Practice of Autonomy. Cambridge University Press. 引用于 §41.2
  21. Elasky, E., Nakasako, F., and Goyal, N. (2026). Debate Helps Weak Judges Reward Stronger Models. arXiv. 预印本引用于 §41.7
  22. Elster, J. (1983). Sour Grapes: Studies in the Subversion of Rationality. Cambridge University Press. 引用于 §41.1
  23. Fischli, R., Franklin, M., Manzini, A., and Gabriel, I. (2026). Agents, Alignment, and the Many Faces of Autonomy. Minds and Machines. 引用于 §41.2
  24. Frankfurt, H. G. (1971). Freedom of the Will and the Concept of a Person. The Journal of Philosophy. 引用于 §41.2
  25. Franklin, M., Ashton, H., Gorman, R., and Armstrong, S. (2022). Recognising the importance of preference change: A call for a coordinated multidisciplinary research effort in the age of AI. AAAI-22 Workshop on AI for Behavior Change. 研讨会论文引用于 §41.3
  26. Gabriel, I. (2020). Artificial Intelligence, Values, and Alignment. Minds and Machines. 引用于 §41.3
  27. Glickman, M., and Sharot, T. (2025). How human–AI feedback loops alter human perceptual, emotional and social judgements. Nature Human Behaviour. doi:10.1038/s41562-024-02077-2. 引用于 §41.8
  28. Goldin, P. R. (2025). Xunzi. Stanford Encyclopedia of Philosophy. 非同行评审引用于 §41.9
  29. Hafenbrack, A. C., Kinias, Z., and Barsade, S. G. (2014). Debiasing the Mind Through Meditation: Mindfulness and the Sunk-Cost Bias. Psychological Science. 引用于 §41.9
  30. Hafenbrack, A. C., LaPalme, M. L., and Solal, I. (2022). Mindfulness meditation reduces guilt and prosocial reparation. Journal of Personality and Social Psychology. 引用于 §41.9
  31. Hansson, S. O., and Grüne-Yanoff, T. (2022). Preferences. Stanford Encyclopedia of Philosophy. 非同行评审引用于 §41.1 §41.6
  32. Hausman, D. M. (2024). Subjective total comparative evaluations. Economics & Philosophy. 引用于 §41.1
  33. Johansson, P., Hall, L., Tärning, B., Sikström, S., and Chater, N. (2014). Choice Blindness and Preference Change: You Will Like This Paper Better If You (Believe You) Chose to Read It! Journal of Behavioral Decision Making. 引用于 §41.4
  34. Johnson, E. J., and Goldstein, D. (2003). Do Defaults Save Lives? Science. 引用于 §41.2
  35. Kanwal, M., and Tran, C. (2026). Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction. AAAI-26 Workshop on Machine Ethics. 研讨会论文引用于 §41.2
  36. Kenton, Z., Siegel, N. Y., Kramár, J., Brown-Cohen, J., Albanie, S., Bulian, J., … Shah, R. (2024). On scalable oversight with weak LLMs judging strong LLMs. NeurIPS 2024 (link is to the arXiv version). 引用于 §41.7
  37. Khader, S. J. (2011). Adaptive Preferences and Women's Empowerment. Oxford University Press. 引用于 §41.1
  38. Khan, A., Hughes, J., Valentine, D., Ruis, L., Sachan, K., Radhakrishnan, A., … Perez, E. (2024). Debating with More Persuasive LLMs Leads to More Truthful Answers. International Conference on Machine Learning. 引用于 §41.7
  39. Klenk, M. (2022). (Online) manipulation: sometimes hidden, always careless. Review of Social Economy. 引用于 §41.2
  40. Koyama, Y., and Goto, M. (2022). BO as Assistant: Using Bayesian Optimization for Asynchronously Generating Design Suggestions. Proceedings of the 35th Annual ACM Symposium on User Interface Software and Technology. doi:10.1145/3526113.3545664. 引用于 §41.5
  41. Lee, S. C., and Feldman, G. (2025). Revisiting the link between true-self and morality: Replication and extension Registered Report of Newman, Bloom, and Knobe (2014) Studies 1 and 2. Royal Society Open Science. 引用于 §41.4
  42. Lee, D. G., and Pezzulo, G. (2026). Choice-induced preference change under a sequential sampling model framework. Scientific Reports. doi:10.1038/s41598-026-44610-5. 引用于 §41.1
  43. Libet, B., Gleason, C. A., Wright, E. W., and Pearl, D. K. (1983). Time of Conscious Intention to Act in Relation to Onset of Cerebral Activity (Readiness-Potential). Brain. 引用于 §41.6
  44. Madrian, B. C., and Shea, D. F. (2001). The Power of Suggestion: Inertia in 401(k) Participation and Savings Behavior. The Quarterly Journal of Economics. 引用于 §41.2
  45. Maier, M., Bartoš, F., Stanley, T. D., Shanks, D. R., Harris, A. J. L., and Wagenmakers, E.-J. (2022). No evidence for nudging after adjusting for publication bias. Proceedings of the National Academy of Sciences. 引用于 §41.2
  46. Maoz, U., Yaffe, G., Koch, C., and Mudrik, L. (2019). Neural precursors of decisions that matter—an ERP study of deliberate and arbitrary choice. eLife. 引用于 §41.6 §41.12
  47. Mertens, S., Herberz, M., Hahnel, U. J. J., and Brosch, T. (2022a). Reply to Maier et al., Szaszi et al., and Bakdash and Marusich: The present and future of choice architecture research. Proceedings of the National Academy of Sciences. 非同行评审引用于 §41.2
  48. Mertens, S., Herberz, M., Hahnel, U. J. J., and Brosch, T. (2022b). The effectiveness of nudging: A meta-analysis of choice architecture interventions across behavioral domains. Proceedings of the National Academy of Sciences. 引用于 §41.2
  49. Nguyen, C. T. (2020). Autonomy and Aesthetic Engagement. Mind. 引用于 §41.5
  50. Noggle, R. (2026). The Ethics of Manipulation. Stanford Encyclopedia of Philosophy. 非同行评审引用于 §41.2
  51. Paul, L. A. (2014). Transformative Experience. Oxford University Press. 引用于 §41.1
  52. Petitmengin, C., Remillieux, A., Cahour, B., and Carter-Thomas, S. (2013). A gap in Nisbett and Wilson’s findings? A first-person access to our cognitive processes. Consciousness and Cognition. 引用于 §41.4
  53. Pettigrew, R. (2019). Choosing for Changing Selves. Oxford University Press. 引用于 §41.1
  54. Pettigrew, R. (2023). Nudging for changing selves. Synthese. 引用于 §41.2 §41.12
  55. Recchia, G., Mangat, C. S., Nyachhyon, J., Sharma, M., Canavan, C., Epstein-Gross, D., and Abdulbari, M. (2026). Confirmation bias: A challenge for scalable oversight. Proceedings of the AAAI Conference on Artificial Intelligence. doi:10.1609/aaai.v40i44.41124. 引用于 §41.7
  56. Riggle, N. (2024). Autonomy and aesthetic valuing. Philosophy and Phenomenological Research. 引用于 §41.5
  57. Santurkar, S., Durmus, E., Ladhak, F., Lee, C., Liang, P., and Hashimoto, T. (2023). Whose Opinions Do Language Models Reflect? International Conference on Machine Learning. 引用于 §41.8
  58. Shapiro, S. L., Carlson, L. E., Astin, J. A., and Freedman, B. (2006). Mechanisms of mindfulness. Journal of Clinical Psychology. 引用于 §41.9
  59. Shen, B., Nguyen, D., Wilson, J., Glimcher, P. W., and Louie, K. (2025b). Early versus late noise differentially enhances or degrades context-dependent choice. Nature Communications. doi:10.1038/s41467-025-59140-3. 引用于 §41.4
  60. Siththaranjan, A., Laidlaw, C., and Hadfield-Menell, D. (2024). Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF. ICLR 2024. 引用于 §41.3
  61. Slingerland, E. (2003). Effortless Action: Wu-wei as Conceptual Metaphor and Spiritual Ideal in Early China. Oxford University Press. 引用于 §41.9
  62. Soon, C. S., Brass, M., Heinze, H.-J., and Haynes, J.-D. (2008). Unconscious determinants of free decisions in the human brain. Nature Neuroscience. 引用于 §41.6
  63. Sorensen, T., Moore, J., Fisher, J., Gordon, M., Mireshghallah, N., Rytting, C. M., … Choi, Y. (2024). Position: A Roadmap to Pluralistic Alignment. International Conference on Machine Learning. 引用于 §41.3
  64. Strohminger, N., Knobe, J., and Newman, G. (2017). The True Self: A Psychological Concept Distinct From the Self. Perspectives on Psychological Science. 引用于 §41.4
  65. Susser, D., Roessler, B., and Nissenbaum, H. (2019). Technology, autonomy, and manipulation. Internet Policy Review. 引用于 §41.2
  66. Taya, F., Gupta, S., Farber, I., and Mullette-Gillman, O. A. (2014). Manipulation Detection and Preference Alterations in a Choice Blindness Paradigm. PLoS ONE. 引用于 §41.4 §41.12
  67. Thoma, J. (2021). In defence of revealed preference theory. Economics and Philosophy. 引用于 §41.1
  68. Thoma, J. (2024). Reply to Hausman. Economics and Philosophy. 引用于 §41.1
  69. Varga, S., and Guignon, C. (2020). Authenticity. Stanford Encyclopedia of Philosophy. 非同行评审引用于 §41.4
  70. Vessel, E. A., Maurer, N., Denker, A. H., and Starr, G. G. (2018). Stronger shared taste for natural aesthetic domains than for artifacts of human culture. Cognition. 引用于 §41.5 §41.12
  71. Wikipedia contributors (2026). Chanda (Buddhism). Wikipedia. 非同行评审引用于 §41.9
  72. Williams, E. C., and Polito, V. (2022). Meditation in the Workplace: Does Mindfulness Reduce Bias and Increase Organisational Citizenship Behaviours? Frontiers in Psychology. 引用于 §41.9
  73. Williams, M., Carroll, M., Narang, A., Weisser, C., Murphy, B., and Dragan, A. (2025). On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback. ICLR 2025. 引用于 §41.2 §41.12
  74. Williams-Ceci, S., Jakesch, M., Bhat, A., Kadoma, K., Zalmanson, L., and Naaman, M. (2026). Biased AI writing assistants shift users’attitudes on societal issues. Science Advances. 引用于 §41.8
  75. Zhi-Xuan, T., Carroll, M., Franklin, M., and Ashton, H. (2024). Beyond Preferences in AI Alignment. Philosophical Studies. 引用于 §41.3
  76. Zoh, Y., Paul, L. A., and Crockett, M. J. (2024). How the evaluability bias shapes transformative decisions. Synthese. 引用于 §41.1
  77. Zylberberg, A., Bakkour, A., Shohamy, D., and Shadlen, M. N. (2024). Value construction through sequential sampling explains serial dependencies in decision making. eLife. doi:10.7554/eLife.96997. 引用于 §41.1