神经科学与计算认知科学
前两章报告的是行为:人们选择什么、选择有多一致、在什么条件下如此(第 37 章、第 38 章)。本章追问,对于构建或评估偏好贝叶斯优化系统的人,大脑以及心智的计算模型还能补充什么:头脑中是否存在单一的价值量表,如偏好贝叶斯优化的潜在效用所预设;反应时在回答之外还揭示了什么;比较中的噪声从何而来,是否保持不变。
2017 至 2026 年间的主要变化,是把价值看作在决策过程中建构、又被选择本身修正的量。在单个任务之内,标量价值有因果证据支持,但跨任务的基数“共同货币”仍有争议。价值判断中的噪声取决于先前见过的价值,因此对价值判断而言,辨别力在最优点附近并不下降,只有感知参数才会如此。注意对选择有因果影响,但影响很小。反应时已经带着理论保证进入偏好学习,只是尚未进入有真人参与的实时实验。对个体而言,神经信号只比自我报告多出约 4 个百分点;主动推断也还不是偏好贝叶斯优化的可用替代方案。本章的核心是第 39.3 节的漂移扩散模型,读者可以在图 39.1 中运行它。
39.1 神经经济学与基于价值的决策 #
神经经济学寻找大脑对价值的表征。一种常见的说法认为,腹内侧前额叶皮层(vmPFC)与眶额皮层(OFC),即位于前额后方和眼睛上方的脑区,把不同种类奖励的价值整合为共同货币(common currency),即可以比较食物、金钱与音乐的单一量表(Levy 与 Glimcher,2012;Bartra 等,2013)。发表于 Behavioral Neuroscience 的一篇批评文章认为,与价值相关的信号可能反映的是显著性、唤醒或注意;OFC 的编码会适应所提供价值的范围;选择还可以通过直接学习行动策略而完全绕过价值。其核心主张是:大脑并不默认表征基数的共同货币价值,也不默认用它来做选择(Hayden 与 Niv,2021)。
在单个任务之内,因果证据有所加强。电刺激猕猴的 OFC,会提高单个报价的价值,从而改变它们的选择(Ballesta 等,2020);对 36 名癫痫患者的颅内记录显示,可以从 vmPFC 与外侧 OFC 的活动中解码出主观价值,其中既有线性信号(价值),也有二次信号(把握度)(Lopez-Persem 等,2020)。OFC 神经元会适应所提供价值的范围,但只是部分适应;在线性决策模型中,由此抬高的活动下限会增加选择的变异性(Conen 与 Padoa-Schioppa,2019)。价值也是在决策过程中建构的。在元认知控制(metacognitive control)模型中,快速而不确定的初始价值估计,会在心理努力与把握度的权衡下逐步细化;该模型能同时预测反应时、把握度、改变主意以及选择引起的偏好改变,其作者认为,偏好逆转可以是一次再评价,而不是噪声(Lee 与 Daunizeau,2021)。选择引起的偏好改变有多大,见第 37.2.2 节。
对偏好贝叶斯优化的含义。这些证据支持在单个任务、单次会话之内存在标量的潜在效用,它只在单调变换的意义下可识别(第 18.4 节),这与偏好学习只需要顺序一致性的论证相符(Sun 等,2025);这些证据并不支持不经重新校准就把学到的量表用于另一个任务(推断)。编码会部分适应所呈现的范围,因此早期过宽的探索性查询,可能导致之后的变异性更高(推断)。把握度与价值一同编码,因此按每次比较的把握度缩放概率单位链接的噪声,是实现异方差噪声的直接办法(推断)。所有这些证据都来自食物、消费品、果汁报价与金钱;对于连续的设计参数,它们只是工作假设(第 39.9 节)。
第 39.1 节引用的文献 8
- Levy 与 Glimcher(2012)The root of all value: a neural common currency for choice
- Bartra 等人(2013)The valuation system: A coordinate-based meta-analysis of BOLD fMRI experiments examining neural correlates of subjective value
- Hayden 与 Niv(2021)The case against economic values in the orbitofrontal cortex (or anywhere else in the brain)
- Ballesta 等人(2020)Values encoded in orbitofrontal cortex are causally related to economic choices
- Lopez-Persem 等人(2020)Four core properties of the human brain valuation system demonstrated in intracranial signals
- Conen 与 Padoa-Schioppa(2019)Partial Adaptation to the Value Range in the Macaque Orbitofrontal Cortex
- Lee 与 Daunizeau(2021)Trading mental effort for confidence in the metacognitive control of value-based decision-making
- Sun 等人(2025)Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives
39.2 神经营销与神经预测 #
一种常见的说法认为,神经信号能揭示人们无法报告的偏好。其最著名的支持来自一项研究:青少年听歌时,伏隔核(腹侧纹状体的一部分)的活动预测了这些歌曲后来的销量,而他们自己的评分却没有(Berns 与 Moore,2012)。这一证据的基础很单薄:排除之后只剩 27 名青少年;120 首歌中有 87 首有销量数据;伏隔核活动与对数销量的相关为 (),平均喜爱度评分的相关为 (不显著);逻辑回归只正确分类了 30% 的热门歌曲;而且数据来自一项原本为研究社会影响而设计的实验(Berns 与 Moore,2012)。我们没有找到独立的直接复现。后来一篇论文报告热门歌曲分类准确率达 97%(Merritt 等,2023),但经审查发现:数据在划分训练集和测试集之前就做了过采样,只涵盖 24 首歌和 33 名听众,校正后的准确率几乎不比随机猜测好(Kapoor 与 Narayanan,2023);这是一份非同行评审的审查报告。
更扎实的进展出现在群体层面。30 名被试接受了功能磁共振成像(fMRI)扫描,其伏隔核活动预测了几周后互联网众筹活动的结果,而被试自己的选择却没有;这一结果在第二项研究中得到了复现(Genevsky 等,2017)。在 2,956 人和 992 人的互联网样本中,基于行为的预测随实验室样本在人口统计学上的代表性而变化,基于脑活动的预测则始终显著(Genevsky 等,2025)。对个体而言,收益有限:把几种脑电图(EEG)测量与机器学习结合,预测每个人在六种食品中最喜欢和最不喜欢的那种,准确率为 68.5%,只比单用自我报告高 4.07 个百分点(Hakim 等,2021)。我们没有找到关于神经预测准确率的元分析,而且样本外证据主要来自同一个实验室。
对偏好贝叶斯优化的含义。偏好贝叶斯优化学习的是个人的效用,而神经预测的优势是在汇总层面上记录的,因此其最有依据的用途是充当群体先验或热启动,而不是个人的似然(推断)。一次会话只有几十次比较,无法训练个人解码器;任何使用神经代理指标的偏好贝叶斯优化系统,都需要严格的留出评测(推断)。
第 39.2 节引用的文献 6
- Berns 与 Moore(2012)A neural predictor of cultural popularity
- Merritt 等人(2023)Accurately predicting hit songs using neurophysiology and machine learning
- Kapoor 与 Narayanan(2023)No, you still cannot predict hit songs using machine learning
- Genevsky 等人(2017)When Brain Beats Behavior: Neuroforecasting Crowdfunding Outcomes
- Genevsky 等人(2025)Neuroforecasting reveals generalizable components of choice
- Hakim 等人(2021)Machines learn neuromarketing: Improving preference prediction from self-reports using multiple EEG measures and machine learning
39.3 序贯抽样与反应时 #
一种常见的说法借鉴决策场理论(Busemeyer 与 Townsend,1993)与注意漂移扩散模型(Krajbich 等,2010),把反应时视为偏好不确定性的天然度量:回答快,表明价值差异大;回答慢,表明差异小。有两项理论结果支持这一说法:在基于偏好的赌博机中,反应时对容易的查询最有信息量(Li 等,2024a);一篇 2026 年的工作论文则表明,选择与反应时合在一起,可以在若干点上识别潜在偏好的分布(Benkert 等,2026)。
39.3.1 漂移扩散模型 #
漂移扩散模型(drift-diffusion model,DDM)把二选一决策描述为带噪声的证据随时间累积的过程(Ratcliff,1978)。设想一个从零开始的计数器。每隔几毫秒,若证据样本支持选项 A,计数器就向上移动一点;若支持 B,就向下移动一点。平均而言,它以速率 漂移,即漂移率(drift rate),但每一步都带有噪声。计数器首次到达 (选择 A)或 (选择 B)时,决策即告完成;边界(boundary) 表示谨慎程度。反应时等于到达边界所需的时间,加上用于知觉和按键的固定非决策时间(non-decision time)。在基于价值的选择中,漂移与价值之差成正比:,其中 。
在单位噪声下,该模型可由两个闭式解描述(Bogacz 等,2006)。选择 A 的概率与平均决策时间分别为
第一个式子是 的逻辑函数。换言之,一个描述决策过程的模型,所给出的选择概率恰好是第 16.4 节的逻辑(Bradley-Terry)链接,其斜率由回答者的谨慎程度 与漂移尺度 共同决定。
推导为什么漂移扩散模型给出逻辑链接
- 设 为计数器位于 时,在到达 之前先到达 的概率。在一小段时间 内,计数器移动 ,再加上方差为 的噪声,因此 ,其中 。
- 把 展开到二阶并取期望,利用 与 ,得到 ,因此 。
- 这个线性方程的通解是 ,代入即可验证。
- 由边界条件确定常数: 与 给出 。
- 起点处 。将分母分解为 并约去公因子,得 ,即 的逻辑函数。
这一模型使关于反应时的说法变得精确。 时漂移消失,选择如同抛硬币,平均决策时间取最大值 。随着 增大,选择概率在 0 或 1 附近饱和,反应时则继续下降。效用差超过中等大小之后,选择几乎不再提供新信息,反应时却仍在提供,这正是反应时对容易的查询帮助最大的原因(Li 等,2024a)。
可以尝试以下几点:
- 设 。模拟决策约各有一半终止于两个边界,决策时间的分布最宽。
- 把 提高到 1 及以上。选择概率已接近 1,平均反应时仍在下降:在这一范围内,只有反应时能区分大的效用差与非常大的效用差。
- 提高谨慎程度 。选择变得更准确、也更慢,逻辑曲线变陡:比较模型会把链接的斜率吸收进噪声尺度 ,而这一斜率既反映回答者的效用,也反映其谨慎程度。
- 打开总体价值效应并提高 。同样的效用差现在产生更快、更准确的选择,忽略总体价值的模型会把这个回答解读为更大的效用差距。
39.3.2 注意与反应时的测量结果 #
注意的因果效应如今有了定量估计,见图 39.2。汇总在二选一偏好选择中操纵注意的实验:增加某个选项被注视的总时间,会把选择它的概率提高到 (95% 置信区间为 );操纵最后被注视的是哪个选项,得到 ();操纵首次注视则没有效应(,,);轻微的发表偏倚会使这些值略微降低(Bhatnagar 与 Orquin,2022)。对未被注视选项的折扣并非常数。在提出注意模型的那项研究中,对 39 名被试合并数据的最佳拟合为 0.3,而对每名被试分别拟合,得到的平均值为 0.52,标准差为 0.3(Krajbich 等,2010);在一项预注册研究()中,选项的总体价值较高时,注视效应减弱(Ting 与 Gluth,2025)。
可以尝试以下几点:
- 把三个区间与 0.5 那条线比较。总注视时间(.523 至 .560)与最后一次注视(.518 至 .547)的区间位于其上方;首次注视的区间(.497 至 .516)则跨越这条线。
- 选择总注视时间,并把会话设为 40 次比较。若每次比较都带有这一操纵,被注视更久的选项在 40 个回答中会比无效应时约多赢得 1.6 个(0.9 至 2.4)。
- 下方面板中,合并折扣 0.3 低于个体拟合的均值 0.52,而个体拟合的标准差 0.3 与合并值本身一样大。
反应时能测量偏好强度,但存在混杂。在三个选择领域中,两个高价值选项之间的决策大多更快、更准确;在漂移扩散模型中,这意味着更高的漂移率,与对价值的敏感性递减相反(Shevlin 等,2022)。总体价值与反应时之间的负相关在 Ting 与 Gluth(2025)中得到复现。以反应时作为偏好强度的代理指标,往往带有噪声并受到混杂(Kaufmann 等,2025)。
39.3.3 反应时进入偏好学习 #
2017 至 2026 年间的主要进展,是反应时带着理论保证进入了偏好学习,高斯过程也包括在内。Shvartsman 等人(2024)用一族偏斜的三参数分布对漂移扩散模型的似然作了可微近似,使反应时可以进入二元选择的高斯过程模型;他们报告,在三个真实的心理物理学与偏好数据集上,潜在价值的估计和留出选择的预测都有所改进(UAI 2024;细节见第 27.2 节)。Sawarni 等人(2025)在 EZ 扩散模型(EZ-diffusion model)下构建了一个利用反应时的损失。EZ 扩散模型是一种简化的漂移扩散模型,其参数可以由反应时的均值、方差和准确率以闭式算出(Wagenmakers 等,2007)。对于线性奖励,标准偏好学习的误差随奖励大小指数增长,这一损失把它变为多项式增长,并且可以推广到非参数的奖励空间。一篇 2026 年 7 月的预印本在理性疏忽的框架下分析每个成对标签;理性疏忽是指人们为信息付出代价,只按信息的价值投入相应的注意(第 40.5 节)。该文认为,异质的注意可能使 Bradley-Terry 模型恢复出误导性的排序;而在感知比较中,反应时与注视携带着关于差距大小的信息,这是标签所缺少的(Xing,2026)。
对偏好贝叶斯优化的含义。选择与反应时的联合似然已经可以与高斯过程代理模型一起使用。这一似然应把总体价值(或其代理量,例如两个选项当前的后验均值)作为漂移率或边界的协变量;否则,会话后期两个选项都很好时,快速的回答会被误读为效用差很大(推断),图 39.1 显示的正是这种误读。应优先采用同时、并排的呈现方式;必须依次体验的选项(音频、触觉、步态)应平衡呈现顺序,并在似然中加入顺序偏差项;预期的呈现效应是选择概率上的几个百分点(推断)。个体折扣的分散程度表明,应使用按用户设定的偏差或折扣参数,而不是 0.3 这样的群体常数(推断)。现有的反应时高斯过程研究使用的是离线数据;能在人在回路中检验这些建议的实验,列于第 39.9 节。
第 39.3 节引用的文献 14
- Busemeyer 与 Townsend(1993)Decision field theory: A dynamic-cognitive approach to decision making in an uncertain environment
- Krajbich 等人(2010)Visual fixations and the computation and comparison of value in simple choice
- Li 等人(2024a)Enhancing Preference-based Linear Bandits via Human Response Time
- Benkert 等人(2026)Time is Knowledge: What Response Times Reveal
- Ratcliff(1978)A theory of memory retrieval
- Bogacz 等人(2006)The physics of optimal decision making: A formal analysis of models of performance in two-alternative forced-choice tasks
- Bhatnagar 与 Orquin(2022)A meta-analysis on the effect of visual attention on choice
- Ting 与 Gluth(2025)High overall values mitigate gaze-related effects in perceptual and preferential choices
- Shevlin 等人(2022)High-value decisions are fast and accurate, inconsistent with diminishing value sensitivity
- Kaufmann 等人(2025)ResponseRank: Data-Efficient Reward Modeling through Preference Strength Learning
- Shvartsman 等人(2024)Response Time Improves Gaussian Process Models for Perception and Preferences
- Sawarni 等人(2025)Preference Learning with Response Time: Robust Losses and Guarantees
- Wagenmakers 等人(2007)An EZ-diffusion model for response time and accuracy
- Xing(2026)Attention Limited Reward Learning
39.4 有效编码与归一化 #
Weber 论证认为,随着优化器向高效用区域收敛,人分辨选项的能力会下降,因此查询应当瞄准期望效用差超过最小可觉差(一个人能可靠察觉的最小差异)的区域。一个相关的论证把比较噪声看作围绕稳定效用的固定表达噪声,并以理性疏忽(Sims,2003;Matějka 与 McKay,2015)作为其微观基础。
对于价值判断,Weber 论证不成立:高价值选项之间的决策更快、更准确(第 39.3.2 节)。有效编码(efficient coding)原则认为,容量有限的系统应把分辨率花在输入最频繁的地方;它预测,辨别力追踪的是环境中价值的密度,而非价值的大小。Polanía 等人(2019)让 38 名被试对 64 种熟悉的食物评分并从中选择,这是四项实验中的第一项,四项实验共有 127 名被试。该研究的估值模型在编码资源有限的条件下最大化信息,同时解释了评分的变异性、选择的一致性与把握度,并预测在先验密度高的价值处选择更一致。相关研究发现:较少见的数字编码得更带噪声(Prat-Carrabin 与 Woodford,2022);在两项预注册实验中,冒险行为对出现更频繁的收益更敏感(Frydman 与 Jin,2022);在奖励方差较低的环境中,猴子的选择更敏感(Zimmermann 等,2018)。可见,噪声本身随情境与历史而变化,而不是围绕稳定效用的固定表达噪声。
除法归一化(divisive normalization)把每个选项的价值除以所提供总价值的某种度量,至今仍有争议。带有除法归一化的离散选择模型,对选择集大小与构成的效应拟合得比其他模型更好,后者也包括范围归一化(Webb 等,2021);但归因于归一化的干扰项效应未能复现(第 37.2.3 节),而在价值需要习得的任务中,范围归一化胜出(第 37.3.1 节)。区分早期噪声与晚期噪声提供了一种调和:选项的表征模糊时(早期噪声),第三个选项会改善辨别;时间压力占主导时(晚期噪声),情境会损害辨别;同时包含两种噪声的除法归一化模型拟合得最好(Shen 等,2025b)。
对偏好贝叶斯优化的含义。采集函数若把查询集中在当前最优点附近,就会缩小回答者体验到的效用范围。有效编码预测,在会话过程中,这一区域的敏感性会上升,只是部分地、滞后地上升;噪声尺度固定的概率单位似然,会把这种后期的精确误读为更陡的效用曲面(推断)。若噪声尺度依赖于选项效用相对于迄今所呈现效用的典型程度,就可以表示这一点;更简单的做法是插入几对取自很少访问区域的固定参照对,直接在那里测量辨别力(推断)。某个领域中占主导的是 Weber 式的压缩还是有效编码,可以在会话的不同阶段用几对重复配对来检查:对于价值判断,证据支持有效编码,而感知参数(刚度、力矩、颜色)存在下限(第 39.7 节)(推断)。
第 39.4 节引用的文献 8
- Sims(2003)Implications of rational inattention
- Matějka 与 McKay(2015)Rational Inattention to Discrete Choices: A New Foundation for the Multinomial Logit Model
- Polanía 等人(2019)Efficient coding of subjective value
- Prat-Carrabin 与 Woodford(2022)Efficient coding of numbers explains decision bias and noise
- Frydman 与 Jin(2022)Efficient Coding and Risky Choice
- Zimmermann 等人(2018)Multiple timescales of normalized value coding underlie adaptive choice behavior
- Webb 等人(2021)The Normalization of Consumer Valuations: Context-Dependent Preferences from Neurobiological Constraints
- Shen 等人(2025b)Early versus late noise differentially enhances or degrades context-dependent choice
39.5 预测加工与主动推断 #
自由能原理(free-energy principle)提出,大脑,或许还有一切自组织系统,都通过行动来最小化变分自由能;变分自由能是一个界,衡量在内部模型下其感觉有多出乎意料(Friston,2010)。主动推断(active inference)把这一原理用于行动:智能体选择使期望自由能(expected free energy)最小的行动,偏好则是智能体对预期观察到的结果的先验信念。期望自由能可以分解为实用价值(达到偏好的结果)与认知价值(获取信息)(Friston 等,2015)。有人称这种分解“恰好”(exactly)就是偏好贝叶斯优化中探索与利用的平衡,其中的探索项“从第一性原理推导出来,而不是人为添加”(derived from first principles rather than added by hand),后者如上置信界的权重(第 12.4 节)。
这一说法需要加以限定。有人论证,某个泛函是变分自由能向未来的自然延伸,而这一泛函反而会主动抑制探索,因此探索并不能直接从最小化自由能中得出(Millidge 等,2021)。一篇 2026 年的预印本给出了最小化期望自由能的智能体的第一个理论保证:“足够的好奇心”(sufficient curiosity)既能保证后验一致性,也能保证累积遗憾有界;好奇心太少会导致短视的利用,太多则会导致不必要的探索和遗憾(Li 等,2026c)。换言之,这一权重仍然需要设定,与上置信界的探索权重一样。该理论的基础也有争议:Markov 毯,即理论中把系统与其环境分隔开的边界,一直在推断工具与物理边界这两种含义之间被混为一谈(Bruineberg 等,2021);“暗室问题”指最小化意外的智能体应当去寻找一个黑暗、安静的房间,对于偏好即预测的观点,这是一个真正的难题(Klein,2018)。三篇 2026 年的预印本把主动推断与贝叶斯优化结合起来:一篇是上文提到的遗憾保证;一篇提出“务实的好奇心”(pragmatic curiosity),按关于任务相关潜变量的信息增益加上期望遗憾势函数来为查询打分(Li 等,2026e);还有一篇提出 BOBA,这一采集函数加入了关于时变目标函数将如何变化的前瞻不确定性,在合成的动态基准上改善了遗憾(Kelly 等,2026)。
对偏好贝叶斯优化的含义。截至 2026 年 9 月,主动推断还不是偏好贝叶斯优化的可用替代方案(推断,依据上述研究)。在贝叶斯优化中,每一个具体实现都归结为一个采集函数,即实用项加上加权的信息增益项,与现有的信息论采集函数相近;它既不取代高斯过程偏好模型,也不取代成对似然。这三篇预印本的摘要没有报告任何使用人类成对反馈的实验(我们没有读到全文),也没有研究在人类偏好数据上把期望自由能采集函数与 EUBO 类采集函数(第 19.4 节)相比较。此外,两个框架所说的偏好含义不同:在主动推断中,偏好是智能体关于自身观测的先验;在偏好贝叶斯优化中,人的效用是有待推断的隐藏状态。因此,把偏好贝叶斯优化改写为主动推断,只是重新编码了目标函数,并没有对人类偏好的结构施加任何约束(推断)。主动推断可能在一个方面有用:把人建模为先验偏好会被学习和更新的智能体(Sajid 等,2021),可以得到偏好漂移的生成模型,不过我们没有找到以这种方式拟合的人类偏好数据(推断)。
第 39.5 节引用的文献 9
- Friston(2010)The free-energy principle: a unified brain theory?
- Friston 等人(2015)Active inference and epistemic value
- Millidge 等人(2021)Whence the Expected Free Energy?
- Li 等人(2026c)Curiosity is Knowledge: Self-Consistent Learning and No-Regret Optimization with Active Inference
- Bruineberg 等人(2021)The Emperor's New Markov Blankets
- Klein(2018)What do predictive coders want?
- Li 等人(2026e)Pragmatic Curiosity: A Unified Framework for Hybrid Learning and Optimization via Active Inference
- Kelly 等人(2026)BOBA: Dynamic Bayesian Optimization through Bayesian Active Inference
- Sajid 等人(2021)Active Inference: Demystified and Compared
39.6 精神药理学与成瘾 #
对于稳定偏好,药理学提供了看似最有力的反例。一种常见的说法区分“想要”(wanting)与“喜欢”(liking),前者归因于中脑边缘多巴胺,后者归因于大脑中的阿片类享乐热点(Berridge 与 Robinson,1998),并提议用多输出高斯过程为两者建模。两者在人类自我报告中可以分离,这方面的证据很弱。在一项双盲被试内研究()中,左旋多巴使音乐愉悦感与对音乐的动机同时提高,利培酮则使两者同时降低(Ferreri 等,2019);在 131 名志愿者中,多巴胺拮抗剂氨磺必利与阿片类拮抗剂纳曲酮都减少了体力付出,但都没有改变对“想要”或“喜欢”的主观评分(Korb 等,2020)。多巴胺能药物确实会改变行为。在一项针对 3,090 名接受治疗的帕金森病患者的横断面研究中,服用多巴胺激动剂的患者比不服用的患者更常出现冲动控制障碍(17.1% 对 6.9%,比值比 2.72)(Weintraub 等,2010);在 31 名健康男性中,左旋多巴削弱了定向探索(Chakroun 等,2020)。
对偏好贝叶斯优化的含义。成对选择与评分可能无法把“想要”与“喜欢”分开,因此双输出模型需要不同的观测通道,例如用付出的努力测量“想要”,用消费过程中的评分测量“喜欢”(推断)。用药状态是缓慢变化的情境变量:在健康与康复领域开展的偏好贝叶斯优化研究应当记录用药状态,并允许以周为尺度、未必单调的漂移;而且由于探索与噪声随多巴胺状态而变化,噪声参数应当按会话而非按人来固定(推断)。当药物改变了一个人的偏好时,以哪一种偏好为准,是一个关于权威的问题;在临床场景中,避开药物峰值效应或在随访时做一次反思性认可核查,是一种合理的保障(推断),第 41.2 节讨论了这一点。目前还没有研究在药理学操纵下引出过成对偏好。
第 39.6 节引用的文献 5
- Berridge 与 Robinson(1998)What is the role of dopamine in reward: hedonic impact, reward learning, or incentive salience?
- Ferreri 等人(2019)Dopamine modulates the reward experiences elicited by music
- Korb 等人(2020)Dopaminergic and opioidergic regulation during anticipation and consumption of social and nonsocial rewards
- Weintraub 等人(2010)Impulse Control Disorders in Parkinson Disease: A Cross-Sectional Study of 3090 Patients
- Chakroun 等人(2020)Dopaminergic modulation of the exploration/exploitation trade-off in human decision-making
39.7 运动学习与适应 #
一种常见的说法认为,在偏好来自亲身体验、用户又有真正专长的场合,偏好贝叶斯优化效果很好。关于专长的说法需要细化:在一项踝关节外骨骼研究中,该研究所称的知情(knowledgeable)用户(两组的技术背景不同)比无经验的用户偏好更高的力矩,而且无经验用户偏好的力矩在实验过程中不断上升;可见,知识与接触改变的是偏好的设置本身,而不只是围绕它的噪声(Ingraham 等,2022)。
在设备为人调节的过程中,人会在多个时间尺度上适应。在 Poggensee 与 Collins(2021)中,经过中等变异性的训练之后,个性化助力使代谢消耗比关闭外骨骼时降低了 39%,其中训练贡献了约一半的收益,个性化约贡献四分之一;成为熟练用户需要约 109 分钟的助力行走。人们遇到新的外骨骼情境时,步频、踝关节角度范围与肌肉活动的变异性都先升后降,各变量的时间尺度不同(Abram 等,2022)。偏好可以重复,但会改变:12 名无经验被试与 12 名知情被试自行调节踝关节外骨骼的力矩大小与时机,他们偏好的力矩在 7.9 至 19.4 N·m 之间,时机在步态周期的 54.1% 至 59.2% 之间,试次之间的标准差分别为 1.7 N·m 与 1.5%,一个试次内的收敛需要 105 秒(Ingraham 等,2022)。假肢踝关节的偏好刚度使假肢关节与健侧关节之间的运动学对称性最大,并且与体重或代谢率没有显著关系(Clites 等,2021)。判断假肢踝关节的刚度与判断踝关节外骨骼的刚度,感知分辨率相差约五倍(推断,依据两项使用不同设备和不同被试的研究):八名膝下截肢者能以 75% 的准确率察觉 7.7% 的刚度变化(Shepherd 等,2018),而穿着踝关节外骨骼行走时,刚度的最小可觉差约为 42%(Maberry 与 Martin,2026)。优化器与人也会相互适应:在三项关于共同适应的在线实验中,当机器使用策略梯度时,人的行为会以牺牲自身利益为代价,向机器的全局最优移动,尽管机器从未估计过人的效用(Chasnov 等,2025)。
对偏好贝叶斯优化的含义。适应带来的漂移是有结构的:变异性先升后降,各参数以不同速率适应,新手偏好的量值随接触而上升。仿照运动适应双状态模型(Smith 等,2006)的思路,采用带有快、慢两个长度尺度的时间核,比单一的指数衰减更合适;设置一个熟悉阶段、降低早期比较的权重,则是更简单的替代方案(推断)。优化器的更新规则会改变用户最终停留的位置,因此应在冻结优化器、经过一段洗脱期之后,把最终设置与其他备选方案再比较一次(推断)。一旦剩余的差异低于某个参数的最小可觉差,进一步的比较几乎不携带信息,这就为该参数提供了有依据的停止规则;Weber 式的下限正是在这里适用(推断)。偏好的最优点不同于生理上的最优点,这支持把偏好与生理分开的多目标表述(第 14.5 节)(推断)。此外,更简单的方法可能就已足够:在一项关于用户主导的手动调节的研究中,人们在约 11 分钟内、测试了 30.5 个设置,就调好了外骨骼的助力,并使代谢消耗降低了 16.6%(Schäfer 等,2026)。外骨骼案例研究(第 24 章)与第 33.1 节具体讨论了这些权衡。
第 39.7 节引用的文献 9
- Ingraham 等人(2022)The role of user preference in the customized control of robotic exoskeletons
- Poggensee 与 Collins(2021)How adaptation, training, and customization contribute to benefits from exoskeleton assistance
- Abram 等人(2022)General variability leads to specific adaptation toward optimal movement policies
- Clites 等人(2021)Understanding patient preference in prosthetic ankle stiffness
- Shepherd 等人(2018)Amputee perception of prosthetic ankle stiffness during locomotion
- Maberry 与 Martin(2026)Just Noticeable Difference of Impedance Parameters While Walking in an Ankle Exoskeleton
- Chasnov 等人(2025)Human adaptation to adaptive machines converges to game-theoretic equilibria
- Smith 等人(2006)Interacting Adaptive Processes with Different Timescales Underlie Short-Term Motor Learning
- Schäfer 等人(2026)User preference-based human-in-the-loop tuning of exoskeleton assistance during walking
39.8 证据改变了什么 #
表 39.1 汇集了本章考察的各种说法,以及经证据检验后各说法的现状;“现状”一栏只描述证据的方向。本部分各章的全部说法及其对偏好贝叶斯优化的含义,汇集在表 45.1 与表 45.2 中。
| 说法 | 现状 | 关键证据 | 位置 |
|---|---|---|---|
| 辨别力在最优点附近下降(Weber) | 对价值判断不成立,对感知参数成立 | 高价值决策更快、更准确;行走时刚度的最小可觉差约 42% | 第 39.4 节、第 39.7 节 |
| 注意提高价值;对未被注视选项的折扣是常数 0.3 | 方向成立,效应很小;折扣随总体价值和个人而变化 | 约为 .53 至 .54 | 第 39.3.2 节 |
| 反应时携带偏好强度 | 得到加强;带着理论保证进入偏好学习 | 有理论保证的损失;高斯过程似然;总体价值的混杂 | 第 39.3.3 节 |
| 有效编码解释价值噪声 | 新出现并得到加强 | 食物价值;数字编码;风险选择 | 第 39.4 节 |
| 腹侧纹状体预测歌曲销量 | 样本小,未复现;一项类似的 97% 结果未通过审查 | 27 名青少年;24 首歌 | 第 39.2 节 |
| “想要”与“喜欢”在人类报告中可以分离 | 支持很弱 | 药物要么同时改变两者,要么都不改变 | 第 39.6 节 |
| 主动推断能推导出探索,并且是偏好贝叶斯优化的可用替代方案 | 截至 2026 年 9 月尚不成立 | 权重仍需调节;没有人类成对实验 | 第 39.5 节 |
| 用户在设备调节过程中会适应 | 得到加强并已量化 | 约 109 分钟成为熟练用户;共同适应 | 第 39.7 节 |
39.9 已定、有争议与缺失 #
已定。在单个任务之内,OFC 与 vmPFC 中的价值信号与选择存在因果关系(Ballesta 等,2020;Lopez-Persem 等,2020)。注意对选择有因果影响,但只有几个百分点(Bhatnagar 与 Orquin,2022)。高价值选项之间的决策更快、更准确(Shevlin 等,2022),因此 Weber 论证对价值判断不成立,而设备的感知参数存在可测量的辨别下限(Maberry 与 Martin,2026)。反应时可以带着理论保证进入偏好学习(Sawarni 等,2025)。神经预测用于汇总层面比用于个体更有效(Hakim 等,2021)。在设备调节过程中,人会在多个时间尺度上适应设备(Poggensee 与 Collins,2021)。
有争议。跨任务的基数共同货币是否存在(Hayden 与 Niv,2021)。除法归一化与范围归一化之争,以及哪一种适用于哪类任务。除了加权信息增益采集函数之外,主动推断能否为偏好贝叶斯优化增添任何东西,以及其理论基础是否成立。
缺失。这样的偏好贝叶斯优化研究:在人在回路中使用以反应时增强的高斯过程,或在反应时似然中对总体价值建模。用连续设计参数的成对判断拟合注意漂移扩散模型。在设计参数上对共同货币或价值建构的任何检验。在交互式优化会话中对有效编码预测的检验。在人类成对数据上把期望自由能采集函数与 EUBO 相比较的研究。药理学操纵下的成对偏好引出。冻结优化器、经过洗脱期之后对调好的设备设置所做的验证。
第 39.9 节引用的文献 9
- Ballesta 等人(2020)Values encoded in orbitofrontal cortex are causally related to economic choices
- Lopez-Persem 等人(2020)Four core properties of the human brain valuation system demonstrated in intracranial signals
- Bhatnagar 与 Orquin(2022)A meta-analysis on the effect of visual attention on choice
- Shevlin 等人(2022)High-value decisions are fast and accurate, inconsistent with diminishing value sensitivity
- Maberry 与 Martin(2026)Just Noticeable Difference of Impedance Parameters While Walking in an Ankle Exoskeleton
- Sawarni 等人(2025)Preference Learning with Response Time: Robust Losses and Guarantees
- Hakim 等人(2021)Machines learn neuromarketing: Improving preference prediction from self-reports using multiple EEG measures and machine learning
- Poggensee 与 Collins(2021)How adaptation, training, and customization contribute to benefits from exoskeleton assistance
- Hayden 与 Niv(2021)The case against economic values in the orbitofrontal cortex (or anywhere else in the brain)
延伸阅读 #
- Bogacz 等人(2006)推导了漂移扩散模型的闭式解,并将其与最优决策联系起来;从模型到式(39.1),这是最清晰的推导路径。
- Shvartsman 等人(2024)与 Sawarni 等人(2025)是从反应时通向偏好学习最直接的两项工作,前者借助高斯过程,后者带有理论保证。
- Shevlin 等人(2022)篇幅简短,其结果(高价值决策又快又准)改变了解读会话后期比较的方式。
- Bhatnagar 与 Orquin(2022)定量估计了注意能在多大程度上改变选择。
- Polanía 等人(2019)以日常食物展示了主观价值的有效编码,是了解情境依赖噪声的良好入门。
- Millidge 等人(2021)与 Li 等人(2026c)合起来解释了主动推断的探索项为何仍然需要权重。
- Poggensee 与 Collins(2021)与 Ingraham 等人(2022)对设备调节过程中人如何变化给出了最好的定量描述。
参考文献
- (2022). General variability leads to specific adaptation toward optimal movement policies. Current Biology. 引用于 §39.7
- (2020). Values encoded in orbitofrontal cortex are causally related to economic choices. Nature. 引用于 §39.1 §39.9
- (2013). The valuation system: A coordinate-based meta-analysis of BOLD fMRI experiments examining neural correlates of subjective value. NeuroImage. 引用于 §39.1
- (2026). Time is Knowledge: What Response Times Reveal. working paper (arXiv). 工作论文引用于 §39.3
- (2012). A neural predictor of cultural popularity. Journal of Consumer Psychology. doi:10.1016/j.jcps.2011.05.001. 引用于 §39.2
- (1998). What is the role of dopamine in reward: hedonic impact, reward learning, or incentive salience? Brain Research Reviews. 引用于 §39.6
- (2022). A meta-analysis on the effect of visual attention on choice. Journal of Experimental Psychology: General. 引用于 §39.3 §39.9
- (2006). The physics of optimal decision making: A formal analysis of models of performance in two-alternative forced-choice tasks. Psychological Review. 引用于 §39.3
- (2021). The Emperor's New Markov Blankets. Behavioral and Brain Sciences. 引用于 §39.5
- (1993). Decision field theory: A dynamic-cognitive approach to decision making in an uncertain environment. Psychological Review. 引用于 §39.3
- (2020). Dopaminergic modulation of the exploration/exploitation trade-off in human decision-making. eLife. 引用于 §39.6
- (2025). Human adaptation to adaptive machines converges to game-theoretic equilibria. Scientific Reports. 引用于 §39.7
- (2021). Understanding patient preference in prosthetic ankle stiffness. Journal of NeuroEngineering and Rehabilitation. 引用于 §39.7
- (2019). Partial Adaptation to the Value Range in the Macaque Orbitofrontal Cortex. The Journal of Neuroscience. 引用于 §39.1
- (2019). Dopamine modulates the reward experiences elicited by music. Proceedings of the National Academy of Sciences. 引用于 §39.6
- (2010). The free-energy principle: a unified brain theory? Nature Reviews Neuroscience. 引用于 §39.5
- (2015). Active inference and epistemic value. Cognitive Neuroscience. 引用于 §39.5
- (2022). Efficient Coding and Risky Choice. The Quarterly Journal of Economics. 引用于 §39.4
- (2017). When Brain Beats Behavior: Neuroforecasting Crowdfunding Outcomes. The Journal of Neuroscience. 引用于 §39.2
- (2025). Neuroforecasting reveals generalizable components of choice. PNAS Nexus. 引用于 §39.2
- (2021). Machines learn neuromarketing: Improving preference prediction from self-reports using multiple EEG measures and machine learning. International Journal of Research in Marketing. 引用于 §39.2 §39.9
- (2021). The case against economic values in the orbitofrontal cortex (or anywhere else in the brain). Behavioral Neuroscience. 引用于 §39.1 §39.9
- (2022). The role of user preference in the customized control of robotic exoskeletons. Science Robotics. 引用于 §39.7
- (2023). No, you still cannot predict hit songs using machine learning. Princeton Reproducibility. 非同行评审引用于 §39.2
- (2025). ResponseRank: Data-Efficient Reward Modeling through Preference Strength Learning. NeurIPS. 引用于 §39.3
- (2026). BOBA: Dynamic Bayesian Optimization through Bayesian Active Inference. arXiv preprint 2609.26021. 预印本引用于 §39.5
- (2018). What do predictive coders want? Synthese. 引用于 §39.5
- (2020). Dopaminergic and opioidergic regulation during anticipation and consumption of social and nonsocial rewards. eLife. 引用于 §39.6
- (2010). Visual fixations and the computation and comparison of value in simple choice. Nature Neuroscience. 引用于 §39.3
- (2021). Trading mental effort for confidence in the metacognitive control of value-based decision-making. eLife. 引用于 §39.1
- (2012). The root of all value: a neural common currency for choice. Current Opinion in Neurobiology. 引用于 §39.1
- (2024a). Enhancing Preference-based Linear Bandits via Human Response Time. Advances in Neural Information Processing Systems. 引用于 §39.3
- (2026c). Curiosity is Knowledge: Self-Consistent Learning and No-Regret Optimization with Active Inference. arXiv preprint 2602.06029. 预印本引用于 §39.5
- (2026e). Pragmatic Curiosity: A Unified Framework for Hybrid Learning and Optimization via Active Inference. arXiv preprint 2602.06104. 预印本引用于 §39.5
- (2020). Four core properties of the human brain valuation system demonstrated in intracranial signals. Nature Neuroscience. 引用于 §39.1 §39.9
- (2026). Just Noticeable Difference of Impedance Parameters While Walking in an Ankle Exoskeleton. IEEE Transactions on Neural Systems and Rehabilitation Engineering. 引用于 §39.7 §39.9
- (2015). Rational Inattention to Discrete Choices: A New Foundation for the Multinomial Logit Model. American Economic Review. 引用于 §39.4
- (2023). Accurately predicting hit songs using neurophysiology and machine learning. Frontiers in Artificial Intelligence. 引用于 §39.2
- (2021). Whence the Expected Free Energy? Neural Computation. 引用于 §39.5
- (2021). How adaptation, training, and customization contribute to benefits from exoskeleton assistance. Science Robotics. 引用于 §39.7 §39.9
- (2019). Efficient coding of subjective value. Nature Neuroscience. 引用于 §39.4
- (2022). Efficient coding of numbers explains decision bias and noise. Nature Human Behaviour. 引用于 §39.4
- (1978). A theory of memory retrieval. Psychological Review. 引用于 §39.3
- (2021). Active Inference: Demystified and Compared. Neural Computation. 引用于 §39.5
- (2025). Preference Learning with Response Time: Robust Losses and Guarantees. NeurIPS. 引用于 §39.3 §39.9
- (2026). User preference-based human-in-the-loop tuning of exoskeleton assistance during walking. npj Biomedical Innovations. doi:10.1038/s44385-026-00085-7. 引用于 §39.7
- (2025b). Early versus late noise differentially enhances or degrades context-dependent choice. Nature Communications. doi:10.1038/s41467-025-59140-3. 引用于 §39.4
- (2018). Amputee perception of prosthetic ankle stiffness during locomotion. Journal of NeuroEngineering and Rehabilitation. 引用于 §39.7
- (2022). High-value decisions are fast and accurate, inconsistent with diminishing value sensitivity. Proceedings of the National Academy of Sciences. 引用于 §39.3 §39.9
- (2024). Response Time Improves Gaussian Process Models for Perception and Preferences. Uncertainty in Artificial Intelligence. 引用于 §39.3
- (2003). Implications of rational inattention. Journal of Monetary Economics. 引用于 §39.4
- (2006). Interacting Adaptive Processes with Different Timescales Underlie Short-Term Motor Learning. PLoS Biology. 引用于 §39.7
- (2025). Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives. ICLR 2025. 引用于 §39.1
- (2025). High overall values mitigate gaze-related effects in perceptual and preferential choices. Journal of Experimental Psychology: General. 引用于 §39.3
- (2007). An EZ-diffusion model for response time and accuracy. Psychonomic Bulletin & Review. 引用于 §39.3
- (2021). The Normalization of Consumer Valuations: Context-Dependent Preferences from Neurobiological Constraints. Management Science. 引用于 §39.4
- (2010). Impulse Control Disorders in Parkinson Disease: A Cross-Sectional Study of 3090 Patients. Archives of Neurology. 引用于 §39.6
- (2026). Attention Limited Reward Learning. arXiv preprint 2607.04590. 预印本引用于 §39.3
- (2018). Multiple timescales of normalized value coding underlie adaptive choice behavior. Nature Communications. 引用于 §39.4