偏好与大语言模型
当今计算领域中,成对比较最引人注目的用途不是偏好贝叶斯优化,而是大语言模型的对齐:由人(越来越多地也由其他模型)阅读同一提示词的两条回复,判断哪条更好;这样的判断重复数百万次,所得回答用于调整模型。标注者面对的问题,与第 19 章中调节设计的人面对的问题相同:这两个当中,你更喜欢哪一个?大多数对齐工作从这些回答中学习时,采用的似然是第 16.4 节的 Bradley-Terry 模型。
2023 年至 2026 年 9 月,两个领域从两个方向交汇。一方面,语言模型进入偏好回路,充当先验、模拟用户、翻译者(把文本转换为偏好标签)、特征提取器和候选生成器。另一方面,对决赌博机与贝叶斯主动学习的工具被用于提示词优化、输出与模型的选择,以及训练所需比较的选择。与本书论证相关的是,对齐研究在大规模上提出了测量问题:模型评判者与人相差多远,哪些比较值得收集(第 45.1 节)。已报告的收益小至胜率提高 1% 至 6%,大至标签节省约一个数量级;但多数结果以奖励模型模拟器或语言模型评判者代替了人,一些严谨的研究还发现,精心选择比较几乎并不优于随机选择。本章先说明对齐如何从比较中学习,再分别沿这两个方向展开,然后把两个领域共用的似然与七个失效的类比区分开,最后讨论反向流回的成果。
35.1 语言模型如何从比较中学习 #
熟悉高斯过程偏好学习的读者,对其中大部分机制已不陌生。本节借用这些读者熟悉的概念介绍对齐研究的术语。
35.1.1 策略、奖励与 Bradley-Terry 奖励模型 #
给定提示词 ,语言模型逐词采样生成回复 ,由此定义了回复上的概率分布 。对齐研究借用强化学习的术语,称这一分布为策略(policy),即选择动作的规则,这里的动作是整条回复。偏好调优之前的模型称为参考策略(reference policy),它通常已在人工撰写的示范上做过微调。
奖励模型(reward model)是一个独立的网络,把提示词与回复映射为一个数 ,通常由语言模型复制而来,只是输出层换成单个标量(Ouyang 等,2022)。它的地位与第 18 章中的潜在效用 完全相同:无法直接观测,只能从比较中学习。向标注者展示提示词 的两条回复 与 时,按照 Bradley-Terry 模型,
其中 是逻辑函数(语言模型文献记作 ,本书则把这个字母留给标准差)。奖励模型通过最大化比较数据的对数似然来训练;每次比较包含一个提示词、一条受偏好的回复 和一条被拒绝的回复 :
与式(19.1)相比,区别只有三处:一是链接函数,这里用逻辑链接而非概率单位链接,二者是同一随机效用族中的两种噪声分布(第 16.5 节);二是 上没有先验;三是规模,用数万至数百万次比较拟合一个大型神经网络,而不是用几十次比较拟合一个高斯过程。推广到排序的版本是 Plackett-Luce 模型: 条回复某一排列的概率,等于依次从剩余各项中做 softmax 选择的概率之积。
35.1.2 RLHF 与 KL 正则目标 #
基于人类反馈的强化学习(reinforcement learning from human feedback,RLHF)利用这样的奖励模型调整策略。Christiano 等人(2017)针对游戏与模拟机器人提出这一方法,Ouyang 等人(2022)将其用于遵循指令的语言模型。其流程是:采样回复并收集人的比较,用式(35.2)拟合奖励模型,再微调策略,对每个提示词 (并在全部提示词上取平均)最大化
其中 与 分别是 与 的简写。第二项是第 6.2 节中的 KL 散度(KL divergence),度量调整后的策略偏离参考策略的程度; 规定这种偏离要以多少奖励为代价。若没有这一项,策略会向奖励模型高估的任意文本漂移,这种失效称为奖励过度优化(reward over-optimization):学到的奖励不断上升,真实质量却在下降(Coste 等,2024)。需要注意,式(35.3)所求的不是单个最好的回复,而是回复上的一个分布:平均得分高,同时贴近参考策略。这正是第 35.4.2 节中第一个失效的类比。
35.1.3 DPO 与隐式奖励 #
直接偏好优化(direct preference optimization,DPO)省去了独立的奖励模型和强化学习步骤。Rafailov 等人(2023)注意到式(35.3)的最优解有闭式表达,因此 Bradley-Terry 似然可以直接用策略表示。
固定提示词 ,并在记号中略去。策略记为 ,求和均遍历所有回复 。
- 由期望与 KL 散度的定义,式(35.3)在该提示词上的目标为 。
- 定义 与分布 。从第 1 步的两项中提出 ,得 。在对数中利用 ,对数即拆分为 ;又因 ,常数项只贡献一次 :。
- KL 散度非负,且仅当两个分布相等时为零,故 在 处取得最大值:(35.4)
- 对式(35.4)取对数,解出奖励:(35.5)
- 恢复提示词,将式(35.5)代入 Bradley-Terry 模型式(35.1)。 只依赖于提示词,与回复无关,因此 在差 中以相反符号出现两次,相互抵消。遍历所有可能回复、难以计算的求和也随之消失。
- 剩下的似然中,策略本身充当奖励。将这一由策略定义的奖励记为 。在比较数据集上最大化 Bradley-Terry 似然,即得 DPO 损失:(35.6)
用该论文标题的话说,策略“其实是一个奖励模型”(is secretly a reward model): 称为隐式奖励(implicit reward),式(35.6)就是把式(35.2)中的 换成 ;论文还给出了适用于排序的 Plackett-Luce 版本。下文还会多次出现两种相近的方法,二者同属一族凸损失(Tang 等,2024):IPO(Azar 等,2024)采用平方损失,SLiC 采用合页损失。此外,由式(35.4)可知,最优策略是按 重新加权的参考策略:它只使模型的已有行为发生倾斜,而不是直接跳到最好的回复。
35.1.4 比较从哪里来 #
离线(offline)偏好学习使用预先收集的固定数据集;在线(online)学习在训练过程中从当前策略采样新回复,送交标注;主动(active)学习还要选择值得标注的提示词与回复对。这种选择就是第 12 章意义上的采集函数,偏好贝叶斯优化与对决赌博机的工具正是由此进入对齐研究。对决赌博机(dueling bandit,第 21.1 节)每轮选择两条臂,观察哪条获胜;情境对决赌博机(contextual dueling bandit)则先观察情境,此处即提示词。下文的许多证据依赖大语言模型评判者(LLM judge),即通过提示让语言模型代替人比较两条回复;这些研究以胜率(win rate)报告结果,即调整后的模型与固定基线模型一对一比较时获胜的比例。
对齐与偏好贝叶斯优化都借助成对随机效用似然,从“哪个更好?”的回答中学习潜在得分。此后,对齐用这一得分在参考模型附近重塑文本上的分布,偏好贝叶斯优化则用它寻找单个最好的设计。下文大部分内容都将回到这一差别。
第 35.1 节引用的文献 6
- Ouyang 等人(2022)Training language models to follow instructions with human feedback
- Christiano 等人(2017)Deep reinforcement learning from human preferences
- Coste 等人(2024)Reward Model Ensembles Help Mitigate Overoptimization
- Rafailov 等人(2023)Direct Preference Optimization: Your Language Model is Secretly a Reward Model
- Tang 等人(2024)Generalized Preference Optimization: A Unified Approach to Offline Alignment
- Azar 等人(2024)A General Theoretical Paradigm to Understand Learning from Human Preferences
35.2 偏好回路中的语言模型 #
2023 至 2026 年间,语言模型在偏好回路中承担了五种角色:先验或热启动、模拟用户、翻译者(把文本转换为偏好标签)、特征提取器和候选生成器。效果最好的系统由经典概率模型负责刻画不确定性和选择查询,语言模型只在接口处发挥作用;由语言模型本身充当优化器的系统,强遗憾则不及经典的对决赌博机算法。
35.2.1 翻译者:从文字到偏好信号 #
PEBOL(Austin 等,2024a)用于对话式推荐中的偏好引出。它为每个物品设一个独立的效用,服从 Beta 分布,即第 5.2 节的共轭模型;自然语言推理模型把用户就某一方面回答的“是”或“否”转换为似然,再由 Thompson 采样或上置信界(第 12.5 节、第 12.4 节)决定 GPT-3.5 下一步问什么。10 轮之后,它的前 10 名平均倒数排名(mean reciprocal rank at 10,即用户目标物品在前 10 名列表中名次倒数的平均值)在 Yelp 上为 0.27,单体式 GPT-3.5 引出器为 0.12;在 MovieLens 上为 0.18 对 0.09,在 Recipe-MPR 上为 0.17 对 0.11。最好的单体式基线 Gemini-Pro 达到 0.17。作者将单体式模型的失败归因于过度利用,严重时会重复提出同一个问题。实验中的用户由 GPT-3.5 模拟,每个数据集 100 个,事先已告知其喜欢哪个物品。
OPEN(Handa 等,2024)(2024 年的预印本)由语言模型提取某一领域的特征并排序,据此初始化线性 Bradley-Terry 效用的先验;它在粒子滤波后验(一组带权样本)上按第 6.4 节的期望信息增益选择成对查询,再由语言模型把每个抽象的比较改写为自然的提问。在一项通过 Prolific 平台招募真人、推荐 New York Times 文章的研究中,它优于单用语言模型引出偏好和单用实验设计的做法。去掉改写后,用户感到准确表达自身偏好明显更难;各方法的脑力需求相近。MAPLE(Mahmud 等,2025)(AAAI 2025)把自然语言反馈转换为抽象概念线性权重的样本或取值范围,用 Bradley-Terry 似然描述轨迹的成对排序,并采用 Markov 链蒙特卡洛(第 17.5 节);评估时使用的是人类模型。
LILO(Kobalczyk 等,2026)(ICML 2026)与严格意义上的偏好贝叶斯优化最为接近。语言模型把自由文本反馈和文本形式的先验翻译成成对标签,交给概率单位成对高斯过程。该高斯过程建立在复合效用 上,其中 给出一次实验的测量结果, 是决策者对这些结果的效用,这正是偏好探索的设定(Lin 等,2022)。让决策者比较哪些结果,由 qEUBO 选择,即一次查询含 个选项时的最优选项期望效用(第 19.4 节)。在 10 个环境中,它优于纯语言模型优化器和偏好贝叶斯优化基线;在某些设定下,决策者的一条消息相当于甚至超过 8 至 16 次成对比较。这些问题为 5 至 8 维,决策者由 Llama-3.3-70B 模拟。LILO 的前身包括:有真人参与的预注册实验,发现语言模型生成的问题所引出的回答往往比用户自己写的提示词或标签信息量更大,用户报告的费力程度也更低(Li 等,2025b);一篇 NeurIPS 2023 研讨会论文,按期望熵减选择问题(Piriyakulkij 等,2023);LILO 第一作者的工作,在语言模型采样的候选解上做贝叶斯实验设计(Kobalczyk 等,2025)(ICLR 2025)。
35.2.2 先验、特征、候选,以及优化器本身 #
先验与热启动。除 OPEN 和 MAPLE 外,Eichelbeck 等人(2026)(ICLR 2026)在自编码器的潜空间中运行偏好贝叶斯优化,先验由语言模型根据访谈生成,评估只用了模拟用户。在标量反馈一侧(第 30.6 节),LLAMBO(Liu 等,2024a)(ICLR 2024)用语言模型做热启动、充当代理模型并采样候选。2025 年的一篇复现预印本发现,热启动“显著改善了早期的遗憾表现,并降低了不同运行之间的方差”,但该代理模型“作为纯粹的单任务回归器,弱于高斯过程或 SMAC”(SMAC 使用随机森林);该预印本的摘要还把 LLAMBO 归于“Daxberger et al. (2024)”,与原作者不符(Rychert 等,2025)。LGBO(Yuan 等,2026)(ICLR 2026)针对标量目标,把语言模型对区域的偏好加到代理模型的均值上,给出了最坏情况保证;偏好与目标一致时收敛更快,并做了一次湿实验。反面的证据很尖锐:在标量贝叶斯优化中,把语言模型智能体观测到的结果换成随机打乱的标签,其表现并无差别,而线性赌博机和高斯过程优化始终胜出(Gupta 等,2025)(EMNLP 2025 Findings);语言模型顾问建议的更好起点,实际上是一个默认配置(Rodrigues 等,2026)(2026 年的一篇预印本)。
特征提取器与代理模型。语言模型“只有在用特定领域的数据预训练或微调过之后”,才对分子上的贝叶斯优化有帮助(Kristiadi 等,2024a)(ICML 2024);BO-ICL(Ramos 等,2026)于 2023 年首次发布、2026 年正式发表,通过上下文回归在 6 次迭代内从 3,700 个候选中找到了接近最优的催化剂;Ranković 等人(2026)(Nature Machine Intelligence 2026)联合训练嵌入与高斯过程,在 23 个化学与材料任务上,以中位数少 41% 的迭代次数达到常规贝叶斯优化的水平。三者都使用标量反馈。在偏好反馈下,“语言模型嵌入加概率头”的实例是 APOHF 和 Dwaracherla 等人的方法(第 35.3 节),二者都没有使用高斯过程。
候选与优化器本身。APPO(Li 等,2026f)(CHI 2026)让语言模型根据用户的二元偏好改写文生图提示词;PDO 和 Duel-Evolve(第 35.3 节)则让同一个语言模型既生成候选,又评判候选。Xia 等人(2025)(ACL 2025 Findings)让顶尖的语言模型在上下文中充当对决赌博机算法。这些模型很快就把最好的臂带入对决,因此短期的弱遗憾(weak regret,只计两条臂中较好的一条)较低;但在强遗憾(strong regret,两条臂都计入)上,与经典算法相比“仍然存在最优性差距”,而且它们“难以收敛并持续利用,即使明确提示它们这样做也是如此”。混合方法 LEAD 用经典算法包裹语言模型,并继承了该算法的保证。
表 35.1 按是否属于本书所说的严格意义上的偏好贝叶斯优化,对主要系统做了归类。严格意义是指:由概率代理模型从成对或排序反馈中学习连续或结构化设计空间上的潜在效用,并由采集函数选择查询。
| 系统 | 语言模型的角色 | 概率模型与查询规则 | 反馈 | 严格意义的 PBO? | 评估中由谁回答 |
|---|---|---|---|---|---|
| PEBOL(RecSys 2024) | 提问;推理模型把回答转换为似然 | 相互独立的 Beta-Bernoulli 物品效用;Thompson 采样或上置信界 | 是或否 | 否:独立臂赌博机 | 每个数据集 100 个由 GPT-3.5 模拟的用户 |
| OPEN(2024 年预印本) | 提取特征、初始化先验、改写问题 | 线性 Bradley-Terry 效用;粒子滤波;期望信息增益 | 成对 | 部分:没有高斯过程 | Prolific 上的真人 |
| MAPLE(AAAI 2025) | 提供权重先验、解释语言反馈 | 概念上的线性权重;Bradley-Terry;MCMC | 成对排序加语言 | 部分:同 OPEN | 人类模型 |
| LILO(ICML 2026) | 把自由文本翻译成成对标签 | 复合效用上的概率单位成对高斯过程;qEUBO | 转换为成对标签的语言 | 是 | Llama-3.3-70B 模拟的决策者,5 至 8 维 |
| Eichelbeck 等(ICLR 2026) | 根据访谈生成先验 | 自编码器潜空间中的偏好贝叶斯优化 | 成对 | 是 | 只有模拟用户 |
| LGBO(ICLR 2026) | 给出对区域的偏好 | 平移高斯过程均值 | 标量加语言模型偏好 | 否:标量贝叶斯优化 | 基准测试与一次湿实验 |
| APOHF(研讨会论文) | 冻结的嵌入作为特征 | 神经网络,Bradley-Terry;贪心加上置信界 | 成对 | 否:神经对决赌博机 | 模拟(验证准确率、图像相似度) |
| Duel-Evolve(研讨会论文) | 生成候选并评判 | 贝叶斯 Bradley-Terry;双重 Thompson 采样 | 模型自己的成对评判 | 否:测试时搜索 | 基准上对照真实答案的准确率 |
只有 LILO 和 Eichelbeck 等人的方法符合严格定义。把这些系统统称为“结合语言模型的偏好贝叶斯优化”,会夸大高斯过程偏好模型在这一交叉领域中所占的分量。
35.2.3 用语言表达目标,用比较做判断 #
如果语言模型能把人的话带进回路,还需要请人做比较吗?在第 32 章的设计研究中,自然语言与显式约束带来的优化性能相同,前者工作负荷更低,后者能动感更强;187 条自然语言请求中,90.9% 描述的是期望的结果,而不是参数值(Niwa 等,2025)。Peng 等人(2026)在一篇预印本中发现,20 个人评判同样的 600 对生成界面,彼此之间的一致性 Krippendorff 只有 0.25(平均而言,两个人在 62.4% 的对上做出相同选择);然而对 12 名新用户,仅凭 8 次成对评判做个性化,就胜过了包括用户自述偏好在内的所有基线,总胜率为 60.35%(第 32.4 节)。
模型一侧的证据指向同一方向。语言模型在多轮对话中推断用户偏好时,与规范的贝叶斯更新相比“差得很远”(far short),而训练它们模仿贝叶斯模型可以改善这一点,且能够泛化(Qiu 等,2026)(Nature Communications,2026 年 1 月);在一个帮助用户建构偏好的模拟用户基准上,没有一个前沿模型在 5 轮之内的准确率超过 56%(Saracay 等,2026)(COLM 2026)。这些结果共同支持一种分工:语言用于表达目标、约束和先验,比较用于精细的判断,后验更新则交给显式的概率模型(推断)。这与第 16.1 节中主张用比较而非评分的理由一致。
35.2.4 作为模拟用户与评判者的语言模型 #
本章的许多系统在评估时都由语言模型代替人。2023 至 2026 年的证据指向同一结论:语言模型在总体上接近人,对个人则不可靠,并且存在系统性偏差。表 35.2 中,Spearman 秩相关(Spearman correlation)与 Kendall 都衡量两个列表的排列顺序有多相似(顺序相同为 1,毫无关系为 0);一致率则统计两个评判者选择同一选项的频率。
| 研究 | 设定 | 总体层面 | 个人层面,或偏差 |
|---|---|---|---|
| Zheng 等,NeurIPS 2023 Datasets and Benchmarks | GPT-4 评判 MT-Bench 与 Chatbot Arena | 与人的一致率“超过 80%”,与人与人之间的一致率相同 | 位置偏差、冗长偏差、自我增强偏差 |
| Dubois 等,NeurIPS 2023,AlpacaFarm | 使用单一提示词的 GPT-4 标注者 | 与人的一致率为 65%,人与人之间为 66%;方法排名与基于人类数据的排名之间的 Spearman 相关为 0.98,成本约为其 1/50 | 无法再现人类标签的变异性,也无法再现奖励过度优化;要再现这些现象,需要一组模拟标注者,并以 0.25 的概率随机翻转标签 |
| Wang 等,ACL 2024 | ChatGPT 作为评估者 | 未报告 | 交换回复顺序后,Vicuna-13B 在 80 个查询中的 66 个上胜过 ChatGPT |
| Panickssery、Bowman 与 Feng,NeurIPS 2024 | 微调改变自我识别能力 | 未报告 | 自我识别能力与自我偏好的强度呈线性相关 |
| Muldrew 等,ICML 2024 | 50 个提示词各标注两次 | GPT-4 与自身的一致率超过 90% | GPT-3.5-turbo 约 60% |
| Kirk 等,2026 年预印本,PRISM-X | 530 人,每人对四个模型排序;GPT-4o 作为模拟用户,或只根据此人的对话记录排序,或亲自进行对话后排序 | 根据模拟排序与根据人类排序拟合的模型得分,相关系数 r = 0.99 与 0.98 | 与此人自己排序的平均 Kendall τ 为 0.22(只排序)与 0.11(亲自对话),而人自身的一致性为 0.57;位置效应很强(图 35.1);比人更谄媚 |
| Kuric、Demcak 与 Krajcovic,2026 年预印本 | 29 个真实的设计偏好测试(n = 2073),78 个任务 | 首选一致率 53%;GPT 5.2 达到 65%,但保真度没有显著提高 | 在 44% 的任务中,模拟分布与真实分布差异显著;单一人设的模拟在 91% 的任务中显著偏离;温度和 top-p 没有显著影响 |
| Xu 等,ICML 2025 | AlpacaEval 上的评判者 | 循环赛加 Bradley-Terry 把与 Chatbot Arena 的 Spearman 相关从 95.0% 提高到 96.4%,Kendall 相关从 82.1% 提高到 86.3% | 评判不可传递;排名依赖于所选的基线模型 |
| Shi 等,IJCNLP-AACL 2025 | 15 个评判者,超过 150,000 个实例 | 未报告 | 位置偏差与提示词长度弱相关,并且“受解答之间质量差距的强烈影响” |
| Yang 等,2026 年预印本 | 20 个语言模型,质量相同的回复对 | 未报告 | 能力强与自我偏好偏差低“往往不相关,甚至负相关”;结构化的多维评估平均把这种偏差降低 31.5% |
| Chawla、Thompson 与 Young,2026 年预印本 | 7 个模型,4 个任务 | 未报告 | 在任何单调链接下,不可传递性都无法用单一排序解释;几个潜在排序的混合拟合得更好 |
| Seshadri 等,2026 年预印本 | 智能体评估中的模拟用户 | 未报告 | 换用不同的模拟器,智能体的成功率最多相差 9 个百分点;对某些方言群体,保真度更差 |
| Zhu、Huang 与 Sang,WWW 2024 研讨会 | 对话式推荐中的模拟用户 | 未报告 | 对话历史和模拟器回复中的数据泄漏抬高了结果;PEBOL 依赖的正是这种评估 |
表中各项的来源依次为 Zheng 等人(2023)、Dubois 等人(2023)、Wang 等人(2024a)、Panickssery 等人(2024)、Muldrew 等人(2024)、Kirk 等人(2026)、Kuric 等人(2026)、Xu 等人(2025a)、Shi 等人(2025)、Yang 等人(2026a)、Chawla 等人(2026)、Seshadri 等人(2026)与 Zhu 等人(2024)。位置偏差(position bias)指偏好先展示(或后展示)的回复;冗长偏差(verbosity bias)指偏好更长的回复;自我增强偏差(self-enhancement bias)或自我偏好偏差(self-preference bias)指评判者偏好自己生成的文本;谄媚(sycophancy)指倾向于说用户看起来想听的话。图 35.1 画出了其中最清楚的例子 PRISM-X。
可以尝试以下几点:
- 把“模拟用户”设为“只对对话记录排序”,比较“与人的一致性”中最上面的条形和下面一条:在哪个模型总体上更好这一点上几乎完全一致,而针对个人的一致性为 0.22。
- 切换到“还亲自进行对话”。针对个人的一致性减半,降到 0.11;第一个展示的模型获胜的试次比例从 33.8% 升到 44.9%,而人的这一比例为 24.1%。
以语言模型充当偏好预言机时,这些证据意味着偏好贝叶斯优化的观测模型设定有误(推断)。语言模型的标签在总体上忠实,对个人却是错的(PRISM-X、Kuric 等人);过于一致(AlpacaFarm 需要 25% 的随机翻转才能再现类似人的过度优化);依赖于呈现顺序(Wang 等人);并且偏向评判者自己的文本(Panickssery 等人)。概率单位似然或 Bradley-Terry 似然把每一处偏离都当作方差固定的独立噪声,但这些偏离大多是偏差。随质量差距变化的位置偏差(Shi 等人)还会使噪声方差依赖于效用差,这是固定的噪声尺度无法表达的(第 27.2 节列出了异方差模型)。最直接的补救是 Wang 等人的平衡位置校准:对两种顺序下的评判取平均。NAOD(Du 等,2026)是 2026 年 9 月 30 日发布的预印本,也是我们找到的第一个把评判者偏差纳入查询设计的方法。它认为主动采集会暴露校准之后仍残留的评判者偏差;在含 17 个评判者的 Chatbot Arena 数据上,与只以信息为目标的匹配设计相比,它把平均代理策略遗憾降低了 29.1%,并表明表示误差“可能逆转预言机设计的优势”。LILO 没有对评判者偏差建模。
截至 2026 年 9 月,我们没有找到这样的研究:用人的比较和语言模型的比较分别运行同一个偏好贝叶斯优化回路,并报告两者的遗憾或样本效率;也没有找到测量位置偏差如何传导到采集决策的研究(例如,对两种顺序取平均是否会改变所选查询的序列)。在这样的研究出现之前,用语言模型预言机得到的偏好贝叶斯优化结果,只是关于这个预言机的结果。最起码的检查是:用真人、在两种呈现顺序下重跑几个会话,并报告所选查询如何变化(推断)。这一缺口并非语言模型所独有:在一项基于偏好贝叶斯优化的视网膜植入物研究中,人的选择只有约 50% 与一个模拟智能体(不是语言模型)一致,但 17 名被试中有 16 名更喜欢优化得到的结果(Schoinas 等,2025)(第 33.5 节、第 31.7 节)。
35.2.5 规律 #
从 2023 年的 PEBOL 到 2026 年的 LILO,不确定性模型始终是经典的小模型(PEBOL 的 Beta-Bernoulli 模型,OPEN 与 MAPLE 的线性 Bradley-Terry 模型,LILO 的成对高斯过程),语言模型只在接口处工作:提取特征、初始化先验、拟定问题的措辞、翻译标签。凡是把查询选择交给语言模型的方法,都不及经典算法(推断)。
第 35.2 节引用的文献 38
- Austin 等人(2024a)Bayesian Optimization with LLM-Based Acquisition Functions for Natural Language Preference Elicitation
- Handa 等人(2024)Bayesian Preference Elicitation with Language Models
- Mahmud 等人(2025)MAPLE: A Framework for Active Preference Learning Guided by Large Language Models
- Kobalczyk 等人(2026)LILO: Bayesian Optimization with Natural Language Feedback
- Lin 等人(2022)Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes
- Li 等人(2025b)Eliciting Human Preferences with Language Models
- Piriyakulkij 等人(2023)Active Preference Inference using Language Models and Probabilistic Reasoning
- Kobalczyk 等人(2025)Active Task Disambiguation with LLMs
- Eichelbeck 等人(2026)Supporting High-Stakes Decision Making Through Interactive Preference Elicitation in the Latent Space
- Liu 等人(2024a)Large Language Models to Enhance Bayesian Optimization
- Rychert 等人(2025)Reproducibility Study of Large Language Model Bayesian Optimization
- Yuan 等人(2026)Unleashing LLMs in Bayesian Optimization: Preference-Guided Framework for Scientific Discovery
- Gupta 等人(2025)LLMs for Bayesian Optimization in Scientific Domains: Are We There Yet?
- Rodrigues 等人(2026)When Is an LLM Worth It for Hyperparameter Optimization? A Budget-Matched Study on Tabular Data Finds the Warm-Start Is a Default Configuration, Not the Model
- Kristiadi 等人(2024a)A Sober Look at LLMs for Material Discovery: Are They Actually Good for Bayesian Optimization Over Molecules?
- Ramos 等人(2026)Bayesian Optimization of Catalysis With In-Context Learning
- Ranković 等人(2026)Large language models as uncertainty-calibrated optimizers for experimental discovery
- Li 等人(2026f)Preference-Guided Prompt Optimization for Text-to-Image Generation
- Xia 等人(2025)Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents
- Niwa 等人(2025)Cooperative Design Optimization through Natural Language Interaction
- Peng 等人(2026)Efficient Personalization of Generative User Interfaces
- Qiu 等人(2026)Bayesian Teaching Enables Probabilistic Reasoning in Large Language Models
- Saracay 等人(2026)Beyond expert users: agents should help users construct preferences, not just elicit them
- Zheng 等人(2023)Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
- Dubois 等人(2023)AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback
- Wang 等人(2024a)Large Language Models are not Fair Evaluators
- Panickssery 等人(2024)LLM Evaluators Recognize and Favor Their Own Generations
- Muldrew 等人(2024)Active Preference Learning for Large Language Models
- Kirk 等人(2026)PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users
- Kuric 等人(2026)Distorted Perspectives of LLM-Simulated Preferences: Can AI Mislead Design?
- Xu 等人(2025a)Investigating Non-Transitivity in LLM-as-a-Judge
- Shi 等人(2025)Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
- Yang 等人(2026a)Quantifying and Mitigating Self-Preference Bias of LLM Judges
- Chawla 等人(2026)Multiple latent orderings better predict language model preferences
- Seshadri 等人(2026)Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations
- Zhu 等人(2024)How Reliable is Your Simulator? Analysis on the Limitations of Current LLM-based User Simulators for Conversational Recommendation
- Du 等人(2026)Optimal Design for Active Preference Learning with Biased LLM Judges
- Schoinas 等人(2025)Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants
35.3 用于语言模型问题的偏好方法 #
第二个方向是把为对决赌博机和偏好贝叶斯优化开发的工具用于语言模型问题:提示词优化、输出与模型的选择、训练所需比较的选择,以及对齐过程中的在线探索。证据好坏参半,但这种参差本身颇有启发;只要追问每次查询的目的,矛盾便可化解。
35.3.1 提示词优化 #
APOHF(Lin 等,2024b)在冻结的提示词嵌入上用 Bradley-Terry 似然训练神经网络,并把贪心最大化点与上置信界的最大化点配成一对,这是线性对决赌博机的做法。对照基线中有一个采用双重 Thompson 采样(double Thompson sampling)的集成;双重 Thompson 采样是一种对决赌博机规则,抽取两个独立的后验样本,把二者各自的最大化点配成一对(第 21.2 节)。APOHF 只处理成对比较,所有“人类”反馈都是模拟的:30 个指令任务上用验证准确率,文生图任务上用与目标图像的相似度。该工作曾在 ICML 2024 研讨会上作口头报告,未被 ICLR 2025 接收;ACL Rolling Review 上有一条 2026 年 5 月的投稿记录,但尚未正式接收。Kayal 等人(2025)(ICML 2025)以它作为“基于人类反馈的贝叶斯优化”(Bayesian optimization from human feedback)的动机应用。PDO(Wu 等,2026)(ACL 2026 Findings)在固定的语言模型评判预算下,用双重 Thompson 采样安排提示词之间的对决,并以获胜者引导变异;在 BIG-bench Hard 和 MS MARCO 上,它找到的提示词优于无标签基线。在我们找到的文本提示词优化器中,没有一个做过真人评估;APPO 的真人研究针对的是图像。(Ji、He 与 Gu 也把一个无关的主动查询算法称为 APPO。)
35.3.2 在输出之间与模型之间做选择 #
Zhang 等人(2024a)(ICML 2024)把推理步骤的逐点打分换成由语言模型完成的成对比较,并用集成和对决赌博机的变体处理噪声。Chatbot Arena(Chiang 等,2024)是基于众包投票的公开排行榜,投票者在匿名模型之间做比较。它选择下一对的概率与 Bradley-Terry 置信区间宽度的期望缩减量成正比。在基于 213,576 张留出选票拟合的模拟中,要使胜率矩阵达到 0.2 的精度,随机采样需要多 54% 的数据;要使得分达到 0.3 的精度,则只需多 5%。Duel-Evolve(Karlekar 等,2026)是 ICLR 2026 研讨会的海报论文。它用语言模型对自身候选的评判拟合贝叶斯 Bradley-Terry 模型,用双重 Thompson 采样分配比较,并以进化方式为下一代挑选亲本,不需要奖励模型或标签。以真实答案衡量,它在 MathBench 上比同类迭代方法高 20 个百分点,在 LiveCodeBench 上高 12 个百分点或更多。有研究把模型路由表述为情境对决赌博机,用 Feel-Good Thompson 采样(一种带乐观项的变体)求解,在 RouterBench 和 MixInstruct 上累积遗憾更低(Chiang 等,2025)(一篇未被 ICLR 2026 接收的预印本);Gharat 等人(2026)(NeurIPS 2026)研究查询成本各异时对决反馈下的最优臂识别,假设存在 Condorcet 赢家(Condorcet winner,即以大于二分之一的概率胜过其他每个选项的选项),并在真实数据上检验了这一假设;CUPID(Nguyen 等,2026)(ICML 2026)为用户选择应当比较的两个模型,并做了真人研究;T-POP(Qu 等,2026)(ICML 2026)用对决赌博机在线学习单个用户的奖励,以引导冻结模型的解码。
35.3.3 为奖励模型与 DPO 主动收集偏好数据 #
选择收集哪些比较用于训练,这一问题上的证据最多。Muldrew 等人(2024)(ICML 2024)优先选择 DPO 隐式偏好模型有把握却判断错误的对;以 GPT-4 为预言机,胜率平均提高了 1% 至 6%。BAL-PM(Melo 等,2024)(NeurIPS 2024)注意到,朴素估计认知不确定性(由数据不足而非回答噪声造成的不确定性)会选出冗余样本,因此加入已采集提示词在模型特征空间中的熵;在两个人类偏好数据集上,所需标签减少了 33% 至 68%。Mehta 等人(2025)(COLM 2025)把对决反馈归约为情境 Borda 函数(Borda function),即某个动作胜过均匀随机选取的另一动作的概率,证明了多项式遗憾界,并报告在预算有限时,其方法的性能可比基线提高 13% 以上;不确定性由蒙特卡洛 dropout(预测时保持 dropout 开启)给出。Das 等人(2025)(ECML-PKDD 2025)证明,预算较小时,均匀采样情境可能留下常数量级的次优差距;他们给出了 维、 轮时 的下界,并表明选择最不确定情境的 APO 在相差对数因子和非线性因子的意义下达到这一下界。Ji 等人(2024)(TMLR)证明了 的遗憾和 的查询复杂度,其中 是最优与次优动作之间的差距;其 ADPO 只用约一半的查询即达到 DPO 的水平。
另一分支基于最优实验设计,使用 Fisher 信息(Fisher information),即对数似然的期望曲率,其逆近似于拟合参数的协方差;D 最优(D-optimal)设计最大化其行列式,从而缩小不确定性椭球。这一分支的工作包括:离线设计,并给出在相差常数因子与对数因子意义下相匹配的下界(Scheid 等,2024);针对在最后一层线性化的 DPO 的 D 最优反馈(Kveton 等,2025)(两者均为预印本);在奖励模型最后一层使用的 Fisher 准则,该研究还发现跨提示词的比较能提高标注效率(Shen 等,2025a)(ICML 2025);为 Plackett-Luce 模型按对数行列式选择负例(Surana 等,2026)(2026 年的一篇预印本);在 RLHF 中借助最后一层的 Laplace 近似(第 17.2 节)做偏好贝叶斯优化式的采集(Cercola 等,2026a)(2026 年发表)。
ActiveUltraFeedback(Melikidze 等,2026)(ICML 2026)是迄今最系统的比较:在 12 个开放模型家族的回复上建立情境对决赌博机,在冻结的骨干网络上构建集成,并以语言模型评判者的 Likert 评分代替人。比较对象包括随机选择、两种启发式方法、三种经典的对决赌博机规则(infomax,即选择集成对其选择概率分歧最大的一对;双重 Thompson 采样;MaxMinLCB),以及两种追求大质量差距的新规则:一是双重反向 Thompson 采样(double reverse Thompson sampling),把同一后验样本的最大化点与最小化点配成一对;二是 DeltaUCB。用新规则选出 5,000 至 10,000 个样本微调的模型,胜过用随机选择、UltraFeedback 或对决赌博机规则选出 60,000 个样本训练的模型。不过,训练奖励模型时,随机选择表现很强;作者据此认为,此时多样性比大质量差距更可取。
35.3.4 用于在线对齐的 Thompson 采样 #
Dwaracherla 等人(2024)(ICML 2024)把双重 Thompson 采样和认知神经网络(epistemic neural network)引入语言模型的反馈收集。认知神经网络输出一族以随机输入为索引的预测,这些预测的离散程度反映了网络尚不知道的部分。每次查询包含一个提示词和两条 Gemini Nano 回复;“人”是一个模拟器,按 Bradley-Terry 模型做选择,所依据的奖励模型以 Gemini Pro 为基础,在 Anthropic 的有用性与无害性数据上拟合;策略用 best-of-(在 条回复中保留得分最高的一条)近似。双重 Thompson 采样胜过被动查询、Boltzmann 探索和 infomax。infomax 早期表现不错,随后远远落后,作者认为原因在于它不论信息是否有用都去获取;双重 Thompson 采样以少一个数量级的数据达到了被动查询的性能。Asghari 等人(2026)(2026 年的一篇预印本)把这一方法扩展到 9B 规模的 Gemma 策略:认知奖励网络使参数增加不到 5%;回复对按选择概率在集成粒子之间的方差选取(信息导向选择);每个强化信号上加一个小的正偏置,作者称之为肯定性推动(affirmative nudge)。它用不到 20,000 个标签,达到了离线 RLHF 用 200,000 个标签达到的水平。论文中 1,000 倍的因子来自曲线外推,消融实验没有把选择规则与推动的作用分开,也没有独立复现。
理论已相当成熟:针对轨迹偏好,已有遗憾与查询次数之间近乎最优的权衡(Wu 与 Sun,2024)(ICLR 2024;第 36.1 节);FGTS.CDB(Li 等,2024b)(ICML 2024)是线性情境对决赌博机的首个后验采样算法,遗憾为 ,接近极小极大最优;上置信界与 Thompson 采样都有神经正切核版本(Verma 等,2025)(ICLR 2025);在一般函数逼近下的在线 RLHF 中,Thompson 采样有 的界(Feng 与 Fu,2025)(2025 年的一篇预印本,没有实验)。
随后出现了两个应用版本。SEA(Liu 等,2024b)把对齐表述为情境对决赌博机,用 Thompson 采样求解,在 1B 至 6.9B 参数的模型上与 DPO、IPO、SLiC 配合使用;偏好来自标量奖励模型(Skywork-Reward-Llama-3.1-8B),另有一个实验以 GPT-4o-mini 为评判者。该工作是 NeurIPS 2024 研讨会的海报论文,未被 ICLR 2025、NeurIPS 2025 或 ICLR 2026 接收。warmPref-PS(Agnihotri 等,2024)是一篇未被 TMLR 接收的预印本,利用能力未知的专家给出的离线偏好为后验采样做热启动。
与之平行的另一分支用探索加成项代替后验采样,包括探索性偏好优化(XPO)(Xie 等,2025)(ICLR 2025)、价值激励偏好优化(Cen 等,2025)(ICLR 2025)、自我探索语言模型(Zhang 等,2024b)(TMLR),以及加在 DPO 目标上的基于计数的加成项(Bai 等,2025)(ICLR 2025)。在 KL 正则或 散度正则(包含 KL 散度的一族)下,这些加成项会“无意中”使探索偏向参考模型的高概率区域(Li 等,2026d)(ICLR 2026);现有在线 RLHF 算法的样本复杂度都随奖励的尺度指数增长(Chen 等,2025a)(NeurIPS 2025);没有显式探索的迭代 Nash 偏好优化(第 35.4.4 节)则可能对 KL 参数有指数依赖(Nan 等,2026)(2026 年的一篇预印本)。
35.3.5 随机选择难以超越 #
Oh 等人(2026b)是 ICLR 2026 的一篇研讨会论文(I Can't Believe It's Not Better)。该文在在线 DPO 中比较了基于不确定性的主动偏好学习与随机选择,任务涵盖无害性、有用性与指令遵循,以奖励模型和语言模型评判者作为代理。主动选择“与随机选择相比,在代理胜率上的提升微乎其微”;代理胜率上升的同时,模型在标准基准上的能力有所下降,主动选择既未能阻止这种下降,也没有明显降低方差。作者认为原因在于网络规模预训练带来的强先验,以及随机同策略样本的“廉价多样性”。其他结果也给正面结论加上了限定:朴素的不确定性估计会选出冗余样本(BAL-PM);infomax 在早期之后落后(Dwaracherla 等人);追求质量差距的规则胜过经典的对决规则(ActiveUltraFeedback);Chatbot Arena 的节省对一个目标是 54%,对另一个目标是 5%。此外,这些正面结果或用奖励模型模拟人(Dwaracherla 等人、Asghari 等人),或以准确率、相似度作为效用(APOHF),或使用语言模型评判者(Muldrew 等人、ActiveUltraFeedback、PDO、Duel-Evolve);BAL-PM 的节省来自人类偏好数据集,Chatbot Arena 的节省来自基于真实投票拟合的模拟。
35.3.6 查询是为了什么 #
区分查询的目的之后,这些结果便可以调和(推断)。对决赌博机与偏好贝叶斯优化的采集规则(双重 Thompson 采样、MaxMinLCB、qEUBO、infomax)旨在找到或确认最好的选项。对齐数据需要的则是有助于训练策略或奖励模型的对:DPO 训练得益于大的质量差距(ActiveUltraFeedback),奖励模型训练得益于多样性(BAL-PM 与 ActiveUltraFeedback 中随机选择的结果),离线方法则得益于对策略自身分布的覆盖(Oh 等人,以及第 35.4.3 节中的 Song 等人)。原样套用“找出最好”的规则,回答的就不是当前提出的问题。另有两点差别同样重要。其一,对齐是在依赖于策略的小候选集中挑选,而不是在整个设计空间中挑选,因此“主动”与“随机”之间的分歧,很大程度上可能源于该候选集本身已有的多样性(推断)。其二,Asghari 等人有关于奖励的显式后验,而 Oh 等人只有直接优化的策略所隐含的奖励。
截至 2026 年 9 月,我们没有找到这样的研究:在相同预算下使用人类标签,同时针对基于奖励模型的 RLHF 和 DPO,比较双重 Thompson 采样、信息导向选择、质量差距选择与随机选择。在这样的研究出现之前,收集偏好数据的团队应当保留一个随机选择组作为基线,并按数据的用途选择主动规则(推断)。
第 35.3 节引用的文献 37
- Lin 等人(2024b)Prompt Optimization with Human Feedback
- Kayal 等人(2025)Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds
- Wu 等人(2026)LLM Prompt Duel Optimizer: Efficient Label-Free Prompt Optimization
- Zhang 等人(2024a)Generating Chain-of-Thoughts with a Pairwise-Comparison Approach to Searching for the Most Promising Intermediate Thought
- Chiang 等人(2024)Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
- Karlekar 等人(2026)Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
- Chiang 等人(2025)LLM Routing with Dueling Feedback
- Gharat 等人(2026)Cost-Aware Best-LLM Identification using Dueling Feedback
- Nguyen 等人(2026)CUPID in the Model Zoo: Online Matchmaking for Selecting Your Dream LLM
- Qu 等人(2026)T-POP: Test-Time Personalization with Online Preference Feedback
- Muldrew 等人(2024)Active Preference Learning for Large Language Models
- Melo 等人(2024)Deep Bayesian Active Learning for Preference Modeling in Large Language Models
- Mehta 等人(2025)Sample Efficient Preference Alignment in LLMs via Active Exploration
- Das 等人(2025)Active Preference Optimization for Sample Efficient RLHF
- Ji 等人(2024)Reinforcement Learning from Human Feedback with Active Queries
- Scheid 等人(2024)Optimal Design for Reward Modeling in RLHF
- Kveton 等人(2025)Active Learning for Direct Preference Optimization
- Shen 等人(2025a)Active Reward Modeling: Adaptive Preference Labeling for Large Language Model Alignment
- Surana 等人(2026)MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization
- Cercola 等人(2026a)Efficient Reinforcement Learning from Human Feedback via Bayesian Preference Inference
- Melikidze 等人(2026)ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning
- Dwaracherla 等人(2024)Efficient Exploration for LLMs
- Asghari 等人(2026)Efficient Exploration at Scale
- Wu 与 Sun(2024)Making RL with Preference-based Feedback Efficient via Randomization
- Li 等人(2024b)Feel-Good Thompson Sampling for Contextual Dueling Bandits
- Verma 等人(2025)Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
- Feng 与 Fu(2025)Thompson Sampling in Online RLHF with General Function Approximation
- Liu 等人(2024b)Sample-Efficient Alignment for LLMs
- Agnihotri 等人(2024)Online Bandit Learning with Offline Preference Data for Improved RLHF
- Xie 等人(2025)Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF
- Cen 等人(2025)Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
- Zhang 等人(2024b)Self-Exploring Language Models: Active Preference Elicitation for Online Alignment
- Bai 等人(2025)Online Preference Alignment for Language Models via Count-based Exploration
- Li 等人(2026d)General Exploratory Bonus for Optimistic Exploration in RLHF
- Chen 等人(2025a)Avoiding $\mathbfexp(R_max)$ scaling in RLHF through Preference-based Exploration
- Nan 等人(2026)Efficient Exploration for Iterative Nash Preference Optimization
- Oh 等人(2026b)Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs
35.4 一个共用的似然与七个失效的类比 #
两个领域共用同一观测模型,在线问题上还共用同一种决策论表述,因此一个领域的采集规则几乎无需修改就能用于另一个领域。这一共同核心容易被过度解读;本节把它与类比失效的七处区分开来。
35.4.1 共有的部分 #
似然。Zhu 等人(2023)(ICML 2023)证明了三点:在线性奖励下,最大似然估计在 Bradley-Terry-Luce 模型和 Plackett-Luce 模型下都收敛,但用它训练的策略可能失败,而悲观估计在某种覆盖性假设下有效;对 个项目的排序,完整的 Plackett-Luce 估计比把排序拆成成对比较“渐近地更有效”;RLHF 与最大熵逆强化学习可以用同一套分析处理。Sun 等人(2025)(ICLR 2025)给出了深度嵌入上 Bradley-Terry 奖励模型的收敛速率,并认为 Bradley-Terry“并非必要的选择”(not a necessary choice),因为下游优化只需要保序的奖励。Tang 等人(2024)(ICML 2024)表明,DPO、IPO 与 SLiC 只在凸损失上不同,这对应于偏好贝叶斯优化中链接函数的选择。在偏好贝叶斯优化一侧,BoTorch 的 PairwiseGP(Meta Platforms, Inc.,2026h)(软件文档)和 LILO 使用 Thurstone 的概率单位链接(第 16.3 节、第 27.1 节),而 Kayal 等人和 PF-TS(Lazzaro 等,2026)(AISTATS 2026)分析的是 Bradley-Terry-Luce 模型。
在线决策问题。Xiong 等人(2024)(ICML 2024)把 RLHF 形式化为“反向 KL 正则的情境赌博机”(reverse-KL regularized contextual bandit),并给出有限样本保证;Ji 等人、Mehta 等人与 SEA 采用了情境对决赌博机的形式。两个领域都有遗憾保证(偏好贝叶斯优化方面有 Kayal 等人和 PF-TS,见第 29.3 节;RLHF 方面有 Wu 与 Sun、Ji 等人以及 APO),采集规则几乎可以原样迁移。
35.4.2 类比失效之处 #
目标。由式(35.5),KL 正则目标的最优解使策略网络既能表示语言模型,又能表示隐式奖励(Rafailov 等,2023)。Korbak 等人(2022)(EMNLP 2022 Findings)指出,单纯的强化学习微调会导致“分布坍缩”(distribution collapse),而 KL 正则的强化学习“等价于变分推断”(equivalent to variational inference),近似于这样一个贝叶斯后验:以奖励为证据,更新作为先验的语言模型。偏好贝叶斯优化返回潜在效用的最大化点;对齐返回的是按奖励指数倾斜的参考策略,并以这一倾斜后的策略为基准衡量遗憾。Won 等人(2025)(2025 年的一篇预印本)认为,当偏好编码了把参考策略更新为目标策略所需的信息时,对数比奖励是唯一合理的选择。
作为效用估计的隐式奖励。把 DPO 的隐式奖励当作高斯过程后验均值来解读并不可靠。它对训练数据的拟合与显式奖励模型一样好,但在五种分布外设定中,准确率平均低 3%,最多低 7%(Lin 等,2024a)(EMNLP 2024 Findings);大多数经过偏好调优的模型,对常见偏好数据集中的对排序正确的比例“不到 60%”,而且 DPO 目标甚至不适于纠正参考模型轻微的排序错误(Chen 等,2024)(NeurIPS 2024)。
强偏好。偏好接近确定时,Bradley-Terry 奖励差会发散,KL 正则的作用越来越弱,DPO 因而过拟合,每一对只出现少数几次时尤其如此(Azar 等,2024)(AISTATS 2024)。在偏好贝叶斯优化中,高斯过程先验直接约束潜在效用,因此这一问题不会以同样的形式出现(推断)。表 35.3 列出了全部九个方面。
| 方面 | 偏好贝叶斯优化的假设 | 基于偏好的对齐的假设 | 是否成立 | 原因与证据 |
|---|---|---|---|---|
| 观测模型 | 概率单位链接(PairwiseGP、LILO)或逻辑 Bradley-Terry(Kayal 等、PF-TS) |
逻辑 Bradley-Terry;列表用 Plackett-Luce;DPO、IPO 与 SLiC 分别对应逻辑损失、平方损失与合页损失 | 成立 | 两者都是成对的随机效用似然;链接只在噪声分布上不同(Zhu 等 2023;Tang 等 2024;Rafailov 等 2023) |
| 在线决策问题 | 以累积遗憾或简单遗憾衡量的对决赌博机 | 带反向 KL 正则的情境对决赌博机 | 成立 | 同样的采集规则适用(Xiong 等 2024;Ji 等;Mehta 等 2025) |
| 1. 目标 | 潜在效用的最大化点 | 按奖励指数倾斜的参考策略 | 失效 | 遗憾以倾斜后的参考策略为基准衡量(Rafailov 等 2023;Korbak 等 2022) |
| 2. 样本复杂度 | 条件性上界:偏好反馈与阶最优的标量反馈同阶(Kayal 等) | KL 正则下为 而非 ;现有在线算法随奖励尺度指数增长;迭代 Nash 方法可能对 KL 参数有指数依赖 | 失效 | 决定速率的是指向参考策略的 KL 项,而不是似然(Zhao 等 2025;Chen 等 2025;Nan 等 2026) |
| 3. 强偏好 | 高斯过程先验约束潜在效用 | 近乎确定的偏好使奖励差发散,KL 约束失去效力 | 失效 | 缺少类似奖励先验的约束来稳定拟合(Azar 等 2024) |
| 4. 效用估计 | 后验均值与方差 | DPO 的隐式奖励没有不确定性;分布外准确率平均低 3%;排序准确率大多低于 60% | 失效 | 隐式奖励是拟合策略的副产品(Lin 等 2024;Chen 等 2024) |
| 5. 查询分布 | 设计空间中任意位置的任意一对 | 候选从策略或模型池中采样;离线方法需要全局覆盖;探索加成项偏向参考模型的高概率区域 | 失效 | 能比较什么,受限于策略能生成什么(Song 等 2024;Li 等 2026) |
| 6. 规模 | 数十至数百次比较,约 2 至 20 维,Laplace 近似或期望传播 | 对序列的 至 次比较;集成、dropout 或 Laplace 近似 | 失效 | 对本章各项研究的汇总(推断) |
| 7. 回答者 | 一个效用一致的决策者 | 许多标注者或语言模型评判者 | 失效 | 用一个奖励拟合许多人,会引出社会选择的问题(Gölz 等 2025;Siththaranjan 等 2024;Chidambaram 等 2026) |
其中三点差别,即样本量、回答者的异质性与查询的来源,可以通过在两个世界中拟合同一个似然看出;图 35.2 还展示了第一点,即每个世界返回什么。
可以尝试以下几点:
- 从“一个人(PBO)”的世界开始,按几次“重新抽取”。50 次比较时,区间带很宽,返回的设计在此人最喜欢的 0.75 附近摆动。把 拖到 1,000,000,区间带收拢到此人的效用上。
- 把“第二组的占比”调到 0.4。区间带依然很窄,但拟合的奖励与两组都不吻合,误差也不再随 增大而缩小:用同一个奖励拟合两组,得到的是一种折中(第 35.4.4 节)。
- 把“选项对的来源”切换为“来自策略”。在策略覆盖的区域之外,无论 多大,区间带都保持很宽:数据再多,也触及不到策略从不生成的选项。
- 把“世界”切换为“许多标注者(对齐)”。橙色曲线是按 重新加权的参考策略,只能对策略生成的选项重新加权,因此始终到不了 A 组最喜欢的 0.75 附近。回到“一个人(PBO)”,令选项对来自策略并取 :偏好贝叶斯优化若只能从别人的候选中挑选,就会止步于策略生成范围的边缘(第 35.3.6 节)。
35.4.3 样本复杂度与覆盖 #
记 为学到的策略与最优策略之间允许的差距。样本复杂度为 ,意味着把 减半需要四倍的数据; 则意味着两倍。Zhao 等人(2025)(NeurIPS 2025)指出,以往对 KL 正则 RLHF 的分析给出的是与无正则问题相同的 ,而更精细的分析给出 。Song 等人(2024)(NeurIPS 2024)证明:类似 DPO 的离线对比方法要达到最优策略,全局覆盖(global coverage)条件是充分必要的,该条件大致是说数据包含最优策略可能产生的每一条回复;在线强化学习则只需要部分覆盖。上文第 3 步展示了缺乏覆盖时的情形。因此,偏好贝叶斯优化与 RLHF 理论的主要差别在于指向参考策略的 KL 约束和策略的参数化,而不在于偏好似然(推断)。
35.4.4 许多标注者:从优化到社会选择 #
回答者的差别把对齐推向社会选择(social choice),即研究如何把许多人的偏好合成为一个决策的学科(第 40.7 节);偏好贝叶斯优化在这方面才刚刚起步(第 20.5 节)。偏好成环时,可能不存在 Condorcet 赢家。Borda 计数(Borda count)按每个选项胜过随机抽取的对手的频率为其打分;von Neumann 赢家(von Neumann winner)是选项上的概率分布,在期望意义上胜过或打平每一个单独选项,即使偏好成环也存在;两人博弈的 Nash 均衡(Nash equilibrium)是双方都无法单方面改进的一对策略。Nash 人类反馈学习(Munos 等,2024)(ICML 2024)寻求比任何对手都更受偏好的策略,即两人常和博弈的 Nash 均衡;在任意偏好下,基于偏好的强化学习的目标则变为 von Neumann 赢家(Wang 等,2023a)(NeurIPS 2023)。von Neumann 赢家也是对决赌博机文献中的解概念,因此对决赌博机关于不可传递偏好的结果(第 21.1 节),是 Nash 学习在偏好贝叶斯优化一侧的自然对应(推断);我们没有核查 2025 或 2026 年是否有论文正式建立了这一联系。
Gölz 等人(2025)(NeurIPS 2025)用失真度(distortion)衡量对齐方法,即可达到的最佳平均效用与学到的策略的平均效用之比在最坏情况下的值;他们证明 Nash 学习的失真度达到极小极大最优,而在完整设定下,RLHF 与 DPO 的失真度可能是指数级的,或者无界。Oko 等人(2026)(ICML 2026)随后证明,在奖励截断下,指数级的退化源于偏好数据与参考策略之间的不匹配,而非算法本身。这一争论尚无定论。用单个奖励拟合许多人会产生什么结果,也已有刻画。存在未观测的情境(例如由哪位标注者作答)时,单个学到的效用会隐式地按 Borda 计数聚合(Siththaranjan 等,2024)(ICLR 2024),Bradley-Terry-Luce 损失也是如此(An 等,2026)(2026 年的一篇预印本),这就是上文第 2 步中的折中曲线。每个用户的数据有限时,二元比较无法识别潜在的用户类型,而三个或更多项目的排序可以(Chidambaram 等,2026)(AISTATS 2026)。在贝叶斯边际化或 KL 稳健优化下,KL 正则目标的有效奖励有闭式表达,在贝叶斯分支中是乐观的,在稳健分支中是悲观的(Hahami 等,2026)(2026 年的一篇预印本)。由此,同一个奖励后验在选择查询时应乐观地使用,在决定部署什么时应悲观地使用;偏好贝叶斯优化的采集函数只处理了前者(推断)。与许多人对齐可能意味着什么,留待第 41.3 节讨论。
第 35.4 节引用的文献 22
- Zhu 等人(2023)Principled Reinforcement Learning with Human Feedback from Pairwise or K-wise Comparisons
- Sun 等人(2025)Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives
- Tang 等人(2024)Generalized Preference Optimization: A Unified Approach to Offline Alignment
- Meta Platforms, Inc.(2026h)BoTorch PairwiseGP source code pairwise_gp.py
- Lazzaro 等人(2026)A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback
- Xiong 等人(2024)Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint
- Rafailov 等人(2023)Direct Preference Optimization: Your Language Model is Secretly a Reward Model
- Korbak 等人(2022)RL with KL penalties is better viewed as Bayesian inference
- Won 等人(2025)Differential Information Distribution: A Bayesian Perspective on Direct Preference Optimization
- Lin 等人(2024a)On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization
- Chen 等人(2024)Preference Learning Algorithms Do Not Learn Preference Rankings
- Azar 等人(2024)A General Theoretical Paradigm to Understand Learning from Human Preferences
- Zhao 等人(2025)Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
- Song 等人(2024)The Importance of Online Data: Understanding Preference Fine-tuning via Coverage
- Munos 等人(2024)Nash Learning from Human Feedback
- Wang 等人(2023a)Is RLHF More Difficult than Standard RL?
- Gölz 等人(2025)Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?
- Oko 等人(2026)Distortion of AI Alignment Revisited: RLHF is a Decent Utilitarian Aligner
- Siththaranjan 等人(2024)Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
- An 等人(2026)Differential Voting: Loss Functions For Axiomatically Diverse Aggregation of Heterogeneous Preferences
- Chidambaram 等人(2026)Direct Preference Optimization with Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences
- Hahami 等人(2026)A Unifying Lens on Reward Uncertainty in RLHF
35.5 常见说法核查 #
表 35.4 核查了关于偏好贝叶斯优化与对齐之间关系的常见说法。
| 说法 | 证据怎么说 |
|---|---|
| 偏好贝叶斯优化与 RLHF 共用 Bradley-Terry 模型。 | 部分正确。两者都使用成对的随机效用似然,但偏好贝叶斯优化的默认实现 PairwiseGP 使用概率单位链接。逻辑形式见于 González 等最初的偏好贝叶斯优化论文(González 等,2017)、POP-BO(Xu 等,2024b)(ICML 2024)、MaxMinLCB 以及 MR-LPF(Kayal 等的算法)。 |
| DPO 与偏好贝叶斯优化共用概率单位似然或 Bradley-Terry 似然。 | “概率单位”是错的。DPO 损失是逻辑 Bradley-Terry 对数似然,附录中还有 Plackett-Luce 版本。 |
| Bradley-Terry 是连接贝叶斯优化、RLHF 与 DPO 的罗塞塔石碑;DPO 的隐式奖励在概念上类似于高斯过程后验。 | 在似然层面成立;对隐式奖励则只是解释性的类比,因为隐式奖励不带任何不确定性(表 35.3)。 |
| RLHF 能扩展规模但查询效率低;偏好贝叶斯优化查询效率高但不能扩展规模;混合方法可以兼得两者之长。 | 方向成立,但有保留。混合方法已经存在(集成后验加双重 Thompson 采样或信息导向选择),但其后验是神经网络集成,而不是高斯过程;而且同类方法在在线 DPO 中相对随机选择的收益微乎其微。我们没有找到在语言模型规模的 RLHF 回路中以高斯过程或核代理模型作为奖励模型的工作。 |
| 把偏好贝叶斯优化的不确定性引入 RLHF,以及用来自语言模型的先验为偏好贝叶斯优化做热启动,都是有待解决的挑战。 | 两者自 2024 年起均已有研究:前者有 Dwaracherla 等、BAL-PM 与 Cercola 等,结果有正有负;后者有 OPEN、MAPLE 与 Eichelbeck 等,除 OPEN 外都只用了模拟用户。 |
| Ji 等的带主动查询的 RLHF 发表于 NeurIPS。 | 内容正确(ADPO 用约一半的查询达到 DPO 的水平),但发表场所是 TMLR。 |
| RLHF 奖励模型“出了名地校准不良”(notoriously poorly calibrated)。 | 我们无法按其原样表述证实这一说法,而且它通常没有引用出处。Thies 等人(2026a)(ICML 2026)发现,RLHF 奖励模型的校准“与基准准确率强相关,但并非完全相关”。 |
| 偏好贝叶斯优化使用约 10 至 1,000 次比较,RLHF 约 50,000 至 500,000 次(或者:几十至一两百次,对比数千至数百万次)。 | 数量级上的对比成立,但两个范围都没有出处。有真人参与的偏好贝叶斯优化研究使用几十至一两百次比较;模拟的高维偏好贝叶斯优化每维约用 10 至 15 次,在 102 维时约 1,500 次(Menn 等,2026a)(2026 年的一篇预印本);对齐使用 至 次。 |
| LiPO 表明,列表式偏好数据带来的收益随列表长度单调增长。 | 部分正确。只有 LiPO-λ 损失从更长的列表中单调受益;DPO 的 Plackett-Luce 形式则不然(Liu 等,2025a)(NAACL 2025)。 |
| PEBOL 在 10 轮之后把 MAP@10 提高了最多 131%。 | 这个数字(前 10 名平均精度均值)只出现在 arXiv 的第一版中(Austin 等,2024b)。RecSys 版本改为报告前 10 名平均倒数排名:最高 0.27,而最好的单体式基线为 0.17。 |
第 35.5 节引用的文献 6
- González 等人(2017)Preferential Bayesian Optimization
- Xu 等人(2024b)Principled Preferential Bayesian Optimization
- Thies 等人(2026a)Calibrated Preference Learning: The Case of Label Ranking
- Menn 等人(2026a)Local Preferential Bayesian Optimization
- Liu 等人(2025a)LiPO: Listwise Preference Optimization through Learning-to-Rank
- Austin 等人(2024b)Bayesian Optimization with LLM-Based Acquisition Functions for Natural Language Preference Elicitation
35.6 反向的流动 #
迁移的主要方向一直是从赌博机和偏好贝叶斯优化到对齐:双重 Thompson 采样、认知神经网络、信息导向采样、核化对决赌博机和感知不确定性的奖励模型。反方向的迁移迄今主要是问题表述、应用与评估。MaxMinLCB(Pásztor 等,2024)(NeurIPS 2024)是一种核化偏好赌博机,把选择一对选项表述为零和 Stackelberg 博弈(一方先承诺,另一方随后应对)。该文以这类模型“已被用于微调大语言模型的系统”作为研究动机;该课题组随后发表了 RewardUQ(Yang 等,2026b)(EurIPS 2025 的一篇研讨会论文)和 ActiveUltraFeedback。Kayal 等人以提示词优化为应用;PF-TS 对称地抽取两个竞争者,其作者认为,使用人类评估者或语言模型评判者时,这样做往往可取,有时甚至必要;Ahmed 与 Ghasemi(2026)(TMLR)的多用户对决赌博机开篇即指出,在语言模型微调中用平均偏好训练会对少数群体不公平,并证明了 个用户、 条臂时公平性遗憾的下界 。Ax 1.2.3 加入了语言模型消息的抽象,1.3.0 加入了语言在回路的标注试验,以及面向偏好贝叶斯优化的 qEUBO 调度(Meta Platforms, Inc.,2026l)(软件文档)。看似迁移的并不都是迁移:LILO 扩展的是 BOPE(Lin 等,2022)(AISTATS 2022),而 BOPE 早于这一波对齐研究;PABBO(Zhang 等,2025a)(ICLR 2025)和 POP-BO 的摘要也没有从语言模型的角度表述各自的问题。
35.6.1 三个可以直接迁移的结果 #
对齐领域有三个结果可以直接用于偏好贝叶斯优化。我们没有找到从 DPO、LiPO、PAL 或感知不确定性的奖励模型中借用方法组件的偏好贝叶斯优化论文,但也没有系统检查 2024 至 2026 年偏好贝叶斯优化论文的参考文献列表(推断)。
排序比成对比较携带更多信息。Zhu 等人证明,完整的 Plackett-Luce 估计优于把排序拆成成对比较;Chidambaram 等人证明,三个项目的排序能识别成对比较无法识别的潜在用户类型。Katkuri 等人(2026)(2026 年的一篇预印本)用 Plackett-Luce 模型从视觉语言模型的排序中学习奖励,在 Meta-World 上达到或超过了成对 Bradley-Terry 和 RL-VLM-F(Wang 等,2024b)(ICML 2024);LiPO(Liu 等,2025a)把排序学习的损失(第 36.6 节)用于列表式偏好优化;GraphDPO(Liu 等,2026a)(2026 年的一篇预印本)把偏好推广到图上。让人在多个选项中做选择的偏好贝叶斯优化界面,即 GimmBO(Liu 等,2026b)(SIGGRAPH North America 2026)和 MultiBO(Rajagopalan 等,2026)(ICML 2026),采用列表是出于界面设计的考虑(第 20.1 节),并未引用上述任何形式化论证。
区分噪声与无知。若干对齐论文把奖励的不确定性分为两部分:偶然(aleatoric)部分,即回答中不可约的噪声;认知(epistemic)部分,即数据不足造成的不确定性。Lou 等人(2024)(2024 年的一篇预印本)用概率价值头处理前者,用集成的分歧处理后者。另一些工作通过量化奖励的不确定性来缓解过度优化,所用方法有奖励模型集成(Coste 等,2024)(ICLR 2024),以及在 LoRA 权重(一小组低秩适配器权重)上做 Laplace 近似(Yang 等,2024)(一篇研讨会论文);BNRM 在 Bradley-Terry 模型中加入非负因子分析(Duan 等,2026)(ICML 2026);RewardUQ 发现,模型规模和初始化比不确定性方法的选择更重要。人的比较噪声属于偶然部分,而按分歧采集依赖的是认知部分。
为预言机的偏差建模。NAOD 把评判者的偏差纳入采集(第 35.2.4 节);使用语言模型预言机的 LILO 则没有。
35.6.2 来自多元奖励模型的群体先验 #
多元奖励模型与个性化奖励模型可以为偏好贝叶斯优化的新用户提供群体先验。PAL(Chen 等,2025c)(ICLR 2025)使用理想点模型(每个用户和每个选项都是共享潜空间中的一个点,偏好随距离增大而下降),并结合混合建模,只需少量样本就能泛化到新用户。Poddar 等人(2024)(NeurIPS 2024)的变分偏好学习为每个用户推断一个潜向量;每个用户的数据很少时,会出现后验坍缩(各用户的潜向量不再携带信息)(Kim 与 Kim,2026)(ICLR 2026)。LoRe(Bose 等,2025)(COLM 2025)和 Cai 等人(2026)(SIGIR 2026)把每个用户的奖励表示为共享基函数的加权组合;在一个个性化奖励模型基准上,最好的模型达到了 75.94% 的准确率(Ma 等,2026)(COLM 2026)。这些方法都没有为学习用户权重而选择查询。因此,在元学习得到的低秩先验上对每个用户主动引出偏好,是偏好贝叶斯优化借鉴这些工作的自然下一步(推断)。
ActiveUltraFeedback 的结果还揭示了偏好贝叶斯优化尚未明确做出的区分:有助于定位最优点的对,不同于有助于学习可复用效用模型的对(推断)。利用以往用户构建群体先验的偏好贝叶斯优化工作属于第二种情形。例如,HOMI 基于用户模型预训练先验,只在第二次和第三次迭代时显著更好(Liao 等,2026)(CHI 2026)。
第 35.6 节引用的文献 23
- Pásztor 等人(2024)Bandits with Preference Feedback: A Stackelberg Game Perspective
- Yang 等人(2026b)RewardUQ: A Unified Framework for Uncertainty-Aware Reward Models
- Ahmed 与 Ghasemi(2026)Multi-User Dueling Bandits: A Fair Approach using Nash Social Welfare
- Meta Platforms, Inc.(2026l)CHANGELOG (versions 1.2 to 1.3)
- Lin 等人(2022)Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes
- Zhang 等人(2025a)PABBO: Preferential Amortized Black-Box Optimization
- Katkuri 等人(2026)Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning
- Wang 等人(2024b)RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback
- Liu 等人(2025a)LiPO: Listwise Preference Optimization through Learning-to-Rank
- Liu 等人(2026a)Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph
- Liu 等人(2026b)GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization
- Rajagopalan 等人(2026)Personalized Image Generation via Human-in-the-loop Bayesian Optimization
- Lou 等人(2024)Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown
- Coste 等人(2024)Reward Model Ensembles Help Mitigate Overoptimization
- Yang 等人(2024)Bayesian Reward Models for LLM Alignment
- Duan 等人(2026)Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling
- Chen 等人(2025c)PAL: Pluralistic Alignment Framework for Learning from Heterogeneous Preferences
- Poddar 等人(2024)Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
- Kim 与 Kim(2026)Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback
- Bose 等人(2025)LoRe: Personalizing LLMs via Low-Rank Reward Modeling
- Cai 等人(2026)One Adapts to Any: Meta Reward Modeling for Personalized LLM Alignment
- Ma 等人(2026)Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
- Liao 等人(2026)Efficient Human-in-the-Loop Optimization via Priors Learned from User Models
35.7 已定、有争议与缺失 #
已定。偏好贝叶斯优化与基于偏好的对齐共用成对的随机效用似然(Bradley-Terry、Thurstone、Plackett-Luce)和情境对决赌博机的表述,采集规则几乎可以原样在两者之间迁移。KL 正则目标的最优解是按 倾斜的参考策略;DPO 之所以成立,是因为归一化常数在 Bradley-Terry 模型中相互抵消(Rafailov 等,2023)。偏好贝叶斯优化的默认实现使用概率单位链接,DPO 使用逻辑链接。作为模拟用户和评判者的语言模型在总体上接近人,但对个人不可靠,并且存在位置、长度和自我偏好方面的偏差。直接充当对决赌博机优化器的语言模型,强遗憾不及经典算法(Xia 等,2025);在标量贝叶斯优化中,把智能体的观测换成随机标签后,其表现并无差别(Gupta 等,2025)。表 35.1 的八个系统中只有两个是严格意义上的偏好贝叶斯优化。
有争议。对齐中主动选择比较是否胜过随机选择:一方是胜率提高 1% 至 6%、标签减少 33% 至 68%,以及模拟设定中一个数量级的节省;另一方是在线 DPO 中微乎其微的收益(Oh 等,2026b)。按查询目的调和两者,是我们的推断。RLHF 与 DPO 的指数级失真度是源于算法(Gölz 等,2025),还是源于数据与参考策略之间的不匹配(Oko 等,2026)。Asghari 等人的消融实验没有分离两个组成部分,也没有复现,其大量标签节省是否成立。Bradley-Terry 形式究竟是否必要(Sun 等,2025)。
缺失。分别用人的比较和语言模型的比较运行偏好贝叶斯优化回路,并报告两者的遗憾或样本效率。测量评判者的位置偏差如何传导到采集决策。在人类标签和共同预算下,针对基于奖励模型的 RLHF 与 DPO,比较双重 Thompson 采样、信息导向选择、质量差距选择与随机选择。对任一基于偏好的文本提示词优化器开展真人评估。在语言模型规模的 RLHF 回路中,以高斯过程或核代理模型作为奖励模型。用对齐领域的组件构建偏好贝叶斯优化方法(Plackett-Luce 排序、偶然与认知不确定性的拆分、预言机偏差模型、带逐用户主动引出的多元先验);设计能区分“用于找最优点的对”与“用于学习可复用效用的对”的采集函数。
第 35.7 节引用的文献 7
- Rafailov 等人(2023)Direct Preference Optimization: Your Language Model is Secretly a Reward Model
- Xia 等人(2025)Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents
- Gupta 等人(2025)LLMs for Bayesian Optimization in Scientific Domains: Are We There Yet?
- Oh 等人(2026b)Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs
- Gölz 等人(2025)Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?
- Oko 等人(2026)Distortion of AI Alignment Revisited: RLHF is a Decent Utilitarian Aligner
- Sun 等人(2025)Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives
延伸阅读 #
- Rafailov 等人(2023)用几页篇幅从 KL 正则目标推导出 DPO;第 35.1.3 节中的推导沿用了他们的思路。
- Ouyang 等人(2022)描述了 RLHF 流程,正是这一流程使比较在语言模型中居于核心地位;文中详细说明了比较数据的收集方式。
- Dwaracherla 等人(2024)与 Oh 等人(2026b)是对齐中主动收集偏好的正反两面,宜对照阅读。
- Melikidze 等人(2026)是对齐数据采集规则最系统的比较,也最清楚地表明:查询目的不同,胜出的规则也不同。
- Kobalczyk 等人(2026)是最清晰的例子:语言模型只在高斯过程偏好回路的接口处工作。
- Kirk 等人(2026)(一篇预印本)在同一个实验中测量了模拟用户如何对总体判断正确,而对每个人判断错误。
- Siththaranjan 等人(2024)与 Gölz 等人(2025)解释了许多人作答时,单个奖励会产生什么结果。
参考文献
- (2024). Online Bandit Learning with Offline Preference Data for Improved RLHF. arXiv (not accepted at TMLR). 预印本引用于 §35.3
- (2026). Multi-User Dueling Bandits: A Fair Approach using Nash Social Welfare. Transactions on Machine Learning Research. 引用于 §35.6
- (2026). Differential Voting: Loss Functions For Axiomatically Diverse Aggregation of Heterogeneous Preferences. arXiv. 预印本引用于 §35.4
- (2026). Efficient Exploration at Scale. arXiv. 预印本引用于 §35.3
- (2024a). Bayesian Optimization with LLM-Based Acquisition Functions for Natural Language Preference Elicitation. RecSys 2024 (arXiv v2). 引用于 §35.2
- (2024b). Bayesian Optimization with LLM-Based Acquisition Functions for Natural Language Preference Elicitation. arXiv. 预印本引用于 §35.5
- (2024). A General Theoretical Paradigm to Understand Learning from Human Preferences. AISTATS 2024. 引用于 §35.1 §35.4
- (2025). Online Preference Alignment for Language Models via Count-based Exploration. ICLR 2025. 引用于 §35.3
- (2025). LoRe: Personalizing LLMs via Low-Rank Reward Modeling. Conference on Language Modeling (COLM 2025). 引用于 §35.6
- (2026). One Adapts to Any: Meta Reward Modeling for Personalized LLM Alignment. SIGIR 2026. 引用于 §35.6
- (2025). Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF. ICLR 2025. 引用于 §35.3
- (2026a). Efficient Reinforcement Learning from Human Feedback via Bayesian Preference Inference. IFAC Journal of Systems and Control. doi:10.1016/j.ifacsc.2026.100398. 引用于 §35.3
- (2026). Multiple latent orderings better predict language model preferences. arXiv. 预印本引用于 §35.2
- (2024). Preference Learning Algorithms Do Not Learn Preference Rankings. Advances in Neural Information Processing Systems. doi:10.52202/079017-3234. 引用于 §35.4
- (2025a). Avoiding scaling in RLHF through Preference-based Exploration. Advances in Neural Information Processing Systems 38 (NeurIPS 2025). doi:10.52202/085713-5485. 引用于 §35.3
- (2025c). PAL: Pluralistic Alignment Framework for Learning from Heterogeneous Preferences. ICLR 2025. 引用于 §35.6
- (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. ICML 2024. 引用于 §35.3
- (2025). LLM Routing with Dueling Feedback. arXiv (not accepted at ICLR 2026). 预印本引用于 §35.3
- (2026). Direct Preference Optimization with Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences. International Conference on Artificial Intelligence and Statistics. 引用于 §35.4
- (2017). Deep reinforcement learning from human preferences. Advances in Neural Information Processing Systems. 引用于 §35.1
- (2024). Reward Model Ensembles Help Mitigate Overoptimization. International Conference on Learning Representations. 引用于 §35.1 §35.6
- (2025). Active Preference Optimization for Sample Efficient RLHF. Machine Learning and Knowledge Discovery in Databases. Research Track. doi:10.1007/978-3-032-06096-9_6. 引用于 §35.3
- (2026). Optimal Design for Active Preference Learning with Biased LLM Judges. arXiv. 预印本引用于 §35.2
- (2026). Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling. ICML 2026. 引用于 §35.6
- (2023). AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback. Advances in Neural Information Processing Systems. doi:10.52202/075280-1308. 引用于 §35.2
- (2024). Efficient Exploration for LLMs. ICML 2024. 引用于 §35.3
- (2026). Supporting High-Stakes Decision Making Through Interactive Preference Elicitation in the Latent Space. International Conference on Learning Representations. 引用于 §35.2
- (2025). Thompson Sampling in Online RLHF with General Function Approximation. arXiv. 预印本引用于 §35.3
- (2026). Cost-Aware Best-LLM Identification using Dueling Feedback. Advances in Neural Information Processing Systems. 引用于 §35.3
- (2025). Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences? NeurIPS 2025. 引用于 §35.4 §35.7
- (2017). Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §35.5
- (2025). LLMs for Bayesian Optimization in Scientific Domains: Are We There Yet? Findings of the Association for Computational Linguistics: EMNLP 2025. 引用于 §35.2 §35.7
- (2026). A Unifying Lens on Reward Uncertainty in RLHF. arXiv. 预印本引用于 §35.4
- (2024). Bayesian Preference Elicitation with Language Models. arXiv. 预印本引用于 §35.2
- (2024). Reinforcement Learning from Human Feedback with Active Queries. TMLR. 引用于 §35.3
- (2026). Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences. ICLR 2026 RSI Workshop. 研讨会论文引用于 §35.3
- (2026). Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning. arXiv. 预印本引用于 §35.6
- (2025). Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds. International Conference on Machine Learning. 引用于 §35.3
- (2026). Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback. ICLR 2026. 引用于 §35.6
- (2026). PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users. arXiv. 预印本引用于 §35.2
- (2025). Active Task Disambiguation with LLMs. ICLR 2025. 引用于 §35.2
- (2026). LILO: Bayesian Optimization with Natural Language Feedback. ICML 2026. 引用于 §35.2
- (2022). RL with KL penalties is better viewed as Bayesian inference. Findings of the Association for Computational Linguistics: EMNLP 2022. doi:10.18653/v1/2022.findings-emnlp.77. 引用于 §35.4
- (2024a). A Sober Look at LLMs for Material Discovery: Are They Actually Good for Bayesian Optimization Over Molecules? International Conference on Machine Learning. 引用于 §35.2
- (2026). Distorted Perspectives of LLM-Simulated Preferences: Can AI Mislead Design? arXiv. 预印本引用于 §35.2
- (2025). Active Learning for Direct Preference Optimization. arXiv. 预印本引用于 §35.3
- (2026). A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback. International Conference on Artificial Intelligence and Statistics. 引用于 §35.4
- (2024b). Feel-Good Thompson Sampling for Contextual Dueling Bandits. International Conference on Machine Learning. 引用于 §35.3
- (2025b). Eliciting Human Preferences with Language Models. ICLR 2025. 引用于 §35.2
- (2026d). General Exploratory Bonus for Optimistic Exploration in RLHF. International Conference on Learning Representations. 引用于 §35.3
- (2026f). Preference-Guided Prompt Optimization for Text-to-Image Generation. CHI 2026. 引用于 §35.2
- (2026). Efficient Human-in-the-Loop Optimization via Priors Learned from User Models. CHI 2026. 引用于 §35.6
- (2022). Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes. International Conference on Artificial Intelligence and Statistics. 引用于 §35.2 §35.6
- (2024a). On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization. Findings of the Association for Computational Linguistics: EMNLP 2024. doi:10.18653/v1/2024.findings-emnlp.940. 引用于 §35.4
- (2024b). Prompt Optimization with Human Feedback. ICML 2024 MHFAIA Workshop (no formal proceedings). 研讨会论文引用于 §35.3
- (2024a). Large Language Models to Enhance Bayesian Optimization. International Conference on Learning Representations. 引用于 §35.2
- (2024b). Sample-Efficient Alignment for LLMs. NeurIPS 2024 LanGame Workshop. 研讨会论文引用于 §35.3
- (2025a). LiPO: Listwise Preference Optimization through Learning-to-Rank. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers). doi:10.18653/v1/2025.naacl-long.121. 引用于 §35.5 §35.6
- (2026a). Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph. arXiv. 预印本引用于 §35.6
- (2026b). GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization. ACM Transactions on Graphics. doi:10.1145/3811293. 引用于 §35.6
- (2024). Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown. arXiv (withdrawn from ICLR 2025). 预印本引用于 §35.6
- (2026). Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization. COLM 2026. 引用于 §35.6
- (2025). MAPLE: A Framework for Active Preference Learning Guided by Large Language Models. Proceedings of the AAAI Conference on Artificial Intelligence. doi:10.1609/aaai.v39i26.34964. 引用于 §35.2
- (2025). Sample Efficient Preference Alignment in LLMs via Active Exploration. COLM 2025. 引用于 §35.3
- (2026). ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning. ICML 2026. 引用于 §35.3
- (2024). Deep Bayesian Active Learning for Preference Modeling in Large Language Models. NeurIPS 2024. 引用于 §35.3
- (2026a). Local Preferential Bayesian Optimization. arXiv. 预印本引用于 §35.5
- (2026h). BoTorch PairwiseGP source code pairwise_gp.py. GitHub. 软件引用于 §35.4
- (2026l). CHANGELOG (versions 1.2 to 1.3). GitHub. 软件引用于 §35.6
- (2024). Active Preference Learning for Large Language Models. ICML 2024. 引用于 §35.2 §35.3
- (2024). Nash Learning from Human Feedback. ICML 2024. 引用于 §35.4
- (2026). Efficient Exploration for Iterative Nash Preference Optimization. arXiv. 预印本引用于 §35.3
- (2026). CUPID in the Model Zoo: Online Matchmaking for Selecting Your Dream LLM. International Conference on Machine Learning (ICML 2026). 引用于 §35.3
- (2025). Cooperative Design Optimization through Natural Language Interaction. UIST 2025. 引用于 §35.2
- (2026b). Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs. ICLR 2026 Workshop: I Can't Believe It's Not Better (ICBINB). 研讨会论文引用于 §35.3 §35.7
- (2026). Distortion of AI Alignment Revisited: RLHF is a Decent Utilitarian Aligner. International Conference on Machine Learning. 引用于 §35.4 §35.7
- (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems. 引用于 §35.1
- (2024). LLM Evaluators Recognize and Favor Their Own Generations. NeurIPS 2024. 引用于 §35.2
- (2024). Bandits with Preference Feedback: A Stackelberg Game Perspective. Advances in Neural Information Processing Systems. doi:10.52202/079017-0383. 引用于 §35.6
- (2026). Efficient Personalization of Generative User Interfaces. arXiv. 预印本引用于 §35.2
- (2023). Active Preference Inference using Language Models and Probabilistic Reasoning. NeurIPS 2023 FMDM Workshop. 研讨会论文引用于 §35.2
- (2024). Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning. Advances in Neural Information Processing Systems 37 (NeurIPS 2024). doi:10.52202/079017-1664. 引用于 §35.6
- (2026). Bayesian Teaching Enables Probabilistic Reasoning in Large Language Models. Nature Communications. doi:10.1038/s41467-025-67998-6. 引用于 §35.2
- (2026). T-POP: Test-Time Personalization with Online Preference Feedback. International Conference on Machine Learning. 引用于 §35.3
- (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. 引用于 §35.1 §35.4 §35.7
- (2026). Personalized Image Generation via Human-in-the-loop Bayesian Optimization. International Conference on Machine Learning. 引用于 §35.6
- (2026). Bayesian Optimization of Catalysis With In-Context Learning. ACS Central Science. doi:10.1021/acscentsci.5c02418. 引用于 §35.2
- (2026). Large language models as uncertainty-calibrated optimizers for experimental discovery. Nature Machine Intelligence. doi:10.1038/s42256-026-01283-z. 引用于 §35.2
- (2026). When Is an LLM Worth It for Hyperparameter Optimization? A Budget-Matched Study on Tabular Data Finds the Warm-Start Is a Default Configuration, Not the Model. arXiv. 预印本引用于 §35.2
- (2025). Reproducibility Study of Large Language Model Bayesian Optimization. arXiv. 预印本引用于 §35.2
- (2026). Beyond expert users: agents should help users construct preferences, not just elicit them. Conference on Language Modeling (COLM 2026). 引用于 §35.2
- (2024). Optimal Design for Reward Modeling in RLHF. arXiv. 预印本引用于 §35.3
- (2025). Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants. 2025 47th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC). doi:10.1109/embc58623.2025.11253762. 引用于 §35.2
- (2026). Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations. Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). doi:10.18653/v1/2026.acl-long.2192. 引用于 §35.2
- (2025a). Active Reward Modeling: Adaptive Preference Labeling for Large Language Model Alignment. International Conference on Machine Learning. 引用于 §35.3
- (2025). Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge. Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics. 引用于 §35.2
- (2024). Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF. ICLR 2024. 引用于 §35.4
- (2024). The Importance of Online Data: Understanding Preference Fine-tuning via Coverage. NeurIPS 2024. 引用于 §35.4
- (2025). Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives. ICLR 2025. 引用于 §35.4 §35.7
- (2026). MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization. arXiv. 预印本引用于 §35.3
- (2024). Generalized Preference Optimization: A Unified Approach to Offline Alignment. International Conference on Machine Learning. 引用于 §35.1 §35.4
- (2026a). Calibrated Preference Learning: The Case of Label Ranking. International Conference on Machine Learning (ICML 2026). 引用于 §35.5
- (2025). Neural Dueling Bandits: Preference-Based Optimization with Human Feedback. International Conference on Learning Representations. 引用于 §35.3
- (2023a). Is RLHF More Difficult than Standard RL? NeurIPS 2023. 引用于 §35.4
- (2024a). Large Language Models are not Fair Evaluators. ACL 2024. 引用于 §35.2
- (2024b). RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback. International Conference on Machine Learning. 引用于 §35.6
- (2025). Differential Information Distribution: A Bayesian Perspective on Direct Preference Optimization. arXiv. 预印本引用于 §35.4
- (2024). Making RL with Preference-based Feedback Efficient via Randomization. ICLR 2024. 引用于 §35.3
- (2026). LLM Prompt Duel Optimizer: Efficient Label-Free Prompt Optimization. Findings of the Association for Computational Linguistics: ACL 2026. doi:10.18653/v1/2026.findings-acl.490. 引用于 §35.3
- (2025). Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents. Findings of the Association for Computational Linguistics: ACL 2025. doi:10.18653/v1/2025.findings-acl.519. 引用于 §35.2 §35.7
- (2025). Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF. ICLR 2025. 引用于 §35.3
- (2024). Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint. ICML 2024. 引用于 §35.4
- (2024b). Principled Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §35.5
- (2025a). Investigating Non-Transitivity in LLM-as-a-Judge. International Conference on Machine Learning. 引用于 §35.2
- (2024). Bayesian Reward Models for LLM Alignment. ICLR 2024 SeT LLM Workshop; ICML 2024 SPIGM Workshop. 研讨会论文引用于 §35.6
- (2026a). Quantifying and Mitigating Self-Preference Bias of LLM Judges. arXiv. 预印本引用于 §35.2
- (2026b). RewardUQ: A Unified Framework for Uncertainty-Aware Reward Models. EurIPS 2025 EIML Workshop. 研讨会论文引用于 §35.6
- (2026). Unleashing LLMs in Bayesian Optimization: Preference-Guided Framework for Scientific Discovery. ICLR 2026. 引用于 §35.2
- (2024a). Generating Chain-of-Thoughts with a Pairwise-Comparison Approach to Searching for the Most Promising Intermediate Thought. International Conference on Machine Learning. 引用于 §35.3
- (2024b). Self-Exploring Language Models: Active Preference Elicitation for Online Alignment. TMLR. 引用于 §35.3
- (2025a). PABBO: Preferential Amortized Black-Box Optimization. ICLR 2025. 引用于 §35.6
- (2025). Sharp Analysis for KL-Regularized Contextual Bandits and RLHF. NeurIPS 2025. 引用于 §35.4
- (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems. doi:10.52202/075280-2020. 引用于 §35.2
- (2023). Principled Reinforcement Learning with Human Feedback from Pairwise or K-wise Comparisons. International Conference on Machine Learning. 引用于 §35.4
- (2024). How Reliable is Your Simulator? Analysis on the Limitations of Current LLM-based User Simulators for Conversational Recommendation. Companion Proceedings of the ACM Web Conference 2024. doi:10.1145/3589335.3651955. 研讨会论文引用于 §35.2