贝叶斯优化
第七部分:人在回路
EN

交互式设计与人机交互

第四部分围绕模拟的人构建偏好贝叶斯优化:效用固定、噪声恒定、耐心无限;第 19.7 节已经指出,真实的人不具备其中任何一条。本章汇集 2017 年至 2026 年 9 月间人机交互、计算机图形学和交互式设计让真人进入回路所获得的认识:设计师调节照片,美术师简化 3D 网格,众包工作者移动滑块,驾驶员为仪表盘评分。

本章对“偏好”取宽泛的理解。除成对对决外,还包括滑块、画廊和排序,一个主要系统的作者也是在“更广的意义上”使用偏好贝叶斯优化一词(Koyama 等,2020);此外还包括由评分或实测性能驱动的优化,因为关于能动感和群体先验的已有认识大多来自这类研究。每项研究都标注其反馈类型(feedback type):偏好(preference),即选择、排序、比较;评分(rating),即量表上的分数;性能(performance),即对人实际表现的测量,例如任务用时。某一类型的结论不能自动推广到另一类型。NN 表示被试人数。

本章围绕三项发现展开,每一项都与本书的论点相关:偏好贝叶斯优化的难点已经转移到测量上,包括提问本身对人的影响(第 45.1 节)。第一,由优化器主导时,结果有所改善,但人的能动感下降;人能够引导搜索时,能动感大部分得以恢复。第二,真实会话中的反馈不稳定,标准噪声模型无法描述这种不稳定。第三,与强对照相比,通常的结果是以更低的成本得到相同的结果,而非更好的结果;在纯偏好研究中,这些结论所依据的样本大多只有 6 至 60 人。

引言引用的文献 1
  1. Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization

32.1 研究线索 #

这一方向以两篇论文为起点:Brochu 等人(2007)用画廊式的主动偏好学习设计材质,González 等人(2017)于 2017 年给出基于对决的形式化定义。此后,人机交互系统改变的大多是查询形式,很少改变采集函数,即选择下一个问题的规则(第 12.1 节);所用的采集函数通常是按查询形式改写的期望改进(第 12.3 节)或上置信界(第 12.4 节)(推断,依据下文的系统描述)。2024 年以后,重心转向借自其他用户的先验,以及语言模型和生成模型。以下各小节按研究组展开,表 32.1 汇总了相关用户研究。

32.1.1 Koyama 及其合作者:以查询界面为变量 #

Yuki Koyama 及其同事(东京大学、日本产业技术综合研究所、OMRON SINIC X)以查询界面为主要研究对象:2017 至 2025 年间,每篇论文增加一种反馈渠道,从单个滑块依次扩展到画廊、多个滑块、隐式的滑块日志、参考样例、约束和自然语言(推断,依据下文的设计)。

序列线搜索(sequential line search)把每次查询变为一项单滑块微任务,滑块沿设计空间中的一条直线移动(Koyama 等,2017)(第 20.2 节;第 25 章将其用于一张照片)。其众包流程每得到一个结果约需 5.25 美元和 68 分钟(15 次迭代,每次 7 个微任务,每个 0.05 美元)。与 Photoshop 和 Lightroom 的自动增强相比,三张照片的优化版本分别获得 32、26 和 29 张众包投票,每个替代版本只有 0 至 3 张(Koyama 与 Igarashi,2018)。同一书章认为,绝对评分通常效果不佳,因为评分者必须了解设计空间;成对比较则“即使对非专家也很容易回答”。

序列画廊(Sequential Gallery)以可缩放的网格(照片任务中为 5 × 5)取代滑块,由人从中选出最好的一项(Koyama 等,2020)(第 20.3 节)。在模拟中,它的平面搜索优于线搜索;在一项 N=6N = 6 的初步研究中,被试平均经过 5.36 次迭代即感到满意,并认为网格可以作为灵感来源,在 7 点量表上评为 6.50 分。作者列出的局限包括:只适用于视觉设计;既不能处理离散参数,也不能利用先验知识;在约 20 维以上表现不佳;并假设用户的感知函数“不随时间变化”。

同一时期的一些系统在生成模型的潜空间(latent space)中搜索。潜空间由紧凑的输入向量构成,训练好的网络把这些向量解码为图像、旋律或字体。Chiu 等人(2020)在潜空间中构建滑块子空间,未使用贝叶斯优化;Chong 等人(2021)让人用多个滑块混合候选图像,并通过涂画引导搜索;Zhou、Koyama、Goto 与 Igarashi 让人从若干段生成的旋律中选出最好的一段,先是一项试点研究(Zhou 等,2020),随后增加了一个滑块,用来设定上置信界的探索权重(Zhou 等,2021)。

BO as Assistant 取消了显式的查询循环:它从普通的滑块编辑中提取偏好对,并异步给出建议,使设计者能够“完全掌握主动权”;该系统没有正式的用户研究,作者也说明未评估可用性、有用性和能动感(Koyama 与 Goto,2022)。Photographer-in-the-loop 布光系统采用偏好贝叶斯优化,画廊由四张照片组成;在作者的演示中,约 10 次迭代即可找到令人满意的布光(Yamamoto 等,2022)。FontCraft 根据文本、图像和字体参考探索字体风格,并提供可撤回选择的历史记录(Tatsukawa 等,2025)。约束偏好贝叶斯优化(constrained PBO)只向横幅广告设计师询问成对偏好,同时以点击率(看到广告的人中点击广告的比例)模型作为约束;其采集函数 EUBOC 即在最优选项期望效用(EUBO,第 19.4 节)上加入约束(Iwai 等,2025)。此后,这条线索转向语言:设计者用自然语言介入系统主导的优化(Niwa 等,2025);语言模型把模糊的偏好转化为组合优化问题(Kuroki 等,2026);一篇 2026 年的预印本则构建了考虑可行性的车轮设计潜空间(Owaki 等,2026)。

32.1.2 剑桥、阿尔托与阳明交通大学:设计者参与的多目标优化 #

第二条线索以 Per Ola Kristensson、John Dudley、Antti Oulasvirta、Liwei Chan、George Mo 与 Yi-Chi Liao 为中心(剑桥大学、阿尔托大学、阳明交通大学),大多使用以性能为目标的多目标贝叶斯优化(multi-objective Bayesian optimization),而非偏好反馈。多目标优化(第 14.5 节)同时测量多个目标,例如速度和准确率,并返回 Pareto 前沿(Pareto front):其中的设计无法在某一目标上改进而不在另一目标上变差。

Dudley 等人(2019)以任务用时为目标优化地图搜索界面,第一个实验有 200 名众包工作者参与。Chan 等人(2022)以一种虚拟现实触控技术(4 个参数)为对象,比较优化器主导与设计者主导两种设计方式;实验采用被试间(between-subjects)设计,即每名被试只经历一种条件,共 40 名新手参加。第 32.2 节主要以这项研究的结果为依据。Shen 等人(2022)让 12 名用户从各自的 Pareto 前沿中选定最终的手势键盘设计;Liao 等人(2023)让 8 名设计师分别借助优化器和按自己的策略工作;Mo 等人(2024)提出协作式(cooperative)优化,由设计者标记设计和区域来引导优化器;Liao 等人(2024b)用“全局高斯过程”(即第 8 章中的代理模型)汇总各次会话,并让新用户从“热启动高斯过程”开始。后来的论文用两级偏好贝叶斯优化为 360 度图像调色(Yuan 等,2025),把每个原型的成本纳入采集函数(Langerak 等,2026);MUSE 则把专家意见、实证研究和模拟器区分为不同的反馈来源(Fernandes Junior 等,2026),该文已被 ACM Transactions on Interactive Intelligent Systems(TiiS)接收。Dudley、Oulasvirta、Chan 与 Kristensson 的一篇综述于 2026 年 8 月在 ACM Computing Surveys 在线发表,我们未能获得全文(Dudley 等,2026)。

32.1.3 苏黎世联邦理工学院与萨尔大学:基于他人数据的先验 #

2024 年以来,第三条线索以 Yi-Chi Liao、Zhipeng Li、Christoph Gebhardt、Christian Holz 与 Anna Maria Feit 为中心(苏黎世联邦理工学院、萨尔大学),研究群体先验(population priors),即利用先前用户的数据,使新用户需要回答的问题尽可能少。Liao 等人(2024a)由阿尔托大学与 Meta 合作完成,用 14 名被试的数据建立群体模型,再将其作为迁移采集函数的先验,用于 11 名新被试;持续人在回路优化则用贝叶斯神经网络(对自身权重保持一个分布的神经网络)表示整个群体(Liao 等,2025)。两者都使用性能反馈。Meta-PO 借助序列画廊界面,在先前用户的高斯过程模型之上进行元学习(Li 等,2025a);Song 等人(2025)从用户对混合现实布局的手动编辑中推断目标权重。随后有三篇 CHI 2026 论文:HOMI 在真实用户参与之前,先在模拟用户上训练神经采集函数(Liao 等,2026);APPO 对用户隐藏图像生成器的文本提示词,只询问二元偏好,由语言模型改写提示词(Li 等,2026f);AutoOptimization 把口头表达的偏好转化为布局优化器的目标(Li 等,2026a)。

32.1.4 乌尔姆:依据驾驶员与乘客的评分优化汽车界面 #

乌尔姆大学 Pascal Jansen、Mark Colley 与 Enrico Rukzio 的研究组依据问卷评分(信任、感知安全、脑力需求、可预测性)优化汽车界面,样本量在这一领域中属于最大之列。研究对象包括:OptiCarVis 中自动驾驶车辆的可视化(N=117N = 117,在线,被试间)(Jansen 等,2025);车辆外部显示屏(N=37N = 37)(Colley 等,2025);有无动感座椅条件下的空中出租车模拟(N=40N = 40)(Meinhardt 等,2025);ProVoice 中的主动式车载助手(N=19N = 19,被试内,即每名被试都经历所有条件)(Susak 等,2026);BlurDriving 中虚拟现实驾驶的模糊效果(IMWUT,2026 年 9 月)(Li 等,2026b);以及一项已被 AutomotiveUI 2026 接收的三天研究(N=74N = 74),比较持续优化与沿用第一天的设计(Colley 等,2026)。

32.1.5 慕尼黑大学:专业水平与现场部署 #

Ou、Buschek、Mayer 与 Butz 和一家工业合作伙伴共同构建了一个简化 3D 网格(9 个参数)的偏好贝叶斯优化系统,系统把美术师的评分转换为成对关系。该系统先由两名全职技术美术师使用了 3 个月,随后又进行了一项 N=20N = 20 的实验室研究(Ou 等,2022)。Ou 等人(2023)在三项任务上比较了 60 名专业水平不同的用户。所用界面要求对 4 个候选排序,设有“不知道”区域,用户按下满意按钮即结束。第 32.3 节和第 32.6 节的材料大多来自这两项研究。

32.1.6 引导生成模型 #

另有四个系统把偏好查询嵌入生成模型,通常是扩散模型,即当前大多数文生图系统所用的生成器。BOgen 结合偏好贝叶斯优化与变分自编码器(把较短的潜向量解码为输出的网络),逐个部件地构建 3D 形状,并由 30 名设计师将其与基线作了比较(Lee 等,2026)。ROMBO 用于音乐生成的个性化,在模拟中评估,另由 16 名志愿者为每段音乐打 0 至 10 分(Marcos 等,2025)。GimmBO 在 20 至 30 个适配器的合并权重上运行偏好贝叶斯优化;适配器是小型附加网络,各自把扩散模型推向某种风格(Liu 等,2026b)。MultiBO(ICML 2026)让用户从 4 张生成图像中选出最接近心中设想的一张,并在模型的注意力空间中引导编辑,最多 50 轮(Rajagopalan 等,2026)。其图像相似度为 0.9364,DiffusionDPO 为 0.8365;在 30 名用户评判的比较中,它胜出 70.82%。作者还观察到,图像越接近目标,偏好信号越弱。

32.1.7 其他领域:触觉、文本输入、阅读、建筑与工程 #

Catkin 与 Patoglu(2023)依据成对比较优化渲染出的弹簧与摩擦的感知真实感,并以专家调校的模型作为验证对照;在 Zhang 等人(2026b)中,13 名被试进行了 40 轮比较,每次附带 5 级把握度评分,留出准确率为 92.3%(范围 85% 至 100%)。AdaptiFont 以阅读速度为目标优化生成式字体空间(性能反馈,主研究中 N=11N = 11)(Kadner 等,2021);Tanaka 等人(2026)让 40 名设计专业学生设计一座有 6 个参数的展亭,方式为由 0 至 100 的评分驱动优化,或使用滑块;Nandy 与 Goucher-Lambert(2025)让参数化马克杯适应“舒适”这一属性(从零开始时 N=31N = 31,利用前一组数据时 N=25N = 25),与非交互模型相比,提高了意图与设计之间的感知匹配度。研讨会论文 McCourt 与 Dewancker(2019)在为艺术作品上色时,不得不扩展偏好贝叶斯优化以处理平局;预印本 Peng 等人(2026)依据成对判断实现生成式用户界面的个性化。文本输入方面,我们找到的唯一研究是 Shen 等人的手势键盘。可视化设计方面,我们找到的贝叶斯优化应用调节的都是特定的显示(OptiCarVis,以及 MUSE 中的一个案例),其中没有一项是偏好贝叶斯优化研究。

32.1.8 研究一览 #

表 32.1 按年份列出主要的用户研究,表中提到的问卷在第 32.2 节中说明。超体积(hypervolume)衡量 Pareto 前沿覆盖目标空间的大小,越大越好。

表 32.1 2017 至 2026 年人机交互与设计领域交互式贝叶斯优化的主要用户研究。出处见本节正文。
系统或研究 发表场所 被试 反馈 对照 主要结果
序列线搜索 SIGGRAPH 2017 众包工作者,每个结果约 105 个微任务 偏好:滑块 Photoshop 与 Lightroom 的自动增强 众包投票 32、26、29 对 0 至 3
Dudley 等 CHI 2019 200 名众包工作者(实验 1) 性能:任务用时 基线界面 第 1 批无差异(p=0.88p = 0.88);从第 2 批起,中位用时从约 34 秒降至约 21 秒
序列画廊 SIGGRAPH 2020 6,另有模拟 偏好:从二维画廊中选最好的 线搜索(模拟) 模拟中平面搜索更好;用户在 5.36 次迭代后满意
Zhou 等 IUI 2021 12 名新手作曲者 偏好:从若干个中选最好的 自动期望改进 创造力支持指数更高;12 人中 11 人偏好手动平衡
Chan 等 CHI 2022 40 名新手,被试间 性能 设计者主导设计 空间误差更小;能动感、归属感、表达力更低
Ou 等 Mensch und Computer 2022 2 名美术师(3 个月现场),20 名(实验室) 评分转换为成对关系 无(观察性) 549 个现场序列中 415 个停在第 1 次迭代;满意 16/134(现场)、97/200(实验室)
Photographer-in-the-loop UIST 2022 12 偏好:4 张中选最好的 手动布光流程 使用体验在全部六项上评分更好;对布光的满意度无显著差异
Shen 等 ISMAR 2022 12 性能;最终设计按偏好选定 基线键盘 速度 +14.4%,准确率 +13.8%
Ou 等 IUI 2023 60,三项任务 偏好:对 4 个排序,可选“不知道” 不同专业水平 新手达到专家级质量;专家迭代更多、满意度更低
Liao 等 CHI 2024 14 名用于建模,11 名用于评估 性能 标准贝叶斯优化;手动校准 绝对指点改善 22.92% 和 21.35%
Mo 等 ACM TiiS 2024 18,被试内 性能;设计者可以标记 设计者主导;优化器主导 掌控感中位数 6.0、5.5、1.5;18 人中 12 人偏好协作
FontCraft CHI 2025 10 名非专家 偏好:滑块、参考、可撤回的历史 单滑块贝叶斯优化 更接近目标字体(未见推断统计)
约束偏好贝叶斯优化 IJCAI 2025 11 名专业广告设计师 偏好:成对 无对照系统 每次选择 4.2 秒;态度积极;一项预研究中,设计师的偏好与点击率没有正相关
OptiCarVis CHI 2025 117,在线 评分 无可视化;专家设计;用户自定义 个性化设计在感知安全、可预测性、信任上评分更好
Meta-PO UIST 2025 36(三组各 12) 偏好:从画廊中选最好的 无迁移 达到满意的迭代次数从 9.54 降至 5.86(同一主题)和 7.41(其他主题)
Niwa 等 UIST 2025 18(研究 1),12(研究 2) 性能,另加自然语言 设计者主导;优化器主导;显式约束 优化器主导超体积最高、能动感最低;语言降低工作负荷,但能动感低于约束
Song 等 UIST 2025 12 由手动编辑推断权重 手动;ParetoSelect 移动的元素更少;布局排名高于 ParetoSelect(p=.02p = .02);超体积和整体质量无差异
GimmBO SIGGRAPH North America 2026 12(计算机或机器学习背景) 偏好:top-kk 排序;滑块;画廊 滑块;序列画廊 排序在相似度和成功率上更好;每步 50.5 秒对 34.7 秒
APPO CHI 2026 16 偏好:二元,隐藏提示词 PromptCharm;DSPy;澄清式提问 不到 4 次迭代即满意(基线多于 6 次);表达力较低
成本感知贝叶斯优化 CHI 2026 12 性能加舒适度评分 忽略成本的贝叶斯优化 以约 67% 的成本达到相同性能;最终质量无差异(p=.77p = .77)
HOMI CHI 2026 12 性能 迁移采集;持续贝叶斯优化 只在第 2 和第 3 次迭代更好;从第 6 次迭代起持平
Tanaka 等 CAADRIA 2026 40 名设计专业学生 评分,0 至 100 滑块 62.5% 偏好优化结果(p=0.025p = 0.025)
Owaki 等 预印本 2026 40 偏好探索 原始的 9 维参数 在 5 维潜空间中形状相似度更高、可行建议更多
第 32.1 节引用的文献 52
  1. Brochu 等人(2007)Active Preference Learning with Discrete Choice Data
  2. González 等人(2017)Preferential Bayesian Optimization
  3. Koyama 等人(2017)Sequential line search for efficient visual design optimization by crowds
  4. Koyama 与 Igarashi(2018)Computational Design with Crowds
  5. Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
  6. Chiu 等人(2020)Human-in-the-loop differential subspace search in high-dimensional latent space
  7. Chong 等人(2021)Interactive Optimization of Generative Image Modelling using Sequential Subspace Search and Content-based Guidance
  8. Zhou 等人(2020)Generative Melody Composition with Human-in-the-Loop Bayesian Optimization
  9. Zhou 等人(2021)Interactive Exploration-Exploitation Balancing for Generative Melody Composition
  10. Koyama 与 Goto(2022)BO as Assistant: Using Bayesian Optimization for Asynchronously Generating Design Suggestions
  11. Yamamoto 等人(2022)Photographic Lighting Design with Photographer-in-the-Loop Bayesian Optimization
  12. Tatsukawa 等人(2025)FontCraft: Multimodal Font Design Using Interactive Bayesian Optimization
  13. Iwai 等人(2025)Constrained Preferential Bayesian Optimization and Its Application in Banner Ad Design
  14. Niwa 等人(2025)Cooperative Design Optimization through Natural Language Interaction
  15. Kuroki 等人(2026)LAPPI: Interactive Optimization with LLM-Assisted Preference-Based Problem Instantiation
  16. Owaki 等人(2026)Learning Feasibility-Aware Latent Spaces for Preference-Based Exploration of Procedural Automotive Wheel Designs
  17. Dudley 等人(2019)Crowdsourcing Interface Feature Design with Bayesian Optimization
  18. Chan 等人(2022)Investigating Positive and Negative Qualities of Human-in-the-Loop Optimization for Designing Interaction Techniques
  19. Shen 等人(2022)Personalization of a Mid-Air Gesture Keyboard using Multi-Objective Bayesian Optimization
  20. Liao 等人(2023)Interaction Design With Multi-Objective Bayesian Optimization
  21. Mo 等人(2024)Cooperative Multi-Objective Bayesian Design Optimization
  22. Liao 等人(2024b)Practical approaches to group-level multi-objective Bayesian optimization in interaction technique design
  23. Yuan 等人(2025)Personalized Dual-Level Color Grading for 360-degree Images in Virtual Reality
  24. Langerak 等人(2026)Cost-Aware Bayesian Optimization for Prototyping Interactive Devices
  25. Fernandes Junior 等人(2026)Integrating Multi-Source Feedback in Computational Design
  26. Dudley 等人(2026)Putting the Human Back in the Loop: A Review of Interactive Bayesian Optimization
  27. Liao 等人(2024a)A Meta-Bayesian Approach for Rapid Online Parametric Optimization for Wrist-based Interactions
  28. Liao 等人(2025)Continual Human-in-the-Loop Optimization
  29. Li 等人(2025a)Efficient Visual Appearance Optimization by Learning from Prior Preferences
  30. Song 等人(2025)Preference-Guided Multi-Objective UI Adaptation
  31. Liao 等人(2026)Efficient Human-in-the-Loop Optimization via Priors Learned from User Models
  32. Li 等人(2026f)Preference-Guided Prompt Optimization for Text-to-Image Generation
  33. Li 等人(2026a)Automating UI Optimization through Multi-Agentic Reasoning
  34. Jansen 等人(2025)OptiCarVis: Improving Automated Vehicle Functionality Visualizations Using Bayesian Optimization to Enhance User Experience
  35. Colley 等人(2025)Improving External Communication of Automated Vehicles Using Bayesian Optimization
  36. Meinhardt 等人(2025)Fly Away: Evaluating the Impact of Motion Fidelity on Optimized User Interface Design via Bayesian Optimization in Automated Urban Air Mobility Simulations
  37. Susak 等人(2026)ProVoice: Designing Proactive Functionality for In-Vehicle Conversational Assistants using Multi-Objective Bayesian Optimization to Enhance Driver Experience
  38. Li 等人(2026b)BlurDriving: Investigating How Personalized Blur Techniques Impact Drivers' Performance in Virtual Reality
  39. Colley 等人(2026)Multi-Session User Experience Assessments of Computationally Optimized Automated Vehicle Functionality Visualizations
  40. Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures
  41. Ou 等人(2023)The Impact of Expertise in the Loop for Exploring Machine Rationality
  42. Lee 等人(2026)Part-level 3D shape generation driven by user intention inference with preferential Bayesian optimization
  43. Marcos 等人(2025)Random rotational embedding Bayesian optimization for human-in-the-loop personalized music generation
  44. Liu 等人(2026b)GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization
  45. Rajagopalan 等人(2026)Personalized Image Generation via Human-in-the-loop Bayesian Optimization
  46. Catkin 与 Patoglu(2023)Preference-Based Human-in-the-Loop Optimization for Perceived Realism of Haptic Rendering
  47. Zhang 等人(2026b)Vibrotactile Preference Learning: Uncertainty-Aware Preference Learning for Personalized Vibration Feedback
  48. Kadner 等人(2021)AdaptiFont: Increasing Individuals' Reading Speed with a Generative Font Model and Bayesian Optimization
  49. Tanaka 等人(2026)Human-in-the-Loop Bayesian Optimization Approach to Supporting Early-Stage Architectural Design
  50. Nandy 与 Goucher-Lambert(2025)Exploring the Effectiveness of Interactive Preference Learning for Adapting Designs to Abstract Semantic Attributes
  51. McCourt 与 Dewancker(2019)Sampling Humans for Optimizing Preferences in Coloring Artwork
  52. Peng 等人(2026)Efficient Personalization of Generative User Interfaces

32.2 能动感与性能 #

这一时期最一致的结果涉及由谁主导搜索。优化器主导时,结果指标更好,脑力需求更低,但人的能动感(agency,即掌控过程的感觉)、归属感(ownership,即认为结果属于自己)和表达力(expressiveness,即能够把自己的想法融入结果)明显下降。设计者一旦有了引导搜索的手段,能动感便大部分恢复,代价是结果质量略有下降。这方面的证据几乎全部来自以性能为目标的多目标优化。

有两份问卷反复出现。创造力支持指数(Creativity Support Index)依据探索、表达力、乐趣等因素,在 0 至 100 的量表上评价对创造性工作的支持程度;NASA 任务负荷指数(NASA Task Load Index,NASA-TLX)用六个分量表测量工作负荷,其中包括脑力需求和努力程度。pp 是各条件实际并无差别时出现至少如此大差异的概率;t(38)t(38) 是自由度为 38 的 tt 统计量,其符号表示哪一组得分较低。

唯一一项规模足以分离出这一效应的研究。Chan 等人(2022)的被试间实验有 40 名新手设计者参加,以性能为目标。优化器主导组报告的能动感(t(38)=−5.523t(38) = -5.523,p<0.001p < 0.001)和归属感(t(38)=−3.892t(38) = -3.892,p<0.001p < 0.001)较低,满意度和信心则没有差异。创造力支持指数在设计者主导时为 75.3,在优化器主导时为 65.4(p=.011p = .011),差异主要来自表达力(44.9 对 23.0,p=.001p = .001)。NASA-TLX 总分没有差异(57.6 对 49.6,p=.758p = .758),但优化器主导组报告的脑力需求(14.9 对 8.4,p=.011p = .011)和努力程度(24.9 对 13.7,p=.040p = .040)较低。优化器主导的会话更长(78.0 分钟对 51.8 分钟);其设计的空间误差更小(t(38)=2.237t(38) = 2.237,p<0.05p < 0.05);该组探索的设计空间比例也更大。用摘要中的话说,由优化器引导的设计者“报告的脑力付出更低,但也觉得自己创造性更弱,对进展的掌控更少”;作者的结论是,这种优化可以支持新手设计者,适用于“能动感并不关键”的场合。

同一研究中的三种掌控程度。Mo 等人(2024)采用被试内设计(N=18N = 18),比较设计者主导、协作和优化器主导三种设计方式。对“我觉得自己能够掌控对设计空间不同区域的搜索”这一陈述,三种方式在 7 点量表上的评分中位数分别为 6.0、5.5 和 1.5。12 名被试偏好协作条件,4 名偏好设计者主导,2 名偏好优化器主导;再次使用该方法的意愿,中位数依次为 6.0、5.0 和 3.0。协作条件的相对超体积与优化器主导条件无显著差异;它所需的正式评估较少,找到的 Pareto 最优设计也较少。

规模较小的研究指向同一方向。Liao 等人(2023)有 8 名设计师参加,优化器找到的设计与设计师自己的设计“性能非常相似”,工作负荷则显著更低;但当设计者角色中的典型工作由优化器接管时,“设计者可能会与设计过程脱节”。在 Zhou 等人(2021)的旋律研究中(偏好反馈,12 名新手作曲者),让用户自行设定探索与利用之间的平衡,提高了创造力支持指数总分(p<0.01p < 0.01)和满意度(p=0.041p = 0.041),12 人中有 11 人偏好手动平衡。在 Niwa 等人(2025)的研究 1 中(N=18N = 18),优化器主导条件的相对超体积高于设计者主导设计(p<0.001p < 0.001),也高于自然语言协作(p=0.001p = 0.001),但能动感显著低于这两者(校正后 p=0.002p = 0.002);研究 2 中(N=12N = 12),语言与显式约束表现相同(p=0.204p = 0.204),语言带来的任务负荷较低(p=0.034p = 0.034),约束带来的能动感较多(p=0.032p = 0.032)。部分被试不确定“自己的指令实际上在多大程度上被执行了”。

较弱的证据。FontCraft 的被试(偏好反馈,N=10N = 10)使用多模态参考时报告的能动感高于基线,10 人中有 7 人提到了历史视图(Tatsukawa 等,2025)。Colley 等人(2025)在 7 点量表上测得,“我觉得自己掌控着设计过程”的平均分为 5.81,“最终的设计是我的”为 5.30。Tanaka 等人(2026)发现,“过程披露”(参数图、评价的范围、优化的方向)对能动感和信任至关重要,即使被试的理解仍停留在表面;Song 等人(2025)则指出,不受约束的优化器可能移动用户亲手放置的元素。

图 32.1 可以让读者亲身体会这一权衡:以相同的预算运行三次,分别由自己选择每个设计、由优化器选择、由优化器建议而自己决定;每次运行后,为自己对搜索方向的掌控程度打分。

你主导 · 尚未尝试00.5101参数 1参数 2点击地图,尝试一个设计每次尝试的得分050100最大值1510目前最佳各次运行对比最佳得分你的掌控程度你主导未运行协作未运行优化器主导未运行你的评分Mo 等的中位数(N = 18)147
你主导 · 尚未尝试00.5101参数 1参数 2点击地图,尝试一个设计每次尝试的得分050100最大值1510目前最佳各次运行对比最佳得分你的掌控程度你主导未运行协作未运行优化器主导未运行你的评分Mo 等的中位数(N = 18)147
图 32.1 由谁主导搜索?图中以双参数设计上的隐藏得分代替本节各研究的实测结果;每次运行有 10 次尝试。把“由谁主导”设为“你”时,点击地图或设定滑块,然后按“试这个设计”;设为“优化器”时,由使用期望改进的高斯过程选择每一次尝试;设为“协作”时,优化器给出建议(橙色圆环),你可以接受,也可以尝试自己的设计,这是 Mo 等人协作条件的简化。每次运行之后,为你对搜索的掌控程度打分;深色刻度是 Mo 等人针对类似陈述测得的中位数(6.0、5.5、1.5;N = 18)。地形和得分仅作示意:在双参数的玩具问题中,你可能与优化器做得一样好;要点在于研究报告的差距,即结果上的差别小,掌控感上的差别大。

可以尝试以下几点:

  • 先做“你”这一轮,不要显示地形。你多半会先找到那座宽阔的山丘;留意剩下的尝试是否都用在了对它的细调上。
  • 切换到“优化器”,按“运行到底”。先比较它与你的最佳得分,再比较你给出的两个掌控程度评分。哪个差距更大?
  • 按“新地形”,重复一遍。在第一个地形上,优化器的探索能找到那座更窄、更高的山峰;在其后的大多数地形上,它在 10 次尝试内无法到达该山峰,你自己搜索也能取得同样的结果。

图中的地图让整个设计空间一目了然。研究中的设计空间更大(Chan 等人为 4 个参数,展亭研究为 6 个,Ou 等人的网格简化为 9 个)。移动 9 个滑块的人已无法看出哪些区域尚未尝试,而这正是优化器的系统性探索应当更能发挥作用之处(推断);图 19.4 从另一个角度说明,随着参数增多,四十次比较所能完成的工作减少了多少。

对偏好优化的启示。能动感按设计者主导、协作、用户引导、优化器主导的顺序递减;能动感上的差异(掌控感中位数 6.0 对 1.5)远大于协作设计与优化器主导设计在结果上的差异。对设计任务而言,这意味着增加供人引导搜索的渠道,比提高优化器的自主程度更可取(推断)。普通的偏好贝叶斯优化中,人只回答优化器的问题,按其构造即属于优化器主导条件(推断)。这一效应是在性能目标下分离出来的;在偏好反馈系统中,只有 Zhou 等人和 FontCraft 测量了与能动感接近的指标,被试分别为 12 人和 10 人(推断)。因此,开发偏好工具的团队应当在自己的研究中测量能动感,例如采用 Mo 等人那样的题项,而不应假定这一效应可以直接迁移(推断)。

第 32.2 节引用的文献 9
  1. Chan 等人(2022)Investigating Positive and Negative Qualities of Human-in-the-Loop Optimization for Designing Interaction Techniques
  2. Mo 等人(2024)Cooperative Multi-Objective Bayesian Design Optimization
  3. Liao 等人(2023)Interaction Design With Multi-Objective Bayesian Optimization
  4. Zhou 等人(2021)Interactive Exploration-Exploitation Balancing for Generative Melody Composition
  5. Niwa 等人(2025)Cooperative Design Optimization through Natural Language Interaction
  6. Tatsukawa 等人(2025)FontCraft: Multimodal Font Design Using Interactive Bayesian Optimization
  7. Colley 等人(2025)Improving External Communication of Automated Vehicles Using Bayesian Optimization
  8. Tanaka 等人(2026)Human-in-the-Loop Bayesian Optimization Approach to Supporting Early-Stage Architectural Design
  9. Song 等人(2025)Preference-Guided Multi-Objective UI Adaptation

32.3 不稳定的反馈与不收敛 #

偏好贝叶斯优化模型假设:每个回答都是对同一个固定效用的带噪声读数,噪声独立同分布(第 19 章)。对真实使用历时最长的一次观察表明,实践可能与这一假设相去甚远。在 Ou 等人(2022)与两名专业 3D 美术师进行的部署中,549 个评价序列中有 415 个停在第一次迭代,根本没有请求优化。其余 134 个序列平均运行 4.1 次迭代(标准差 4.2,范围 1 至 23),其中只有 16 个(11.9%)得到满意的结果。实验室研究中,200 个序列有 97 个(48.5%)以满意告终。图 32.2 画出了全部序列。

以满意结束请求了优化,未满意停在第一次迭代实验室:其他结局(未细分)现场:3 个月,2 名专业美术师549 个序列中的 16 个 = 2.9%实验室:20 名被试200 个序列中的 97 个 = 48.5%
以满意结束请求了优化,未满意停在第一次迭代实验室:其他结局(未细分)现场:3 个月,2 名专业美术师549 个序列中的 16 个 = 2.9%实验室:20 名被试200 个序列中的 97 个 = 48.5%
图 32.2 Ou 等人(2022)网格简化研究的全部评价序列,每个方块代表一个序列。与两名专业 3D 美术师进行的 3 个月现场部署共有 549 个序列:415 个停在第一次迭代(灰色),134 个请求了优化,其中 16 个以满意告终(绿色)。在 20 名被试参加的实验室研究中,200 个序列有 97 个以满意告终;实验室的其余 103 个序列没有按停止位置细分。“计数基准”设定现场百分比的分母。所有计数均来自作者的报告(Ou 等,2022)。

可以尝试以下几点:

  • 把“计数基准”设为“全部序列”,比较两个百分比:现场为 2.9%,实验室为 48.5%。
  • 切换到“请求了优化的序列”。415 个灰色方块不再计入,现场的数字升至 11.9%。两个数字都正确;习题 32.1 将讨论哪一个能描述该工具在实践中的表现。

作者写道,被试即使不是随机评分,“在评分过程中至少表现得非常不稳定、不一致”。问及具体的不一致评分时,专家们提到对先前见过的网格的锚定、可得性启发式与代表性启发式、损失厌恶以及收益递减,即第 37.2 节中的各种判断偏差。作者的结论是,稳定而完备的偏好与独立同分布噪声这两个假设都不成立:“人的判断是一个难以优化的脆弱函数”(human judgment is a fragile function to optimize for)。若把这一结果视为偏好在会话中建构的直接证据,则属于诠释:论文记录的是不稳定与不收敛,建构只是其中一种解释(推断)。

其他研究中零散但一致的迹象。序列画廊的一位被试“依据我一开始并没有的标准”挑选设计(Koyama 等,2020);AdaptiFont 寻找的是使用当时的最佳字体,而非稳定的最优点,因为使阅读速度最快的字体可能取决于文本、疲劳程度和显示屏(Kadner 等,2021);Dudley 等人(2019)则不得不处理用户差异、任务差异和学习效应带来的噪声。

真人与模拟的人。在一项有 17 名视力正常被试参加的视网膜植入物个性化研究中,只有约 50% 的选择与模拟智能体一致(Schoinas 等,2025)(第 33.5 节)。在 Peng 等人(2026)的预印本中,20 名界面设计经验各异的被试评判同样的 600 对生成界面,彼此的一致性只有 0.25。这里所用的是校正机遇后的一致性统计量,0 表示机遇水平,1 表示完全一致(Krippendorff α\alpha;Cohen κ\kappa 保留两位小数时与之相同)。振动触觉研究指出,相近候选之间的比较“被回答噪声所主导”,其模型假设平稳性,没有考虑适应、疲劳或漂移(Zhang 等,2026b)。Meta-PO、Song 等人与 LAPPI 都把偏好静态这一假设列为局限,但没有测量偏好的变化(Li 等,2025a;Song 等,2025;Kuroki 等,2026)。

要点漂移有人提及,无人检验

2017 至 2026 年间,没有一项设计研究用重复测量设计检验会话内的偏好漂移,例如在会话结束时再次展示早先的对;大多数论文把漂移列为局限,便止步于此。建立在潜在效用和独立同分布噪声之上的高斯过程模型,会把锚定、收益递减和会话中逐渐形成的标准一概视为噪声(推断)。这项检验每次会话只需增加几次比较(习题 32.2),因此让真人参与偏好贝叶斯优化的团队可以在每项研究中加入这一检验(推断)。

第 27.2 节和第 29.10 节讨论能够容纳这些效应的模型,第 47.4 节讨论能够区分噪声与漂移的实验。

第 32.3 节引用的文献 10
  1. Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures
  2. Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
  3. Kadner 等人(2021)AdaptiFont: Increasing Individuals' Reading Speed with a Generative Font Model and Bayesian Optimization
  4. Dudley 等人(2019)Crowdsourcing Interface Feature Design with Bayesian Optimization
  5. Schoinas 等人(2025)Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants
  6. Peng 等人(2026)Efficient Personalization of Generative User Interfaces
  7. Zhang 等人(2026b)Vibrotactile Preference Learning: Uncertainty-Aware Preference Learning for Personalized Vibration Feedback
  8. Li 等人(2025a)Efficient Visual Appearance Optimization by Learning from Prior Preferences
  9. Song 等人(2025)Preference-Guided Multi-Objective UI Adaptation
  10. Kuroki 等人(2026)LAPPI: Interactive Optimization with LLM-Assisted Preference-Based Problem Instantiation

32.4 反馈形式 #

系统应当问什么?第 20 章把各种查询形式作为方法讨论,本节汇集在真人身上得到的经验。2026 年以前,每项研究只改变查询的一个方面。Koyama 与 Igarashi(2018)认为,连续空间上的查询所携带的信息远多于一次比较,但众包工作者难以作答,因此单个滑块是他们的折中方案。Chong 等人(2021)测得,使用一个滑块时每次迭代需 17.2 秒,使用四个需 53.4 秒;按迭代计,四个滑块收敛更快,也更受青睐,但 N=3N = 3。在虚拟现实调色中,用户更愿意比较两个选项,而不是四个(Yuan 等,2025)。“不知道”区域使人能够表达不完备的偏好(Ou 等,2023);在现场研究中,以对 4 个模型评分代替选出 1 个,并没有消除不一致(Ou 等,2022)(第 20.4 节讨论平局与弃答)。Mikkola 等人(2020)还认为,类似滑块的投影式查询能大大减轻用户的工作负荷。

2026 年:首批同一任务上的比较。GimmBO(N=12N = 12,被试内,20 次迭代)发现,排序在与目标的相似度、成功率以及找回正确的稀疏适配器集合上都优于滑块;使用滑块时会开启多余的适配器,序列画廊的用户会陷入局部极小值,但排序每一步用时更长(50.5 秒对 34.7 秒)(Liu 等,2026b)。APPO 只使用二元偏好,收敛更快、负荷更低,但表达力不如允许文本反馈或手动编辑的基线(Li 等,2026f)。MultiBO 认为,每轮从 4 个候选中选一个,比成对比较更好地平衡了信息量与负荷,但这一结论来自设计分析,而非对照实验(Rajagopalan 等,2026)。在一项有 12 名新用户参加的在线研究中,预印本 Peng 等人(2026)发现,基于 8 次成对判断的个性化优于所有基线,包括共享的设计准则和用户自己写下的偏好,总胜率为 60.35%,而以用户画像为条件的评判者为 50.9%。Mo 等人(2024)则批评画廊:所有选项仍由优化器提供,用户除了表示喜欢或不喜欢之外无从表达。

这些结果指向同一方向:降低每次查询的负担,或增加每次查询携带的信息。目前还没有研究在同一任务上用真实用户比较成对比较、画廊、滑块、排序和评分,因此关于查询形式的建议主要依据模拟、极小的样本和作者的论证(推断)。在这样的研究出现之前,代价最低的防范措施是在真实任务上对两种候选形式做简短的试点,记录每个回答的用时,并重复若干次查询(推断)。第 20.6 节讨论界面为何是模型的一部分。

第 32.4 节引用的文献 11
  1. Koyama 与 Igarashi(2018)Computational Design with Crowds
  2. Chong 等人(2021)Interactive Optimization of Generative Image Modelling using Sequential Subspace Search and Content-based Guidance
  3. Yuan 等人(2025)Personalized Dual-Level Color Grading for 360-degree Images in Virtual Reality
  4. Ou 等人(2023)The Impact of Expertise in the Loop for Exploring Machine Rationality
  5. Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures
  6. Mikkola 等人(2020)Projective Preferential Bayesian Optimization
  7. Liu 等人(2026b)GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization
  8. Li 等人(2026f)Preference-Guided Prompt Optimization for Text-to-Image Generation
  9. Rajagopalan 等人(2026)Personalized Image Generation via Human-in-the-loop Bayesian Optimization
  10. Peng 等人(2026)Efficient Personalization of Generative User Interfaces
  11. Mo 等人(2024)Cooperative Multi-Objective Bayesian Design Optimization

32.5 个体差异与群体先验 #

众包框架假设人群共享同一种偏好,但不同背景的人群“可能有明显不同的偏好”(Koyama 与 Igarashi,2018)。群体先验借用他人的数据帮助每一位新用户。这类先验在实验中有效,但收益集中在最初几次迭代。

支持群体先验的证据。Liao 等人(2024b)的全局高斯过程(性能反馈)得到的设计使完成时间缩短 5.5%,空间误差降低 48%;热启动高斯过程使有经验用户的超体积提高 38%,新手用户提高 18%,不过面向速度的全局设计在空间误差上并不优于基线。腕部交互的元贝叶斯优化在绝对指点上比标准贝叶斯优化改善 22.92%,比手动校准改善 21.35%;在相对指点上分别改善 25.43% 和 13.60%(Liao 等,2024a)。Meta-PO(偏好反馈)把达到满意所需的迭代次数从不迁移时的 9.54(标准差 2.19),降至同一主题用户之间迁移时的 5.86(标准差 1.20,t(11)=5.11t(11) = 5.11,p<0.001p < 0.001),以及跨主题迁移时的 7.41(标准差 1.28,p<0.01p < 0.01);跨主题比同一主题内需要更多迭代(p<0.01p < 0.01),可见目标差别越大,迁移的帮助越小(Li 等,2025a)。HOMI 只在第 2 和第 3 次迭代显著更好(p=.040p = .040 和 p=.002p = .002);从第 6 次迭代起,所有方法收敛到同一水平,NASA-TLX 也没有差异(Liao 等,2026)。

支持个体差异的证据。凡是测量了个体差异的研究,都发现差异很大,涉及助听器的增益调整(N=20N = 20)(Søgaard Jensen 等,2019)、偏好的压缩比(Baltzell 等,2018)(第 33.4 节)、使阅读速度最快的字体(Kadner 等,2021)、打字速度与准确率之间的权衡(Shen 等,2022)、对空中出租车界面的设计偏好(Meinhardt 等,2025),以及驾驶中偏好的模糊程度(Li 等,2026b)。即使是专家的偏好,也可能与实测结果不一致:一项预研究发现,专业广告设计师的偏好与实际点击率没有正相关,约束偏好贝叶斯优化正是因此把点击率交给机器处理(Iwai 等,2025)。

群体先验把分析单位从个人转移到群体,这与上述个体差异难以相容。现有研究表明群体先验能加快早期收敛,但没有一项研究表明,个人偏离群体时群体先验不会造成损害(推断)。因此,采用这类先验的系统应当让个人自己的回答迅速压过先验,并单独报告与群体差距最大者的结果(推断)。相关模型见第 20.5 节和第 27.3 节。

第 32.5 节引用的文献 12
  1. Koyama 与 Igarashi(2018)Computational Design with Crowds
  2. Liao 等人(2024b)Practical approaches to group-level multi-objective Bayesian optimization in interaction technique design
  3. Liao 等人(2024a)A Meta-Bayesian Approach for Rapid Online Parametric Optimization for Wrist-based Interactions
  4. Li 等人(2025a)Efficient Visual Appearance Optimization by Learning from Prior Preferences
  5. Liao 等人(2026)Efficient Human-in-the-Loop Optimization via Priors Learned from User Models
  6. Søgaard Jensen 等人(2019)Perceptual Effects of Adjusting Hearing-Aid Gain by Means of a Machine-Learning Approach Based on Individual User Preference
  7. Baltzell 等人(2018)Efficient characterization of individual differences in compression ratio preference
  8. Kadner 等人(2021)AdaptiFont: Increasing Individuals' Reading Speed with a Generative Font Model and Bayesian Optimization
  9. Shen 等人(2022)Personalization of a Mid-Air Gesture Keyboard using Multi-Objective Bayesian Optimization
  10. Meinhardt 等人(2025)Fly Away: Evaluating the Impact of Motion Fidelity on Optimized User Interface Design via Bayesian Optimization in Automated Urban Air Mobility Simulations
  11. Li 等人(2026b)BlurDriving: Investigating How Personalized Blur Techniques Impact Drivers' Performance in Virtual Reality
  12. Iwai 等人(2025)Constrained Preferential Bayesian Optimization and Its Application in Banner Ad Design

32.6 新手与专家 #

为谁优化与如何优化同样重要。Ou 等人(2023)的研究(N=60N = 60)发现,“新手可以达到专家级的质量表现,但专业水平较高的被试会带来更多的优化迭代和更明确的偏好,同时满意度一直较低。相比之下,新手更容易满足,结束得也更快。”作者的解释是,“专家追求更多样的结果,而机器达到的是最优结果”。现场研究同样如此:实验室被试比专家美术师更容易满足,后者采用了实验室被试所忽略的质量标准(Ou 等,2022)。

专家一再要求直接控制:在画廊之外操纵参数(Koyama 等,2020),或编辑字形、关闭风格传播、查看更完整的历史(Tatsukawa 等,2025)。当优化器接管他们自己无法判断的部分时,他们态度积极:约束偏好贝叶斯优化研究中的 11 名广告设计师平均有 5.82 年经验,他们赞成由系统管理点击率(Iwai 等,2025)。材料科学实验也发现专家与非专家的行为不同(第 34.2 节)。

然而,大多数样本是新手或学生:Chan 等人的 40 名新手、Mo 等人的 18 名 20 至 36 岁的被试、FontCraft 的 10 名非专家、GimmBO 中全部具有计算机或机器学习背景的被试和 APPO 中 24 至 28 岁的被试(Chan 等,2022;Mo 等,2024;Liu 等,2026b;Li 等,2026f)。关于专业设计师使用偏好贝叶斯优化工具的情况,已有认识主要来自两名技术美术师和两次访谈(推断)。

第 32.6 节引用的文献 9
  1. Ou 等人(2023)The Impact of Expertise in the Loop for Exploring Machine Rationality
  2. Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures
  3. Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
  4. Tatsukawa 等人(2025)FontCraft: Multimodal Font Design Using Interactive Bayesian Optimization
  5. Iwai 等人(2025)Constrained Preferential Bayesian Optimization and Its Application in Banner Ad Design
  6. Chan 等人(2022)Investigating Positive and Negative Qualities of Human-in-the-Loop Optimization for Designing Interaction Techniques
  7. Mo 等人(2024)Cooperative Multi-Objective Bayesian Design Optimization
  8. Liu 等人(2026b)GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization
  9. Li 等人(2026f)Preference-Guided Prompt Optimization for Text-to-Image Generation

32.7 解释与信任 #

实验表明,解释能提高任务表现。在一项 N=213N = 213 的被试间实验中,被试调节模拟煮蛋任务的 6 个参数;任何一种解释(条形图、规则或文本)都提高了任务成功率,减少了所需的尝试次数,增进了理解和信心,且没有增加工作负荷(Chakraborty 等,2025b)。MOLONE 的作者报告,针对输入和结果的比较式解释使收敛显著加快,但我们未能获得该用户研究的规模(Chakraborty 等,2025a)。预印本 ShapleyBO 用 Shapley 值解释每个提议,即把提议的期望值分摊到各输入参数上;在一项外骨骼服个性化研究中,看到解释的团队累积遗憾较低。累积遗憾指整个会话中与最佳设计之间差距的总和(第 13 章)(Rodemann 等,2024)。CoExBO 为每个候选给出解释以促进信任,并带有无害保证:即使用户给出对抗性输入,它也能像普通贝叶斯优化一样收敛(Adachi 等,2024)。Niwa 等人(2025)的被试认为,解释使出乎意料的建议更容易接受,但也有人觉得解释过于笼统或过长。

对优化器的理解也可能改变反馈。Colella 等人(2020)发现,理解优化器的用户会给出带有策略性偏差的回答(21 人,一维任务,标量反馈),不同于大多数论文中如实作答的模拟用户。Sandholtz 等人(2023)(Bayesian Analysis,2023)发现,许多被试的探索方式超出了标准采集函数所能刻画的范围;Weichert 等人(2025)的一篇预印本记录了一个工业案例,加入数据和专家知识反而使贝叶斯优化效果变差。

乌尔姆各项研究中的“信任”指对车辆的信任,它本身是被优化的目标之一,而不是对优化器的信任(Jansen 等,2025);在偏好贝叶斯优化的人机交互研究中,对优化器本身的信任几乎从未得到直接测量(推断)。研究若要就此下结论,应当在题项中明确提及优化器。让搜索可见且可编辑(显式约束、过程披露、可撤回的历史),似乎比单靠文本解释更能维持能动感(推断)。

第 32.7 节引用的文献 9
  1. Chakraborty 等人(2025b)Explanation format does not matter; but explanations do -- An Eggsbert study on explaining Bayesian Optimisation tasks
  2. Chakraborty 等人(2025a)Comparative Explanations: Explanation Guided Decision Making for Human-in-the-Loop Preference Selection
  3. Rodemann 等人(2024)Explaining Bayesian Optimization by Shapley Values Facilitates Human-AI Collaboration
  4. Adachi 等人(2024)Looping in the Human Collaborative and Explainable Bayesian Optimization
  5. Niwa 等人(2025)Cooperative Design Optimization through Natural Language Interaction
  6. Colella 等人(2020)Human Strategic Steering Improves Performance of Interactive Optimization
  7. Sandholtz 等人(2023)Inverse Bayesian Optimization: Learning Human Acquisition Functions in an Exploration vs Exploitation Search Task
  8. Weichert 等人(2025)When Less is More: A Story of Failing Bayesian Optimization Due to Additional Expert Knowledge
  9. Jansen 等人(2025)OptiCarVis: Improving Automated Vehicle Functionality Visualizations Using Bayesian Optimization to Enhance User Experience

32.8 与强基线的比较 #

一种方法只要胜过较弱的对手,就可能显得很好。表 32.2 按对照条件的强弱为主要比较排序。强弱分级是本章的判断(推断):随机查询、单个滑块和无可视化算作弱;设计者自己的设计、手动调参和文献中的设定算作中;相似的优化器、忽略成本的贝叶斯优化和专家设计算作强。

表 32.2 按对照条件强度排序的主要比较。强度分级是本章的判断(推断)。出处:ROMBO(Marcos 等,2025)、多会话研究(Colley 等,2026),以及正文中引用的研究。
研究 对照 强度 结果
ROMBO(2025) 随机查询 弱 找到新的喜爱曲目的频率高 40%、速度快 16%,花在不喜欢的曲目上的时间少 18%(N=16N = 16)
FontCraft(2025) 单滑块贝叶斯优化 弱 更接近目标;未见推断统计(N=10N = 10)
OptiCarVis(2025) 无可视化;用户自定义;专家设计 弱至强 个性化设计在若干评分上胜过专家设计和自定义设计
序列线搜索(2017) 商业自动增强 中 众包投票大幅领先
Dudley 等(2019) 基线界面 中 第 1 批无差异;从第 2 批起任务用时更短
Shen 等(2022) 基线键盘 中 速度 +14.4%(p=0.0059p = 0.0059),准确率 +13.8%(p=0.0046p = 0.0046),排除了学习效应
Liao 等(2024) 标准贝叶斯优化;手动校准 强;中 绝对指点改善 22.92% 和 21.35%,相对指点改善 25.43% 和 13.60%
Tanaka 等(2026) 滑块 中 62.5% 偏好优化结果;85% 认可其多样性
GimmBO(2026) 滑块;画廊 中 排序更好,但每步更慢
Liao 等(IEEE Pervasive Computing 2023) 设计师自己的策略 中 设计性能“非常相似”
Song 等(2025) 手动;ParetoSelect 中至强 布局排名高于 ParetoSelect(p=.02p = .02);超体积、整体质量或体验无差异
多会话车辆可视化(AutomotiveUI 2026) 第二、三天沿用第一天的设计 中至强 持续优化在认知负荷、信任、可预测性和感知安全上评分更好(N=74N = 74);作者报告了主观测量方面的不足
Mo 等(2024) 优化器主导 强 超体积无差异;Pareto 设计更少
Niwa 等,研究 2(2025) 通过显式约束协作 强 性能无差异(p=0.204p = 0.204)
成本感知贝叶斯优化(2026) 忽略成本的贝叶斯优化 强 约 67% 的成本;最终质量无差异(p=.77p = .77)
HOMI(2026) 迁移采集;持续贝叶斯优化 强 从第 6 次迭代起无差异
BlurDriving(IMWUT 2026) 无模糊 中 客观驾驶表现无显著改善
Ou 等,现场部署(2022) 无 不适用 549 个序列中有 415 个从未进入优化

图 32.3 以样本量和对照强度为两条轴排布这些研究,并按反馈类型着色。

偏好评分性能隐式(编辑)结果更好结果相同,成本更低无对照无弱中强对照条件的强度5102050100200被试人数(对数刻度)每项对照的强度是本章的分级(推断),不是作者的分级。Chan 等(图中带圈者)CHI 2022 · N = 40 · 性能反馈对照条件:设计者主导设计(本章分级:中)空间误差更好;能动感、归属感和表达力更低
偏好评分性能隐式(编辑)结果更好结果相同,成本更低无对照无弱中强对照条件的强度5102050100200被试人数(对数刻度)每项对照的强度是本章的分级(推断),不是作者的分级。Chan 等(图中带圈者)CHI 2022 · N = 40 · 性能反馈对照条件:设计者主导设计(本章分级:中)空间误差更好;能动感、归属感和表达力更低
图 32.3 本章人机交互研究的证据图:被试人数(对数刻度)对对照条件的强度(各行),颜色表示反馈类型,标记形状表示比较的发现。选择一项研究或点击其标记,可以查看它的对照与结果。分级与结果编码是本章的判断(推断)。未画出的有:序列线搜索和 BlurDriving(表中没有被试人数)、Photographer-in-the-loop(其比较测量的是使用工具的体验)以及 Owaki 等人(比较的是不同的表示方式)。最上面一行是面对强对照的研究,九个标记中有六个是菱形,即以更低成本得到相同结果;沿 x 轴看,没有一项偏好反馈研究(蓝色)的被试超过 60 人。

规律很清楚(推断)。较强的正面结果来自性能目标:任务用时、打字速度、指点误差。纯偏好反馈的研究更常报告满意度或迭代次数,或报告胜过单个滑块之类的弱对照(ROMBO 胜过随机查询的结果是用评分得到的)。与熟练的手工作业或相似的优化器相比,最终质量通常没有差异。2017 至 2026 年间,交互式贝叶斯优化在设计领域的成效,最好概括为以更低的成本(更少的迭代、评估或投入的时间)得到相同的结果,而非得到更好的结果(推断)。第 46.7 节据此给出评估新系统的建议。

第 32.8 节引用的文献 2
  1. Marcos 等人(2025)Random rotational embedding Bayesian optimization for human-in-the-loop personalized music generation
  2. Colley 等人(2026)Multi-Session User Experience Assessments of Computationally Optimized Automated Vehicle Functionality Visualizations

32.9 来自设计研究的批评与替代方案 #

2017 至 2025 年间,批评主要来自优化论文的作者和相邻的人机交互研究,可分为两类。第一类涉及能动感,证据见第 32.2 节:Chan 等人提议“把优化器推到幕后,让它的建议成为推荐而不是命令”(Chan 等,2022);Mo 等人(2024)补充说,优化器通常无法“利用设计者的专业知识,迅速认定某个‘差’设计不值得”评估。

第二类涉及效用模型本身。Ou 等人(2022)的结论是,“我们需要从总体上重新思考人在回路系统设计中的基本假设与方法”。Koyama 与 Igarashi(2018)提出“谁的偏好?”(Whose preference?)这一问题:众包框架假设“人群共享一种‘一般的’(或普遍的)偏好”,而在某些领域,“只有专家才能充分评估设计的质量”。Koyama 与 Goto(2022)对贝叶斯优化生成的建议是否具有创造性未作定论;Dudley 等人(2019)无法判断其优化器是真正在优化,还是只排除了表现差的区域。2026 年,Langerak 等人(2026)指出,在设计空间仍在演变时,预先定义的参数空间会限制早期探索;Owaki 等人(2026)则认为,展示给用户的表示方式是交互设计的一部分,在其研究中(N=40N = 40),考虑可行性的 5 维潜空间优于原始的 9 维参数。

固着。设计固着(design fixation)指倾向于停留在见过的样例或自己最初的想法附近。在构思阶段使用人工智能图像生成器,会导致更多的固着、更少的想法,以及更低的多样性和原创性(N=60N = 60)(Wadinambiarachchi 等,2024);学生对自己最初想法的固着,可能强于对给定样例的固着(Leahy 等,2020)。偏好贝叶斯优化的画廊不断呈现系统提供的样例,当前最优设计则相当于最初的想法,因此用偏好贝叶斯优化辅助构思时,可以预期出现同样的固着(推断)。Gmeiner 等人(2023)观察到,14 名受过训练的设计师难以理解和引导生成式设计工具。

在交互中形成的偏好。2025 和 2026 年关于与生成式人工智能共创的研究认为:偏好在交互中形成;过早收敛和固着是主要的失败形式;一定的摩擦可能有益。可切换发散与收敛模式的系统 HAICo(一篇预印本)在创造力支持指数的每个因素上得分都高于 ChatGPT(N=24N = 24,p<0.002p < 0.002)(Wen 等,2026);IdeaBlocks 使设计师探索的图像数量增至 2.13 倍,视觉多样性高出 12.5%(Choi 等,2026);一篇研讨会论文主张保留促进反思的摩擦(Avelino 等,2026);一篇预印本发现,引出过程会使用户尚未形成的偏好显现出来(Kim 等,2026);Saracay 等人(2026)(COLM 2026)认为智能体应当帮助用户建构偏好,并给出了一个模拟用户基准,其用户模型得到一项 25 人研究的支持。如果偏好部分是在回答过程中建立的,一次比较测量的究竟是什么?第 45 章将回到这一问题。

替代方案趋向混合主导(mixed initiative),即任何一方都可以主导:第 32.2 节中的各个系统、可撤回的历史(Tatsukawa 等,2025)、交由机器处理的约束(Iwai 等,2025),以及让设计者担任约束的策展人而非原型的制作者(Jansen,2025)(一篇研讨会论文)。在构思方面,Koch 等人(2019)使用协作情境赌博机(一种根据反馈自适应的序贯推荐器)为情绪板推荐有启发性的素材,而不是收敛到某个最优点;16 名专业设计师中有 14 人更喜欢这一工具。

反面证据:优化可以支持探索。优化器主导的设计者探索了更多的设计空间(Chan 等,2022);协作条件下的设计者在两次评估之间移动得比设计者主导时更远(Mo 等,2024);Niwa 等人的被试把打破其固着的建议描述为“哦,原来如此!”的时刻(Niwa 等,2025);85% 的建筑专业学生认可优化器带来的多样性(p<0.001p < 0.001)(Tanaka 等,2026)。

两类批评的现状。针对能动感的批评已有经过检验的补救办法(协作控制、显式约束、探索滑块),在实验中恢复了大部分能动感。针对效用模型的批评,在偏好贝叶斯优化内部只有已提出、尚未检验的补救办法,例如丢弃历史、让旧数据衰减、撤回选择;也还没有研究在同一创造性任务上,把偏好贝叶斯优化工具与以发散为目标的构思工具相比较(推断)。批评者与优化论文的作者在诊断上大体一致(固着、目标不明确、偏好在交互中形成),分歧在于补救办法。

根据这些证据,可以为设计工具归纳出一条工作准则(推断):让优化器充当顾问;把可测量的子目标,如点击率、可行性或任务用时,交给机器;外观上的判断留给比较或排序;使搜索状态可见且可编辑;评估时与手动调参或熟练设计师比较,而不只与单个滑块或随机查询比较。这条准则来自本章的实证结果,不依赖于高斯过程框架。

第 32.9 节引用的文献 22
  1. Chan 等人(2022)Investigating Positive and Negative Qualities of Human-in-the-Loop Optimization for Designing Interaction Techniques
  2. Mo 等人(2024)Cooperative Multi-Objective Bayesian Design Optimization
  3. Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures
  4. Koyama 与 Igarashi(2018)Computational Design with Crowds
  5. Koyama 与 Goto(2022)BO as Assistant: Using Bayesian Optimization for Asynchronously Generating Design Suggestions
  6. Dudley 等人(2019)Crowdsourcing Interface Feature Design with Bayesian Optimization
  7. Langerak 等人(2026)Cost-Aware Bayesian Optimization for Prototyping Interactive Devices
  8. Owaki 等人(2026)Learning Feasibility-Aware Latent Spaces for Preference-Based Exploration of Procedural Automotive Wheel Designs
  9. Wadinambiarachchi 等人(2024)The Effects of Generative AI on Design Fixation and Divergent Thinking
  10. Leahy 等人(2020)Design Fixation From Initial Examples: Provided Versus Self-Generated Ideas
  11. Gmeiner 等人(2023)Exploring Challenges and Opportunities to Support Designers in Learning to Co-create with AI-based Manufacturing Design Tools
  12. Wen 等人(2026)Exploration vs. Fixation: Scaffolding Divergent and Convergent Thinking for Human-AI Co-Creation with Generative Models
  13. Choi 等人(2026)IdeaBlocks: Expressing and Reusing Divergent Intents for Graphic Design Exploration using Generative AI
  14. Avelino 等人(2026)Creativity from Friction: Human-AI Interaction for Exploratory Structural Design
  15. Kim 等人(2026)Elicitive User Interfaces: Designing How Users Shape Generative Interfaces
  16. Saracay 等人(2026)Beyond expert users: agents should help users construct preferences, not just elicit them
  17. Tatsukawa 等人(2025)FontCraft: Multimodal Font Design Using Interactive Bayesian Optimization
  18. Iwai 等人(2025)Constrained Preferential Bayesian Optimization and Its Application in Banner Ad Design
  19. Jansen(2025)Human-in-the-Loop Optimization for Inclusive Design: Balancing Automation and Designer Expertise
  20. Koch 等人(2019)May AI? Design Ideation with Cooperative Contextual Bandits
  21. Niwa 等人(2025)Cooperative Design Optimization through Natural Language Interaction
  22. Tanaka 等人(2026)Human-in-the-Loop Bayesian Optimization Approach to Supporting Early-Stage Architectural Design

32.10 常见说法核查 #

表 32.3 对照原始文献,核查二手叙述中流传的若干说法。

表 32.3 对照原始文献核查关于交互式贝叶斯优化人机交互文献的说法。
说法 判定 文献显示的情况
序列线搜索在一个 6 维问题上约需 15 至 20 次迭代收敛。 部分正确 照片任务有 6 个参数,众包运行固定为 15 次迭代;从不同起点出发的运行在前 4 至 5 次迭代内趋于一致。没有任何依据支持“15 至 20”(Koyama 与 Igarashi,2018)。
AdaptiFont、持续人在回路优化和 Chan 等是关于偏好贝叶斯优化的证据。 范围错误 AdaptiFont 优化阅读速度,Chan 等优化速度和准确率,持续人在回路优化使用性能反馈;没有一项使用偏好反馈(Kadner 等,2021;Chan 等,2022;Liao 等,2025)。
在 Niwa 等的研究中,语言模型把设计意图转换成对搜索空间的约束。 部分正确 语言模型让设计者介入系统主导的优化,并解释其推理;该研究把它与一种使用显式约束的方法作了比较(Niwa 等,2025)。
约束偏好贝叶斯优化(Iwai 等 2025)是第一个带不等式约束的偏好贝叶斯优化。 论文本身的说法,过强 作者是 Iwai、Kumagae、Koyama、Hamasaki 与 Goto。“第一个”忽略了 C-GLISp(IEEE TCST 2022)和 StageOpt(ICML 2018)(Iwai 等,2025;Zhu 等,2022;Sui 等,2018b)。

有两处引用细节容易出错。2020 年那篇 SIGGRAPH 论文题为 Sequential Gallery,“序列平面搜索”(sequential plane search)是其中的方法(Koyama 等,2020)。旋律方面的工作是两篇论文:2020 年的试点研究(Zhou 等,2020),以及 IUI 2021 上有 12 名被试的研究(Zhou 等,2021)。

第 32.10 节引用的文献 11
  1. Koyama 与 Igarashi(2018)Computational Design with Crowds
  2. Kadner 等人(2021)AdaptiFont: Increasing Individuals' Reading Speed with a Generative Font Model and Bayesian Optimization
  3. Chan 等人(2022)Investigating Positive and Negative Qualities of Human-in-the-Loop Optimization for Designing Interaction Techniques
  4. Liao 等人(2025)Continual Human-in-the-Loop Optimization
  5. Niwa 等人(2025)Cooperative Design Optimization through Natural Language Interaction
  6. Iwai 等人(2025)Constrained Preferential Bayesian Optimization and Its Application in Banner Ad Design
  7. Zhu 等人(2022)C-GLISp: Preference-Based Global Optimization Under Unknown Constraints With Applications to Controller Calibration
  8. Sui 等人(2018b)Stagewise Safe Bayesian Optimization with Gaussian Processes
  9. Koyama 等人(2020)Sequential Gallery for Interactive Visual Design Optimization
  10. Zhou 等人(2020)Generative Melody Composition with Human-in-the-Loop Bayesian Optimization
  11. Zhou 等人(2021)Interactive Exploration-Exploitation Balancing for Generative Melody Composition

32.11 已定、有争议与缺失 #

研究现状已定、有争议与缺失

已定。在以性能为目标的设计任务中,由优化器主导会大幅降低能动感、归属感和表达力,结果指标只有小幅改善;提供引导搜索的渠道,能以结果上的较小代价恢复大部分失去的能动感(Chan 等,2022;Mo 等,2024;Niwa 等,2025)。群体先验减少了所需的迭代次数(Li 等,2025a);在唯一一项追踪整个会话的研究中,其优势到第六次迭代时已经消失(Liao 等,2026)。凡是测量过个体差异的研究,差异都很大。真实会话常常提前结束:在唯一一次长期现场部署中,四分之三的序列从未进入优化(Ou 等,2022)。

有争议。优化器对创造性探索是帮助还是妨碍:关于固着的文献指向一个方向,设计空间覆盖度的测量指向另一个方向。面对强对照时,交互式贝叶斯优化的收益能否保持;在强对照下,最终质量通常没有差异。哪种查询形式最好:首批同一任务上的比较直到 2026 年才出现,被试为 12 至 16 人。解释能否建立对优化器的信任,还是只能提高任务表现。

缺失。会话内偏好漂移的重复测量检验。在同一任务上用真实用户对成对比较、画廊、滑块、排序和评分进行的比较。偏好贝叶斯优化会话内对固着的测量。对优化器信任的直接测量。使用纯偏好反馈、样本量与 Chan 等人相当的能动感研究。两名美术师和两次访谈之外的专业设计师研究。在同一任务上对偏好贝叶斯优化工具与以发散为目标的构思工具的比较。群体先验不会损害远离群体者的证据(推断)。

第 32.11 节引用的文献 6
  1. Chan 等人(2022)Investigating Positive and Negative Qualities of Human-in-the-Loop Optimization for Designing Interaction Techniques
  2. Mo 等人(2024)Cooperative Multi-Objective Bayesian Design Optimization
  3. Niwa 等人(2025)Cooperative Design Optimization through Natural Language Interaction
  4. Li 等人(2025a)Efficient Visual Appearance Optimization by Learning from Prior Preferences
  5. Liao 等人(2026)Efficient Human-in-the-Loop Optimization via Priors Learned from User Models
  6. Ou 等人(2022)The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures

32.12 习题 #

习题 32.1

图 32.2 给出同一工具的三个成功率:全部现场序列中的 2.9%,请求了优化的现场序列中的 11.9%,以及实验室序列中的 48.5%。哪一个描述了该工具在实践中的表现?如果一篇论文只报告那 134 个序列,或只报告实验室研究,为什么可能误导读者?

解答

是 2.9%(16/54916/549);请求了优化的序列为 16/134≈11.9%16/134 \approx 11.9\%,实验室为 97/200=48.5%97/200 = 48.5\%。停在第一次迭代的 415 个序列,本身就是该工具实际使用情况的一部分:美术师看过第一个网格就停下了,可能是某个候选已经足够好,也可能是他们放弃了。只报告进入优化的序列,等于以人们已经选择继续为条件;只报告实验室研究,则是以另一些被试取代专业用户,而作者发现这些被试更容易满足。两种做法都会使方法显得比现场实际使用时更好。

习题 32.2

2017 至 2026 年间,没有一项设计研究检验会话内的偏好漂移。请设计一个最简单的检验,加入一次现有的偏好贝叶斯优化会话(30 次比较)。应当重复什么、在何时重复?回答中出现什么模式,才能把漂移与普通的回答噪声区分开?

解答

在之后的两个时间点重复部分早先的对。例如,第 2、4、6 对首次回答后随即再展示一次(短间隔),会话结束时再展示一次(长间隔),并随机穿插在常规查询之中。若只有回答噪声,两种间隔下的一致率应当相同,因为每个回答都是对固定效用的独立带噪声读数。若存在漂移,长间隔下的一致率应低于短间隔,且方向一致:如果此人的标准发生了移动,后期回答与基于后期数据拟合的模型应当比与基于早期数据拟合的模型更加一致。每人只有少数几次重复时,这一检验对单个人效力很弱,汇总一组人时则有用;代价是每次会话多几次比较。第 47.4 节介绍了这一实验更完整的版本。

习题 32.3

一篇新论文报告,其基于偏好的设计工具在 6 次迭代内得到满意结果,单滑块基线则需要 11 次,被试为 12 人。按表 32.2 的分级,这一比较有多强?请举出两个能使结果更有信息量的对照条件,并说明各自能排除什么。

解答

按本章的分级,单个滑块是弱对照。两个更强的对照:一是由同样的被试在同样的时间预算内手动调节同样的参数,用以检验人们自行调节能否做得同样好;二是采用不同查询形式或采集函数的相似优化器,用以检验收益是否来自新组件,而非一般意义上的优化。此外,由未参与研究的评判者测量最终质量,而不只统计达到满意的迭代次数,还能把“更快”与“更好”区分开。

延伸阅读 #

  • Chan 等人(2022)是关于能动感与性能之间权衡最清晰的对照研究;阅读其结果时,宜一并阅读其中关于混合主导的讨论。
  • Mo 等人(2024)展示了协作这一折中方案的具体形态,并在同一项被试内研究中将其与两个极端作了比较。
  • Ou 等人(2022)是唯一一次有专业人员参与的偏好贝叶斯优化长期现场部署,也最详细地记录了真实反馈如何偏离模型。
  • Koyama 等人(2020)和书章 Koyama 与 Igarashi(2018)阐述了界面研究线索对查询形式的思考,并坦率列出了其局限。
  • Niwa 等人(2025)在设计者用自然语言引导时同时测量结果与能动感,可作为通向第 35 章中语言模型系统的桥梁。

参考文献

  1. Adachi, M., Planden, B., Howey, D. A., Osborne, M. A., Orbell, S., Ares, N., Muandet, K., and Chau, S. L. (2024). Looping in the Human Collaborative and Explainable Bayesian Optimization. AISTATS 2024. 引用于 §32.7
  2. Avelino, R. M., Sevastjanova, R., Van Mele, T., Block, P., and El-Assady, M. (2026). Creativity from Friction: Human-AI Interaction for Exploratory Structural Design. ICML 2026 Workshop on Human-AI Co-Creativity. 研讨会论文引用于 §32.9
  3. Baltzell, L. S., Xia, J., and Kalluri, S. (2018). Efficient characterization of individual differences in compression ratio preference. The Journal of the Acoustical Society of America. doi:10.1121/1.5067390. 引用于 §32.5
  4. Brochu, E., de Freitas, N., and Ghosh, A. (2007). Active Preference Learning with Discrete Choice Data. Advances in Neural Information Processing Systems. 引用于 §32.1
  5. Catkin, B., and Patoglu, V. (2023). Preference-Based Human-in-the-Loop Optimization for Perceived Realism of Haptic Rendering. IEEE Transactions on Haptics. doi:10.1109/toh.2023.3266726. 引用于 §32.1
  6. Chakraborty, T., Wirth, C., and Seifert, C. (2025a). Comparative Explanations: Explanation Guided Decision Making for Human-in-the-Loop Preference Selection. World Conference on eXplainable AI 2025. 引用于 §32.7
  7. Chakraborty, T., Koelle, M., Schlötterer, J., Schlicker, N., Wirth, C., and Seifert, C. (2025b). Explanation format does not matter; but explanations do – An Eggsbert study on explaining Bayesian Optimisation tasks. Information Systems Frontiers. doi:10.1007/s10796-025-10671-6. 引用于 §32.7
  8. Chan, L., Liao, Y.-C., Mo, G. B., Dudley, J. J., Cheng, C.-L., Kristensson, P. O., and Oulasvirta, A. (2022). Investigating Positive and Negative Qualities of Human-in-the-Loop Optimization for Designing Interaction Techniques. CHI 2022. 引用于 §32.1 §32.2 §32.6 §32.9 §32.10 §32.11
  9. Chiu, C.-H., Koyama, Y., Lai, Y.-C., Igarashi, T., and Yue, Y. (2020). Human-in-the-loop differential subspace search in high-dimensional latent space. ACM Transactions on Graphics. doi:10.1145/3386569.3392409. 引用于 §32.1
  10. Choi, D., Son, K., Yu, J., Jung, H., and Kim, J. (2026). IdeaBlocks: Expressing and Reusing Divergent Intents for Graphic Design Exploration using Generative AI. Proceedings of the 2026 Designing Interactive Systems Conference. doi:10.1145/3800645.3813005. 引用于 §32.9
  11. Chong, T. L. H., Shen, I.-C., Sato, I., and Igarashi, T. (2021). Interactive Optimization of Generative Image Modelling using Sequential Subspace Search and Content-based Guidance. Computer Graphics Forum. doi:10.1111/cgf.14188. 引用于 §32.1 §32.4
  12. Colella, F., Daee, P., Jokinen, J., Oulasvirta, A., and Kaski, S. (2020). Human Strategic Steering Improves Performance of Interactive Optimization. UMAP 2020. 引用于 §32.7
  13. Colley, M., Jansen, P., Keskar, M., and Rukzio, E. (2025). Improving External Communication of Automated Vehicles Using Bayesian Optimization. CHI 2025. 引用于 §32.1 §32.2
  14. Colley, M., Jansen, P., Krauss, S., and Rukzio, E. (2026). Multi-Session User Experience Assessments of Computationally Optimized Automated Vehicle Functionality Visualizations. Proceedings of the 18th International Conference on Automotive User Interfaces and Interactive Vehicular Applications. doi:10.1145/3828157.3828785. 引用于 §32.1 §32.8
  15. Dudley, J. J., Jacques, J. T., and Kristensson, P. O. (2019). Crowdsourcing Interface Feature Design with Bayesian Optimization. Proceedings of the 2019 CHI Conference on Human Factors in Computing Systems. doi:10.1145/3290605.3300482. 引用于 §32.1 §32.3 §32.9
  16. Dudley, J., Oulasvirta, A., Chan, L., and Kristensson, P. O. (2026). Putting the Human Back in the Loop: A Review of Interactive Bayesian Optimization. ACM Computing Surveys. 引用于 §32.1
  17. Fernandes Junior, F. E., Langerak, T., Keränen, M., Shi, D., Alipova, A., and Oulasvirta, A. (2026). Integrating Multi-Source Feedback in Computational Design. Accepted at ACM TiiS. 引用于 §32.1
  18. Gmeiner, F., Yang, H., Yao, L., Holstein, K., and Martelaro, N. (2023). Exploring Challenges and Opportunities to Support Designers in Learning to Co-create with AI-based Manufacturing Design Tools. CHI 2023. 引用于 §32.9
  19. González, J., Dai, Z., Damianou, A., and Lawrence, N. D. (2017). Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §32.1
  20. Iwai, K., Kumagae, Y., Koyama, Y., Hamasaki, M., and Goto, M. (2025). Constrained Preferential Bayesian Optimization and Its Application in Banner Ad Design. Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence. 引用于 §32.1 §32.5 §32.6 §32.9 §32.10
  21. Jansen, P. (2025). Human-in-the-Loop Optimization for Inclusive Design: Balancing Automation and Designer Expertise. CHI 2025 Workshop Access InContext. 研讨会论文引用于 §32.9
  22. Jansen, P., Colley, M., Krauß, S., Hirschle, D., and Rukzio, E. (2025). OptiCarVis: Improving Automated Vehicle Functionality Visualizations Using Bayesian Optimization to Enhance User Experience. CHI 2025. 引用于 §32.1 §32.7
  23. Kadner, F., Keller, Y., and Rothkopf, C. A. (2021). AdaptiFont: Increasing Individuals' Reading Speed with a Generative Font Model and Bayesian Optimization. CHI 2021. 引用于 §32.1 §32.3 §32.5 §32.10
  24. Kim, E., Min, B., Xia, H., and Kim, J. (2026). Elicitive User Interfaces: Designing How Users Shape Generative Interfaces. arXiv. 预印本引用于 §32.9
  25. Koch, J., Lucero, A., Hegemann, L., and Oulasvirta, A. (2019). May AI? Design Ideation with Cooperative Contextual Bandits. Proceedings of the 2019 CHI Conference on Human Factors in Computing Systems. doi:10.1145/3290605.3300863. 引用于 §32.9
  26. Koyama, Y., and Goto, M. (2022). BO as Assistant: Using Bayesian Optimization for Asynchronously Generating Design Suggestions. Proceedings of the 35th Annual ACM Symposium on User Interface Software and Technology. doi:10.1145/3526113.3545664. 引用于 §32.1 §32.9
  27. Koyama, Y., and Igarashi, T. (2018). Computational Design with Crowds. Computational Interaction. 引用于 §32.1 §32.4 §32.5 §32.9 §32.10
  28. Koyama, Y., Sato, I., Sakamoto, D., and Igarashi, T. (2017). Sequential line search for efficient visual design optimization by crowds. ACM Transactions on Graphics. 引用于 §32.1
  29. Koyama, Y., Sato, I., and Goto, M. (2020). Sequential Gallery for Interactive Visual Design Optimization. ACM Transactions on Graphics 39(4) (SIGGRAPH 2020). 引用于 §32.1 §32.3 §32.6 §32.10
  30. Kuroki, S., Nakagawa, M., Yoshida, S., Koyama, Y., and Tadashi, K. (2026). LAPPI: Interactive Optimization with LLM-Assisted Preference-Based Problem Instantiation. IEEE Access 14. 引用于 §32.1 §32.3
  31. Langerak, T., Zhang, R., Wang, Z., Kristensson, P. O., and Oulasvirta, A. (2026). Cost-Aware Bayesian Optimization for Prototyping Interactive Devices. CHI 2026. 引用于 §32.1 §32.9
  32. Leahy, K., Daly, S. R., McKilligan, S., and Seifert, C. M. (2020). Design Fixation From Initial Examples: Provided Versus Self-Generated Ideas. Journal of Mechanical Design. 引用于 §32.9
  33. Lee, S. W., Choi, J., and Hyun, K. H. (2026). Part-level 3D shape generation driven by user intention inference with preferential Bayesian optimization. Scientific Reports. doi:10.1038/s41598-026-38916-7. 引用于 §32.1
  34. Li, Z., Liao, Y.-C., and Holz, C. (2025a). Efficient Visual Appearance Optimization by Learning from Prior Preferences. UIST 2025. 引用于 §32.1 §32.3 §32.5 §32.11
  35. Li, Z., Gebhardt, C., Liao, Y.-C., and Holz, C. (2026a). Automating UI Optimization through Multi-Agentic Reasoning. Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI 2026). doi:10.1145/3772318.3791444. 引用于 §32.1
  36. Li, Y., Colley, M., Gui, X., Rendon Cardona, C. C., Jansen, P., Sandor, C., and Igarashi, T. (2026b). BlurDriving: Investigating How Personalized Blur Techniques Impact Drivers' Performance in Virtual Reality. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies. doi:10.1145/3831646. 引用于 §32.1 §32.5
  37. Li, Z., Liao, Y.-C., and Holz, C. (2026f). Preference-Guided Prompt Optimization for Text-to-Image Generation. CHI 2026. 引用于 §32.1 §32.4 §32.6
  38. Liao, Y.-C., Dudley, J. J., Mo, G. B., Cheng, C.-L., Chan, L., Oulasvirta, A., and Kristensson, P. O. (2023). Interaction Design With Multi-Objective Bayesian Optimization. IEEE Pervasive Computing. doi:10.1109/mprv.2022.3230597. 引用于 §32.1 §32.2
  39. Liao, Y.-C., Desai, R., Pierce, A. M., Taylor, K. E., Benko, H., Jonker, T. R., and Gupta, A. (2024a). A Meta-Bayesian Approach for Rapid Online Parametric Optimization for Wrist-based Interactions. Proceedings of the CHI Conference on Human Factors in Computing Systems. doi:10.1145/3613904.3642071. 引用于 §32.1 §32.5
  40. Liao, Y.-C., Mo, G. B., Dudley, J. J., Cheng, C.-L., Chan, L., Kristensson, P. O., and Oulasvirta, A. (2024b). Practical approaches to group-level multi-objective Bayesian optimization in interaction technique design. Collective Intelligence. doi:10.1177/26339137241241313. 引用于 §32.1 §32.5
  41. Liao, Y.-C., Streli, P., Li, Z., Gebhardt, C., and Holz, C. (2025). Continual Human-in-the-Loop Optimization. CHI 2025. 引用于 §32.1 §32.10
  42. Liao, Y.-C., Belo, J., Moon, H.-S., Steimle, J., and Feit, A. M. (2026). Efficient Human-in-the-Loop Optimization via Priors Learned from User Models. CHI 2026. 引用于 §32.1 §32.5 §32.11
  43. Liu, C., Ling, S., and Jacobson, A. (2026b). GimmBO: Interactive Generative Image Model Merging via Bayesian Optimization. ACM Transactions on Graphics. doi:10.1145/3811293. 引用于 §32.1 §32.4 §32.6
  44. Marcos, M., Mur-Labadia, L., and Martinez-Cantin, R. (2025). Random rotational embedding Bayesian optimization for human-in-the-loop personalized music generation. PLOS One. doi:10.1371/journal.pone.0335853. 引用于 §32.1 §32.8
  45. McCourt, M., and Dewancker, I. (2019). Sampling Humans for Optimizing Preferences in Coloring Artwork. ICML 2019 Workshop on Human in the Loop Learning. 研讨会论文引用于 §32.1
  46. Meinhardt, L.-M., Schramm, C., Jansen, P., Colley, M., and Rukzio, E. (2025). Fly Away: Evaluating the Impact of Motion Fidelity on Optimized User Interface Design via Bayesian Optimization in Automated Urban Air Mobility Simulations. CHI 2025. 引用于 §32.1 §32.5
  47. Mikkola, P., Todorović, M., Järvi, J., Rinke, P., and Kaski, S. (2020). Projective Preferential Bayesian Optimization. International Conference on Machine Learning. 引用于 §32.4
  48. Mo, G., Dudley, J., Chan, L., Liao, Y.-C., Oulasvirta, A., and Kristensson, P. O. (2024). Cooperative Multi-Objective Bayesian Design Optimization. ACM Transactions on Interactive Intelligent Systems. doi:10.1145/3657643. 引用于 §32.1 §32.2 §32.4 §32.6 §32.9 §32.11
  49. Nandy, A., and Goucher-Lambert, K. (2025). Exploring the Effectiveness of Interactive Preference Learning for Adapting Designs to Abstract Semantic Attributes. Journal of Mechanical Design. 引用于 §32.1
  50. Niwa, R., Yoshida, S., Koyama, Y., and Ushiku, Y. (2025). Cooperative Design Optimization through Natural Language Interaction. UIST 2025. 引用于 §32.1 §32.2 §32.7 §32.9 §32.10 §32.11
  51. Ou, C., Buschek, D., Mayer, S., and Butz, A. (2022). The Human in the Infinite Loop: A Case Study on Revealing and Explaining Human-AI Interaction Loop Failures. Mensch und Computer 2022. 引用于 §32.1 §32.3 §32.4 §32.6 §32.9 §32.11
  52. Ou, C., Mayer, S., and Butz, A. (2023). The Impact of Expertise in the Loop for Exploring Machine Rationality. IUI 2023. 引用于 §32.1 §32.4 §32.6
  53. Owaki, T., Koyama, Y., Nakano, T., Yamaguchi, T., Goto, M., and Sakai, H. (2026). Learning Feasibility-Aware Latent Spaces for Preference-Based Exploration of Procedural Automotive Wheel Designs. arXiv. 预印本引用于 §32.1 §32.9
  54. Peng, Y.-H., Bigham, J. P., and Wu, J. (2026). Efficient Personalization of Generative User Interfaces. arXiv. 预印本引用于 §32.1 §32.3 §32.4
  55. Rajagopalan, R., Dutta, D., Wei, Y.-L., and Roy Choudhury, R. (2026). Personalized Image Generation via Human-in-the-loop Bayesian Optimization. International Conference on Machine Learning. 引用于 §32.1 §32.4
  56. Rodemann, J., Croppi, F., Arens, P., Sale, Y., Herbinger, J., Bischl, B., … Casalicchio, G. (2024). Explaining Bayesian Optimization by Shapley Values Facilitates Human-AI Collaboration. arXiv. 预印本引用于 §32.7
  57. Sandholtz, N., Miyamoto, Y., Bornn, L., and Smith, M. (2023). Inverse Bayesian Optimization: Learning Human Acquisition Functions in an Exploration vs Exploitation Search Task. Bayesian Analysis. doi:10.1214/21-BA1303. 引用于 §32.7
  58. Saracay, I., Schmidt, L., and Guestrin, C. (2026). Beyond expert users: agents should help users construct preferences, not just elicit them. Conference on Language Modeling (COLM 2026). 引用于 §32.9
  59. Schoinas, E., Rastogi, A., Carter, A., Granley, J., and Beyeler, M. (2025). Evaluating Deep Human-in-the-Loop Optimization for Retinal Implants Using Sighted Participants. 2025 47th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC). doi:10.1109/embc58623.2025.11253762. 引用于 §32.3
  60. Shen, J., Hu, J., Dudley, J. J., and Kristensson, P. O. (2022). Personalization of a Mid-Air Gesture Keyboard using Multi-Objective Bayesian Optimization. 2022 IEEE International Symposium on Mixed and Augmented Reality (ISMAR). doi:10.1109/ismar55827.2022.00088. 引用于 §32.1 §32.5
  61. Søgaard Jensen, N., Hau, O., Bagger Nielsen, J. B., Bundgaard Nielsen, T., and Vase Legarth, S. (2019). Perceptual Effects of Adjusting Hearing-Aid Gain by Means of a Machine-Learning Approach Based on Individual User Preference. Trends in Hearing. doi:10.1177/2331216519847413. 引用于 §32.5
  62. Song, Y., Gebhardt, C., Liao, Y.-C., and Holz, C. (2025). Preference-Guided Multi-Objective UI Adaptation. Proceedings of the 38th Annual ACM Symposium on User Interface Software and Technology. doi:10.1145/3746059.3747645. 引用于 §32.1 §32.2 §32.3
  63. Sui, Y., Zhuang, V., Burdick, J., and Yue, Y. (2018b). Stagewise Safe Bayesian Optimization with Gaussian Processes. International Conference on Machine Learning. 引用于 §32.10
  64. Susak, J., Liu, Y., Jansen, P., and Colley, M. (2026). ProVoice: Designing Proactive Functionality for In-Vehicle Conversational Assistants using Multi-Objective Bayesian Optimization to Enhance Driver Experience. Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems. doi:10.1145/3772318.3791877. 引用于 §32.1
  65. Tanaka, M., Ono, K., and Yamada, S. (2026). Human-in-the-Loop Bayesian Optimization Approach to Supporting Early-Stage Architectural Design. CAADRIA proceedings. doi:10.52842/conf.caadria.2026.1.347. 引用于 §32.1 §32.2 §32.9
  66. Tatsukawa, Y., Shen, I.-C., Dogan, M. D., Qi, A., Koyama, Y., Shamir, A., and Igarashi, T. (2025). FontCraft: Multimodal Font Design Using Interactive Bayesian Optimization. CHI 2025. 引用于 §32.1 §32.2 §32.6 §32.9
  67. Wadinambiarachchi, S., Kelly, R. M., Pareek, S., Zhou, Q., and Velloso, E. (2024). The Effects of Generative AI on Design Fixation and Divergent Thinking. Proceedings of the CHI Conference on Human Factors in Computing Systems. 引用于 §32.9
  68. Weichert, D., Ernis, G., Worthmann, M., Ryzko, P., and Seifert, L. (2025). When Less is More: A Story of Failing Bayesian Optimization Due to Additional Expert Knowledge. arXiv. 预印本引用于 §32.7
  69. Wen, C., Phung, T., Mehrotra, P., Gulwani, S., Beaty, R. E., Nagashima, T., and Singla, A. (2026). Exploration vs. Fixation: Scaffolding Divergent and Convergent Thinking for Human-AI Co-Creation with Generative Models. arXiv. 预印本引用于 §32.9
  70. Yamamoto, K., Koyama, Y., and Ochiai, Y. (2022). Photographic Lighting Design with Photographer-in-the-Loop Bayesian Optimization. Proceedings of the 35th Annual ACM Symposium on User Interface Software and Technology. doi:10.1145/3526113.3545690. 引用于 §32.1
  71. Yuan, L.-P., Dudley, J. J., Kristensson, P. O., and Qu, H. (2025). Personalized Dual-Level Color Grading for 360-degree Images in Virtual Reality. IEEE Transactions on Visualization and Computer Graphics. 引用于 §32.1 §32.4
  72. Zhang, R., Zhu, X., Pourebadi Khotbehsara, M., Dao, W., Bıyık, E., and Culbertson, H. (2026b). Vibrotactile Preference Learning: Uncertainty-Aware Preference Learning for Personalized Vibration Feedback. UMAP 2026 (per Semantic Scholar). 引用于 §32.1 §32.3
  73. Zhou, Y., Koyama, Y., Goto, M., and Igarashi, T. (2020). Generative Melody Composition with Human-in-the-Loop Bayesian Optimization. CSMC-MuMe 2020. 引用于 §32.1 §32.10
  74. Zhou, Y., Koyama, Y., Goto, M., and Igarashi, T. (2021). Interactive Exploration-Exploitation Balancing for Generative Melody Composition. 26th International Conference on Intelligent User Interfaces. 引用于 §32.1 §32.2 §32.10
  75. Zhu, M., Piga, D., and Bemporad, A. (2022). C-GLISp: Preference-Based Global Optimization Under Unknown Constraints With Applications to Controller Calibration. IEEE Transactions on Control Systems Technology. 引用于 §32.10