这个无法验证的世界8. 看不见自己的组织目录EN

第 8 章 看不见自己的组织

论点:大型组织或国家无法直接观察自身的知识与活动:它们分散各处,部分隐而不见,有时还遭到刻意掩盖。于是,组织转而依赖可以观察的代理指标(代理替换的 Goodhart 崩塌在这里表现得最为触目),再以审计(留痕)与冗余加以补充。

看不清自身的庞然大物

在讨论放出去的智能体时,我们已经遇到过委托代理(principal-agent)问题。现在把它的尺度放大:委托方不再是一个人,而是一整个组织、一个国家;受托行动的,则是散布各处的成千上万的人。由此出现了一种新的、近乎荒诞的局面:这个庞然大物看不清它自己。

它想知道自己有多少人、种植着什么、谁在做什么、做得好不好,然而这些知识并不存放在任何一个它能够直接读取的地方。本章的问题是:当需要验证的对象是组织自身那些分散的、隐藏的、甚至会主动规避观察的知识时,组织如何应对?这里的不可验证叠加了前面讨论过的两种处境:一是部分可观测(partial observability,知识分散在边缘),二是对抗(被观察者会反过来操纵那些被观察的量)。

分散的知识

哈耶克 1945 年的《知识在社会中的运用》1明确揭示了这个问题:一个社会赖以运转的知识从不集中于任何一处,而是分散在无数个体手中。这是关于特定时间、特定地点的局部知识(local knowledge),而且往往难以言明。哪台机器今天出了点小毛病,哪位客户即将流失,哪条小路雨后会塌方:掌握这些知识的人常常并未意识到它们算得上「知识」,更无从将其整理成形、上报给中心。波兰尼把这一层称为默会维度(tacit dimension)2:我们知道的,远多于我们说得出的。

这意味着,组织所面对的并不只是「信息尚未收齐」。即便每个人都忠诚合作,那些局部的、默会的知识也会在汇集的过程中流失。中心所期望的那幅「组织全貌」,在原则上就无法被如实地纳入任何一个可供验证的容器。这是部分可观测在社会尺度上的形态,而且它有一条更为坚硬的底线:这些知识本质上是局部的,无法汇集于任何一处。

清晰性的冲动

看不清,便设法使之变得可以看清。斯科特在 1998 年的《国家的视角》3中为这种冲动取了一个准确的名字:清晰性(legibility)。国家若要对社会采取行动,首先须把社会改造成它能够读懂的样子。它丈量土地,绘制地籍图;为原本只有小名、绰号或随父名的人强加固定的姓氏;统一度量衡;推行标准化的科学营林。这些都不是中性的记录工作,而是对现实的重塑,目的是让现实能够被填入表格。哈金的《驯服偶然》32、德罗西埃的《大数字的政治》31以及鲍克与斯塔尔的《分类及其后果》30从不同的侧面考察了这一过程,合起来便是一部「把社会变得可数」的历史。

清晰性的危险在于,地图必然有所简化,而组织一旦只依照地图行动,被地图抹去的东西便会反噬。斯科特最有力的案例是科学营林(scientific forestry)。为了让森林「可读、可算、可收税」,普鲁士人把杂乱的天然林改造成整齐划一、便于清点的单一树种人工林。第一代长势喜人;到了第二代,土壤耗竭,虫害蔓延,森林成片死亡,德语甚至为此造出了一个词:Waldsterben,即「森林之死」。地图越是整洁,被它抹去的那些维系系统运转的局部知识,其缺失就越是致命。组织以这种方式为自己制造它所缺乏的可观测性,代价则是亲手削平了使它得以运转的复杂性。

代理指标与 Goodhart 崩塌

清晰性的冲动最常见的产物是指标。组织真正在意的东西(健康、学习、生产力、公共福祉)无法直接观测,于是它转而依赖可以观测的代理指标(proxy):KPI、GDP、考试分数、论文引用数、急诊等待时长。

这就是第 7 章讨论过的代理替换,但它在这里以相反的方式失效,而这一对照是贯穿全书的一条主线。数学家的代理忠实却不更易:等价改写确实等价,问题却并未因此变得更容易解决。组织的代理恰好相反,更易却不忠实:指标固然容易测量,然而一旦被当作目标,它与真实目标之间的对应关系就会断裂。

这种断裂有许多名称,在不同的学科中各有表述。早在 1956 年,里奇韦就在《绩效度量的失能后果》一文中7对这类后果作了系统的编目。1975 年,古德哈特4指出:一旦某个指标被当作政策目标,它作为指标的可靠性就会瓦解。同样在 1975 年,克尔发表《奖励 A 却指望 B 的蠢事》8,使这一现象成为管理学的常识。1979 年,坎贝尔6阐述的是同一现象在社会领域中的版本。斯特拉森则为它留下了最为精炼的表述5:当一个度量变成目标,它就不再是个好度量。

更深的一层是反应性(reactivity)。埃斯佩兰与索德尔 2007 年12指出,公开的排名与其说是在描述世界,不如说是在重塑世界:被排名的大学会依照排名的算法改变自身,于是指标所「测量」的,变成了由它自己催生出来的行为。相关的现象也早有记录:史密斯 1995 年10分析了公开发布绩效数据如何招致一连串始料未及的后果,贝文与胡德11则记录了英国医疗系统中针对指标的博弈。若再往前追溯,这一切的总源头是默顿 1936 年的文章《有目的的社会行动的非预期后果》9。

这类崩塌在现实中屡见不鲜,代价有时十分惊人。为了达成「交叉销售」的账户指标,富国银行的员工在客户不知情的情况下私自开设了大量虚假账户。2016 年事件曝光时,这类账户估计约有两百万个(后经复查增至约三百五十万个)。银行被处以一亿八千五百万美元的罚款,五千多名员工遭到解雇。那个被奉为目标的数字,反而摧毁了它本应衡量的客户关系。更早还有一则近乎寓言的案例,发生在殖民时期的德里:当局为了灭蛇,悬赏收购眼镜蛇的尸体,市民于是养蛇领赏;赏金一经停止,这些蛇被尽数放生,蛇患反而比从前更加严重。「眼镜蛇效应」(cobra effect)由此得名。

代理指标为何注定会被扭曲?委托代理理论对此给出了严格的解释。霍尔姆斯特伦 1979 年提出的信息性原理(informativeness principle)14指出:报酬应当挂靠在对「努力」具有信息量的信号上。然而,一旦努力是多维的,而可以测量的只是其中几个维度,问题便随之而来。霍尔姆斯特伦与米尔格罗姆 1991 年的多任务委托代理分析(multitask principal-agent)15清楚地表明:当一个人需要同时兼顾可测与不可测的任务时,对可测部分的奖励越重,他就越会把努力从不可测的部分转移到可测的部分。设真实目标为 $G$,可观测的代理指标为 $P$,二者在现状下彼此相关。问题在于,这种相关性是行为的产物,而不是客观规律。一旦以 $P$ 作为施压的目标,

$$\arg\max_{a} P(a)\ \quad\text{vs.}\quad\ \arg\max_{a} G(a),$$

理性的代理人便会寻找那些能够抬高 $P$、却无助于甚至有损于 $G$ 的行动,原有的相关性也就被优化的压力碾碎了。教师为考试而教,医院通过调度病人来压低某一项等待时长,研究者把一篇论文拆分成可以计数的最小发表单元,都出自同一机制。

Goodhart 崩塌:优化代理指标,真实目标随之脱钩

以审计与冗余为补充

代理指标若单独使用便会崩塌,因此组织又引入另外两种对策加以补充;这两种对策在本书中同样反复出现。

其一是留痕与审计。复式记账是人类最古老的审计链之一。索尔在《账簿与权力》22中论证,编制可供核查之账目的能力,与一个个国家的兴衰直接相关:算得清自己的,才能持久。现代的财务审计与独立稽核,都是在「事前无法防范舞弊」的条件下,换取「事后能够查出舞弊」的可能。然而,这一对策有其自身的病症。鲍尔 1997 年的《审计社会》(audit society)20一语道破:当验证沦为一种仪式,组织生产出来的不过是「一切尽在掌握」的表象,而不是实际的掌握。肖尔与赖特所描述的「审计文化」(audit culture)17,以及奥尼尔在 2002 年里斯讲座中对「信任」的反思21,指向的都是同一种异化:为了能够被问责,机构把大量精力耗费在制造可供检查的痕迹上,真正的工作反而被挤到一边。

其二是冗余与共识。兰道 1969 年那篇被低估的文章16为「重复与重叠」正名:在一个各部件都不完全可靠的系统中,冗余(redundancy)不是浪费,而是可靠性的来源;若干相互独立的核查,比单一的权威更难被同时欺骗。这一对策的成立有一个前提,即各项核查彼此独立;下一部将反复强调这一点:如果几项核查出自同一来源,相关的失效便会一举击穿冗余最核心的承诺。

小结:第二部的收束

四个场景至此考察完毕。控制台前的人、放出去的智能体、撞墙的数学家、看不见自己的组织,它们所面对的不可验证,来源迥然不同:隐藏在内心的偏好,开放世界中的未来行为,原则上不可判定的命题,分散且会主动规避观察的知识。然而,它们所诉诸的是同一小组对策。

其中最值得并置的,是代理替换两种方向相反的失效方式。数学家受挫于「忠实却不更易」,组织则受挫于「更易却不忠实」。第 7 章那张 2×2 表格的两端,如今都有了血肉。它们不是两种对策,而是同一种对策的两个失效方向。一个好的代理必须同时避开这两端,既忠实又更易;两者兼得极为罕见,而这一对策的全部技艺,几乎就在于做到这一点。第 11 章将正式把这两端联系起来。委托代理的那副骨架,也从第 6 章的一段代码,扩展成了这里的一个国家。

至此,第二部已在各个场景之中,以彼此交织的方式展示了这些对策。它们分散各处,名称各异,隐没在各自领域的术语之中。第三部将转换角度:把每一种对策从其所属的领域中抽离出来,剥除各自的术语,为之统一命名,使一个名称便能涵盖所有场景。由此得到的那张跨领域对照表,将是本书最主要的贡献。


参考文献

落足点:① 历史上科学家的判断 ② 理论上被研究过的东西 ③ 科学如何进展 ④ 如何在无法验证的世界里生活。本节经网络逐条核实。

  1. F. A. Hayek (1945).「The Use of Knowledge in Society」.《American Economic Review》, 35(4), 519-530. 链接 [②④] 哈耶克论证,社会运转所依赖的知识从不集中于一处,而是分散在无数个体手中,是关乎特定时间、特定地点的局部知识,无法被任何中心如实汇集。这篇文章是本章「分散的知识」一节的直接出发点,也奠定了「组织看不清自己」这一困境的认识论底色。
  2. M. Polanyi (1966).《The Tacit Dimension》. Doubleday. Google Books [②] 波兰尼提出知识的默会维度,其名言是「我们知道的,远多于我们说得出的」。本书用它来说明,分散在边缘的局部知识中有相当一部分根本无法被言说和上交,这是组织难以验证自身的更硬的一层底。
  3. J. C. Scott (1998).《Seeing Like a State: How Certain Schemes to Improve the Human Condition Have Failed》. Yale University Press. Google Books [②④] 斯科特提出「清晰性」这一概念:国家为了在社会上行动,会用地籍图、固定姓氏、统一度量衡等手段把社会改造成自己读得懂的样子,而这种简化往往抹掉维系系统运转的局部知识,导致科学营林那样的失败。本章「清晰性的冲动」一节正建基于此,它是理解组织为何要亲手削平复杂性的核心读物。
  4. C. A. E. Goodhart (1975).「Problems of Monetary Management: The U.K. Experience」.《Papers in Monetary Economics》, Vol. I. Reserve Bank of Australia. [②] 古德哈特原本谈的是货币政策,却给出了后来被普遍引用的洞见:一旦某个统计规律被当作政策调控的目标,它原有的规律性就会瓦解。这就是本章「代理指标与 Goodhart 崩塌」一节的命名来源,是理解代理被优化压力碾碎的起点。
  5. M. Strathern (1997).「Improving Ratings: Audit in the British University System」.《European Review》, 5(3), 305-321. doi:10.1002/(sici)1234-981x(199707)5:3<305::aid-euro184>3.0.co;2-4 [②④] 斯特拉森借英国大学审计的经验,给古德哈特定律留下了最精炼的一句通俗表述:当一个度量变成目标,它就不再是个好度量。本章直接引用了这句话,它也是把抽象的代理崩塌讲给读者听的最佳一句话。
  6. D. T. Campbell (1979).「Assessing the Impact of Planned Social Change」.《Evaluation and Program Planning》, 2(1), 67-90. doi:10.1016/0149-7189(79)90048-x [②④] 坎贝尔从社会科学评估的角度提出了与古德哈特同构的「坎贝尔定律」:一个量化的社会指标越是被用于社会决策,它就越容易遭受腐蚀压力,也越会扭曲它本要监测的社会过程。本章用它佐证代理崩塌并非经济学独有,而是跨学科反复被发现的同一现象。
  7. V. F. Ridgway (1956).「Dysfunctional Consequences of Performance Measurements」.《Administrative Science Quarterly》, 1(2), 240-247. doi:10.2307/2390989 [②④] 里奇韦很早就系统编目了绩效度量的失能后果,区分了单一度量、复合度量和多重度量各自带来的扭曲。本章用它说明,针对指标的博弈与扭曲是一个被发现得相当早的老问题,而非晚近才有的管理学新词。
  8. S. Kerr (1975).「On the Folly of Rewarding A, While Hoping for B」.《Academy of Management Journal》, 18(4), 769-783. doi:10.2307/255378 [②④] 克尔列举了大量现实例子,说明组织常常奖励一种行为,却指望得到另一种它没有奖励的行为,结果自然事与愿违。这篇文章把代理与激励的错配写成了管理学的常识,是本章「奖励 A 却指望 B」这一机制的经典出处。
  9. R. K. Merton (1936).「The Unanticipated Consequences of Purposive Social Action」.《American Sociological Review》, 1(6), 894-904. doi:10.2307/2084615 [②④] 默顿系统分析了有目的的社会行动为何总会带来未曾预料的后果,并梳理了无知、误判、价值偏好等成因。本章把它视为指标博弈、清晰性反噬等一系列「始料未及」现象的总源头。
  10. P. Smith (1995).「On the Unintended Consequences of Publishing Performance Data in the Public Sector」.《International Journal of Public Administration》, 18(2-3), 277-310. doi:10.1080/01900699508525011 [②④] 史密斯分类梳理了公共部门公开发布绩效数据所招致的一连串非预期后果,如隧道视野、近视、目标错位、衡量固化、博弈等。本章用它把笼统的「指标被扭曲」拆成可辨认的若干种具体失效方式。
  11. G. Bevan & C. Hood (2006).「What's Measured Is What Matters: Targets and Gaming in the English Public Health Care System」.《Public Administration》, 84(3), 517-538. doi:10.1111/j.1467-9299.2006.00600.x [②④] 贝文与胡德实证记录了英国国民医疗体系在「目标加恐吓」治理下针对指标的种种博弈,例如调度病人以压低等待时长这类应付指标却无助于真实健康的做法。本章以它为指标博弈在公共服务中如何具体发生的现场证据。
  12. W. N. Espeland & M. Sauder (2007).「Rankings and Reactivity: How Public Measures Recreate Social Worlds」.《American Journal of Sociology》, 113(1), 1-40. doi:10.1086/517897 [②④] 埃斯佩兰与索德尔以法学院排名为例,提出「反应性」(reactivity):公开的度量不只是描述世界,还会反过来重塑被度量者的行为,使指标最终测量的是它自己催生出来的反应。本章「更深的一层是反应性」一段正出自此,它把代理失效推进到指标制造现实这一层。
  13. M. Sauder & W. N. Espeland (2009).「The Discipline of Rankings: Tight Coupling and Organizational Change」.《American Sociological Review》, 74(1), 63-82. doi:10.1177/000312240907400104 [②④] 这篇姊妹篇借福柯的规训概念分析排名如何嵌入组织:原本松散耦合的机构在排名压力下被迫紧密耦合,外部度量内化为日常的自我监控与组织变革。它与前一条互补,前者讲反应性机制,本条讲排名怎样改造组织的内部结构。
  14. B. Holmström (1979).「Moral Hazard and Observability」.《The Bell Journal of Economics》, 10(1), 74-91. doi:10.2307/3003320 [②④] 霍尔姆斯特伦提出信息性原理:在道德风险下,最优报酬契约应当挂靠在对代理人努力有信息量的全部信号上。本章用它为「代理为何注定被扭曲」给出严格的委托代理解释,并引出当努力多维而只测得几维时的麻烦。
  15. B. Holmström & P. Milgrom (1991).「Multitask Principal-Agent Analyses: Incentive Contracts, Asset Ownership, and Job Design」.《The Journal of Law, Economics, and Organization》, 7(Special Issue), 24-52. doi:10.1093/jleo/7.special_issue.24 [②] 多任务委托代理模型说明,当一个人要同时兼顾可测与不可测的任务时,越是重奖可测的那部分,他就越会把努力从不可测的部分抽走。本章正是以此论证代理崩塌的机理:照可观测指标施压,会理性地诱使代理人放弃难以衡量却真正重要的工作。
  16. M. Landau (1969).「Redundancy, Rationality, and the Problem of Duplication and Overlap」.《Public Administration Review》, 29(4), 346-358. doi:10.2307/973247 [②④] 兰道为常被斥为浪费的「重复与重叠」正名:在零件都不完全可靠的系统里,冗余正是可靠性的来源,多个相互独立的核查比单一权威更难被同时骗过。本章「以审计与冗余为补充」一节直接采用这一论点,并强调它成立的前提是各核查彼此独立。
  17. C. Shore & S. Wright (1999).「Audit Culture and Anthropology: Neo-Liberalism in British Higher Education」.《The Journal of the Royal Anthropological Institute》, 5(4), 557-575. doi:10.2307/2661148 [②④] 肖尔与赖特以英国高等教育为例,提出「审计文化」:新自由主义治理下,问责与审计的逻辑渗透进学术机构,把同行变成被监控对象,重塑了人的自我治理方式。本章用它说明审计如何从工具异化为一种文化,让人耗在制造可供检查的痕迹上。
  18. J. Z. Muller (2018).《The Tyranny of Metrics》. Princeton University Press. doi:10.23943/9781400889433 [④] 穆勒面向一般读者,梳理了医疗、教育、警务、商业等领域过度依赖量化指标所带来的扭曲与代价,提出何时该用、何时不该用度量的判断。本书是把代理崩塌讲给实践者听的通俗综合之作,适合读者作为入门与对照。
  19. T. M. Porter (1995).《Trust in Numbers: The Pursuit of Objectivity in Science and Public Life》. Princeton University Press. doi:10.1515/9781400821617 [②④] 波特论证,对量化的依赖往往源于一种「机械的客观性」:在缺乏信任、需对外问责的处境下,数字被用作抑制个人判断、抵御质疑的工具。本书为理解组织为何执着于可读的数字提供了深层的社会学解释,与本章清晰性与审计两节互为背景。
  20. M. Power (1997).《The Audit Society: Rituals of Verification》. Oxford University Press. Google Books [②④] 鲍尔指出,当验证本身变成一套仪式,组织生产出来的往往是「一切尽在掌握」的表象,而非掌握本身,社会也随之为了可被审计而重塑自己。本章「以审计与冗余为补充」一节借它点破审计这一对策自带的病:留痕越多,真实工作越被挤到一边。
  21. O. O'Neill (2002).《A Question of Trust: The BBC Reith Lectures 2002》. Cambridge University Press. Google Books [④] 奥尼尔在这组里斯讲座中反思当代的问责文化:旨在重建信任的种种透明与审计措施,往往侵蚀了它们本想培育的信任,让人忙于应付检查而非把事做好。本章引它与「审计社会」并列,说明过度问责如何反噬。
  22. J. Soll (2014).《The Reckoning: Financial Accountability and the Rise and Fall of Nations》. Basic Books. Google Books [①④] 索尔以复式记账为线索,论证可核账目的能力与一个个国家的兴衰直接相关:算得清自己的,方能持久。本章用它支撑「留痕与审计」是人类最古老的验证链之一这一论断。
  23. J. G. March & H. A. Simon (1958).《Organizations》. John Wiley & Sons. Google Books [②] 马奇与西蒙奠定了现代组织理论:组织成员的理性是有限的,组织正是通过分工、程序与信息渠道来应对个体认知能力的局限。本书为「组织看不清自己」提供了基础框架,是理解信息如何在层级中流动与衰减的经典源头。
  24. H. A. Simon (1947).《Administrative Behavior: A Study of Decision-Making Processes in Administrative Organization》. Macmillan. Google Books [②] 西蒙提出有限理性,把组织理解为一套帮助成员在认知能力受限的条件下做出决策的结构。本书是理解组织为何必须依赖简化、惯例与代理来运转的源头,为本章组织自我认知的局限奠定了理论底盘。
  25. R. M. Cyert & J. G. March (1963).《A Behavioral Theory of the Firm》. Prentice-Hall. Google Books [②] 赛尔特与马奇提出企业的行为理论,强调组织决策受标准操作程序、有限搜索与各方目标协商支配,而非纯粹的最优化。本书有助于理解组织内部目标的多元与张力,是本章把组织看作有限理性主体的重要支撑。
  26. O. E. Williamson (1975).《Markets and Hierarchies: Analysis and Antitrust Implications》. Free Press. Google Books [②] 威廉森从交易成本出发,解释了为何有些活动由市场协调、有些则被纳入科层组织:有限理性与机会主义使得某些交易在层级内部完成更有效率。本书为组织为何要把分散的活动收编进自己内部、并因此承担起验证它们的难题提供了经济学解释。
  27. K. J. Arrow (1974).《The Limits of Organization》. W. W. Norton. Google Books [②④] 阿罗简练地探讨了组织作为应对信息匮乏与不确定性的手段,以及它在权威、责任与信任上遭遇的内在限度。本书指出信任是社会运转不可或缺却无法靠契约买到的润滑剂,与本章审计与冗余两节探讨的验证成本遥相呼应。
  28. M. Lipsky (1980).《Street-Level Bureaucracy: Dilemmas of the Individual in Public Services》. Russell Sage Foundation. Google Books [②④] 利普斯基指出,教师、警察、社工等一线官僚在资源不足的处境下行使大量自由裁量,他们的日常应对实际上塑造了公共政策的真实落地。本书是理解组织边缘的局部知识与裁量为何难以被中心观察和验证的重要参照。
  29. J. Q. Wilson (1989).《Bureaucracy: What Government Agencies Do and Why They Do It》. Basic Books. Google Books [②④] 威尔逊详细考察了政府机构的实际运作,区分了产出与结果均可观察与否的不同机构类型,并说明为何许多公共机构的真实成效难以衡量。本书为本章「组织看不见自己」提供了丰富的现实素材,尤其有助于理解为何代理指标在公共部门格外容易失真。
  30. G. C. Bowker & S. L. Star (1999).《Sorting Things Out: Classification and Its Consequences》. MIT Press. doi:10.7551/mitpress/6352.001.0001 [②④] 鲍克与斯塔尔考察了分类系统如何无声地嵌入基础设施,又如何塑造它本想中立记录的现实,被分类抹平的差异往往带来实际后果。本章把它与哈金、德罗西埃并列,归入「把社会变得可数」这部历史,说明分类是清晰性工程的隐形一环。
  31. A. Desrosières (1998).《The Politics of Large Numbers: A History of Statistical Reasoning》(trans. C. Naish). Harvard University Press. Google Books [②] 德罗西埃梳理了统计推理的历史,说明统计范畴与国家管理同步成形,数字既是认识社会的工具,也是构造社会现实的政治行为。本章把它纳入「把社会变得可数」的谱系,揭示清晰性背后那套统计装置的来历。
  32. I. Hacking (1990).《The Taming of Chance》. Cambridge University Press. doi:10.1017/cbo9780511819766 [②] 哈金考察了十九世纪统计与概率思想的兴起,论证大量收集人口数据如何「驯服偶然」,催生了「正常」与「常态」等支配现代治理的概念。本章引它说明,让社会变得可数本身就是一段重塑认知的历史,而非中性的记录。

用微信扫码打开

手机微信「扫一扫」打开本页,再点右上角分享给好友或朋友圈