Wisdom of Crowds: Galton's Ox — The 1906 Experiment That Proved Crowds Beat Experts
Decision Science

Wisdom of Crowds: Galton's Ox — The 1906 Experiment That Proved Crowds Beat Experts

AT
Argumentree Team
Decision Science
July 25, 2026
14 min 阅读
加尔顿的牛实验是人群智慧的创始示范。在1906年秋季,弗朗西斯·加尔顿在普利茅斯的西英格兰肥畜和家禽展览会上分析了一场重量判断比赛,参赛者支付六便士来估计一头活牛的屠宰重量。在大约800张卡片中,787张是清晰可读的;中位数猜测为1207磅,而实际重量为1198磅——误差约为0.8%——正如加尔顿后来在后续信件中承认的,平均值为1197磅,偏差一磅。加尔顿,一个对民主判断持怀疑态度的人,原本希望证明普通选民的无能;相反,他在《自然》杂志(1907)上发表了这一结果,称之为“民众之声”。该实验之所以有效,是因为独立、多样的错误在聚合时部分抵消——这一原则在康多塞陪审团定理(1785)中得到了形式化,由詹姆斯·苏罗维基的四个条件(多样性、独立性、分散化、聚合,2004)进行了编码,并在今天的预测市场和集成机器学习中得到了应用。当独立性因信息级联或社会影响而破裂时,人群的优势消失。在决策生命周期中,加尔顿的教训适用于聚合阶段:在讨论之前独立收集判断。Argumentree通过独立的异步论证提交、聚合成共识分数的多维评分以及记录的推理轨迹来实现这一点。
Share:
摘要

在1906年,弗朗西斯·加尔顿——一位杰出的统计学家和对民主判断持开放怀疑态度的人——分析了787个对牛的屠宰重量的猜测,原本希望证明人群是无望的。中位数猜测为1207磅。牛的实际重量为1198磅。人群超越了专家,集体判断的科学由此诞生。

  • 实验设置:在普利茅斯的牲畜博览会上进行的六便士重量判断比赛;约800张卡片,787张有效
  • 结果:中位数1207磅与实际1198磅——误差约为0.8%;稍后注意到的平均值为1197磅
  • 为什么有效:独立、多样的错误在聚合时部分抵消
  • 陷阱:打破独立性——让人们相互模仿——魔法就会逆转
  • 遗产:预测市场、集成机器学习和结构化小组决策都源于这个下午

想要证明人群愚蠢的科学家

集体智慧中最著名实验的最佳部分在于,它的设计——至少在精神上——是为了证明与其发现的相反的结果。

到1906年,弗朗西斯·加尔顿是英国最杰出的科学家之一。作为查尔斯·达尔文的表亲,他开创了相关性和回归到均值的统计概念,发明了天气图,并将指纹识别建立在科学基础上。他还——这对故事很重要——对普通人的判断深感怀疑。加尔顿认为智力集中在一个小的遗传精英中;他创造了“优生学”这个术语,并花费数十年推广它,这一遗产今天受到正当谴责,并与他对这个问题的处理方式密不可分。当他将统计工具应用于人群时,他原本希望记录下人群的无能。

因此,当84岁的加尔顿在1906年秋季漫步于普利茅斯的西英格兰肥畜和家禽展览会,遇到一个重量判断比赛时,他看到了一个不可抗拒的数据集。这里有一个人群——一些是专家,大多数不是——对一个事实问题做出数百个独立的数值判断,支付小额入场费以保持诚实,并有奖品激励他们。正如他后来在《自然》杂志中所写,平均竞争者可能与普通选民在判断大多数政治问题的优劣时一样适合判断这头牛。与民主的类比正是整个要点。加尔顿期待民众之声——人民的声音——会让自己感到尴尬。

一个乡村集市、一头肥牛和787张六便士票

比赛的机制很简单,且——正如我们现在所知——意外地接近理想的实验设计。一头活牛被展示出来。任何人都可以花六便士购买一张盖章和编号的卡片,在上面写下他们的姓名和地址,并记录他们对牛屠宰后重量的估计——这个商业上有意义的数字,比动物的活重更难。最准确的猜测赢得奖品。

这个设置的三个特征值得关注,因为每一个特征都与后来的研究显示的集体准确性所必需的条件相对应。首先,六便士的费用过滤掉了纯粹的恶作剧者——人们在其中有利益。其次,每张卡片都是私下填写的:没有举手表决,没有拍卖师叫出正在进行的共识,没有可见的领先者可供模仿。判断是独立的。第三,人群是真正混合的:拥有专业知识的屠夫和农民与那些在加尔顿看来受当时情绪影响的职员和家庭并肩而立。判断是多样的

比赛结束后,加尔顿借用了这些卡片。在大约800张中,有13张是模糊不清或其他缺陷,留下了787个有效估计。他对它们进行了分类、制表、绘制分布图,并计算其分位数——一项完整的统计工作,发表于1907年3月7日的《自然》杂志,标题为“民众之声”(加尔顿,F.,《自然》,75,450–451)。

让他感到惊讶的结果

中间的估计——我们现在称之为中位数——是1207磅。牛屠宰后重量为1198磅。人群的集体判断偏差了九磅:约0.8%的误差,比在场的牛肉专家的估计更接近。

加尔顿——作为科学家的真实功劳——直接报告了结果。“我认为这个结果比预期的更能证明民主判断的可信度,”他写道。来自一个花费职业生涯争论良好判断是稀有遗传天赋的人,这句话是一个安静的科学让步:数据超越了他的先前观点。

在随后的信件中,故事变得更好。《自然》的读者写信来,在他的回复中(“投票箱”,自然,75,509),加尔顿承认所有787个猜测的算术平均值1197磅——比真实重量少一磅。一个世纪后,经济计量学家肯尼斯·沃利斯(“重访弗朗西斯·加尔顿的预测比赛”,2014)回顾了原始数据和相关交流,确认了詹姆斯·苏罗维基所使名声显赫的故事的要点。平均值的偏差一磅是今天通常引用的版本;中位数的偏差九磅是加尔顿实际上首先提到的。两者都令人惊讶。

中位数还是平均数?加尔顿的统计选择仍然重要

加尔顿为什么更喜欢中间的估计?他的推理是明确的政治性的:中位数是人群中大多数人会在投票中认可的值。每个其他值都会被认为过高或过低的人所否决。换句话说,中位数是人群的民主裁决——这正是他设定要测试的关于民众之声的问题。

但在政治论证中隐藏着一个统计论证,今天仍在教授。中位数是一个稳健的统计量:少数荒谬的猜测——有人为了好玩写下10000磅——几乎不会影响它,而平均值则可能被单个异常值任意拉远。另一方面,平均值使用了数据中的更多信息,并且当错误大致对称且独立时,更有效地抵消它们。加尔顿的人群表现得足够好,以至于两者都有效:中位数偏差9磅,平均值偏差1磅。在更混乱的人群中——在线投票、无调节的论坛——中位数的稳健性往往胜出。选择你的聚合机制就是一个关于你信任人群尾部的决策。

为什么平均有效:错误抵消的算术

加尔顿的结果没有神秘性。每个猜测可以被视为真实值加上一个错误。如果错误是独立的,并且在真实值的两侧分散——一些屠夫高估,一些低估——那么将猜测相加会抵消大部分错误,同时共享信号累积。错误越多样且独立,抵消的效果越明显。

斯科特·佩奇后来将这一直觉形式化为多样性预测定理(佩奇,差异,2007):对于平方误差,集体的误差等于平均个体误差减去预测的多样性。这是一个数学恒等式,而不是一个经验性主张——这使得它非常有用。人群超越其平均成员的程度正好等于其成员之间的分歧程度。多样性不是可有可无的;从算术上讲,它是整个优势。一个克隆人群从聚合中得不到任何好处。

同样的逻辑在加尔顿之前一个多世纪就被发现,针对的是是/否问题而不是数量。康多塞侯爵在1785年证明,如果每位选民比随机情况稍微更有可能是正确的,并且选民独立判断,随着群体的增长,绝大多数正确的概率会接近确定性。我们在关于康多塞陪审团定理的配套文章中讲述这个故事——以及当其假设破裂时定理失败的戏剧性方式。

从脚注到框架:苏罗维基的四个条件

在20世纪的大部分时间里,加尔顿的牛只是一个统计好奇心。2004年,詹姆斯·苏罗维基以普利茅斯的故事开启了人群的智慧,并汇集了一个世纪的证据——从股票市场到搜索引擎——证明人群可以系统性地聪明。至关重要的是,苏罗维基并没有声称人群总是明智。他确定了加尔顿的集市意外满足的四个条件,以及任何明智人群所需的条件:

观点多样性

每个人都带来一些私人信息或不同的解读方式。屠夫、农民和随意的集市游客对牛的看法各不相同——他们的不同错误部分抵消。

独立性

每张票都是私下填写的,没有举手表决或大声的专家在场。没有人可以模仿领先者,因为没有可见的领先者。

分散化

没有委员会决定“官方”估计应该是什么。每个参与者都依赖自己的地方知识——多年的判断牛只,或者仅仅是一个好的眼光。

聚合

一个机制将787个私人判断转化为一个集体答案。如果没有一堆票和愿意统计它们的人,智慧就会被困在个人的头脑中。

去掉任何一个条件,人群不仅失去优势——它可能变得比其成员更糟,因为聚合会放大共享偏见,而不是抵消独立错误。有关四个条件及其失败模式的完整科学,请参见我们关于人群智慧的指南。

细则:集市正确的地方与会议错误的地方

对于任何组织会议的人来说,这里有一个不舒服的问题:你们组织中的多少集体决策是像加尔顿的集市那样结构化的——而有多少是完全相反的结构?

在集市上,每个判断都是私下书面提交的,在任何人看到其他人的数字之前。在典型的会议中,最资深或最自信的人首先发言,随后的每个“估计”都以他们的为锚。看似三十个人达成一致,实际上往往是一个人的猜测与二十九个回声。经济学家称这种机制为信息级联:一旦一些早期意见可见,每个后续的人就会理性地折扣自己的信息并模仿——而人群的独立性,整个现象的支撑条件,悄然崩溃(比克昌达尼、赫希莱弗和韦尔奇,1992)。我们在关于信息级联的指南中涵盖了这些机制。

这也是为什么加尔顿实验的重复有时令人失望:如果用可见的运行平均值进行牛猜测游戏,或者让参与者大声喊出他们的猜测,准确性就会下降。魔法从来不在于人群——而在于协议。六便士、一张私人卡片和一个锁定的投票箱被证明是比大多数会议室更好的决策架构。

现代牛的后代

加尔顿记录的聚合原则现在贯穿于一系列现代系统:

预测市场

成立于1988年的爱荷华电子市场,将交易者的信念聚合成价格。伯格、纳尔逊和里茨(2008)将市场与1988-2004年总统选举的964项全国民调进行了比较:市场在74%的情况下更接近结果。

集成机器学习

随机森林和其他集成方法是加尔顿的牛在硅中的体现:许多不完美、部分独立的模型通过投票或平均聚合成比任何单一模型更准确的预测。

预测平均

结合预测——无论是来自经济学家、天气模型还是选举预测者——通常超越大多数个体预测,正是加尔顿偶然发现的错误抵消原因。

估计练习

这个实验很容易复制:要求一组人独立书面估计一个数量,然后聚合。课堂和研讨会的重复仍然是统计聚合的标准示范。

每个后代聚合的内容不同——市场将信念聚合成价格,集成将模型输出聚合成预测,投票系统将偏好聚合成结果——每个都继承了相同的依赖性:聚合的质量取决于其输入的独立性和多样性。这种家族相似性是整个研究传统的主线,从康多塞的1785年定理到麻省理工学院集体智慧中心今天的集体智能研究——这是我们在集体智能:240年的研究中追溯的240年弧线。

加尔顿的牛对你的团队意味着什么

1906年实验的实际转化是一个简短的检查清单,它适用于决策生命周期中的一个特定时刻——在你收集和结合判断的时刻,在小组开始讨论之前:

  • 首先独立书面收集估计。 在会议之前,在资深人士发言之前。判断一旦变得可见,独立性——以及人群的统计优势——就开始衰减。
  • 积极招募多样的观点。 多样性预测定理是明确的:你对平均成员的集体优势就是你的多样性。一个背景和信息相同的人的小组只是一个穿着多个名牌的猜测。
  • 故意选择你的聚合机制。 对于混乱的人群使用中位数,对于表现良好的人群使用平均数,当判断具有多个维度时使用结构化评分。“我们讨论过并达成共识”不是聚合机制——它通常是一个锚定机制。
  • 保留理由,而不仅仅是数字。 加尔顿的卡片告诉他人群认为什么,而从未告诉他为什么。对于一头牛来说,这很好。对于战略决策来说,推理是当情况变化时你需要的部分。

最后一点是现代协作决策超越加尔顿的地方。Argumentree旨在为团队提供带有推理的集市协议:参与者独立且异步地贡献论点——在房间达成共识之前——形成一个结构化的支持/反对树;然后小组在明确的维度(有用性、清晰度、准确性、完整性)上对每个论点进行评分,这些评分聚合成共识分数,就像787张卡片聚合成1207磅一样。匿名贡献选项保护独立性免受等级制度的影响,而完整的审计轨迹保留了牛比赛从未能做到的事情:数字背后的原因

加尔顿去集市是为了证明普通判断不可信。他离开时却带走了迄今为止任何人所提供的最有力证据——如果正确聚合,它是可信的。工具已经从投票箱变成了软件。教训没有改变。

常见问题

什么是高尔顿的牛实验?

在1906年秋季,统计学家弗朗西斯·高尔顿分析了在普利茅斯的西英格兰肥畜和家禽展览会上进行的一个重量判断比赛。参展者支付六便士来猜测一头活牛在被“屠宰和处理”后重量。高尔顿收集了卡片——787张是清晰有效的——发现中位数猜测为1,207磅,而实际处理后的重量为1,198磅:误差约为0.8%,并且比在场的牛专家的估计更准确。他在1907年3月的《自然》杂志上发表了这项分析,标题为《民意之声》。

为什么高尔顿的牛实验重要?

这是群体智慧的基础实证证明:在适当的条件下,许多独立、不完美判断的总和可以比个别专家的判断更准确。结果让高尔顿本人感到惊讶,他原本期望证明普通选民的无能。詹姆斯·苏罗维基在他的2004年书籍《群体的智慧》中以这个故事开篇,而其背后的统计数据现在推动着预测市场和集成机器学习。

高尔顿使用的是均值还是中位数?

在原始的《自然》文章中,高尔顿报告了“中间估计”——中位数——为1,207磅,认为这是民主公平的选择,因为一半的人认为答案更高,另一半认为更低。在后续的通信中,他承认猜测的算术均值为1,197磅——仅比真实的1,198磅少一磅。这一交流是关于稳健统计的早期争论:中位数抵抗极端离群值的扭曲,而均值在误差大致对称时提取更多信息。

群体需要什么条件才能智慧?

詹姆斯·苏罗维基(2004)确定了四个条件:意见多样性(人们持有不同的信息和解释)、独立性(判断是在不抄袭他人的情况下形成的)、分散化(人们依靠自己的地方知识)和聚合(一个机制将私人判断结合成集体答案)。高尔顿的比赛满足了这四个条件——这正是它成功的原因。去掉任何一个,群体的优势就会减弱或逆转。

群体何时会失败?

当独立性崩溃时,群体就会失败——当人们可以看到并复制彼此的答案时,早期的猜测在群体中传播,错误变得相关,聚合结果趋向于第一个大声说话者所说的内容。信息级联、群体思维和回音室都是这种失败的表现。对团队的教训是:在任何人公开讨论之前,独立并书面收集判断。

群体智慧与多数投票是一样的吗?

它们是相关的,但并不相同。高尔顿的牛实验涉及聚合数值估计,其中平均值可以抵消错误。关于是/否问题的多数投票受康多塞陪审团定理(1785)的支配,该定理表明,随着群体规模的增长,多数变得显著更可靠——前提是每位选民的判断优于随机,并且独立投票。两者都是聚合机制;投票聚合离散选择,而平均值聚合数量。

AT

Argumentree Team

Decision Science

The Argumentree team explores the science of better decisions—from 18th-century mathematics to modern AI.

给你的团队提供集市协议。

Argumentree独立收集判断,将其聚合成共识分数,并将推理记录在案——这些条件使加尔顿的人群变得聪明,融入你的决策中。

开始免费14天试用 →

相关文章