1906년, 프랜시스 갈톤 — 뛰어난 통계학자이자 민주적 판단에 대한 공개적인 회의론자 — 은 소의 도축된 무게에 대한 787개의 추정을 분석하며 군중이 절망적이라는 것을 입증할 것으로 예상했습니다. 중앙값 추정치는 1,207 lb였고, 소의 실제 무게는 1,198 lb였습니다. 군중이 전문가를 이겼고, 집단 판단의 과학이 태어났습니다.
- 설정: 플리머스 가축 박람회에서의 6펜스 무게 추정 대회; ~800장 카드, 787장 유효
- 결과: 중앙값 1,207 lb vs. 실제 1,198 lb — ~0.8% 이내; 나중에 언급된 평균은 1,197 lb였습니다.
- 작동하는 이유: 독립적이고 다양한 오류가 집합될 때 부분적으로 상쇄됩니다.
- 함정: 독립성을 깨뜨리면 — 사람들이 서로를 복사하게 되면 — 마법이 역전됩니다.
- 유산: 예측 시장, 앙상블 기계 학습, 구조화된 그룹 의사 결정은 모두 이 오후에서 유래합니다.
군중이 어리석다는 것을 입증하고 싶었던 과학자
집단 지성에서 가장 유명한 실험의 가장 좋은 부분은 그것이 발견한 것의 정반대를 입증하기 위해 설계되었다는 것입니다.
1906년까지 프랜시스 갈톤은 영국에서 가장 뛰어난 과학자 중 한 명이었습니다. 찰스 다윈의 사촌인 그는 상관관계와 평균 회귀라는 통계 개념을 개척하고, 기상도를 발명하며, 지문 식별을 과학적 기반 위에 놓았습니다. 그는 또한 — 이 이야기에 중요합니다 — 일반 사람들의 판단에 대해 깊은 회의적이었습니다. 갈톤은 지능이 소수의 유전적 엘리트에 집중되어 있다고 믿었고, '유전학'이라는 용어를 만들고 수십 년 동안 이를 홍보했습니다. 이는 오늘날 정당하게 비난받는 유산이며, 그가 이 질문에 접근한 방식과 불가분의 관계에 있습니다. 그는 군중에 그의 통계 도구를 적용했을 때 그 무능함을 문서화할 것으로 예상했습니다.
그래서 84세의 갈톤이 1906년 가을 플리머스의 서부 잉글랜드 비육 및 가금류 전시회에서 무게 추정 대회를 발견했을 때, 그는 저항할 수 없는 데이터 세트를 보았습니다. 여기에는 전문가도 있고, 대부분은 아닌 군중이 사실에 대한 수백 개의 독립적인 수치 판단을 하고 있었습니다. 소액의 참가비가 그들을 정직하게 유지하고, 상이 그들을 동기부여했습니다. 그는 나중에 Nature에 쓴 것처럼, 평균 경쟁자는 평균 유권자가 그가 투표하는 대부분의 정치적 문제의 장점을 판단하는 것만큼 소를 판단하는 데 적합했을 것입니다. 민주주의에 대한 비유가 전체 요점이었습니다. 갈톤은 vox populi — 즉, 사람들의 목소리 — 가 스스로를 부끄럽게 할 것으로 예상했습니다.
시골 박람회, 뚱뚱한 소, 그리고 787장의 6펜스 티켓
대회의 메커니즘은 간단했으며 — 우리가 지금 아는 바와 같이 — 우연히 이상적인 실험 설계에 가깝습니다. 살아있는 소가 전시되었습니다. 6펜스를 내면 누구나 스탬프가 찍힌 번호가 매겨진 카드를 구매하고, 자신의 이름과 주소를 적고, 소가 도축되고 드레싱된 후 무게를 추정한 값을 기록할 수 있었습니다 — 상업적으로 의미 있는 수치이며, 동물의 생체 무게보다 더 어려운 질문입니다. 가장 정확한 추정이 상을 받았습니다.
이 설정의 세 가지 특징은 주목할 만합니다. 각 특징은 나중에 연구에서 집단 정확성에 필수적임이 입증된 조건에 해당합니다. 첫째, 6펜스의 수수료는 순수한 실용 농담꾼을 걸러냈습니다 — 사람들은 게임에 참여했습니다. 둘째, 각 카드는 비공식적으로 작성되었습니다: 손을 들거나 경매인이 진행 중인 합의를 부르는 것이 없었고, 복사할 수 있는 눈에 보이는 선두주자가 없었습니다. 판단은 독립적이었습니다. 셋째, 군중은 진정으로 혼합되어 있었습니다: 전문 지식을 가진 정육점 주인과 농부들이 갈톤의 말처럼 순간의 환상에 이끌린 사무원과 가족들과 나란히 서 있었습니다. 판단은 다양했습니다.
대회가 끝난 후, 갈톤은 카드를 빌렸습니다. 약 800장 중 13장은 읽을 수 없거나 결함이 있어 787장의 유효한 추정치가 남았습니다. 그는 그것들을 정리하고, 표로 만들고, 분포를 플로팅하고, 분위수를 계산했습니다 — Nature에 1907년 3월 7일 “Vox Populi”라는 제목으로 발표된 완전한 통계 작업입니다 (갈톤, F., Nature, 75, 450–451).
그를 놀라게 한 결과
가장 중앙의 추정치 — 우리가 지금 중앙값이라고 부르는 것 — 는 1,207파운드였습니다. 도축되고 드레싱된 소는 1,198파운드였습니다. 군중의 집단적 판단은 9파운드 차이가 났습니다: 약 0.8%의 오류로, 참석한 소 전문가들의 추정치보다 더 가까웠습니다.
갈톤은 — 과학자로서의 진정한 신용을 위해 — 결과를 그대로 보고했습니다. “이 결과는 민주적 판단의 신뢰성에 대해 예상했던 것보다 더 신뢰할 수 있다고 생각합니다.”라고 그는 썼습니다. 신뢰할 수 있는 판단이 드문 유전적 재능이라고 주장하며 경력을 보낸 사람의 입장에서 이 문장은 조용한 과학적 양보입니다: 데이터가 그의 이전 주장을 이겼습니다.
이야기는 후속 서신에서 더 나아졌습니다. Nature 독자들이 편지를 보내왔고, 그의 답변에서 (“투표함,” Nature, 75, 509) 갈톤은 787개의 추정치의 산술 평균이 1,197파운드였으며 — 실제 무게에서 1파운드 차이가 났다고 인정했습니다. 한 세기 후, 경제학자 케네스 월리스 (“프랜시스 갈톤의 예측 대회를 다시 방문하다,” 2014)는 원래 데이터와 주변 교환을 다시 검토하여 제임스 수로위키가 유명하게 만든 이야기의 본질을 확인했습니다. 평균의 1파운드 차이는 오늘날 일반적으로 인용되는 버전입니다; 중앙값의 9파운드 차이는 갈톤이 실제로 처음으로 언급한 것입니다. 두 가지 모두 놀랍습니다.
중앙값 또는 평균? 갈톤의 통계적 선택은 여전히 중요합니다.
왜 갈톤은 가장 중앙의 추정치를 선호했을까요? 그의 추론은 명백히 정치적이었습니다: 중앙값은 군중의 대다수가 투표에서 비준할 가치입니다. 다른 모든 값은 너무 높거나 낮다고 생각하는 사람들에 의해 반대 투표를 받습니다. 다시 말해, 중앙값은 군중의 민주적 판단입니다 — 이는 그가 시험하고자 했던 vox populi에 대한 질문이었습니다.
하지만 정치적 주장 안에는 통계적 주장이 숨겨져 있으며, 오늘날에도 여전히 가르쳐집니다. 중앙값은 강건한 통계입니다: 몇 개의 터무니없는 추정 — 누군가가 웃기려고 10,000파운드를 적는 경우 — 는 거의 영향을 미치지 않지만, 평균은 단일 이상치에 의해 임의로 멀리 끌려갈 수 있습니다. 반면 평균은 데이터의 정보를 더 많이 사용하고, 오류가 대략 대칭적이고 독립적일 때 더 효율적으로 상쇄합니다. 갈톤의 군중은 충분히 잘 행동하여 두 가지 모두 작동했습니다: 중앙값은 9 lb, 평균은 1 lb 차이가 났습니다. 더 혼란스러운 군중 — 온라인 여론 조사, 비조정 포럼 — 에서는 중앙값의 강건성이 종종 승리합니다. 집합 메커니즘을 선택하는 것은 군중의 꼬리 부분을 얼마나 신뢰하는지에 대한 결정입니다.
왜 평균이 작동하는가: 오류 상쇄의 산술
갈톤의 결과에는 신비가 없습니다. 각 추정치는 진짜 값에 오류를 더한 것으로 생각할 수 있습니다. 오류가 독립적이고 진실의 양쪽에 흩어져 있다면 — 일부 정육점 주인은 과대 추정하고, 일부는 과소 추정합니다 — 추정치를 더하면 오류의 대부분이 상쇄되고 공유 신호가 축적됩니다. 오류가 다양하고 독립적일수록 더 공격적으로 상쇄됩니다.
스콧 페이지는 나중에 이 직관을 다양성 예측 정리 (페이지, 차이, 2007)로 공식화했습니다: 제곱 오류의 경우, 집단의 오류는 평균 개별 오류 에서 예측의 다양성을 뺀 것과 같습니다. 이는 수학적 정체성이지 경험적 주장이 아닙니다 — 그래서 유용합니다. 군중은 평균 구성원보다 정확히 그만큼 더 많은 의견 차이를 가집니다. 다양성은 선택 사항이 아닙니다; 산술적으로 전체 이점입니다. 복제의 군중은 집합에서 아무것도 얻지 못합니다.
같은 논리는 갈톤보다 한 세기 전에 수량이 아닌 예/아니오 질문에 대해 발견되었습니다. 콩도르세 후작은 1785년에 각 유권자가 약간이라도 정답일 가능성이 높고, 유권자가 독립적으로 판단할 경우, 다수가 정답일 확률이 그룹이 커짐에 따라 확실성에 가까워진다고 증명했습니다. 우리는 그 이야기를 — 그리고 정리가 실패할 때의 극적인 방법 — 콩도르세 배심원 정리에 대한 동반 기사에서 다룹니다.
각주에서 프레임워크로: 수로위키의 네 가지 조건
20세기 대부분 동안 갈톤의 소는 통계적 호기심이었습니다. 이는 2004년 제임스 수로위키가 플리머스 이야기를 시작으로 군중의 지혜를 열고, 주식 시장에서 검색 엔진에 이르기까지 군중이 체계적으로 똑똑할 수 있다는 증거의 세기를 모으면서 바뀌었습니다. 결정적으로, 수로위키는 군중이 항상 지혜롭다고 주장하지 않았습니다. 그는 갈톤의 박람회가 우연히 충족한 네 가지 조건과 어떤 지혜로운 군중이 의도적으로 필요로 하는 조건을 확인했습니다:
의견의 다양성
각 사람은 개인적인 정보나 질문을 해석하는 다른 방식을 가지고 있습니다. 정육점 주인, 농부, 그리고 일반 관람객들은 모두 소를 다르게 읽습니다 — 그리고 그들의 서로 다른 오류는 부분적으로 상쇄됩니다.
독립
각 티켓은 손을 들거나 큰 소리로 방을 이끌 전문가 없이 개인적으로 작성되었습니다. 눈에 보이는 선두주자가 없었기 때문에 아무도 선두주자를 따라 할 수 없었습니다.
탈중앙화
어떤 위원회도 "공식" 추정치가 무엇이어야 하는지 결정하지 않았습니다. 모든 참가자는 자신의 지역 지식 — 수년간의 소 심사 경험이나 단순히 좋은 안목 — 에 의존했습니다.
집계
메커니즘이 787개의 개인적인 판단을 하나의 집합적인 답변으로 바꾸었습니다. 티켓 더미와 이를 집계할 의향이 있는 사람이 없으면, 지혜는 개인의 머릿속에 갇혀 있습니다.
어떤 하나의 조건을 제거하면 군중은 단순히 우위를 잃는 것이 아니라 — 집합화가 독립적인 오류를 상쇄하는 대신 공유된 편향을 증폭시킬 수 있기 때문에 — 그 구성원보다 더 나빠질 수 있습니다. 네 가지 조건과 그 실패 모드에 대한 전체 과학은 군중의 지혜에 대한 가이드를 참조하십시오.
세부 사항: 박람회가 회의에서 잘못된 점
회의를 운영하는 모든 사람에게 불편한 질문이 있습니다: 귀하의 조직에서 얼마나 많은 그룹 결정이 갈톤의 박람회처럼 구조화되어 있으며, 얼마나 많은 결정이 정반대처럼 구조화되어 있습니까?
박람회에서는 모든 판단이 비공식적으로, 서면으로, 다른 사람의 숫자를 보기 전에 기록되었습니다. 일반적인 회의에서는 가장 고위직이거나 가장 자신감 있는 사람이 먼저 발언하고, 이후의 모든 “추정”은 그들의 발언에 고정됩니다. 30명이 동의하는 것처럼 보이는 것은 종종 한 사람의 추정치에 29개의 메아리입니다. 경제학자들은 이 메커니즘을 정보의 연쇄라고 부릅니다: 몇 개의 초기 의견이 보이게 되면, 각 후속 개인이 자신의 정보를 할인하고 복사하는 것이 개인적으로 합리적이 됩니다 — 그리고 군중의 독립성, 전체 현상의 하중을 지탱하는 조건이 조용히 무너집니다 (Bikhchandani, Hirshleifer & Welch, 1992). 우리는 정보의 연쇄에 대한 가이드에서 메커니즘을 다룹니다.
이것이 갈톤의 실험 복제가 때때로 실망스러운 이유이기도 합니다: 가시적인 평균을 가지고 소 추정 게임을 진행하거나 참가자들이 추정치를 외치게 하면 정확도가 떨어집니다. 마법은 결코 군중에 있지 않았습니다 — 그것은 프로토콜에 있었습니다. 6펜스, 비공식 카드, 잠긴 투표함은 대부분의 회의실보다 더 나은 의사 결정 구조로 판명되었습니다.
소의 현대적 후손들
갈톤이 문서화한 집합 원리는 이제 놀라운 범위의 현대 시스템을 관통하고 있습니다:
예측 시장
아이오와 전자 시장은 1988년에 설립되어 거래자들의 신념을 가격으로 집계합니다. Berg, Nelson 및 Rietz (2008)는 1988-2004년 대통령 선거 동안 964개의 전국 여론조사와 시장을 비교했습니다: 시장은 74%의 경우 결과에 더 가까웠습니다.
앙상블 기계 학습
랜덤 포레스트와 기타 앙상블 방법은 실리콘에서의 갈턴의 황소입니다: 많은 불완전하고 부분적으로 독립적인 모델들이 투표나 평균을 통해 집계되어 어떤 단일 모델보다 더 정확한 예측을 만들어냅니다.
예측 평균화
예측을 결합하는 것은 — 경제학자, 기상 모델 또는 선거 예측자들로부터의 예측을 포함하여 — 갈턴이 우연히 발견한 오류 상쇄 이유로 인해 대부분의 개별 예측보다 일관되게 더 나은 결과를 낳습니다.
추정 연습
실험은 복제하기 쉽습니다: 그룹에게 독립적으로 그리고 서면으로 양을 추정하도록 요청한 다음 집계합니다. 교실 및 워크숍 복제는 통계적 집계의 표준 시연으로 남아 있습니다.
각 후손은 다른 것을 집계합니다 — 시장은 신념을 가격으로 집계하고, 앙상블은 모델 출력을 예측으로 집계하며, 투표 시스템은 선호를 결과로 집계합니다 — 그리고 각 후손은 동일한 의존성을 상속합니다: 집합은 그것을 공급하는 것의 독립성과 다양성만큼 좋습니다. 그 가족의 유사성은 콩도르세의 1785년 정리에서 MIT의 집단 지성 연구까지의 전체 연구 전통의 관통선입니다 — 우리는 집단 지성: 240년의 연구에서 이 240년의 궤적을 추적합니다.
갈톤의 소가 귀하의 팀에 의미하는 것
1906년 실험의 실용적인 번역은 짧은 체크리스트이며, 이는 결정의 생애에서 특정 시점 — 판단을 수집하고 결합하는 순간 — 에 적용됩니다: 그룹이 심의하기 시작하기 전에:
- 먼저 독립적으로 서면으로 견적을 수집하십시오. 회의 전에, 고위 인사가 발언하기 전에. 판단이 드러나는 순간, 독립성과 군중의 통계적 이점이 사라지기 시작합니다.
- 다양한 관점을 적극적으로 모집하세요. 다양성 예측 정리는 간단합니다: 당신의 평균 구성원에 대한 집단적 이점 은 당신의 다양성입니다. 같은 배경과 같은 정보를 가진 사람들로 구성된 패널은 여러 이름 태그를 단 하나의 추측입니다.
- 집합 메커니즘을 신중하게 선택하세요. 혼란스러운 군중에는 중앙값, 잘 행동하는 군중에는 평균, 판단에 여러 차원이 있을 때는 구조화된 평가를 사용하세요. “우리는 논의했고 합의에 도달했습니다”는 집합 메커니즘이 아닙니다 — 보통은 기준 설정 메커니즘입니다.
- 숫자뿐만 아니라 이유를 유지하세요. 갈턴의 카드들은 그에게 군중이 무엇을 생각하는지 알려주었지만, 왜 그런지는 알려주지 않았습니다. 소에게는 괜찮습니다. 전략적 결정에는 상황이 변할 때 필요한 부분이 바로 그 이유입니다.
마지막 포인트는 현대의 협업 의사 결정이 갈톤을 넘어서는 지점입니다. Argumentree는 팀에 추론이 첨부된 박람회 프로토콜을 제공하도록 구축되었습니다: 참가자들은 독립적이고 비동기적으로 주장을 기여합니다 — 방이 수렴하기 전에 — 구조화된 찬반 트리로; 그룹은 각 주장을 명시적인 차원(유용성, 명확성, 정확성, 완전성)에서 평가하고, 평가 결과는 787장의 카드가 1,207파운드로 집계된 방식으로 합의 점수로 집계됩니다. 익명 기여 옵션은 계층으로부터 독립성을 보호하고, 전체 감사 경로는 소 대회가 결코 할 수 없었던 것을 보존합니다: 숫자 뒤에 있는 이유입니다.
갈톤은 일반적인 판단이 신뢰할 수 없다는 것을 입증하기 위해 박람회에 갔습니다. 그는 집계가 올바르게 이루어질 경우 신뢰할 수 있다는 가장 강력한 증거를 가지고 떠났습니다. 도구는 투표함에서 소프트웨어로 바뀌었습니다. 교훈은 변하지 않았습니다.
자주 묻는 질문
갈턴의 소 실험은 무엇이었나요?
1906년 가을, 통계학자 프랜시스 골턴은 플리머스에서 열린 서부 잉글랜드 비육 및 가금류 전시회에서 체중 추정 대회를 분석했습니다. 박람회 방문객들은 "도살되고 손질된" 후의 살아있는 소의 체중을 추측하기 위해 6펜스를 지불했습니다. 골턴은 카드를 수집했으며 — 787장이 읽을 수 있고 유효했습니다 — 중간 추정치는 1,207파운드였고 실제 손질된 체중은 1,198파운드였습니다: 약 0.8% 이내로, 참석한 소 전문가들의 추정치보다 더 정확했습니다. 그는 이 분석을 1907년 3월 네이처에 "Vox Populi"로 발표했습니다.
갈턴의 소 실험이 중요한 이유는 무엇인가요?
군중의 지혜에 대한 창립적인 경험적 증거입니다: 적절한 조건 하에서, 많은 독립적이고 불완전한 판단의 집합이 개별 전문가의 판단보다 더 정확할 수 있습니다. 그 결과는 갈턴 자신을 놀라게 했으며, 그는 평균 유권자의 무능함을 입증할 것으로 예상했습니다. 제임스 수로위키는 2004년 저서 《군중의 지혜》를 이 이야기로 시작했으며, 그 기초 통계는 현재 예측 시장과 앙상블 기계 학습을 지원하고 있습니다.
갈턴은 평균을 사용했나요, 아니면 중앙값을 사용했나요?
원래의 Nature 기사에서 Galton은 1,207 lb의 "가장 중간 추정치" — 중앙값 — 를 보고하며, 이는 군중의 절반이 답이 더 높다고 생각하고 절반이 더 낮다고 생각했기 때문에 민주적으로 공정한 선택이라고 주장했습니다. 후속 서신에서 그는 추정치의 산술 평균이 1,197 lb임을 인정했으며, 이는 실제 1,198 lb에서 단 1파운드 차이입니다. 이 교환은 강건 통계에 대한 초기 논쟁입니다: 중앙값은 극단적인 이상치에 의해 왜곡되는 것을 저항하는 반면, 평균은 오류가 대략 대칭적일 때 더 많은 정보를 추출합니다.
군중이 지혜로워지기 위해서는 어떤 조건이 필요합니까?
제임스 수로위키(2004)는 네 가지를 확인했습니다: 의견의 다양성(사람들이 서로 다른 정보와 해석을 가지고 있음), 독립성(판단이 다른 사람을 모방하지 않고 형성됨), 분산화(사람들이 자신의 지역 지식을 활용함), 집계(메커니즘이 개인의 판단을 집합적인 답으로 결합함). 갈턴의 경연은 이 네 가지를 모두 충족시켰습니다 — 이것이 바로 그것이 효과를 발휘한 이유입니다. 하나라도 제거하면 군중의 이점이 감소하거나 반전됩니다.
군중은 언제 실패하는가?
군중은 독립성이 무너질 때 실패합니다 — 사람들이 서로의 답변을 보고 복사할 수 있을 때, 초기 추측이 그룹을 통해 퍼지고, 오류가 상관관계가 생기며, 집합체는 첫 번째로 큰 목소리가 말한 방향으로 흘러갑니다. 정보의 폭포, 집단사고, 그리고 메아리 방은 모두 이러한 실패의 버전입니다. 팀을 위한 교훈: 누군가가 소리 내어 논의하기 전에 독립적으로 그리고 서면으로 판단을 수집하십시오.
군중의 지혜는 다수결 투표와 같은 것인가?
그들은 관련이 있지만 동일하지는 않습니다. 갈턴의 황소는 수치 추정치를 집계하는 것과 관련이 있으며, 평균을 내면 오류가 상쇄됩니다. 예/아니오 질문에 대한 다수결 투표는 콩도르세 배심원 정리에 의해 지배되며(1785), 각 유권자가 우연보다 나은 경우와 독립적으로 투표할 경우, 집단 규모가 커질수록 다수결이 극적으로 더 신뢰할 수 있게 된다는 것을 보여줍니다. 두 가지 모두 집계 메커니즘입니다. 투표는 이산 선택을 집계하고, 평균은 양을 집계합니다.
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from 18th-century mathematics to modern AI.
팀에 박람회 프로토콜을 제공하십시오.
Argumentree는 판단을 독립적으로 수집하고, 합의 점수로 집계하며, 기록에 추론을 유지합니다 — 갈톤의 군중을 지혜롭게 만든 조건이 귀하의 결정에 내장되어 있습니다.
무료 14일 체험 시작 →
