Pada tahun 1906, Francis Galton — seorang ahli statistik yang cemerlang dan skeptik terbuka terhadap penilaian demokratik — menganalisis 787 tekaan tentang berat lembu yang telah disembelih, menjangkakan untuk membuktikan bahawa orang ramai tidak berdaya. Anggaran median adalah 1,207 lb. Lembu itu berat 1,198 lb. Orang ramai mengalahkan pakar, dan sains penilaian kolektif dilahirkan.
- Persediaan: pertandingan penilaian berat enam pence di pameran ternakan Plymouth; ~800 kad, 787 sah
- Keputusan: median 1,207 lb berbanding 1,198 lb sebenar — dalam ~0.8%; purata, yang dicatat kemudian, adalah 1,197 lb
- Kenapa ia berfungsi: kesilapan yang bebas dan pelbagai sebahagiannya dibatalkan apabila digabungkan
- Perangkap: pecahkan kebebasan — biarkan orang meniru satu sama lain — dan keajaiban itu terbalik
- Legasi: pasaran ramalan, pembelajaran mesin ensemble, dan pengambilan keputusan kumpulan yang terstruktur semuanya berasal dari satu petang ini
Saintis yang ingin membuktikan orang ramai bodoh
Bahagian terbaik dari eksperimen paling terkenal dalam kecerdasan kolektif adalah bahawa ia direka — sekurang-kurangnya dalam semangat — untuk membuktikan sebaliknya daripada apa yang ditemuinya.
Menjelang tahun 1906, Francis Galton adalah salah satu saintis paling berjaya di Britain. Seorang sepupu Charles Darwin, beliau telah mempelopori konsep statistik korelasi dan regresi ke purata, mencipta peta cuaca, dan meletakkan pengenalan cap jari pada asas saintifik. Dia juga — dan ini penting untuk cerita — sangat skeptikal terhadap penilaian orang biasa. Galton percaya bahawa kecerdasan tertumpu dalam elit warisan kecil; dia mencipta istilah “eugenik” dan menghabiskan dekad-dekad mempromosikannya, satu legasi yang hari ini dikutuk dengan tepat dan tidak dapat dipisahkan dari cara dia mendekati soalan ini. Apabila dia menggunakan alat statistiknya pada orang ramai, dia menjangkakan untuk mendokumentasikan ketidakcekapan mereka.
Jadi apabila Galton yang berusia 84 tahun merayau melalui Pameran Stok Lemak dan Ayam di Plymouth pada musim luruh 1906 dan menemui pertandingan penilaian berat, dia melihat satu set data yang tidak dapat ditolak. Di sini adalah orang ramai — beberapa pakar, kebanyakan tidak — membuat ratusan penilaian numerik yang bebas tentang satu perkara fakta, dengan yuran kemasukan kecil untuk memastikan mereka jujur dan hadiah untuk memastikan mereka bermotivasi. Seperti yang dia tulis kemudian dalam Nature, pesaing purata mungkin sama baiknya untuk menilai lembu seperti pengundi purata untuk menilai merit kebanyakan isu politik yang dia undi. Analogi kepada demokrasi adalah keseluruhan maksudnya. Galton menjangkakan vox populi — suara rakyat — akan memalukan dirinya.
Pameran negara, lembu gemuk, dan 787 tiket enam pence
Mekanisme pertandingan adalah mudah, dan — seperti yang kita tahu sekarang — secara tidak sengaja hampir kepada reka bentuk eksperimen yang ideal. Seekor lembu hidup dipamerkan. Dengan enam pence, sesiapa sahaja boleh membeli kad yang dicap dan bernombor, menulis nama dan alamat mereka di atasnya, dan merekodkan anggaran mereka tentang berapa berat lembu itu setelah disembelih dan disiapkan — angka yang bermakna secara komersial, dan soalan yang lebih sukar daripada berat hidup haiwan itu. Anggaran yang paling tepat memenangi hadiah.
Tiga ciri persediaan ini layak mendapat perhatian, kerana setiap satu memetakan kepada syarat yang kemudian penyelidikan akan menunjukkan adalah penting untuk ketepatan kolektif. Pertama, yuran enam pence menapis penipu praktikal yang tulen — orang mempunyai kepentingan dalam permainan. Kedua, setiap kad diisi secara peribadi: tiada angkat tangan, tiada lelongan yang memanggil konsensus yang berjalan, tiada pendahulu yang jelas untuk dicontohi. Penilaian adalah bebas. Ketiga, orang ramai benar-benar bercampur: tukang daging dan petani dengan kepakaran profesional berdiri di sebelah kerani dan keluarga yang, dalam kata-kata Galton, dipandu oleh fantasi saat itu. Penilaian adalah pelbagai.
Selepas pertandingan, Galton meminjam kad-kad tersebut. Dari kira-kira 800, tiga belas tidak boleh dibaca atau cacat, meninggalkan 787 anggaran sah. Dia menyusunnya, mengira, memplotkan taburan mereka, dan mengira kuantil mereka — satu kerja statistik penuh, diterbitkan dalam Nature pada 7 Mac 1907 dengan tajuk “Vox Populi” (Galton, F., Nature, 75, 450–451).
Keputusan yang mengejutkannya
Anggaran yang paling tengah — apa yang kita panggil median — adalah 1,207 paun. Lembu itu, setelah disembelih dan disiapkan, berat 1,198 paun. Keputusan kolektif orang ramai tersasar sembilan paun: satu kesilapan kira-kira 0.8%, lebih dekat daripada anggaran pakar lembu yang hadir.
Galton — untuk kreditnya yang tulus sebagai seorang saintis — melaporkan keputusan itu secara langsung. “Keputusan ini adalah, saya rasa, lebih terpuji kepada kebolehpercayaan penilaian demokratik daripada yang mungkin dijangkakan,” tulisnya. Datang dari seorang lelaki yang telah menghabiskan kariernya berhujah bahawa penilaian yang baik adalah hadiah warisan yang jarang, ayat itu adalah satu pengakuan saintifik yang tenang: data telah mengalahkan sebelumnya.
Cerita menjadi lebih baik dalam surat-menyurat yang mengikuti. Pembaca Nature menulis, dan dalam balasannya (“The Ballot-Box,” Nature, 75, 509) Galton mengakui bahawa purata semua 787 tekaan adalah 1,197 paun — satu paun off berat sebenar. Seratus tahun kemudian, ahli ekonomi Kenneth Wallis (“Revisiting Francis Galton’s forecasting competition,” 2014) mengkaji semula data asal dan pertukaran sekitarnya, mengesahkan asas cerita yang telah terkenal oleh James Surowiecki. Kesalahan satu paun purata adalah versi yang biasanya dipetik hari ini; kesalahan sembilan paun median adalah apa yang Galton sebenarnya memulakan. Kedua-duanya menakjubkan.
Median atau purata? Pilihan statistik Galton masih penting
Mengapa Galton lebih suka anggaran yang paling tengah? Pemikirannya adalah secara politik: median adalah nilai yang akan disahkan oleh majoriti orang ramai dalam undian. Setiap nilai lain akan diundi keluar oleh mereka yang menganggapnya terlalu tinggi atau terlalu rendah. Median, dengan kata lain, adalah keputusan demokratik orang ramai — yang merupakan soalan tepat tentang vox populi yang dia ingin uji.
Tetapi terdapat hujah statistik yang tersembunyi di dalam hujah politik itu, dan ia masih diajar hari ini. Median adalah statistik yang kukuh: segelintir tekaan yang tidak masuk akal — seseorang menulis 10,000 paun untuk bergurau — hampir tidak mengubahnya, manakala purata boleh ditarik jauh oleh satu outlier tunggal. Purata, sebaliknya, menggunakan lebih banyak maklumat dalam data dan, apabila kesilapan adalah lebih kurang simetri dan bebas, membatalkan mereka dengan lebih berkesan. Orang ramai Galton cukup berkelakuan baik sehingga kedua-duanya berfungsi: median tersasar 9 lb, purata 1 lb. Dalam orang ramai yang lebih berantakan — undian dalam talian, forum tanpa moderator — ketahanan median sering menang. Memilih mekanisme pengagregatan anda adalah keputusan tentang seberapa banyak anda mempercayai ekor orang ramai anda.
Mengapa purata berfungsi: aritmetik pembatalan kesilapan
Tiada mistik dalam keputusan Galton. Setiap tekaan boleh dianggap sebagai nilai sebenar ditambah dengan kesilapan. Jika kesilapan adalah bebas dan tersebar di kedua-dua belah kebenaran — beberapa tukang daging menganggarkan terlalu tinggi, beberapa terlalu rendah — maka menambah tekaan bersama membatalkan banyak kesilapan sementara isyarat yang dikongsi terkumpul. Semakin pelbagai dan bebas kesilapan, semakin agresif mereka dibatalkan.
Scott Page kemudian memformalkan intuisi itu sebagai teorem ramalan kepelbagaian (Page, The Difference, 2007): untuk kesilapan kuasa dua, kesilapan kolektif sama dengan purata kesilapan individu tolak kepelbagaian ramalan. Ia adalah identiti matematik, bukan tuntutan empirik — yang menjadikannya sangat berguna. Orang ramai mengalahkan anggotanya yang purata dengan tepat sebanyak mana anggotanya tidak bersetuju antara satu sama lain. Kepelbagaian bukanlah sesuatu yang baik untuk dimiliki; ia adalah, secara aritmetik, keseluruhan kelebihan. Sekumpulan klon tidak mendapat apa-apa daripada pengagregatan.
Logik yang sama telah ditemui, untuk soalan ya/tidak dan bukannya kuantiti, lebih dari satu abad sebelum Galton. Marquis de Condorcet membuktikan pada tahun 1785 bahawa jika setiap pengundi sedikit lebih mungkin daripada kebetulan untuk betul, dan pengundi menilai secara bebas, kebarangkalian bahawa majoriti betul meningkat ke arah kepastian apabila kumpulan berkembang. Kami menceritakan cerita itu — dan cara dramatik teorem itu gagal apabila andaian-andaian itu pecah — dalam karya pendamping kami tentang Teorem Juri Condorcet.
Dari nota kaki ke rangka kerja: empat syarat Surowiecki
Untuk kebanyakan abad kedua puluh, lembu Galton adalah satu keanehan statistik. Itu berubah pada tahun 2004, apabila James Surowiecki membuka The Wisdom of Crowds dengan cerita Plymouth dan mengumpulkan satu abad bukti — dari pasaran saham hingga enjin carian — bahawa orang ramai boleh menjadi bijak secara sistematik. Yang penting, Surowiecki tidak mendakwa orang ramai sentiasa bijak. Dia mengenal pasti empat syarat yang dipenuhi oleh pameran Galton secara tidak sengaja, dan yang diperlukan oleh mana-mana orang ramai yang bijak secara sengaja:
Kepelbagaian pendapat
Setiap orang membawa beberapa maklumat peribadi atau cara yang berbeza untuk mentafsirkan soalan. Penjual daging, petani, dan pengunjung pameran yang santai semua membaca lembu dengan cara yang berbeza — dan kesilapan mereka yang berbeza sebahagiannya saling membatalkan.
Kemandirian
Setiap tiket diisi secara peribadi, tanpa angkat tangan atau pakar yang kuat mengawal bilik. Tiada siapa yang boleh meniru pendahulu, kerana tiada pendahulu yang jelas.
Desentralisasi
Tiada jawatankuasa yang memutuskan apa anggaran "rasmi" sepatutnya. Setiap peserta menggunakan pengetahuan tempatan mereka sendiri — bertahun-tahun menilai lembu, atau hanya mata yang baik.
Pengagregatan
Satu mekanisme mengubah 787 keputusan peribadi menjadi satu jawapan kolektif. Tanpa timbunan tiket dan seseorang yang bersedia untuk mengira mereka, kebijaksanaan terperangkap dalam kepala individu.
Buang mana-mana satu syarat dan orang ramai tidak hanya kehilangan kelebihan mereka — ia boleh menjadi lebih teruk daripada anggotanya, kerana pengagregatan kemudian memperkuatkan bias yang dikongsi dan bukannya membatalkan kesilapan yang bebas. Untuk sains penuh tentang empat syarat dan cara kegagalan mereka, lihat panduan kami tentang kebijaksanaan orang ramai.
Cetakan halus: apa yang pameran lakukan dengan betul yang mesyuarat lakukan dengan salah
Berikut adalah soalan yang tidak selesa bagi sesiapa yang mengendalikan mesyuarat: berapa banyak keputusan kumpulan dalam organisasi anda yang disusun seperti pameran Galton — dan berapa banyak yang disusun seperti sebaliknya?
Di pameran, setiap penilaian dilakukan secara peribadi, secara bertulis, sebelum sesiapa melihat nombor orang lain. Dalam mesyuarat biasa, orang yang paling senior atau paling yakin bercakap terlebih dahulu, dan setiap “anggaran” seterusnya diikat pada anggaran mereka. Apa yang kelihatan seperti tiga puluh orang bersetuju sering kali adalah satu tekaan seseorang dengan dua puluh sembilan gema. Ahli ekonomi memanggil mekanisme itu sebagai gelombang maklumat: setelah beberapa pendapat awal kelihatan, ia menjadi rasional secara individu bagi setiap orang seterusnya untuk mengabaikan maklumat mereka sendiri dan meniru — dan kebebasan orang ramai, syarat yang menyokong keseluruhan fenomena, secara senyap runtuh (Bikhchandani, Hirshleifer & Welch, 1992). Kami membincangkan mekanisme dalam panduan kami tentang gelombang maklumat.
Inilah juga sebab mengapa replikasi eksperimen Galton kadang-kadang mengecewakan: jalankan permainan meneka lembu dengan purata yang jelas, atau biarkan peserta menjerit tekaan mereka, dan ketepatan merosot. Keajaiban tidak pernah ada dalam orang ramai — ia ada dalam protokol. Enam pence, kad peribadi, dan kotak undi yang terkunci ternyata menjadi seni bina keputusan yang lebih baik daripada kebanyakan bilik persidangan.
Keturunan moden lembu
Prinsip pengagregatan yang didokumentasikan oleh Galton kini berjalan melalui pelbagai sistem moden yang luar biasa:
Pasaran ramalan
Pasaran Elektronik Iowa, yang ditubuhkan pada tahun 1988, mengumpulkan kepercayaan pedagang menjadi harga. Berg, Nelson dan Rietz (2008) membandingkan pasaran dengan 964 tinjauan kebangsaan sepanjang pilihan raya presiden 1988–2004: pasaran lebih dekat dengan hasil 74% daripada masa.
Pembelajaran mesin ensemble
Hutan rawak dan kaedah ensemble lain adalah lembu Galton dalam silikon: banyak model yang tidak sempurna dan sebahagiannya bebas digabungkan — melalui pengundian atau purata — menjadi ramalan yang lebih tepat daripada mana-mana model tunggal.
Ramalan purata
Menggabungkan ramalan — sama ada dari ahli ekonomi, model cuaca, atau peramal pilihan raya — secara rutin mengatasi kebanyakan ramalan individu, untuk alasan pembatalan ralat yang tepat yang ditemui oleh Galton.
Latihan anggaran
Eksperimen ini mudah untuk diulang: minta sekumpulan untuk menganggarkan suatu kuantiti secara bebas dan secara bertulis, kemudian agregat. Pengulangan di bilik darjah dan bengkel kekal sebagai demonstrasi standard pengagregatan statistik.
Setiap keturunan mengagregat sesuatu yang berbeza — pasaran mengagregat kepercayaan menjadi harga, ensemble mengagregat output model menjadi ramalan, sistem pengundian mengagregat pilihan menjadi hasil — dan setiap satu mewarisi kebergantungan yang sama: agregat hanya sebaik kebebasan dan kepelbagaian yang memberi makannya. Persamaan keluarga itu adalah garis penghubung tradisi penyelidikan keseluruhan, dari teorem Condorcet 1785 hingga penyelidikan kecerdasan kolektif di Pusat Kecerdasan Kolektif MIT hari ini — satu lengkung 240 tahun yang kami jejak dalam Kecerdasan Kolektif: 240 Tahun Penyelidikan.
Apa yang lembu Galton bermakna untuk pasukan anda
Terjemahan praktikal eksperimen 1906 adalah senarai semak pendek, dan ia terpakai pada satu titik tertentu dalam kehidupan keputusan — saat anda mengumpul dan menggabungkan penilaian, sebelum kumpulan mula berunding:
- Kumpulkan anggaran secara bebas, secara bertulis, terlebih dahulu. Sebelum mesyuarat, sebelum orang senior bercakap. Saat penilaian menjadi jelas, kebebasan — dan kelebihan statistik orang ramai — mula merosot.
- Secara aktif merekrut perspektif yang pelbagai. Teorem ramalan kepelbagaian adalah jelas: kelebihan kolektif anda berbanding ahli purata anda adalah kepelbagaian anda. Sebuah panel orang dengan latar belakang dan maklumat yang sama adalah satu tekaan yang memakai banyak nama.
- Pilih mekanisme pengagregatan anda dengan teliti. Median untuk orang ramai yang tidak teratur, purata untuk yang berkelakuan baik, penilaian terstruktur apabila penilaian mempunyai pelbagai dimensi. “Kami membincangkannya dan mencapai konsensus” bukanlah mekanisme pengagregatan — ia biasanya merupakan mekanisme penetapan.
- Simpaikan sebab-sebab, bukan hanya nombor. Kad Galton memberitahunya apa yang difikirkan oleh orang ramai, tetapi tidak kenapa. Bagi seekor lembu, itu tidak mengapa. Bagi keputusan strategi, alasan adalah bahagian yang anda perlukan apabila keadaan berubah.
Titik terakhir itu adalah di mana pengambilan keputusan kolaboratif moden melangkaui Galton. Argumentree dibina untuk memberikan pasukan protokol pameran dengan alasan yang dilampirkan: peserta menyumbang hujah secara bebas dan tidak segerak — sebelum bilik bersatu — ke dalam pokok pro/con yang terstruktur; kumpulan kemudian menilai setiap hujah pada dimensi yang jelas (kegunaan, kejelasan, ketepatan, kelengkapan), dan penilaian digabungkan menjadi skor konsensus seperti mana 787 kad digabungkan menjadi 1,207 paun. Pilihan sumbangan tanpa nama melindungi kebebasan daripada hierarki, dan jejak audit penuh mengekalkan apa yang pertandingan lembu tidak pernah dapat: mengapa di sebalik nombor.
Galton pergi ke pameran untuk membuktikan bahawa penilaian biasa tidak boleh dipercayai. Dia pergi dengan bukti terkuat yang pernah dihasilkan bahawa — jika digabungkan dengan betul — ia boleh. Alatnya telah berubah dari kotak undi kepada perisian. Pengajarannya tidak.
Soalan Lazim
Apa itu eksperimen lembu Galton?
Pada musim luruh 1906, ahli statistik Francis Galton menganalisis pertandingan menilai berat di Pameran Stok Lemak dan Ayam Barat England di Plymouth. Pengunjung pameran membayar enam pence untuk meneka berat lembu hidup setelah ia "disembelih dan disiapkan." Galton mengumpulkan kad-kad tersebut — 787 adalah jelas dan sah — dan mendapati bahawa tekaan yang paling tengah (median) adalah 1,207 paun berbanding dengan berat sebenar yang telah disiapkan sebanyak 1,198 paun: dalam kira-kira 0.8%, dan lebih baik daripada anggaran pakar lembu yang hadir. Dia menerbitkan analisis itu sebagai "Vox Populi" dalam Nature pada Mac 1907.
Mengapa eksperimen lembu Galton penting?
Ia adalah demonstrasi empirik asas tentang kebijaksanaan orang ramai: di bawah keadaan yang betul, agregat banyak penilaian bebas yang tidak sempurna boleh lebih tepat daripada penilaian pakar individu. Hasilnya mengejutkan Galton sendiri, yang mengharapkan untuk menunjukkan ketidakcekapan pengundi purata. James Surowiecki membuka bukunya 2004 The Wisdom of Crowds dengan cerita ini, dan statistik asas kini memberi kuasa kepada pasaran ramalan dan pembelajaran mesin ensemble.
Adakah Galton menggunakan purata atau median?
Dalam artikel asal di Nature, Galton melaporkan "anggaran paling tengah" — median — sebanyak 1,207 lb, berpendapat bahawa ia adalah pilihan yang adil secara demokratik kerana separuh daripada orang ramai berfikir jawapannya lebih tinggi dan separuh lebih rendah. Dalam surat susulan, dia mengakui bahawa purata aritmetik tekaan adalah 1,197 lb — hanya satu paun dari 1,198 lb yang sebenar. Pertukaran ini adalah hujah awal tentang statistik yang kukuh: median menahan distorsi oleh outlier yang liar, sementara purata mengekstrak lebih banyak maklumat apabila kesilapan adalah lebih kurang simetri.
Apakah syarat yang diperlukan oleh orang ramai untuk menjadi bijak?
James Surowiecki (2004) mengenal pasti empat: kepelbagaian pendapat (orang mempunyai maklumat dan tafsiran yang berbeza), kebebasan (penilaian dibentuk tanpa meniru orang lain), desentralisasi (orang menggunakan pengetahuan tempatan mereka sendiri), dan agregasi (mekanisme menggabungkan penilaian peribadi menjadi jawapan kolektif). Pertandingan Galton memenuhi keempat-empat syarat tersebut — yang merupakan sebab mengapa ia berjaya. Buang mana-mana satu, dan kelebihan orang ramai akan terhakis atau terbalik.
Bila orang ramai gagal?
Orang ramai gagal apabila kebebasan terputus — apabila orang dapat melihat dan meniru jawapan satu sama lain, tekaan awal mengalir melalui kumpulan, kesilapan menjadi berkorelasi, dan agregat mengalir ke arah apa sahaja yang dikatakan oleh suara kuat pertama. Aliran maklumat, pemikiran kumpulan, dan bilik gema adalah semua versi kegagalan ini. Pengajaran untuk pasukan: kumpulkan penilaian secara bebas dan secara bertulis sebelum sesiapa membincangkannya dengan kuat.
Adakah kebijaksanaan orang ramai sama dengan pengundian majoriti?
Mereka berkaitan tetapi tidak identik. Lembu Galton melibatkan pengagregatan anggaran numerik, di mana purata membatalkan kesilapan. Pengundian majoriti pada soalan ya/tidak dikawal oleh Teorem Juri Condorcet (1785), yang menunjukkan bahawa majoriti menjadi lebih boleh dipercayai secara dramatik apabila saiz kumpulan bertambah — dengan syarat setiap pengundi lebih baik daripada kebetulan dan mengundi secara bebas. Kedua-duanya adalah mekanisme agregasi; pengundian mengagregat pilihan diskret, sementara purata mengagregat kuantiti.
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from 18th-century mathematics to modern AI.
Berikan pasukan anda protokol pameran.
Argumentree mengumpul penilaian secara bebas, mengagregatkannya menjadi skor konsensus, dan menyimpan alasan dalam rekod — syarat yang menjadikan orang ramai Galton bijak, dibina ke dalam keputusan anda.
Mula Percubaan Percuma 14 Hari →Artikel Berkaitan
Teorem Juri Condorcet: Matematik Berusia 240 Tahun di Sebalik Keputusan yang Lebih Baik
Kepelbagaian Mengatasi Kebolehan: Mengapa Pekerja Terpandai Anda Bukan Pembuat Keputusan Terbaik Anda
Apabila Orang Ramai Menjadi Salah: Gelembung, Cascades, dan Kegilaan Kumpulan
Di seluruh ekosistemKonsensus Multi-LLM
Rata-rata yang sama yang membuat orang ramai Galton mengalahkan pakar adalah apa yang menjadikan konsensus multi-LLM lebih boleh dipercayai daripada mana-mana model tunggal.

