Ketika LLM Bertemu Penambangan Argumen: Apa yang Berubah dan Apa yang Tidak | Argumentree
Untuk sebagian besar sejarahnya, penambangan argumen komputasional memerlukan korpus yang dianotasi secara manual untuk setiap domain baru. Persyaratan itu adalah batasan yang mengikat di bidang ini: upaya anotasi sangat besar, pedoman diperdebatkan, dan sistem yang disesuaikan pada esai mahasiswa kurang berhasil diterapkan pada transkrip pertemuan atau komentar publik. Model bahasa besar menghilangkan batasan itu. Model umum dapat melakukan deteksi komponen dan klasifikasi hubungan dari sebuah prompt, tanpa data pelatihan spesifik domain, dan evaluasi yang dipublikasikan telah menemukan bahwa model umum yang diprompt bersaing dengan dan dalam beberapa kasus lebih baik daripada baseline encoder yang disesuaikan dalam penambangan argumen berbasis hubungan. Ini mengubah apa itu penambangan argumen: menjadi dapat digunakan pada teks organisasi biasa daripada hanya pada korpus penelitian yang dikurasi. Apa yang tidak berubah adalah struktur dari masalah-masalah sulit. Ketidakseimbangan kelas mencerminkan bagaimana orang menulis, bukan bagaimana model dilatih. Apakah sebuah kontribusi mendukung atau menyerang tergantung pada induknya daripada kata-katanya. Dan keberatan sering kali menargetkan jaminan yang tidak dinyatakan yang tidak muncul di mana pun dalam teks. Model besar juga memperkenalkan kesulitan baru mereka sendiri: keyakinan yang diucapkan lebih terkalibrasi daripada probabilitas token mentah tetapi masih tidak dapat diandalkan sebagai sinyal peringkat, sehingga kepastian model tidak dapat digunakan untuk memutuskan argumen mana yang paling penting.
Titik bottleneck korpus menghilang. Masalah struktural tidak bergerak sedikit pun — dan yang baru muncul, mengenakan kostum sebagai solusi.
- Penambangan argumen dulunya memerlukan korpus yang dianotasi secara manual per domain. Model umum yang dipicu tidak memerlukannya, yang membuatnya dapat digunakan pada teks bisnis biasa.
- Evaluasi yang dipublikasikan menemukan bahwa model tujuan umum yang dipicu bersaing dengan, dan terkadang lebih baik daripada, baseline encoder yang disesuaikan dalam klasifikasi relasi.
- Ketidakseimbangan, ketergantungan konteks, dan jaminan yang tidak dinyatakan adalah sifat dari bahasa dan tugas, bukan dari ukuran model.
- Kepercayaan model lebih terkalibrasi dengan baik dibandingkan probabilitas mentah tetapi masih bukan sinyal peringkat yang dapat diandalkan — sebuah jebakan baru, bukan alat baru.
- Apa yang membantu adalah memaksa hubungan untuk dinyatakan dalam kata-kata sebelum label diterapkan.
Keterbatasan yang Mendefinisikan Bidang Tersebut Saja Berhenti Berlaku
Selama dua puluh tahun, jawaban untuk bisakah kita melakukan penambangan argumen pada data kita? adalah pertanyaan lain: berapa ribu dokumen Anda yang bersedia Anda anotasi secara manual terlebih dahulu, dan siapa yang akan menulis panduannya?
Itu bukanlah detail teknis. Itu adalah alasan mengapa penambangan argumen tetap berada di laboratorium penelitian sementara analisis sentimen diterapkan di setiap produk. Persyaratan anotasi menjadikan setiap domain baru sebagai proyek daripada konfigurasi, dan seperti yang dijelaskan dalam pos kedua dalam seri ini, pedoman itu sendiri diperdebatkan bahkan di antara para spesialis.
Kemudian model bahasa umum muncul dan pertanyaan itu tidak lagi diajukan. Anda sekarang dapat mengarahkan salah satunya ke transkrip rapat di domain yang belum pernah dianotasi dan mendapatkan hasil awal yang dapat digunakan. Jika Anda pernah bertanya-tanya mengapa kemampuan ini muncul dalam produk secara tiba-tiba daripada secara bertahap, itulah alasannya.
Zero-Shot adalah Seluruh Cerita
Hal spesifik yang berubah adalah penghapusan pengawasan yang spesifik untuk domain. Model yang dipicu membawa kompetensi umum dengan bahasa dan dapat diberitahu apa itu klaim dan apa itu premis, dalam prompt, pada saat inferensi.
Pekerjaan yang dipublikasikan tentang penambangan argumen berbasis relasi telah menemukan model umum dengan pemicu sedikit yang bersaing dengan baseline pengkode yang disesuaikan di berbagai dataset — dan dalam beberapa kasus bahkan lebih unggul. Untuk bidang yang seluruh perangkat evaluasinya dibangun di atas pelatihan terawasi terhadap korpora yang dianotasi, itu adalah suatu diskontinuitas yang nyata.
Tiga konsekuensi praktis mengikuti. Adaptasi domain menjadi pengalihan prompt daripada pelatihan ulang. Dokumen panjang menjadi dapat ditangani, karena jendela konteks berkembang. Dan bidang bukti dapat membawa penjelasan, karena model dapat diminta untuk membenarkan dirinya sendiri dalam panggilan yang sama — yang ternyata lebih penting daripada yang terdengar.
Tiga Masalah yang Tidak Bergerak
Semua yang ada di pos sebelumnya masih berlaku, dan penting untuk menjelaskan mengapa skala tidak mengatasi hal tersebut.
- Ketidakseimbangan kelas adalah sifat dari penulisan, bukan dari pelatihan. Orang-orang yang membangun argumen sebagian besar menulis kalimat pendukung. Model yang telah membaca seluruh internet juga sebagian besar telah membaca persetujuan.
- Ketergantungan konteks adalah sifat dari tugas. Dukungan dan serangan adalah hubungan, bukan atribut kalimat. Kalimat yang sama di bawah induk yang berbeda memiliki label yang berbeda, dan tidak ada jumlah pengetahuan dunia yang dapat mengubahnya.
- Jaminan yang tidak dinyatakan adalah properti dari teks. Jika prinsip yang menghubungkan bukti dengan kesimpulan tidak pernah dituliskan, maka itu tidak ada dalam input. Model yang lebih besar membaca kalimat yang sama yang tidak ada.
Ada yang keempat, yang lebih halus. Model yang fasih menghasilkan keluaran yang fasih, sehingga kesalahannya muncul dengan ungkapan yang baik dan konsisten secara internal. Label relasi yang salah dari pengkode terlihat seperti kebisingan. Label relasi yang salah dari model bahasa terlihat seperti argumen.
Jebakan Baru: Mempercayai Kepastian Model Itu Sendiri
Karena model-model ini dapat melaporkan seberapa yakin mereka, sangat menggoda untuk menggunakan angka tersebut — untuk memberi peringkat pada argumen yang diekstrak, untuk memutuskan mana yang penting, untuk mengatur apa yang ditampilkan.
Pekerjaan oleh Saurav Kadavath dan rekan-rekannya menemukan bahwa penilaian diri yang diucapkan lebih terkalibrasi dengan baik dibandingkan dengan probabilitas token mentah. Hasil tersebut sering dikutip sebagai izin untuk mempercayai angka tersebut. Evaluasi selanjutnya secara konsisten kurang menggembirakan: lebih baik daripada alternatif bukanlah hal yang sama dengan dapat diandalkan, dan kalibrasi menurun tepat di tempat yang Anda butuhkan, pada kasus-kasus yang sulit dan tidak biasa.
Ada juga kesalahan kategori yang tersembunyi dalam praktik ini. Kepercayaan mengukur seberapa yakin model bahwa ia menemukan argumen yang nyata. Ini tidak mengatakan apa-apa tentang apakah argumen itu sentral untuk debat. Statistik yang diungkapkan dengan jelas adalah ekstraksi yang mudah dan memiliki kepercayaan tinggi; kalimat yang hati-hati yang kebetulan merupakan tesis yang sebenarnya adalah yang sulit. Peringkat berdasarkan kepercayaan mempromosikan bukti dan mendemotivasi klaim — yang merupakan kegagalan yang dibuka oleh pos terakhir dalam seri ini.
Uji pada transkrip yang Anda kenal dengan baik
Ambil sebuah pertemuan yang hasilnya kamu ingat dengan jelas dan tanyakan kepada alat AI apa argumen utamanya. Jika alat tersebut memberikan kalimat yang paling tepat dan didukung bukti terbaik daripada kalimat yang lebih longgar yang sebenarnya mendorong keputusan, kamu baru saja menyaksikan kepercayaan menggantikan kepentingan — dan sekarang kamu tahu untuk tidak mempercayai peringkat itu.
Apa Itu Bantuan: Membuatnya Mengatakan Mengapa Terlebih Dahulu
Perbaikan yang paling dapat diandalkan yang tersedia dengan model-model ini hampir sangat sederhana. Minta penjelasan sebelum label.
Mewajibkan model untuk menuliskan apa yang dilakukan kontribusi terhadap induknya — ini memperkuat keberatan di atas, karena memberikan alasan lain mengapa keberatan itu berlaku — sebelum berkomitmen pada keputusan dukungan atau serangan secara terukur meningkatkan keputusan tersebut. Langkah tertulis memaksa hubungan induk masuk ke dalam konteks kerja model, yang merupakan informasi yang tepat yang tidak disediakan oleh kata-kata dalam kalimat tersebut.
Ini adalah versi mesin dari teknik yang sepenuhnya manusiawi. Inilah mengapa steelmanning berhasil: mengartikulasikan apa yang sebenarnya dilakukan oleh sebuah argumen, sebelum menilainya, mengubah penilaian.
Jadi, Apakah Penambangan Argumen Sudah Terpecahkan?
Tidak, dan bentuk apa yang tersisa sekarang lebih jelas daripada sebelumnya.
Apa yang diselesaikan, secara praktis, adalah akses. Setiap organisasi dapat menjalankan penambangan argumen atas teksnya sendiri hari ini tanpa program anotasi, yang tidak terbayangkan beberapa tahun yang lalu. Itu adalah perubahan yang nyata dan besar.
Apa yang belum terpecahkan adalah strukturnya: kontribusi mana yang merespons yang mana, dan dalam arah mana, ketika prinsip penghubung tidak dinyatakan dan data telah melatih semua orang — manusia dan mesin — untuk mengharapkan kesepakatan. Posisi yang jujur adalah bahwa ekstraksi sekarang menghasilkan draf yang baik di bidang apa pun, dan bahwa seseorang masih harus memeriksa ketidaksepakatan. Ini adalah pembagian kerja yang jauh lebih baik daripada yang di mana tidak ada yang membangun struktur sama sekali.
Cara Menggunakan Ini dengan Baik
- Jangan peringkat berdasarkan kepercayaan. Ini mengukur kepastian ekstraksi, bukan pentingnya, dan secara sistematis mempromosikan bukti di atas klaim.
- Tanyakan tentang hubungan, bukan perasaan. Pertanyaan yang berguna adalah apa yang terjadi pada induknya — bukan bagaimana perasaannya tentang topik tersebut.
- Pastikan itu membenarkan label sebelum memberikannya. Alasan yang tertulis adalah apa yang menempatkan hubungan orang tua dalam konteks, dan di situlah Anda menangkap kesalahan.
- Habiskan waktu ulasan Anda pada perbedaan pendapat. Di situlah model paling lemah dan di mana nilai keputusan terkonsentrasi.
Draf yang Lebih Baik, Bukan Putusan
Titik bottleneck yang membuat penambangan argumen terjebak di laboratorium telah hilang, dan tidak akan kembali. Itu perlu disadari dengan jelas: ini adalah perbedaan antara teknik penelitian dan sesuatu yang dapat Anda tunjukkan di pertemuan Anda sendiri.
Tetapi masalah yang sulit pada tahun 1958 masih sulit sekarang. Surat perintahnya masih belum ditulis, ketidaksepakatan masih jarang, dan labelnya masih tergantung pada orang tua daripada pada frasa. Yang berubah adalah siapa yang mendapatkan masalah tersebut — yang, untuk sebuah bidang yang menghabiskan dua puluh tahun menunggu anotator, sudah cukup sebagai perubahan.
Seri penambangan argumen
Lima pos tentang bagaimana mesin belajar membaca argumen — dari mana bidang ini berasal, mengapa masalah sulitnya sulit, dan bagaimana kami menerapkannya.
Bagaimana sebuah buku filsafat tahun 1958 yang ditolak oleh para logician menjadi spesifikasi untuk tugas pembelajaran mesin.
Dekade korpus yang dianotasi tangan yang mengubah penambangan argumen dari sebuah ide menjadi tugas yang terukur.
Ketidaksepakatan jarang terjadi dalam data dan tergantung pada konteks yang tidak terdapat dalam kalimat.
Menerapkannya: kategori argumen, satu klaim utama per kategori, dan mengapa kepercayaan adalah sinyal peringkat yang salah.
Sumber & Bacaan Lanjutan
Keadaan bidang sebelum LLM — berguna sebagai dasar untuk mengukur pergeseran.
Penilaian diri yang diucapkan mengalahkan probabilitas token mentah — hasilnya sering kali dibaca berlebihan sebagai izin untuk mempercayai angka tersebut.
Hasil tolok ukur yang diawasi yang dibandingkan dengan pendekatan LLM.
Surat perintah — langkah tak tertulis yang tidak disediakan oleh skala, karena itu tidak ada dalam teks daripada dalam model.
Pertanyaan yang Sering Diajukan
Bagaimana model bahasa besar mengubah penambangan argumen?
Mereka menghapus persyaratan untuk korpus yang dianotasi tangan di setiap domain baru. Model umum yang dipicu dapat mengidentifikasi klaim, premis, dan hubungan tanpa data pelatihan spesifik domain, yang mengubah penambangan argumen dari teknik penelitian menjadi sesuatu yang dapat digunakan pada teks organisasi biasa.
Apakah LLM lebih baik daripada model yang disesuaikan dalam penambangan argumen?
Dalam penambangan argumen berbasis hubungan, evaluasi yang diterbitkan telah menemukan bahwa model umum yang dipicu bersaing dengan dan dalam beberapa kasus lebih baik daripada baseline encoder yang disesuaikan di berbagai dataset. Keuntungan praktis yang lebih besar adalah bahwa mereka sama sekali tidak memerlukan data pelatihan yang dianotasi untuk domain baru.
Masalah apa yang tidak diselesaikan oleh LLM?
Tiga yang struktural. Ketidakseimbangan kelas mencerminkan bagaimana orang menulis daripada bagaimana model dilatih. Dukungan versus serangan tergantung pada orang tua, bukan pada kata-katanya. Dan keberatan sering kali menargetkan jaminan yang tidak dinyatakan yang tidak ada dalam teks, jadi tidak ada jumlah kemampuan model yang dapat menyediakannya.
Bisakah Anda mempercayai skor kepercayaan model?
Bukan sebagai sinyal peringkat. Keyakinan yang diucapkan lebih terkalibrasi daripada probabilitas token mentah tetapi tetap tidak dapat diandalkan dalam istilah absolut, dan itu mengukur kepastian ekstraksi daripada pentingnya — jadi peringkat berdasarkan itu secara sistematis mempromosikan detail yang didukung dengan baik dibandingkan dengan kalimat yang lebih longgar yang membawa klaim sebenarnya.
Apa yang sebenarnya meningkatkan klasifikasi hubungan dengan LLM?
Mewajibkan model untuk menyatakan, dengan kata-kata, apa yang dilakukan kontribusi terhadap induknya sebelum berkomitmen pada label dukungan atau serangan. Langkah tertulis ini memaksa hubungan induk ke dalam konteks kerja, yang merupakan informasi yang tidak dapat diberikan oleh kata-kata kalimat itu sendiri.
Apakah penambangan argumen sekarang sudah menjadi masalah yang terpecahkan?
Akses telah teratasi — organisasi mana pun dapat menjalankannya pada teks mereka sendiri tanpa program anotasi. Struktur belum. Memutuskan kontribusi mana yang merespons yang mana, dan dalam arah mana, tetap sulit, sehingga ekstraksi menghasilkan draf yang baik dan seseorang masih meninjau ketidaksepakatan.
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
Draf yang bisa Anda perbaiki
Ekstraksi menghasilkan struktur; Anda meninjau ketidaksepakatan. Tempelkan transkrip dan lihat pembagian kerja.
Halaman referensi untuk bidang — tugas, sejarah, dan mengapa hubungan adalah bagian yang sulit.
Lengkungan seluruh bidang, dari buku filsafat yang ditolak pada tahun 1958 hingga hari ini.
Kategori, satu klaim utama per kategori, dan mengapa kepercayaan adalah sinyal peringkat yang salah.
Jalankan di transkrip Anda sendiri
Tidak ada program anotasi, tidak ada korpus, tidak ada pelatihan — hanya pohon pro dan kontra yang terstruktur untuk ditinjau.
Mulai gratis