LLM'ler Argüman Madenciliği ile Tanıştığında: Ne Değişti ve Ne Değişmedi | Argumentree
Tarihinin çoğu boyunca, hesaplamalı argüman madenciliği her yeni alan için elle etiketlenmiş bir korpus gerektiriyordu. Bu gereklilik, alanın bağlayıcı kısıtlamasıydı: etiketleme çabası büyüktü, yönergeler tartışmalıydı ve öğrenci makaleleri üzerinde ayarlanmış bir sistem, toplantı transkriptlerine veya kamu yorumlarına geçişte zayıf performans gösteriyordu. Büyük dil modelleri bu kısıtlamayı ortadan kaldırdı. Genel amaçlı bir model, alan spesifik eğitim verisi olmadan bir istemden bileşen tespiti ve ilişki sınıflandırması yapabilir ve yayımlanan değerlendirmeler, istemle yönlendirilen genel amaçlı modellerin ilişki temelli argüman madenciliğinde ince ayar yapılmış kodlayıcı temel çizgileri ile rekabetçi ve bazı durumlarda daha iyi olduğunu bulmuştur. Bu, argüman madenciliğinin amacını değiştirdi: artık yalnızca özenle hazırlanmış araştırma korpusları üzerinde değil, sıradan organizasyonel metinlerde de kullanılabilir hale geldi. Değişmeyen şey, zor problemlerinin yapısıdır. Sınıf dengesizliği, insanların yazma biçimini yansıtır, modellerin nasıl eğitildiğini değil. Bir katkının destekleyici mi yoksa saldırgan mı olduğu, kelime seçiminden ziyade ebeveynine bağlıdır. Ve itirazlar sıklıkla metinde hiçbir yerde görünmeyen belirtilmemiş bir gerekçeyi hedef alır. Büyük modeller ayrıca kendi yeni zorluğunu da getirdi: sözel olarak ifade edilen güven, ham token olasılıklarından daha iyi kalibre edilmiştir ancak yine de bir sıralama sinyali olarak güvenilir değildir, bu nedenle bir modelin kesinliği, hangi çıkarılan argümanın en önemli olduğunu belirlemek için kullanılamaz.
Korpus darboğazı ortadan kalktı. Yapısal sorunlar bir adım bile ilerlemedi — ve bir çözüm kostümü giymiş yeni bir sorun ortaya çıktı.
- Argüman madenciliği, her alan için elle etiketlenmiş bir veri kümesine ihtiyaç duyuyordu. Genel amaçlı modellerin buna ihtiyacı yok, bu da onu sıradan iş metinlerinde kullanılabilir hale getirdi.
- Yayınlanan değerlendirmeler, genel amaçlı modellerin ilişki sınıflandırmasında, bazen ince ayar yapılmış kodlayıcı temel modellerden daha rekabetçi ve daha iyi olduğunu bulmuştur.
- Dengesizlik, bağlam bağımlılığı ve belirtilmemiş gerekçe, dilin ve görevin özellikleridir, model boyutunun değil.
- Model güveni, ham olasılıklardan daha iyi kalibre edilmiştir ancak yine de güvenilir bir sıralama sinyali değildir — yeni bir tuzak, yeni bir araç değil.
- Yardımcı olan şey, etiketin onaylanmasından önce ilişkinin kelimelerle ifade edilmesini zorlamaktır.
Alanı Tanımlayan Kısıtlama Basitçe Uygulanmayı Durdurdu
Yirmi yıl boyunca, verilerimizde argüman madenciliği yapabilir miyiz? sorusunun cevabı başka bir soru oldu: Kaç bin belgenizin önce elle anotasyon yapılmasına izin vermeye hazırsınız ve kılavuzu kim yazacak?
Bu bir teknik detay değildi. Argüman madenciliğinin araştırma laboratuvarlarında kalmasının nedeni, duygu analizinin her üründe yer almasıydı. Anotasyon gereksinimi, her yeni alanı bir yapılandırma yerine bir proje haline getirdi ve bu serideki ikinci yazıda açıklandığı gibi, yönergeler bile uzmanlar arasında tartışmalıydı.
Sonra genel amaçlı dil modelleri geldi ve bu soru sorulmamaya başlandı. Artık daha önce hiç anotasyon yapılmamış bir alandaki bir toplantı transkriptine bir model yönlendirebilir ve kullanılabilir bir ilk taslak elde edebilirsiniz. Bu yeteneğin ürünlerde aniden ortaya çıkmasının nedenini merak ettiyseniz, işte bu sebeptir.
Sıfır Atış Tüm Hikayedir
Değişen spesifik şey, alanına özgü denetimin kaldırılmasıdır. Bir istemle yönlendirilen model, dil konusunda genel bir yetkinlik getirir ve bir iddianın ne olduğunu ve bir önermenin ne olduğunu, istemde, çıkarım zamanında belirtmek mümkündür.
İlişki temelli argüman madenciliği üzerine yayımlanan çalışmalar, birkaç örnekle yönlendirme ile genel amaçlı modellerin, birden fazla veri seti üzerinde ince ayar yapılmış kodlayıcı temel modellerle rekabet edebildiğini — ve bazı durumlarda onları geride bıraktığını bulmuştur. Tüm değerlendirme aparatının, anotasyonlu derlemelere karşı denetimli eğitim üzerine inşa edildiği bir alan için bu, gerçek bir kesintidir.
Üç pratik sonuç ortaya çıkıyor. Alan adaptasyonu yeniden eğitim yerine istem değiştirme haline geliyor. Uzun belgeler yönetilebilir hale geliyor, çünkü bağlam pencereleri büyüdü. Ve kanıt alanı bir açıklama taşıyabilir, çünkü modelden aynı çağrıda kendini haklı çıkarması istenebilir — bu, duyulandan daha önemli olduğu ortaya çıkıyor.
Hareket Etmeyen Üç Problem
Önceki yazıda her şey hala geçerli ve ölçeğin neden bunların hiçbirini ele almadığı konusunda net olmak önemlidir.
- Sınıf dengesizliği yazmanın bir özelliğidir, eğitimin değil. Bir dava oluşturan insanlar genellikle destekleyici cümleler yazar. Tüm interneti okumuş bir model de çoğunlukla anlaşmayı okumuştur.
- Bağlam bağımlılığı, görevin bir özelliğidir. Destek ve saldırı, cümle nitelikleri değil, ilişkileridir. Farklı bir üst cümle altında aynı cümle farklı bir etikete sahiptir ve dünya bilgisi bunun değişmesini sağlamaz.
- Belirtilmemiş gerekçe metnin bir özelliğidir. Eğer kanıtı sonuca bağlayan ilke asla yazılmadıysa, bu girdi içinde yoktur. Daha büyük bir model aynı eksik cümleyi okur.
Dördüncü, daha ince bir durum var. Akıcı bir model akıcı bir çıktı üretir, bu nedenle hataları iyi bir şekilde ifade edilmiş ve içsel olarak tutarlıdır. Bir kodlayıcıdan gelen yanlış bir ilişki etiketi gürültü gibi görünüyordu. Bir dil modelinden gelen yanlış bir ilişki etiketi ise bir argüman gibi görünür.
Yeni Tuzak: Modelin Kendi Kesinliğine Güvenmek
Bu modeller ne kadar emin olduklarını raporlayabildiğinden, bu sayıyı kullanmak cazip hale geliyor — çıkarılan argümanları sıralamak, hangilerinin önemli olduğuna karar vermek, neyin gösterileceğini belirlemek için.
Saurav Kadavath ve meslektaşlarının çalışmaları, sözel olarak ifade edilen öz değerlendirmelerin ham token olasılıklarından anlamlı şekilde daha iyi kalibre edildiğini bulmuştur. Bu sonuç genellikle sayıya güvenmek için bir izin olarak alıntılanmaktadır. Sonraki değerlendirmeler ise sürekli olarak daha az cesaret verici olmuştur: alternatiften daha iyi olmak, güvenilir olmakla aynı şey değildir ve kalibrasyon, tam da ihtiyaç duyduğunuz yerlerde, zor ve alışılmadık durumlarda bozulur.
Uygulamada gizli bir kategori hatası da var. Güven, modelin gerçek bir argüman bulduğuna ne kadar emin olduğunu ölçer. Bu, o argümanın tartışmanın merkezi olup olmadığı hakkında hiçbir şey söylemez. Kesin bir şekilde ifade edilmiş bir istatistik, kolay ve yüksek güvenilirlikte bir çıkarımken; aslında tez olan temkinli bir cümle zordur. Güvene göre sıralama, kanıtları öne çıkarır ve iddiaları geri plana atar — bu da tam olarak bu serinin son gönderisinde açılan bir başarısızlıktır.
Bunu iyi bildiğin bir transkripte test et.
Açıkça hatırladığınız bir toplantıyı alın ve herhangi bir AI aracına ana argümanın ne olduğunu sorun. Eğer size, aslında kararı yönlendiren gevşek cümle yerine en kesin, en iyi kanıtlanmış cümleyi veriyorsa, güvenin önem yerine geçtiğini görmüşsünüzdür — ve artık o sıralamaya güvenmemeniz gerektiğini biliyorsunuz.
Yardım: Önce Neden Dediğini Yapmak Ne Anlama Geliyor
Bu modellerle mevcut en güvenilir iyileştirme neredeyse utanç verici derecede basit. Etiket öncesinde akıl yürütmeyi isteyin.
Bir modelin bir katkının ebeveynine ne yaptığını yazmasını gerektirmek — bu, yukarıdaki itirazı güçlendirir, çünkü bu itirazın geçerli olmasının başka bir nedenini sağlar — destek veya saldırı kararı vermeden önce, kararı ölçülebilir şekilde iyileştirir. Yazılı adım, ebeveyn ilişkisini modelin çalışma bağlamına zorlar, bu da cümlenin ifadesinin sağlamadığı tam olarak gereken bilgidir.
Bu, tamamen insana ait bir tekniğin makine versiyonudur. Bu nedenle steelmaning işe yarar: bir argümanın aslında ne yaptığını ifade etmek, onu yargılamadan önce, yargıyı değiştirir.
Peki, Argüman Madenciliği Çözüldü mü?
Hayır, geriye kalanların şekli artık her zamankinden daha net.
Pratikte çözülen şey erişimdir. Bugün herhangi bir kuruluş, birkaç yıl önce düşünülemezken, kendi metni üzerinde argüman madenciliği yapabilir. Bu gerçek ve büyük bir değişimdir.
Çözülemeyen şey yapı: hangi katkının hangisine yanıt verdiği ve hangi yönde, bağlayıcı ilke belirtilmediğinde ve verilerin herkesin — insan ve makine — anlaşma beklemesine neden olduğu durumlarda. Dürüst bir pozisyon, çıkarımın artık herhangi bir alanda iyi bir taslak ürettiğidir ve bir kişinin hala anlaşmazlıkları kontrol etmesi gerektiğidir. Bu, hiç kimsenin yapıyı inşa etmediği durumdan çok daha iyi bir iş bölümü.
Bunu Nasıl Kullanırsınız
- Güvene göre sıralamayın. Bu, önem değil, çıkarım kesinliğini ölçer ve sistematik olarak kanıtları iddiaların üzerinde teşvik eder.
- İlişkiyi sorun, duyguyu değil. Yararlı soru, bunun ebeveynine ne yaptığıdır — asla konuyla ilgili nasıl hissettiği değildir.
- Etiketi vermeden önce gerekçeyi haklı çıkarın. Yazılı gerekçe, ebeveyn ilişkisini bağlama oturtan şeydir ve hataları yakaladığınız yerdir.
- Değerlendirme zamanınızı anlaşmazlıklara harcayın. Modellerin en zayıf olduğu ve karar değerinin yoğunlaştığı yer burasıdır.
Daha İyi Bir Taslak, Bir Karar Değil
Argüman madenciliğini laboratuvarlarda tutan darboğaz ortadan kalktı ve geri gelmeyecek. Bu konuda net olmak önemli: bu, bir araştırma tekniği ile kendi toplantılarınıza uygulayabileceğiniz bir şey arasındaki farktır.
Ama 1958'de zor olan sorunlar şimdi de zor. Arama emri hala yazılmamış, anlaşmazlık hala nadir, ve etiket hala ifadelere değil, ebeveyne bağlı. Değişen şey, sorunu kimin yaşayacağı — ki, yirmi yıl boyunca anotatörleri bekleyen bir alan için bu yeterince büyük bir değişim.
Argüman madenciliği serisi
Makinelerin argümanları okumayı nasıl öğrendiğine dair beş gönderi — bu alanın nereden geldiği, zor problemlerinin neden zor olduğu ve bunu nasıl uyguladığımız.
Mantıkçıların reddettiği 1958 tarihli bir felsefe kitabının, bir makine öğrenimi görevine yönelik spesifikasyon haline nasıl geldiği.
Argüman madenciliğini bir fikirden ölçülebilir bir göreve dönüştüren elle etiketlenmiş derlemelerin on yılı.
Verilerde anlaşmazlık nadirdir ve cümlenin içermediği bağlama bağlıdır.
Uygulama: argüman kategorileri, her kategori için bir ana iddia ve neden güvenin yanlış sıralama sinyali olduğu.
Kaynaklar ve Daha Fazla Okuma
Alanın ön-LLM durumu — kaymanın ölçüldüğü temel olarak faydalıdır.
Sözel olarak ifade edilen öz değerlendirme, ham token olasılıklarını geride bırakır — sonuç genellikle sayıya güvenme izni olarak yanlış okunur.
LLM yaklaşımlarının karşılaştırıldığı denetimli kıyaslama sonuçları.
Emirname — ölçeğin sağlamadığı, çünkü metinden değil, modelden eksik olan yazılı olmayan adım.
Sıkça Sorulan Sorular
Büyük dil modelleri argüman madenciliğini nasıl değiştirdi?
Her yeni alan için elle anotasyon yapılmış bir korpus gereksinimini kaldırdılar. Bir istemle yönlendirilen genel amaçlı model, alan spesifik eğitim verisi olmadan iddiaları, önermeleri ve ilişkileri tanımlayabilir; bu da argüman madenciliğini bir araştırma tekniğinden sıradan kurumsal metinlerde kullanılabilir bir şeye dönüştürdü.
LLM'ler, argüman madenciliğinde ince ayar yapılmış modellerden daha mı iyidir?
İlişki temelli argüman madenciliği üzerine yapılan yayınlanmış değerlendirmeler, genel amaçlı modellerin birden fazla veri setinde ince ayar yapılmış kodlayıcı temel modellerle rekabetçi ve bazı durumlarda daha iyi olduğunu bulmuştur. Daha büyük pratik avantaj, yeni bir alan için hiç anotasyonlu eğitim verisine ihtiyaç duymamalarıdır.
LLM'ler hangi sorunları çözmedi?
Üç yapısal olanlar. Sınıf dengesizliği, insanların yazma biçimlerini yansıtır, modellerin eğitim biçimlerini değil. Destek ile saldırı, kelimelere değil, ebeveyne bağlıdır. Ve itirazlar genellikle metinden eksik olan belirtilmemiş bir gerekçeyi hedef alır, bu nedenle model yeteneğinin hiçbir miktarı bunu sağlamaz.
Bir modelin güven puanına güvenebilir misiniz?
Bir sıralama sinyali olarak değil. Sözlü güven, ham token olasılıklarından daha iyi kalibre edilmiştir ancak mutlak terimlerde güvenilir değildir ve önem yerine çıkarım kesinliğini ölçer — bu nedenle, buna göre sıralama yapmak, gerçek iddiaları taşıyan daha gevşek cümleler yerine iyi belgelenmiş detayları sistematik olarak teşvik eder.
LLM'lerle ilişki sınıflandırmasını aslında ne geliştirir?
Modelin, bir destek veya saldırı etiketine bağlı kalmadan önce, bir katkının ebeveynine ne yaptığını kelimelerle ifade etmesini gerektirir. Yazılı adım, ebeveyn ilişkisini çalışma bağlamına zorlar; bu, cümlenin kendi ifadesinin sağlamakta başarısız olduğu bilgilere tam olarak karşılık gelir.
Argüman madenciliği artık çözülmüş bir problem mi?
Erişim çözüldü — herhangi bir kuruluş bunu kendi metni üzerinde bir anotasyon programı olmadan çalıştırabilir. Yapı ise çözülmedi. Hangi katkının hangi katkıya yanıt verdiğini ve hangi yönde olduğunu belirlemek zor olmaya devam ediyor, bu nedenle çıkarım iyi bir taslak üretiyor ve bir kişi hala anlaşmazlıkları gözden geçiriyor.
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
Düzeltilebilecek bir taslak
Çıkarma yapılar oluşturur; anlaşmazlıkları gözden geçirirsiniz. Bir transkripti yapıştırın ve iş bölümünü görün.
Alan için referans sayfası — görevler, tarihçe ve ilişkilerin neden zor kısım olduğu.
Reddedilen 1958 felsefe kitabından bugüne kadar olan tüm alanın yayılımı.
Kategoriler, her kategori için bir ana iddia ve neden güvenin yanlış sıralama sinyali olduğu.
Bunu kendi transkriptinizde çalıştırın.
Hiçbir anotasyon programı, hiçbir korpus, hiçbir eğitim çalışması yok — sadece gözden geçirmek için yapılandırılmış bir artı ve eksi ağacı var.
Ücretsiz başla