Saldırı Tespiti Neden Argüman Madenciliğindeki En Zor Problemdir | Argumentree
Argüman madenciliğinde, hangi cümlelerin iddia olduğunu belirlemek büyük ölçüde çözülmüşken, bir argümanın diğerini destekleyip desteklemediğine karar vermek henüz çözülmemiştir. Üç yapısal neden bu boşluğu açıklar. İlk olarak, sınıf dengesizliği: anotasyonlu derlemelerde ilişkilerin ezici çoğunluğu destek ilişkileridir ve saldırı ilişkileri küçük bir azınlıktır — bazı veri setlerinde etiketli ilişkilerin onda biri bile değildir. Destek tahmin eden bir sistem çoğu zaman doğru sonuç verir, bu nedenle eğitim sinyali anlaşmazlık tahmin etmeyi aktif olarak caydırır. İkinci olarak, bağlama bağımlılık: bir ifadenin bir şeyi saldırıp saldırmadığı, onun neye bağlı olduğuna bağlıdır, nasıl ifade edildiğine değil. Olumsuz bir şekilde ifade edilen bir cümle genellikle üstündeki iddiayı desteklerken, olumlu bir şekilde ifade edilen bir cümle genellikle ona saldırır. Üçüncü olarak, belirtilmemiş gerekçe: bir itiraz genellikle gerekçeler ile iddia arasındaki çıkarımsal adımı tartışır ve bu adım metin içinde hiçbir yerde yazılı değildir. Yayınlanmış kıyaslamalar bu etkiyi sürekli olarak göstermektedir — bileşen tespiti %73 F1 civarında, aynı ikna edici makale derlemesinde ilişki tespiti ise %48 civarındadır ve daha karmaşık kamu yorum verilerinde yaklaşık %34'tür. Bu pratikte önemlidir çünkü nadir sınıf faydalı olandır: kimsenin yanıtlamadığı en güçlü itiraz, bir karar kaydının koruması gereken tam olarak budur.
Nadir sınıf, faydalı olanıdır. Anlaşmazlık, verilerin küçük bir azınlığıdır; bu nedenle modeller bunu yeterince tahmin edemez — ve bu nedenle en önemli olanıdır.
- Saldırı ilişkileri, anotasyonlu derlemelerde küçük bir azınlıktır. Tahmin desteği genellikle doğrudur, bu nedenle modeller anlaşmazlığı düşük tahmin etmeyi öğrenir.
- Bir şeyin saldırıp saldırmaması, neye bağlı olduğuna bağlıdır, nasıl ifade edildiğine değil. Ton, aktif olarak yanıltıcı bir sinyaldir.
- Birçok itiraz, gerçekler yerine çıkarımsal adımı sorguluyor — ve o adım asla yazılmıyor.
- Yayınlanan kıyaslamalar: ~%73 F1 bileşenleri bulma, aynı korpus üzerinde ~%48 ilişkileri sınıflandırma; daha karmaşık verilerde ~%34.
- Nadir sınıf, kararların döndüğü sınıftır. Cevapsız bir itiraz, herhangi bir tartışma kaydındaki en değerli şeydir.
En Önemli Olan Sınıf, En Az Olan Sınıftır
Argüman madenciliği sistemlerinin eğitildiği ve ölçüldüğü veri kümelerinde, anlaşmazlık nadirdir. Etiketlenmiş ilişkilerin ezici çoğunluğu destek ilişkileridir: bu neden o iddiayı destekler. Saldırı ilişkileri — bu itiraz o nedeni zayıflatır — küçük bir azınlıktır, bazı veri setlerinde etiketlenmiş bağlantıların onda birinden daha azdır.
Bu tek gerçek, alanın en inatçı hata modunu üretir. Her seferinde destek tahmin eden bir sistem, çoğu zaman doğru olur ve bu dağılımdan öğrenen herhangi bir model aynı önyargıyı benimser. Uygun hale gelir.
Tam olarak bunun tersidir, çünkü birini neden uygulayacağınızdır. Hiç kimse altı ay sonra herkesin neye karar verdiğini merak ederek bir kararı yeniden gözden geçirmez. İtirazı isterler — ve itiraz, modelin en az güvendiği ve en az tahmin etme olasılığına sahip olduğu sınıftır.
Neden Dengesizlik Burada Diğer Yerlerden Daha Kötü
Sınıf dengesizliği, sıradan makine öğrenimi çözümleri ile birlikte sıradan bir makine öğrenimi problemidir — kaybı yeniden ağırlıklandırmak, nadir sınıfı aşırı örneklemek, doğruluk yerine makro ortalama puanları raporlamak. Tüm bunlar standart uygulamalardır ve hepsi bir şekilde yardımcı olur.
Argüman madenciliğini zorlaştıran şey, dengesizliğin daha fazla veri toplayarak düzeltebileceğiniz bir örnekleme artefaktı olmamasıdır. Bu, insanların yazma biçimini yansıtır. İkna edici bir makalede yazar bir argüman oluşturur, bu nedenle çoğu cümle tasarım gereği tezi destekler. Korpusu ölçeklendirmek, dengesizliği de beraberinde ölçeklendirir.
Bu nedenle alan raporları makro-F1 ve ayrı sınıf başına puanlar kullanır, ham doğruluk yerine. Saldırı tahmin etmeyen bir model, istediğiniz şey için işe yaramazken, saygın görünen bir genel sayı ortaya koyabilir. Sadece başlık rakamını okumak, başarısızlığı tamamen gizler.
Ton sadece yardımcı değil — aynı zamanda yanıltıcıdır.
Sezgisel yaklaşım, dile bakmaktır. Olumsuz kelimeler, temkinli ifadeler, karşıt bir üslup — bunlar kesinlikle bir saldırıyı işaret eder.
Bunu yapmazlar ve karşı örnekler kenar durumlar değildir. Bir projenin riskli olduğu iddiasını düşünün. zaman baskısı riski artırır cümlesi olumsuz bir şekilde ifade edilmiştir ve bu iddiayı destekler — projenin riskli olmasının başka bir nedenini sunar. Şimdi uzun vadeli tasarruflar başlangıç yatırımını dengeleyecek ifadesini düşünün, bu da maliyetlerin engelleyici olduğu iddiasıyla ilişkilidir. Her yerde olumlu kelimeler var ve bu iddiayı saldırır.
Bir şeyin destekleyip desteklemediği, cümlenin değil, ilişkinin bir özelliğidir. Farklı bir üst cümleye eklenen aynı cümle, etiketini değiştirir. Bu nedenle, yaptığı işte çok iyi olan duygu analizi yanlış bir araçtır: cümleyi okur ve cevap cümlede değildir.
Tuzağa Düşmek: Konuya Göre Tutum Değerlendirmek, Ebeveyn Yerine
Bu hatanın, açıkça yanlış çıktılar yerine kendinden emin bir şekilde yanlış çıktılar ürettiği için adını vermeye değer özel bir versiyonu vardır.
Bir öneri hakkında bir tartışma hayal edin. Birisi bir itirazda bulunur — öneri, bir takımda çok fazla yetki topluyor. İkinci bir kişi, bu itirazın doğru olduğunu belirten bir neden ekler. O ikinci katkı, bir itiraz olan ana önerisini destekler. Bu, karşıt bir dal içinde destekleyici bir hamledir.
Bir duruşu belirlemek için bu cümle öneriyi destekliyor mu? diye soran bir sistem, durumu tersine çevirir, pekiştirmeyi bir saldırı olarak etiketler ve hata daha sonra yayılır: bir anti-teklif argümanı, oylamanın pro tarafında ortaya çıkar. Sorulması gereken soru, cümlenin konu hakkında ne düşündüğü değil, doğrudan üstündeki şeye ne yaptığıdır.
Kendi cevapsız itirazınızı bulun.
Son çeyrekte ekibinizin aldığı bir kararı değerlendirin. O karara karşı en güçlü argümanı belirtin ve ardından o argüme verilen yanıtı söyleyin. İtirazı belirtebilir ama yanıtı veremezseniz, karar kaydınızdaki en değerli unsuru bulmuşsunuz demektir — ve destek yanlısı bir aracın en az ortaya çıkaracağı şeydir.
Asla Yazılmamış Bir Adıma İtiraz
Üçüncü neden en derin olanıdır ve Toulmin'e kadar uzanır. Birçok gerçek itiraz, aslında gerçekleri sorgulamaz. Onlar <em>çıkarımı</em> — kanıtı sonuca bağlayan belirtilmemiş ilkeyi sorgularlar.
Birisi %13'lük bir verimlilik artışını gösteren bir çalışmayı alıntılayarak politikanın benimsenmesi gerektiğini sonucuna varıyor. İtiraz, çalışma popülasyonunun bu organizasyona hiç benzemediği yönündedir. Hiçbir gerçek sorgulanmamıştır. Sorgulanan şey, oradaki bir sonucun buraya aktarılabileceği garantisidir. Bu ilke, transkripte hiçbir yerde yer almıyor, çünkü kimse bunu söylemedi.
Bu serinin ilk gönderisinde ele alındığı gibi, gerekçe yeniden yapılandırması Toulmin'in merkezi içgörüsüydü ve alanın en az çözülen problemi olmaya devam ediyor. Bir ilişkiyi sınıflandırması istenen bir sistem bazen girdi olarak bulunmayan bir önermeyi yeniden yapılandırmak zorunda kalır ve ardından itirazın o önermeyi, kanıtı veya sonucu hedef alıp almadığına karar vermelidir.
Ama kesinlikle daha büyük bir model bunu düzeltir, değil mi?
Bu makul bir beklentidir ve uzun bir süre kısmen yanlış olduğu için ilginçtir.
Ölçek, bilgi ve akıcılığa yardımcı olur ve gerçekten de argüman madenciliğini geliştirmiştir — bu hikaye bu serideki bir sonraki yazıdır. Ancak yukarıdaki üç sorundan hiçbiri bir bilgi sorunu değildir. Dengesizlik, insanların yazma şeklinin bir özelliğidir. Bağlam bağımlılığı, görev tanımının bir özelliğidir. Eksik gerekçe ise metnin bir özelliğidir.
Daha büyük bir model aynı transkripti okuduğunda, hala ihtiyaç duyduğu prensibi belirten bir cümle bulamaz, üzerinde ayarlandığı şeyde çoğunlukla anlaşma görür ve hala bir itirazın hangi üç makul hedefe yönelik olduğunu belirlemek zorundadır. Yetenek arttı; problemin yapısı değişmedi.
Gerçekten Ne Yardımcı Olur
- Sınıfları ayrı ayrı puanlayın. Tek bir başlık numarası, asla anlaşmazlık tahmin etmeyen bir modelin yetkin görünmesini sağlar. Sınıf başına F1, başarısızlığı hemen görünür kılar.
- Anne babayı sorun, konuyu asla sormayın. Doğru bir etiket veren tek soru, bu katkının hemen üstündeki şeye ne yaptığıdır.
- Karardan önce akıl yürütmeyi açık hale getirin. Destek vermeye veya saldırmaya karar vermeden önce ilişkinin yazılı bir gerekçesini zorlamak, hata yakalanabilirken onu yüzeye çıkarır.
- Nadir sınıf için bir insanı devrede tutun. Anlaşmazlık, modellerin en zayıf olduğu ve değerin en yüksek olduğu yerdir — inceleme dikkatini harcamanız gereken tam yer.
Faydalı Sınıf Nadir Olandır
Verilerle ilgili her şey bir sistemi uzlaşmaya yönlendirir. Dağılım bunu ödüllendirir, ifadeler buna yönlendirir ve kritik bağlantı adımı genellikle metinden tamamen eksiktir.
Ve aslında ihtiyacınız olan tek şey, kimsenin cevaplamadığı itirazdı. Bu yüzden bu, argüman madenciliğindeki en zor problemdir ve bu çabaya değer: nadir sınıf, faydalı sınıftır.
Argüman madenciliği serisi
Makinelerin argümanları okumayı nasıl öğrendiğine dair beş gönderi — bu alanın nereden geldiği, zor problemlerinin neden zor olduğu ve bunu nasıl uyguladığımız.
1958'de mantıkçıların reddettiği bir felsefe kitabının, bir makine öğrenimi görevine yönelik spesifikasyon haline nasıl geldiği.
Argüman madenciliğini bir fikirden ölçülebilir bir göreve dönüştüren elle etiketlenmiş derlemelerin on yılı.
Sıfırdan öğrenme modelleri, metin kümesi darboğazını ortadan kaldırdı ve yapısal sorunları tam olarak oldukları yerde bıraktı.
Uygulama: argüman kategorileri, her kategori için bir ana iddia ve neden güvenin yanlış sıralama sinyali olduğu.
Kaynaklar ve Daha Fazla Okuma
İkna edici makale sonuçları genellikle bileşen ile ilişki arasındaki fark için alıntılanır.
CDCP korpusu, ilişki tespitinin gerçek kamu yorumu metninde yaklaşık %34 F1'e düştüğü yerdir.
Yetki belgesi — iddiaları destekleyen gerekçeleri birbirine bağlayan belirtilmemiş ilke ve birçok itirazın aslında hedef aldığı şey.
İtiraz ve zayıflatma: bir sonuca saldırmak, ona giden çıkarıma saldırmaktan farklı bir hamledir.
İlişki temelli argüman madenciliği ve bunun değerlendirme pratiği üzerine bir anket çalışması.
Sıkça Sorulan Sorular
Saldırı tespitinin destek tespitinden neden daha zor olduğunu?
Üç neden bir araya geliyor. Saldırı ilişkileri, etiketlenmiş verilerin küçük bir azınlığını oluşturur, bu nedenle modeller, destek tahmininin genellikle güvenli olduğunu öğrenir. Bir şeyin saldırı olup olmadığı, onun nasıl ifade edildiğinden ziyade neye bağlı olduğuna bağlıdır. Ve birçok itiraz, belirtilen bir gerçeğe değil, belirtilmemiş bir çıkarım adımına yöneliktir.
Argüman madenciliğinde sınıf dengesizliği nedir?
Açıklamalı derlemelerde, ilişkilerin ezici çoğunluğu saldırıdan ziyade destek niteliğindedir — bazı veri setlerinde saldırılar etiketlenmiş ilişkilerin onda birinden daha azdır. İkna edici metin yazarları bir argüman oluşturduğundan, bu durum insanların yazma biçimini yansıtır, bu nedenle daha fazla veri toplamak dengesizliği düzeltmek yerine artırır.
Neden duygu analizi anlaşmazlığı tespit etmekte işe yaramıyor?
Çünkü destek ve saldırı, bir ilişkinin özellikleridir, bir cümlenin değil. "Zaman çizelgesi baskısı riski artırır" olumsuz bir şekilde ifade edilmiştir ve bir projenin riskli olduğu iddiasını destekler. Aynı cümleyi farklı bir üst başlık altına taşıdığınızda, etiketi değişir. Duygu, cümleyi okur; cevap cümlede değildir.
Çürütme ile zayıflatma arasındaki fark nedir?
İtiraz, sonuca karşı çıkar — bunun yanlış olduğunu savunur. Zayıflatma, kanıtı kabul eder ve sonucun ondan çıkmadığını reddeder. "Çalışmanız hatalı" ve "çalışmanız iyi ama bunu göstermiyor" farklı hamlelerdir ve bunları birleştirmek, gerçek bir anlaşmazlıktaki bilgilerin çoğunu kaybettirir.
Sistemler argüman ilişkilerini ne kadar iyi tespit ediyor?
Yayınlanan karşılaştırmalar tutarlı bir fark gösteriyor. İkna edici makale veri kümesinde, bileşen tanımlama yaklaşık %73 F1 seviyesine ulaşırken, ilişki sınıflandırması %48 civarında kalıyor. Daha karmaşık CDCP kamu yorumu veri kümesinde, ilişki tespiti yaklaşık %34'e düşüyor. Bu fark, model mimarisindeki ardışık değişikliklere rağmen devam etti.
Daha büyük dil modelleri saldırı tespitini çözer mi?
Boşluğu kapatmadan geliştiriyorlar. Üç temel sorundan hiçbiri bir bilgi sorunu değil: dengesizlik, insanların yazma biçimini yansıtır, bağlama bağımlılığı görevin doğasında vardır ve eksik gerekçe metinden yoktur. Aynı transkripti okuyan daha büyük bir model de hâlâ bu üç sorunla karşı karşıya kalır.
Nadir sınıf neden en önemli?
Çünkü kararlar, anlaşma yerine itirazlara dayanır. Hiç kimse, herkesin üzerinde anlaştığı bir kararı yeniden gözden geçirmez; en güçlü karşı argümanın ne olduğunu ve bunun hiç yanıtlanıp yanıtlanmadığını bilmek isterler. İşte bu, destek yanlısı bir sistemin en az yüzeye çıkma olasılığına sahip olduğu sınıftır.
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
İtirazı görünür tutun
Artı ve eksi ağaçları, hangi itirazın hangi nedene karşı yapıldığını ve hangi itiraza kimsenin yanıt vermediğini korur.
Alan için referans sayfası — görevler, tarihçe ve ilişkilerin neden zor kısım olduğu.
Reddedilen 1958 felsefe kitabından bugüne kadar olan tüm alanın yayını.
Cevaplamadan önce karşıt argümanı güçlendirmek — bu sorunu çözmenin insani versiyonu.
En güçlü itirazı kaybetmeyin.
Tartışmayı öyle yapılandırın ki, altı ay sonra hala yanıtlanmamış olan argüman görünür kalsın.
Ücretsiz başla