Argument Mining

From Toulmin to Transformers: How Argument Mining Became a Technology

AT
Argumentree Team
Decision Science
July 29, 2026
11 min leggere
From Toulmin to Transformers: How Argument Mining Became a Technology

Da Toulmin ai Trasformatori: Come il Mining degli Argomenti è Diventato una Tecnologia | Argumentree

L'argomentazione automatica è il campo dell'IA che identifica automaticamente le affermazioni, le ragioni fornite per esse e se ciascuna ragione supporta o attacca ciò a cui è collegata. Le sue fondamenta sono filosofiche piuttosto che computazionali. Nel 1958, Stephen Toulmin pubblicò "The Uses of Argument", che si distaccò dalla logica formale descrivendo come gli argomenti quotidiani siano effettivamente costruiti: affermazione, motivi, garanzia, supporto, qualificatore, confutazione. I logici formali lo rifiutarono in gran parte; il libro trovò invece il suo pubblico tra studiosi di retorica e comunicazione, e il suo vocabolario è ancora il vocabolario del campo. Douglas Walton catalogò successivamente i modelli ricorrenti del ragionamento quotidiano come schemi argomentativi, ciascuno con domande critiche che rivelano dove fallisce. James Freeman distinse l'attacco a una conclusione dall'attacco all'inferenza che porta ad essa. L'argomentazione automatica divenne un compito computazionale misurabile solo negli anni 2010, quando apparvero corpora annotati: i saggi persuasivi di Christian Stab e Iryna Gurevych, i microtesti argomentativi di Andreas Peldszus e Manfred Stede. Seguirono modelli neurali, e i grandi modelli linguistici rimossero il requisito di un corpus annotato a mano in ogni nuovo dominio. Ciò che non è cambiato è quale metà sia difficile: trovare affermazioni è in gran parte risolto, e decidere cosa si attacca a cosa, e se supporta o attacca, non lo è.

Share:
TL;DR

Un libro di filosofia che i logici scartarono nel 1958 si rivelò essere la specifica per un compito di apprendimento automatico che nessuno avrebbe tentato per altri cinquanta anni.

  • Il modello di Toulmin del 1958 — affermazione, motivazioni, garanzia — fu rifiutato dai logici formali e divenne comunque il vocabolario operativo del mining degli argomenti.
  • Walton ha catalogato come le persone discutono realmente e ha allegato domande critiche a ciascun modello che mostrano dove si rompe.
  • Il campo è diventato misurabile negli anni 2010, quando i corpora annotati hanno permesso di confrontare sistemi concorrenti sugli stessi testi.
  • I modelli di linguaggio di grandi dimensioni hanno rimosso il collo di bottiglia del corpus: non è più necessario avere migliaia di esempi annotati a mano per ogni dominio.
  • La metà difficile non si è mai mossa. Trovare le rivendicazioni è in gran parte risolto; decidere cosa attacca cosa non lo è.

Il libro che doveva porre fine a una carriera

Quando Stephen Toulmin pubblicò The Uses of Argument nel 1958, la ricezione da parte dei logici professionisti fu ostile. Aveva scritto un libro sul ragionamento che rifiutava di essere sulla logica formale, e gli fu detto, in effetti, che si era allontanato dalla mappa. Toulmin raccontò in seguito che un collega cominciò a chiamarlo il suo libro anti-logica.

Non ha messo fine alla sua carriera. Quello che ha fatto è stato trovare un pubblico completamente diverso. I dipartimenti di retorica e comunicazione — specialmente negli Stati Uniti — hanno adottato il libro e costruito curricula su di esso, perché Toulmin aveva fatto qualcosa che la logica formale non si era mai preoccupata di fare. Aveva descritto come appare un argomento quando una persona reale ne fa uno.

Sessant'anni dopo, se chiedi a una macchina di leggere un verbale di una riunione e dirti cosa è stato discusso, utilizzerà il vocabolario di Toulmin per rispondere. Questa è la storia di questa serie, e questo post ne è l'arco: come un libro di filosofia che i logici hanno rifiutato è diventato la specifica per un compito di apprendimento automatico.

Cosa ha realmente cambiato Toulmin

La logica formale si occupa di validità: date queste premesse, questa conclusione segue? È uno strumento eccellente e descrive quasi nulla di ciò che le persone dicono realmente. Nessuno argomenta in sillogismi.

La mossa di Toulmin è stata quella di porre una domanda diversa — non è valido ma come è costruito. Ha suddiviso un vero argomento in sei parti, e tre di esse svolgono il lavoro pesante:

  • Affermare — la posizione che viene proposta. Ciò che stai effettivamente chiedendo a qualcuno di accettare.
  • Motivi — i fatti offerti a sostegno. Le prove, i dati, l'esempio.
  • Garanzia — il principio che autorizza il passaggio dai fondamenti alla rivendicazione. Quasi mai espresso ad alta voce.

Il mandato è quello interessante, ed è il motivo per cui l'argomentazione automatica è difficile piuttosto che noiosa. Il ponte è strutturalmente insicuro, quindi dovremmo chiuderlo contiene una premessa nascosta: che le strutture insicure dovrebbero essere chiuse. Nessuno dice quella frase. Tutti la danno per scontata. Una macchina che legge il testo deve ricostruire un passaggio che non è nel testo.

Le altre tre parti — supporto, qualificatore, confutazione — gestiscono le riserve e le eccezioni. Insieme descrivono un argomento come una struttura piuttosto che come una catena, e quella visione strutturale è ciò che ha reso tutto computabile in seguito.

Walton e la Domanda che Rompe l'Argomento

Se Toulmin ha dato al campo la sua anatomia, Douglas Walton gli ha fornito una guida sul campo. Lavorando negli anni '90 e 2000, Walton ha catalogato i modelli ricorrenti del ragionamento quotidiano — appello all'opinione di esperti, argomento per analogia, argomento per conseguenze, argomento per segno — come schemi argomentativi.

Il catalogo è utile. Ciò che lo rende potente è la seconda metà: ogni schema è accompagnato da domande critiche, le sfide specifiche che rivelano dove quel modello fallisce. Per quanto riguarda l'appello all'opinione degli esperti: questa persona è realmente un esperto in questo campo? Altri esperti sono d'accordo? L'affermazione è coerente con le prove?

Questa è la cosa più utile in tutta la tradizione per chiunque si trovi in una riunione, e non costa nulla da applicare. Quando qualcuno argomenta per autorità, non è necessario dissentire dalla conclusione. Si pone la domanda critica che il modello stesso invita. Non è aggressivo; è ciò che l'argomento richiede.

Freeman e la distinzione che lo rese computabile

Il lavoro di James Freeman del 1991 sulla macrostruttura dell'argomento ha aggiunto il pezzo che contava di più per le macchine. Ha tracciato una netta distinzione tra due cose che le persone chiamano casualmente disaccordo.

Puoi attaccare una conclusione — sostenere che sia falsa. Oppure puoi attaccare l'inferenza — accettare ogni fatto offerto e negare che la conclusione ne derivi. Il tuo studio è difettoso e il tuo studio è valido ma non mostra ciò che pensi mostri sono mosse completamente diverse, e trattarle come una sola fa perdere gran parte delle informazioni in un vero disaccordo.

Freeman ha anche separato le premesse che funzionano solo insieme da quelle che possono stare da sole — la differenza tra un argomento che crolla se rimuovi una gamba e uno che semplicemente diventa più debole. Una volta che hai queste distinzioni, un argomento non è più prosa. È un grafo etichettato, e un grafo etichettato è qualcosa su cui un computer può essere valutato.

Poi non accadde nulla per vent'anni

La teoria era in atto all'inizio degli anni '90. Il campo computazionale non è arrivato fino agli anni 2010, e il motivo non è affascinante: non c'era nulla con cui misurarsi.

Un campo di ricerca diventa un campo di ricerca quando approcci concorrenti possono essere confrontati sugli stessi dati. Questo ha richiesto che qualcuno si sedesse con migliaia di documenti e segnasse, a mano, quali parti erano affermazioni, quali erano premesse e quali supportavano o attaccavano quali. Christian Stab e Iryna Gurevych lo hanno fatto per saggi persuasivi. Andreas Peldszus e Manfred Stede hanno costruito un corpus di brevi testi argomentativi specificamente per studiare la struttura.

Quel lavoro è trattato adeguatamente in il prossimo post di questa serie. Ciò che conta qui è la forma che ha rivelato. Una volta che puoi valutare i sistemi, puoi vedere quali parti sono difficili — e la risposta è stata immediata e non è mai realmente cambiata.

La domanda da porre nel tuo prossimo incontro

Quando qualcuno successivamente argomenta per autorità — un consulente, un benchmark, uno studio nominato — non sfidare la conclusione. Fai invece la domanda di Walton: è questo un esperto in questa cosa specifica, e altri esperti sono d'accordo? Nota quanto spesso nessuno ha verificato.

Trovare le richieste è facile. Tutto il resto non lo è.

I benchmark pubblicati raccontano una storia coerente. Sul corpus degli saggi persuasivi, identificare e etichettare i componenti argomentativi raggiunge circa il 73% di F1. Decidere come quei componenti si relazionano tra loro — cosa si attacca a cosa, e se supporta o attacca — si attesta intorno al 48%. Sul corpus CDCP di dati di commenti pubblici costruito da Joonsuk Park e Claire Cardie, la rilevazione delle relazioni scende a circa il 34%.

Quella lacuna è il campo. Non è un artefatto di modelli deboli e ha resistito a ogni cambiamento di architettura da allora. Il rilevamento è migliorato costantemente. Le relazioni si sono mosse a malapena.

Le ragioni sono strutturali piuttosto che tecniche, e sono oggetto di terzo post di questa serie: il disaccordo è raro nei dati, dipende dal contesto che la frase non contiene, e il passo connettivo è solitamente non dichiarato — la garanzia di Toulmin, ancora mancante, sessant'anni dopo.

Ma non è solo elaborazione del linguaggio naturale?

Utilizza la stessa macchina, quindi l'obiezione è giusta. La differenza sta in ciò che viene recuperato.

L'analisi del sentiment chiede come si sente un testo. La sintesi chiede cosa dice. Il riconoscimento delle entità nominate chiede chi e cosa appare in esso. Tutti e tre riguardano il contenuto. L'estrazione di argomenti chiede riguardo alla struttura — quale frase sta svolgendo un lavoro argomentativo su quale altra frase, e in quale direzione.

Quella distinzione ha un vantaggio pratico. Una frase può essere formulata in modo negativo pur sostenendo l'affermazione a cui è collegata: la pressione temporale aumenta il rischio rafforza un argomento secondo cui il progetto è rischioso. Qualsiasi sistema di valutazione per tono lo interpreta al contrario, ogni volta. L'argomento informativo che il mining recupera non è nelle parole. È nelle relazioni tra di esse.

Cosa hanno cambiato i grandi modelli e cosa non hanno cambiato

L'ultimo capitolo è quello che tutti conoscono. I modelli di linguaggio di uso generale possono eseguire compiti di estrazione di argomenti senza essere stati addestrati prima su un corpus annotato, il che rimuove il più grande ostacolo pratico che il campo ha mai avuto: la necessità di migliaia di esempi etichettati a mano per ogni nuovo dominio.

Quella è una vera discontinuità, ed è ciò che ha reso l'argomentazione mineraria utilizzabile su testi aziendali ordinari piuttosto che solo su corpora di saggi curati. È trattato nel quarto post.

Quello che non ha fatto è chiudere il divario. I problemi strutturali rimangono ancora strutturali. Un modello che ha letto l'intero internet deve ancora decidere se questa obiezione era rivolta a quella ragione o alla conclusione che ne deriva, e il testo ancora non lo dice.

Cosa suggeriscono sessant'anni di questo riguardo ai tuoi stessi argomenti

  • Il mandato è dove di solito risiede il disaccordo. Due persone che concordano su ogni fatto e che ancora non sono d'accordo stanno discutendo un principio non dichiarato. Nominalo e la conversazione si accorcia.
  • Attaccare l'inferenza non è la stessa cosa che attaccare i fatti. Decidere quale delle due cose stai facendo — ad alta voce — salva l'altra persona dal difendere la cosa sbagliata.
  • Ogni appello all'autorità viene con la propria domanda di prova. Walton le ha annotate. Usarle non è ostilità; è il modello che funziona come previsto.
  • La struttura è ciò che sopravvive. Sei mesi dopo, nessuno ricorda la formulazione. Ciò di cui hanno bisogno è quale obiezione è stata sollevata e se qualcuno ha risposto.

Il Libro dell'Anti-Logica

I critici di Toulmin avevano ragione su una cosa: The Uses of Argument non era davvero un libro sulla logica formale. Era un libro su come le persone ragionano quando le conseguenze sono reali e le premesse sono contestabili e nessuno ha tempo per un sillogismo.

Si è rivelato essere il problema più difficile e quello più utile. Ogni sistema che oggi legge un verbale e ti dice cosa è stato affermato, su quali basi e cosa è stato argomentato contro, sta lavorando dalla sua descrizione. Non male per un libro anti-logico.

La serie di estrazione degli argomenti

Cinque post su come le macchine hanno imparato a leggere argomenti — da dove proviene il campo, perché i suoi problemi difficili sono difficili e come lo applichiamo.

Domande Frequenti

Che cos'è l'argomentazione mining?

L'argomentazione automatica è il ramo dell'IA che identifica automaticamente la struttura argomentativa all'interno di un testo ordinario: quali frasi fanno affermazioni, quali forniscono motivazioni e se ogni motivazione supporta o attacca l'affermazione a cui è collegata. L'output è una mappa strutturata piuttosto che un riassunto.

Chi ha fondato l'argomentazione mining?

Non c'è un singolo fondatore. Le basi teoriche sono il modello di struttura dell'argomento di Stephen Toulmin del 1958, ampliato dagli schemi di argomentazione di Douglas Walton e dalla descrizione della macrostruttura dell'argomento di James Freeman. Il campo computazionale ha preso forma negli anni 2010, una volta che i corpora annotati lo hanno reso misurabile.

Perché il libro di Toulmin era controverso?

Perché era un libro sul ragionamento che rifiutava di essere sulla logica formale. Toulmin sosteneva che la validità è la domanda sbagliata per l'argomentazione quotidiana e descriveva invece la struttura. I logici professionisti lo rifiutarono in gran parte; studiosi di retorica e comunicazione lo adottarono e costruirono curricula su di esso.

Che cos'è un mandato nel modello di Toulmin?

Il warrant è il principio che autorizza il passaggio dai tuoi fondi alla tua affermazione. In "il ponte è insicuro, quindi dovremmo chiuderlo", il warrant è che le strutture insicure dovrebbero essere chiuse. I warrant quasi mai vengono espressi ad alta voce, ed è proprio per questo che estrarre argomenti automaticamente è difficile.

Quali sono gli schemi argomentativi di Walton?

Schemi ricorrenti del ragionamento quotidiano — appello all'opinione degli esperti, argomento per analogia, argomento per conseguenze — ciascuno abbinato a domande critiche che rivelano dove quel modello fallisce. Le domande critiche sono la metà praticamente utile: ti offrono un modo per testare un argomento senza semplicemente negarne la conclusione.

Perché la rilevazione delle relazioni è più difficile rispetto alla ricerca di affermazioni?

Poiché le relazioni dipendono dal contesto che la frase non contiene, il passo di collegamento è solitamente non dichiarato e il disaccordo è raro nei dati annotati. I benchmark pubblicati mostrano una rilevazione dei componenti intorno al 73% di F1 rispetto alla rilevazione delle relazioni vicino al 48% sullo stesso corpus e circa il 34% su quelli più difficili.

I modelli di linguaggio di grandi dimensioni hanno risolto il mining degli argomenti?

Hanno rimosso il più grande ostacolo pratico — la necessità di un corpus annotato a mano in ogni nuovo dominio — il che ha reso la tecnologia utilizzabile su testi aziendali ordinari. Non hanno chiuso il divario strutturale. Decidere cosa si attacca a cosa, e in quale direzione, rimane la parte difficile.

AT

Argumentree Team

Decision Science

The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.

Trasforma una discussione in un albero degli argomenti.

Sessant'anni di teoria dell'argomentazione, applicata al verbale del tuo prossimo incontro.

Inizia gratis

Letture correlate