Argument Mining

How Argumentree Turns a Transcript Into an Argument Tree

AT
Argumentree Team
Decision Science
July 29, 2026
9 min lesen
How Argumentree Turns a Transcript Into an Argument Tree

Wie Argumentree ein Transkript in einen Argumentbaum umwandelt | Argumentree

Argumentree verwendet Argument Mining, um ein unstrukturiertes Transkript oder Dokument in einen Pro- und Contra-Argumentbaum umzuwandeln. Die Extraktion umfasst vier Schritte: Sie findet die Textstellen, die Ansprüche oder Gründe enthalten, kennzeichnet, was jeder einzelne ist, ermittelt, welcher Grund zu welchem Anspruch gehört, und entscheidet, ob jede Verbindung das darüberliegende unterstützt oder angreift. Zwei Designentscheidungen prägen das Ergebnis. Erstens werden Argumente in einwortige Kategorien wie Kosten, Risiko, Zeitrahmen oder Rechtliches gruppiert, und genau ein Argument pro Kategorie wird als Hauptanspruch dieser Kategorie hervorgehoben. Zweitens wird der Hauptanspruch nicht durch den eigenen Vertrauensscore des Modells ausgewählt. Vertrauen misst, wie sicher die Extraktion war, nicht wie zentral das Argument ist, und verbalisiertes LLM-Vertrauen ist bekannt dafür, schlecht kalibriert zu sein. Stattdessen wird der Hauptanspruch aus mehreren Signalen gleichzeitig ausgewählt, wobei das stärkste Signal die Zentralität ist — wie viele andere Argumente daran anknüpfen — und Abstraktheit, da ein Hauptanspruch eine allgemeine Position darstellt, während die unterstützenden Beweise spezifisch sind. Ein Argument, das einen Prozentsatz, eine Währungszahl oder eine benannte Studie enthält, wird als Beweis für einen Anspruch und nicht als der Anspruch selbst behandelt. Jedes extrahierte Argument muss die Quelle wörtlich zitieren; alles, was im Originaltext nicht gefunden werden kann, wird verworfen, bevor der Baum angezeigt wird. Das Ergebnis ist ein Entwurf, den die Menschen korrigieren, umstrukturieren und bewerten können, kein Urteil.

Share:
TL;DR

Die Extraktion ist die einfache Hälfte. Die schwierige Hälfte ist die Struktur — zu entscheiden, was der Hauptpunkt ist, was lediglich Beweis dafür ist und was tatsächlich dagegen spricht.

  • Argumente werden in einwortige Kategorien gruppiert — Kosten, Risiko, Zeitrahmen, Rechtliches — und genau eines pro Kategorie wird zur Hauptbehauptung dieser Kategorie.
  • Der Hauptanspruch ist nicht der, bei dem das Modell am zuversichtlichsten war. Die Vertrauensmaße messen die Extraktionssicherheit, nicht die Wichtigkeit.
  • Hauptansprüche sind allgemein; Beweise sind spezifisch. Ein Argument, das einen Prozentsatz oder eine benannte Studie enthält, wird als Unterstützung für einen Anspruch betrachtet, nicht als der Anspruch selbst.
  • Jedes Argument muss die Quelle wortwörtlich zitieren. Alles, was im Originaltext nicht zu finden ist, wird entfernt, bevor Sie es sehen.
  • Das Ergebnis ist ein Entwurf. Menschen korrigieren, überarbeiten und bewerten ihn – die Maschine erstellt die Struktur, die Gruppe behält das Urteil.

Die selbstbewussteste Antwort war die falsche.

Füttern Sie ein neunzigminütiges Budgetmeeting in eine Extraktionsmaschine und fragen Sie sie, welches Argument am wichtigsten war, und sie wird Ihnen oft eine Statistik liefern. Etwas wie "das Finanzmodell prognostiziert eine Reduzierung der Betriebsausgaben um 20%" — präzise, gut belegt, und das Modell ist sich dessen sehr sicher.

Es ist auch die falsche Antwort. Dieser Satz ist nicht das Argument. Es ist der Beweis für ein Argument, das jemand vierzig Minuten früher gemacht hat und viel lockerer formuliert hat: wir sollten die beiden Teams zusammenlegen, weil es Geld sparen wird. Der vage Satz ist die Behauptung. Der präzise ist das, was es stützt.

Diese Unterscheidung ist das ganze Problem, ein Gespräch in eine Struktur zu verwandeln, und es ist wert, dies im Hinterkopf zu behalten, wenn Sie das nächste Mal Ihre eigenen Besprechungsnotizen lesen. Die Sätze, die am quotierbarsten erscheinen, sind in der Regel die, die am wenigsten argumentative Arbeit leisten.

Was die Extraktion richtig machen muss

Argument Mining — das Forschungsfeld dahinter, das 2019 von John Lawrence und Chris Reed untersucht wurde — wird normalerweise in vier Aufgaben unterteilt, die zunehmend schwieriger werden.

  • Finde die argumentativen Teile. Die meisten Sätze in einem echten Meeting sind Logistik, Begrüßungen oder Wiederholungen. Nur einige enthalten eine Behauptung oder einen Grund.
  • Bezeichnen Sie, was jeder Teil ist. Eine Behauptung ist eine Position. Eine Prämisse ist ein Grund dafür. Beweise sind die Daten hinter dem Grund. Der gleiche Satz kann in einem Dokument eine Behauptung und in einem anderen eine Prämisse sein.
  • Finde heraus, was auf was reagiert. Ein Grund gehört zu einer spezifischen Behauptung; ein Einwand gehört zu einem spezifischen Grund. Das ist es, was eine Liste in einen Baum verwandelt.
  • Entscheide dich für Unterstützung oder Angriff. Für jeden Link: Stärkt dies das, woran es angehängt ist, oder schwächt es es?

Die ersten beiden Probleme sind weitgehend gelöst. Die letzten beiden sind es nicht, und veröffentlichte Benchmarks zeigen die Lücke deutlich: Bei dem von Christian Stab und Iryna Gurevych annotierten Korpus für persuasive Essays erreicht die Komponentenerkennung etwa 73% F1, während die Beziehungserkennung bei etwa 48% liegt. Bei dem von Joonsuk Park und Claire Cardie erstellten CDCP-Korpus sinkt die Beziehungserkennung auf etwa 34%.

Die interessanten Designentscheidungen liegen also nicht im Finden. Sie liegen in der Strukturierung — und genau da kommen die Kategorien ins Spiel.

Warum Argumente in Kategorien sortiert werden

Eine echte Diskussion dreht sich nicht nur um eine Sache. Eine Entscheidung zur Zusammenlegung von zwei Teams betrifft gleichzeitig die Kosten, die Moral, die rechtlichen Risiken und die Dauer des Prozesses. Das sind verschiedene Debatten, die im selben Raum stattfinden, und sie in eine Liste zu flatten, ergibt etwas, das niemand lesen kann.

Jedes extrahierte Argument ist mit einer einzelnen Kategorie gekennzeichnet — Kosten, Risiko, Zeitrahmen, Rechtliches, Sicherheit, Umfang. Einzelnes Wort, absichtlich. In dem Moment, in dem Kategorien zu Phrasen werden, fragmentiert dasselbe Thema in nahezu Duplikate: Budgetauswirkungen und Kostenüberlegungen und Finanzielles Risiko sind eine Debatte, die drei Hüte trägt, und der Baum teilt sich in Äste, die eins hätten sein sollen.

Die Einschränkung wird durchgesetzt, anstatt angefordert zu werden. Kategorien werden auf eine einzige kanonische Form normalisiert, und eine Kategorie ist eine Eigenschaft des oberen Endes eines Zweigs — alles unter einem Hauptanspruch erbt die Kategorie dieses Hauptanspruchs. Ein Kostenargument erhält kein Kind in der Risikokategorie; wenn das Kind tatsächlich mit Risiko zu tun hat, gehört es stattdessen unter den Hauptanspruch Risiko.

Ein Hauptargument pro Kategorie

Innerhalb jeder Kategorie wird genau ein Argument zum Hauptanspruch erhoben — die zentrale Position, die alles andere in dieser Kategorie unterstützt oder angreift. Alles andere in der Kategorie wird direkt oder indirekt zu einem Kind davon.

Dies ist die einzig entscheidende Wahl im gesamten Prozess. Wenn Sie es richtig machen, liest sich der Abschnitt wie ein Argument: hier ist die Position zu den Kosten, hier sind drei Gründe dafür, hier ist der Einwand gegen den zweiten Grund. Wenn Sie es falsch machen, erhalten Sie die Umkehrung von der Spitze dieses Artikels — eine Statistik, die oben in einem Abschnitt steht, während die Behauptung, die sie unterstützen sollte, darunter schwebt, als wäre sie ein Detail.

Der offensichtliche Ansatz funktioniert nicht.

Die intuitive Antwort besteht darin, das Argument zu fördern, bei dem das Modell am zuversichtlichsten war. Das schlägt fehl, aus einem Grund, der es wert ist, verstanden zu werden.

Das Vertrauen misst, wie sicher die Extraktion war, dass sie ein echtes Argument gefunden hat. Es misst nicht, wie zentral dieses Argument für die Debatte ist. Eine präzise formulierte Statistik mit einer benannten Quelle ist eine einfache, hochvertrauenswürdige Extraktion. Ein vager, abgeschwächter Satz, der zufällig die tatsächliche These ist, ist eine schwierige, niedrigvertrauenswürdige Extraktion. Die Einstufung nach Vertrauen fördert systematisch die Beweise und entwertet die Behauptung.

Es gibt ein zweites Problem, das dem ersten zugrunde liegt. Arbeiten von Saurav Kadavath und Kollegen bei Anthropic haben ergeben, dass die verbalisierten Zuversichtswerte von Sprachmodellen besser kalibriert sind als die rohen Token-Wahrscheinlichkeiten — aber nachfolgende Bewertungen haben wiederholt gezeigt, dass sie in absoluten Begriffen immer noch nicht gut kalibriert sind. Es ist ein nutzbares Signal. Es ist kein zuverlässiges Ranking.

Was wählt tatsächlich die Hauptforderung aus

Statt eines Signals werden mehrere kombiniert — und das stärkste davon ist strukturell und nicht linguistisch.

  • Zentralität. Wie viele andere Argumente hängen an diesem? Die Behauptung, auf die alles andere reagiert, ist fast immer die zentrale Behauptung. Dies ist das nächstgelegene, was einem zuverlässigen Signal entspricht, da es eine Eigenschaft der Position des Arguments in der Debatte und nicht seiner Formulierung ist.
  • Abstraktheit. Hauptansprüche sind allgemein; Beweise sind spezifisch. Dies ist direkt Toulmin: In seinem Bericht von 1958 ist der Anspruch die Schlussfolgerung und die Gründe sind die konkreten Fakten, die darunter liegen.
  • Argumentative Sprache. Diskursmarker — deshalb, das zentrale Thema ist, ich würde argumentieren — signalisieren, dass ein Sprecher eine Position äußert, anstatt ein Detail zu liefern.
  • Kürze. Zentrale Aussagen sind in der Regel kurz. Ein langer Satz enthält normalerweise Qualifikationen, was die unterstützenden Materialien tun.
  • Position. Ein schwaches Signal, aber ein echtes: Thesen neigen dazu, früh zu erscheinen.

Abstraktheit wird gemessen, indem man nach den Fingerabdrücken der Spezifität sucht. Ein Prozentsatz, ein Geldbetrag, eine quantifizierte Entität, eine zitierte Phrase, eine benannte Institution — jede dieser Angaben macht es wahrscheinlicher, dass es sich nicht um die Hauptbehauptung handelt, da jede ein Merkmal von Gründen und nicht von einer Schlussfolgerung ist. Remote-Arbeit verbessert die Produktivität ist eine Behauptung. Eine Umfrage unter 500 Arbeitnehmern ergab eine Zufriedenheit von 78% ist das, was man sagt, wenn jemand fragt, warum.

Die Kombination mehrerer schwacher Signale ist besser, als einem stark aussehenden zu vertrauen — aus demselben Grund schneidet eine Gruppe mit unterschiedlichen Perspektiven besser ab als ein selbstbewusster Einzelner, ein Muster, das in warum Vielfalt Fähigkeiten übertrifft untersucht wird.

Versuche dies bei deinem letzten Treffen selbst.

Nehmen Sie die letzte Entscheidung, die Ihr Team getroffen hat. Können Sie das stärkste Argument dagegen benennen — und wissen Sie, wer es vorgebracht hat? Wenn Sie das nicht können, ist das kein Gedächtnisproblem. Es ist ein Strukturproblem: Ihr Protokoll hat festgehalten, was entschieden wurde, aber nicht, was argumentiert wurde, was genau die Lücke ist, die die Extraktion zu schließen versucht.

Nichts überlebt, was nicht in der Quelle ist.

Ein Argument, das plausibel klingt, aber nie tatsächlich vorgebracht wurde, ist schlimmer als ein fehlendes — es ist ein falscher Bericht darüber, was Ihr Team gesagt hat. Daher trägt jedes extrahierte Argument die genaue Formulierung, aus der es stammt, und jedes Argument, dessen zitiertes Beweismaterial im Quellendokument nicht gefunden werden kann, wird entfernt, bevor der Baum jemandem gezeigt wird.

Das ist unglamourös und es ist der Teil, der den Rest nutzbar macht. Ein Baum, den Sie nicht auf das Transkript zurückverfolgen können, ist eine Zusammenfassung mit zusätzlichen Schritten.

Aber ist das nicht einfach Zusammenfassung mit zusätzlichen Schritten?

Es ist der offensichtliche Einwand, und die Antwort liegt darin, was jeder wegwirft.

Eine Zusammenfassung komprimiert. Sie sagt Ihnen grob, was in der Sitzung behandelt wurde und, wenn sie gut ist, was beschlossen wurde. Was sie nicht bewahren kann, ist die Form der Meinungsverschiedenheit — dass dieser spezifische Einwand gegen diesen spezifischen Grund erhoben wurde, dass er beantwortet wurde und dass ein zweiter Einwand nie erhoben wurde. Zusammenfassungen verlieren genau den Teil, der wichtig ist, wenn die Entscheidung acht Monate später erneut betrachtet wird und sich niemand erinnern kann, warum die offensichtliche Alternative abgelehnt wurde.

Die Unterscheidung trennt auch das Argument Mining von der Sentimentanalyse, die die Einstellung misst, anstatt das Denken. Ein Satz kann negativ formuliert sein und dennoch den Punkt unterstützen, an den er angehängt ist — "Zeitdruck erhöht das Risiko" stärkt die Behauptung, dass das Projekt riskant ist. Wenn man das nach Ton bewertet, erhält man es jedes Mal verkehrt herum.

Der Output ist ein Entwurf, und das ist der Punkt.

Was aus der Extraktion herauskommt, ist ein Vorschlag: hier ist, was wir denken, wurde argumentiert, hier ist, wie wir denken, dass es zusammenpasst. Die Leute korrigieren es dann — sie ordnen ein Argument neu, das an die falsche Behauptung angehängt wurde, teilen eines, das zwei Punkte zusammengeführt hat, fördern etwas, das bei der Bewertung falsch verstanden wurde, und bewerten, was sie überzeugend finden.

Diese Unterteilung ist absichtlich. Die Struktur von Hand zu erstellen, ist mühsame Arbeit, die die Teams davon abhält, es überhaupt zu tun. Zu beurteilen, ob ein Argument gut ist — ob die Beweise stichhaltig sind, ob die unausgesprochene Annahme akzeptabel ist — ist nicht mühsam. Es ist das eigentliche Denken, und es bleibt in der Gruppe.

Was das bedeutet, wenn Sie Ihre eigenen Besprechungsprotokolle lesen

  • Die zitierfähige Zeile ist normalerweise nicht die Behauptung. Präzise, gut belegte Sätze sind typischerweise Beweise. Die Behauptung, die sie unterstützen, ist oft vager und leichter zu übersehen.
  • Zähle, was an was anhaftet. Der Punkt, auf den alle anderen reagierten, ist der Punkt, der wichtig war, unabhängig davon, wer ihn am selbstbewusstesten äußerte.
  • Nennen Sie die Kategorien. Wenn Sie nicht sagen können, um welche zwei oder drei Themen es bei einer Entscheidung ging, war die Diskussion nicht strukturiert — sie wurde transkribiert.
  • Suche nach dem Einwand, auf den niemand geantwortet hat. Es ist das Nützlichste in jedem Argumentationsprotokoll, und das Erste, was eine flache Zusammenfassung zerstört.

Der vage Satz war das Argument.

Die Statistik war nie der Punkt. Es war die Antwort auf eine Frage, die jemand zu einer Behauptung gestellt hatte, die bereits gemacht worden war — vage, früh und in der Art von Satz, der nie in die Protokolle aufgenommen wird.

Die Strukturierung einer Diskussion bedeutet, diesen Satz wieder an die Spitze des Zweigs zu setzen, wo er hingehört, mit den Beweisen darunter und den Einwänden, die an die spezifischen Gründe angehängt sind, die sie bestreiten. Dafür ist ein Baum da. Und das ist der Grund, warum die selbstsicherste Antwort so oft die falsche ist.

Die Argumentationsbergbau-Serie

Dieser Beitrag behandelt, wie wir Argument Mining anwenden. Der Rest der Serie behandelt, wo das Feld herkommt und warum seine schwierigen Probleme schwierig sind.

Häufig gestellte Fragen

Wie verwandelt Argumentree ein Transkript in einen Argumentbaum?

Es wird Argument Mining angewendet: das Finden der Textstellen, die Ansprüche oder Gründe enthalten, das Kennzeichnen, was jeder einzelne ist, das Herausfinden, welcher Grund zu welchem Anspruch gehört, und das Entscheiden, ob jede Verbindung den Punkt darüber unterstützt oder angreift. Das Ergebnis ist ein Pro- und Contra-Baum, den die Menschen dann überprüfen und korrigieren.

Was sind Argumentkategorien und warum Einzelwörter?

Kategorien gruppieren eine Diskussion in ihre separaten Debatten — Kosten, Risiko, Zeitrahmen, Rechtliches. Sie sind auf Einzelwörter beschränkt, da kategorien mit mehreren Wörtern fragmentieren: Budgetauswirkungen, Kostenüberlegungen und finanzielles Risiko sind eine Debatte, die drei Hüte trägt, und der Baum teilt sich in Äste, die hätte eins sein sollen.

Was bedeutet ein Hauptargument pro Kategorie?

Innerhalb jeder Kategorie wird genau ein Argument als zentrale Behauptung hervorgehoben, und alles andere in dieser Kategorie wird darunter angeordnet. Das ist es, was einen Zweig als Argument lesbar macht — eine Position, die Gründe dafür und die Einwände gegen diese Gründe — anstatt eine flache Liste verwandter Sätze.

Warum ist das Hauptargument nicht einfach das mit dem höchsten Vertrauen?

Denn das Vertrauen misst, wie sicher die Extraktion war, nicht wie zentral das Argument ist. Eine präzise formulierte Statistik ist eine einfache, hochvertrauenswürdige Extraktion; der vage Satz, der die eigentliche These ist, ist eine schwierige. Die Rangordnung nach Vertrauen fördert systematisch Beweise und entwertet Behauptungen.

Wie unterscheidet sich das von der Zusammenfassung von Meetings?

Eine Zusammenfassung komprimiert und erzählt, was behandelt wurde. Sie kann die Form der Meinungsverschiedenheit nicht bewahren — dass dieser Einwand gegen jenen Grund erhoben wurde, dass er beantwortet wurde und dass ein anderer nicht beantwortet wurde. Zusammenfassungen verlieren genau den Teil, der wichtig ist, wenn eine Entscheidung später erneut betrachtet wird.

Was hindert die KI daran, Argumente zu erfinden, die niemand vorgebracht hat?

Jedes extrahierte Argument trägt die genaue Formulierung, aus der es stammt, und jedes Argument, dessen zitiertes Beweismaterial im Quellendokument nicht gefunden werden kann, wird entfernt, bevor der Baum angezeigt wird. Ein Argument, das plausibel klingt, aber nie geäußert wurde, ist schlimmer als ein fehlendes.

Kann ich ändern, was die Extraktion produziert hat?

Ja — das ist der beabsichtigte Arbeitsablauf. Das Ergebnis ist ein Entwurf. Die Leute ordnen Argumente, die an den falschen Anspruch angehängt sind, neu zu, teilen zusammengeführte Punkte auf, fördern etwas, das bei der Bewertung falsch war, und bewerten, was sie überzeugend finden. Die Maschine baut die Struktur auf; die Gruppe behält das Urteil.

AT

Argumentree Team

Decision Science

The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.

Verwandeln Sie Ihr nächstes Meeting in einen Argumentationsbaum.

Strukturiere die Argumentation, nicht nur das Protokoll — damit der Einwand, auf den niemand geantwortet hat, auch in sechs Monaten noch sichtbar ist.

Kostenlos starten

Verwandte Lektüre