Как Argumentree Превращает Транскрипт в Дерево Аргументов | Argumentree
Argumentree использует аргументный майнинг для преобразования неструктурированного транскрипта или документа в дерево аргументов "за" и "против". Извлечение выполняет четыре задачи: находит фрагменты текста, содержащие утверждения или причины, маркирует каждое из них, определяет, какая причина относится к какому утверждению, и решает, поддерживает ли каждая связь или атакует то, что находится выше. Два дизайнерских выбора формируют вывод. Во-первых, аргументы группируются в однословные категории, такие как Стоимость, Риск, Сроки или Юридические аспекты, и ровно один аргумент из каждой категории продвигается как основное утверждение этой категории. Во-вторых, основное утверждение не выбирается на основе собственного коэффициента уверенности модели. Уверенность измеряет, насколько точно было извлечение, а не насколько центральным является аргумент, и известна плохая калибровка вербализованной уверенности LLM. Вместо этого основное утверждение выбирается сразу по нескольким сигналам, самым сильным из которых является центральность — сколько других аргументов к нему относится — и абстрактность, поскольку основное утверждение является общей позицией, в то время как его поддерживающие доказательства являются конкретными. Аргумент, содержащий процент, сумму в валюте или названное исследование, рассматривается как доказательство для утверждения, а не само утверждение. Каждый извлеченный аргумент должен цитировать источник дословно; все, что не может быть найдено в оригинальном тексте, исключается перед тем, как дерево будет показано. Вывод является черновиком для людей, чтобы исправить, изменить родительские связи и оценить, а не вердиктом.
Извлечение — это легкая часть. Трудная часть — это структура: определить, что является основной мыслью, что лишь доказательством для нее, а что на самом деле противоречит ей.
- Аргументы сгруппированы в категории из одного слова — Стоимость, Риск, Сроки, Юридические — и ровно один из аргументов в каждой категории становится основным утверждением этой категории.
- Основное утверждение не является тем, в котором модель была наиболее уверена. Уровень уверенности измеряет степень уверенности в извлечении, а не важность.
- Основные утверждения являются общими; доказательства конкретными. Аргумент, содержащий процент или названное исследование, рассматривается как поддержка утверждения, а не само утверждение.
- Каждый аргумент должен цитировать источник дословно. Всё, что не может быть найдено в оригинальном тексте, отбрасывается до того, как вы это увидите.
- Результат — это черновик. Люди исправляют, переосмысляют и оценивают его — машина создает структуру, группа сохраняет суждение.
Самый уверенный ответ оказался неверным.
Вставьте девяностоминутное заседание по бюджету в систему извлечения и спросите, какой аргумент имел наибольшее значение, и она часто выдаст вам статистику. Что-то вроде "финансовая модель прогнозирует 20% сокращение операционных расходов" — точно, хорошо обоснованно, и модель в этом очень уверена.
Это также неправильный ответ. Это предложение не является аргументом. Это доказательство аргумента, который кто-то привел сорок минут назад и сформулировал гораздо более расплывчато: нам следует объединить две команды, потому что это сэкономит деньги. Расплывчатое предложение является утверждением. Точное — это то, что его поддерживает.
Это различие является всей проблемой превращения разговора в структуру, и стоит помнить об этом в следующий раз, когда вы будете читать свои собственные заметки с собраний. Предложения, которые выглядят наиболее цитируемыми, обычно являются теми, которые выполняют наименьшую аргументативную работу.
Что должно быть правильно в экстракции
Аргументный майнинг — это исследовательская область, рассмотренная Джоном Лоуренсом и Крисом Ридом в 2019 году — обычно делится на четыре задачи, и они становятся сложнее по мере продвижения.
- Найдите аргументированные части. Большинство предложений на настоящей встрече касаются логистики, приветствий или повторения. Только некоторые содержат утверждение или причину.
- Обозначьте, что представляет собой каждая часть. Утверждение — это позиция. Посыл — это причина для этого. Доказательства — это данные, стоящие за причиной. Одна и та же фраза может быть утверждением в одном документе и посылом в другом.
- Разберитесь, что на что отвечает. Причина относится к конкретному утверждению; возражение относится к конкретной причине. Это и превращает список в дерево.
- Решите, поддерживать или атаковать. Для каждой ссылки: усиливает ли она то, к чему прикреплена, или ослабляет?
Первые два вопроса в значительной степени решены. Последние два — нет, и опубликованные эталонные данные ясно показывают разрыв: в корпусе убедительных эссе, аннотированном Кристианом Стабом и Ирыной Гуревич, обнаружение компонентов достигает около 73% F1, в то время как обнаружение отношений находится на уровне около 48%. В корпусе CDCP, созданном Джунсуком Паком и Клэр Кардие, обнаружение отношений падает примерно до 34%.
Таким образом, интересные дизайнерские решения заключаются не в нахождении. Они заключаются в структурировании — и именно здесь вступают в игру категории.
Почему аргументы сортируются по категориям
Настоящая дискуссия не сводится к одной теме. Решение о консолидации двух команд одновременно касается затрат, морального состояния, юридических рисков и времени, необходимого для этого. Это разные дебаты, происходящие в одной комнате, и сведение их в один список приводит к тому, что никто не может его прочитать.
Таким образом, каждый извлеченный аргумент помечен одним словом-категорией — Стоимость, Риск, Сроки, Юридические вопросы, Безопасность, Объем. Одно слово, намеренно. В тот момент, когда категории становятся фразами, одна и та же тема распадается на почти дубликаты: Влияние на бюджет и Соображения по стоимости и Финансовый риск — это один спор в трех обличьях, и дерево распадается на ветви, которые должны были быть одним.
Ограничение применяется, а не запрашивается. Категории нормализуются до единой канонической формы, и категория является свойством вершины ветви — все, что находится под основным утверждением, наследует категорию этого основного утверждения. Аргумент о стоимости не получает дочернюю категорию в категории Риск; если дочерняя категория действительно касается риска, она должна находиться под основным утверждением Риск.
Один основной аргумент на категорию
В каждой категории ровно один аргумент продвигается как основное утверждение — центральная позиция, которую поддерживает или атакует всё остальное в этой категории. Всё остальное в категории становится её дочерним элементом, прямо или косвенно.
Это единственный наиболее значимый выбор во всем процессе. Если сделать это правильно, ветвь будет выглядеть как аргумент: вот позиция по стоимости, вот три причины для нее, вот возражение против второй причины. Если сделать это неправильно, вы получите инверсию из начала этой статьи — статистику, находящуюся вверху ветви, с утверждением, которое она должна была поддерживать, висящим под ней, как будто это деталь.
Очевидный подход не работает.
Интуитивный ответ заключается в том, чтобы продвигать тот аргумент, в котором модель была наиболее уверена. Это не срабатывает, по причине, которую стоит понять.
Уверенность измеряет, насколько точно извлечение определило реальный аргумент. Она не измеряет, насколько центральным является этот аргумент в дебатах. Четко сформулированная статистика с указанным источником — это легкое, высоко уверенное извлечение. Неясное, осторожное предложение, которое на самом деле является тезисом, — это трудное, низко уверенное извлечение. Ранжирование по уверенности систематически продвигает доказательства и понижает значимость утверждения.
Существует вторая проблема, скрытая под первой. Работа Сауравы Кадават и его коллег в Anthropic показала, что вербализированная уверенность языковых моделей лучше откалибрована, чем сырые вероятности токенов — но последующая оценка неоднократно показывала, что она все еще плохо откалибрована в абсолютных терминах. Это полезный сигнал. Это не надежный рейтинг.
Что на самом деле выбирает основной иск
Вместо одного сигнала комбинируются несколько — и самый сильный из них является структурным, а не лингвистическим.
- Центральность. Сколько других аргументов связано с этим? Утверждение, на которое реагирует всё остальное, почти всегда является центральным утверждением. Это наиболее близкий аналог надежного сигнала, поскольку это свойство позиции аргумента в дебатах, а не его формулировки.
- Абстрактность. Основные утверждения общие; доказательства конкретные. Это напрямую относится к Тулмину: в его описании 1958 года утверждение является выводом, а основания — конкретными фактами, лежащими в его основе.
- Аргументативный язык. Дискурсные маркеры — поэтому, ключевой вопрос заключается в том, я бы утверждал — сигнализируют о том, что говорящий выражает позицию, а не предоставляет деталь.
- Краткость. Центральные утверждения, как правило, короткие. Длинное предложение обычно содержит уточнения, что и делает вспомогательный материал.
- Позиция. Слабый сигнал, но реальный: тезисы, как правило, появляются рано.
Абстрактность измеряется поиском отпечатков конкретики. Процент, сумма в валюте, количественная единица, цитата, названное учреждение — каждое из этих элементов делает аргумент менее вероятным для того, чтобы быть основным утверждением, потому что каждое из них является признаком оснований, а не заключения. Удаленная работа повышает продуктивность — это утверждение. Опрос 500 работников показал 78% удовлетворенности — это то, что вы говорите, когда кто-то спрашивает вас, почему.
Сочетание нескольких слабых сигналов лучше, чем доверие одному сильному сигналу — это та же причина, по которой группа с разнообразными взглядами превосходит уверенного индивида, что является темой, рассмотренной в почему разнообразие превосходит способности.
Попробуйте это на своей последней встрече.
Возьмите последнее решение, которое приняла ваша команда. Можете ли вы назвать единственный самый сильный аргумент против него — и можете ли вы назвать, кто его высказал? Если нет, то это не проблема памяти. Это проблема структуры: ваши записи зафиксировали то, что было решено, но не то, что обсуждалось, что и является той самой пропастью, которую пытается преодолеть экстракция.
Ничто не выживает, если этого нет в источнике.
Аргумент, который звучит правдоподобно, но на самом деле никогда не был высказан, хуже, чем отсутствующий — это ложная запись того, что сказала ваша команда. Поэтому каждый извлеченный аргумент сохраняет точную формулировку, из которой он был взят, и любой аргумент, для которого нельзя найти цитируемое доказательство в исходном документе, удаляется до того, как дерево будет показано кому-либо.
Это не гламурно, и это та часть, которая делает остальное полезным. Дерево, которое вы не можете отследить до транскрипта, — это резюме с дополнительными шагами.
Но разве это не просто резюмирование с дополнительными шагами?
Это очевидное возражение, и ответ заключается в том, что каждый из них выбрасывает.
Резюме сжимает информацию. Оно примерно рассказывает, о чем шла речь на встрече и, если оно хорошее, что было решено. То, что оно не может сохранить, — это форма разногласий: что это конкретное возражение было высказано против этой конкретной причины, что на него был дан ответ, и что второе возражение так и не было высказано. Резюме теряет именно ту часть, которая имеет значение, когда решение пересматривается восемь месяцев спустя, и никто не может вспомнить, почему очевидная альтернатива была отвергнута.
Это различие также отделяет извлечение аргументов от анализа настроений, который измеряет отношение, а не рассуждение. Предложение может быть сформулировано негативно, поддерживая при этом точку зрения, к которой оно относится — "давление сроков увеличивает риск" усиливает утверждение о том, что проект рискованный. Оцените это по тону, и вы получите обратный результат каждый раз.
Выход является черновиком, и в этом суть.
Из извлечения получается предложение: вот что, по нашему мнению, было аргументировано, вот как мы думаем, это связано друг с другом. Люди затем корректируют это — переопределяют аргумент, который был привязан к неправильному утверждению, разделяют тот, который объединил две точки, продвигают что-то, что было неправильно оценено, и оценивают то, что они находят убедительным.
Это разделение преднамеренно. Строительство структуры вручную — это утомительная работа, которая мешает командам делать это вообще. Оценка того, является ли аргумент каким-либо хорошим — выдерживает ли доказательство, приемлемо ли неявное предположение — не является утомительной. Это и есть настоящее мышление, и оно остается в группе.
Что это означает, если вы читаете свои собственные записи встреч
- Цитируемая фраза обычно не является утверждением. Точные, хорошо обоснованные предложения обычно являются доказательством. Утверждение, которое они поддерживают, часто более расплывчато и легче упускается из виду.
- Считайте, что прикрепляется к чему. То, на что отреагировали все остальные, — это то, что имело значение, независимо от того, кто сказал это с наибольшей уверенностью.
- Назовите категории. Если вы не можете сказать, о каких двух или трех темах шла речь в решении, обсуждение не было структурировано — оно было записано.
- Ищите возражение, на которое никто не ответил. Это самая полезная вещь в любом аргументированном документе, и первое, что уничтожает плоское резюме.
Неясное предложение было аргументом.
Статистика никогда не была целью. Это был ответ на вопрос, который кто-то задал о заявлении, которое уже было сделано — небрежно, рано и в таком предложении, которое никогда не попадает в протокол.
Структурирование обсуждения означает возвращение этого предложения на вершину ветви, к которой оно относится, с его доказательствами под ним и возражениями, прикрепленными к конкретным причинам, с которыми они не согласны. Для этого и предназначено дерево. И именно поэтому самый уверенный ответ так часто оказывается неверным.
Серия извлечения аргументов
В этом посте рассматривается, как мы применяем извлечение аргументов. Остальная часть серии охватывает, откуда возникла эта область и почему ее сложные проблемы являются сложными.
Как философская книга 1958 года, которую логики отвергли, стала спецификацией для задачи машинного обучения.
Десятилетие ручных аннотированных корпусов, которое превратило извлечение аргументов из идеи в измеримую задачу.
Несогласие в данных редко встречается и зависит от контекста, который не содержится в предложении.
Модели нулевого выстрела устранили узкое место корпуса и оставили структурные проблемы на своих местах.
Источники и дополнительная литература
Стандартный обзор области — определения задач, методы и открытые проблемы.
Аннотированный корпус, который сделал извлечение аргументов измеримой задачей, и источник указанных здесь показателей F1 для компонентов/отношений.
Модель претензии/основания/гарантии — источник принципа, согласно которому претензии являются общими, а основания — специфическими.
Корпус CDCP, на котором показатели обнаружения отношений составляют около 34% F1 — это более сложный конец опубликованного диапазона.
По вербализованной модели уверенности — лучше, чем сырые вероятности, но все еще не надежный сигнал для ранжирования.
Часто задаваемые вопросы
Как Argumentree превращает транскрипт в дерево аргументов?
Это применяет извлечение аргументов: нахождение отрезков текста, которые содержат утверждения или причины, маркировка каждого из них, определение, какая причина относится к какому утверждению, и решение, поддерживает ли каждая связь или атакует ли она пункт выше. Результатом является дерево "за" и "против", которое люди затем просматривают и корректируют.
Что такое категории аргументов и почему одиночные слова?
Категории группируют обсуждение в отдельные дебаты — Стоимость, Риск, Сроки, Юридические вопросы. Они ограничены отдельными словами, потому что категории длиной в фразу фрагментируют: Влияние бюджета, Учет стоимости и Финансовый риск — это один дебат, который носит три шляпы, и дерево делится на ветви, которые должны были быть одним.
Что означает один основной аргумент на категорию?
В каждой категории точно один аргумент выдвигается в качестве центрального утверждения, а все остальные элементы в этой категории располагаются под ним. Это и делает ветвь читаемой как аргумент — позиция, причины для нее и возражения против этих причин — а не плоским списком связанных предложений.
Почему основным аргументом не является просто тот, который имеет наивысшую уверенность?
Поскольку уверенность измеряет, насколько точно была выполнена экстракция, а не насколько центральным является аргумент. Четко сформулированная статистика — это легкая экстракция с высокой уверенностью; расплывчатое предложение, которое является фактической тезой, — это сложная задача. Ранжирование по уверенности систематически продвигает доказательства и понижает значимость утверждений.
Чем это отличается от резюмирования встреч?
Резюме сжимает и сообщает, что было рассмотрено. Оно не может сохранить форму разногласия — что это возражение было выдвинуто против той причины, что на него был дан ответ, а другое не было рассмотрено. Резюме теряет именно ту часть, которая имеет значение, когда решение пересматривается позже.
Что мешает ИИ выдумывать аргументы, которые никто не высказывал?
Каждый извлеченный аргумент содержит точную формулировку, из которой он был взят, и любой аргумент, для которого не удается найти цитируемое доказательство в исходном документе, удаляется перед отображением дерева. Аргумент, который звучит правдоподобно, но никогда не был высказан, хуже, чем отсутствующий.
Могу ли я изменить то, что было получено в результате извлечения?
Да — это предполагаемый рабочий процесс. Результат — это черновик. Люди переназначают аргументы, прикрепленные к неправильному утверждению, разделяют объединенные пункты, продвигают что-то, что было оценено неверно, и оценивают то, что они находят убедительным. Машина строит структуру; группа сохраняет суждение.
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
Смотрите это в своем собственном транскрипте.
Вставьте стенограмму встречи и получите структурированное дерево плюсов и минусов, которое вы можете исправить, оценить и развивать.
Поле за этим — что это такое, откуда оно взялось и почему отношения являются сложной частью.
Ручной аналог: изложение требований и причин вручную.
Запечатление того, почему было принято решение, а не только того, что было сказано.
Преобразуйте вашу следующую встречу в дерево аргументов.
Структурируйте аргументацию, а не просто запись — чтобы возражение, на которое никто не ответил, оставалось видимым через шесть месяцев.
Начать бесплатно