Когда LLM встретились с аргументным майнингом: что изменилось, а что нет | Argumentree
На протяжении большей части своей истории вычислительная добыча аргументов требовала ручной аннотации корпуса для каждой новой области. Это требование было ограничивающим фактором в данной области: усилия по аннотации были значительными, руководства оспаривались, а система, настроенная на студенческих эссе, плохо переносилась на стенограммы встреч или публичные комментарии. Большие языковые модели устранили это ограничение. Модель общего назначения может выполнять обнаружение компонентов и классификацию отношений по запросу, без специфических для домена обучающих данных, и опубликованные оценки показали, что запрашиваемые модели общего назначения конкурентоспособны и в некоторых случаях лучше, чем тонко настроенные базовые модели кодировщиков в области добычи аргументов на основе отношений. Это изменило назначение добычи аргументов: она стала применимой к обычным организационным текстам, а не только к курируемым исследовательским корпусам. То, что не изменилось, так это структура сложных задач. Дисбаланс классов отражает, как люди пишут, а не как модели обучаются. Поддерживает ли вклад или атакует, зависит от его родителя, а не от формулировки. И возражения часто нацелены на неявное основание, которое нигде не упоминается в тексте. Большие модели также ввели новую сложность: вербализованная уверенность лучше откалибрована, чем сырые вероятности токенов, но все еще ненадежна как сигнал ранжирования, поэтому уверенность модели не может быть использована для определения, какой извлеченный аргумент имеет наибольшее значение.
Корпусное узкое место исчезло. Структурные проблемы не сдвинулись ни на дюйм — и появилась новая, в костюме решения.
- Аргументный анализ раньше требовал рукописного корпуса для каждой области. Общие модели, основанные на подсказках, этого не требуют, что сделало их применимыми к обычным бизнес-текстам.
- Опубликованные оценки показывают, что универсальные модели, обученные с использованием подсказок, конкурентоспособны с, а иногда и превосходят, специализированные базовые модели кодировщиков в задаче классификации отношений.
- Несбалансированность, зависимость от контекста и неявное основание являются свойствами языка и задачи, а не размера модели.
- Уверенность модели лучше откалибрована, чем сырые вероятности, но все еще не является надежным сигналом для ранжирования — это новая ловушка, а не новый инструмент.
- Что действительно помогает, так это заставить отношения быть сформулированными словами до того, как будет присвоен ярлык.
Ограничение, которое определяло область, просто перестало действовать.
На протяжении двадцати лет ответ на вопрос можем ли мы провести аргументный анализ наших данных? был другим вопросом: сколько тысяч ваших документов вы готовы сначала аннотировать вручную, и кто напишет руководство?
Это не была техническая деталь. Это была причина, по которой аргументный анализ оставался в исследовательских лабораториях, в то время как анализ настроений внедрялся в каждый продукт. Требование аннотации делало каждую новую область проектом, а не конфигурацией, и, как описано в втором посте этой серии, сами рекомендации оспаривались даже среди специалистов.
Затем появились языковые модели общего назначения, и этот вопрос перестал задаваться. Теперь вы можете указать одну из них на стенограмму встречи в области, которую никто никогда не аннотировал, и получить пригодный для использования первый вариант. Если вы когда-либо задумывались, почему эта возможность появилась в продуктах внезапно, а не постепенно, вот причина.
Нулевой выстрел — это вся история
Конкретное изменение заключается в удалении специализированного надзора. Модель с подсказкой обладает общей компетенцией в языке и может быть проинструктирована о том, что такое утверждение и что такое предпосылка, в подсказке во время вывода.
Опубликованные работы по аргументированию на основе отношений обнаружили универсальные модели с несколькими примерами, которые конкурируют с дообученными базовыми моделями кодировщиков на нескольких наборах данных — и в некоторых случаях опережают их. Для области, вся оценочная аппаратура которой была построена на контролируемом обучении на аннотированных корпусах, это является подлинным разрывом.
Следуют три практических последствия. Адаптация домена становится переключением подсказок, а не повторным обучением. Длинные документы становятся управляемыми, потому что размеры контекстных окон увеличились. И поле доказательства может содержать объяснение, потому что модель может быть запрошена обосновать себя в том же вызове — что оказывается более важным, чем кажется.
Три проблемы, которые не сдвинулись
Все в предыдущем посте по-прежнему актуально, и стоит точно объяснить, почему масштаб не решает ни одной из этих проблем.
- Несбалансированность классов — это свойство написания, а не обучения. Люди, строящие аргументы, в основном пишут поддерживающие предложения. Модель, которая прочитала весь интернет, тоже в основном читала согласие.
- Зависимость от контекста — это свойство задачи. Поддержка и атака — это отношения, а не атрибуты предложения. Одно и то же предложение под другим родителем имеет другую метку, и никакое количество знаний о мире это не изменит.
- Неявный ордер является свойством текста. Если принцип, связывающий доказательства с выводом, никогда не был записан, его нет в исходных данных. Более крупная модель читает то же самое отсутствующее предложение.
Существует четвертый, более тонкий аспект. Плавная модель генерирует плавный вывод, поэтому ее ошибки выглядят хорошо сформулированными и внутренне согласованными. Неправильная метка отношения от кодировщика выглядит как шум. Неправильная метка отношения от языковой модели выглядит как аргумент.
Новая ловушка: доверие уверенности модели
Поскольку эти модели могут сообщать о том, насколько они уверены, возникает соблазн использовать это число — для ранжирования извлеченных аргументов, для определения того, какие из них важны, для ограничения того, что будет показано.
Работа Сауравы Кадават и коллег показала, что вербализованная самооценка значительно лучше откалибрована, чем сырые вероятности токенов. Этот результат часто цитируется как основание для доверия к числу. Последующая оценка была последовательно менее обнадеживающей: лучше, чем альтернатива, не означает надежно, и калибровка ухудшается именно там, где это необходимо, в сложных и необычных случаях.
В практике также скрывается ошибка категории. Уверенность измеряет, насколько модель была уверена в том, что она нашла реальный аргумент. Это ничего не говорит о том, является ли этот аргумент центральным в дебатах. Четко сформулированная статистика — это легкая, высоко уверенная экстракция; предложение с оговорками, которое на самом деле является тезисом, — это сложное. Ранжирование по уверенности продвигает доказательства и умаляет утверждения — что и является именно той неудачей, с которой открывается последний пост в этой серии.
Проверьте это на расшифровке, которую вы хорошо знаете.
Возьмите встречу, исход которой вы помните ясно, и спросите любой инструмент ИИ, каков был основной аргумент. Если он предоставит вам самое точное, хорошо обоснованное предложение, а не то расплывчатое, которое на самом деле повлияло на решение, вы только что стали свидетелем того, как уверенность заменила важность — и теперь вы знаете, что не стоит доверять этому ранжированию.
Что означает Помощь: Сначала объясните, почему
Наиболее надежное улучшение, доступное с этими моделями, почти смущающе простое. Запрашивайте обоснование перед меткой.
Требование от модели записать, что вклад делает для своего родителя, усиливает вышеупомянутое возражение, поскольку предоставляет еще одну причину, по которой это возражение имеет место — прежде чем принять решение о поддержке или атаке, это значительно улучшает вердикт. Письменный шаг заставляет родительскую связь войти в рабочий контекст модели, что именно та информация, которую формулировка предложения не предоставляет.
Это машинная версия тщательно человеческой техники. Именно поэтому стилмэннинг работает: формулирование того, что на самом деле делает аргумент, перед его оценкой, изменяет суждение.
Так решена проблема извлечения аргументов?
Нет, и форма того, что осталось, теперь яснее, чем когда-либо.
Что решено, практически говоря, так это доступ. Любая организация может сегодня проводить анализ аргументации над своим текстом без программы аннотирования, что было немыслимо несколько лет назад. Это реальное и значительное изменение.
Не решена структура: какой вклад отвечает на какой и в каком направлении, когда соединяющий принцип не указан, а данные подготовили всех — людей и машины — ожидать согласия. Честная позиция заключается в том, что извлечение теперь дает хороший черновик в любой области, и что человек все еще должен проверять несогласия. Это значительно лучшее распределение труда, чем то, при котором никто вообще не построил структуру.
Как правильно использовать это хорошо
- Не ранжируйте по уверенности. Это измеряет степень уверенности в извлечении, а не важность, и систематически продвигает доказательства над утверждениями.
- Спросите о связи, а не о чувствах. Полезный вопрос заключается в том, что это делает с его родителем — никогда не о том, как он относится к теме.
- Сделайте так, чтобы это оправдывало ярлык, прежде чем его давать. Письменное обоснование ставит родительскую связь в контекст и позволяет выявить ошибки.
- Проведите время на обзор разногласий. Именно там модели наиболее слабы, и именно там сосредоточена ценность решения.
Лучший проект, а не приговор
Узкое место, которое удерживало аргументный майнинг в лаборатории, исчезло, и оно не вернется. Это стоит понимать четко: это разница между исследовательской техникой и чем-то, что вы можете применить на своих собственных встречах.
Но проблемы, которые были сложными в 1958 году, остаются сложными и сейчас. Ордер все еще не написан, разногласия по-прежнему редки, а ярлык по-прежнему зависит от родителя, а не от формулировки. Изменилось то, кто имеет право на эту проблему — что для области, которая провела двадцать лет в ожидании аннотаторов, является достаточным изменением.
Серия извлечения аргументов
Пять постов о том, как машины научились читать аргументы — откуда возникла эта область, почему её сложные задачи сложны и как мы это применяем.
Как философская книга 1958 года, которую логики отвергли, стала спецификацией для задачи машинного обучения.
Десятилетие ручных аннотированных корпусов, которое превратило извлечение аргументов из идеи в измеримую задачу.
Несогласие в данных редко встречается и зависит от контекста, который не содержится в предложении.
Применение: категории аргументов, одно основное утверждение на категорию и почему уверенность является неправильным сигналом ранжирования.
Источники и дополнительная литература
Предшествующее состояние области до LLM — полезно как базовая линия, относительно которой измеряется сдвиг.
Вербализированная самооценка превосходит сырые вероятности токенов — результат, который чаще всего воспринимается как разрешение доверять числу.
Результаты контролируемых эталонов, с которыми сравниваются подходы LLM.
Мандат — это неформальный шаг, который масштаб не предоставляет, потому что он отсутствует в тексте, а не в модели.
Часто задаваемые вопросы
Как крупные языковые модели изменили добычу аргументов?
Они убрали требование наличия рукописного аннотированного корпуса в каждой новой области. Модель общего назначения с подсказками может идентифицировать утверждения, предпосылки и отношения без специфичных для домена обучающих данных, что превратило аргументный анализ из исследовательской техники в нечто, пригодное для использования на обычных организационных текстах.
Являются ли LLM лучше, чем тонко настроенные модели, в области извлечения аргументов?
В области аргументационного майнинга на основе отношений опубликованные оценки показали, что универсальные модели, основанные на запросах, конкурентоспособны и в некоторых случаях лучше, чем тонко настроенные базовые модели кодировщиков на нескольких наборах данных. Более значительное практическое преимущество заключается в том, что им вообще не нужны аннотированные обучающие данные для новой области.
Какие проблемы не были решены LLM?
Три структурных аспекта. Непропорциональность классов отражает, как люди пишут, а не как обучаются модели. Поддержка против атаки зависит от родителя, а не от формулировки. И возражения часто нацелены на неявное основание, которого нет в тексте, поэтому никакие возможности модели не могут его обеспечить.
Можно ли доверять оценке уверенности модели?
Не как сигнал ранжирования. Вербализованная уверенность лучше откалибрована, чем сырые вероятности токенов, но остается ненадежной в абсолютном выражении, и она измеряет уверенность в извлечении, а не важность — поэтому ранжирование по ней систематически продвигает хорошо обоснованные детали над более расплывчатыми предложениями, которые содержат фактические утверждения.
Что на самом деле улучшает классификацию отношений с помощью LLM?
Требуется, чтобы модель сформулировала словами, что вклад делает для своего родителя, прежде чем принять решение о метке поддержки или атаки. Письменный шаг заставляет родительскую связь войти в рабочий контекст, что именно та информация, которую формулировка самого предложения не предоставляет.
Является ли извлечение аргументов уже решенной задачей?
Доступ решён — любая организация может использовать его на своём тексте без программы аннотации. Структура не решена. Определить, какой вклад отвечает на какой, и в каком направлении, по-прежнему сложно, поэтому извлечение даёт хороший черновик, и человек всё равно проверяет несоответствия.
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
Черновик, который вы можете исправить
Извлечение создает структуру; вы рассматриваете разногласия. Вставьте транскрипт и посмотрите на распределение труда.
Страница справки для области — задачи, история и почему отношения являются сложной частью.
Арка всей области, от отклоненной философской книги 1958 года до сегодняшнего дня.
Категории, одно основное утверждение на категорию и почему уверенность является неправильным сигналом для ранжирования.
Запустите это на своем собственном стенограмме.
Нет программы аннотирования, нет корпуса, нет обучающего запуска — только структурированное дерево за и против для обзора.
Начать бесплатно