Обучение машин чтению аргументов: Десятилетие аннотированных корпусов | Argumentree
Аргументный майнинг существовал как теория десятилетиями, прежде чем стал измеримой вычислительной задачей. То, что изменило ситуацию, — это аннотирование: люди садились с тысячами документов и вручную отмечали, какие отрывки были утверждениями, какие — предпосылками, и какие поддерживали или атаковали что. Кристиан Стаб и Ирина Гуревич аннотировали убедительные эссе таким образом, создавая корпус, обычно называемый AAEC. Андреас Пельдсзус и Манфред Стеде создали корпус коротких аргументативных микротекстов специально для изучения структуры аргументации. Джунсук Парк и Клэр Карди аннотировали публичные комментарии, поданные в рамках разработки правил в США, что является гораздо более запутанным жанром. Проблема заключалась не только в усилиях по аннотированию — дело в том, что человеческие аннотаторы не согласны с тем, что такое аргумент, и задача, по которой люди не могут прийти к согласию, не может быть оценена надежно. Согласие между аннотаторами стало, таким образом, охранником всей области: оно определяет практический предел производительности машин, потому что модель не может быть оценена как более последовательная, чем аннотация, с которой она сравнивается. Корпуса также выявили постоянную асимметрию в этой области — идентификация аргументативных компонентов оказалась выполнимой, в то время как идентификация отношений между ними — нет.
Вы не можете научить машину находить аргументы, пока люди не могут согласовать, что такое аргумент. Это оказалось самой сложной частью, и это определило все, что впоследствии измерялось в этой области.
- Аргументный майнинг стал настоящей областью только тогда, когда люди вручную аннотировали тысячи документов — утверждений, предпосылок и связей между ними.
- Аннотаторы не согласны, особенно по поводу отношений. Согласие между аннотаторами стало контрольным показателем, поскольку оно ограничивает, насколько хорошо может быть оценена любая модель.
- Три корпуса определили это десятилетие: убедительные эссе, аргументированные микротексты и комментарии к публичному нормотворчеству — от чистых до запутанных.
- Каждый корпус является жанром. Модель, обученная на студенческих эссе, не подходит для стенограммы встречи, и долгое время у никого не было корпуса стенограмм встреч.
- Корпусы выявили постоянную асимметрию: нахождение компонентов осуществимо, нахождение отношений — нет.
Два эксперта, один абзац, два разных ответа
Дайте двум обученным аннотаторам один и тот же абзац студенческого эссе и задайте простой вопрос: какое предложение является утверждением, а какие предложения являются его обоснованиями? Они часто будут не согласны. Не по теме, не по тому, хорош ли аргумент — а по тому, где он находится.
Это факт, который сформировал первое десятилетие вычислительной добычи аргументов, и его легко недооценить. Все, что происходит дальше, зависит от этого: вы не можете создать эталон для задачи, которую люди не могут выполнять последовательно, и вы не можете утверждать, что модель превосходит человеческие результаты в оценке, которую люди не разделяют.
Попробуйте сами на последней цепочке писем, в которой вы спорили. Отметить требование обычно легко. Отметить, к какому предложению было направлено каждое возражение, — вот где вы начнете колебаться, и это колебание является всей историей этого десятилетия.
Почему теория оставалась неиспользованной в течение двадцати лет
К началу 1990-х годов теоретический аппарат был завершен. Тулмин дал области ее анатомию, Уолтон — каталог моделей рассуждений, Фриман — различие между атакой на вывод и атакой на заключение. Как мы упоминали в первом посте этой серии, аргумент был переописан как помеченный граф.
Помеченный граф — это то, по чему компьютер может быть оценен — в принципе. На практике вам нужно что-то, с чем можно провести оценку. Без аннотированных данных две исследовательские группы, утверждающие разные результаты, не могут прийти к соглашению, и область, в которой результаты не могут быть сопоставлены, не является областью. Это просто набор демонстраций.
Таким образом, десятилетие, которое превратило извлечение аргументов в дисциплину, не было десятилетием алгоритмов. Это было десятилетие аннотационных руководств.
Три корпуса, которые определили задачу
Разные исследовательские группы аннотировали разные жанры, и выбор жанра оказался более важным, чем кто-либо изначально ожидал.
- Убедительные эссе (Стаб и Гуревич). Студенческие аргументативные эссе, аннотированные по утверждениям, предпосылкам и отношениям поддержки/атаки между ними. Структурированное письмо от людей, которые явно пытались четко аргументировать — это максимально благоприятный текст.
- Аргументативные микротексты (Peldszus & Stede). Короткие контролируемые тексты, специально созданные для изучения структуры аргументации, каждый из которых представляет собой компактный аргумент с преднамеренной формой. Маленькие, четкие и разработанные так, чтобы структурные вопросы имели ответы.
- Комментарии к публичному регулированию (Парк и Карди). Комментарии, представленные общественностью на консультации по регулированию в США. Реальные, неотредактированные, часто бессвязные — гораздо ближе к тексту, который на самом деле имеют организации.
Это прогрессия от чистоты к беспорядку — полезная вещь, на которую стоит обратить внимание. Производительность падает по мере продвижения вниз по списку, и она падает больше всего в отношении. Эссе были дружелюбным случаем, и даже там числа отношений были скромными.
Согласие между аннотаторами — это настоящий предел.
Отчеты по проектам аннотирования показывают, как часто независимые аннотаторы приходят к согласию, и в области извлечения аргументов это число не является сноской. Это потолок.
Если два обученных человека, следуя одним и тем же рекомендациям, лишь умеренно согласны относительно того, какая предпосылка относится к какому утверждению, то модель, оцененная по одному из них, не может быть значимо описана как превосходящая другого. Само измерение становится нестабильным еще до того, как это произойдет с моделью.
Согласие последовательно выше по компонентам, чем по отношениям — люди в основном согласны с тем, какое предложение является утверждением, и расходятся во мнениях о том, на что оно отвечает. Эта единственная асимметрия предсказала все, что позже покажут эталоны.
Проведите тест аннотирования в своей команде.
Возьмите цепочку электронных писем по принятию решения и попросите двух коллег, отдельно, отметить единственное самое сильное возражение и указать, на какую конкретную причину оно было направлено. Если они выберут разные цели, ваше несогласие никогда не касалось фактов — и ни один инструмент для подведения итогов этого не выявит, потому что резюме фиксирует то, что было сказано, а не на что оно было направлено.
Руководящие принципы — это теория, приведенная в действие.
Аннотационные рекомендации звучат как канцелярская работа. Это ближе к спецификации. Каждая неопределенность, оставленная теорией, должна быть разрешена перед тем, как аннотаторы смогут начать, и каждое разрешение является настоящим обязательством.
Является ли риторический вопрос утверждением? Считается ли переформулировка в заключении новым компонентом или тем же самым? Когда предложение поддерживает два утверждения одновременно, оно относится к обоим, к ближайшему или к более общему? Если кто-то признает аргумент перед его опровержением, является ли это признание атакой на собственную позицию?
Ни один из этих вопросов не имеет очевидных ответов, и каждый корпус ответил на них немного по-разному. Вот почему модели плохо переносятся между корпусами: они отчасти изучают жанр, а отчасти — ответы одной команды на эти вопросы.
Но разве вы не могли просто аннотировать больше данных?
Это естественная реакция, и для обнаружения компонентов она в целом работала. Большее количество аннотированных диапазонов обеспечивало лучшее обнаружение диапазонов. Эта часть области steadily и предсказуемо улучшалась.
Для отношений это не так, и причина в структуре, а не в объеме. Отношения зависят от контекста вне предложения — что дорого аннотировать последовательно. Отношения несогласия редки, поэтому увеличение корпуса увеличивает дисбаланс вместе с ним. А соединяющий шаг часто не указан, поэтому аннотатор не отмечает что-то видимое в тексте; он отмечает свою реконструкцию этого.
Больше данных умножает все три проблемы, а не решает их. Этот аргумент является темой следующего поста.
Что осталось после десятилетия
Две вещи, обе все еще несущие.
Первое — это само определение задачи. Четырехчастное деление, с которого начинается каждая статья по аргументальному майнингу — найти компоненты, пометить их, связать их, классифицировать связи — является продуктом этих проектов аннотирования, а не философии. Тулмин никогда не предлагал конвейер.
Второе — это установленный эталон. Когда современная система сообщает число, она обычно ссылается на эссе или микротексты, аннотированные в этом десятилетии. Это стоит помнить при сравнении цифр в разных работах: одно и то же название метрики в двух разных корпусах — это не одно и то же измерение, и многие опубликованные сравнения тихо игнорируют это.
Что это значит за пределами лаборатории
- Если люди не могут согласовать, где находится спор, ни один инструмент не даст вам уверенности. Рассматривайте извлеченную структуру как черновик для исправления, а не как вердикт для принятия.
- Жанр важнее объема. Система, настроенная на аккуратные эссе, сталкивается с совершенно другой проблемой в стенограмме встречи, полной прерываний и незаконченных мыслей.
- Разногласия по поводу целей — это настоящий сигнал. Когда два человека считают, что возражение было направлено на разные вещи, именно в этом разрыве обычно и застревает решение.
- Сравнивайте эталонные числа только в рамках одного корпуса. Тот же показатель на другом наборе данных является другим измерением, как бы похожа ни была метка.
Где находится аргумент
Десятилетие аннотаций — это наименее гламурная часть этой истории и та часть, на которой основывается всё остальное. Ни одна модель, как бы большой она ни была, не может избежать того факта, что её табло было создано людьми, которые иногда не соглашались друг с другом относительно того, где находится аргумент.
Что является полезной вещью, которую стоит приносить на свои собственные встречи. Если найти аргумент сложно для двух обученных аннотаторов с письменными рекомендациями, то тот факт, что ваша команда продолжает пересматривать решение, не является проблемой дисциплины. Это та же проблема, но без рекомендаций.
Серия извлечения аргументов
Пять постов о том, как машины научились читать аргументы — откуда возникла эта область, почему её сложные задачи сложны и как мы это применяем.
Как философская книга 1958 года, которую логики отвергли, стала спецификацией для задачи машинного обучения.
Несогласие в данных редко встречается и зависит от контекста, который не содержится в предложении.
Модели нулевого выстрела устранили узкое место корпуса и оставили структурные проблемы на своих местах.
Применение: категории аргументов, одно основное утверждение на категорию и почему уверенность является неправильным сигналом ранжирования.
Источники и дополнительная литература
Проект аннотации убедительного эссе и его рекомендации — корпус, который сделал задачу измеримой.
Полное разборное исследование того же корпуса, с компонентными и реляционными результатами, обычно из него цитируемыми.
Операционализация модели Фримена для автоматизированного извлечения аргументов — мост от теории к схеме аннотирования.
Корпус комментариев к публичным правилам CDCP — реальные, неупорядоченные и гораздо более сложные, чем эссе.
Опрос, который консолидировал десятилетие — определения задач, корпуса и практика оценки.
Часто задаваемые вопросы
Что такое корпус аргументационного майнинга?
Сборник документов, в которых люди вручную отметили аргументативную структуру: какие части являются утверждениями, какие - предпосылками, и какая предпосылка поддерживает или атакует какое утверждение. Это позволяет сравнивать конкурирующие системы на идентичных данных, что превращает идею в область исследования.
Что такое корпус AAEC?
Корпус аннотированных эссе по аргументации, созданный Кристианом Стабом и Ирыной Гуревич на основе студенческих убедительных эссе. Он аннотирует компоненты аргументации и отношения между ними и остается одним из стандартных эталонов для извлечения аргументов.
Почему так важна согласованность между аннотаторами?
Потому что это устанавливает предел измерения. Если два обученных человека, следуя одной и той же инструкции, не согласны с тем, какое предположение относится к какому утверждению, модель, оцененная по одному из них, не может быть значимо показана как превосходящая другую. Оценка становится нестабильной еще до того, как модель это сделает.
Почему модели, обученные на одном корпусе, показывают худшие результаты на другом?
Поскольку каждый корпус представляет собой жанр плюс набор руководящих решений. Студенческие эссе структурированы и продуманы; публичные комментарии хаотичны. Модель частично изучает жанр и частично изучает ответы одной команды аннотаторов на неоднозначные случаи, и ни одно из них не переносится чисто.
Можешь просто аннотировать больше данных, чтобы исправить обнаружение отношений?
Это значительно помогло в обнаружении компонентов и гораздо меньше в обнаружении отношений. Отношения зависят от контекста за пределами предложения, отношения несогласия редки, поэтому увеличение корпуса также увеличивает дисбаланс, а соединительный шаг часто не указан — поэтому аннотатор отмечает реконструкцию, а не что-то видимое.
Какие корпуса используются в качестве эталонов сегодня?
Убедительные эссе и аргументированные микротексты остаются наиболее распространенными, при этом корпуса общественных комментариев используются для более сложной и запутанной оценки. Поскольку каждый из них использует разные решения по аннотации, одно и то же название метрики в двух корпусах не является одинаковым измерением — это частая причина вводящих в заблуждение сравнений.
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
Пропустите шаг аннотирования
Вставьте транскрипцию и получите структурированное дерево плюсов и минусов, которое вы можете исправить — черновик создается автоматически, решение остается за вами.
Страница справки для области — задачи, история и почему отношения являются сложной частью.
Арка всего поля, от отклоненной философской книги 1958 года до сегодняшнего дня.
Что корпусы показали о разногласиях и почему больше данных не решает эту проблему.
Преобразуйте обсуждение в дерево аргументов.
Структурированное рассуждение на основе ваших собственных транскриптов — без необходимости в аннотационных руководствах.
Начать бесплатно