Argument Mining

Teaching Machines to Read Arguments: The Decade of Annotated Corpora

AT
Argumentree Team
Decision Science
July 29, 2026
10 min 阅读
Teaching Machines to Read Arguments: The Decade of Annotated Corpora

教机器阅读论证:注释语料库的十年 | Argumentree

论证挖掘作为一种理论存在了几十年,才成为一个可测量的计算任务。改变这一点的是注释:人们坐下来,手动标记成千上万的文档,标明哪些段落是主张,哪些是前提,哪些支持或攻击了哪些。Christian Stab 和 Iryna Gurevych 以这种方式注释了说服性论文,产生了通常称为 AAEC 的语料库。Andreas Peldszus 和 Manfred Stede 建立了一个短小论证微文本的语料库,专门研究论证结构。Joonsuk Park 和 Claire Cardie 注释了提交给美国规则制定的公众评论,这是一个更为复杂的体裁。困难从来不仅仅在于标记的工作量——而在于人类注释者对什么是论证存在分歧,而人类无法达成一致的任务无法可靠地评分。因此,注释者之间的一致性成为整个领域的守门人:它定义了机器性能的实际上限,因为一个模型的测量不能比其所依据的注释更一致。这些语料库还揭示了该领域的永久性不对称——识别论证成分被证明是可行的,而识别它们之间的关系则不是。

Share:
简而言之

你无法教会机器找到论点,直到人类能够就什么是论点达成一致。这被证明是困难的部分,并且它塑造了该领域之后所测量的一切。

  • 论证挖掘真正成为一个领域,是在当人们手动标注了数千份文档——主张、前提及其之间的联系时。
  • 注释者之间存在分歧,尤其是在关系方面。注释者之间的一致性成为了门槛,因为它限制了任何模型的评分能力。
  • 三个语料库塑造了这个十年:说服性论文、论证性微文本和公共规则制定评论——从整洁到混乱。
  • 每个语料库都是一种体裁。一个在学生论文上训练的模型无法转移到会议记录上,而且很长一段时间内没有人拥有会议记录语料库。
  • 语料库揭示了永久的不对称性:寻找成分是可行的,而寻找关系则不是。

两个专家,一段话,两个不同的答案

给两个训练有素的注释者同一段学生论文,并问一个简单的问题:哪个句子是主张,哪个句子是理由?他们通常会有不同的看法。不是关于主题,不是关于论点是否有效——而是关于它的位置。

这是塑造计算论证挖掘第一个十年的事实,容易被低估。所有后续的工作都依赖于此:你无法为人们无法一致执行的任务建立基准,也无法声称一个模型在一个人类不共享的判断上超越了人类表现。

在你最后一次争论的邮件线程中自己试试看。标记出主张通常很简单。标记每个反对意见针对的句子是你开始犹豫的地方——而这种犹豫正是这个十年的全部故事。

为什么这个理论闲置了二十年

到1990年代初,理论框架已经完善。图尔敏为该领域提供了其结构,沃尔顿提供了推理模式的目录,弗里曼区分了攻击结论和攻击推理之间的区别。正如我们在本系列的第一篇文章中所述,论证被重新描述为一个带标签的图。

标记图是计算机可以进行评分的东西——原则上如此。实际上,你需要一些东西来进行评分。如果没有注释数据,两个声称不同结果的研究小组就没有办法解决这个问题,而一个结果无法比较的领域就不是一个领域。它只是一个演示的集合。

因此,将论证挖掘转变为一门学科的十年并不是算法的十年,而是注释指南的十年。

定义该任务的三个语料库

不同的研究小组对不同的体裁进行了注释,而体裁的选择比任何人最初预期的更为重要。

  • 说服性论文(Stab & Gurevych)。 学生的论证性论文,标注了主张、前提以及它们之间的支持/攻击关系。由那些明确试图清晰论证的人撰写的结构化写作——文本的质量几乎达到了最佳水平。
  • 论证性微文本 (Peldszus & Stede)。 专门构建的短小控制文本,用于研究论证结构,每个文本都是一个紧凑的论证,具有明确的形状。小巧、简洁,设计上使得结构性问题有答案。
  • 公众规则制定评论(Park & Cardie)。 公众向美国监管咨询提交的评论。真实、未经编辑、常常冗长——与组织实际拥有的文本更为接近。

从整洁到杂乱的这种进展是值得注意的有用之处。随着你向下移动列表,性能下降,而在关系上下降得最明显。论文是一个友好的案例,即使在这里,关系的数量也很有限。

标注者间一致性是真正的上限

注释项目报告独立注释者的意见一致性,而在论证挖掘中,这个数字不是脚注。它是上限。

如果两个受过训练的人遵循相同的指导方针,仅对哪个前提与哪个主张相关达成中等程度的共识,那么一个针对其中一个人的模型的评分不能有意义地被描述为超过另一个人。测量本身在模型之前就变得不稳定。

在各个组成部分上,协议始终高于关系——人们大多一致认为哪个句子是主张,但对其回应的内容则存在分歧。这一单一的不对称性预测了基准测试后来的所有结果。

在你自己的团队上运行注释测试

取一个决策邮件线程,分别请两位同事标记出最强烈的反对意见,并说明具体针对哪个理由。如果他们选择了不同的目标,那么你们的分歧从来就不是关于事实的——而且没有任何摘要工具能够揭示这一点,因为摘要记录的是所说的内容,而不是其针对的内容。

指南是理论的实际应用

注释指南听起来像是文书工作。它更接近于规范。在注释者可以开始之前,理论留下的每一个模糊之处都必须得到解决,而每一个解决方案都是一种真正的承诺。

修辞性问题算不算主张?结论中的重述算作一个新组成部分还是同一个部分?当一个句子同时支持两个主张时,它是附属于两个主张,还是附属于更近的,或者更一般的?如果有人在反驳之前承认一个观点,这个承认算不算对自己立场的攻击?

这些问题没有明显的答案,每个语料库的回答略有不同。这就是为什么模型在不同语料库之间迁移效果不佳的原因:它们部分是在学习一种体裁,部分是在学习一个团队对这些问题的回答。

但你就不能标注更多数据吗?

这是自然反应,对于组件检测来说,它大致有效。更多的标注跨度产生了更好的跨度检测。该领域的这一部分稳步且可预测地改善。

对于关系来说,它并没有,原因是结构性的,而不是数量问题。关系依赖于句子外部的上下文——这在一致性标注上是昂贵的。不同意关系很少,因此扩展语料库也会扩展不平衡。而且连接步骤通常没有明确说明,因此标注者并不是在标记文本中可见的内容;他们是在标记对其的重构。

更多的数据加剧了这三个问题,而不是解决它们。这个论点是下一篇文章的主题。

十年留下的遗产

两件事,都是承重的。

第一个是任务定义本身。每篇论证挖掘论文现在开头的四部分细分——找到组件、标记它们、链接它们、分类链接——是这些注释项目的产物,而不是哲学的产物。图尔敏从未提出过一个流程。

第二个是基准集。当一个现代系统报告一个数字时,它通常是在本十年注释的论文或微文本上报告的。在比较不同论文的数据时,这一点值得记住:在两个不同语料库上相同的指标名称并不是相同的测量,许多已发表的比较悄悄忽视了这一点。

这在实验室外意味着什么

  • 如果人类无法就争论的焦点达成一致,任何工具都无法给你确定性。 将提取的结构视为需要修正的草稿,而不是需要接受的裁决。
  • 体裁比字数更重要。 一个针对整洁论文调校的系统在充满打断和未完成思路的会议记录中面临着截然不同的问题。
  • 对目标的分歧才是真正的信号。 当两个人认为反对意见针对的是不同的事物时,这个差距通常就是决策实际上停滞不前的地方。
  • 仅在一个语料库内比较基准数字。 在不同数据集上使用相同的指标是不同的测量,无论标签看起来多么相似。

论点所在

注释的十年是这个故事中最不光彩的部分,也是其他一切所依赖的部分。无论模型多么庞大,都无法逃避这样一个事实:它的记分板是由有时对论点位置存在分歧的人们构建的。

这对于你自己的会议来说是一个有用的事情。如果对于两个受过训练的注释者来说,找到论点很困难,那么你的团队不断重新审议一个决定并不是一个纪律问题。这是同样的问题,只是没有指导方针。

论证挖掘系列

五篇关于机器如何学习阅读论证的文章——这个领域的起源、为什么它的难题很难,以及我们如何应用它。

常见问题解答

什么是论证挖掘语料库?

一组文件,其中人们手动标记了论证结构:哪些跨度是主张,哪些是前提,以及哪个前提支持或攻击哪个主张。这使得竞争系统能够在相同的数据上进行比较,这就是将一个想法转变为研究领域的原因。

AAEC语料库是什么?

论证注释论文语料库由Christian Stab和Iryna Gurevych基于学生的说服性论文构建。它注释了论证组件及其之间的关系,并且仍然是论证挖掘的标准基准之一。

为什么注释者之间的一致性如此重要?

因为它设定了测量的上限。如果两个受过训练的人遵循相同的指导方针,但对哪个前提与哪个主张相关存在分歧,那么一个模型在其中一个人身上得分,无法有意义地证明它优于另一个人。在模型之前,评估就变得不稳定。

为什么在一个语料库上训练的模型在另一个语料库上的表现更差?

因为每个语料库都是一个体裁加上一组指导决策。学生的论文是结构化和深思熟虑的;公众评论则比较杂乱。一个模型部分地学习体裁,部分地学习一个注释团队对模糊案例的回答,而这两者都无法干净地转移。

你能否标注更多数据以修复关系检测?

它在组件检测方面帮助很大,而在关系检测方面则帮助较小。关系依赖于超出句子的上下文,异议关系很少,因此扩展语料库也会扩展这种不平衡,而连接步骤通常没有明确说明——因此注释者标记的是重建而不是可见的内容。

今天使用哪些语料库作为基准?

说服性论文和论证性微文本仍然是最常见的,公共评论语料库用于更困难、更复杂的评估。由于每个语料库使用不同的注释决策,因此在两个语料库中相同的度量名称并不是相同的测量——这是一个常见的误导性比较来源。

AT

Argumentree Team

Decision Science

The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.

将讨论转化为论证树

从您自己的成绩单中进行结构化推理 — 无需注释指南。

开始免费

相关阅读