什么是论证挖掘?论证挖掘是自然语言处理的一个分支,它自动识别普通文本中的论证结构——哪些句子提出主张,哪些句子给出理由,以及每个理由是否支持或攻击其所附加的主张。

论证挖掘(也称为论证采矿)将非结构化的散文——会议记录、政策咨询、论文、论坛帖子——转化为一个结构化的地图,显示谁在什么基础上提出了什么论点。该领域通常被描述为四个相互关联的任务:在文本中找到论证的范围,将每个范围标记为主张、前提或证据,确定哪个范围响应哪个,以及决定每个关系是支持还是攻击。它源于论证理论——斯蒂芬·图尔敏1958年关于日常论证如何构建的论述,以及道格拉斯·沃尔顿对重复推理模式的分类——并在2010年代通过注释语料库(如克里斯蒂安·斯塔布和伊琳娜·古列维奇的说服性论文,以及安德烈亚斯·佩尔兹斯和曼弗雷德·斯特德的论证微文本)成为一种计算学科。Argumentree利用论证挖掘将粘贴的记录或文档转化为一个正反论证树,供人们阅读、纠正、评分和扩展。

什么是论证挖掘?

什么是论证挖掘?

论证挖掘是人工智能的一个分支,它读取普通文本并分析其论证结构——哪些句子是主张,哪些是为其提供的理由,以及每个理由是 支持 还是 攻击 其所附加的观点。这项技术使得将会议记录转化为结构化的利弊树成为可能。

最后更新: 2026-07-29

简而言之

论证挖掘(或称论证分析)自动提取非结构化文本中的推理。情感分析询问 这段文本的感觉如何,总结则询问 它说了什么,而论证挖掘则询问 有什么主张,基于什么理由,以及有什么反对意见。它使软件能够将记录、咨询回复或论文转换为论证图,而不是摘要。

论证挖掘的四个工作

研究人员通常将问题分解为四个相互关联的任务。每个任务都比上一个更难,早期的错误会在后续的所有任务中传播。

1. 找到论证部分

在真实文档中,大多数句子并不是论点——它们是问候、后勤、背景或重述。首要任务是决定哪些文本段落实际上包含主张或理由。

2. 标记每个部分是什么

主张是某人所持的立场。前提是为此提供的理由。证据是支持该理由的数据、研究或示例。同一句话在一个文档中可以是主张,而在另一个文档中可以是前提——其角色取决于它的作用,而不是它的措辞。

3. 找出什么对什么有反应

论点不是一个平坦的列表。一个理由附属于一个特定的主张;一个反驳附属于一个特定的理由。恢复这种结构就是将一堆提取的句子转变为一棵树。

4. 决定支持还是攻击

对于树中的每个链接:这是否增强了它所附着的事物,还是削弱了它?这是最常出错的步骤,原因将在下面进一步解释。

只有当所有四个部分都完成时,你才能拥有一个可以实际导航的内容:一个主张、支持该主张的理由、对这些理由的反对意见,以及对这些反对意见的回应。

论证挖掘的起源

论证挖掘是一个年轻的计算领域,建立在一个更古老的理论基础上。理论大约早了半个世纪。

1958

图尔敏打破了形式逻辑。

在《论证的用途》中,斯蒂芬·图尔敏认为,真实的论证并不像三段论。他提出了主张、依据、担保、支持、限定词和反驳作为日常论证的组成部分——这一术语至今仍被整个领域使用。

1990年代

沃尔顿记录了人们实际上是如何争论的。

道格拉斯·沃尔顿记录了日常推理中的反复模式——对专家意见的诉求、类比论证、后果论证——每种模式都有一套关键问题,揭示其可能失败的地方。

1991

弗里曼形式化论证结构

詹姆斯·弗里曼区分了只能一起工作的前提和每个独立存在的前提,并将攻击结论与攻击导致结论的推理分开——这一区分在机器必须做出判断时显得尤为重要。

2013–2015

语料库到达

当注释数据集出现时,论证挖掘成为一个可测量的计算任务。Stab 和 Gurevych 对说法、前提和关系进行了注释,涵盖了说服性论文;Peldszus 和 Stede 构建了一个短篇论证文本的语料库,专门用于研究论证结构。共享基准使得进展可比。

2010年代

统计模型和神经模型

系统学习从标记的示例中标记争论性片段并分类关系。组件检测变得相对可靠。关系检测——决定什么与什么相连,以及它是支持还是攻击——依然顽固地困难。

2020年代

大型语言模型改变了经济学。

通用语言模型可以在没有先经过标注语料库训练的情况下执行论证挖掘任务。这消除了最大的实际障碍——每个领域需要数千个手动标注的示例——并使论证挖掘可以应用于普通商业文本。

为什么这比听起来要难

提取索赔是简单的一半。困难在于关系——这有三个原因。

大多数争论都没有明确表达这种联系。

“这座桥不安全,所以我们应该关闭它”隐藏了一个未明确说明的原则:不安全的结构应该被关闭。图尔敏称之为担保。人们几乎从不把它说出来,这意味着机器必须重建一个文本中没有的步骤。

攻击很少见,因此模型对它们的预测不足。

在大多数带注释的语料库中,大多数关系是支持关系;攻击关系则是少数。基于这种分布训练或提示的模型会学习到猜测支持关系通常是安全的——而这对于决策中最重要的案例来说恰恰是错误的。

同意这个话题并不等于支持父母。

在反对意见下,支持反对意见的理由是支持其母体,同时反对整体提案。通过句子对主题的感觉来判断立场的系统对此理解错误,这个错误在分支中不断加深。

Argumentree 如何使用论证挖掘

Argumentree 将论证挖掘应用于一个特定的工作:将转录文本、文档或讨论串转换为一个正反论证树,团队可以在此基础上进行工作。该设计遵循该领域的实践,而不是发明一种私有方法。

每个论点都与其来源紧密相连。

每个提取的论点都保留了其来源的确切措辞。如果一个主张无法追溯到源中实际存在的内容,它就不会被纳入树中。

支援和攻击被正确建模

根据沃尔顿和弗里曼的观点,反对意见可以质疑一个结论、质疑其背后的证据,或质疑将二者连接起来的推理步骤。这些是不同的举动,并被视为不同的关系。

输出是草稿,而不是裁决

提取生成一个建议的树。人们在它成为记录之前进行审查、修正、重新归类和评分。机器完成繁琐的初步工作;判断权仍在小组手中。

结构在对话中存活

因为结果是一个树状结构而不是一个总结,后来的贡献者可以在几个月后将新的异议附加到它所针对的具体理由上。

实际效果是,决策背后的推理保持可检验——不仅是决定了什么,还有哪些论点被提出,哪些论点得到了回应,以及哪些论点根本没有得到回应。

进一步探索

常见问题

简单来说,论证挖掘是什么?

论证挖掘是软件读取一段文本并分析其中的论证:所声称的内容、给出的理由,以及哪些理由支持或反对哪些主张。其结果是一个结构化的图谱,而不是一段散文。

论证挖掘与摘要有什么不同?

摘要压缩了文本,并大致告诉你内容。论证挖掘保留了结构:它告诉你这个特定的反对意见是针对那个特定的理由提出的,并且没有人对此作出回应。摘要恰恰失去了对决策至关重要的分歧。

论证挖掘与情感分析是一样的吗?

不。情感分析衡量态度——积极、消极、中立。论证挖掘恢复推理。一个句子可以以消极的方式表达,同时支持它所附加的观点,而情感分析每次都会搞错这一点。

谁发明了论证挖掘?

没有单一的发明者。理论基础是斯蒂芬·图尔敏1958年的论证结构模型,随后由道格拉斯·沃尔顿的论证方案和詹姆斯·弗里曼的论证宏观结构描述进行了扩展。计算领域在2010年代逐渐形成,克里斯蒂安·斯塔布和伊琳娜·古列维奇,以及安德烈亚斯·佩尔兹斯和曼弗雷德·斯特德的注释语料库等工作使其可测量。

为什么检测攻击比检测支撑更难?

两个原因。这些系统学习的数据集中,攻击的出现远比支持要少,因此模型倾向于预测支持。而且,攻击通常需要相对于其直接的父项进行判断,而不是相对于整体主题——一个理由可以加强反对意见,同时反对该反对意见所针对的提案。

论证挖掘是否取代人类判断?

不,这样对待是个错误。提取产生了论证结构的初稿。判断一个论证是否有效——证据是否成立,未表述的假设是否可接受——是人类的工作。其价值在于在这项工作开始之前,不必手动构建结构。

参考文献与进一步阅读

图尔敏, S. E. (1958). 论证的用途. 剑桥大学出版社.

主张-数据-担保-支持-反驳模型 - 论证结构的理论基础。

View source →

沃尔顿, D., 里德, C., & 马卡尼奥, F. (2008). 论证模式. 剑桥大学出版社.

反复出现的推理模式目录及其检验的关键问题 - 支持与攻击关系的词汇。

Freeman, J. B. (1991). 辩证法与论证的宏观结构:论证结构理论。Foris / De Gruyter。

在支持者与反对者的交流中,支持、反驳和削弱——攻击结论与攻击推理之间的区别。

View source →

Peldszus, A., & Stede, M. (2013). 从论证图到文本中的论证挖掘:一项调查。国际认知信息学与自然智能杂志, 7(1), 1-31。

将Freeman模型应用于自动化论证挖掘。

View source →

Stab, C., & Gurevych, I. (2014). 在说服性论文中注释论证组件和关系。COLING 2014 会议论文集。

基础计算论证挖掘 - 自动论证提取背后的注释语料库和方案。

View source →

劳伦斯,J.,& 里德,C.(2019)。论证挖掘:一项调查。《计算语言学》,45(4),765-818。

该领域的标准调查 - 任务定义、方法和开放问题。

View source →

论证挖掘系列

从图尔敏到变压器:论证挖掘如何成为一项技术
1958年,一位哲学家出版了一本关于推理的书,拒绝将其归为形式逻辑,并被告知他已经偏离了正轨。六十年后,所有能够读取记录并告诉你争论内容的系统都使用了他的词汇。论证挖掘的弧线:图尔敏的担保,沃尔顿的关键问题,弗里曼的削弱,使其可测量的语料库,以及那一半从未变得更简单的部分。
阅读文章
教机器阅读论证:注释语料库的十年
给两个训练有素的注释者同一段文字,并询问哪一句是主张。他们经常意见不合——而这个单一的事实塑造了将论证挖掘从理论转变为可测量任务的十年。为什么注释者之间的一致性是真正的上限,为什么体裁比数量更重要,以及为什么更多的数据从未解决关系检测的问题。
阅读文章
为什么攻击检测是论证挖掘中最难的问题
分歧在注释数据中占少数——在某些语料库中不到十分之一的关系。因此,模型学习到猜测一致性通常是安全的,这正是你部署模型的原因的反面。有三个结构性原因使得攻击检测难以解决,以及为什么稀有类别是决策所依赖的。
阅读文章
当大型语言模型遇上论证挖掘:改变了什么,没改变什么
二十年来,“我们能在我们的数据上进行论证挖掘吗?”的答案是另一个问题:你们首先会标注多少千份文档?大型语言模型使这个问题不再被提问。语料库瓶颈的崩溃实际上改变了什么,它又留下了什么,以及以解决方案的名义出现的新陷阱。
阅读文章
Argumentree如何将文字记录转换为论证树
将预算会议输入提取引擎,并询问哪个论点最重要,它会给你一个统计数据——这正是错误的。高层次地看我们如何应用论点挖掘:为什么讨论被归类为单词类别,为什么每个类别恰好一个论点成为主要主张,为什么模型自身的信心是选择错误的方式,以及为什么没有任何内容能幸存下来,除非是从你的来源中引用的。
阅读文章

将文字记录转化为论证树

粘贴会议记录、咨询回复或文档,获取一个结构化的优缺点树,供您的团队审查、修正、评分和构建。

开始免费