为什么攻击检测是论证挖掘中最难的问题 | Argumentree
在论证挖掘中,识别哪些句子是主张的问题在很大程度上已经解决,而判断一个论证是否支持或攻击另一个论证仍然没有解决。三个结构性原因解释了这一差距。首先,类别不平衡:在标注语料库中,绝大多数关系是支持关系,而攻击关系则是少数——在某些数据集中,标注关系中不到十分之一是攻击关系。一个猜测支持的系统大多数时候都是正确的,因此训练信号积极地抑制了对不一致的预测。第二,依赖上下文:一个陈述是否攻击某事取决于它所附加的内容,而不是它的措辞。一个负面措辞的句子通常支持其上面的主张,而一个正面措辞的句子通常攻击它。第三,未表述的担保:一个反对意见通常质疑基础和主张之间的推理步骤,而该步骤在文本中并没有写下来。已发布的基准测试一致显示出这种影响——在同一篇说服性论文语料库中,组件检测的F1值接近73%,而关系检测的F1值接近48%,在更复杂的公共评论数据中约为34%。这在实践中很重要,因为稀有类别是有用的:没有人回答的最强反对意见正是决策记录需要保留的内容。
稀有类别是有用的类别。分歧是数据中的小部分,这正是模型低估它的原因——也是它最重要的原因。
- 攻击关系在注释语料库中占少数。猜测支持通常是正确的,因此模型倾向于低估分歧。
- 攻击某物是否取决于它附着的对象,而不是它的措辞。语气是一个积极误导的信号。
- 许多反对意见质疑推理步骤而不是事实——而这个步骤从未被写下来。
- 发布的基准测试:在相同语料库上,找到组件的F1值约为73%,而分类关系的F1值约为48%;在更复杂的数据上约为34%。
- 稀有的类别是决策所依赖的。未回答的反对意见是任何论证记录中最有价值的东西。
最重要的课程是最少的那一门
在论证挖掘系统训练和评估的语料库中,分歧是罕见的。绝大多数标注的关系是支持关系:这个理由支持那个主张。攻击关系——这个反对意见削弱了那个理由——则是少数,在某些数据集中标记的链接中不到十分之一。
这个单一的事实导致了该领域最顽固的失败模式。一个每次都简单预测支持的系统大多数时候都是正确的,而任何从该分布中学习的模型都会吸收相同的偏见。它变得令人满意。
这正好是你部署一个模型的原因的反面。没有人会在六个月后重新审视一个决定,想知道大家达成了什么共识。他们想要的是反对意见——而反对意见是模型最不自信、最不可能预测的类别。
为什么这里的不平衡比其他地方更严重
类别不平衡是一个普通的机器学习问题,具有普通的机器学习解决方案——重新加权损失、对稀有类别进行过采样、报告宏观平均分数而不是准确率。所有这些都是标准做法,并且都有一定的帮助。
使论证挖掘变得更加困难的是,这种不平衡并不是一种可以通过收集更多数据来纠正的抽样伪影。它反映了人们的写作方式。在一篇说服性文章中,作者是在构建论点,因此大多数句子都是为了支持论点而设计的。扩大语料库也会随之扩大这种不平衡。
这就是为什么领域报告使用宏观F1和单独的每类得分,而不是原始准确率。一个从不预测攻击的模型可以显示出一个看起来相当不错的整体数字,但对于你想要的目标却毫无用处。仅仅阅读标题数字完全掩盖了失败。
语气不仅无益——它实际上是误导性的
直观的方法是关注语言。消极词汇、模糊措辞、对抗性表述——这些无疑表明了攻击的信号。
他们并不是这样,反例并不是边缘案例。考虑一个项目有风险的说法。句子时间压力增加了风险是以否定的方式表达的,并且支持了这个说法——它提供了项目有风险的另一个理由。现在考虑长期节省将抵消初始投资,与成本过高的说法相关联。整个句子使用了积极的词汇,并且反驳了这个说法。
无论某事是支持还是攻击,这都是关系的属性,而不是句子的属性。同一句话附加到不同的父句上会改变其标签。这就是为什么情感分析虽然在其擅长的领域表现很好,但却是错误的工具:它读取句子,而答案并不在句子中。
陷阱:根据主题而不是父母来判断立场
这个错误有一个特定的版本值得提及,因为它产生的是自信错误的输出,而不是明显错误的输出。
想象一下关于一个提案的辩论。有人提出异议——该提案将过多的权力集中在一个团队中。第二个人补充了一个理由,说明这个异议是正确的。这个第二个贡献支持了它的父项,而父项恰好是一个异议。这是在对立分支中的一个支持性举动。
一个通过询问这句话是否支持提案?来决定立场的系统是错误的,它将强化标记为攻击,错误随后传播:一个反提案的论点出现在支持方的统计中。必须问的问题不是这句话对主题的看法,而是它对直接在其上方的事物的影响。
找到你自己未解答的异议
在上个季度,做出一个你团队的决定。指出对该决定最强烈的反对意见,然后说出对此反对意见的回应。如果你能指出反对意见但无法给出回应,那么你刚刚找到了决策记录中最有价值的内容——也是一个支持偏见工具最不可能浮现的内容。
对从未被记录下来的步骤的反对
第三个原因是最深刻的,它可以追溯到图尔敏。许多真正的反对意见根本不争论事实。它们争论的是<em>推论</em>——将证据与结论联系起来的未陈述原则。
有人引用了一项研究,显示生产力提高了13%,并得出结论认为应该采纳该政策。反对意见是,研究对象与这个组织完全不同。没有任何事实受到质疑。受到质疑的是理由:即那里的结果可以转移到这里。这个原则在记录中没有出现,因为没有人说过。
正如本系列的第一篇文章所述,论证重建是图尔敏的核心见解,也是该领域最难解决的问题之一。一个被要求分类关系的系统有时必须重建一个不在其输入中的命题,然后决定反对意见是针对该命题、证据还是结论。
但更大的模型肯定能解决这个问题?
这是合理的预期,而它已经部分错误了足够长的时间,变得很有趣。
规模有助于知识和流利度,并且确实改善了论证挖掘——这个故事是 本系列的下一篇文章。但上述三个问题都不是知识问题。失衡是人们写作方式的一个特性。上下文依赖是任务定义的一个特性。缺失的担保是文本的一个特性。
一个更大的模型阅读相同的转录本仍然没有找到陈述所需原则的句子,仍然主要看到它所调优的内容中的一致性,并且仍然必须决定反对意见是针对三个合理目标中的哪一个。能力提高了;问题的结构没有变化。
什么真正有效
- 单独评分各个类别。 一个单一的头条数字让一个从不预测分歧的模型看起来很有能力。每个类别的F1分数立即显现出失败。
- 询问父级,而不是主题。 唯一能产生正确标签的问题是这个贡献对其直接上方的事物有什么影响。
- 在裁决之前明确推理。 在承诺支持或攻击之前强制书面说明关系,可以在错误仍然可以被发现时将其暴露出来。
- 在稀有类别中保持人类参与。 分歧是模型最薄弱的地方,也是价值最高的地方——正是需要花费审查注意力的地方。
有用的班级是稀有的班级
数据的所有方面都推动系统达成一致。分布奖励它,措辞误导它,而关键的连接步骤在文本中常常完全缺失。
而你真正需要的就是没有人回答的反对意见。这就是为什么这是论证挖掘中最难的问题,以及为什么这值得付出努力:稀有类别是有用的类别。
论证挖掘系列
五篇关于机器如何学习阅读论证的文章——这个领域的起源、为什么它的难题很难,以及我们如何应用它。
来源与进一步阅读
通常引用的说服性论文结果用于组件与关系之间的差距。
CDCP语料库中,关系检测在真实公共评论文本上的F1值降至大约34%。
授权——将理由与主张联系起来的未明示原则,以及许多反对意见实际上针对的事物。
反驳与削弱:攻击一个结论与攻击推导到该结论的推理是不同的举动。
基于关系的论证挖掘的调查处理及其评估实践。
常见问题解答
为什么攻击检测比支持检测更难?
三个原因相互影响。攻击关系是标注数据中的少数,因此模型学习到猜测支持通常是安全的。某事是否构成攻击取决于它附加的内容,而不是它的措辞。许多反对意见针对的是一个未明确说明的推理步骤,而不是任何已陈述的事实。
在论证挖掘中,什么是类别不平衡?
在注释语料库中,绝大多数关系是支持而非攻击——在某些数据集中,攻击关系不到标记关系的十分之一。由于说服性文本的作者正在构建论点,这反映了人们的写作方式,因此收集更多数据只会扩大这种不平衡,而不是修复它。
为什么情感分析无法用于检测分歧?
因为支持和攻击是关系的属性,而不是句子的属性。“时间线压力增加了风险”是负面表述,支持一个项目有风险的说法。将同一句话移到不同的父级下,它的标签就会翻转。情感分析读取句子;答案不在句子中。
反驳和削弱有什么区别?
反驳质疑结论——认为它是错误的。削弱接受证据并否认结论由此得出。“你的研究有缺陷”和“你的研究没问题,但并没有证明这一点”是不同的举动,将它们合并会失去大部分真实争论中的信息。
系统实际上多好地检测论证关系?
发布的基准测试显示出一个持续的差距。在说服性论文语料库中,组件识别的F1值大约为73%,而关系分类接近48%。在更复杂的CDCP公共评论语料库中,关系检测降至约34%。这一差距在模型架构的连续变化中依然存在。
更大的语言模型能解决攻击检测问题吗?
他们在不缩小差距的情况下改进它。三个潜在问题都不是知识问题:不平衡反映了人们的写作方式,情境依赖是任务固有的,而缺失的担保在文本中缺失。一个更大的模型阅读同样的抄本仍然面临这三者。
为什么稀有类别最重要?
因为决策依赖于反对意见而不是一致意见。没有人会重新审视一个决策来回忆大家达成的共识;他们想知道最强的反对论点是什么,以及是否曾经得到回应。这正是支持偏见系统最不可能显现的类别。
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
保持异议可见
优缺点树保留了针对哪个理由提出了哪些反对意见,以及哪些没有人回答。
