툴민에서 트랜스포머까지: 어떻게 논증 채굴이 기술이 되었는가 | Argumentree
주장 채굴은 AI의 분야로, 자동으로 주장, 그에 대한 이유, 그리고 각 이유가 연결된 것에 대해 지지하는지 공격하는지를 식별합니다. 그 기초는 계산적이라기보다는 철학적입니다. 1958년 스티븐 툴민은 《주장의 사용》을 출판했으며, 이는 일상적인 주장이 실제로 어떻게 구성되는지를 설명함으로써 형식 논리와 단절되었습니다 — 주장, 근거, 보증, 지원, 한정어, 반박. 형식 논리학자들은 이를 대체로 거부했지만, 이 책은 수사학과 커뮤니케이션 학자들 사이에서 청중을 찾았고, 그 어휘는 여전히 이 분야의 어휘로 사용되고 있습니다. 더글라스 월튼은 이후 일상적인 추론의 반복적인 패턴을 주장 체계로 분류했으며, 각 체계에는 실패하는 지점을 드러내는 비판적 질문이 포함되어 있습니다. 제임스 프리먼은 결론을 공격하는 것과 그 결론에 이르는 추론을 공격하는 것을 구별했습니다. 주장 채굴은 2010년대에 주석이 달린 말뭉치가 등장하면서 비로소 측정 가능한 계산 작업이 되었습니다 — 크리스찬 스탭과 이리나 구레비치의 설득력 있는 에세이, 안드레아스 펠츠수스와 만프레드 스테데의 논증적 마이크로텍스트. 신경망 모델이 뒤따랐고, 대형 언어 모델은 각 새로운 도메인에서 수작업으로 주석이 달린 말뭉치의 필요성을 제거했습니다. 변하지 않은 것은 어떤 절반이 어려운가입니다: 주장을 찾는 것은 대체로 해결되었지만, 무엇이 무엇에 연결되는지, 그리고 그것이 지지하는지 공격하는지는 여전히 해결되지 않았습니다.
1958년에 논리학자들이 무시했던 철학서가 아무도 다음 50년 동안 시도하지 않을 기계 학습 작업의 사양으로 판명되었다.
- 툴민의 1958년 모델 — 주장, 근거, 보증 — 은 형식 논리학자들에 의해 거부되었지만 어쨌든 논증 채굴의 작업 용어가 되었다.
- Walton은 사람들이 실제로 어떻게 논쟁하는지를 정리하고, 각 패턴에 대해 어디에서 문제가 발생하는지를 보여주는 중요한 질문을 첨부했습니다.
- 이 분야는 2010년대에 측정 가능해졌으며, 주석이 달린 말뭉치 덕분에 경쟁 시스템들이 동일한 텍스트에서 비교될 수 있게 되었습니다.
- 대형 언어 모델은 말뭉치 병목 현상을 제거했습니다 — 이제 각 도메인마다 수천 개의 수작업 주석 예제가 필요하지 않습니다.
- 어려운 절반은 전혀 움직이지 않았습니다. 주장을 찾아내는 일은 대체로 해결되었지만, 무엇이 무엇을 반박하는지 판단하는 일은 그렇지 않습니다.
경력을 끝내기로 되어 있던 책
스티븐 툴민이 1958년에 The Uses of Argument를 출판했을 때, 전문 논리학자들의 반응은 적대적이었다. 그는 형식 논리에 관한 것이 아닌 추론에 대한 책을 썼고, 사실상 그는 지도를 벗어났다는 말을 들었다. 툴민은 나중에 한 동료가 이 책을 그의 반논리학서라고 부르기 시작했다고 회상했다.
그것은 그의 경력을 끝내지 않았다. 그것이 한 일은 완전히 다른 청중을 찾는 것이었다. 수사학 및 커뮤니케이션 학과 — 특히 미국에서 — 이 책을 받아들여 커리큘럼을 만들었다. 왜냐하면 툴민은 형식 논리가 결코 신경 쓰지 않았던 일을 해냈기 때문이다. 그는 실제 사람이 주장을 할 때 주장이 어떻게 보이는지를 설명했다.
60여 년 후, 기계에게 회의록을 읽고 어떤 주장이 있었는지 말해달라고 요청하면, 그것은 투울민의 어휘를 사용하여 대답할 것입니다. 이것이 이 시리즈의 이야기이며, 이 게시물은 그 흐름입니다: 논리학자들이 거부한 철학서가 어떻게 기계 학습 작업의 사양이 되었는지.
툴민이 실제로 바꾼 것
형식 논리는 타당성에 관한 것이다: 이러한 전제가 주어졌을 때, 이 결론이 따르는가? 그것은 훌륭한 도구이며 사람들이 실제로 하는 말은 거의 설명하지 않는다. 아무도 삼단논법으로 논쟁하지 않는다.
툴민의 접근은 다른 질문을 하는 것이었다 — 이것이 유효한가가 아니라 이것이 어떻게 구성되는가. 그는 실제 주장을 여섯 부분으로 나누었고, 그 중 세 부분이 중요한 역할을 한다:
- 주장 — 제기되고 있는 입장. 누군가에게 실제로 받아들이도록 요청하는 것입니다.
- 근거 — 지지를 위해 제시된 사실. 증거, 데이터, 예시.
- 보증 — 근거에서 주장으로의 이동을 허가하는 원칙. 거의 소리 내어 언급되지 않음.
영장이 흥미로운 것이며, 그것이 주장의 채굴이 지루하기보다는 어려운 이유입니다. 다리가 구조적으로 불안정하므로 우리는 그것을 닫아야 합니다는 숨겨진 전제를 포함하고 있습니다: 불안정한 구조는 닫아야 한다는 것입니다. 아무도 그 문장을 말하지 않습니다. 모두가 그것을 당연하게 여깁니다. 텍스트를 읽는 기계는 텍스트에 없는 단계를 재구성해야 합니다.
나머지 세 부분인 뒷받침, 한정자, 반박은 완화와 예외를 다룹니다. 이들은 함께 주장을 연쇄가 아닌 구조로 설명하며, 이러한 구조적 관점이 나중에 전체를 계산 가능하게 만든 것입니다.
월튼과 논쟁을 깨는 질문
툴민이 이 분야에 해부학을 제공했다면, 더글라스 월튼은 필드 가이드를 제공했다. 1990년대와 2000년대에 걸쳐 월튼은 일상적인 추론의 반복되는 패턴 — 전문가 의견에 대한 호소, 유추에 의한 주장, 결과에 의한 주장, 징후에 의한 주장 — 을 주장 체계로 분류했다.
카탈로그는 유용합니다. 그것을 강력하게 만드는 것은 후반부입니다: 각 계획에는 비판적 질문이 포함되어 있으며, 이는 해당 패턴이 실패하는 지점을 드러내는 특정 도전 과제입니다. 전문가 의견에 대한 호소: 이 사람이 실제로 이 분야의 전문가인가요? 다른 전문가들은 동의하고 있나요? 주장은 증거와 일치하나요?
회의에 참석하는 누구에게나 전통에서 가장 유용한 것입니다. 적용하는 데 비용이 들지 않습니다. 누군가 권위에서 주장할 때, 결론에 동의할 필요는 없습니다. 패턴 자체가 초대하는 중요한 질문을 합니다. 이것은 공격적이지 않으며, 주장이 요구하는 것입니다.
프리먼과 그것을 계산 가능하게 만든 구분
제임스 프리먼의 1991년 작업은 논증 매크로 구조에 관한 것으로, 기계에 가장 중요한 요소를 추가했습니다. 그는 사람들이 가볍게 불일치라고 부르는 두 가지 사이에 명확한 경계를 그었습니다.
결론에 공격할 수 있습니다 — 그것이 거짓이라고 주장하세요. 또는 추론에 공격할 수 있습니다 — 제공된 모든 사실을 받아들이고 결론이 그것들로부터 도출된다고 부인하세요. 당신의 연구는 결함이 있습니다와 당신의 연구는 괜찮지만 당신이 생각하는 것을 보여주지 않습니다는 완전히 다른 접근 방식이며, 이를 하나로 취급하면 실제 disagreement에서 대부분의 정보를 잃게 됩니다.
프리먼은 함께 작동하는 전제와 각각 독립적으로 서 있는 전제를 구분했습니다. 하나의 다리를 제거하면 무너지는 주장의 차이와 단순히 약해지는 주장의 차이입니다. 이러한 구분이 있으면 주장은 더 이상 산문이 아닙니다. 그것은 레이블이 붙은 그래프이며, 레이블이 붙은 그래프는 컴퓨터가 점수를 매길 수 있는 것입니다.
그 후로 20년 동안 아무 일도 일어나지 않았다.
이론은 1990년대 초에 확립되었다. 계산 분야는 2010년대에야 도래했으며, 그 이유는 화려하지 않다: 측정할 것이 없었다.
연구 분야는 경쟁하는 접근 방식이 동일한 데이터에서 비교될 수 있을 때 연구 분야가 됩니다. 이를 위해 누군가가 수천 개의 문서에 앉아 수작업으로 어떤 부분이 주장인지, 어떤 부분이 전제인지, 그리고 어떤 부분이 어떤 것을 지지하거나 공격하는지를 표시해야 했습니다. Christian Stab와 Iryna Gurevych는 설득력 있는 에세이에 대해 이를 수행했습니다. Andreas Peldszus와 Manfred Stede는 구조를 연구하기 위해 특별히 짧은 논증 텍스트의 말뭉치를 구축했습니다.
그 작업은 이 시리즈의 다음 게시물에서 제대로 다루어집니다. 여기서 중요한 것은 그것이 드러낸 형태입니다. 시스템을 점수화할 수 있게 되면, 어떤 부분이 어려운지 알 수 있습니다 — 그리고 그 대답은 즉각적이었고 실제로는 결코 변하지 않았습니다.
다음 회의에서 물어볼 질문
누군가 권위에서 주장할 때 — 컨설턴트, 벤치마크, 특정 연구 — 결론에 도전하지 마세요. 대신 월튼의 질문을 해보세요: 이 사람이 이 특정 분야의 전문가인가, 그리고 다른 전문가들도 동의하는가? 아무도 확인하지 않은 경우가 얼마나 자주 있는지 주목하세요.
청구를 찾는 것은 쉽습니다. 그 이후의 모든 것은 쉽지 않습니다.
발표된 벤치마크는 일관된 이야기를 전합니다. 설득력 있는 에세이 코퍼스에서 논증 구성 요소를 식별하고 라벨링하는 것은 대략 73% F1에 도달합니다. 이러한 구성 요소들이 서로 어떻게 관련되는지 — 무엇이 무엇에 연결되고, 그것이 지지하는지 공격하는지 — 는 약 48%에 해당합니다. Joonsuk Park와 Claire Cardie가 구축한 공공 댓글 데이터의 CDCP 코퍼스에서는 관계 탐지가 약 34%로 떨어집니다.
그 간극이 바로 필드입니다. 이는 약한 모델의 산물이 아니며, 그 이후 모든 아키텍처 변경을 견뎌냈습니다. 탐지는 꾸준히 개선되었습니다. 관계는 거의 변하지 않았습니다.
이유는 기술적이라기보다는 구조적이며, 이는 이 시리즈의 세 번째 게시물의 주제입니다: 데이터에서의 불일치는 드물고, 문장이 포함하지 않는 맥락에 따라 다르며, 연결 단계는 보통 명시되지 않습니다 — 툴민의 보증이 여전히 결여된 채로, 60년이 지난 지금도 그렇습니다.
하지만 이것은 단순히 자연어 처리 아닙니까?
같은 기계를 사용하므로 이의 제기는 타당합니다. 차이는 회수되는 것에 있습니다.
감정 분석은 텍스트가 어떤 느낌인지 묻습니다. 요약은 텍스트가 무엇을 말하는지 묻습니다. 개체 인식은 누가 무엇이 등장하는지 묻습니다. 이 세 가지는 모두 내용에 관한 것입니다. 논증 채굴은 구조에 대해 묻습니다 — 어떤 문장이 어떤 다른 문장에 대해 논증적인 역할을 하고 있으며, 그 방향은 무엇인지.
그 구분은 실용적인 측면이 있습니다. 문장은 부정적으로 표현될 수 있지만 그것이 연결된 주장을 지지할 수 있습니다: 타임라인 압박은 위험을 증가시킨다는 프로젝트가 위험하다는 주장을 강화합니다. 톤에 따라 점수를 매기는 시스템은 매번 그 반대로 해석합니다. 정보 주장을 채굴하는 과정에서 회수되는 것은 단어에 있는 것이 아닙니다. 그것은 단어들 간의 관계에 있습니다.
대형 모델이 변화시킨 것과 변화시키지 않은 것
가장 최근의 장은 모두가 아는 장입니다. 범용 언어 모델은 주석이 달린 말뭉치에 대한 사전 훈련 없이도 논증 채굴 작업을 수행할 수 있으며, 이는 이 분야가 지금까지 직면했던 가장 큰 실질적인 장벽인 새로운 도메인마다 수천 개의 수작업 레이블이 붙은 예제가 필요하다는 문제를 제거합니다.
그것은 진정한 불연속성이며, 그것이 논증 채굴을 정제된 에세이 말뭉치뿐만 아니라 일반 비즈니스 텍스트에서도 사용할 수 있게 만든 것입니다. 이는 네 번째 게시물에서 다루어집니다.
그것이 하지 않은 것은 격차를 줄이는 것이었다. 구조적 문제는 여전히 구조적이다. 전체 인터넷을 읽은 모델은 여전히 이 반대 의견이 그 이유를 겨냥한 것인지 아니면 그 뒤에 있는 결론을 겨냥한 것인지 결정해야 하며, 텍스트는 여전히 그것을 말하지 않는다.
이것이 당신의 주장을 어떻게 시사하는지에 대한 60년의 경험
- 영장에는 보통 의견 차이가 존재합니다. 모든 사실에 동의하지만 여전히 의견이 다른 두 사람은 명시되지 않은 원칙에 대해 논쟁하고 있습니다. 그것을 명명하면 대화가 짧아집니다.
- 추론을 공격하는 것은 사실을 공격하는 것과 다릅니다. 당신이 무엇을 하고 있는지 — 소리 내어 — 결정하는 것은 상대방이 잘못된 것을 방어하는 것을 막아줍니다.
- 모든 권위에 대한 호소는 고유한 시험 질문을 동반합니다. 월튼은 그것들을 적어두었습니다. 그것들을 사용하는 것은 적대감이 아니라 의도한 대로 작동하는 패턴입니다.
- 구조가 남는다. 6개월 후에는 아무도 문구를 기억하지 못한다. 그들이 필요한 것은 어떤 반대가 제기되었는지와 누군가 그것에 답했는지 여부이다.
반논리 책
툴민의 비평가들은 한 가지에 대해 옳았다: 주장의 사용은 정말로 형식 논리에 관한 책이 아니었다. 그것은 사람들이 이해관계가 실제이고 전제가 논란의 여지가 있으며 누구도 삼단논법에 시간을 할애할 수 없을 때 어떻게 추론하는지를 다룬 책이었다.
그것은 더 어려운 문제이자 더 유용한 문제로 판명되었습니다. 오늘날 전사본을 읽고 무엇이 주장되었는지, 어떤 근거로 주장되었는지, 그리고 무엇이 반박되었는지를 알려주는 모든 시스템은 그의 설명을 바탕으로 작동하고 있습니다. 반논리 책치고는 나쁘지 않네요.
주장 채굴 시리즈
기계가 주장을 읽는 방법을 배운 다섯 가지 게시물 — 이 분야의 기원, 어려운 문제들이 왜 어려운지, 그리고 우리가 이를 어떻게 적용하는지.
출처 및 추가 읽기
주장/근거/보증 모델 — 전체 분야에서 여전히 사용되는 용어.
반복되는 추론 패턴의 목록과 각 패턴을 검증하는 비판적 질문들.
결론을 공격하는 것과 그 결론에 대한 추론을 공격하는 것 — 주장을 구조적으로 계산 가능하게 만든 구분.
계산 분야의 표준 조사, 그 작업 정의 및 열린 문제들.
주장 채굴을 측정 가능하게 만든 주석이 달린 말뭉치이며, 여기에서 인용된 구성 요소 및 관계 F1 수치의 출처입니다.
CDCP 말뭉치에서 관계 탐지의 F1 점수는 약 34%입니다.
자주 묻는 질문
주장 채굴이란 무엇인가요?
주장 채굴은 일반 텍스트 내에서 주장의 구조를 자동으로 식별하는 AI의 한 분야입니다: 어떤 문장이 주장을 하고, 어떤 문장이 이유를 제시하며, 각 이유가 연결된 주장에 대해 지지하는지 공격하는지를 판단합니다. 출력은 요약이 아니라 구조화된 맵입니다.
주장 채굴은 누가 창립했나요?
단일 창립자는 없습니다. 이론적 기초는 스티븐 툴민의 1958년 논증 구조 모델로, 더글라스 월튼의 논증 계획과 제임스 프리먼의 논증 거대 구조 설명에 의해 확장되었습니다. 주석이 달린 말뭉치가 측정 가능하게 되면서 2010년대에 컴퓨터 과학 분야가 형성되었습니다.
툴민의 책이 왜 논란이 되었나요?
형식 논리에 관한 책이 아니라고 거부한 이유로 추론에 관한 책이었기 때문이다. 툴민은 유효성이 일상적인 논쟁에 대한 잘못된 질문이라고 주장하고 대신 구조를 설명했다. 전문 논리학자들은 이를 대체로 거부했지만, 수사학 및 커뮤니케이션 학자들은 이를 채택하고 커리큘럼을 구축했다.
툴민 모델에서 보증(warrant)은 무엇인가요?
보증은 당신의 토지에서 당신의 주장으로 이동하는 것을 허가하는 원칙입니다. "다리가 불안정하므로 우리는 그것을 닫아야 한다"에서 보증은 불안정한 구조물은 닫아야 한다는 것입니다. 보증은 거의 항상 소리 내어 언급되지 않기 때문에 주장을 자동으로 추출하는 것이 어렵습니다.
월튼의 논증 체계는 무엇인가요?
일상적인 추론의 반복적인 패턴 — 전문가 의견에 대한 호소, 유추에 의한 주장, 결과에 의한 주장 — 각각은 그 패턴이 실패하는 지점을 드러내는 비판적 질문과 쌍을 이룹니다. 비판적 질문은 실용적으로 유용한 절반입니다: 그것은 결론을 단순히 부정하지 않고도 주장을 테스트할 수 있는 방법을 제공합니다.
관계 탐지가 주장 찾기보다 더 어려운 이유는 무엇인가요?
관계는 문맥에 의존하기 때문에 문장에는 포함되지 않은 연결 단계가 보통 명시되지 않으며, 주석이 달린 데이터에서는 이견이 드물다. 발표된 벤치마크는 동일한 말뭉치에서 관계 탐지에 대해 약 48%의 F1 점수에 비해 구성 요소 탐지가 약 73%에 이르고, 더 어려운 말뭉치에서는 약 34%에 이른다.
대형 언어 모델이 논증 채굴 문제를 해결했나요?
그들은 모든 새로운 도메인에서 손으로 주석이 달린 말뭉치의 필요성이라는 가장 큰 실용적 장벽을 제거하여 이 기술을 일반 비즈니스 텍스트에서 사용할 수 있게 만들었습니다. 그들은 구조적 격차를 해소하지 않았습니다. 무엇이 무엇에 연결되고 어떤 방향으로 연결되는지를 결정하는 것은 여전히 어려운 부분입니다.
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
이론이 적용된 것을 보세요.
전사본을 붙여넣고 구조화된 찬반 트리를 얻으세요 — 주장, 그에 대한 이유, 그리고 반대하는 주장을 포함합니다.
