Argumentree가 전사를 논증 트리로 변환하는 방법 | Argumentree
Argumentree는 비구조화된 전사 또는 문서를 찬반 논쟁 트리로 변환하기 위해 논쟁 채굴을 사용합니다. 추출 과정은 네 가지 작업을 수행합니다: 주장을 담고 있는 텍스트 범위를 찾고, 각 범주가 무엇인지 레이블을 붙이며, 어떤 이유가 어떤 주장에 연결되는지를 파악하고, 각 링크가 위의 것을 지지하는지 공격하는지를 결정합니다. 두 가지 디자인 선택이 출력을 형성합니다. 첫째, 주장은 비용, 위험, 일정 또는 법률과 같은 단어 하나로 그룹화되며, 각 범주당 정확히 하나의 주장이 해당 범주의 주요 주장으로 승격됩니다. 둘째, 주요 주장은 모델의 신뢰도 점수에 의해 선택되지 않습니다. 신뢰도는 추출이 얼마나 확실했는지를 측정하며, 주장이 얼마나 중심적인지를 측정하지 않으며, 언어화된 LLM 신뢰도는 잘 조정되지 않은 것으로 알려져 있습니다. 대신 주요 주장은 여러 신호 중에서 동시에 선택되며, 그 중 가장 강력한 것은 중심성 — 얼마나 많은 다른 주장이 그것에 연결되는지 —와 추상성입니다. 주요 주장은 일반적인 입장이며, 그에 대한 지원 증거는 구체적입니다. 백분율, 통화 수치 또는 명명된 연구를 포함하는 주장은 주장 자체가 아니라 주장의 증거로 간주됩니다. 추출된 모든 주장은 출처를 정확히 인용해야 하며, 원본 텍스트에서 찾을 수 없는 것은 트리가 표시되기 전에 삭제됩니다. 출력은 사람들이 수정하고, 재구성하고, 평가할 수 있는 초안이지, 판결이 아닙니다.
추출은 쉬운 부분입니다. 어려운 부분은 구조입니다 — 주요 요점이 무엇인지, 그것에 대한 단순한 증거가 무엇인지, 그리고 실제로 그것에 반대하는 주장이 무엇인지 결정하는 것입니다.
- 주장은 단어 하나로 된 범주로 그룹화됩니다 — 비용, 위험, 일정, 법적 — 그리고 각 범주에서 정확히 하나가 해당 범주의 주요 주장으로 설정됩니다.
- 주요 주장은 모델이 가장 확신했던 것이 아니다. 신뢰도는 추출의 확실성을 측정할 뿐, 중요성을 측정하지 않는다.
- 주요 주장은 일반적이며, 증거는 구체적입니다. 백분율이나 특정 연구를 포함한 주장은 주장을 뒷받침하는 것으로 간주되며, 주장이 아닙니다.
- 모든 주장은 출처를 단어 그대로 인용해야 합니다. 원본 텍스트에서 찾을 수 없는 것은 당신이 보기 전에 삭제됩니다.
- 결과는 초안입니다. 사람들은 이를 수정하고, 재구성하며 평가합니다 — 기계는 구조를 만들고, 그룹은 판단을 유지합니다.
가장 자신 있는 대답이 잘못된 것이었다.
90분 예산 회의를 추출 엔진에 입력하고 어떤 주장이 가장 중요했는지 물어보면, 종종 통계를 제공할 것입니다. "재무 모델은 운영 비용이 20% 감소할 것으로 예상합니다"와 같은 것 — 정확하고, 잘 입증되었으며, 모델은 이에 대해 매우 확신하고 있습니다.
그것도 잘못된 대답입니다. 그 문장은 주장이 아닙니다. 그것은 누군가가 40분 전에 제시한 주장의 증거입니다. 그 주장은 훨씬 더 느슨하게 표현되었습니다: 우리는 두 팀을 통합해야 합니다. 왜냐하면 비용을 절감할 수 있기 때문입니다. 모호한 문장이 주장이며, 정확한 문장이 그것을 뒷받침합니다.
이 구분은 대화를 구조로 바꾸는 전체 문제이며, 다음 번에 자신의 회의 노트를 읽을 때 염두에 두는 것이 좋습니다. 가장 인용할 만해 보이는 문장들은 대개 가장 적은 논증 작업을 수행하는 문장들입니다.
추출이 정확히 해야 할 것
주장 채굴 — 2019년 존 로렌스와 크리스 리드가 조사한 이 연구 분야 — 은 일반적으로 네 가지 작업으로 나뉘며, 진행할수록 더 어려워집니다.
- 주장하는 부분을 찾아보세요. 실제 회의에서 대부분의 문장은 물류, 인사 또는 재진술입니다. 주장이나 이유를 담고 있는 문장은 일부에 불과합니다.
- 각 부분이 무엇인지 라벨을 붙이세요. 주장은 입장입니다. 전제는 그에 대한 이유입니다. 증거는 그 이유 뒤에 있는 데이터입니다. 같은 문장이 한 문서에서는 주장일 수 있고 다른 문서에서는 전제일 수 있습니다.
- 무엇이 무엇에 반응하는지 파악하세요. 이유는 특정 주장에 연결되고, 반대는 특정 이유에 연결됩니다. 이것이 목록을 나무로 바꾸는 것입니다.
- 지원하거나 공격할지 결정하세요. 모든 링크에 대해: 이것이 연결된 것을 강화합니까, 아니면 약화합니까?
첫 두 가지는 대부분 해결되었습니다. 마지막 두 가지는 해결되지 않았으며, 발표된 벤치마크는 그 격차를 명확히 보여줍니다: Christian Stab와 Iryna Gurevych가 주석을 단 설득력 있는 에세이 코퍼스에서 구성 요소 탐지는 약 73% F1에 도달하는 반면, 관계 탐지는 약 48%에 머물고 있습니다. Joonsuk Park와 Claire Cardie가 구축한 CDCP 코퍼스에서는 관계 탐지가 대략 34%로 떨어집니다.
그래서 흥미로운 디자인 결정은 발견에 있는 것이 아닙니다. 그것은 구조화에 있으며, 그곳에서 범주가 등장합니다.
주장이 왜 범주로 분류되는가
진정한 논의는 한 가지에 관한 것이 아닙니다. 두 팀을 통합하기로 한 결정은 비용, 사기, 법적 노출, 그리고 소요 시간에 관한 것입니다. 이들은 같은 방에서 일어나는 서로 다른 논쟁이며, 이를 하나의 목록으로 단순화하면 아무도 읽을 수 없는 결과가 나옵니다.
따라서 모든 추출된 주장은 단어 하나로 된 범주 — 비용, 위험, 일정, 법률, 보안, 범위 — 로 태그가 붙습니다. 단어 하나, 의도적으로. 범주가 구문이 되는 순간, 같은 주제가 거의 중복되는 형태로 나뉘어집니다: 예산 영향과 비용 고려사항과 재정적 위험은 세 가지 모자를 쓴 하나의 논쟁이며, 나무는 하나여야 할 가지로 나뉘어집니다.
제약은 요청되는 것이 아니라 시행됩니다. 카테고리는 단일 표준 형식으로 정규화되며, 카테고리는 가지의 최상단 속성입니다 — 주요 주장 아래의 모든 것은 그 주요 주장의 카테고리를 상속받습니다. 비용 주장은 위험 카테고리에서 자식을 얻지 않습니다; 만약 자식이 진정으로 위험에 관한 것이라면, 대신 위험 주요 주장 아래에 속해야 합니다.
카테고리당 하나의 주요 주장
각 범주 내에서 정확히 하나의 주장이 주요 주장으로 승격됩니다 — 해당 범주 내의 모든 것이 지지하거나 공격하는 중심 위치입니다. 범주 내의 나머지 모든 것은 직접적이거나 간접적으로 그것의 자식이 됩니다.
이것은 전체 과정에서 가장 중요한 선택입니다. 올바르게 선택하면 가지가 논증처럼 읽힙니다: 여기 비용에 대한 입장이 있고, 여기에 대한 세 가지 이유가 있으며, 여기에 두 번째 이유에 대한 반대가 있습니다. 잘못 선택하면 이 기사의 맨 위에서 언급한 반전이 발생합니다 — 통계가 가지의 맨 위에 위치하고, 그것을 뒷받침해야 할 주장이 마치 세부사항인 것처럼 그 아래에 매달려 있습니다.
명백한 접근 방식은 작동하지 않습니다.
직관적인 대답은 모델이 가장 확신하는 주장을 홍보하는 것입니다. 그러나 이는 이해할 가치가 있는 이유로 실패합니다.
신뢰도는 추출이 실제 주장을 찾았다는 확신의 정도를 측정합니다. 이는 그 주장이 논쟁에서 얼마나 중심적인지를 측정하지 않습니다. 명확하게 표현된 통계와 이름이 있는 출처는 쉽고 높은 신뢰도의 추출입니다. 실제 논제인 모호하고 조건이 붙은 문장은 어렵고 낮은 신뢰도의 추출입니다. 신뢰도에 따라 순위를 매기는 것은 체계적으로 증거를 강조하고 주장을 약화시킵니다.
첫 번째 문제 아래에는 두 번째 문제가 있습니다. Anthropic의 Saurav Kadavath와 동료들이 수행한 연구에 따르면, 언어 모델의 언어화된 신뢰도는 원시 토큰 확률보다 더 잘 조정되어 있지만, 이후 평가에서는 여전히 절대적인 측면에서 잘 조정되지 않았음을 반복적으로 보여주었습니다. 이는 사용 가능한 신호입니다. 신뢰할 수 있는 순위는 아닙니다.
주요 주장을 실제로 결정하는 것은 무엇인가?
하나의 신호 대신 여러 신호가 결합되며, 그 중 가장 강력한 것은 언어적이지 않고 구조적입니다.
- 중심성. 이 주장에 얼마나 많은 다른 주장이 연결되어 있습니까? 다른 모든 것이 반응하는 주장은 거의 항상 중심 주장입니다. 이것은 논쟁에서 주장의 위치의 특성이기 때문에 신뢰할 수 있는 신호에 가장 가까운 것입니다.
- 추상성. 주요 주장은 일반적이며; 증거는 구체적이다. 이것은 직접적으로 툴민의 이론이다: 그의 1958년 설명에서 주장은 결론이고 근거는 그 아래의 구체적인 사실들이다.
- 주장하는 언어. 담화 표지 — 따라서, 핵심 문제는, 내가 주장하고 싶은 것은 — 화자가 세부 사항을 제공하기보다는 입장을 밝히고 있음을 나타냅니다.
- 간결함. 중심 주장은 짧은 경향이 있다. 긴 문장은 보통 자격을 부여하고 있으며, 이는 지원 자료가 하는 일이다.
- 위치. 약한 신호이지만, 실제 신호입니다: 논문은 보통 일찍 나타나는 경향이 있습니다.
추상성은 구체성의 지문을 찾음으로써 측정됩니다. 백분율, 통화 금액, 정량화된 개체, 인용구, 명명된 기관 — 각각은 주장을 주요 주장일 가능성을 줄입니다. 왜냐하면 각각이 결론이 아닌 근거의 특징이기 때문입니다. 원격 근무는 생산성을 향상시킵니다는 주장입니다. 500명의 근로자를 대상으로 한 조사에서 78%의 만족도가 나타났습니다는 누군가가 왜 그런지 물어볼 때 하는 말입니다.
여러 약한 신호를 결합하는 것이 하나의 강력해 보이는 신호를 신뢰하는 것보다 낫습니다. 이는 다양한 관점을 가진 그룹이 자신감 있는 개인보다 더 나은 성과를 내는 이유와 같습니다. 이 패턴은 다양성이 능력을 이기는 이유에서 탐구되었습니다.
마지막 회의에서 이것을 혼자 해보세요.
당신의 팀이 내린 마지막 결정을 생각해 보세요. 그 결정에 대한 가장 강력한 반대 주장을 하나 말할 수 있나요? 그리고 그 주장을 한 사람이 누구인지 말할 수 있나요? 만약 그렇지 않다면, 그것은 기억 문제이기 때문이 아닙니다. 그것은 구조 문제입니다: 당신의 기록은 결정된 내용을 담고 있지만 논의된 내용은 담고 있지 않으며, 이것이 바로 추출이 메우려고 하는 간극입니다.
출처에 없는 것은 아무것도 살아남지 않는다.
실제로 제기되지 않았지만 그럴듯하게 들리는 주장은 누락된 주장보다 더 나쁩니다. 이는 귀하의 팀이 말한 것에 대한 잘못된 기록이기 때문입니다. 따라서 추출된 모든 주장은 원래 출처의 정확한 문구를 포함하고 있으며, 인용된 증거가 원본 문서에서 찾을 수 없는 주장은 나무가 누구에게 보여지기 전에 제거됩니다.
이것은 매력적이지 않으며 나머지를 사용할 수 있게 만드는 부분입니다. 전사로 되돌릴 수 없는 나무는 추가 단계가 있는 요약입니다.
하지만 이것은 추가 단계가 있는 요약에 불과하지 않나요?
명백한 반대이며, 그 답은 각자가 버리는 것에 있다.
요약은 압축됩니다. 회의에서 다룬 내용을 대략적으로 알려주고, 만약 좋다면 결정된 사항을 알려줍니다. 그러나 요약이 보존할 수 없는 것은 이견의 형태입니다. 즉, 이 특정한 반대 의견이 그 특정한 이유에 대해 제기되었고, 그것이 답변되었으며, 두 번째 반대 의견은 결코 제기되지 않았다는 것입니다. 요약은 결정이 8개월 후에 다시 검토될 때 중요한 부분을 잃게 되며, 아무도 왜 명백한 대안이 거부되었는지 기억하지 못하게 됩니다.
이 구분은 주장을 채굴하는 것과 감정 분석을 구분짓습니다. 감정 분석은 추론이 아닌 태도를 측정합니다. 문장은 부정적으로 표현될 수 있지만 그것이 연결된 주장을 지지할 수 있습니다 — "타임라인 압박은 위험을 증가시킨다"는 프로젝트가 위험하다는 주장을 강화합니다. 이를 톤으로 점수화하면 매번 반대로 나옵니다.
출력물은 초안이며, 그것이 요점입니다.
추출에서 나오는 것은 제안입니다: 우리가 주장했다고 생각하는 것이 무엇인지, 그것이 어떻게 연결된다고 생각하는지입니다. 그런 다음 사람들은 이를 수정합니다 — 잘못된 주장에 붙어 있던 주장을 재구성하고, 두 가지 요점을 합친 주장을 나누고, 점수가 잘못된 것을 홍보하며, 그들이 설득력 있다고 생각하는 것을 평가합니다.
그 구분은 의도적입니다. 구조를 손으로 만드는 것은 팀이 전혀 하지 못하게 만드는 지루한 작업입니다. 주장이 어떤 좋음이 있는지 — 증거가 유효한지, 암묵적인 가정이 수용 가능한지 — 판단하는 것은 지루하지 않습니다. 그것은 실제 사고이며, 그룹과 함께 남아 있습니다.
자신의 회의 기록을 읽고 있다면 이것이 의미하는 바
- 인용할 만한 문장은 보통 주장과는 다릅니다. 정확하고 출처가 명확한 문장은 일반적으로 증거입니다. 그들이 지지하는 주장은 종종 더 모호하고 간과하기 쉽습니다.
- 무엇이 무엇에 붙는지를 세어보세요. 다른 모든 사람들이 반응한 점은 가장 중요했던 점이며, 누가 가장 자신 있게 말했는지는 상관없습니다.
- 카테고리를 명명하세요. 결정이 어떤 두 가지 또는 세 가지 주제에 관한 것인지 말할 수 없다면, 논의는 구조화되지 않았습니다 — 그것은 기록된 것입니다.
- 누구도 대답하지 않은 반대를 찾아보세요. 그것은 어떤 논쟁 기록에서도 가장 유용한 것이며, 평면 요약이 파괴하는 첫 번째 것입니다.
모호한 문장이 주장이었다.
통계는 결코 요점이 아니었다. 그것은 누군가가 이미 제기한 주장에 대해 물었던 질문에 대한 답이었다 — 느슨하게, 일찍, 그리고 회의록에 결코 들어가지 않는 종류의 문장에서.
토론을 구조화한다는 것은 그 문장을 해당 가지의 맨 위로 다시 가져다 놓고, 그 아래에 증거를 두며, 그들이 반박하는 특정 이유에 반대 의견을 붙이는 것을 의미합니다. 그것이 나무의 용도입니다. 그리고 그것이 가장 자신 있는 답변이 종종 잘못된 이유입니다.
주장 채굴 시리즈
이 게시물은 우리가 주장을 채굴하는 방법에 대해 다룹니다. 시리즈의 나머지 부분은 이 분야가 어디에서 왔는지와 그 어려운 문제들이 왜 어려운지에 대해 다룹니다.
출처 및 추가 읽기
이 분야의 표준 조사 — 작업 정의, 방법 및 열린 문제들.
주장 채굴을 측정 가능한 작업으로 만든 주석이 달린 말뭉치와 여기에서 인용된 구성 요소/관계 F1 수치의 출처입니다.
주장/근거/보증 모델 — 주장이 일반적이고 근거가 구체적이라는 원칙의 출처.
CDCP 말뭉치는 관계 탐지 점수가 약 34% F1로, 발표된 범위의 어려운 쪽에 해당합니다.
구두로 표현된 모델 신뢰도 — 원시 확률보다 낫지만 여전히 신뢰할 수 있는 순위 신호는 아니다.
자주 묻는 질문
Argumentree는 어떻게 전사를 논증 트리로 변환하나요?
주장 채굴을 적용합니다: 주장을 담고 있는 텍스트의 범위를 찾고, 각 범주가 무엇인지 라벨을 붙이며, 어떤 이유가 어떤 주장에 연결되는지 파악하고, 각 연결이 위의 주장을 지지하는지 공격하는지 결정합니다. 그 결과는 사람들이 검토하고 수정하는 찬반 트리가 됩니다.
인수 범주란 무엇이며 왜 단어 하나인가요?
카테고리는 논의를 개별적인 토론으로 그룹화합니다 — 비용, 위험, 일정, 법적. 단어 길이로 제한되며, 구문 길이 카테고리는 분산됩니다: 예산 영향, 비용 고려사항 및 재정적 위험은 세 가지 모자를 쓴 하나의 토론이며, 나무는 하나여야 할 가지로 나뉩니다.
각 카테고리당 하나의 주요 주장은 무엇을 의미하나요?
각 범주 내에서 정확히 하나의 주장이 중심 주장으로 승격되며, 그 범주 내의 나머지 모든 것은 그 아래에 연결됩니다. 이것이 가지가 주장을 읽을 수 있게 만드는 이유입니다 — 입장, 그에 대한 이유, 그리고 그 이유에 대한 반대 — 단순히 관련 문장의 평면 목록이 아니라.
주요 주장이 가장 높은 신뢰도를 가진 주장만이 아닐까요?
신뢰도는 추출이 얼마나 확실했는지를 측정할 뿐, 주장이 얼마나 중심적인지는 측정하지 않기 때문입니다. 명확하게 표현된 통계는 쉽고 높은 신뢰도의 추출입니다; 실제 논지인 모호한 문장은 어려운 것입니다. 신뢰도에 따라 순위를 매기는 것은 체계적으로 증거를 촉진하고 주장을 낮추는 결과를 가져옵니다.
회의 요약과 어떻게 다른가요?
요약은 다루어진 내용을 압축하여 전달합니다. 그것은 이의 제기가 어떤 이유에 대해 제기되었고, 그것이 어떻게 답변되었으며, 다른 이의 제기는 그렇지 않았다는 불일치의 형태를 보존할 수 없습니다. 요약은 나중에 결정을 다시 검토할 때 중요한 부분을 정확히 잃게 됩니다.
AI가 아무도 하지 않은 주장을 만들어내지 못하게 하는 것은 무엇인가요?
모든 추출된 주장은 원문에서 온 정확한 문구를 포함하고 있으며, 인용된 증거를 원본 문서에서 찾을 수 없는 주장은 트리가 표시되기 전에 제거됩니다. 그럴듯하게 들리지만 실제로 제기되지 않은 주장은 누락된 주장보다 더 나쁩니다.
추출 결과를 변경할 수 있나요?
네 — 그것이 의도된 작업 흐름입니다. 출력물은 초안입니다. 사람들은 잘못된 주장에 연결된 주장을 재구성하고, 병합된 포인트를 나누고, 점수가 잘못된 것을 홍보하며, 그들이 설득력 있다고 생각하는 것을 평가합니다. 기계가 구조를 만들고, 그룹이 판단을 유지합니다.
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
자신의 성적 증명서에서 확인하세요.
회의 기록을 붙여넣고 수정하고 평가하며 발전시킬 수 있는 구조화된 장단점 트리를 얻으세요.
