LLM이 논증 채굴을 만났을 때: 무엇이 변했고 무엇이 변하지 않았는가 | Argumentree
대부분의 역사에서 계산적 논증 채굴은 새로운 도메인마다 수작업으로 주석이 달린 말뭉치가 필요했습니다. 그 요구 사항은 이 분야의 제약 조건이었습니다: 주석 작업은 방대했고, 지침은 논란의 여지가 있었으며, 학생 에세이에 맞춰 조정된 시스템은 회의 기록이나 공공 댓글에 잘 적용되지 않았습니다. 대형 언어 모델은 그 제약을 제거했습니다. 범용 모델은 도메인 특정 훈련 데이터 없이도 프롬프트에서 구성 요소 감지 및 관계 분류를 수행할 수 있으며, 발표된 평가에서는 프롬프트된 범용 모델이 관계 기반 논증 채굴에서 세밀하게 조정된 인코더 기준선과 경쟁하거나 경우에 따라 더 나은 성능을 보인다고 밝혔습니다. 이는 논증 채굴의 용도를 변화시켰습니다: 이제 일반적인 조직 텍스트에서도 사용 가능해졌고, 오직 선별된 연구 말뭉치에서만 사용되던 것이 아닙니다. 그러나 변화하지 않은 것은 어려운 문제의 구조입니다. 클래스 불균형은 사람들이 글을 쓰는 방식이 반영된 것이지, 모델이 훈련되는 방식이 아닙니다. 기여가 지지하는지 공격하는지는 그 문구보다는 부모에 따라 달라집니다. 그리고 반대 의견은 종종 텍스트 어디에도 나타나지 않는 명시되지 않은 보증을 겨냥합니다. 대형 모델은 또한 그들만의 새로운 어려움을 도입했습니다: 언어화된 신뢰도는 원시 토큰 확률보다 더 잘 조정되지만 여전히 순위 신호로서 신뢰할 수 없으므로, 모델의 확신은 어떤 추출된 논증이 가장 중요한지를 결정하는 데 사용될 수 없습니다.
코퍼스 병목 현상이 사라졌다. 구조적 문제는 조금도 움직이지 않았고, 해결책의 옷을 입은 새로운 문제가 나타났다.
- 주장 채굴은 도메인별로 수작업으로 주석이 달린 말뭉치가 필요했습니다. 그러나 일반 목적의 모델은 필요하지 않으며, 이것이 일반 비즈니스 텍스트에서 사용 가능하게 만든 이유입니다.
- 발표된 평가 결과는 일반 목적 모델이 관계 분류에서 미세 조정된 인코더 기준선과 경쟁력이 있으며 때로는 더 나은 성능을 보인다는 것을 발견했습니다.
- 불균형, 맥락 의존성 및 명시되지 않은 보증은 언어와 작업의 특성이지 모델 크기의 특성이 아닙니다.
- 모델 신뢰도는 원시 확률보다 더 잘 조정되지만 여전히 신뢰할 수 있는 순위 신호는 아니다 — 새로운 도구가 아니라 새로운 함정이다.
- 도움이 되는 것은 레이블이 확정되기 전에 관계를 말로 표현하도록 강요하는 것입니다.
그 분야를 정의했던 제약이 단순히 적용되지 않게 되었다.
20년 동안 우리 데이터에 대해 주장을 추출할 수 있을까?라는 질문에 대한 대답은 또 다른 질문이었습니다: 당신의 문서 중 몇 천 개를 먼저 수작업으로 주석을 달도록 할 의향이 있으며, 누가 가이드라인을 작성할 것인가?
그것은 기술적인 세부사항이 아니었습니다. 그것은 주장이 채굴이 연구실에 머물렀던 이유였고, 감정 분석이 모든 제품에 배포된 이유였습니다. 주석 요구 사항은 각 새로운 도메인을 구성 설정이 아닌 프로젝트로 만들었고, 이 시리즈의 두 번째 게시물에서 설명했듯이, 가이드라인 자체가 전문가들 사이에서도 논란이 있었습니다.
그때 범용 언어 모델이 등장하면서 그 질문은 더 이상 제기되지 않았습니다. 이제는 아무도 주석을 달지 않은 분야의 회의록에 모델을 적용하여 유용한 초안을 얻을 수 있습니다. 이 기능이 갑자기 제품에 등장한 이유가 궁금했다면, 그것이 그 이유입니다.
제로샷이 전체 이야기다
변경된 구체적인 사항은 도메인 특정 감독의 제거입니다. 프롬프트된 모델은 언어에 대한 일반적인 능력을 가지고 있으며, 추론 시 프롬프트에서 주장과 전제가 무엇인지 지시받을 수 있습니다.
관계 기반 주장을 채굴에 대한 발표된 연구는 여러 데이터셋에서 미세 조정된 인코더 기준선과 경쟁할 수 있는 몇 가지 샷 프롬프트를 가진 범용 모델을 발견했습니다. 경우에 따라 이들보다 앞서는 경우도 있습니다. 주로 주석이 달린 말뭉치에 대한 감독 학습을 기반으로 구축된 평가 장치가 있는 분야에서, 이는 진정한 단절입니다.
세 가지 실질적인 결과가 따른다. 도메인 적응은 재훈련이 아니라 프롬프트 전환이 된다. 긴 문서가 처리 가능해지는데, 이는 컨텍스트 윈도우가 커졌기 때문이다. 그리고 증거 필드는 설명을 담을 수 있는데, 이는 모델이 같은 호출에서 스스로를 정당화하도록 요청할 수 있기 때문이다 — 이는 생각보다 더 중요하다.
움직이지 않은 세 가지 문제
이전 게시물의 모든 내용이 여전히 적용되며, 규모가 그것을 해결하지 못하는 이유에 대해 정확하게 설명하는 것이 중요합니다.
- 클래스 불균형은 훈련의 속성이 아니라 글쓰기의 속성입니다. 사례를 만드는 사람들은 주로 지지하는 문장을 씁니다. 전체 인터넷을 읽은 모델은 주로 동의하는 내용도 읽었습니다.
- 맥락 의존성은 작업의 속성입니다. 지원과 공격은 관계이며, 문장 속성이 아닙니다. 다른 부모 아래의 동일한 문장은 다른 레이블을 가지며, 어떤 양의 세계 지식도 그것을 변경하지 않습니다.
- 명시되지 않은 보증은 텍스트의 속성입니다. 증거와 결론을 연결하는 원칙이 결코 기록되지 않았다면, 그것은 입력에 없습니다. 더 큰 모델은 동일한 부재 문장을 읽습니다.
네 번째, 더 미묘한 것이 있습니다. 유창한 모델은 유창한 출력을 생성하므로 그 오류는 잘 표현되고 내부적으로 일관성이 있습니다. 인코더에서 잘못된 관계 레이블은 잡음처럼 보였습니다. 언어 모델에서 잘못된 관계 레이블은 주장의 형태로 보입니다.
새로운 함정: 모델의 확신에 대한 신뢰
이 모델들은 자신이 얼마나 확신하는지를 보고할 수 있기 때문에, 그 숫자를 사용하는 것이 유혹적입니다 — 추출된 주장을 순위 매기고, 어떤 것이 중요한지를 결정하며, 무엇이 표시될지를 제한하는 데에.
Saurav Kadavath와 동료들의 연구에 따르면, 언어화된 자기 평가가 원시 토큰 확률보다 의미 있게 더 잘 조정되어 있다고 합니다. 그 결과는 종종 숫자를 신뢰할 수 있는 근거로 인용됩니다. 이후 평가에서는 일관되게 덜 고무적인 결과가 나왔습니다: 대안보다 낫다는 것이 신뢰할 수 있다는 것과는 다르며, 조정은 바로 필요한 곳, 즉 어려운 경우와 비정상적인 경우에서 저하됩니다.
실천에는 범주 오류가 숨겨져 있습니다. 신뢰도는 모델이 실제 주장을 찾았다는 확신의 정도를 측정합니다. 그것은 그 주장이 논쟁의 중심인지 여부에 대해서는 아무런 말을 하지 않습니다. 간결하게 표현된 통계는 쉽고 높은 신뢰도의 추출입니다; 실제 논제인 완곡한 문장은 어려운 것입니다. 신뢰도에 따라 순위를 매기는 것은 증거를 강조하고 주장을 낮추는 결과를 초래합니다 — 이는 바로 이 시리즈의 마지막 포스트가 시작하는 실패입니다.
잘 아는 성적표에서 테스트해 보세요.
결과를 명확하게 기억하는 회의를 하나 선택하고 어떤 AI 도구에 그 회의의 주요 주장이 무엇이었는지 물어보세요. 만약 그것이 실제로 결정을 이끌었던 느슨한 문장 대신 가장 정확하고 증거가 잘 뒷받침된 문장을 제공한다면, 당신은 자신감이 중요성을 대신하는 것을 목격한 것입니다 — 그리고 이제 그 순위를 신뢰하지 말아야 한다는 것을 알게 됩니다.
도움: 먼저 왜라고 말하게 하기
이 모델들로 가능한 가장 신뢰할 수 있는 개선은 거의 부끄러울 정도로 간단합니다. 레이블 전에 이유를 요청하세요.
기여가 부모에게 무엇을 하는지를 모델이 작성하도록 요구하는 것은 위의 반대 의견을 강화합니다. 이는 그 반대 의견이 유지되는 또 다른 이유를 제공하기 때문입니다. 지원 또는 공격 판결에 대한 결정을 내리기 전에 이 과정을 거치는 것은 판결을 측정 가능하게 개선합니다. 작성된 단계는 부모 관계를 모델의 작업 맥락으로 강제하며, 이는 문장의 표현이 제공하지 못하는 정확한 정보입니다.
이것은 철저히 인간적인 기법의 기계 버전입니다. 이것이 스틸맨닝이 효과적인 이유입니다: 주장을 판단하기 전에 그것이 실제로 무엇을 하고 있는지를 명확히 하는 것은 판단을 변화시킵니다.
그렇다면 논증 채굴은 해결된 건가요?
아니요, 남아 있는 것의 형태는 이제 그 어느 때보다 더 명확해졌습니다.
실질적으로 해결된 것은 접근성입니다. 오늘날 어떤 조직이든 자신의 텍스트에 대해 주장을 추출하는 작업을 주석 프로그램 없이 수행할 수 있으며, 이는 몇 년 전에는 상상할 수 없었던 일입니다. 이는 실제로 크고 중요한 변화입니다.
해결되지 않은 것은 구조입니다: 어떤 기여가 어떤 것에 응답하며, 어떤 방향으로 나아가는지, 연결 원칙이 명시되지 않고 데이터가 모든 사람 — 인간과 기계 — 에게 합의를 기대하도록 훈련되었을 때. 솔직한 입장은 이제 추출이 어떤 분야에서든 좋은 초안을 생성하며, 여전히 사람이 이견을 확인해야 한다는 것입니다. 이는 아무도 구조를 전혀 구축하지 않은 경우보다 훨씬 더 나은 노동 분담입니다.
이것을 잘 사용하는 방법
- 신뢰도로 순위를 매기지 마세요. 이는 중요성이 아니라 추출 확실성을 측정하며, 체계적으로 주장을 넘어 증거를 우선시합니다.
- 관계에 대해 물어보세요, 감정에 대해선 아닙니다. 유용한 질문은 이것이 부모에게 어떤 영향을 미치는가입니다 — 주제에 대한 감정은 결코 중요하지 않습니다.
- 라벨을 주기 전에 정당화하세요. 작성된 이유는 부모 관계를 맥락에 맞게 설정하며, 오류를 발견하는 곳입니다.
- 검토 시간을 이견에 할애하세요. 그곳이 모델이 가장 약한 부분이며 결정 가치가 집중되는 곳입니다.
더 나은 초안, 판결이 아니다
실험실에서 주장을 채굴하는 것을 가로막던 병목 현상이 사라졌고, 다시 돌아오지 않을 것입니다. 이것은 분명히 인식할 가치가 있습니다: 연구 기법과 자신의 회의에 적용할 수 있는 것의 차이입니다.
하지만 1958년에 어려웠던 문제들은 지금도 어렵습니다. 영장은 여전히 작성되지 않았고, 의견 불일치는 여전히 드물며, 라벨은 여전히 문구보다는 부모에게 의존합니다. 변화한 것은 누가 그 문제를 가지게 되는가입니다. 이는 주석 작성자를 20년 동안 기다려온 분야에 있어 충분한 변화입니다.
주장 채굴 시리즈
기계가 주장을 읽는 방법을 배운 다섯 가지 게시물 — 이 분야의 기원, 어려운 문제들이 왜 어려운지, 그리고 우리가 이를 어떻게 적용하는지.
출처 및 추가 읽기
LLM 이전의 분야 상태 — 변화가 측정되는 기준으로 유용하다.
구술화된 자기 평가가 원시 토큰 확률보다 우수하다 — 그 결과는 대개 숫자를 신뢰할 수 있는 면허로 과도하게 해석된다.
LLM 접근 방식이 비교되는 감독된 벤치마크 결과입니다.
영장 — 스케일이 제공하지 않는 암묵적인 단계로, 이는 모델이 아닌 텍스트에서 결여되어 있기 때문입니다.
자주 묻는 질문
대형 언어 모델이 논증 채굴에 어떻게 변화를 가져왔나요?
그들은 각 새로운 도메인에서 수동 주석이 달린 말뭉치의 요구 사항을 제거했습니다. 프롬프트된 범용 모델은 도메인 특정 훈련 데이터 없이 주장, 전제 및 관계를 식별할 수 있으며, 이는 논증 채굴을 연구 기법에서 일반 조직 텍스트에서 사용할 수 있는 것으로 전환했습니다.
LLM이 논증 채굴에서 미세 조정된 모델보다 더 나은가요?
관계 기반 주장을 채굴하는 것에 대한 발표된 평가에서는 여러 데이터셋에서 일반 목적 모델이 세밀하게 조정된 인코더 기준선과 경쟁하거나 경우에 따라 더 나은 성능을 보인다는 결과가 나왔습니다. 더 큰 실용적인 장점은 새로운 도메인에 대해 주석이 달린 훈련 데이터가 전혀 필요하지 않다는 것입니다.
LLM이 해결하지 못한 문제는 무엇인가요?
세 가지 구조적 요소. 클래스 불균형은 사람들이 글을 쓰는 방식이 아니라 모델이 훈련되는 방식을 반영합니다. 지원 대 공격은 문구가 아니라 부모에 따라 달라집니다. 그리고 반대 의견은 종종 텍스트에 없는 명시되지 않은 보증을 겨냥하므로, 모델의 능력이 아무리 뛰어나도 이를 제공할 수 없습니다.
모델의 신뢰도 점수를 믿을 수 있나요?
순위 신호로서가 아니다. 언어화된 신뢰도는 원시 토큰 확률보다 더 잘 조정되지만 절대적인 측면에서 여전히 신뢰할 수 없으며, 중요성보다는 추출 확실성을 측정한다. 따라서 이를 기준으로 순위를 매기면 실제 주장을 담고 있는 느슨한 문장보다 잘 입증된 세부 사항이 체계적으로 우선시된다.
LLM을 사용하여 관계 분류를 실제로 개선하는 것은 무엇인가요?
모델이 지원 또는 공격 레이블을 부여하기 전에 기여가 부모에게 무엇을 하는지 말로 명시하도록 요구합니다. 이 서면 단계는 부모 관계를 작업 맥락으로 강제하며, 이는 문장의 자체 표현이 제공하지 못하는 정보입니다.
주장 채굴이 이제 해결된 문제인가요?
접근성은 해결되었지만 — 어떤 조직이든 주석 프로그램 없이 자체 텍스트에서 실행할 수 있습니다. 구조는 해결되지 않았습니다. 어떤 기여가 어떤 것에 응답하는지, 그리고 어떤 방향으로 응답하는지를 결정하는 것은 여전히 어렵기 때문에, 추출은 좋은 초안을 생성하지만 여전히 사람이 이견을 검토해야 합니다.
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
수정할 수 있는 초안
추출은 구조를 생성하고, 당신은 이견을 검토합니다. 전사본을 붙여넣고 노동 분담을 확인하세요.
