LLMとアーギュメントマイニングが出会ったとき: 何が変わり、何が変わらなかったのか | Argumentree
その歴史のほとんどの間、計算論的議論マイニングは新しいドメインごとに手動で注釈付けされたコーパスを必要としました。その要件はこの分野の制約でした:注釈作業は大規模で、ガイドラインは議論の余地があり、学生のエッセイに調整されたシステムは会議の議事録や公的コメントにうまく適応しませんでした。大規模言語モデルはその制約を取り除きました。汎用モデルは、ドメイン特有のトレーニングデータなしで、プロンプトからコンポーネント検出と関係分類を実行できます。公開された評価では、プロンプトされた汎用モデルが関係ベースの議論マイニングにおいて微調整されたエンコーダーベースラインと競争力があり、場合によってはそれよりも優れていることが示されています。これにより、議論マイニングの目的が変わりました:それはキュレーションされた研究コーパスだけでなく、通常の組織テキストでも使用可能になりました。しかし、変わらなかったのは難しい問題の構造です。クラスの不均衡は、人々の書き方を反映しており、モデルのトレーニング方法を反映しているわけではありません。貢献が支持するか攻撃するかは、その表現ではなく親に依存します。そして、反論はしばしば、テキストのどこにも現れない暗黙の根拠をターゲットにします。大規模モデルはまた、自らの新たな難しさをもたらしました:言語化された信頼度は生のトークン確率よりも良く調整されていますが、依然としてランキング信号としては信頼できません。そのため、モデルの確実性を使用して、どの抽出された議論が最も重要かを決定することはできません。
コーパスのボトルネックは消えた。構造的な問題は一ミリも動かなかった — そして解決策の衣装をまとった新たな問題が現れた。
- 議論マイニングは、ドメインごとに手動で注釈されたコーパスを必要としました。しかし、一般的なモデルはそれを必要とせず、これが通常のビジネステキストでの利用を可能にしました。
- 公開された評価では、一般目的モデルが関係分類においてファインチューニングされたエンコーダーベースラインと競争力があり、時にはそれよりも優れていることが示されています。
- 不均衡、文脈依存性、そして明示されていない根拠は、モデルのサイズではなく、言語とタスクの特性です。
- モデルの信頼性は生の確率よりも良く調整されていますが、それでも信頼できるランキング信号ではありません — 新しい道具ではなく、新しい罠です。
- 助けになるのは、ラベルが確定される前に関係を言葉で表現することを強制することです。
その分野を定義していた制約が単に適用されなくなった
20年間、私たちのデータに対して議論マイニングを実行できますか?という質問の答えは別の質問でした。それは、あなたの文書の中で手作業で注釈を付けることにどれだけの数千を許容しますか、そして誰がガイドラインを書くのですか?
それは技術的な詳細ではありませんでした。それは、議論マイニングが研究室に留まり、感情分析がすべての製品に搭載された理由でした。アノテーションの要件により、各新しいドメインは設定ではなくプロジェクトとなり、このシリーズの第二の投稿が説明したように、ガイドライン自体が専門家の間でも争われていました。
その後、汎用言語モデルが登場し、その質問はされなくなりました。今では、誰も注釈を付けたことのない分野の会議のトランスクリプトにモデルを向けると、使える初期の結果が得られます。この機能が突然製品に現れた理由が気になったことがあるなら、それが理由です。
ゼロショットが全ての物語です
変わった具体的な点は、ドメイン特有の監視の削除です。プロンプトされたモデルは言語に関する一般的な能力を持ち、推論時にプロンプト内で主張が何であるか、前提が何であるかを指示することができます。
関係ベースのアーギュメントマイニングに関する公開された研究は、複数のデータセットにわたってファインチューニングされたエンコーダーベースラインと競合する少数ショットプロンプティングを用いた汎用モデルを見出しました — そして場合によってはそれらを上回っています。注釈付きコーパスに対する教師ありトレーニングに基づいて構築された評価装置全体を持つ分野にとって、それは真の断絶です。
3つの実用的な結果が続きます。ドメイン適応は再訓練ではなくプロンプト切り替えになります。長い文書は扱いやすくなります。なぜなら、コンテキストウィンドウが大きくなったからです。そして、証拠フィールドは説明を持つことができ、モデルは同じ呼び出しで自らを正当化するように求められることができます — これは思ったよりも重要です。
動かなかった三つの問題
前回の投稿の内容はすべて当てはまり、スケールがそれに対処しない理由について正確であることが重要です。
- クラスの不均衡は、トレーニングの特性ではなく、執筆の特性です。 ケースを構築する人々は主に支持する文を書きます。インターネット全体を読んだモデルも、主に同意を読んでいます。
- 文脈依存性はタスクの特性です。 支持と攻撃は関係であり、文の属性ではありません。異なる親の下にある同じ文は異なるラベルを持ち、世界知識の量がそれを変えることはありません。
- 明示されていない保証はテキストの特性です。 証拠と結論を結びつける原則が決して書き留められていなければ、それは入力には含まれていません。より大きなモデルは、同じ欠落した文を読み取ります。
第四の、より微妙なものがあります。流暢なモデルは流暢な出力を生成するため、そのエラーはうまく表現され、一貫性があります。エンコーダからの誤った関係ラベルはノイズのように見えました。言語モデルからの誤った関係ラベルは引数のように見えます。
新しい罠:モデル自身の確実性を信頼すること
これらのモデルは自分たちの自信の度合いを報告できるため、その数値を使用して抽出された議論をランク付けしたり、どれが重要かを決定したり、表示される内容を制御したりすることが魅力的です。
Saurav Kadavathと同僚の研究によると、言語化された自己評価は生のトークン確率よりも意味的に良く調整されていることがわかりました。その結果は、数字を信頼するための根拠としてしばしば引用されます。しかし、その後の評価は一貫してあまり励みになるものではありません:代替案よりも良いということは、信頼できるということとは同じではなく、調整は必要なところ、つまり難しいケースや珍しいケースで劣化します。
実践の中にはカテゴリーエラーも隠れています。信頼度は、モデルが実際の主張を見つけたことにどれだけ確信を持っているかを測ります。それは、その主張が議論の中心であるかどうかについては何も言いません。明確に表現された統計は、簡単で高い信頼度の抽出です。一方、実際の論文である偶然の条件付き文は難しいものです。信頼度によるランキングは証拠を促進し、主張を低く評価します — これはまさにこのシリーズの最終投稿が冒頭で指摘している失敗です。
よく知っているトランスクリプトでテストしてください。
明確に覚えている会議を取り上げ、その主な議論が何だったのかを任意のAIツールに尋ねてみてください。もしそれが、実際に決定を促した曖昧な文ではなく、最も正確で証拠に基づいた文を提供した場合、あなたは自信が重要性の代わりに立っているのを目撃したことになります — そして、そのランキングを信頼しないべきだと知ることになります。
ヘルプとは:最初に「なぜ」と言わせること
これらのモデルで利用可能な最も信頼性の高い改善は、ほとんど恥ずかしいほど簡単です。ラベルの前に理由を尋ねてください。
貢献がその親に何をするかを書き出すことをモデルに要求すること — これは上記の反対意見を強化します。なぜなら、それがその反対意見が成立する別の理由を提供するからです — 支持または攻撃の判断にコミットする前に、測定可能に判断を改善します。書かれたステップは親の関係をモデルの作業コンテキストに強制的に組み込みますが、これは文の表現が提供できない正確な情報です。
これは徹底的に人間的な技術の機械版です。これがスティールマニングが機能する理由です:議論が実際に何をしているのかを明確にすることで、判断を下す前に、その判断が変わります。
では、議論マイニングは解決されたのでしょうか?
いいえ、残っているものの形は今まで以上に明確です。
実際的に解決されたのはアクセスです。今日、どの組織でも独自のテキストに対してアーギュメントマイニングを実行できるようになりましたが、これは数年前には考えられなかったことです。これは実際に大きな変化です。
解決されていないのは構造です:どの貢献がどの貢献に応じ、どの方向に向かうのか、接続原則が明示されておらず、データが人間と機械の両方に合意を期待させるように訓練しているときに。正直な立場は、抽出が現在、どの分野でも良いドラフトを生成することを示しており、依然として人が意見の不一致を確認しなければならないということです。これは、誰も構造を全く構築しなかった場合よりも、かなり良い労働の分担です。
この井戸の使い方
- 自信でランク付けしないでください。 それは重要性ではなく、抽出の確実性を測定し、主張よりも証拠を体系的に促進します。
- 関係を尋ね、感情を尋ねるな。 有用な質問は、これが親に何をもたらすかであり、決してそのトピックについてどう感じるかではない。
- ラベルを与える前にそれを正当化してください。 書かれた理由が親の関係を文脈に置き、そこでエラーを見つけることができます。
- レビューの時間は意見の相違に費やしてください。 そこがモデルの弱点であり、意思決定の価値が集中している場所です。
より良い草案、判決ではない
研究室に留まっていた議論マイニングのボトルネックは解消され、再び戻ることはありません。それを明確に理解することが重要です:それは研究技術と、自分の会議で指摘できる何かとの違いです。
しかし、1958年に難しかった問題は今も難しいままです。令状はまだ書かれておらず、意見の不一致は依然としてまれで、ラベルは依然として表現よりも親に依存しています。変わったのは、誰がその問題を持つことができるかということです。これは、20年間アノテーターを待っていた分野にとっては、十分な変化です。
議論マイニングシリーズ
機械が議論を読む方法を学んだ5つの投稿 — この分野の起源、なぜその難しい問題が難しいのか、そして私たちがどのようにそれを応用しているのか。
出典とさらなる参考文献
LLM以前の分野の状態 — 変化が測定される基準として有用です。
言語化された自己評価は、生のトークン確率を上回る — 結果はしばしばその数字を信頼する許可として過剰に解釈される。
LLMアプローチが比較される監視されたベンチマーク結果。
令状 — スケールが提供しない書かれていないステップであり、それはモデルからではなく、テキストから欠如しているためです。
よくある質問
大規模言語モデルは議論マイニングをどのように変えましたか?
彼らは各新しいドメインにおける手動注釈付きコーパスの要件を削除しました。プロンプトされた汎用モデルは、ドメイン特有のトレーニングデータなしで主張、前提、および関係を特定できるため、議論マイニングは研究技術から通常の組織テキストで使用可能なものに変わりました。
LLMは、引数マイニングにおいてファインチューニングされたモデルより優れていますか?
関係ベースの議論マイニングに関する公開された評価では、一般的なモデルが複数のデータセットにおいてファインチューニングされたエンコーダーベースラインと競争力があり、場合によってはそれを上回ることが示されています。より大きな実用的な利点は、新しいドメインに対して全く注釈付きのトレーニングデータを必要としないことです。
LLMはどのような問題を解決できなかったのか?
三つの構造的なもの。クラスの不均衡は、人々の書き方を反映しており、モデルのトレーニング方法を反映しているわけではありません。支持と攻撃は、言葉遣いではなく親に依存します。そして、反論はしばしばテキストに存在しない明示されていない根拠を狙うため、モデルの能力がどれだけあってもそれを提供することはできません。
モデルの信頼度スコアを信頼できますか?
ランキングシグナルとしてではなく、言語化された自信は生のトークン確率よりも適切に調整されていますが、絶対的な意味では信頼性がなく、重要性ではなく抽出の確実性を測定します。そのため、これによってランキングを行うと、実際の主張を含む緩い文よりも、十分に証拠がある詳細が体系的に促進されます。
LLMを用いた関係分類を実際に改善するものは何ですか?
モデルに、サポートまたは攻撃のラベルを付ける前に、貢献がその親に何をするかを言葉で述べることを要求します。この書かれたステップは、親の関係を作業コンテキストに強制し、これは文の自体の表現が提供できない情報そのものです。
議論のマイニングは現在解決された問題ですか?
アクセスは解決されました — どの組織でも独自のテキストでそれを実行できますが、構造は解決されていません。どの貢献がどの貢献に応じているのか、またその方向性を決定することは依然として難しく、抽出は良いドラフトを生成しますが、最終的には人が意見の不一致をレビューします。
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
修正できるドラフト
抽出は構造を生み出し、あなたは意見の不一致を確認します。トランスクリプトを貼り付けて、作業の分担を確認してください。
