Enseñando a las máquinas a leer argumentos: La década de los corpora anotados | Argumentree
La minería de argumentos existió como una teoría durante décadas antes de convertirse en una tarea computacional medible. Lo que lo cambió fue la anotación: personas sentadas con miles de documentos y marcando, a mano, qué fragmentos eran afirmaciones, cuáles eran premisas y cuáles apoyaban o atacaban a cuáles. Christian Stab e Iryna Gurevych anotaron ensayos persuasivos de esta manera, produciendo el corpus comúnmente llamado AAEC. Andreas Peldszus y Manfred Stede construyeron un corpus de microtextos argumentativos cortos específicamente para estudiar la estructura del argumento. Joonsuk Park y Claire Cardie anotaron comentarios públicos presentados a la elaboración de normas en EE. UU., un género mucho más desordenado. La dificultad nunca fue solo el esfuerzo de etiquetado; fue que los anotadores humanos no están de acuerdo sobre lo que es un argumento, y una tarea en la que los humanos no pueden ponerse de acuerdo no puede ser evaluada de manera confiable. Por lo tanto, el acuerdo entre anotadores se convirtió en el guardián de todo el campo: define el límite práctico del rendimiento de las máquinas, porque un modelo no puede medirse como más consistente que la anotación contra la que se juzga. Los corpora también revelaron la asimetría permanente del campo: identificar componentes argumentativos resultó manejable, mientras que identificar las relaciones entre ellos no.
No se puede enseñar a una máquina a encontrar argumentos hasta que los humanos puedan ponerse de acuerdo sobre lo que es uno. Eso resultó ser la parte difícil, y moldeó todo lo que el campo midió después.
- La minería de argumentos se convirtió en un campo real solo cuando las personas anotaron a mano miles de documentos: afirmaciones, premisas y los vínculos entre ellas.
- Los anotadores no están de acuerdo, especialmente sobre las relaciones. El acuerdo entre anotadores se convirtió en el guardián, porque limita cuán bien se puede puntuar cualquier modelo.
- Tres corpus dieron forma a la década: ensayos persuasivos, microtextos argumentativos y comentarios sobre la elaboración de normas públicas — de limpios a desordenados.
- Cada corpus es un género. Un modelo entrenado con ensayos de estudiantes no se transfiere a una transcripción de reunión, y durante mucho tiempo nadie tuvo un corpus de transcripciones de reuniones.
- Los corpora expusieron la asimetría permanente: encontrar componentes es manejable, encontrar relaciones no lo es.
Dos expertos, un párrafo, dos respuestas diferentes
Dale a dos anotadores entrenados el mismo párrafo de un ensayo de un estudiante y hazles una pregunta simple: ¿cuál es la afirmación y cuáles son las oraciones que la respaldan? A menudo estarán en desacuerdo. No sobre el tema, ni sobre si el argumento es bueno o no, sino sobre dónde se encuentra.
Este es el hecho que dio forma a la primera década de la minería de argumentos computacionales, y es fácil subestimarlo. Todo lo que viene después depende de ello: no puedes construir un estándar para una tarea que las personas no pueden realizar de manera consistente, y no puedes afirmar que un modelo supera el rendimiento humano en un juicio que los humanos no comparten.
Inténtalo tú mismo en el último hilo de correo electrónico en el que discutiste. Marcar la reclamación suele ser fácil. Marcar a qué oración estaba dirigida cada objeción es donde comenzarás a dudar — y esa duda es toda la historia de esta década.
Por qué la teoría permaneció sin uso durante veinte años
A principios de la década de 1990, el aparato teórico estaba completo. Toulmin había dado al campo su anatomía, Walton su catálogo de patrones de razonamiento, Freeman la distinción entre atacar una conclusión y atacar la inferencia hacia ella. Como cubrimos en la primera publicación de esta serie, un argumento había sido redescrito como un gráfico etiquetado.
Un gráfico etiquetado es algo en lo que se puede puntuar a una computadora, en principio. En la práctica, necesitas algo contra lo que puntuarlo. Sin datos anotados, dos grupos de investigación que afirman resultados diferentes no tienen forma de resolverlo, y un campo donde los resultados no se pueden comparar no es un campo. Es una colección de demostraciones.
Así que la década que convirtió la minería de argumentos en una disciplina no fue una década de algoritmos. Fue una década de directrices de anotación.
Los Tres Corpora Que Definieron la Tarea
Diferentes grupos de investigación anotaron diferentes géneros, y la elección del género importó más de lo que cualquiera esperaba inicialmente.
- Ensayos persuasivos (Stab & Gurevych). Ensayos argumentativos de estudiantes, anotados para reclamos, premisas y las relaciones de apoyo/ataque entre ellos. Escritura estructurada por personas que intentaban explícitamente argumentar de manera clara — tan favorable como se puede obtener en un texto.
- Microtextos argumentativos (Peldszus y Stede). Textos cortos controlados construidos específicamente para estudiar la estructura del argumento, cada uno es un argumento compacto con una forma deliberada. Pequeños, claros y diseñados para que las preguntas estructurales tengan respuestas.
- Comentarios de elaboración de normas públicas (Park & Cardie). Comentarios presentados por el público a las consultas regulatorias de EE. UU. Reales, sin editar, frecuentemente divagantes — mucho más cercanos al texto que las organizaciones realmente tienen.
Esa progresión de limpio a desordenado es lo útil a notar. El rendimiento disminuye a medida que te desplazas hacia abajo en la lista, y disminuye más en las relaciones. Los ensayos fueron el caso amigable, y aun allí los números de relación fueron modestos.
El Acuerdo Inter-Anotador Es el Verdadero Techo
Los proyectos de anotación informan con qué frecuencia los anotadores independientes están de acuerdo, y en la minería de argumentos ese número no es una nota al pie. Es el límite.
Si dos humanos entrenados que siguen las mismas directrices están de acuerdo solo moderadamente sobre qué premisa se adjunta a qué afirmación, entonces un modelo evaluado en contra de uno de ellos no puede describirse de manera significativa como superior al otro. La medición en sí se vuelve inestable antes que el modelo.
El acuerdo es consistentemente mayor en los componentes que en las relaciones: las personas generalmente coinciden en cuál oración es una afirmación y divergen sobre a qué está respondiendo. Esa única asimetría predijo todo lo que los puntos de referencia mostrarían más tarde.
Ejecuta la prueba de anotación en tu propio equipo.
Toma un hilo de correo electrónico de decisión y pide a dos colegas, por separado, que marquen la única objeción más fuerte y digan a qué razón específica estaba dirigida. Si eligen objetivos diferentes, tu desacuerdo nunca fue sobre los hechos, y ninguna herramienta de resumen lo revelará, porque los resúmenes registran lo que se dijo en lugar de a qué estaba dirigido.
Las Directrices Son la Teoría, Hecha Operativa
Una guía de anotación suena como trabajo clerical. Está más cerca de una especificación. Cada ambigüedad que la teoría dejó abierta tiene que resolverse antes de que los anotadores puedan comenzar, y cada resolución es un compromiso real.
¿Es una pregunta retórica una afirmación? ¿Cuenta una reformulación en la conclusión como un nuevo componente o como el mismo? Cuando una oración apoya dos afirmaciones a la vez, ¿se adjunta a ambas, o a la más cercana, o a la más general? Si alguien concede un punto antes de refutarlo, ¿es la concesión un ataque a su propia posición?
Ninguna de estas tiene respuestas obvias, y cada corpus las respondió de manera ligeramente diferente. Por eso los modelos se transfieren mal entre corpora: están aprendiendo en parte un género y en parte las respuestas de un equipo a esas preguntas.
¿Pero no podrías simplemente anotar más datos?
Es la respuesta natural, y para la detección de componentes funcionó en términos generales. Más intervalos anotados produjeron una mejor detección de intervalos. Esa parte del campo mejoró de manera constante y predecible.
Para las relaciones no lo hizo, y la razón es estructural más que una cuestión de volumen. Las relaciones dependen del contexto fuera de la oración, lo cual es costoso de anotar de manera consistente. Las relaciones de desacuerdo son raras, por lo que escalar el corpus escala el desequilibrio junto con él. Y el paso de conexión a menudo no se declara, por lo que el anotador no está marcando algo visible en el texto; está marcando su reconstrucción de ello.
Más datos multiplican los tres problemas en lugar de resolverlos. Ese argumento es el tema de la próxima publicación.
Lo que la década dejó atrás
Dos cosas, ambas aún estructurales.
La primera es la definición de la tarea en sí. La descomposición en cuatro partes con la que ahora comienza cada artículo sobre minería de argumentos — encontrar los componentes, etiquetarlos, enlazarlos, clasificar los enlaces — es un producto de estos proyectos de anotación, no de la filosofía. Toulmin nunca propuso un proceso.
El segundo es el conjunto de referencia. Cuando un sistema moderno informa un número, generalmente lo está haciendo sobre ensayos o microtextos anotados en esta década. Eso es importante recordar al comparar cifras entre documentos: el mismo nombre de métrica en dos corpus diferentes no es la misma medición, y muchas comparaciones publicadas ignoran silenciosamente eso.
Lo que esto significa fuera del laboratorio
- Si los humanos no pueden ponerse de acuerdo sobre dónde está el argumento, ninguna herramienta te dará certeza. Trata la estructura extraída como un borrador para corregir, no como un veredicto a aceptar.
- El género importa más que el volumen. Un sistema ajustado para ensayos ordenados enfrenta un problema muy diferente en una transcripción de reunión llena de interrupciones y pensamientos a medio terminar.
- El desacuerdo sobre los objetivos es la verdadera señal. Cuando dos personas piensan que una objeción estaba dirigida a cosas diferentes, esa brecha es generalmente donde la decisión está realmente estancada.
- Compara números de referencia solo dentro de un corpus. La misma métrica en un conjunto de datos diferente es una medición diferente, por muy similar que parezca la etiqueta.
Dónde está el argumento
La década de anotación es la parte menos glamorosa de esta historia y la parte sobre la que descansa todo lo demás. Ningún modelo, por grande que sea, escapa al hecho de que su marcador fue construido por personas que a veces no estaban de acuerdo entre sí sobre dónde estaba un argumento.
Lo cual es algo útil para llevar a tus propias reuniones. Si encontrar el argumento es difícil para dos anotadores capacitados con una guía escrita, el hecho de que tu equipo siga reexaminando una decisión no es un problema de disciplina. Es el mismo problema, sin la guía.
La serie de minería de argumentos
Cinco publicaciones sobre cómo las máquinas aprendieron a leer argumentos: de dónde proviene el campo, por qué sus problemas difíciles son difíciles y cómo lo aplicamos.
Cómo un libro de filosofía de 1958 que los lógicos rechazaron se convirtió en la especificación para una tarea de aprendizaje automático.
El desacuerdo es raro en los datos y depende del contexto que la oración no contiene.
Los modelos de cero disparos eliminaron el cuello de botella del corpus y dejaron los problemas estructurales exactamente donde estaban.
Aplicándolo: categorías de argumentos, una afirmación principal por categoría y por qué la confianza es la señal de clasificación incorrecta.
Fuentes y Lecturas Adicionales
El proyecto de anotación del ensayo persuasivo y sus directrices — el corpus que hizo que la tarea fuera medible.
El tratamiento completo de análisis del mismo corpus, con los resultados de componentes y relaciones que generalmente se citan de él.
Operacionalizando el modelo de Freeman para la minería de argumentos automatizada: el puente de la teoría al esquema de anotación.
El corpus de comentarios públicos sobre la elaboración de normas del CDCP — reales, desordenados y mucho más difíciles que los ensayos.
La encuesta que consolidó la década — definiciones de tareas, corpora y práctica de evaluación.
Preguntas Frecuentes
¿Qué es un corpus de minería de argumentos?
Una colección de documentos en los que las personas han marcado a mano la estructura argumentativa: qué tramos son afirmaciones, cuáles son premisas y qué premisa apoya o ataca qué afirmación. Es lo que permite que los sistemas en competencia se comparen en datos idénticos, lo que convierte una idea en un campo de investigación.
¿Qué es el corpus AAEC?
El Corpus de Ensayos Anotados sobre Argumentos, construido por Christian Stab e Iryna Gurevych a partir de ensayos persuasivos de estudiantes. Anota los componentes del argumento y las relaciones entre ellos, y sigue siendo uno de los estándares de referencia para la minería de argumentos.
¿Por qué importa tanto el acuerdo entre anotadores?
Porque establece el límite en la medición. Si dos humanos capacitados que siguen la misma directriz no están de acuerdo sobre qué premisa se adjunta a qué afirmación, un modelo evaluado en contra de uno de ellos no puede demostrarse de manera significativa que supere al otro. La evaluación se vuelve inestable antes de que lo haga el modelo.
¿Por qué los modelos entrenados en un corpus tienen un rendimiento peor en otro?
Porque cada corpus es un género más un conjunto de decisiones de directrices. Los ensayos de los estudiantes son estructurados y deliberados; los comentarios públicos divagan. Un modelo aprende en parte el género y en parte las respuestas de un equipo de anotación a casos ambiguos, y ninguno se transfiere de manera limpia.
¿Puedes anotar más datos para corregir la detección de relaciones?
Ayudó considerablemente en la detección de componentes y mucho menos en la detección de relaciones. Las relaciones dependen del contexto más allá de la oración, las relaciones de desacuerdo son raras, por lo que escalar el corpus también escala el desequilibrio, y el paso de conexión a menudo no se declara — así que el anotador está marcando una reconstrucción en lugar de algo visible.
¿Qué corpora se utilizan como puntos de referencia hoy en día?
Los ensayos persuasivos y los microtextos argumentativos siguen siendo los más comunes, con corpora de comentarios públicos utilizados para evaluaciones más difíciles y desordenadas. Debido a que cada uno utiliza diferentes decisiones de anotación, el mismo nombre de métrica en dos corpora no representa la misma medición, lo que es una fuente frecuente de comparaciones engañosas.
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
Saltar el paso de anotación
Pega una transcripción y obtén un árbol estructurado de pros y contras que puedes corregir: el borrador es automático, el juicio sigue siendo tuyo.
La página de referencia para el campo — tareas, historia y por qué las relaciones son la parte difícil.
El arco de todo el campo, desde un libro de filosofía rechazado de 1958 hasta hoy.
Lo que los corpora revelaron sobre el desacuerdo y por qué más datos no lo solucionan.
Convierte una discusión en un árbol de argumentos.
Razonamiento estructurado a partir de tus propias transcripciones — no se requieren directrices de anotación.
Comenzar gratis