Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

6.5 El arco de lectura: de los artículos a un agente de revisión

🖥️ Diapositivas — Sesión 19 (vie 13 nov)

Esta página es el contrato de las lecturas asignadas del trimestre. En este curso no hay reportes de lectura. En su lugar, cuatro tareas escalonadas corren a lo largo del trimestre y se construyen una sobre otra: usted verifica literatura con un asistente de IA, disecciona qué hace buenos o malos a los artículos, escribe sus propios estándares de calidad y termina construyendo un agente de revisión previa al envío a partir de esos estándares y evaluándolo con la maquinaria de 6.3. Cada etapa tiene un entregable calificado, listado en la tabla del final. Junto a las etapas, cada estudiante da una breve charla de pulso de artículo durante el trimestre, y cada estudiante presente califica cada charla mediante la encuesta de retroalimentación entre pares — presentar y evaluar son aquí ambas habilidades que se practican, no actuaciones de una sola vez. La programación semana a semana vive en el calendario del curso; esta página define qué entrega usted y cómo se califica.

El arco evalúa los resultados 10 (evaluar agentes de IA como instrumentos científicos), 11 (integrar la asistencia de IA conservando la propiedad intelectual) y 12 (traducir y valorar resultados para públicos distintos).

Etapa 1 — Revisión de literatura asistida por IA

El tema es el mismo para todos, localizado a su campo: las oportunidades y los desafíos de la IA en su subcampo de las geociencias. Dos lecturas ancla compartidas lo enmarcan — una revisión general del aprendizaje automático (machine learning, ML) en las geociencias y un artículo crítico sobre sus límites (las selecciones vigentes están listadas en el programa del curso; el par cambia conforme se mueve la literatura). A partir de ese punto de arranque, conduzca a un asistente de IA por una revisión de literatura localizada a su propio subcampo: pida el estado del campo, los artículos canónicos, las preguntas abiertas. Después verifique todo.

Este tema no es decorativo. Los artículos que saque a la superficie aquí son su materia prima para el resto del arco: sus objetivos de disección de la etapa 2, su charla de pulso de artículo y la postura que revisitará en la etapa 4 después de haber medido usted mismo a un agente.

El entregable es el registro de verificación, no el resumen. El resumen del asistente es materia prima; su trabajo calificado es la auditoría de ese resumen. Para cada cita que el asistente produjo, el registro anota:

CampoQué va en él
Cita tal como se dioAutores, año, medio, título tal como los enunció el asistente
¿Resuelve?¿Un DOI o una URL estable lleva a un documento real?
Afirmación atribuidaQué dice el resumen que muestra este artículo
Qué dice el artículoSu lectura del resumen o de la sección pertinente reales
Veredictoverificada / mal atribuida (artículo real, afirmación equivocada) / fabricada / no verificable

Cierre el registro con un párrafo breve: cuántas citas sobrevivieron, qué modo de falla dominó y qué le costó la verificación en tiempo respecto del tiempo de redacción del asistente. Esa razón es el precio honesto de la lectura asistida por IA, y usted se la citará a sí mismo todo el trimestre.

Un resumen con citas sin verificar, por fluido que sea, obtiene cero. Este es el mismo deber que enuncia la política de IA del curso, aplicado a la lectura en vez de al código.

Etapa 2 — Anatomía de los buenos artículos científicos

Usted recibe dos artículos ejemplares de su área general: uno sólido, uno defectuoso. (El defectuoso es real o está levemente editado; no se le dice cuál es cuál.) Disecte ambos.

Entregable: una lista anotada de defectos y fortalezas, organizada por sección del artículo. Para cada sección de cada artículo, entradas que respondan tres preguntas:

Cada entrada cita una línea, figura o número específicos. «Los métodos son débiles» no gana nada; «la sección 3.2 ajusta el umbral de detección sobre los mismos eventos usados en la tabla 2» gana crédito. Esta es la habilidad que el agente de revisión necesitará en la etapa 4, practicada primero a mano.

La charla de pulso de artículo (parte de la calificación de la etapa 2)

Una vez durante el trimestre — las inscripciones abren en la semana 2 — usted da una charla de 4 minutos más una pregunta al inicio de una sesión de clase, sobre un artículo de su revisión de literatura de la etapa 1. El formato es fijo:

  1. La afirmación central del artículo, en una oración que un no especialista pueda seguir.
  2. La evidencia detrás de ella — qué figura o número carga con la afirmación.
  3. Una fortaleza y un defecto, juzgados contra la rúbrica en construcción de la clase.
  4. Una oración de declaración: qué hizo el asistente de IA en su flujo de trabajo de lectura, y qué verificó usted.

Corren dos charlas por sesión de la semana 3 a la 10, de modo que para el momento de escribir la rúbrica (etapa 3) la clase ha construido un corpus compartido de artículos diseccionados — decenas de ejemplos trabajados de cómo se ve lo bueno y lo malo, presentados por quienes los encontraron. La charla se califica dentro de los puntos de la etapa 2, con el mismo estándar que la lista escrita: la especificidad gana crédito, la vaguedad no.

Todos en la sala califican todas las charlas. Una breve encuesta de retroalimentación entre pares (en Canvas, el mismo instrumento todo el trimestre) recoge cinco valoraciones espejo de la rúbrica y dos líneas obligatorias de texto libre — una fortaleza específica, una mejora específica — durante cada charla. La retroalimentación llega al presentador anonimizada y filtrada. Completar las encuestas los días que usted asiste cuenta para la participación; sus valoraciones nunca se califican por su «corrección». La encuesta es en sí misma contenido del curso: es la rúbrica como calificador con muchos evaluadores, y las estadísticas de acuerdo de la propia clase sobre esas valoraciones regresan como conjunto de datos en vivo cuando 6.3 pregunta cuánto vale el veredicto de un solo evaluador. Usted presentará una vez y evaluará unas cuarenta; la segunda habilidad es la que el arco de verdad está entrenando.

Etapa 3 — Construya sus propios estándares

La etapa 2 le dio un vocabulario de defectos y fortalezas. La etapa 3, conducida mediante discusión en clase, lo convierte en su propio estándar explícito.

Entregable: una rúbrica de calidad para los artículos de su campo. La rúbrica enuncia:

Declare su género. Según las dos vías del proyecto final, usted escribe la rúbrica para uno de dos géneros y declara cuál al principio:

Los dos géneros comparten los estándares de evidencia de la etapa 2 pero difieren en qué significa «bueno»; una rúbrica que ignora al público de su género falla el resultado 12 por cuidadosamente que esté ponderada.

Escriba los criterios como comprobaciones binarias. La etapa 4 usará esta rúbrica como calificador, y solo los criterios binarios y verificables de forma independiente sobreviven a esa conversión — este es el requisito de rúbrica como calificador de la sección «Calificar sin verdad computable» de 6.3.

Etapa 4 — Construya y evalúe su agente de revisión

El trabajo culminante. Convierta su rúbrica de la etapa 3 en un agente de revisión previa al envío — un agente especificado cuyo trabajo es criticar un artículo o informe contra sus estándares antes de que usted lo envíe — y luego evalúe ese agente como 6.3 le enseñó a evaluar cualquier agente. El agente por sí solo no da puntos; la tarea calificada es la evaluación.

Entregable: un cuaderno o informe que contenga seis partes, en espejo con la estructura de la tarea de 6.3:

  1. Especificación de la tarea. Entradas (un manuscrito o informe), esquema de salida (qué comprobaciones de la rúbrica, en qué formato, con qué especificidad exigida — p. ej., que toda crítica cite una línea, figura o número) y restricciones. Escrita antes de correr nada.
  2. Conjunto de evaluación. Al menos seis artículos o informes breves con fortalezas y defectos conocidos y plantados — un fallo de fuga de datos, un umbral ajustado sobre el conjunto de prueba, una cita fabricada, un eje deshonesto — más al menos un caso negativo sin nada plantado, para que pueda atrapar a un agente que critica todo. La verdad de referencia para una tarea subjetiva es algo que usted diseña: «encontró el defecto plantado» es una comprobación computable incluso cuando «¿es buena esta revisión?» no lo es.
  3. Rúbrica como calificador. Su rúbrica de la etapa 3, aplicada como comprobaciones binarias a las revisiones del agente. Califique cada comprobación de forma independiente en lugar de pedir una impresión global, y aplique los controles del sesgo del juez de 6.2: califique los pares en ambos órdenes, y ciegue al calificador respecto de qué salida vino de qué agente.
  4. Acuerdo entre dos evaluadores. Intercambie con un compañero las revisiones del agente de un caso; ambos las califican con su rúbrica. Reporte el acuerdo porcentual y el kappa de Cohen (6.3 muestra el cálculo de cinco líneas y por qué el porcentaje por sí solo engaña — dos evaluadores indulgentes coinciden constantemente por azar). Un kappa bajo es un defecto de la rúbrica antes que un defecto de los evaluadores: reescriba el criterio ambiguo, recalifique, reporte ambas rondas.
  5. Ejecución y análisis de fallas. Corra el agente N=5 veces por caso y reporte tasas de éxito con errores estándar binomiales, no veredictos únicos — un modelo muestreado atrapa un defecto plantado en algunas corridas y lo pierde en otras, y con N=5 una tasa cercana a 0.5 acarrea alrededor de ±0.22. Agrupe las fallas y diagnostique cada grupo: limitación del agente, defecto de la rúbrica, o un caso que era genuinamente ambiguo.
  6. Reflexión de cierre (media página). Vuelva a su tema de la etapa 1 — las oportunidades y los desafíos de la IA en su subcampo — y respóndalo de nuevo, ahora citando sus propias mediciones en vez de las afirmaciones de la literatura: qué atrapó su agente de forma confiable, qué se le escapó, qué dicen el kappa y las tasas de éxito sobre delegar el juicio. Vale la pena enunciar las posturas que cambiaron desde la etapa 1; también las que sobrevivieron al contacto con los datos.

Base calificada: la vía sin conexión con transcripciones grabadas. Como en todo este capítulo, el trabajo calificado corre sin conexión. El curso provee transcripciones de revisión grabadas — un agente de revisión de referencia corrido N=5 por caso sobre un corpus de defectos plantados — y su rúbrica, su calificador, su análisis de acuerdo y su análisis de fallas corren contra esas grabaciones, en CI, sin red. Usted igualmente entrega la especificación completa de su propio agente (parte 1) construida a partir de su propia rúbrica; las grabaciones sustituyen a las corridas.

Opcional: la vía en vivo. Si tiene el hardware, corra su propia especificación contra OLMo 2 servido localmente por Ollama, exactamente como lo hace la sección opcional de 6.3 (ollama pull olmo2, active con MLGEO_LIVE_EVAL=1; unos 8 GB de RAM, funciona en CPU). Califique las transcripciones nuevas con la misma maquinaria. Nada de la vía en vivo es obligatorio y no otorga puntos extra; la vía sin conexión es la base calificada para que la tarea funcione en entornos restringidos.

Calificación

100 puntos a lo largo del arco. Cada entregable nombra además las herramientas de IA usadas y para qué, según la política de declaración.

EtapaEntregablePuntosResultado evaluado
1Registro de verificación de citas1511 (verificar salidas, hacerse dueño del resultado)
2Lista anotada de defectos y fortalezas, ambos artículos, + la charla de pulso de artículo20 (15 escrito + 5 charla)10 (analizar modos de falla), 12 (valorar el vínculo afirmación–evidencia para un público, oralmente y por escrito)
3Rúbrica de calidad con declaración de género2511 (hacerse dueño de sus estándares), 12 (criterios específicos del género y del público)
4Especificación del agente + informe de evaluación (especificación, conjunto de evaluación, calificador, kappa, análisis de fallas, reflexión de cierre)4010 (maquinaria completa de evaluación), 11 (defender los veredictos del agente como propios), 1 (valorar el papel de la IA en su campo, a partir de evidencia)

Las encuestas de retroalimentación entre pares son crédito de participación, registrado por finalización los días que usted asiste; no aportan puntos del arco y sus valoraciones nunca se juzgan por su exactitud.

Diferenciación 469 / 569

El arco corre en dos niveles, siguiendo la regla de impartición del curso (nivel Aplicar para 469, nivel Crear para 569 en el resultado 10):

EtapaESS 469ESS 569
1–2IdénticoIdéntico
3Adaptar un esqueleto de rúbrica provisto: fijar los pesos y las barras de aprobación, y añadir al menos dos criterios específicos de su campo y su géneroEscribir la rúbrica desde cero: al menos diez criterios binarios, pesos y barras de aprobación, con la justificación de una oración para cada peso
4Evaluar contra el corpus de defectos plantados y las transcripciones grabadas provistos por el curso; se exigen calificador completo, kappa y análisis de fallasAdemás, redactar al menos dos documentos propios del conjunto de evaluación, con defectos que usted planta y documenta, y añadirlos al corpus

La medición de kappa y el análisis de fallas se exigen en ambos niveles; son las partes de la maquinaria que no se diluyen.

Por qué el arco termina aquí

Para la etapa 4 usted ha escrito los estándares, los ha codificado como comprobaciones y ha medido — con estadísticas de acuerdo y tasas de éxito, no con impresiones — qué tan bien los aplica un agente. El agente hace cumplir una rúbrica que usted escribió, ponderada por razones que usted puede enunciar, probada contra defectos que usted puede nombrar. Cuando alguien pregunte si la IA escribió su artículo o lo escribió usted, el arco es la respuesta del curso: el asistente redacta y critica, pero los estándares que hace cumplir son suyos, y usted puede defender cada uno de ellos sin que él esté en la sala.