🖥️ Diapositivas — Sesión 19 (vie 13 nov)
Esta página es el contrato de las lecturas asignadas del trimestre. En este curso no hay reportes de lectura. En su lugar, cuatro tareas escalonadas corren a lo largo del trimestre y se construyen una sobre otra: usted verifica literatura con un asistente de IA, disecciona qué hace buenos o malos a los artículos, escribe sus propios estándares de calidad y termina construyendo un agente de revisión previa al envío a partir de esos estándares y evaluándolo con la maquinaria de 6.3. Cada etapa tiene un entregable calificado, listado en la tabla del final. Junto a las etapas, cada estudiante da una breve charla de pulso de artículo durante el trimestre, y cada estudiante presente califica cada charla mediante la encuesta de retroalimentación entre pares — presentar y evaluar son aquí ambas habilidades que se practican, no actuaciones de una sola vez. La programación semana a semana vive en el calendario del curso; esta página define qué entrega usted y cómo se califica.
El arco evalúa los resultados 10 (evaluar agentes de IA como instrumentos científicos), 11 (integrar la asistencia de IA conservando la propiedad intelectual) y 12 (traducir y valorar resultados para públicos distintos).
Etapa 1 — Revisión de literatura asistida por IA¶
El tema es el mismo para todos, localizado a su campo: las oportunidades y los desafíos de la IA en su subcampo de las geociencias. Dos lecturas ancla compartidas lo enmarcan — una revisión general del aprendizaje automático (machine learning, ML) en las geociencias y un artículo crítico sobre sus límites (las selecciones vigentes están listadas en el programa del curso; el par cambia conforme se mueve la literatura). A partir de ese punto de arranque, conduzca a un asistente de IA por una revisión de literatura localizada a su propio subcampo: pida el estado del campo, los artículos canónicos, las preguntas abiertas. Después verifique todo.
Este tema no es decorativo. Los artículos que saque a la superficie aquí son su materia prima para el resto del arco: sus objetivos de disección de la etapa 2, su charla de pulso de artículo y la postura que revisitará en la etapa 4 después de haber medido usted mismo a un agente.
El entregable es el registro de verificación, no el resumen. El resumen del asistente es materia prima; su trabajo calificado es la auditoría de ese resumen. Para cada cita que el asistente produjo, el registro anota:
| Campo | Qué va en él |
|---|---|
| Cita tal como se dio | Autores, año, medio, título tal como los enunció el asistente |
| ¿Resuelve? | ¿Un DOI o una URL estable lleva a un documento real? |
| Afirmación atribuida | Qué dice el resumen que muestra este artículo |
| Qué dice el artículo | Su lectura del resumen o de la sección pertinente reales |
| Veredicto | verificada / mal atribuida (artículo real, afirmación equivocada) / fabricada / no verificable |
Cierre el registro con un párrafo breve: cuántas citas sobrevivieron, qué modo de falla dominó y qué le costó la verificación en tiempo respecto del tiempo de redacción del asistente. Esa razón es el precio honesto de la lectura asistida por IA, y usted se la citará a sí mismo todo el trimestre.
Un resumen con citas sin verificar, por fluido que sea, obtiene cero. Este es el mismo deber que enuncia la política de IA del curso, aplicado a la lectura en vez de al código.
Etapa 2 — Anatomía de los buenos artículos científicos¶
Usted recibe dos artículos ejemplares de su área general: uno sólido, uno defectuoso. (El defectuoso es real o está levemente editado; no se le dice cuál es cuál.) Disecte ambos.
Entregable: una lista anotada de defectos y fortalezas, organizada por sección del artículo. Para cada sección de cada artículo, entradas que respondan tres preguntas:
- Defendibilidad de los métodos. ¿Podrían los autores defender cada decisión metodológica si se les cuestionara — particiones, modelos de referencia, tolerancias, exclusiones? ¿Dónde hay una decisión no enunciada, no justificada o propensa a la fuga de datos?
- Honestidad de las figuras. ¿Muestran las figuras lo que afirman los pies de figura? Rangos de los ejes, barras de error o su ausencia, ejemplos escogidos a conveniencia frente a ejemplos representativos.
- Vínculo afirmación–evidencia. Para cada afirmación del resumen y de las conclusiones, ¿qué figura, tabla o número la sustenta? Las afirmaciones sin sustento rastreable se marcan; también se marca la evidencia sólida que los autores subvaloraron.
Cada entrada cita una línea, figura o número específicos. «Los métodos son débiles» no gana nada; «la sección 3.2 ajusta el umbral de detección sobre los mismos eventos usados en la tabla 2» gana crédito. Esta es la habilidad que el agente de revisión necesitará en la etapa 4, practicada primero a mano.
La charla de pulso de artículo (parte de la calificación de la etapa 2)¶
Una vez durante el trimestre — las inscripciones abren en la semana 2 — usted da una charla de 4 minutos más una pregunta al inicio de una sesión de clase, sobre un artículo de su revisión de literatura de la etapa 1. El formato es fijo:
- La afirmación central del artículo, en una oración que un no especialista pueda seguir.
- La evidencia detrás de ella — qué figura o número carga con la afirmación.
- Una fortaleza y un defecto, juzgados contra la rúbrica en construcción de la clase.
- Una oración de declaración: qué hizo el asistente de IA en su flujo de trabajo de lectura, y qué verificó usted.
Corren dos charlas por sesión de la semana 3 a la 10, de modo que para el momento de escribir la rúbrica (etapa 3) la clase ha construido un corpus compartido de artículos diseccionados — decenas de ejemplos trabajados de cómo se ve lo bueno y lo malo, presentados por quienes los encontraron. La charla se califica dentro de los puntos de la etapa 2, con el mismo estándar que la lista escrita: la especificidad gana crédito, la vaguedad no.
Todos en la sala califican todas las charlas. Una breve encuesta de retroalimentación entre pares (en Canvas, el mismo instrumento todo el trimestre) recoge cinco valoraciones espejo de la rúbrica y dos líneas obligatorias de texto libre — una fortaleza específica, una mejora específica — durante cada charla. La retroalimentación llega al presentador anonimizada y filtrada. Completar las encuestas los días que usted asiste cuenta para la participación; sus valoraciones nunca se califican por su «corrección». La encuesta es en sí misma contenido del curso: es la rúbrica como calificador con muchos evaluadores, y las estadísticas de acuerdo de la propia clase sobre esas valoraciones regresan como conjunto de datos en vivo cuando 6.3 pregunta cuánto vale el veredicto de un solo evaluador. Usted presentará una vez y evaluará unas cuarenta; la segunda habilidad es la que el arco de verdad está entrenando.
Etapa 3 — Construya sus propios estándares¶
La etapa 2 le dio un vocabulario de defectos y fortalezas. La etapa 3, conducida mediante discusión en clase, lo convierte en su propio estándar explícito.
Entregable: una rúbrica de calidad para los artículos de su campo. La rúbrica enuncia:
- Criterios — cada uno una comprobación que un lector pueda resolver sin preguntarle a usted, formulada de modo que dos lectores lleguen al mismo veredicto. «Los métodos son rigurosos» no es un criterio; «todo modelo aprendido se compara contra un modelo de referencia del dominio, enunciado explícitamente» sí lo es.
- Pesos — qué criterios importan más en su campo, y por qué (una oración cada uno).
- Barras de aprobación — qué debe satisfacer un artículo antes de que usted lo enviara a una revista o a una parte interesada. Nombre los criterios que son requisitos duros frente a los que son orientativos.
Declare su género. Según las dos vías del proyecto final, usted escribe la rúbrica para uno de dos géneros y declara cuál al principio:
- Rúbrica de artículo de revista — estándares para un artículo de investigación con revisión por pares en su campo.
- Rúbrica de informe técnico / entregable para una parte interesada — estándares para un informe escrito para una persona que toma decisiones, nombrada: ¿enuncia la pregunta operativa en los términos de esa parte interesada, cuantifica qué ocurre cuando el modelo se equivoca, separa los hallazgos de las recomendaciones?
Los dos géneros comparten los estándares de evidencia de la etapa 2 pero difieren en qué significa «bueno»; una rúbrica que ignora al público de su género falla el resultado 12 por cuidadosamente que esté ponderada.
Escriba los criterios como comprobaciones binarias. La etapa 4 usará esta rúbrica como calificador, y solo los criterios binarios y verificables de forma independiente sobreviven a esa conversión — este es el requisito de rúbrica como calificador de la sección «Calificar sin verdad computable» de 6.3.
Etapa 4 — Construya y evalúe su agente de revisión¶
El trabajo culminante. Convierta su rúbrica de la etapa 3 en un agente de revisión previa al envío — un agente especificado cuyo trabajo es criticar un artículo o informe contra sus estándares antes de que usted lo envíe — y luego evalúe ese agente como 6.3 le enseñó a evaluar cualquier agente. El agente por sí solo no da puntos; la tarea calificada es la evaluación.
Entregable: un cuaderno o informe que contenga seis partes, en espejo con la estructura de la tarea de 6.3:
- Especificación de la tarea. Entradas (un manuscrito o informe), esquema de salida (qué comprobaciones de la rúbrica, en qué formato, con qué especificidad exigida — p. ej., que toda crítica cite una línea, figura o número) y restricciones. Escrita antes de correr nada.
- Conjunto de evaluación. Al menos seis artículos o informes breves con fortalezas y defectos conocidos y plantados — un fallo de fuga de datos, un umbral ajustado sobre el conjunto de prueba, una cita fabricada, un eje deshonesto — más al menos un caso negativo sin nada plantado, para que pueda atrapar a un agente que critica todo. La verdad de referencia para una tarea subjetiva es algo que usted diseña: «encontró el defecto plantado» es una comprobación computable incluso cuando «¿es buena esta revisión?» no lo es.
- Rúbrica como calificador. Su rúbrica de la etapa 3, aplicada como comprobaciones binarias a las revisiones del agente. Califique cada comprobación de forma independiente en lugar de pedir una impresión global, y aplique los controles del sesgo del juez de 6.2: califique los pares en ambos órdenes, y ciegue al calificador respecto de qué salida vino de qué agente.
- Acuerdo entre dos evaluadores. Intercambie con un compañero las revisiones del agente de un caso; ambos las califican con su rúbrica. Reporte el acuerdo porcentual y el kappa de Cohen (6.3 muestra el cálculo de cinco líneas y por qué el porcentaje por sí solo engaña — dos evaluadores indulgentes coinciden constantemente por azar). Un kappa bajo es un defecto de la rúbrica antes que un defecto de los evaluadores: reescriba el criterio ambiguo, recalifique, reporte ambas rondas.
- Ejecución y análisis de fallas. Corra el agente N=5 veces por caso y reporte tasas de éxito con errores estándar binomiales, no veredictos únicos — un modelo muestreado atrapa un defecto plantado en algunas corridas y lo pierde en otras, y con N=5 una tasa cercana a 0.5 acarrea alrededor de ±0.22. Agrupe las fallas y diagnostique cada grupo: limitación del agente, defecto de la rúbrica, o un caso que era genuinamente ambiguo.
- Reflexión de cierre (media página). Vuelva a su tema de la etapa 1 — las oportunidades y los desafíos de la IA en su subcampo — y respóndalo de nuevo, ahora citando sus propias mediciones en vez de las afirmaciones de la literatura: qué atrapó su agente de forma confiable, qué se le escapó, qué dicen el kappa y las tasas de éxito sobre delegar el juicio. Vale la pena enunciar las posturas que cambiaron desde la etapa 1; también las que sobrevivieron al contacto con los datos.
Base calificada: la vía sin conexión con transcripciones grabadas. Como en todo este capítulo, el trabajo calificado corre sin conexión. El curso provee transcripciones de revisión grabadas — un agente de revisión de referencia corrido N=5 por caso sobre un corpus de defectos plantados — y su rúbrica, su calificador, su análisis de acuerdo y su análisis de fallas corren contra esas grabaciones, en CI, sin red. Usted igualmente entrega la especificación completa de su propio agente (parte 1) construida a partir de su propia rúbrica; las grabaciones sustituyen a las corridas.
Opcional: la vía en vivo. Si tiene el hardware, corra su propia especificación contra OLMo 2 servido localmente por Ollama, exactamente como lo hace la sección opcional de 6.3 (ollama pull olmo2, active con MLGEO_LIVE_EVAL=1; unos 8 GB de RAM, funciona en CPU). Califique las transcripciones nuevas con la misma maquinaria. Nada de la vía en vivo es obligatorio y no otorga puntos extra; la vía sin conexión es la base calificada para que la tarea funcione en entornos restringidos.
Calificación¶
100 puntos a lo largo del arco. Cada entregable nombra además las herramientas de IA usadas y para qué, según la política de declaración.
| Etapa | Entregable | Puntos | Resultado evaluado |
|---|---|---|---|
| 1 | Registro de verificación de citas | 15 | 11 (verificar salidas, hacerse dueño del resultado) |
| 2 | Lista anotada de defectos y fortalezas, ambos artículos, + la charla de pulso de artículo | 20 (15 escrito + 5 charla) | 10 (analizar modos de falla), 12 (valorar el vínculo afirmación–evidencia para un público, oralmente y por escrito) |
| 3 | Rúbrica de calidad con declaración de género | 25 | 11 (hacerse dueño de sus estándares), 12 (criterios específicos del género y del público) |
| 4 | Especificación del agente + informe de evaluación (especificación, conjunto de evaluación, calificador, kappa, análisis de fallas, reflexión de cierre) | 40 | 10 (maquinaria completa de evaluación), 11 (defender los veredictos del agente como propios), 1 (valorar el papel de la IA en su campo, a partir de evidencia) |
Las encuestas de retroalimentación entre pares son crédito de participación, registrado por finalización los días que usted asiste; no aportan puntos del arco y sus valoraciones nunca se juzgan por su exactitud.
Diferenciación 469 / 569¶
El arco corre en dos niveles, siguiendo la regla de impartición del curso (nivel Aplicar para 469, nivel Crear para 569 en el resultado 10):
| Etapa | ESS 469 | ESS 569 |
|---|---|---|
| 1–2 | Idéntico | Idéntico |
| 3 | Adaptar un esqueleto de rúbrica provisto: fijar los pesos y las barras de aprobación, y añadir al menos dos criterios específicos de su campo y su género | Escribir la rúbrica desde cero: al menos diez criterios binarios, pesos y barras de aprobación, con la justificación de una oración para cada peso |
| 4 | Evaluar contra el corpus de defectos plantados y las transcripciones grabadas provistos por el curso; se exigen calificador completo, kappa y análisis de fallas | Además, redactar al menos dos documentos propios del conjunto de evaluación, con defectos que usted planta y documenta, y añadirlos al corpus |
La medición de kappa y el análisis de fallas se exigen en ambos niveles; son las partes de la maquinaria que no se diluyen.
Por qué el arco termina aquí¶
Para la etapa 4 usted ha escrito los estándares, los ha codificado como comprobaciones y ha medido — con estadísticas de acuerdo y tasas de éxito, no con impresiones — qué tan bien los aplica un agente. El agente hace cumplir una rúbrica que usted escribió, ponderada por razones que usted puede enunciar, probada contra defectos que usted puede nombrar. Cuando alguien pregunte si la IA escribió su artículo o lo escribió usted, el arco es la respuesta del curso: el asistente redacta y critica, pero los estándares que hace cumplir son suyos, y usted puede defender cada uno de ellos sin que él esté en la sala.