🖥️ Diapositivas — Sesión 27 (vie 4 dic)
Un resultado, N públicos. La disciplina consiste en decidir qué cambia entre versiones — y en demostrar que lo que no cambió es la verdad de la afirmación.
Qué cambia entre públicos¶
Cuatro públicos cubren casi todo lo que encuentra una persona que hace geociencias. Lo que varía entre ellos no es «qué tan inteligentes son» (nunca escriba con condescendencia); es qué dan ya por supuesto, qué van a hacer con la información, y con qué tipo de enunciado de incertidumbre pueden actuar.
| Público | Vocabulario | Qué puede dar por supuesto | Qué poner al frente | Encuadre de la incertidumbre |
|---|---|---|---|---|
| Pares de la disciplina (p. ej., sismólogos) | Técnico completo | Métodos, benchmarks (comparativas de referencia), rarezas de los datos | Qué hay de nuevo respecto al estado del arte; dónde falla | Completo: métricas, intervalos de confianza, ablaciones |
| Científico de campo vecino (p. ej., ingeniería civil) | Técnico, pero su jerga traducida a la de ellos | Alfabetización cuantitativa general; otros benchmarks y otras normas | La cantidad que consumen sus modelos; el rango de operación donde el de usted es válido | Cuantificada, en sus unidades y convenciones |
| Financiadores / tomadores de decisiones | Llano, numérico | Razonamiento costo-beneficio; sin formación en el campo | La decisión que esto habilita; el costo de no hacer nada; el nivel de madurez | Rangos y escenarios; qué cambiaría la conclusión |
| Público general / población | Llano, concreto | Experiencia vivida de la amenaza; sin formación formal | Qué significa para ellos; qué hacer; qué sigue igual | Honesto pero no paralizante: probabilidades en frecuencias naturales, acciones válidas en cualquier caso |
Un resultado de alertamiento sísmico temprano ilustra por qué un solo resumen no puede servirles a todos. Para un sismólogo es un problema de latencia de detección y estimación de magnitud. Para un ingeniero civil son unos segundos de aviso en un sitio dado, y si alcanzan o no para disparar un corte automático. Para quien coordina Protección Civil es una tasa de falsas alarmas por la que responderá públicamente. Para un habitante de la Ciudad de México es si la alerta sísmica del SASMEX que suena en los altavoces de su calle —o en su teléfono— merece atención. El mismo sistema, cuatro afirmaciones distintas.
Ejemplo resuelto: un hallazgo, cuatro versiones¶
El hallazgo técnico, exactamente como aparecería en un informe:
Nuestro detector recupera el 92 % de los eventos M>2 con 1 falsa alarma por día; la exhaustividad cae al 60 % por debajo de SNR 3.
Para pares de la disciplina (se mantiene cerca del original; agrega el contexto que los pares van a exigir):
En un punto de operación de 1 falsa alarma/día, el detector recupera el 92 % de los eventos de catálogo M>2, una ganancia de 15 puntos de exhaustividad sobre el modelo de referencia (baseline) STA/LTA a igual tasa de falsas alarmas. La exhaustividad se degrada al 60 % por debajo de una relación señal-ruido (SNR) de 3, es decir, la mayoría de los eventos perdidos son los pequeños y ruidosos que cualquier detector pierde; no hemos evaluado por debajo de M1.5.
Por qué estas decisiones: a los pares no hay que explicarles «exhaustividad»; necesitan la comparación con el modelo de referencia y el régimen de falla, porque sus dos primeras preguntas son «¿mejor que qué?» y «¿dónde se rompe?». La afirmación en sí queda intacta.
Para un científico de un campo vecino (alguien que modela amenazas o hace ingeniería):
El catálogo automatizado está completo al 92 % para eventos por encima de magnitud 2 en condiciones normales de ruido, con aproximadamente una detección espuria por día. La completitud baja a cerca del 60 % para los eventos más pequeños y ruidosos, de modo que el catálogo subestima las tasas cerca de su piso de magnitud — si usted ajusta parámetros de recurrencia con él, la magnitud de completitud debe tratarse como ~2, no menor.
Por qué estas decisiones: «exhaustividad» se volvió «completitud» — la cantidad análoga en el campo vecino — y la consecuencia para su cálculo (estimaciones de tasa sesgadas) se enuncia explícitamente, porque no la van a deducir de su métrica. Esto es una traducción de la afirmación: el alcance («por encima de M2, ruido normal») viaja junto con el número.
Para una agencia financiadora o quien toma decisiones:
El sistema ahora detecta automáticamente 9 de cada 10 sismos por encima de magnitud 2, con cerca de una alerta falsa al día que un analista debe descartar — una carga de trabajo que absorbe una sola persona. Pierde sobre todo los eventos más pequeños durante periodos ruidosos. Esto es de grado de investigación: suficientemente confiable para construir catálogos, todavía no para disparar alertas públicas sin revisión humana, y el siguiente paso (evaluación en dos redes más, ~1 año) ataca precisamente esa brecha.
Por qué estas decisiones: las métricas se volvieron cantidades operativas (carga de trabajo del analista, requisito de revisión), y la madurez se enuncia en términos de la decisión en juego — quienes financian están decidiendo qué pagar a continuación, así que la brecha honesta y su precio son la carga útil, no una debilidad que esconder.
Para el público general:
Nuestro software ahora detecta la mayoría de los sismos pequeños que la gente no siente — cerca de 9 de cada 10 por encima de magnitud 2. Seguir estos sismos pequeños ayuda a que los científicos mapeen qué fallas están activas. No predice sismos, y no cambia lo que usted debe hacer: los sismos demasiado pequeños para sentirse son también demasiado pequeños para importar a su seguridad.
Por qué estas decisiones: la tasa de falsas alarmas desapareció — carece de sentido sin el contexto operativo — y dos frases se adelantan a las dos malas lecturas previsibles («pueden predecir sismos», «¿debería preocuparme?»). Lo que el público necesita al frente es lo que el resultado no significa.
La falla común: traducir la jerga frente a traducir la afirmación¶
El modo de falla del que hay que entrenarse para salir: cambiar palabras técnicas por palabras llanas mientras se amplía la afirmación en silencio. Compare, para la versión destinada a quien financia:
✗ «Nuestra IA detecta el 92 % de los sismos.»
Cada palabra es llana; la afirmación ahora es falsa por tres vías: el 92 % se midió por encima de M2, a una tasa de falsas alarmas elegida, con datos de una sola red. Traducir la jerga sustituye vocabulario; traducir la afirmación reformula su alcance para que sus condiciones de verdad sobrevivan en el vocabulario nuevo. «9 de cada 10 sismos por encima de magnitud 2» es exactamente igual de llano y sigue siendo cierto. La prueba para cualquier frase traducida: ¿podría defenderla, sola, ante el miembro más escéptico de ese público? Si el calificador es lo que la hace verdadera, el calificador se queda — en las palabras que ese público pueda cargar.
El público más cercano es el más difícil: las subdisciplinas vecinas¶
La geociencia es una federación de subculturas — sismología, glaciología, hidrología, ciencias atmosféricas, geoquímica — que difieren en vocabulario, en normas de evidencia y en sus valores por defecto de ciencia abierta (la sismología comparte formas de onda por servicios estandarizados y lo da por supuesto; otras comunidades tratan los datos como propios hasta la publicación; «validación de modelos» nombra procedimientos distintos en cada una). La traducción a través de la frontera entre subdisciplinas falla más seguido que la traducción al público general, porque ambos lados suponen convenciones compartidas que no lo son.
Un protocolo que funciona, una tarde por frontera. Para cada concepto central de su resultado, encuentre en el campo vecino:
- La cantidad análoga. Su «exhaustividad a tasa de falsas alarmas fija» es, para quien hace hidrología, la «probabilidad de detección frente a razón de falsas alarmas» (verifican pronósticos con POD/FAR); su magnitud de completitud es, para quien hace glaciología, el mínimo evento de desprendimiento detectable. Use su término y cite su referencia canónica.
- El benchmark análogo. Todo campo tiene su «supere esto o a nadie le importa»: los pronósticos de persistencia en hidrología y clima, STA/LTA en detección sísmica, los modelos de grado-día en glaciología. Enuncie su mejora respecto al modelo de referencia del campo vecino, o espere que su resultado se descuente.
- El modo de falla análogo. Su «SNR baja» es su «cuenca no aforada» o su «vacío de datos de la noche polar» — el régimen donde los métodos se degradan y todos lo saben. Nombrar el régimen difícil del otro campo, y decir con honestidad cómo se comporta su método en el equivalente, es la jugada de construcción de confianza más rápida disponible.
Si no puede llenar las tres filas, todavía no entiende el campo vecino lo suficiente para colaborar con él — lo cual conviene descubrir antes de la reunión de arranque, no después.
Ejercicio: traducción asistida por IA con un paso de verificación¶
Se hace fuera de CI, con el asistente de IA que usted prefiera; declárelo según el capítulo 6.4. Este ejercicio es el ensayo del producto de traducción para cada público del proyecto final.
- Tome un hallazgo cuantitativo de su proyecto (o use el hallazgo del detector de arriba). Escriba usted mismo la versión técnica, con cada calificador que la hace verdadera.
- Pida a un asistente de IA que redacte las cuatro versiones para cada público. Itere libremente sobre la redacción — esta parte es barata.
- Ahora la parte calificada, el paso de verificación. Liste cada afirmación de cada borrador. Marque cada una:
- preservada — mismas condiciones de verdad que la versión técnica;
- debilitada — más vaga, pero todavía implicada por la versión técnica (aceptable, anótelo);
- rota — afirma algo que la versión técnica no sostiene.
- Corrija cada afirmación rota y luego entregue: versión técnica, cuatro borradores (finales) y la tabla de verificación, incluyendo qué corrigió.
Va a encontrar afirmaciones rotas. Los modelos sueltan calificadores bajo la presión de simplificar por la misma razón que lo hacen los humanos apurados: la frase se lee mejor sin ellos.
Verificación resuelta (para el borrador dirigido a quien financia, del ejemplo de arriba)
Suponga que el borrador de la IA para quien financia decía: «El sistema detecta el 92 % de los sismos automáticamente y casi no requiere supervisión humana, lo que lo deja listo para despliegue operativo.»
| Afirmación del borrador | Veredicto | Por qué |
|---|---|---|
| «detecta el 92 % de los sismos» | rota | Se perdieron las condiciones de verdad: medido por encima de M2, a 1 falsa alarma/día, en una sola red. Corrección: «9 de cada 10 sismos por encima de magnitud 2». |
| «automáticamente» | preservada | El flujo de trabajo está automatizado; sostenido. |
| «casi no requiere supervisión humana» | rota | La versión técnica implica ~1 falsa alarma/día que necesita revisión de un analista — eso es supervisión, cuantificada. Corrección: enunciar la carga de trabajo. |
| «listo para despliegue operativo» | rota | No se sigue de nada de lo medido; la evaluación por debajo de SNR 3 muestra un régimen de 60 % de exhaustividad, y no existe prueba en una segunda red. Corrección: «de grado de investigación; el uso operativo requiere X». |
| (implícito) «sismos» incluye eventos sentidos o dañinos | debilitada/riesgosa | La evaluación es de microsismicidad M>2; quien financia puede imaginar sismos dañinos. Agregue explícitamente el encuadre de microsismicidad. |
Note el patrón: cada afirmación rota vino de un calificador soltado, no de una palabra equivocada. Por eso el paso de verificación trabaja afirmación por afirmación, no palabra por palabra — y por eso no puede delegarse en la herramienta que produjo los borradores.