Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

Esta página es para lectores fuera de ESS 469/569 en la UW: quien monta su propio curso, quien lidera un laboratorio e integra a nuevos miembros, quien asesora y decide si asignarlo, o quien evalúa programas y juzga qué enseña. La maquinaria del libro — tabla de clasificación (leaderboard), cuestionarios, conjuntos de prueba ocultos — no supone nada específico de la UW, aunque el calendario que la rodea y los datos que alimentan los ejercicios son firmemente del Noroeste del Pacífico estadounidense; aquí se explica cómo operarla en otra parte, qué conviene sustituir, y cómo leer el libro sin operar nada de eso.

Esta edición en español existe precisamente para eso: si usted enseña en una institución de América Latina o España, puede asignar la edición traducida a sus estudiantes y trabajar contra el mismo repositorio, el mismo código y las mismas evaluaciones que la edición en inglés (el inglés sigue siendo la versión de referencia para el código y las salidas ejecutadas).

Monte su propia instancia del curso

Bifurque el repositorio (github.com/geo-smart/mlgeo-book). Todos los tutoriales, las tareas, el paquete de datos sintéticos mlgeo_synth y la infraestructura de calificación viven en este único repositorio. pixi install y luego pixi run build reproduce el libro localmente.

CI de la tabla de clasificación. Los estudiantes envían predicciones por pull request; un flujo de trabajo de GitHub Actions califica cada PR y actualiza la página de posiciones al fusionarlo. La receta, incluido el sistema de semillas privadas, está en leaderboard/INSTRUCTOR.md (no se renderiza en el libro). Hay tres pistas: clasificación, calificada contra una partición pública canónica de un conjunto de datos sísmicos en Zenodo, con una repartición privada como conjunto oculto; una pista diagnóstica de pronóstico contra datos públicos de CO2, deliberadamente explotable y sin peso en la calificación; y una pista calificada de pronóstico oculto sobre una serie de mlgeo_synth cuyo archivo de verdad vive únicamente en la máquina del instructor (leaderboard/private/, ignorado por git), de modo que la CI pública muestra esa sección como pendiente y su corrida local de calificación produce la tabla real. Cualquier generador de mlgeo_synth acepta una semilla, así que las variantes de las tareas se regeneran sin costo.

Regenere las semillas ocultas cada año. Una vez que una cohorte ha visto un conjunto de prueba, es un conjunto de validación. La lista de verificación de rotación en INSTRUCTOR.md lo cubre: nuevas semillas privadas guardadas fuera del repositorio, un horizonte de reserva de CO2 renovado, una serie de pronóstico oculto regenerada (la receta del generador está en ese archivo), envíos borrados y una corrida de prueba del script de calificación antes de la primera semana. Reporte a su clase tanto los puntajes públicos como los ocultos; la brecha entre ambos es la lección.

Cuestionarios en cualquier LMS. Los bancos de opción múltiple de comprobación de conceptos (resultado 1) son archivos fuente privados del instructor, uno por capítulo, en un formato sencillo que se convierte a Canvas con text2qti o se pega en cualquier LMS. Se mantienen deliberadamente fuera del repositorio público para que las claves de respuestas no circulen; quien adopte el libro puede pedir los bancos a los autores (vea el contacto en el README) o escribir los suyos a partir de los resultados de aprendizaje de cada capítulo — preguntas basadas en escenarios, que evalúan el juicio sobre una situación y no la memoria. Nada más requiere Canvas: los envíos llegan por PR, y lo que no llega así (informes, presentaciones) funciona con lo que use su institución.

Qué es propio de la UW y qué conviene sustituir

Andamiaje del curso. La capa de impartición es un trimestre de otoño de diez semanas en la UW, tres sesiones de 80 minutos por semana en un aula con nombre, con cuestionarios escritos para Canvas y un calendario marcado por los feriados estadounidenses. El par 469/569 es una distinción entre licenciatura y posgrado propia del sistema de Estados Unidos, que puede no tener equivalente en el suyo, y los pesos de calificación (incluido el reparto 35/30/35 del proyecto final entre informe, repositorio y presentación) están ajustados a ese par y a las reglas de créditos de la UW. Un plan semestral dispone de unas cuatro semanas más; lo habitual es ralentizar los capítulos 2 y 4 en vez de agregar material. Sustituya la página de calendario por completo — está hecha para desecharse y reescribirse — y conserve el orden de los capítulos.

Datos. Casi todos los ejercicios que usan datos reales usan datos estadounidenses y, más concretamente, del Noroeste del Pacífico:

El resto — todo lo generado por mlgeo_synth o por las series sintéticas de geoquímica, caudal y GNSS, cerca de la mitad de los cuadernos — no lleva geografía alguna y viaja sin cambios. Unas pocas páginas se localizan con una palabra: los encuadres «al estilo de Seattle» de 2.7 y 3.7 son etiquetas sobre datos sintéticos, y las menciones de Cascadia y del USGS en 6.1 y 7.2 son ejemplos en prosa.

Cómo sustituir. Cambie los datos, no la lección. Las sustituciones más baratas conservan el mismo cargador y la misma física y solo cambian un identificador: un código de estación GNSS, un par red/estación de FDSN, una región de consulta a un catálogo. Las caras — miniPNW, las tablas de características de Zenodo — exigen un conjunto etiquetado equivalente en su región y revisar si las clases siguen teniendo sentido; presupueste una reejecución y un juicio pedagógico, no un buscar y reemplazar. Si sustituye los datos de la pista de clasificación, regenere también la partición oculta (véase arriba). Sea cual sea la sustitución, mantenga las frecuencias de muestreo, los tamaños de muestra y el balance de clases en el mismo orden de magnitud, o los tiempos de entrenamiento y las figuras de diagnóstico que comenta la prosa circundante dejarán de coincidir con lo que ven los estudiantes.

Un ejemplo resuelto. Las ediciones en francés y en español de este libro localizan la prosa en todas partes, pero los datos en un solo lugar, el cuaderno 1.7: la lección de GNSS toma una estación francesa para la edición en francés y una mexicana para la edición en español, del mismo archivo global del Nevada Geodetic Laboratory — mismo cargador, misma física, terreno local, cuaderno reejecutado para que las salidas sean las que esa estación produce de verdad. Todo lo demás en esas ediciones sigue corriendo con los datos estadounidenses, de manera deliberada. La política de dos niveles detrás de esa decisión, y el procedimiento para aportar un conjunto de datos regional, están en translations/README.md. Si usted construye una sustitución regional, nos gustaría saberlo.

Piso de cómputo y de acceso a la IA

Hardware. Una laptop con 8 GB de RAM y unos 10 GB de disco libre es la línea base. No se requiere GPU: los capítulos 1 a 3 son ligeros, y los modelos del capítulo 4 son deliberadamente pequeños y se entrenan en CPU en un tiempo acotado (minutos por cuaderno, no horas). La sección 5.5 lee en flujo un almacén Zarr remoto y necesita internet y unas pocas decenas de MiB de transferencia; todo lo demás corre con datos locales o descargados una sola vez. Quienes usan Windows tienen una ruta oficial mediante WSL2 o GitHub Codespaces (1.9).

Asistente de IA. La sección 1.8 supone que cada estudiante tiene un asistente de programación con IA agéntica al terminar la primera semana. Los planes gratuitos cambian demasiado rápido para enumerarlos aquí, pero el invariante se sostiene: los programas para estudiantes y para educación de los principales proveedores (el nivel educativo de GitHub Copilot es el más antiguo) han mantenido disponible alguna opción agéntica sin costo, y el curso solo necesita un asistente que funcione por estudiante, no un producto en particular.

La ruta enteramente gratuita. Donde los asistentes alojados no estén disponibles o no estén permitidos, un modelo de pesos abiertos corre localmente: OLMo 2 mediante Ollama necesita unos 4.5 GB de disco y 8 GB de RAM, y funciona (lentamente) en CPU. El capítulo 6 está construido para que esto nunca sea un obstáculo: todos sus cuadernos calificados corren sin conexión contra transcripciones grabadas y agentes simulados, y las secciones con modelo en vivo son opcionales.

Redes restringidas. Para laboratorios nacionales, enclaves y redes industriales que bloquean el tráfico saliente a internet, la sección «Entornos restringidos» de 5.4 da las cuatro sustituciones: espejos de paquetes e instalaciones de pixi sin conexión, transferencia de contenedores por una pasarela aprobada, CI autoalojada y seguimiento de experimentos autoalojado.

Rutas de lectura

Ruta de asesoría, sin código (para quien supervisa y quiere los conceptos y los estándares sin ejecutar un cuaderno): los readmes de capítulo de principio a fin, más el capítulo 1 incluida la sección 1.8, 2.1, 3.1, 6.4 y el capítulo 7. Solo prosa y figuras; suficiente para acompañar a un estudiante por todo el flujo, fijar expectativas de declaración de uso y leer críticamente su evaluación.

Ruta de incorporación en seis semanas (para quien lidera un laboratorio y forma a alguien que ya programa): semana 1, el capítulo 1 hasta el montaje del banco de trabajo; semanas 2 y 3, el núcleo del capítulo 2 (2.1–2.6 y 2.13); semana 4, 3.8 — el material de validación cruzada y fuga de datos paga toda la ruta; semana 5, el capítulo 5; semana 6, 6.3 y 6.4. Al terminar, la persona puede construir un conjunto de datos defendible, particionarlo con honestidad, mantener el trabajo reproducible y evaluar la asistencia de IA que inevitablemente usará.

Ruta de trimestre estándar: el libro en orden, capítulos 1 a 7, con el proyecto final corriendo desde la primera semana y el arco de lecturas escalonado a lo largo del periodo. La versión de licenciatura (469) atenúa las expectativas, no el contenido: nivel Aplicar en lugar de Crear en los resultados de datos sintéticos y de evaluación de agentes, y asistir en lugar de liderar los proyectos finales.

Licencias y atribución

El texto y las figuras están bajo CC-BY-4.0; el código, incluido el código fuente de los cuadernos, está bajo MIT. Ambas permiten la reutilización y la adaptación, incluso comercial, con atribución. Para material reutilizado o adaptado, cite el libro y enlace la fuente, por ejemplo:

Adaptado de Machine Learning in the Geosciences (Denolle et al., GeoSMART / University of Washington), https://github.com/geo-smart/mlgeo-book, CC-BY-4.0.

Si adopta el libro para un curso, una issue o una nota en el repositorio diciéndolo nos ayuda a contar las adopciones y a avisarle cuando cambien las recetas de semillas ocultas o los conjuntos de datos.