Cette page s’adresse aux lecteurs extérieurs au cours ESS 469/569 de l’Université de Washington : un enseignant qui monte son propre cours, un responsable d’équipe qui accueille de nouveaux membres, un directeur de thèse qui se demande s’il va le prescrire, ou un responsable de programme qui juge ce qu’il enseigne. La machinerie du livre — classement (leaderboard), quiz, ensembles de test cachés — ne suppose rien de spécifique à l’Université de Washington, même si le calendrier qui l’entoure et les données qui alimentent les exercices sont solidement ancrés dans le Pacifique Nord-Ouest américain ; voici comment la faire tourner ailleurs, ce qu’il faut substituer, et comment lire le livre sans rien faire tourner du tout. Une édition française du livre existe : les enseignants francophones qui l’adoptent peuvent s’appuyer sur elle pour la prose, en gardant le code, les sorties exécutées et les figures en anglais, à l’identique de l’édition originale.
Monter votre propre instance du cours¶
Faites un fork du dépôt (githubmlgeo_synth et l’infrastructure de notation vivent dans ce dépôt unique. pixi install puis pixi run build reconstruisent le livre en local.
L’intégration continue du classement. Les étudiants soumettent leurs prédictions par pull request ; un workflow GitHub Actions note chaque PR et met à jour la page des classements à la fusion. La recette, y compris le système de graines privées, est dans leaderboard/INSTRUCTOR.md (non rendu dans le livre). Trois pistes : la classification, notée contre un découpage public canonique d’un jeu de données sismiques Zenodo, avec un redécoupage privé comme ensemble caché ; une piste diagnostique de prévision sur des données CO2 publiques, délibérément exploitable et sans poids dans la note ; et une piste de prévision cachée, notée, sur une série mlgeo_synth dont le fichier de vérité ne réside que sur la machine de l’enseignant (leaderboard/private/, ignoré par git), de sorte que l’intégration continue publique affiche la section comme en attente et que votre exécution locale de la notation produit la vraie table. Tout générateur mlgeo_synth accepte une graine, donc les variantes de devoirs se régénèrent gratuitement.
Régénérez les graines cachées chaque année. Une fois qu’une promotion a vu un ensemble de test, c’est un ensemble de validation. La liste de rotation dans INSTRUCTOR.md couvre l’opération : nouvelles graines privées stockées hors du dépôt, horizon de réserve CO2 rafraîchi, série de prévision cachée régénérée (la recette du générateur est dans le fichier), soumissions effacées, et un essai à blanc du script de notation avant la première semaine. Communiquez à votre classe les scores publics et cachés : l’écart entre les deux est la leçon.
Les quiz sur n’importe quelle plateforme pédagogique. Les banques de QCM de vérification des concepts (résultat d’apprentissage 1) sont des fichiers sources réservés aux enseignants, un par chapitre, dans un format simple qui se convertit vers Canvas via text2qti ou se colle dans n’importe quel LMS. Elles sont délibérément tenues hors du dépôt public pour que les corrigés ne circulent pas ; les enseignants qui adoptent le livre peuvent demander ces banques aux auteurs (voir le contact dans le README) ou écrire les leurs à partir des résultats d’apprentissage de chaque chapitre — des questions fondées sur des scénarios, qui testent le jugement face à une situation et non la mémorisation. Rien d’autre n’exige Canvas : les soumissions arrivent par PR, et ce qui n’y passe pas (rapports, présentations) fonctionne avec l’outil de votre établissement, quel qu’il soit.
Ce qui relève de l’Université de Washington, et ce qu’il faut substituer¶
L’ossature du cours. La couche de mise en œuvre est un trimestre d’automne de dix semaines à l’Université de Washington, trois séances de 80 minutes par semaine dans une salle nommée, avec des quiz écrits pour Canvas et un calendrier rythmé par les fêtes américaines. L’appariement 469/569 est une distinction licence/master-doctorat propre au système américain, qui peut n’avoir aucun équivalent chez vous, et les coefficients de notation (y compris la répartition 35/30/35 du projet final entre rapport, dépôt et présentation) sont calés sur cet appariement et sur les règles de crédits de l’université. Un cursus en semestres dispose d’environ quatre semaines de plus ; le choix habituel est de ralentir les chapitres 2 et 4 plutôt que d’ajouter de la matière. Remplacez la page de calendrier en bloc — elle est faite pour être jetée et réécrite — et conservez l’ordre des chapitres.
Les données. La plupart des exercices qui utilisent des données réelles utilisent des données américaines, et plus précisément du Pacifique Nord-Ouest :
- des formes d’onde sismiques du Pacifique Nord-Ouest : miniPNW, hébergé sur un serveur de l’Université de Washington (2.11, 4.3, 4.6), et la station UW.RATT du Puget Sound, récupérée en direct par FDSN (2.8, 2.9, 2.10) ;
- des caractéristiques d’événements sismiques du Pacifique Nord-Ouest déposées sur Zenodo, motivées par le mont Hood (3.3, 3.5, 3.9, 4.1, 4.2) — c’est aussi la piste de classification du classement ;
- du GNSS de Cascadia et de Californie du Nord, issu du Nevada Geodetic Laboratory (1.7, 2.6) ;
- le CO2 du Mauna Loa (4.10, et la piste diagnostique de prévision du classement) ;
- des tableaux et des grilles américains : la liste de voies du réseau NCEDC de Californie du Nord et un catalogue mondial IRIS (2.3), un GeoJSON des volcans de la chaîne des Cascades (2.2), le champ de réanalyse du jeu de démonstration xarray, dont le domaine est l’Amérique du Nord (2.5), et une extraction sur le plateau continental du Pacifique Nord-Ouest d’un magasin mondial de température de surface de la mer (5.5).
Le reste — tout ce qui est engendré par mlgeo_synth ou par les séries synthétiques de géochimie, de débit et de GNSS, soit environ la moitié des carnets — ne porte aucune géographie et voyage sans modification. Quelques pages se localisent d’un mot : les cadrages « à la manière de Seattle » en 2.7 et 3.7 sont des étiquettes posées sur des données synthétiques, et les mentions de Cascadia et de l’USGS en 6.1 et 7.2 sont des exemples de prose.
Comment substituer. Changez les données, pas la leçon. Les substitutions les moins coûteuses conservent le même chargeur et la même physique et ne changent qu’un identifiant : un code de station GNSS, un couple réseau/station FDSN, une région de requête de catalogue. Les coûteuses — miniPNW, les tables de caractéristiques Zenodo — exigent un jeu de données étiqueté équivalent dans votre région et un réexamen de la pertinence des classes ; prévoyez une réexécution et un jugement pédagogique, pas un chercher-remplacer. Si vous remplacez les données de la piste de classification du classement, régénérez aussi le découpage caché (voir plus haut). Quoi que vous substituiez, gardez les fréquences d’échantillonnage, les effectifs et l’équilibre des classes dans les mêmes ordres de grandeur, faute de quoi les temps d’entraînement et les figures de diagnostic commentés dans la prose environnante cesseront de correspondre à ce que voient les étudiants.
Un exemple traité. Les éditions française et espagnole de ce livre localisent la prose partout, mais les données en un seul endroit, le carnet 1.7 : la leçon GNSS y tire une station française pour l’édition française et une station mexicaine pour l’édition espagnole, de la même archive mondiale du Nevada Geodetic Laboratory — même chargeur, même physique, terrain local, carnet réexécuté pour que les sorties soient bien celles de cette station. Tout le reste de ces éditions tourne encore sur les données américaines, délibérément. La politique à deux niveaux qui fonde ce choix, et la procédure pour contribuer un jeu de données régional, sont dans translations/README.md. Si vous construisez une substitution régionale, nous aimerions le savoir.
Socle matériel et accès à l’IA¶
Matériel. Un portable avec 8 Go de RAM et une dizaine de Go d’espace disque libre constitue la base. Aucun GPU n’est nécessaire : les chapitres 1 à 3 sont légers, et les modèles du chapitre 4 sont délibérément petits et s’entraînent sur CPU en un temps borné (des minutes par carnet, pas des heures). La section 5.5 lit un magasin Zarr distant en continu et demande une connexion internet et quelques dizaines de Mio de transfert ; tout le reste tourne sur des données locales ou téléchargées une fois. Les utilisateurs de Windows disposent d’un chemin officiel via WSL2 ou GitHub Codespaces (1.9).
Assistant IA. La section 1.8 suppose que chaque étudiant dispose d’un assistant de programmation agentique à la fin de la première semaine. Les offres gratuites changent trop vite pour être énumérées ici, mais l’invariant tient : les programmes étudiants et éducation des grands fournisseurs (l’offre éducation de GitHub Copilot est la plus ancienne) ont maintenu une option agentique sans frais, et le cours n’a besoin que d’un assistant fonctionnel par étudiant, pas d’un produit particulier.
Le parcours entièrement gratuit. Là où les assistants hébergés sont indisponibles ou proscrits, un modèle à poids ouverts tourne en local : OLMo 2 via Ollama demande environ 4,5 Go de disque et 8 Go de RAM, et fonctionne (lentement) sur CPU. Le chapitre 6 est conçu pour que cela ne soit jamais bloquant : chacun de ses carnets notés s’exécute hors ligne à partir de transcriptions enregistrées et d’agents simulés, et les sections à modèle en direct sont facultatives.
Réseaux restreints. Pour les laboratoires nationaux, les enclaves et les réseaux industriels qui bloquent l’accès internet sortant, la section « Environnements restreints » de 5.4 donne les quatre substitutions : miroirs de paquets et installations pixi hors ligne, transfert de conteneurs par une passerelle approuvée, intégration continue auto-hébergée et suivi d’expériences auto-hébergé.
Parcours de lecture¶
Parcours encadrant, sans code (pour un directeur de recherche qui veut les concepts et les exigences sans exécuter de carnet) : les readme de chapitres de bout en bout, plus le chapitre 1 y compris 1.8, 2.1, 3.1, 6.4 et le chapitre 7. Prose et figures seulement ; de quoi encadrer un étudiant tout au long du pipeline, fixer les attentes en matière de déclaration d’usage de l’IA, et lire son évaluation d’un œil critique.
Parcours d’intégration en six semaines (un responsable d’équipe qui forme une nouvelle recrue sachant déjà programmer) : semaine 1, le chapitre 1 jusqu’à l’installation du poste de travail ; semaines 2 et 3, le noyau du chapitre 2 (2.1 à 2.6 et 2.13) ; semaine 4, 3.8 — le matériau sur la validation croisée et les fuites de données rentabilise à lui seul tout le parcours ; semaine 5, le chapitre 5 ; semaine 6, 6.3 et 6.4. La recrue en ressort capable de construire un jeu de données défendable, de le découper honnêtement, de garder son travail reproductible et d’évaluer l’assistance de l’IA qu’elle utilisera immanquablement.
Parcours trimestre standard : le livre dans l’ordre, chapitres 1 à 7, avec le projet final qui court depuis la première semaine et l’arc de lecture échelonné sur le trimestre. La déclinaison licence (469) allège les attentes, non le contenu : niveau Appliquer plutôt que Créer sur les résultats d’apprentissage relatifs aux données synthétiques et à l’évaluation des agents, et un rôle d’appui plutôt que de pilotage dans les projets finaux. Dans un cursus français en semestres, la déclinaison 469 correspond à un public de L3 ou de M1, et la déclinaison 569 à un public de M2 et de doctorat ; le volume tient dans un semestre en conservant l’ordre des chapitres et en étalant l’arc de lecture sur les douze semaines d’enseignement.
Licences et attribution¶
Le texte et les figures sont sous CC-BY-4.0 (contrat en français) ; le code, y compris le code source des carnets, est sous licence MIT. Les deux autorisent la réutilisation et l’adaptation, y compris commerciale, avec attribution. Pour du matériel réutilisé ou adapté, citez le livre et faites un lien vers la source, par exemple :
Adapté de Machine Learning in the Geosciences (Denolle et al., GeoSMART / University of Washington), https://
github .com /geo -smart /mlgeo -book, CC-BY-4.0.
Si vous adoptez ce livre pour un cours, une issue ou une note sur le dépôt le signalant nous aide à compter les adoptions et à vous prévenir quand les recettes de graines cachées ou les jeux de données changent.