Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

🖥️ Diapositives du cours — Séance 12 (lun. 26 oct.)

Des diapositives d’ensemble couvrant les chapitres 3.1 et 3.2 sont disponibles ici.

Les cadres d’apprentissage se distinguent par ce qui supervise l’entraînement : des étiquettes, la structure propre des données, ou le retour d’un environnement. Un analyste sismologue qui a étiqueté dix mille formes d’onde comme séisme ou bruit supervise un modèle directement. Une archive de profils océaniques que personne n’a étiquetés n’offre que sa propre structure. Un planeur sous-marin autonome apprend des conséquences de ses propres choix d’échantillonnage. Ce chapitre présente les principaux cadres — apprentissage non supervisé, semi-supervisé, auto-supervisé, par renforcement et actif — et la place de chacun dans le travail géoscientifique. L’apprentissage supervisé, cheval de bataille de ce chapitre, est traité en profondeur à partir de 3.2.

1. Apprentissage non supervisé

Le réseau Argo a renvoyé des millions de profils température–salinité de l’océan mondial, et personne n’en a étiqueté un seul. Combien de masses d’eau distinctes s’y trouvent ? Quels profils vont ensemble, et lesquels ne ressemblent à rien d’autre dans l’archive ? Ces questions — la structure d’abord, les étiquettes jamais — sont le territoire de l’apprentissage non supervisé.

L’apprentissage non supervisé entraîne des modèles sur des données sans sorties étiquetées. Aucune variable cible ne guide l’entraînement : c’est la géométrie propre des données qui supervise — quels échantillons sont proches les uns des autres dans l’espace des caractéristiques (features), quelles directions portent la variance, quels échantillons sont loin de tout le reste.

Trois familles de techniques répondent à ces trois questions. Le partitionnement (clustering) groupe les échantillons par similarité de caractéristiques (k-means, partitionnement hiérarchique, DBSCAN — l’objet de la leçon 3.3). La réduction de dimension comprime de nombreuses caractéristiques corrélées en quelques directions informatives (PCA, t-SNE ; voir le chapitre 2.12). La détection d’anomalies signale les échantillons qui se situent loin de tous les autres (forêt d’isolement — isolation forest —, SVM à une classe).

Parmi les exemples géoscientifiques : la détection d’anomalies géochimiques en exploration minière, où les forêts d’isolement signalent les échantillons aux signatures multi-élémentaires inhabituelles ; l’analyse de faciès sismiques, où le partitionnement d’attributs sismiques groupe les données de réflexion en unités de subsurface interprétables ; et la découverte de régimes climatiques, où k-means appliqué aux champs de pression atmosphérique retrouve les régimes de temps récurrents des latitudes moyennes.

Avantages et défis

AvantagesDéfis
Aucun besoin de données étiquetées, dont l’obtention peut être coûteuse ou peu praticable.L’interprétation des résultats peut être subjective.
Utile pour l’analyse exploratoire des données.L’évaluation du modèle est moins directe, faute de vérité terrain.

2. Apprentissage semi-supervisé

Un inventaire de glissements de terrain pour une région de montagne confirme quelques centaines de ruptures, cartographiées sur le terrain après les tempêtes, alors que la région compte des dizaines de milliers de versants que personne n’a visités. Écarter les versants non visités gaspille l’essentiel des données ; les déclarer tous « stables » revient à poser de fausses étiquettes. L’apprentissage semi-supervisé prend la voie médiane : il s’entraîne à la fois sur le petit ensemble étiqueté et sur le grand ensemble non étiqueté.

Les échantillons non étiquetés ne peuvent pas dire à quelle classe ils appartiennent, mais ils dessinent où les données sont denses et où tombent les creux naturels — et une bonne frontière de décision doit passer par les creux, pas au milieu d’un nuage dense. Voilà l’information qu’apportent les versants non étiquetés.

La recette la plus simple est l’auto-apprentissage (self-training) : ajuster un modèle sur les échantillons étiquetés, lui faire prédire des étiquettes pour les échantillons non étiquetés, adopter ses prédictions les plus confiantes comme si elles étaient vraies, et réajuster. Le risque est évident — une étiquette fausse mais confiante, adoptée tôt, se propage à chaque tour suivant. Des variantes s’en prémunissent en entraînant plusieurs modèles qui étiquettent les données les uns pour les autres (co-apprentissage, co-training), ou en propageant les étiquettes le long d’un graphe reliant les échantillons similaires (méthodes à base de graphes).

Parmi les applications géoscientifiques : la cartographie d’occupation du sol depuis l’imagerie satellitaire, quand les étiquettes vérifiées sur le terrain ne couvrent qu’une petite fraction de la scène ; la cartographie de prospectivité minérale à partir de levés géophysiques abondants mais non étiquetés, ancrés par quelques gisements forés ; et la cartographie de susceptibilité aux glissements de terrain, quand les inventaires ne recensent qu’un nombre limité d’événements confirmés.

AvantagesDéfis
Améliore l’exactitude du modèle avec moins de données étiquetées.Risque de propager des étiquettes incorrectes.
Économique quand l’étiquetage coûte cher.La performance du modèle dépend fortement de la qualité de l’ensemble étiqueté initial.

3. Apprentissage auto-supervisé

L’apprentissage auto-supervisé génère sa propre supervision à partir de la structure des données : le modèle est entraîné à prédire une partie cachée de l’entrée à partir de la partie visible. Aucune étiquette humaine n’intervient, et pourtant l’entraînement est pleinement supervisé dans sa forme — l’« étiquette » est une valeur masquée, l’échantillon suivant, ou l’identité d’une copie augmentée.

C’est le mécanisme d’entraînement des modèles de fondation. Les grands modèles de langage sont entraînés par prédiction masquée ou prédiction du token suivant sur du texte ; les modèles de fondation pour la vision et les formes d’onde sont entraînés par reconstruction de fragments masqués ou par apprentissage contrastif, où le modèle apprend à placer les vues augmentées d’une même entrée proches l’une de l’autre dans un espace de représentation (embedding) et les entrées différentes loin les unes des autres. Appliquée à grande échelle à des archives non étiquetées — et les géosciences en ont d’immenses : enregistrements sismiques continus, piles d’images satellitaires, champs de réanalyse — l’auto-supervision produit des représentations généralistes qui se transfèrent aux tâches en aval avec peu d’étiquettes.

Concepts clés

AvantagesDéfis
Exploite d’immenses volumes de données non étiquetées.Concevoir des tâches prétextes efficaces n’est pas trivial.
Produit des représentations réutilisables et transférables.Les représentations apprises ne se transfèrent pas forcément bien à toute tâche en aval.

Au chapitre 4, vous construirez ce mécanisme vous-même : un auto-encodeur qui reconstruit son entrée à travers un goulot d’étranglement, et un exercice de pré-entraînement masqué où le réseau apprend à combler les portions cachées d’un signal. Ces deux travaux pratiques sont la version à petite échelle de l’entraînement des modèles de fondation.

4. Apprentissage par renforcement

Un planeur sous-marin autonome qui cartographie un fjord doit décider, plongée après plongée, où échantillonner ensuite. Chaque choix rapporte des données d’une certaine valeur et coûte de la batterie, et personne ne peut étiqueter à l’avance la trajectoire « correcte » — la qualité d’un choix ne devient claire que plus tard, une fois la campagne achevée ou la batterie épuisée.

L’apprentissage par renforcement (RL, reinforcement learning) est fait pour ces décisions séquentielles. Un agent (le planeur) observe l’état de son environnement (position, batterie, le champ déjà cartographié), effectue une action (plonger ici, transiter là) et reçoit une récompense (information gagnée, énergie dépensée). Au fil de nombreuses interactions, il apprend une politique : une règle qui associe une action à chaque état et maximise la récompense cumulée sur l’ensemble de la mission, pas seulement au pas suivant. Une vaste littérature algorithmique s’appuie sur ces ingrédients — le Q-learning et ses variantes à réseaux profonds estiment la valeur à long terme de chaque action, tandis que les méthodes de gradient de politique et acteur–critique ajustent directement la politique — mais le vocabulaire ci-dessus suffit pour lire un article de RL en géosciences.

Le RL reste rare en géosciences parce que peu de problèmes offrent un environnement sûr pour des millions d’interactions par essai-erreur. Des exemples opérationnels existent en échantillonnage adaptatif, où des véhicules autonomes sous-marins ou aériens apprennent des trajets de levé qui maximisent le gain d’information, et en gestion de réservoirs et d’eaux souterraines, où les calendriers d’injection et de pompage sont optimisés à l’aide de simulateurs. Le RL est aussi le mécanisme du post-entraînement des grands modèles de langage à partir de retours humains.

AvantagesDéfis
Adapté aux problèmes de décision séquentielle.Exige des interactions massives avec l’environnement.
Capable d’apprendre des comportements complexes.Coûteux en calcul, avec des problèmes de convergence possibles.

5. Apprentissage actif

Un réseau régional enregistre cent mille petits événements sismiques par an ; un analyste peut relire soigneusement peut-être deux mille sismogrammes. Lesquels méritent ces heures ? Choisir au hasard dépense l’essentiel du temps de l’analyste sur des exemples faciles et redondants que le modèle traite déjà. L’apprentissage actif retourne la question : le modèle lui-même sélectionne les échantillons dont les étiquettes lui apprendraient le plus, et demande exactement ceux-là à l’expert.

Trois choix définissent une boucle d’apprentissage actif. La stratégie de requête décide quels échantillons envoyer à l’étiquetage — le plus souvent ceux dont le modèle courant est le moins certain, pour que chaque sismogramme étiqueté tombe là où la connaissance du modèle est la plus mince. L’oracle fournit les étiquettes vraies : un analyste sismologue qui relit des formes d’onde, un géologue qui nomme des échantillons de roche, un climatologue qui annote des situations météorologiques. Le critère d’arrêt met fin à la boucle, généralement quand le budget d’étiquetage est épuisé ou quand les nouvelles étiquettes n’améliorent plus le modèle.

Il existe des stratégies de requête au-delà de l’incertitude — désaccord d’un comité, changement de modèle attendu, pondération par densité — cataloguées dans la synthèse de Settles sur l’apprentissage actif ; pour la plupart des problèmes de géosciences, l’échantillonnage par incertitude est le point de départ.

Avantages et défis

AvantagesDéfis
Réduit la quantité de données étiquetées nécessaire.Exige une stratégie de requête efficace.
Économique quand l’étiquetage coûte cher.La qualité de l’oracle peut affecter la performance.
Peut améliorer nettement la performance du modèle.Déterminer le critère d’arrêt peut être difficile.

6. Vue comparative

Cadre d’apprentissageUsage typiqueStatut des donnéesÉvaluation du modèle
SuperviséAutomatiser des flux de travail de fouille de données ou développer des modèles de substitutionÉtiquetéesDonnées de test étiquetées, tenues à l’écart de l’entraînement : exactitude, précision/rappel, F1 pour la classification ; MSE, RMSE, R² pour la régression.
Non superviséExplorer ou comprendre la structure des données.Non étiquetéesScore de silhouette, inertie, ou interprétation propre au domaine.
Semi-superviséAutomatiser des flux de travailPeu de données étiquetées, majoritairement non étiquetéesPerformance mesurée sur des ensembles de validation étiquetés.
Auto-superviséApprentissage de représentations ; pré-entraînement des modèles de fondationDonnées non étiquetées à structure intrinsèqueÉvaluation indirecte, par la performance sur les tâches en aval après affinage.
Par renforcementDécisions séquentielles avec retour des interactions.Un environnement où l’agent peut interagir et recevoir des récompensesRécompenses cumulées ou atteinte du niveau de performance visé.
ActifEntraînement continu du modèle pour améliorer la performanceMajoritairement non étiquetées, quelques données étiquetéesPerformance mesurée sur des ensembles de validation étiquetés, en s’attachant à l’efficacité du processus d’étiquetage.

Les métriques d’évaluation nommées ici sont définies là où elles servent pour la première fois : score de silhouette et inertie dans la leçon 3.3, exactitude/précision/rappel/F1 en 3.4, et MSE, RMSE et R² en 3.7 — ce tableau est une carte, pas un prérequis.

À retenir