Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

6.5 L’arc de lecture : des articles à un agent de relecture

🖥️ Diapositives du cours — Séance 19 (ven. 13 nov.)

Cette page est le contrat des lectures du trimestre. Il n’y a pas de fiches de lecture dans ce cours. À la place, quatre travaux échelonnés courent sur le trimestre et s’appuient les uns sur les autres : vous vérifiez de la littérature avec un assistant IA, vous disséquez ce qui fait qu’un article est bon ou mauvais, vous écrivez vos propres exigences de qualité, et vous terminez en construisant un agent de relecture avant soumission à partir de ces exigences, évalué avec la machinerie de 6.3. Chaque étape a un livrable noté, listé dans le tableau final. En parallèle des étapes, chaque étudiant donne une fois dans le trimestre un court exposé paper-pulse — le nom du format sur Canvas : prendre le pouls d’un article en quatre minutes —, et chaque étudiant présent note chaque exposé via l’enquête d’évaluation par les pairs — présenter et évaluer sont ici deux compétences que l’on exerce, non deux performances uniques. Le calendrier semaine par semaine se trouve dans le calendrier du cours ; cette page définit ce que vous rendez et comment c’est noté.

L’arc évalue les résultats d’apprentissage 10 (évaluer les agents d’IA comme des instruments scientifiques), 11 (intégrer l’assistance par IA en gardant la propriété intellectuelle du travail) et 12 (traduire et apprécier des résultats pour des publics distincts).

Étape 1 — revue de littérature assistée par IA

Le sujet est le même pour tous, localisé à votre domaine : les opportunités et les défis de l’IA dans votre sous-domaine des géosciences. Deux lectures d’ancrage communes le cadrent — une synthèse sur l’apprentissage automatique à travers les géosciences et un article critique sur ses limites (les choix actuels figurent dans le syllabus ; l’appariement change à mesure que la littérature évolue). À partir de ce point de départ, conduisez un assistant IA à travers une revue de littérature localisée à votre propre sous-domaine : demandez l’état du domaine, les articles canoniques, les questions ouvertes. Puis vérifiez tout.

Ce sujet n’est pas décoratif. Les articles que vous faites remonter ici sont la matière première du reste de l’arc : vos cibles de dissection à l’étape 2, votre exposé paper-pulse, et la position que vous reprendrez à l’étape 4 après avoir mesuré vous-même un agent.

Le livrable est le journal de vérification, pas le résumé. Le résumé de l’assistant est de la matière première ; votre travail noté en est l’audit. Pour chaque citation produite par l’assistant, le journal consigne :

ChampCe qu’on y met
Citation telle que donnéeAuteurs, année, support, titre tels que l’assistant les a énoncés
Résout ?Un DOI ou une URL stable mène-t-il à un document réel ?
Affirmation attribuéeCe que le résumé dit que cet article montre
Ce que dit l’articleVotre lecture du résumé réel ou de la section pertinente
Verdictvérifiée / mal attribuée (article réel, mauvaise affirmation) / fabriquée / invérifiable

Concluez le journal par un court paragraphe : combien de citations ont survécu, quel mode d’échec a dominé, et ce que la vérification vous a coûté en temps par rapport au temps de rédaction de l’assistant. Ce rapport est le prix honnête de la lecture assistée par IA, et vous vous le rappellerez tout le trimestre.

Un résumé aux citations non vérifiées, si fluide soit-il, vaut zéro. C’est le même devoir que celui énoncé dans la politique d’IA du cours, appliqué à la lecture au lieu du code.

Étape 2 — anatomie des bons articles scientifiques

Vous recevez deux articles exemplaires dans votre domaine général : un solide, un défectueux. (Le défectueux est réel ou légèrement retouché ; on ne vous dit pas lequel est lequel.) Disséquez les deux.

Livrable : une liste annotée de défauts et de forces, organisée par section d’article. Pour chaque section de chaque article, des entrées qui répondent à trois questions :

Chaque entrée cite une ligne, une figure ou un nombre précis. « Les méthodes sont faibles » ne rapporte rien ; « la section 3.2 règle le seuil de détection sur les mêmes événements que ceux du tableau 2 » rapporte des points. C’est la compétence dont l’agent de relecture aura besoin à l’étape 4, exercée d’abord à la main.

L’exposé paper-pulse (compte dans la note de l’étape 2)

Une fois dans le trimestre — les inscriptions ouvrent en semaine 2 — vous donnez un exposé de 4 minutes suivi d’une question en début de séance, sur un article de votre revue de littérature de l’étape 1. Le format est fixe :

  1. L’affirmation centrale de l’article, en une phrase qu’un non-spécialiste suit.
  2. La preuve derrière elle — quelle figure ou quel nombre porte l’affirmation.
  3. Une force et un défaut, jugés à l’aune de la grille en cours d’élaboration par la classe.
  4. Une phrase de déclaration : ce que l’assistant IA a fait dans votre flux de lecture, et ce que vous avez vérifié.

Deux exposés par séance, de la semaine 3 à la semaine 10 : au moment d’écrire la grille (étape 3), la classe a donc constitué un corpus partagé d’articles disséqués — des dizaines d’exemples travaillés de ce à quoi ressemblent le bon et le mauvais, présentés par ceux qui les ont trouvés. L’exposé est noté à l’intérieur des points de l’étape 2, selon le même critère que la liste écrite : la précision rapporte, le vague non.

Tout le monde dans la salle note chaque exposé. Une courte enquête d’évaluation par les pairs (sur Canvas, le même instrument tout le trimestre) recueille cinq notes calquées sur la grille et deux lignes de texte libre obligatoires — une force précise, une amélioration précise — pendant chaque exposé. Le retour parvient à l’orateur anonymisé et filtré. Remplir les enquêtes les jours où vous assistez au cours compte dans la participation ; vos notes ne sont jamais évaluées pour leur « exactitude ». L’enquête est elle-même du contenu de cours : c’est la grille comme notateur avec de nombreux évaluateurs, et les statistiques d’accord de la classe sur ces notes reviennent comme jeu de données réel lorsque 6.3 demande ce que vaut le verdict d’un évaluateur unique. Vous présenterez une fois et évaluerez une quarantaine de fois ; la seconde compétence est celle que l’arc entraîne réellement.

Étape 3 — construisez vos propres exigences

L’étape 2 vous a donné un vocabulaire de défauts et de forces. L’étape 3, menée en discussion de classe, le transforme en votre propre exigence explicite.

Livrable : une grille de qualité pour les articles de votre domaine. La grille énonce :

Déclarez votre genre. Selon les deux parcours du projet final, vous écrivez la grille pour l’un des deux genres et indiquez lequel en tête :

Les deux genres partagent les exigences de preuve de l’étape 2 mais diffèrent sur ce que « bon » veut dire ; une grille qui ignore le public de son genre échoue au résultat 12, si soigneusement pondérée soit-elle.

Écrivez les critères comme des contrôles binaires. L’étape 4 utilisera cette grille comme notateur, et seuls des critères binaires, vérifiables indépendamment, survivent à cette conversion — c’est l’exigence « grille comme notateur » de la section « Noter sans vérité calculable » de 6.3.

Étape 4 — construisez et évaluez votre agent de relecture

Le point d’orgue. Transformez votre grille de l’étape 3 en un agent de relecture avant soumission — un agent spécifié dont le travail est de critiquer un article ou un rapport à l’aune de vos exigences avant que vous ne le soumettiez — puis évaluez cet agent comme 6.3 vous a appris à évaluer n’importe quel agent. L’agent ne vaut rien sans évaluation ; l’évaluation est le devoir.

Livrable : un carnet ou un rapport unique contenant six parties, calquées sur la structure du devoir de 6.3 :

  1. Cahier des charges de la tâche. Entrées (un manuscrit ou un rapport), schéma de sortie (quels contrôles de la grille, sous quel format, avec quelle précision exigée — par exemple, chaque critique cite une ligne, une figure ou un nombre), et contraintes. Écrit avant toute exécution.
  2. Jeu d’évaluation. Au moins six courts articles ou rapports comportant des forces et des défauts connus et plantés — un bogue de fuite de données, un seuil réglé sur le jeu de test, une citation fabriquée, un axe malhonnête — plus au moins un cas négatif sans rien de planté, pour pouvoir attraper un agent qui critique tout. La vérité terrain d’une tâche subjective se construit par ingénierie : « a trouvé le défaut planté » reste un contrôle calculable même quand « cette relecture est-elle bonne ? » ne l’est pas.
  3. La grille comme notateur. Votre grille de l’étape 3, appliquée comme contrôles binaires aux relectures de l’agent. Notez chaque contrôle indépendamment plutôt que de demander une impression d’ensemble, et appliquez les contrôles du biais de juge de 6.2 : notez les paires dans les deux ordres, et masquez au notateur quelle sortie vient de quel agent.
  4. Accord entre deux évaluateurs. Échangez avec un binôme les relectures d’agent d’un cas ; notez-les tous les deux avec votre grille. Rapportez le pourcentage d’accord et le kappa de Cohen (6.3 montre le calcul en cinq lignes et pourquoi le pourcentage seul induit en erreur — deux évaluateurs indulgents s’accordent constamment par hasard). Un kappa faible est un défaut de la grille avant d’être un défaut des évaluateurs : réécrivez le critère ambigu, renotez, rapportez les deux tours.
  5. Exécution et analyse des échecs. Exécutez l’agent N = 5 fois par cas et rapportez des taux de réussite avec leurs erreurs types binomiales, non des verdicts uniques — un modèle échantillonné attrape un défaut planté à certaines exécutions et le rate à d’autres, et à N = 5 un taux voisin de 0,5 porte environ ±0,22. Regroupez les échecs et diagnostiquez chaque groupe : limite de l’agent, défaut de la grille, ou cas réellement ambigu.
  6. Réflexion finale (une demi-page). Revenez à votre sujet de l’étape 1 — les opportunités et les défis de l’IA dans votre sous-domaine — et répondez-y à nouveau, en citant cette fois vos propres mesures plutôt que les affirmations de la littérature : ce que votre agent a attrapé de façon fiable, ce qu’il a raté, ce que le kappa et les taux de réussite disent de la délégation du jugement. Les positions qui ont changé depuis l’étape 1 méritent d’être énoncées ; celles qui ont survécu au contact des données aussi.

Référence notée : le chemin hors ligne, sur transcriptions enregistrées. Comme partout dans ce chapitre, le travail noté s’exécute hors ligne. Le cours fournit des transcriptions de relecture enregistrées — un agent de relecture de référence exécuté N = 5 fois par cas sur un corpus à défauts plantés — et votre grille, votre notateur, votre analyse d’accord et votre analyse des échecs tournent contre ces enregistrements, en intégration continue, sans réseau. Vous rendez tout de même la spécification complète de votre propre agent (partie 1) construite à partir de votre propre grille ; les enregistrements tiennent lieu d’exécutions.

Facultatif : le chemin en ligne. Si vous avez le matériel, exécutez votre propre spécification contre OLMo 2 servi localement par Ollama, exactement comme le fait la section facultative de 6.3 (ollama pull olmo2, activation explicite avec MLGEO_LIVE_EVAL=1 ; environ 8 Go de RAM, le CPU suffit). Notez les nouvelles transcriptions avec la même machinerie. Rien du chemin en ligne n’est exigé et il ne rapporte aucun point supplémentaire ; le chemin hors ligne est la référence notée, pour que le devoir fonctionne en environnement restreint.

Notation

100 points sur l’ensemble de l’arc. Chaque livrable nomme aussi les outils d’IA utilisés et ce pour quoi ils l’ont été, conformément à la politique de déclaration.

ÉtapeLivrablePointsRésultat évalué
1Journal de vérification des citations1511 (vérifier les sorties, assumer le résultat)
2Liste annotée de défauts et de forces, les deux articles, + l’exposé paper-pulse20 (15 écrit + 5 exposé)10 (analyser les modes d’échec), 12 (apprécier le lien affirmation–preuve pour un public, à l’oral et à l’écrit)
3Grille de qualité avec déclaration de genre2511 (assumer vos exigences), 12 (critères propres au genre et au public)
4Spécification de l’agent + rapport d’évaluation (cahier des charges, jeu d’évaluation, notateur, kappa, analyse des échecs, réflexion finale)4010 (machinerie d’évaluation complète), 11 (défendre les verdicts de l’agent comme les vôtres), 1 (apprécier le rôle de l’IA dans votre domaine, sur preuves)

Les enquêtes d’évaluation par les pairs relèvent de la participation, suivies par leur complétion les jours où vous assistez au cours ; elles ne rapportent aucun point d’arc et vos notes ne sont jamais jugées pour leur exactitude.

Différenciation 469 / 569

L’arc se décline à deux niveaux, selon la règle de progression du cours (niveau Appliquer pour 469, niveau Créer pour 569 sur le résultat 10) :

ÉtapeESS 469ESS 569
1–2IdentiqueIdentique
3Adapter un squelette de grille fourni : fixer les pondérations et les seuils de réussite, et ajouter au moins deux critères propres à votre domaine et à votre genreÉcrire la grille de zéro : au moins dix critères binaires, des pondérations et des seuils de réussite, avec la justification d’une phrase pour chaque pondération
4Évaluer contre le corpus à défauts plantés et les transcriptions enregistrées fournis par le cours ; notateur complet, kappa et analyse des échecs exigésEn plus, rédiger au moins deux documents de jeu d’évaluation de votre cru, avec des défauts que vous plantez et documentez, et les ajouter au corpus

La mesure du kappa et l’analyse des échecs sont exigées aux deux niveaux ; ce sont les parties de la machinerie qui ne se diluent pas.

Pourquoi l’arc s’achève ici

À l’étape 4, vous avez écrit les exigences, vous les avez encodées en contrôles, et vous avez mesuré — avec des statistiques d’accord et des taux de réussite, non des impressions — avec quelle qualité un agent les applique. L’agent fait respecter une grille que vous avez écrite, pondérée pour des raisons que vous savez énoncer, testée contre des défauts que vous savez nommer. Quand on vous demandera si c’est l’IA qui a écrit votre article ou vous, l’arc est la réponse du cours : l’assistant rédige et critique, mais les exigences qu’il fait respecter sont les vôtres, et vous savez les défendre toutes, sans lui dans la pièce.