LYCÉE → PRÉPA · L36

Module L36 · Partie K · Ingénierie de l’IA

Les données : collecter, annoter, nettoyer, documenter — tout ce qu’il faut savoir.

Un modèle n’est jamais meilleur que ses données. Ce chapitre traite la création d’un jeu de données de bout en bout : définir ce qu’on mesure, collecter (sources, consentement, licences, échantillonnage), annoter (consignes, accord inter-annotateurs, annotation active et assistée), nettoyer (doublons, valeurs manquantes, aberrantes, étiquettes bruitées, fuites), équilibrer et augmenter, séparer (train/val/test sans fuite), documenter (datasheet), versionner — et les données pour LLM (déduplication à grande échelle, filtrage de qualité, données synthétiques, contamination). Avec les mathématiques (taille d’échantillon, accord, bruit d’étiquettes, déduplication par MinHash) et les articles.

Durée : 4 séances · Prérequis : L08, L11, L13, L32. Objectifs : concevoir une collecte et une consigne d’annotation ; mesurer et améliorer l’accord ; nettoyer et dédupliquer (exact et quasi-doublons) ; détecter les fuites et les biais ; séparer correctement ; documenter et versionner ; savoir quand générer des données synthétiques.

Ce que vous saurez faire à la fin
  • Calculer la taille d’échantillon nécessaire et le budget d’annotation.
  • Écrire une consigne d’annotation qui produit un kappa > 0,7, et itérer.
  • Implémenter la déduplication par MinHash/LSH et la détection d’étiquettes bruitées.
  • Produire un jeu versionné et documenté, avec une séparation sans fuite.

Fiche de cours · Définitions

Définitions

Définition (jeu de données). Ensemble d’exemples (x, y) avec métadonnées (source, date, annotateur, licence), une documentation (datasheet), un schéma (types, unités, valeurs autorisées), une version. Un jeu sans ces éléments est une collection de fichiers.
Définition (population, échantillon, biais d’échantillonnage). Population : ce sur quoi le modèle sera utilisé. Échantillon : ce qu’on collecte. Biais : l’échantillon ne représente pas la population (biais de sélection, de survie, de disponibilité, temporel). Un modèle apprend l’échantillon, pas la population.
Définition (annotation). Attribution d’étiquettes par des humains selon une consigne (guidelines). Qualité mesurée par l’accord inter-annotateurs (kappa, alpha) et contre un étalon-or (gold). Modes : simple, double avec arbitrage, consensus, annotation assistée (pré-étiquetage par modèle), active (le modèle choisit les exemples à annoter).
Définition (bruit d’étiquettes). Fraction d’étiquettes fausses ; symétrique (uniforme) ou dépendant de la classe/de l’entrée. Détection : désaccords, perte élevée après entraînement (confident learning), ré-annotation d’un échantillon.
Définition (doublon, quasi-doublon). Exact : même contenu (hash). Quasi : contenu presque identique (similarité de Jaccard sur n-grammes > seuil, plongements proches). Les doublons entre train et test gonflent les scores ; dans le train, ils sur-pondèrent et favorisent la mémorisation.
Définition (fuite). Toute information présente à l’entraînement qui ne sera pas disponible en production, ou qui provient du futur ou du test : variables proxy de la cible, prétraitement ajusté sur tout le jeu, doublons train/test, groupes partagés, ordre temporel violé.
Définition (séparation). Aléatoire (données i.i.d.), par groupe (un patient, un robot, un utilisateur entier dans un seul sous-ensemble), temporelle (test = période future), stratifiée (proportions des classes conservées). Le test est scellé (L32).
Définition (données synthétiques, augmentation). Synthétiques : générées par simulation, règles ou modèle (LLM) ; augmentation : transformations d’exemples réels préservant l’étiquette (rotations, bruit, paraphrases). Utiles pour la rareté et l’équilibre ; risquent de reproduire les biais du générateur et de dégrader par effondrement (model collapse) si réutilisées en boucle.
Définition (datasheet, licence, consentement). Documentation (Gebru 2018) : motivation, composition, collecte, prétraitement, usages, distribution, maintenance. Licence des données (CC, ODbL, propriétaire, conditions de site) ; base légale (RGPD : consentement, intérêt légitime ; données sensibles ; droit à l’effacement).

Fiche de cours · Formules

Formules à connaître

Taille d’un jeu de test pour une exactitude p à ±e (95 %) : n ≥ 1,96²·p(1−p)/e² ; pour ±2 points autour de 80 % : 1 537 cas
Taille d’entraînement (règle empirique) : erreur ≈ a + b/nc (loi de puissance, c ≈ 0,3–0,5) ; tracer la courbe d’apprentissage sur 10 %, 20 %, 50 %, 100 % et extrapoler
Kappa de Cohen κ = (po − pe)/(1 − pe) ; alpha de Krippendorff α = 1 − Do/De (multi-annotateurs, données manquantes, distances variées) ; cibles : κ ≥ 0,7 pour une tâche « bien définie »
Bruit symétrique de taux η : un classifieur entraîné avec la perte 0-1 atteint la même solution optimale si η < ½ (Natarajan 2013) ; mais la variance et le sur-apprentissage augmentent ; l’exactitude mesurée sur un test bruité est plafonnée à ≈ 1 − η
Jaccard(A, B) = |A ∩ B|/|A ∪ B| sur les ensembles de shingles (n-grammes) ; MinHash : P(hmin(A) = hmin(B)) = Jaccard(A, B) ; avec k fonctions, estimation ± 1/√k
LSH par bandes (b bandes de r lignes, br = k) : P(candidat) = 1 − (1 − sr)b — courbe en S avec seuil ≈ (1/b)1/r
Coût d’annotation = n × temps par exemple × taux horaire × (1 + fraction doublement annotée) + conception de la consigne + arbitrage
Déséquilibre : sur-échantillonner la minorité, sous-échantillonner la majorité, ou pondérer la perte par 1/fréquence ; SMOTE (interpolation) pour le tabulaire ; jamais sur le test
Z-score |x − μ|/σ > 3 ou IQR (x < Q₁ − 1,5·IQR ou > Q₃ + 1,5·IQR) pour les valeurs aberrantes univariées ; isolation forest / LOF en multidimensionnel
Imputation : moyenne/médiane (biais de variance), par modèle (KNN, régression), indicateur de valeur manquante en variable supplémentaire ; MCAR / MAR / MNAR déterminent ce qui est valide

Fiche de cours · Théorèmes et démonstrations

Démonstrations à savoir refaire

Théorème 1 (MinHash estime Jaccard). Pour une permutation aléatoire π des shingles, P(min π(A) = min π(B)) = J(A, B).
Le minimum de π sur A ∪ B est atteint sur un élément uniformément aléatoire de A ∪ B (la permutation est aléatoire). min π(A) = min π(B) ssi cet élément est dans A ∩ B. Probabilité |A ∩ B|/|A ∪ B| = J. Avec k permutations indépendantes (en pratique k fonctions de hachage), la fraction d’égalités est un estimateur sans biais de J, de variance J(1 − J)/k. Une signature de k = 128 entiers (512 octets) remplace un document de plusieurs Mo pour la comparaison : c’est ce qui rend la déduplication de 10⁹ documents possible (Broder 1997 ; utilisé pour C4, The Pile, RefinedWeb).
Théorème 2 (LSH par bandes : la courbe en S). Avec une signature de br valeurs découpée en b bandes de r valeurs, deux documents de similarité s deviennent candidats (identiques sur au moins une bande) avec probabilité 1 − (1 − sr)b.
Par le Théorème 1, chaque valeur de signature coïncide avec probabilité s ; une bande entière (r valeurs) coïncide avec probabilité sr (indépendance) ; aucune bande ne coïncide avec probabilité (1 − sr)b. La fonction est proche de 0 pour s petit, de 1 pour s grand, avec un seuil vers (1/b)1/r : pour b = 20, r = 5 : s ≈ 0,55. On ne compare donc que les paires candidates (mêmes buckets), en temps ≈ linéaire, au lieu de n²/2 paires.
Théorème 3 (un doublon train/test surestime l’exactitude). Si une fraction d du jeu de test est dupliquée dans le train et que le modèle mémorise (exactitude 1 sur ces cas) tandis que l’exactitude réelle est a, l’exactitude mesurée est a + d(1 − a).
Mesurée = d × 1 + (1 − d) × a = a + d(1 − a). Avec d = 10 % et a = 0,80 : 0,82 — un « gain » de 2 points qui ne correspond à rien. Pour les LLM, la contamination des benchmarks (L32) est ce mécanisme à l’échelle du web ; pour un jeu interne, elle vient des copier-coller, des versions multiples d’un document, des exports répétés. Déduplication avant la séparation, exacte et approximative, et par groupe (un document et ses versions dans le même sous-ensemble).
Théorème 4 (le bruit d’étiquettes plafonne l’exactitude mesurée et la borne inférieure de l’accord). Si les étiquettes du test sont fausses avec probabilité η (symétrique, binaire), l’exactitude mesurée d’un classifieur parfait est 1 − η ; et deux annotateurs indépendants de taux d’erreur η s’accordent avec probabilité (1 − η)² + η².
Un classifieur parfait est « en désaccord » avec l’étiquette exactement quand elle est fausse : exactitude mesurée 1 − η. Deux annotateurs s’accordent s’ils ont tous deux raison ((1 − η)²) ou tous deux tort de la même façon (η² en binaire). Pour η = 0,1 : accord 0,82, et un modèle à 90 % « réel » affiche 81–90 % selon la corrélation de ses erreurs avec celles des annotateurs. Conséquence : un plafond de performance apparent peut être un plafond d’annotation ; ré-annoter un échantillon du test en double, avec arbitrage, avant de chercher un meilleur modèle.

01 / Concevoir

Du besoin au plan de collecte : population, échantillonnage, budget

Question de conceptionRéponse à écrire avant de collecter
Population cibleQui/quoi, où, quand, dans quelles conditions (capteurs, langues, saisons, appareils)
Unité d’exempleUne image, une phrase, un document, une séquence de 10 s ? Une décision par unité
ÉtiquetteDéfinition opérationnelle, valeurs autorisées, cas limites tranchés, exemples
Sources et droitsOrigine, licence, consentement, données personnelles, durée de conservation
ÉchantillonnageAléatoire ? stratifié par condition ? sur-collecte des cas rares ? période ?
MétadonnéesTout ce qui permettra les tranches (L32) et les séparations par groupe

02 / Annoter

Consigne, accord inter-annotateurs, arbitrage — et l’annotation active

03 / Nettoyer

Schéma, valeurs manquantes et aberrantes, étiquettes bruitées — sur un jeu réaliste

03 / Nettoyer

Déduplication approximative : MinHash et LSH implémentés (Théorèmes 1 et 2)

À l’échelle (10⁹ documents) : signatures sur GPU/Spark, LSH distribué (text-dedup, datasketch), déduplication de sous-chaînes par suffix array (Lee et al. 2022). La déduplication améliore la perplexité des LLM et réduit la mémorisation — un des rares traitements qui gagnent sur les deux tableaux.

04 / Séparer et protéger

Fuites, séparations par groupe et par temps, équilibrage — vérifiés par le code

05 / Données pour LLM

Corpus de pré-entraînement et d’affinage : filtrage, déduplication, synthèse, contamination

ÉtapeCe qu’on faitExemples / chiffresPiège
CollecteCommon Crawl (pétaoctets), livres, code, articles, forums ; corpus internesRefinedWeb : 5 000 G tokens → 600 G après filtrage ; FineWeb 15 T tokensDroits d’auteur, données personnelles, robots.txt
ExtractionHTML → texte (trafilatura), langue (fastText), encodagePerte de 50–80 % du volume brutMenus, pubs, texte dupliqué de gabarit
Filtrage de qualitéHeuristiques (longueur, ponctuation, ratio de symboles, répétitions), classifieurs de qualité (entraînés sur Wikipédia/livres vs web), perplexité d’un petit LMGopher rules ; C4 : lignes sans point final retiréesBiais : le « bon anglais » filtre les dialectes et les langues rares
DéduplicationExacte (hash de documents/lignes), quasi (MinHash LSH), sous-chaînes (suffix array)Lee et al. 2022 : −10 % de perplexité à calcul égal, mémorisation ÷10Dédupliquer aussi contre les jeux de test (contamination)
DécontaminationRetirer tout document contenant des n-grammes des benchmarks (13-grammes)GPT-3 : 13-gram overlap ; toujours imparfait (paraphrases)Impossible à garantir ; d’où les jeux privés (L32)
Mélange et pondérationProportions par source (web 80 %, code 10 %, livres…), sur-échantillonnage des sources rares de qualitéLe mélange influence les capacités (code → raisonnement)Époques multiples sur les données rares : rendements décroissants après 4 (Muennighoff 2023)
Données d’instructionPaires (instruction, réponse) écrites par des humains, ou générées puis filtrées (Self-Instruct, Evol-Instruct), préférences (paires)LIMA : 1 000 exemples de haute qualité suffisent pour l’alignement de baseRéponses générées par un modèle = ses biais et ses erreurs ; licences des sorties
Données synthétiquesSimulation, LLM générateur + vérificateur (code exécuté, maths vérifiées)Phi : manuels synthétiques ; robotique : sim-to-realEffondrement du modèle si l’on entraîne en boucle sur ses propres sorties (Shumailov 2024)

06 / Documenter et versionner

Datasheet, schéma, version : le jeu de données comme artefact logiciel

# DATASHEET — obstacles-robot-v3 (extrait)
Motivation : entraîner et évaluer la détection d'obstacles du robot R2 en intérieur (couloirs, ateliers) ; commanditaire : équipe navigation.
Composition : 24 310 images 640×480 (RGB) + 24 310 scans lidar synchronisés ; 3 sites, 11 robots, 2025-11 → 2026-06 ; classes : sol, mur,
  obstacle_statique, humain, vide ; 7 % 'humain' ; 1 130 images avec ≥ 2 annotateurs (kappa 0,81) ; étalon-or : 500 images arbitrées.
Collecte : capture automatique 1 img/s pendant les missions ; échantillonnage stratifié par site et par heure ; humains floutés (RGPD, base
  légale : intérêt légitime, information affichée sur site) ; aucune donnée hors des sites partenaires.
Prétraitement : déduplication exacte (hash) et approximative (pHash < 6) → −2 140 ; images floues (variance du laplacien < 50) → −310 ;
  étiquettes normalisées ; 41 conflits arbitrés. Script : prep/clean.py @ a1f3c9e.
Séparation : par ROBOT (test = 3 robots jamais vus) et par période (test = 2026-05/06) ; train 17 800 / val 2 900 / test 3 610 ; test scellé (hash).
Usages : détection et segmentation ; NON prévu : reconnaissance de personnes. Licence : interne ; contact : navigation@…
Maintenance : version trimestrielle ; erreurs signalées via le formulaire ; changelog ci-dessous.
Versions : v1 (2026-01, 8 000 img) → v2 (2026-04, +site C) → v3 (2026-07, déduplication, nouvelle consigne 'humain partiel').

07 / Articles

Les articles à lire

ArticleContributionÀ retenir
Gebru et al., Datasheets for Datasets, 2018 — 1803.09010Documentation standardiséeLe modèle de la partie 06
Broder, On the resemblance and containment of documents, 1997 ; Leskovec, Rajaraman & Ullman, Mining of Massive Datasets, chap. 3MinHash, LSHThéorèmes 1 et 2
Lee et al., Deduplicating Training Data Makes Language Models Better, ACL 2022 — 2107.06499Déduplication exacte + approximative des corpus LLMMoins de mémorisation, meilleure perplexité
Northcutt, Jiang & Chuang, Confident Learning, JAIR 2021 — 1911.00068 ; Northcutt et al., Pervasive Label Errors in Test Sets, NeurIPS 2021 — 2103.14749Détecter les étiquettes fausses ; 3,4 % d’erreurs dans les tests standard (ImageNet 6 %)Théorème 4 ; cleanlab
Natarajan et al., Learning with Noisy Labels, NeurIPS 2013Théorie du bruit d’étiquettesPertes corrigées ; le bruit < ½ est surmontable
Settles, Active Learning Literature Survey, 2009Annotation activeIncertitude, diversité ; le test reste aléatoire
Kaufman et al., Leakage in Data Mining, TKDD 2012Taxonomie des fuitesUn score trop beau est une fuite jusqu’à preuve du contraire
Penedo et al., The RefinedWeb Dataset, 2023 — 2306.01116 ; FineWeb, 2024 — 2406.17557Pipelines de filtrage web à l’échelle, ablationsCe que chaque filtre change, mesuré
Zhou et al., LIMA: Less Is More for Alignment, 2023 — 2305.112061 000 exemples de qualitéQualité > quantité pour l’affinage
Shumailov et al., AI models collapse when trained on recursively generated data, Nature 2024Effondrement du modèleGarder des données réelles ; tracer la provenance
Sambasivan et al., “Everyone wants to do the model work, not the data work”, CHI 2021Cascades de données dans les projets IALes échecs viennent des données négligées
Rubin, Inference and Missing Data, Biometrika 1976MCAR / MAR / MNARLe mécanisme des manquants décide de l’imputation valide

TP guidé

TP — Un jeu de données from scratch, documenté (6 h)

Exercices

Exercices auto-corrigés

Exercice 1 — Kappa et alpha

Implémentez kappa_cohen(a, b) et kappa_pondere(a, b, K) (pondération quadratique pour des catégories ordinales 0..K−1 : poids wij = (i − j)²/(K − 1)²). Vérifiez : κ = 1 pour l’accord parfait ; κ ≈ 0 pour des annotations indépendantes ; le kappa pondéré pénalise moins un désaccord d’un cran qu’un désaccord de trois crans.

Correction
def kappa_cohen(a, b):
    a, b = np.asarray(a), np.asarray(b); cats = sorted(set(a) | set(b)); po = np.mean(a == b)
    pe = sum(np.mean(a == c) * np.mean(b == c) for c in cats); return (po - pe) / (1 - pe)
def kappa_pondere(a, b, K):
    a, b = np.asarray(a).astype(np.intp), np.asarray(b).astype(np.intp); n = len(a); O = np.zeros((K, K)); np.add.at(O, (a, b), 1); O /= n
    E = np.outer(np.bincount(a, minlength=K) / n, np.bincount(b, minlength=K) / n)
    W = np.array([[(i - j) ** 2 for j in range(K)] for i in range(K)]) / (K - 1) ** 2
    return 1 - (W * O).sum() / (W * E).sum()

Exercice 2 — MinHash et sa précision

Écrivez minhash_simple(ensemble, k, graine) avec des fonctions de hachage hi(x) = hash((i, x)) (via hashlib), et similarite(sigA, sigB). Vérifiez sur des ensembles de Jaccard connu que l’erreur d’estimation décroît en 1/√k.

Correction
def minhash_simple(ensemble, k=64, graine=0):
    sig = []
    for i in range(k):
        sig.append(min(int(hashlib.blake2b(f"{graine}|{i}|{x}".encode(), digest_size=8).hexdigest(), 16) for x in ensemble))
    return np.array(sig)
def similarite(sa, sb): return float(np.mean(sa == sb))

Exercices

Exercices auto-corrigés (suite)

Exercice 3 — Séparation par groupe sans fuite

Écrivez separer_par_groupe(groupes, frac_test, rng) qui renvoie un masque booléen du test tel qu’aucun groupe ne soit à cheval et que la fraction de lignes en test soit ≈ frac_test (±0,05), et verifier_fuite(train_ids, test_ids) qui renvoie le nombre d’identifiants (doublons) communs.

Correction
def separer_par_groupe(groupes, frac_test=0.2, rng=None):
    rng = rng or np.random.default_rng(0); g = np.unique(groupes); rng.shuffle(g); tailles = {x: (groupes == x).sum() for x in g}
    test, total = set(), 0
    for x in g:
        if total / len(groupes) >= frac_test: break
        test.add(x); total += tailles[x]
    return np.isin(groupes, list(test))
def verifier_fuite(train_ids, test_ids): return len(set(train_ids) & set(test_ids))

Exercice 4 — Détection d’étiquettes bruitées par validation croisée

Implémentez etiquettes_suspectes(X, y, k_plis, seuil) : entraîner un classifieur simple (centroïdes par classe) sur k−1 plis, prédire les probabilités sur le pli restant (softmax des −distances), et renvoyer les indices dont la probabilité de l’étiquette annotée est < seuil. Vérifiez que sur des données avec 10 % d’étiquettes inversées, la précision de la détection et le rappel dépassent 0,6.

Correction
def etiquettes_suspectes(X, y, k_plis=5, seuil=0.2):
    n = len(y); K = y.max() + 1; plis = np.arange(n) % k_plis; suspects = []
    for p in range(k_plis):
        tr, te = plis != p, plis == p
        centres = np.array([X[tr][y[tr] == c].mean(0) for c in range(K)])
        d = ((X[te][:, None, :] - centres[None, :, :]) ** 2).sum(-1); z = -d; z -= z.max(1, keepdims=True); pr = np.exp(z); pr /= pr.sum(1, keepdims=True)
        idx = np.where(te)[0]; suspects += [int(i) for i, row, lab in zip(idx, pr, y[te]) if row[lab] < seuil]
    return suspects

Fiche de cours · Exercices corrigés

Exercices corrigés (rédaction)

Exercice 1. Un modèle de tri de courriels atteint 97 % en validation, 71 % en production. Lister les causes probables liées aux données et le test qui les confirme.
Correction. (1) Fuite : variable proxy (identifiant, horodatage corrélé au libellé, champ rempli après coup) — test : importance des variables, ré-entraîner sans les suspects. (2) Doublons train/val (fils de discussion, réponses citant le message) — test : déduplication exacte + MinHash entre train et val ; séparation par fil de discussion. (3) Séparation aléatoire alors que la production est temporelle (nouveaux sujets) — test : validation temporelle. (4) Population différente : val = courriels d’un service, prod = tous — test : dérive (L35) entre val et prod, tranches par service. (5) Étiquettes de val produites par une règle que le modèle a apprise (validation circulaire) — test : ré-annotation humaine d’un échantillon. (6) Prétraitement ajusté sur tout le jeu. Ordre : (2) et (3) sont les plus fréquents.
Exercice 2. Deux annotateurs ont un kappa de 0,45 sur une tâche de sentiment à 5 niveaux. Que faire avant d’entraîner ?
Correction. 0,45 = accord modéré : le bruit d’étiquettes plafonnera le modèle (Théorème 4) et l’évaluation. Actions : (1) matrice de désaccord — si les désaccords sont surtout entre niveaux adjacents (3 vs 4), le kappa pondéré sera bien meilleur et l’on peut fusionner des niveaux (5 → 3) ou traiter la tâche comme ordinale/régression ; (2) préciser la consigne sur les cas limites identifiés, avec exemples ancrés ; (3) lot pilote de 100, re-mesurer, itérer jusqu’à κ ≥ 0,7 ; (4) annoter le test en triple avec vote/arbitrage (étalon-or), et le train en simple avec un échantillon en double pour estimer η ; (5) si la tâche est intrinsèquement subjective, conserver les étiquettes multiples (distribution) plutôt qu’un vote, et évaluer par la log-vraisemblance de cette distribution.
Exercice 3. On propose de générer 50 000 exemples synthétiques par LLM pour entraîner un classifieur de tickets, faute de données annotées. Avantages, risques, protocole.
Correction. Avantages : volume et couverture rapides, équilibrage des classes rares, coût faible, pas de données personnelles. Risques : distribution différente des vrais tickets (style trop propre, vocabulaire du modèle), étiquettes fausses (le générateur se trompe sur les cas limites), biais du générateur reproduits, effondrement si réutilisé en boucle, licence des sorties. Protocole : (1) partir de 300 vrais tickets annotés (test scellé + amorces) ; (2) générer conditionnellement à des exemples réels et à la consigne d’annotation, avec diversité contrôlée (température, personas) ; (3) filtrer : déduplication, classifieur de « réalisme » (réel vs synthétique — s’il sépare facilement, les synthétiques sont hors distribution), vérification d’un échantillon par humains (précision des étiquettes ≥ 95 %) ; (4) entraîner sur synthétique + réel, évaluer uniquement sur le réel, comparer à réel seul et à synthétique seul ; (5) courbe : quelle quantité de synthétique aide encore ; (6) tracer la provenance de chaque exemple et ne jamais faire entrer de synthétique dans le test.

Vérification

Un jeu contient 5 mesures par session et 15 sessions par robot. Le modèle servira sur de nouveaux robots. Comment séparer train et test ?

Deux questions supplémentaires

1. Que fait MinHash ? Estime la similarité de Jaccard par des signatures courtes ; LSH ne compare que les candidats probables (Théorèmes 1–2).

2. Pourquoi ré-annoter un échantillon du test avant de chercher un meilleur modèle ? Le bruit d’étiquettes plafonne l’exactitude mesurée (Théorème 4).

Référence

Les mots à retenir

MotDéfinition
Population / échantillonCe sur quoi le modèle servira / ce qu’on a collecté ; biais entre les deux.
Consigne, kappa, étalon-orDéfinition opérationnelle, accord corrigé du hasard, référence arbitrée.
Bruit d’étiquettesPlafonne la mesure ; détecter par désaccords et confident learning.
Doublon, MinHash, LSHExact / approximatif ; signatures ; bandes.
FuiteInformation indisponible en production présente à l’entraînement.
Séparation par groupe / tempsReproduire l’usage ; test scellé.
DatasheetMotivation, composition, collecte, prétraitement, usages, maintenance.
Données synthétiquesUtiles avec filtrage et évaluation sur réel ; risque d’effondrement.

Suite

Avant d’entraîner quoi que ce soit : l’escalade des solutions.

Chapitre suivant : les étapes avant « je crée mon modèle from scratch » — règles, modèles existants, prompt, RAG, affinage léger, affinage complet, pré-entraînement — avec, pour chacune, limites, contraintes et avantages.

← L35SommaireL37 : avant le from scratch →