ÉtonniumLycée et prépaLycée Voisins et erreurs

Lycée et prépa · Intelligence artificielle

Voisins et erreurs : une IA qui classe

Une machine connaît 242 manchots de l’Antarctique, mesurés par des scientifiques. Pour trouver l’espèce d’un manchot qu’elle n’a jamais vu, elle cherche ceux qui lui ressemblent le plus, ses plus proches voisins, et les fait voter. Fais-la classer, puis fais-lui passer un examen honnête et range ses erreurs dans un tableau. Tu y retrouveras les mots des tests médicaux : faux positifs, faux négatifs, sensibilité, spécificité.

De la 2de (tests diagnostiques) à la 1re (NSI : k plus proches voisins) ⏱ 20 à 30 min 8 missions Vraies données : 342 manchots de l’archipel Palmer (CC0)

Les deux mesures

La distance

    Touche ou clique le dessin pour placer un manchot inconnu. Au clavier, les flèches le déplacent (Maj : plus vite) et Échap le retire.

    L’examen porte sur

    Espèce cherchée par le détecteur

    Palier 1 · DécouvrirDemander aux voisins

    Une machine qui compare 1re · NSI

    Sur le banc, chaque point est un manchot adulte mesuré en Antarctique entre 2007 et 2009. En largeur : la longueur de son bec. En hauteur : la hauteur du bec à sa base. La forme et la couleur disent l’espèce : Adélie, à jugulaire ou papou. Ces 242 manchots sont les exemples de la machine.

    Touche le dessin : tu crées un manchot inconnu, qui a les deux mesures de cet endroit. La machine calcule sa distance à chacun des 242 exemples, garde les k plus proches et les fait voter. Chacun donne une voix à son espèce ; l’espèce qui a le plus de voix l’emporte. C’est tout : la machine ne tire aucune règle de ses exemples, elle les garde et elle compare. On parle quand même d’apprentissage, car ses réponses viennent des exemples, pas d’une règle écrite par quelqu’un.

    Le dessin est à l’échelle de la machine : deux manchots proches sur le dessin sont proches pour elle. Ce n’est pas si simple quand les mesures n’ont pas la même unité : on y vient au palier 3.

    1. Place un manchot au milieu d’un groupe d’une seule couleur : tous les voisins sont d’accord.
    2. Place-le entre deux groupes, puis compare k = 1 et k = 5 avec le curseur.
    3. Cherche un point isolé au milieu d’une autre couleur, et place l’inconnu tout contre lui.

    Avec k = 1, un seul exemple hors norme peut-il changer la réponse de la machine ?

    Le vote des k voisins

    Avec k = 1, la machine recopie l’espèce de l’exemple le plus proche. Avec k = 5, cinq exemples votent : un manchot hors norme, par exemple un manchot à jugulaire au bec exceptionnellement long, peut être mis en minorité par ses voisins. Si deux espèces ont autant de voix, la machine prend celle du plus proche voisin parmi elles.

    Si tu as fait voter des voisins à l’atelier Apprendre par l’exemple, tu reconnais la méthode. Ici, on va jusqu’au bout : l’examen, et le compte précis des erreurs.

    Les voisins d’un manchot inconnu, du plus proche au plus loin : papou, à jugulaire, à jugulaire, papou, papou. Que répond la machine avec k = 3, puis avec k = 5 ?

    Au palier 2 : faire passer un examen à la machine, sur 100 manchots qu’elle n’a jamais vus, et ranger ses erreurs dans un tableau.

    Tes missions

    Voici les missions du palier choisi. Réponds, puis clique sur « Valider ma réponse ». Si ce n’est pas encore ça, un indice t’aide. Après trois essais, tu peux voir la solution.

    Le savais-tu ?

    Des faits vrais, avec le texte ou le calcul qui les prouve.

    Le savais-tu ?

    La règle du plus proche voisin a été décrite en 1951 par deux statisticiens, Evelyn Fix et Joseph Hodges, dans un rapport pour l’école de médecine aéronautique de l’armée de l’air des États-Unis. Ce rapport n’a été publié dans une revue qu’en 1989.

    Fix et Hodges (1951), republié dans International Statistical Review 57(3), 1989.

    Le savais-tu ?

    En 1967, Thomas Cover et Peter Hart démontrent qu’avec une infinité d’exemples, la règle du plus proche voisin se trompe au plus deux fois plus souvent que la meilleure règle possible.

    Cover et Hart (1967), IEEE Transactions on Information Theory 13(1), p. 21-27.

    Le savais-tu ?

    Si une maladie touche 1 personne sur 1 000, un « test » qui répond toujours « non » a une exactitude de 99,9 %. Il ne trouve pourtant aucun malade : sa sensibilité est nulle.

    Calcul : 999 bonnes réponses sur 1 000.

    Le savais-tu ?

    Le papou est le plus lourd des trois : 5,08 kg en moyenne, contre 3,70 kg pour l’Adélie et 3,73 kg pour le manchot à jugulaire. Dans le fichier, toutes les masses sont des multiples de 25 g.

    Calcul sur les 342 manchots du fichier (donnees.js).

    Le savais-tu ?

    Ces manchots ont été mesurés de 2007 à 2009 par l’écologue Kristen Gorman et l’équipe de la station Palmer, sur trois îles. En 2020, trois chercheuses en ont tiré un jeu de données libre, pour s’exercer à explorer et à représenter des données. Elles le présentent comme une alternative au jeu classique des fleurs d’iris, qui date de 1936.

    Gorman, Williams et Fraser (2014) ; Horst, Hill et Gorman (2020), paquet palmerpenguins.

    Les mots du module

    Chaque mot, en une ou deux phrases.

    Exemples (données d’entraînement)
    Les données dont on connaît la réponse et que la machine garde en mémoire : ici, les 242 manchots dont l’espèce est connue.
    k plus proches voisins
    Une méthode de classement : pour une donnée nouvelle, chercher les k exemples les plus proches et répondre la classe (ici l’espèce) la plus fréquente parmi eux.
    Distance euclidienne
    La distance « à vol d’oiseau » entre deux points d’un repère orthonormé : √((x₂ − x₁)² + (y₂ − y₁)²).
    Écart type
    La dispersion d’une série autour de sa moyenne : la racine carrée de la moyenne des carrés des écarts à la moyenne.
    Mise à l’échelle
    Diviser chaque mesure par son écart type, pour que des mesures d’unités différentes pèsent autant dans la distance.
    Examen (données de test)
    Des données mises de côté avant tout, jamais montrées à la machine, qui servent seulement à mesurer ses erreurs.
    Tableau des erreurs (matrice de confusion)
    Un tableau croisé d’effectifs : en lignes, la vraie classe ; en colonnes, la réponse de la machine.
    Vrai ou faux, positif ou négatif
    Pour une classe cherchée : « positif » ou « négatif » est la réponse de la machine ; « vrai » ou « faux » dit si elle a raison.
    Sensibilité
    VP/(VP + FN) : la part des cas cherchés que la machine trouve.
    Spécificité
    VN/(VN + FP) : la part des autres cas que la machine écarte à raison.
    Exactitude
    (VP + VN)/N : la part des bonnes réponses. Elle peut rester élevée alors qu’une classe rare n’est jamais trouvée.
    Validation
    Une troisième pile de données, distincte des exemples et de l’examen, qui sert à choisir des réglages comme k.
    Pour les parents et les enseignantsouvrir

    Objectifs

    • Comprendre une méthode d’apprentissage réelle et simple, les k plus proches voisins, sur de vraies données : classer en comparant, puis en faisant voter.
    • Évaluer un classifieur honnêtement : sur des données mises de côté, pas sur ses propres exemples.
    • Construire et lire le tableau des erreurs d’une espèce contre les autres ; calculer sensibilité, spécificité et exactitude, avec le vocabulaire des tests diagnostiques de 2de.
    • Comprendre deux réglages, la mise à l’échelle des mesures par l’écart type et le nombre k de voisins, et leur effet sur une espèce rare.

    Déroulé (20 à 30 minutes)

    Palier 1 : placer un manchot inconnu, voir ses voisins voter, comparer k = 1 et k = 5. Palier 2 : l’examen sur 100 manchots jamais vus, les quatre cas, la sensibilité, la spécificité et l’exactitude. Palier 3 : la masse en grammes qui écrase le bec en millimètres, la mise à l’échelle, l’espèce rare effacée par un grand k, et ce qu’il en est des systèmes d’IA actuels.

    Les pièges visés

    Juger la machine sur ses propres exemples ; confondre faux positif et faux négatif ; diviser par le mauvais groupe (VP + FP au lieu de VP + FN) ; prendre l’exactitude pour la sensibilité ; calculer une distance avec des mesures d’unités différentes sans les mettre à l’échelle ; croire qu’un k plus grand est toujours plus sûr. Les indices des missions repèrent ces erreurs et les nomment.

    À faire en vrai

    Au tableur, avec le fichier des manchots (licence CC0) : une colonne de distances à un manchot inconnu, un tri, puis les voix des k premiers. En NSI, écrire la fonction qui fait voter les k plus proches voisins, puis celle qui remplit le tableau des erreurs sur une pile d’examen ; refaire les calculs sans, puis avec la division par l’écart type.

    Liens avec les programmes

    • Seconde, mathématiques (programme de 2026, en vigueur à la rentrée 2026), arrêté du 26 février 2026, NOR MENE2602914A, Bulletin officiel n° 14 du 2 avril 2026. Probabilités (p. 345) : « donner du sens au vocabulaire des tests diagnostiques : faux positifs, faux négatifs, spécificité et sensibilité d’un test ». Croisement de deux variables qualitatives (p. 344) : « Tableau croisé d’effectifs », « Fréquence conditionnelle, fréquence marginale ». Statistiques (p. 344) : « Indicateurs de dispersion : écart type ». Vecteurs (p. 341) : « Calculer la distance entre deux points ». Vérifié : texte relu dans le PDF du Bulletin officiel, aux pages indiquées.
    • Première, numérique et sciences informatiques (spécialité), programme fixé par l’arrêté du 17 janvier 2019 (NOR MENE1901633A, Bulletin officiel spécial n° 1 du 22 janvier 2019), partie « Algorithmique » : « Algorithme des k plus proches voisins » ; capacité attendue : « Écrire un algorithme qui prédit la classe d’un élément en fonction de la classe majoritaire de ses k plus proches voisins » ; commentaire : « Il s’agit d’un exemple d’algorithme d’apprentissage. » Vérifié : annexe officielle relue (PDF du ministère).
    • Terminale, enseignement scientifique, annexe de l’arrêté du 30 mai 2023, Bulletin officiel n° 25 du 22 juin 2023, thème 3.5 « De la machine de Turing à l’intelligence artificielle » : « produire un tableau de contingence afin de calculer des fréquences de faux positifs, faux négatifs, vrais positifs, vrais négatifs », puis « Utiliser cette démarche dans d’autres contextes de classification ». Vérifié : annexe officielle relue.
    • Classes préparatoires, informatique commune (2e année des filières MP, PC, PSI, PT), arrêté du 5 janvier 2021, NOR ESRS2035774A : « Algorithme des k plus proches voisins avec distance euclidienne. Matrice de confusion. » Texte lu dans une copie de l’annexe, pas sur un site officiel.
    • Pas de plafond : les badges disent où chaque outil se trouve dans les programmes. Un élève de seconde qui a compris le palier 2 peut aborder le palier 3, qui n’utilise que l’écart type et la distance entre deux points.

    Ce que le module simplifie

    Un seul découpage, tiré au hasard une fois pour toutes : avec un autre tirage, les nombres changent. Sur 200 tirages, la sensibilité du détecteur de manchots à jugulaire (bec, mis à l’échelle, k = 5) va de 70 % à 100 %, 90 % en médiane : avec 20 manchots à jugulaire, un seul compte pour 5 points. La machine compare deux mesures à la fois ; la longueur de la nageoire, quatrième mesure du fichier, n’est jamais utilisée. Les écarts types sont calculés sur les 242 exemples seuls, pour que l’examen reste inconnu de la machine. Le manchot inconnu est imaginaire ; ses mesures sont arrondies au dixième de millimètre et à 25 g. Le banc laisse choisir k en regardant l’examen, ce qu’on évite en pratique avec une pile de validation. Les systèmes d’IA actuels utilisent d’autres modèles et beaucoup plus de données.

    Sources

    Les distances, les votes, les tableaux et les réponses des missions viennent du modèle du module (modele.js), vérifié dans node, et des mesures des manchots (donnees.js).

    1. Ministère de l’Éducation nationale. Programme d’enseignement de mathématiques de la classe de seconde générale et technologique, arrêté du 26 février 2026, NOR MENE2602914A, Bulletin officiel n° 14 du 2 avril 2026, p. 332-345.
    2. Ministère de l’Éducation nationale. Programme de numérique et sciences informatiques de première générale, annexe de l’arrêté du 17 janvier 2019, NOR MENE1901633A, Bulletin officiel spécial n° 1 du 22 janvier 2019.
    3. Ministère de l’Éducation nationale. Programme d’enseignement scientifique de terminale générale, annexe de l’arrêté du 30 mai 2023, Bulletin officiel n° 25 du 22 juin 2023, thème 3.5.
    4. Ministère de l’Enseignement supérieur. Programme d’informatique commune des classes préparatoires scientifiques, arrêté du 5 janvier 2021, NOR ESRS2035774A.
    5. Horst A. M., Hill A. P., Gorman K. B. (2020). palmerpenguins: Palmer Archipelago (Antarctica) penguin data. Paquet R, doi:10.5281/zenodo.3960218. Fichier penguins.csv de la version 0.1.1 (CRAN), licence CC0 (domaine public).
    6. Gorman K. B., Williams T. D., Fraser W. R. (2014). Ecological sexual dimorphism and environmental variability within a community of Antarctic penguins (genus Pygoscelis). PLoS ONE 9(3) : e90081. doi:10.1371/journal.pone.0090081.
    7. Fix E., Hodges J. L. (1951). Discriminatory analysis. Nonparametric discrimination: consistency properties. Rapport n° 4, USAF School of Aviation Medicine, Randolph Field (Texas). Republié dans International Statistical Review 57(3), à partir de la p. 238 (1989). doi:10.2307/1403797.
    8. Cover T. M., Hart P. E. (1967). Nearest neighbor pattern classification. IEEE Transactions on Information Theory 13(1) : 21-27. doi:10.1109/TIT.1967.1053964.
    9. Hastie T., Tibshirani R., Friedman J. (2009). The Elements of Statistical Learning, 2e édition. Springer, doi:10.1007/978-0-387-84858-7 : chapitre 7, « Model Assessment and Selection » (validation et test), et chapitre 13, « Prototype Methods and Nearest-Neighbors ».