Outils de données interactifs
Démonstrations interactives de concepts en science des données et en analyse de données
Notions fondamentales
Types de données
Chaque variable d'un jeu de données appartient à l'un de quatre types, et savoir lequel détermine ce que vous pouvez en faire. Les variables nominales sont des catégories sans ordre naturel, comme la race d'un chien. Les variables ordinales sont des catégories avec un ordre naturel, comme une note de satisfaction. Les variables numériques discrètes sont des dénombrements — des nombres entiers obtenus en comptant. Les variables numériques continues sont des mesures qui peuvent prendre n'importe quelle valeur, avec autant de décimales que la précision de la mesure le permet.
Types de jointures
Beaucoup d'erreurs bien réelles dans les rapports — lignes manquantes, comptes en double, totaux qui ne concordent pas — proviennent de la fusion de deux tables avec le mauvais type de jointure. Ce graphique rend cela concret : deux petites tables d'un club de thé — les membres et leurs commandes — sont jointes. Choisissez un type de jointure ci-dessous et observez quelles lignes survivent, et où apparaissent les NULL. Il existe quelques autres types de jointures nommés (semi-jointures, anti-jointures et autres) — ils se comportent comme ceux présentés ici, avec un filtre supplémentaire, et sont donc laissés de côté pour garder l'explication ciblée.
Statistiques
Statistiques descriptives
Un petit ensemble de points de données se trouve sur une droite numérique. Faites-les glisser, ajoutez ou supprimez des points, et activez différentes statistiques descriptives — moyenne, médiane, mode, minimum et maximum, écart type, écart interquartile et un diagramme en boîte — pour voir comment chacune réagit lorsque les données changent.
Méthodes d'échantillonnage
Mal choisir son échantillon peut produire silencieusement des conclusions erronées — que l'on se contente de prendre les personnes les plus faciles à joindre, ou que l'on suppose qu'un groupe d'apparence aléatoire fera l'affaire. Cette démonstration montre pourquoi : une population de 60 personnes de trois pays est représentée, chacune avec sa propre consommation moyenne de thé par jour. Prélevez un échantillon par choix de commodité (biaisé), échantillonnage aléatoire simple ou échantillonnage aléatoire stratifié, et comparez-le à la population réelle. L'échantillonnage stratifié est une méthode conçue pour se prémunir contre ce type d'erreur — il en existe plusieurs autres, chacune adaptée à des situations différentes, mais elles ne sont pas présentées ici.
Régression, corrélation et causalité
Vérifier si deux variables sont corrélées est l'un des outils les plus utiles en analyse de données — cela peut révéler une relation réelle sur laquelle agir, ou montrer qu'un facteur qu'on croyait important ne l'est en fait pas. Mais il est aussi facile de se laisser tromper : une corrélation forte peut être une coïncidence, provenir d'un facteur caché commun, ou même s'inverser complètement une fois les données séparées en sous-groupes. Les six petites démonstrations interactives ci-dessous couvrent les deux aspects — deux sur le fonctionnement de la régression linéaire, et quatre sur les façons dont la corrélation peut induire en erreur si on la prend pour argent comptant.
Qualité des données
Imputation des données manquantes
En pratique, il arrive constamment que des données manquent — un capteur tombe hors ligne, un champ de formulaire est oublié, une section de sondage n'atteint jamais une partie de l'échantillon, un enregistrement est supprimé par accident. La solution idéale est souvent de recueillir plus de données, mais ce n'est pas toujours possible : si le thermomètre d'une station météo tombe hors ligne pendant un après-midi, il n'y a aucun moyen de remesurer après coup la température de cet après-midi-là. L'imputation est une façon de combler une telle lacune — plutôt que d'écarter les bonnes données environnantes ou de laisser un trou, on remplace les valeurs absentes par une estimation plausible, fondée sur la tendance du reste des données. Ce graphique le démontre avec un nuage de points représentant le temps d'infusion du thé (en minutes) et son intensité (1 à 10) — la relation réelle est à peu près linéaire, puis s'incurve à mesure que l'intensité approche son maximum. Choisissez la plage de temps où les données manquent, puis explorez différentes façons de combler la lacune.
Valeurs aberrantes
Une valeur aberrante est une valeur qui ne correspond pas au profil des données qui l'entourent — parfois une erreur ponctuelle, parfois le signe que quelque chose de systématique se produit. Les exemples ci-dessous sont volontairement flagrants, mais les vraies valeurs aberrantes le sont rarement autant, d'où l'existence de tests quantitatifs pour évaluer à quel point une valeur est susceptible d'en être une : au-delà des moustaches de 1,5× l'écart interquartile (EI), à plus de 2 ou 3 écarts types de la moyenne, anormalement éloignée d'une tendance ajustée, ou — pour des données asymétriques où la moyenne et l'écart type sont eux-mêmes faussés par les valeurs aberrantes — un score z modifié fondé sur la médiane. Cette page présente deux exemples de la façon dont une seule valeur inhabituelle peut fausser une analyse, et de ce qui change une fois qu'on la signale.
Discrétisation : du numérique à l'ordinal
Un trop grand nombre de valeurs distinctes (ou de catégories) peut inutilement compliquer une analyse — plus il y en a, plus les tendances réelles sont difficiles à voir et plus les étapes suivantes deviennent fragiles, un effet souvent appelé la malédiction de la dimensionnalité (curse of dimensionality). Réduire une mesure numérique fine à une poignée de catégories ordonnées est une façon de s'en prémunir : une campagne de marketing, par exemple, n'a pas besoin de savoir que la préférence d'intensité d'une personne est exactement 6,4 sur 10 — « moyenne » suffit pour agir. Chaque point ci-dessous représente l'intensité mesurée d'une tasse de thé, sur une échelle de 1 à 10; elle est ici convertie en trois catégories ordonnées — « faible », « moyenne » et « forte ». L'emplacement de ces limites de catégorie est une vraie décision : déplacez vous-même les deux lignes de coupure, ou choisissez une méthode qui les calcule automatiquement.
Visualisation de données
Signal visuel brut
Avant même que votre cerveau ne regroupe quoi que ce soit en motifs, avant même qu'il décide de ce qui compte, vos yeux ont déjà effectué leur propre premier traitement : la lumière atteint la rétine, se transforme en signaux de contraste, de contours et de couleur, puis est acheminée vers le cortex visuel — tout cela avant la moindre pensée consciente. Deux aspects de ce premier traitement comptent énormément pour quiconque conçoit un graphique. D'abord, la couleur est à elle seule un signal fragile : un contraste insuffisant, ou le fait de se fier à la teinte sans autre indice pour la renforcer, peut fausser ce que l'on voit avant même que le cerveau commence à l'interpréter. Ensuite, tous les systèmes visuels ne reçoivent pas ce signal de la même façon — environ 1 homme sur 12 et 1 femme sur 200 présentent une forme de déficience de la vision des couleurs, et un simple contraste insuffisant pose problème à un bien plus grand nombre de personnes encore. Les onglets ci-dessous vous permettent de voir de tels effets en direct.
Avant même de cligner des yeux (traitement pré-attentif)
Certaines différences visuelles s'enregistrent à l'instant où vous regardez. Un seul point rouge dans un champ de points gris semble s'annoncer de lui-même — vous ne l'avez pas cherché, il est simplement là. C'est le traitement pré-attentif : votre système visuel lit quelques caractéristiques de base, dont la couleur, partout à la fois, avant même que l'attention soutenue n'entre en jeu. Le hic, c'est que cela ne fonctionne que pour une caractéristique à la fois. Ajoutez une deuxième puis une troisième couleur concurrente et le raccourci s'effondre : vous voilà de retour à vérifier les éléments un par un. Cette démonstration met cela à l'épreuve avec une tâche de comptage rapide : jetez un coup d'œil à une grille de chiffres, puis dites combien d'occurrences d'un chiffre vous avez vues.
Principes de la Gestalt
Avant même de comparer consciemment une seule valeur sur un graphique, votre cerveau a déjà regroupé ce qu'il voit — en grappes, en catégories et en éléments qui ressortent — à l'aide de quelques règles innées que les psychologues appellent les principes de la Gestalt. Un graphique qui respecte ces règles se lit sans effort; un graphique qui les contredit force le lecteur à faire consciemment le travail que la conception aurait dû faire à sa place. Sept principes sont généralement regroupés sous ce nom : la simplicité, la continuité, la proximité, la similarité, le point focal, la correspondance et la relation figure-fond. Cinq d'entre eux ont leur propre onglet interactif ci-dessous, chacun appliqué au même petit ensemble de nombres pour qu'un seul élément change à la fois. Les deux autres se manifestent autrement : la simplicité est en fait l'idée qui sous-tend les cinq onglets plutôt qu'une démonstration à part entière, et la correspondance — le risque de s'appuyer sur des couleurs comme le rouge et le vert pour signifier « mauvais » et « bon » — apparaît comme une mise en garde dans l'onglet Point focal plutôt que comme un onglet complet.
Ce qui attire l'œil en premier (recherche visuelle)
Certaines caractéristiques visuelles vous sautent aux yeux instantanément, avant même que vous ayez commencé à chercher consciemment — un point rouge parmi des points bleus, une ligne inclinée parmi des lignes droites. Les spécialistes de la vision appellent cela le traitement pré-attentif : votre système visuel repère certaines caractéristiques dans toute une scène en parallèle, en une fraction de seconde, avant que la moindre recherche délibérée, élément par élément, ne commence. L'indice, c'est le temps de réaction : une caractéristique vraiment pré-attentive reste à peu près aussi rapide à trouver, peu importe la taille de la grille. Mais combinez deux caractéristiques de façon qu'aucune seule ne distingue la cible, et ce raccourci disparaît — vous devez de nouveau vérifier les éléments un par un, et le temps de réaction se révèle de façon fiable plus élevé que celui d'une seule caractéristique. Toutes les combinaisons ne perdent pas ce raccourci de façon égale, non plus : certaines restent plus proches de la vitesse d'une seule caractéristique que d'autres, même si aucune ne le retrouve complètement.
Simplifiez le graphique (cognition attentive)
La cognition attentive est la dernière étape qui transforme un signal visuel brut en une information comprise — regarder activement, comparer et interpréter, plutôt que simplement remarquer. Deux éléments déterminent la qualité de ce processus : la clarté de la conception d'un graphique, et la façon dont l'esprit organise de nombreux éléments individuels en un petit nombre gérable. Les deux onglets ci-dessous explorent chacun l'un de ces aspects : corriger un graphique délibérément mal conçu, et trier un même ensemble d'éléments en groupes de votre choix pour observer cette seconde idée, le regroupement en blocs, à l'œuvre.
Apprentissage automatique et IA
Techniques d'apprentissage automatique en miniature
L'apprentissage automatique, en bref : on fournit à un système des données pour qu'il y apprenne une régularité, puis on applique ce qu'il a appris à de nouvelles données jamais vues pour prendre une décision. Les quatre petites démonstrations pratiques ci-dessous illustrent chacune un aspect de ce processus, ancrées dans un scénario d'infusion de thé ou de boutique de thé — pas un survol du domaine, seulement l'occasion de voir chaque technique fonctionner sur des données que vous pouvez observer et manipuler.
Analyse du panier d'achat (exploration de données)
L'exploration de données consiste à trouver des tendances déjà présentes dans les données que vous avez recueillies — pas, comme l'apprentissage automatique, à utiliser ces tendances pour prédire quelque chose sur un nouveau cas jamais vu, et pas, comme l'IA, à agir sur cette prédiction. L'analyse du panier d'achat en est un exemple classique : elle cherche simplement quels articles ont tendance à être achetés ensemble. Leaf and Kettle est une boutique de thé dont le système de caisse enregistre chaque commande comme une liste d'articles achetés ensemble — un « panier » — et dont le comptoir offre aussi un petit présentoir de crayons et de papier pour la clientèle étudiante, à côté du thé. Voici 100 commandes réalistes de Leaf and Kettle, où chaque panier de la grille sert aussi de graphique en pourcentage — choisissez deux articles et voyez à quelle fréquence ils apparaissent vraiment ensemble.
IA ou intelligence augmentée?
L'intelligence artificielle (IA) désigne généralement un système qui décide et agit entièrement seul; l'intelligence augmentée désigne un système qui assiste une personne, qui garde le dernier mot — le même modèle sous-jacent peut fonctionner des deux façons, et lequel des deux on construit dépend de la confiance qu'on lui accorde, pas de son intelligence. Une boutique de thé veut savoir : peut-on faire confiance à un simple programme informatique pour trier les arrivages en thé vert ou thé noir tout seul, ou une personne devrait-elle toujours vérifier? Le programme examine le temps d'infusion et la température de l'eau d'un nouvel échantillon, le compare à des tasses dont il connaît déjà la réponse, et propose une réponse, accompagnée d'un indice de confiance indiquant son degré de certitude. Les vrais systèmes (détection de la fraude, modération de contenu, vérification d'images médicales) utilisent exactement ce genre de seuil de confiance pour décider quand se fier au modèle et quand confier plutôt le cas à une personne.
Probabilités et simulation
Taux de base et le paradoxe du « test positif » (statistique bayésienne)
La statistique bayésienne consiste à réviser une croyance à la lumière d'une nouvelle information — en partant de la probabilité initiale d'une chose (son « taux de base ») et en la combinant avec la fiabilité réelle de cette information, plutôt que de se fier à l'information seule. Le piège classique est le résultat de test positif : même un test très fiable peut se tromper la plupart du temps en pratique si ce qu'il cherche à détecter est suffisamment rare au départ. Un fournisseur de thé reçoit de grands arrivages de thé, et une petite fraction de chaque arrivage s'avère contaminée — un problème de salubrité alimentaire qui doit être détecté avant l'expédition aux clients. Un test de contrôle de la qualité examine chaque lot, mais aucun test n'est parfait : il peut signaler correctement un lot contaminé, signaler à tort un lot propre, ou manquer une vraie contamination et déclarer le lot propre. Ce graphique simule un arrivage complet de 1 000 lots selon votre propre choix de la rareté de la contamination et de l'exactitude du test, et montre ce qui arrive réellement à chaque lot.
Théorie des jeux
La théorie des jeux étudie comment les gens prennent des décisions lorsque le résultat dépend de plus que leur propre choix — parfois parce que quelqu'un d'autre choisit aussi, et parfois parce que quelqu'un d'autre sait simplement quelque chose que vous ignorez. Deux énigmes classiques ci-dessous : un scénario de jeu télévisé où changer sa réponse est secrètement la meilleure stratégie, et un bras de fer sur les prix où le choix individuellement le plus sûr pour chaque camp laisse les deux perdants.
Pi avec des sachets de thé (méthode de Monte-Carlo)
Les méthodes de Monte-Carlo estiment une réponse en effectuant un grand nombre d'essais aléatoires et en observant le résultat global, plutôt qu'en résolvant le problème directement — utiles chaque fois qu'un calcul exact est trop complexe, ou qu'il n'existe tout simplement pas de formule nette pour ce qu'on cherche. Plus on effectue d'essais, plus l'estimation se rapproche généralement de la vraie valeur. Quelqu'un retire une boîte de sachets de thé d'une étagère dans l'arrière-boutique d'une boutique de thé, et la boîte glisse, éparpillant les sachets sur le sol. Le carreau en dessous a justement un cercle inscrit à l'intérieur de sa bordure carrée. Comme l'endroit où atterrit chaque sachet est, à toutes fins utiles, aléatoire, compter combien atterrissent à l'intérieur du cercle par rapport à l'extérieur constitue une véritable façon d'estimer le nombre pi — un cercle de rayon 0,5 s'inscrit exactement dans un carré de 1 × 1 et couvre pi/4 de sa surface, donc quatre fois la fraction des sachets atterrissant à l'intérieur donne une estimation de pi lui-même.
L'urne à thé (modélisation de processus)
La modélisation de processus est une façon de suivre comment quelque chose change au fil du temps — le même principe s'applique qu'il s'agisse d'eau dans un réservoir, d'argent dans un compte bancaire, d'énergie dans une batterie, ou de tasses de thé dans une urne. Chaque version se résume à deux choses : un stock (la quantité qu'on possède actuellement) et les flux qui l'alimentent ou le drainent. Elle est utile pour comprendre comment un processus se comporte dans le temps, pour planifier à l'avance quand on peut influencer certains leviers (comme le moment de réapprovisionner) mais pas d'autres (comme la demande), et pour voir comment un délai entre une décision et son effet peut faire dérailler même un plan raisonnable. Vous gérez le comptoir à thé d'un café achalandé. Une urne de 20 tasses doit rester approvisionnée pendant les heures d'ouverture, mais la demande de la clientèle suit un profil d'affluence approximatif qui n'est jamais tout à fait le même d'une journée à l'autre — certains matins plus occupés, certains dîners plus calmes, toujours avec une part d'imprévu.