Imputation des données manquantes

En pratique, il arrive constamment que des données manquent — un capteur tombe hors ligne, un champ de formulaire est oublié, une section de sondage n'atteint jamais une partie de l'échantillon, un enregistrement est supprimé par accident. La solution idéale est souvent de recueillir plus de données, mais ce n'est pas toujours possible : si le thermomètre d'une station météo tombe hors ligne pendant un après-midi, il n'y a aucun moyen de remesurer après coup la température de cet après-midi-là. L'imputation est une façon de combler une telle lacune — plutôt que d'écarter les bonnes données environnantes ou de laisser un trou, on remplace les valeurs absentes par une estimation plausible, fondée sur la tendance du reste des données. Ce graphique le démontre avec un nuage de points représentant le temps d'infusion du thé (en minutes) et son intensité (1 à 10) — la relation réelle est à peu près linéaire, puis s'incurve à mesure que l'intensité approche son maximum. Choisissez la plage de temps où les données manquent, puis explorez différentes façons de combler la lacune.

Faites glisser directement l'un ou l'autre bord de la bande ombrée (ou utilisez les deux curseurs ci-dessous) pour choisir la plage de temps manquante — la bande n'apparaît qu'une fois que vous choisissez une méthode autre que « Données originales », puisque rien n'y manque encore — puis passez d'une méthode à l'autre pour voir comment chacune comble les valeurs manquantes, et comparez les points imputés (losanges) aux valeurs réelles (cercles vides) qu'ils remplacent.

Ce que cet outil enseigne : Retirez une plage de points d'une série chronologique, comblez le vide avec différentes méthodes d'imputation, puis comparez chaque résultat aux valeurs réelles. L'outil montre comment le choix d'une méthode d'imputation peut fausser une tendance ou sous-estimer la variabilité.

Lire l'article (en anglais)