Taux de base et le paradoxe du « test positif » (statistique bayésienne)

La statistique bayésienne consiste à réviser une croyance à la lumière d'une nouvelle information — en partant de la probabilité initiale d'une chose (son « taux de base ») et en la combinant avec la fiabilité réelle de cette information, plutôt que de se fier à l'information seule. Le piège classique est le résultat de test positif : même un test très fiable peut se tromper la plupart du temps en pratique si ce qu'il cherche à détecter est suffisamment rare au départ. Un fournisseur de thé reçoit de grands arrivages de thé, et une petite fraction de chaque arrivage s'avère contaminée — un problème de salubrité alimentaire qui doit être détecté avant l'expédition aux clients. Un test de contrôle de la qualité examine chaque lot, mais aucun test n'est parfait : il peut signaler correctement un lot contaminé, signaler à tort un lot propre, ou manquer une vraie contamination et déclarer le lot propre. Ce graphique simule un arrivage complet de 1 000 lots selon votre propre choix de la rareté de la contamination et de l'exactitude du test, et montre ce qui arrive réellement à chaque lot.

Réglez la rareté réelle de la contamination avec le curseur de prévalence, puis la capacité du test à détecter une vraie contamination (sensibilité) et à confirmer les lots vraiment propres (spécificité). Chaque petit carré ci-dessous représente un lot de l'arrivage, coloré selon la réalité du lot et le résultat du test. Observez la précision à mesure que vous abaissez la prévalence : même un test qui semble très fiable peut finir par crier au loup la plupart du temps une fois la contamination devenue assez rare.

Ce que cet outil enseigne : Faites varier la rareté d'une condition et la précision d'un test pour voir combien de résultats positifs sont réellement vrais. L'outil présente le théorème de Bayes, la négligence du taux de base et le paradoxe du test positif.

Lire l'article (en anglais)