P-value et intervalle de confiance : arrête de paniquer, ça se comprend
Les stats font flipper la moitié des étudiants en médecine. Normal — on vous balance des formules, des tests, des p<0.05 sans jamais vous expliquer ce que ça veut dire concrètement. Pourtant, la p-value et l'intervalle de confiance sont deux concepts que tu utilises déjà intuitivement dans la vie de tous les jours. Laisse-moi te montrer.
La p-value : "est-ce que c'est du hasard ?"
Imagine : tu lances une pièce de monnaie 10 fois. Tu obtiens 9 fois face. Tu te dis "c'est bizarre, cette pièce est peut-être truquée". La p-value, c'est exactement ça : la probabilité d'observer un résultat aussi extrême (ou plus) SI le hasard seul était en jeu.
En langage stats : la p-value est la probabilité d'obtenir le résultat observé (ou plus extrême) sous l'hypothèse nulle H0 (= "il ne se passe rien", "le traitement ne fait rien", "la pièce est équilibrée").
Exemples concrets :
- p = 0.03 → "Il y a 3% de chances d'observer ce résultat si le traitement ne faisait vraiment rien." C'est peu, donc on doute sérieusement de H0. On conclut que le traitement a probablement un effet.
- p = 0.45 → "Il y a 45% de chances que ce résultat soit dû au hasard." Pas du tout convainquant. On ne peut rien conclure.
- p = 0.001 → "0.1% de chances que ce soit le hasard." Très convainquant.
Le seuil p < 0.05 : une convention, pas une vérité
Le seuil de 5% est une convention statistique (merci Ronald Fisher, 1925). Ce n'est pas un seuil magique. Un résultat avec p = 0.049 n'est pas fondamentalement différent d'un résultat avec p = 0.051. Pourtant, le premier est "significatif" et le second ne l'est pas. Garde ça en tête — le seuil est arbitraire.
Ce que p < 0.05 ne veut PAS dire
- ❌ "Il y a 95% de chances que le traitement marche" — c'est l'erreur la plus fréquente. La p-value ne dit RIEN sur la probabilité que le traitement soit efficace. Elle dit seulement que le résultat serait rare si H0 était vraie.
- ❌ "L'effet est important / cliniquement pertinent" — un p minuscule (0.001) peut correspondre à un effet minuscule si l'échantillon est énorme. Avec 100 000 patients, même une différence de 0.1 point de tension peut être "significative" sans être utile.
- ❌ "L'étude prouve que le traitement est efficace" — une seule étude ne "prouve" rien. Elle fournit une pièce du puzzle.
- ✅ Ce que ça dit vraiment : "Ce résultat serait rare sous H0. Soit H0 est fausse (le traitement marche), soit on a eu un coup de chance statistique."
L'intervalle de confiance : "à quel point c'est précis ?"
La p-value te dit SI c'est significatif. L'IC te dit COMBIEN c'est précis et quelle est l'amplitude de l'effet. C'est l'information la plus utile cliniquement.
Exemple : RR = 1.5 [IC 95% : 1.1 – 2.3]
Traduction : "On estime que le risque est multiplié par 1.5 dans le groupe exposé. Et on est raisonnablement sûrs (95% de confiance) que la vraie valeur se situe quelque part entre 1.1 et 2.3."
Les 3 choses à regarder dans un IC
- L'IC croise-t-il la valeur nulle ?
- Pour un RR ou OR : la valeur nulle est 1 (pas d'effet)
- Pour une différence de moyennes : la valeur nulle est 0
- Si l'IC croise cette valeur → résultat non significatif (équivalent à p ≥ 0.05)
- L'IC est-il large ou étroit ?
- Large = peu de précision = petit échantillon ou grande variabilité
- Étroit = bonne précision = grand échantillon, résultat fiable
- L'IC est-il cliniquement pertinent ?
- RR = 1.02 [IC : 1.001 – 1.04] → "significatif" (l'IC ne croise pas 1) mais cliniquement inutile (un risque multiplié par 1.02, personne ne change de pratique pour ça)
- C'est LA distinction que les correcteurs EDN attendent : significativité statistique ≠ pertinence clinique
P-value et IC : comment ils se complètent
La p-value te donne un "oui/non" binaire (significatif ou pas). L'IC te donne la nuance : quelle est la fourchette plausible de l'effet et est-ce que cette fourchette a un intérêt clinique.
Un résultat peut être :
- Significatif ET cliniquement pertinent — RR = 2.5 [1.8–3.5], p < 0.001 → le traitement double le risque, c'est clair et important
- Significatif mais PAS pertinent — RR = 1.02 [1.01–1.03], p = 0.01 → statistiquement "vrai" mais inutile en pratique
- Non significatif mais potentiellement pertinent — RR = 2.0 [0.8–5.0], p = 0.12 → l'IC est large (petit échantillon), on ne peut pas conclure mais l'effet pourrait être important → besoin d'une étude plus grande
L'erreur classique aux EDN
On te montre un résultat avec p = 0.04 et un IC [1.01 – 1.03]. La question : "Ce résultat est-il cliniquement pertinent ?". La réponse est NON — même si p < 0.05. L'effet est trop faible pour justifier un changement de pratique médicale. Les correcteurs vérifient que tu fais cette distinction.
Autre piège : un résultat avec p = 0.08 et IC [0.95 – 2.8]. "L'absence de significativité signifie-t-elle l'absence d'effet ?" NON — l'IC est large (manque de puissance), l'effet pourrait exister mais l'étude n'avait pas assez de patients pour le montrer.
S'entraîner
Les QCM LCA annales gratuites contiennent de nombreuses questions sur l'interprétation de la p-value et des IC — c'est systématiquement interrogé depuis 2019. La plateforme LCA propose des exercices dédiés dans le Thème 2 (Analyse statistique).
🧪 Lab : Simule la p-value (lance la pièce)
🎲 Simulateur de p-value
Hypothèse nulle : la pièce est équilibrée (50/50). Clique pour lancer et observe quand le résultat devient "statistiquement significatif".
Lancers : 0 | Faces : 0 | Proportion : —
p-value : —
L'intervalle de confiance : "à quel point c'est précis ?"
RR = 1.5 [IC 95% : 1.1 – 2.3] → le risque est multiplié par 1.5, la vraie valeur est probablement entre 1.1 et 2.3.
Ce qu'il faut regarder
- L'IC croise-t-il 1 (RR/OR) ou 0 (différence) ? → si oui, pas significatif
- Large ou étroit ? → large = peu précis
- Cliniquement pertinent ? → RR 1.02 [1.001–1.04] = significatif mais inutile
🧪 Lab : Visualise l'intervalle de confiance
📊 Simulateur d'IC
Vraie proportion = 0.60. Change la taille de l'échantillon et observe comment l'IC se rétrécit.
Erreur classique EDN
Confondre significativité statistique et pertinence clinique. Le correcteur attend cette distinction.