Choisir son test statistique

Temps de lecture

1. Choisir son test

Ellistat présente les tests dans une matrice à deux entrées : la famille de tests en lignes, le type de comparaison en colonnes.

Les cinq familles, selon ce que vous comparez :

FamilleVous comparezQuestion typique
PositionsDes moyennesCes deux réglages donnent-ils la même cote moyenne ?
ÉchellesDes dispersionsCette machine est-elle plus régulière que l’autre ?
DistributionsDes formes de distribution entièresCes deux lots suivent-ils la même loi ?
RangsDes positions, sans hypothèse de loiMême question que Positions, mais sans supposer la normalité.
FréquencesDes proportionsLe taux de rebut a-t-il changé ?

Les types de comparaison, en colonnes :

  • À une valeur théorique : votre échantillon est-il conforme à une cible, une norme, une valeur historique ?
  • Entre deux échantillonsappairé ou indépendant ;
  • Entre plusieurs échantillonsappairé ou indépendant.

Faire un test est répondre à la question « Y a-t-il une différence entre ces situations » ou la question « Puis-je conclure à l’équivalence entre ces 2 situations »

Ces deux questions ne se répondent pas avec les mêmes tests c’est la raison pour laquelle lorsque la situation le permet vous aurez à sélectionner la question en cliquant sur le badge adapté.

2. Les tests proposés

2.1 Pour montrer une différence

FamilleValeur théorique2 échantillonsPlusieurs échantillons
PositionsZ théorique, T théoriqueTest z, Test t — Test t appairéANOVA — ANOVA appairée
ÉchellesTest Chi2Test F / Fligner-KilleenBartlett, Levene / Permutation MAD
Distributions(réalisé en statistiques descriptives)Cramér-von MisesEnergies
RangsTest des signes, Test de WilcoxonTest de Mann-Whitney, B to CKruskal-Wallis — Friedman appairé
FréquencesTest 1PTest 2PTest Chi2

Là où deux tests sont séparés par une barre, le premier est paramétrique et le second non paramétrique : Test F et Fligner-Killeen répondent à la même question, le second sans supposer la normalité.

💡 Z ou T ?  Le test Z suppose l’écart-type de la population connu, ce qui est rare en pratique. Le test T l’estime sur l’échantillon. Dans le doute, T.

2.2 Pour montrer une équivalence

FamilleValeur théorique2 échantillons
PositionsTOST Two one-sided tests TOST Two one-sided tests 
Échelles Scale equivalence Variance ratio 
FréquencesEquivalence to a target proportionWilson score Equivalence of two proportionsFarrington-Manning 

Ellistat choisit automatiquement les tests adaptés en fonction du type de donner que l’on veut comparer. Inutile de se souvenir de tous les tests, Ellistat vous donne le résultat complet des tests adaptés. Pour une variable continue il donne le test de différence en position, échelle, et dispersion ! On peut sélectionner une seule de ces catégories. 

3. Tests paramétriques vs non paramétrique

Les tests paramétriques supposent une loi, généralement la normale. Ils sont plus puissants quand cette hypothèse tient : à données égales, ils détectent des écarts plus faibles.

Les tests non paramétriques ne supposent rien sur la loi. Ils sont plus robustes mais un peu moins sensibles.

  • Distribution normale, pas de valeur aberrante : paramétrique ;
  • Loi douteuse, petit effectif, valeurs extrêmes : non paramétrique.

Le menu affiche les deux côte à côte précisément pour rendre ce choix explicite.

L’équivalence n’est disponible qu’en paramétrique : basculer sur cet objectif ramène le sélecteur au paramétrique. L’équivalent non paramétrique viendra dans une prochaine version.

4. Les conditions de validité, vérifiées pour vous

C’est un point fort du menu, et souvent mal exploité : Ellistat contrôle automatiquement les hypothèses du test choisi et affiche le verdict.

Les trois badges peuvent être :

  • Les conditions sont respectées
  • Les conditions sont respectées malgré un écart à l’idéal
  • Au moins une condition n’est pas respectée
ConditionCe qui est vérifié
Loi NormaleHypothèse de normalité acceptée ou refusée. Pour un test apparié, elle porte sur la différenceentre échantillons, pas sur chaque échantillon.
Équivalence des variancesHypothèse de variance égale acceptée ou refusée. Certains tests de moyenne y sont sensibles.
Valeurs aberrantesPrésence ou absence de valeurs atypiques, qui peuvent à elles seules créer ou masquer une différence.

Quand un test n’a pas de condition à vérifier, Ellistat l’indique : « Il n’y a pas d’hypothèse à vérifier pour ce test », c’est le cas des non paramétriques.

⚠️ Un test paramétrique dont les conditions sont refusées donne une p-value qui n’a pas la valeur annoncée. Le réflexe : basculer sur l’équivalent non paramétrique de la même ligne, ou traiter la cause, retirer une valeur aberrante justifiée, transformer les données.

💡 Ne jamais retirer une valeur aberrante seulement parce qu’elle gêne. Une valeur aberrante est une information : erreur de saisie, incident de production, pièce hors procédé. La comprendre vaut mieux que la supprimer.

5. Lire le résultat

Le résultat présente les hypothèses H0 et H1 formulées en clair pour votre cas, la statistique du test, la p-value, et la conclusion avec sa couleur : Rejet de H0 ou Non-rejet de H0.

Le graphique associé accompagne le test : boîtes à moustaches pour une comparaison de moyennes, barres pour des proportions.

💡 Toujours regarder graphique et p-value ensemble. Le graphique montre de combien et dans quel sens, la p-value dit si l’on peut y croire. L’un sans l’autre laisse la moitié de la conclusion de côté.

6. Montrer une équivalence

Un test classique cherche à démontrer une différence. Il ne sait pas démontrer l’inverse : ne pas trouver de différence n’est pas la même chose que prouver l’égalité. Or c’est souvent l’égalité qui vous intéresse : ce nouveau fournisseur vaut-il l’ancien, ce réglage plus rapide donne-t-il la même cote, ce moyen de mesure remplace-t-il le précédent ?

Le sélecteur Objectif bascule le test dans ce sens.

Un seul paramètre nouveau : δ

δ est la limite d’équivalence : l’écart en deçà duquel la différence ne vous intéresse pas. Sa valeur n’est pas statistique, elle est métier c’est vous qui décidez qu’un écart de deux centièmes ne change rien à la fonction de la pièce.

Il se saisit en unité de la caractéristique, en % de la moyenne, en multiple de l’écart-type, ou en % de l’intervalle de tolérance, la formulation la plus naturelle en industrie. Les autres expressions s’affichent en dessous.

⚠️ δ se fixe avant de regarder les données. Le choisir après avoir vu l’écart observé revient à décider de la conclusion, pas à la tester.

6.1 La lecture est visuelle

L’onglet Équivalence montre l’intervalle de confiance de l’écart face à la zone d’indifférence ±δ. L’équivalence est démontrée quand l’intervalle tient entièrement dans la zone. Aucune p-value n’est nécessaire pour le voir.

6.2 La matrice de décision

Les deux lectures : différence et équivalence se croisent en quatre cas :

⚠️ La case Indécis est celle que le test de différence seul masque. Sans elle, « non significatif » se lit « égal » et c’est faux.

6.3 Combien de pièces ?

Deux informations remplacent le calcul de puissance préalable :

  • le plus petit δ démontrable avec vos effectifs actuels ;
  • le nombre de pièces qu’il faudrait pour tenir le δ que vous avez fixé.

6.4 Trois questions au lieu d’une

La ligne d’hypothèse alternative garde son rôle et se relibelle :

BadgeQuestion
Non-infériorité : A n’est pas significativement pire que B
Équivalence : A et B ne diffèrent pas de plus de δ
Non-supériorité : A n’est pas significativement meilleur que B

6.5 Sur quoi porte l’équivalence ?

Positions : moyennes, à une cible ou entre deux échantillons, appariés ou non ;

Échelles : rapport de variances. La limite est ici un **rapport R > 1**, la zone d’indifférence vaut `[1/R ; R]`, et le graphique passe en échelle logarithmique ;

Fréquences : différence de deux proportions ou 1 proportion vs objectif, en points de pourcentage.

⚠️ Démontrer une équivalence de variances demande des effectifs nettement plus élevés que sur les moyennes, souvent plusieurs centaines de pièces là où quelques dizaines suffisent pour les moyennes. Le chiffre exact est affiché.

7. Plusieurs échantillons

Une ANOVA ou un Kruskal-Wallis significatif répond « ces groupes ne sont pas tous égaux ». Il ne dit pas lequel est diffèrent.

Ellistat fournit pour cela une conclusion par paires, qui compare les groupes deux à deux.

⚠️ Comparer tous les couples multiplie les tests, donc les fausses alarmes : avec dix groupes, on fait quarante-cinq comparaisons, et à 5 % de risque chacune, on trouve en moyenne deux différences fictives. C’est pourquoi il faut passer par la comparaison par paires fournie, plutôt que d’enchaîner des tests t à la main.

8. Le piège de l’appariement

Des données sont appariées quand les deux séries portent sur les mêmes individus : la même pièce avant et après traitement, le même opérateur sur deux méthodes, la même pièce mesurée par deux instruments.

Le test apparié élimine la variabilité entre individus et devient bien plus puissant.

⚠️ Traiter des données appariées comme indépendantes est l’erreur la plus fréquente et la plus coûteuse : la variabilité entre pièces noie l’effet cherché, et l’on conclut « pas de différence » alors qu’elle est nette. L’inverse, déclarer appariées des séries qui ne le sont pas, fabrique des différences.

💡 Le test vous le rappelle indirectement : pour un test apparié, la normalité est vérifiée sur la différence. Si Ellistat parle de la différence entre échantillons, c’est que vous êtes bien en apparié.

9. Analyse de variance en cas de plusieurs X sélectionnés et Y quantitatif

Lorsque plusieurs X sont sélectionnés et que le Y est quantitatif, la question change de nature : il ne s’agit plus de comparer deux groupes, mais de savoir lesquels des facteurs retenus font varier le Y. Ellistat réalise alors une analyse de la variance sur l’ensemble des X.

Le principe est de décomposer la variabilité observée sur le Y : une part attribuable à chaque facteur, et une part résiduelle que le modèle n’explique pas.

Ce que donne la page :

  • Un tableau d’analyse de la variance, une ligne par facteur : degrés de liberté, somme des carrés, carré moyen, statistique F et p-value. Un facteur est déclaré influent lorsque sa p-value passe sous le risque alpha retenu.
  • La part de variabilité expliquée par chaque facteur, qui hiérarchise les X entre eux, et la part résiduelle : ce que les facteurs sélectionnés ne suffisent pas à expliquer.
  • Les graphiques associés : moyennes par modalité, boîtes à moustaches qui donnent le sens et l’amplitude de l’effet, là où la p-value ne dit que son existence.
  • Pour un facteur influent à plus de deux modalités, la comparaison par paires du §3.7 précise lesquelles diffèrent réellement.

💡 Analyser les X ensemble n’est pas équivalent à enchaîner un test par facteur. Chaque effet est ici évalué en présence des autres : on évite l’accumulation des risques de fausse alarme, et l’on distingue un facteur réellement influent d’un facteur qui ne l’était qu’en raison de sa liaison avec un autre.

💡 Lire p-value et part expliquée ensemble. Sur de gros effectifs, un facteur peut être très significatif tout en n’expliquant que quelques pourcents de la variabilité : l’effet est réel, mais l’action industrielle est ailleurs.

⚠️ Les conditions de validité du paragraphe 4 s’appliquent aussi ici, et elles portent sur les résidus du modèle : normalité, homogénéité des variances entre modalités, absence de valeur aberrante. Un facteur peut devenir significatif à cause d’un seul point atypique.

⚠️ L’analyse de la variance établit une liaison, pas une cause : elle indique quels facteurs accompagnent la variation du Y, dans le domaine effectivement couvert par vos données. Pour quantifier les effets et leurs interactions, il faut un plan d’expériences.

Le tableau des conditions de validité :

On peut sélectionner de ne prendre que les effets principaux ou avec les interactions. Et également la méthode de calcul Paramétrique ou Non paramétrique. La méthode paramétrique est classique mais nécessite une hypothèse de normalité, la méthode non paramétrique n’a pas besoin de cette hypothèse, elle travaille par échange. C’est une méthode chronophage. Elle ne s’applique que pour les tableaux de moins de 1000 lignes. Les résultats entre les 2 méthodes sont très proches sauf écart de normalité auquel cas il est préférable de prendre l’approche non paramétrique.

La roue dentée permet de sélectionner les paramètres : Le plus petit écart intéressant pour commencer à le considérer comme un écart sur le Y étudié. Il sera utilisé dans la matrice de décision ci-après. Le nombre de permutation qui influence la plus petite variation sur la p value. Et la graine aléatoire, Elle est figée ce qui permet de retrouver toujours les mêmes résultats sur un poste de travail.

La matrice de décision résume la situation de tous les facteurs étudiés en fonction de leur niveau de signification et de leur importance vis-à-vis de delta

⚠️ Attention dans le cas de structure hiérarchique plutôt que d’étudier des interaction il est préférable d’utiliser l’Analyse de la variance généralisée qui est dans le menu « Sources de variations »