1. Elegir la prueba
Ellistat presenta las pruebas en una matriz de dos entradas : la familia de pruebas en filas, el tipo de comparación en columnas.
Las cinco familias, dependiendo de lo que se compare:
| Familia | ¿Estás comparando? | Pregunta típica |
| Puestos | Medias | ¿Estos dos ajustes dan el mismo valor medio? |
| Escaleras | Dispersiones | ¿Es esta máquina más regular que la otra? |
| Repartos | Formas de distribución completas | ¿Se rigen estas dos series por la misma ley? |
| Clasificación | Puntos de vista, sin hipótesis legislativas | La misma pregunta que en «Posiciones», pero sin dar por sentada la normalidad. |
| Frecuencias | Proporciones | ¿Ha cambiado la tasa de rechazo? |
Los tipos de comparación, en columnas:
- A un valor teórico : ¿Se ajusta su muestra a un valor de referencia, una norma o un valor histórico?
- Entre dos muestras, emparejado o independiente ;
- Entre varias muestras, emparejado o independiente.

Hacer una prueba es responder a la pregunta «¿Hay alguna diferencia entre estas situaciones?» o a la pregunta «¿Puedo concluir que estas dos situaciones son equivalentes?».»
Estas dos preguntas no se responden con las mismas pruebas; por eso, cuando la situación lo permita, deberás seleccionar la pregunta haciendo clic en la insignia correspondiente.

2. Las pruebas propuestas
2.1 Para mostrar una diferencia
| Familia | Valor teórico | 2 muestras | Varias muestras |
| Puestos | Z teórica, T teórica | Prueba z, prueba t — Prueba t pareada | ANOVA — ANOVA por pares |
| Escaleras | Prueba de chi-cuadrado | Prueba F / Fligner-Killeen | Bartlett, Levene / Permutación MAD |
| Repartos | (elaborado con estadísticas descriptivas) | Cramér-von Mises | Energías |
| Clasificación | Prueba de los signos, prueba de Wilcoxon | Prueba de Mann-Whitney, de B a C | Kruskal-Wallis — Friedman emparejado |
| Frecuencias | Prueba 1P | Prueba 2P | Prueba de chi-cuadrado |
Cuando dos pruebas están separadas por una barra, la primera es paramétrico y el segundo no paramétrico : La prueba F y la de Fligner-Killeen responden a la misma pregunta, aunque la segunda no supone la normalidad.
💡 ¿Z o T? La prueba Z supone que se conoce la desviación típica de la población, lo cual es poco habitual en la práctica. La prueba T la estima a partir de la muestra. En caso de duda, se utiliza la prueba T.
2.2 Para demostrar una equivalencia
| Familia | Valor teórico | 2 muestras |
| Puestos | TOST Dos pruebas unilaterales | TOST Dos pruebas unilaterales |
| Escaleras | Equivalencia de escalas Ratio de varianza | |
| Frecuencias | Equivalencia con una proporción objetivoÍndice de Wilson | Equivalencia de dos proporcionesFarrington-Manning |
Ellistat selecciona automáticamente las pruebas adecuadas en función del tipo de dato que se quiera comparar. No hace falta recordar todas las pruebas, ya que Ellistat te ofrece el resultado completo de las pruebas adecuadas. Para una variable continua, ofrece la prueba de diferencia en posición, escala y dispersión. Se puede seleccionar una sola de estas categorías.

3. Pruebas paramétricas frente a no paramétricas

Las pruebas paramétricas suponen una distribución, normalmente la normal. Son más potentes cuando esta hipótesis es válida: con los mismos datos, detectan desviaciones más pequeñas.
Las pruebas no paramétricas no hacen ninguna suposición sobre la distribución. Son más resistentes pero un poco menos sensibles.
- Distribución normal, sin valores atípicos: paramétrico ;
- Una ley cuestionable, una plantilla reducida, valores extremos: no paramétrico.
El menú muestra ambas opciones una al lado de la otra precisamente para que esta elección quede clara.
La equivalencia solo está disponible en paramétrico : al cambiar a este objetivo, el selector vuelve al modo paramétrico. El modo no paramétrico estará disponible en una próxima versión.
4. Las condiciones de validez, comprobadas para ti
Es uno de los puntos fuertes del menú, y a menudo no se aprovecha bien: Ellistat comprueba automáticamente las hipótesis de la prueba seleccionada y muestra el veredicto.
Las tres insignias pueden ser:
- Se cumplen las condiciones

- Se cumplen las condiciones, a pesar de que no se alcanza el nivel ideal

- No se cumple al menos una condición

| Condición | Lo que se comprueba |
| Ley de la Normalidad | Hipótesis de normalidad aceptada o rechazada. En el caso de una prueba pareada, se refiere a la diferenciaentre muestras, no en cada muestra. |
| Equivalencia de varianzas | Se acepta o se rechaza la hipótesis de varianza igual. Algunas pruebas de media son sensibles a ello. |
| Valores atípicos | Presencia o ausencia de valores atípicos, que por sí solos pueden generar u ocultar una diferencia. |
Cuando una prueba no tiene ninguna condición que verificar, Ellistat lo indica: «No hay ninguna hipótesis que verificar para esta prueba»; este es el caso de las pruebas no paramétricas.
⚠️ Una prueba paramétrica cuyas condiciones no se cumplen da un valor p que no tiene el valor anunciado. La reacción instintiva: pasar al equivalente no paramétrico de la misma línea, o bien abordar la causa, eliminar un valor atípico justificado o transformar los datos.
💡 Nunca elimines un valor atípico solo porque te resulte molesto. Un valor atípico es un información : error de introducción de datos, incidencia en la producción, pieza fuera de proceso. Es mejor entenderla que eliminarla.
5. Leer el resultado
El resultado muestra los hipótesis Las hipótesis H0 y H1 formuladas de forma clara para tu caso, la estadística de la prueba, la valor p, y la conclusión junto con su resultado: rechazo de la hipótesis nula (H0) o no rechazo de la hipótesis nula (H0).
El gráfico correspondiente acompaña a la prueba: diagramas de boxplot para la comparación de medias y histogramas para las proporciones.
💡 Hay que fijarse siempre en el gráfico y en el valor p a la vez. El gráfico muestra ¿cuánto? y ¿en qué sentido?, el valor p indica si es que se puede creer en ello. Uno sin el otro deja de lado la mitad de la conclusión.
6. Demostrar una equivalencia
Una prueba clásica tiene como objetivo demostrar una diferencia. No sabe demostrar lo contrario: no encontrar diferencias no es lo mismo que demostrar la igualdad. Sin embargo, a menudo es la igualdad lo que le interesa: ¿es este nuevo proveedor tan bueno como el anterior?, ¿este ajuste más rápido ofrece el mismo resultado?, ¿este método de medición sustituye al anterior?
El selector Objetivo decide la prueba en ese sentido.

Solo hay un parámetro nuevo: δ
δ es la límite de equivalencia : la tolerancia por debajo de la cual la diferencia no te interesa. Su valor no es estadístico, sino técnico; eres tú quien decide que una tolerancia de dos centésimas no afecta al funcionamiento de la pieza.

Se introduce como unidad la característica, como % de la media, como múltiplo de la desviación típica o como % del intervalo de tolerancia, que es la forma más habitual de expresarlo en la industria. Las demás expresiones aparecen debajo.
⚠️ Se establece el valor de δ antes de analizar los datos. Elegirlo tras haber observado la diferencia equivale a decidir la conclusión, no a comprobarla.
6.1 La lectura es una actividad visual

La pestaña Equivalencia muestra el intervalo de confianza de la diferencia con respecto a la zona de indiferencia ±δ. La equivalencia queda demostrada cuando el intervalo cumple por completo en la zona. No hace falta ningún valor p para darse cuenta de ello.
6.2 La matriz de decisión
Las dos interpretaciones —diferencia y equivalencia— se solapan en cuatro casos:

⚠️ La casilla Indeciso es la que la prueba de diferencias por sí sola oculta. Sin ella, «no significativo» se interpreta como «igual», y eso es falso.
6.3 ¿Cuántas piezas?

Hay dos datos que sustituyen al cálculo previo de la potencia:
- el el δ más pequeño demostrable con vuestra plantilla actual; ;
- el número de piezas lo que haría falta para mantener el δ que habéis fijado.
6.4 Tres preguntas en lugar de una
La línea de hipótesis alternativa mantiene su función y vuelve a etiquetarse como:

| Insignia | Pregunta |
| No inferioridad : A no es significativamente peor que B | |
| Equivalencia : A y B no difieren en más de δ | |
| No superioridad : A no es significativamente mejor que B |
6.5 ¿En qué consiste la equivalencia?
Puestos : medias, de una muestra o entre dos muestras, emparejadas o no; ;
Escaleras : relación de varianzas. El límite aquí es una **relación R > 1**, la zona de indiferencia es `[1/R ; R]`, y el gráfico se representa en escala logarítmica; ;
Frecuencias : diferencia entre dos proporciones o entre una proporción y el objetivo, expresada en puntos porcentuales.
⚠️ Demostrar la equivalencia de desviaciones requiere un volumen de producción considerablemente mayor que el de los lotes medios; a menudo, varios cientos de unidades, mientras que para los lotes medios bastan unas pocas decenas. La cifra exacta aparece indicada.
7. Varias muestras
Un ANOVA o una prueba de Kruskal-Wallis significativos indican que «no todos estos grupos son iguales». No dicen ¿cuál no? es diferente.
Para ello, Ellistat ofrece una conclusión por parejas, que compara los grupos de dos en dos.

⚠️ Comparar todos los pares multiplica el número de pruebas y, por lo tanto, las falsas alarmas: con diez grupos, se realizan cuarenta y cinco comparaciones y, con un riesgo de 5 % en cada una, se encuentran de media dos diferencias ficticias. Por eso es necesario utilizar la comparación por pares que se proporciona, en lugar de realizar pruebas t de forma manual una tras otra.
8. La trampa del emparejamiento
Hay datos que emparejadas cuando ambas series tratan sobre los las mismas personas : la misma pieza antes y después del tratamiento, el mismo operador con dos métodos diferentes, la misma pieza medida con dos instrumentos.
La prueba por pares elimina la variabilidad entre individuos y resulta mucho más eficaz.
⚠️ Tratar los datos emparejados como si fueran independientes es el error más frecuente y más costoso: la variabilidad entre las muestras enmascara el efecto buscado, y se llega a la conclusión de que «no hay diferencias», cuando en realidad son evidentes. Por el contrario, declarar como emparejadas series que no lo son genera diferencias.
💡 La prueba te lo recuerda de forma indirecta: en una prueba de pares, se comprueba la normalidad sobre la diferencia. Si Ellistat habla de la diferencia entre muestras, es que sí que estáis emparejados.
9. Análisis de varianza cuando hay varias variables X seleccionadas y una variable Y cuantitativa
Cuando se seleccionan varias variables X y la variable Y es cuantitativa, la naturaleza de la pregunta cambia: ya no se trata de comparar dos grupos, sino de determinar cuáles de los factores seleccionados influyen en la variable Y. En ese caso, Ellistat realiza un análisis de varianza sobre el conjunto de las variables X.
El principio consiste en desglosar la variabilidad observada en la variable Y: una parte atribuible a cada factor y una parte residual que el modelo no explica.

Esto es lo que muestra la página:
- Una tabla de análisis de varianza, con una fila por factor: grados de libertad, suma de cuadrados, cuadrado medio, estadística F y valor p. Se considera que un factor es significativo cuando su valor p es inferior al nivel de significación (alfa) establecido.
- La proporción de variabilidad explicada por cada factor, que establece un orden jerárquico entre las variables X, y la proporción residual: lo que los factores seleccionados no logran explicar por sí solos.
- Los gráficos correspondientes: medias por modalidad, diagramas de caja y bigotes que muestran la dirección y la magnitud del efecto, mientras que el valor p solo indica su existencia.
- En el caso de un factor influyente en más de dos modalidades, la comparación por pares del apartado 3.7 especifica cuáles difieren realmente.
💡 Analizar los X en conjunto no equivale a realizar una prueba factor por factor. Aquí se evalúa cada efecto en presencia de los demás: así se evita la acumulación de riesgos de falsas alarmas y se distingue un factor que influye realmente de uno que solo lo hacía debido a su relación con otro.
💡 Analiza conjuntamente el valor p y la proporción explicada. En muestras de gran tamaño, un factor puede ser muy significativo aunque solo explique un pequeño porcentaje de la variabilidad: el efecto es real, pero la acción industrial se encuentra en otro lugar.
⚠️ Las condiciones de validez del apartado 4 también se aplican aquí, y se refieren a los residuos del modelo: normalidad, homogeneidad de las varianzas entre modalidades y ausencia de valores atípicos. Un factor puede llegar a ser significativo debido a un solo punto atípico.
⚠️ El análisis de varianza establece una relación, no una causa: indica qué factores acompañan a la variación de Y, dentro del ámbito que realmente abarcan tus datos. Para cuantificar los efectos y sus interacciones, se necesita un diseño experimental.
Tabla de condiciones de validez:


Se puede elegir que solo se incluyan los efectos principales o con los interacciones. Y también el método de cálculo Paramétrico o No paramétrico. El método paramétrico es clásico, pero requiere la hipótesis de normalidad; el método no paramétrico no necesita esta hipótesis, ya que se basa en el intercambio. Es un método que requiere mucho tiempo. Solo se aplica a tablas de menos de 1.000 filas. Los resultados de ambos métodos son muy similares, salvo en caso de desviación de la normalidad, en cuyo caso es preferible optar por el enfoque no paramétrico.

La rueda dentada permite seleccionar los parámetros: la desviación mínima relevante para empezar a considerarla como una desviación en la variable Y estudiada. Se utilizará en la matriz de decisión que se muestra a continuación. El número de permutaciones que influye en la variación mínima del valor p. Y la semilla aleatoria: está fijada, lo que permite obtener siempre los mismos resultados en un puesto de trabajo.
La matriz de decisión resume la situación de todos los factores analizados en función de su nivel de significación y de su importancia con respecto a delta

⚠️ Atención: en el caso de una estructura jerárquica, en lugar de analizar las interacciones, es preferible utilizar el análisis de varianza generalizado, que se encuentra en el menú «Fuentes de variación».»
