Dos métodos que se supone que miden lo mismo rara vez dan exactamente el mismo resultado. La cuestión no es si difieren —siempre difieren—, sino si la diferencia es lo suficientemente pequeña como para que podamos utilizarlos indistintamente: sustituir un instrumento por otro, aceptar el resultado de un laboratorio externo, comparar una medición de recepción con una medición de control.

Este estudio no se reduce ni a un R&R ni a una prueba de medias. Una prueba de comparación de medias busca demostrar una diferencia; en este caso ocurre lo contrario: hay que demostrar una equivalencia, y una prueba no significativa no basta para sacar conclusiones. Por lo tanto, la pantalla responde a cinco preguntas distintas, ya que dos medias pueden diferir de cinco maneras diferentes.
1. Lo que hay que entender
El apartado «Información» reúne todo lo que define el estudio:
- el nombre del estudio, la unidad y las tolerancias mínima y máxima de la característica, que son opcionales, pero cuya ausencia priva al estudio de la verificación más concreta: la de la coherencia de las decisiones de conformidad; ;
- d) el límite de equivalencia: el margen por debajo del cual la diferencia entre las dos medias no tiene consecuencias prácticas. Es el parámetro decisivo del estudio; ;
- el método de definición de δ: en valor absoluto, o en relación con la tolerancia o con la magnitud medida; ;
- los nombres de los dos medios (A y B) y la indicación de cuál de ellos sirve de referencia, ya que la desviación siempre se calcula con respecto a este; ;
- el número de piezas y el número de repeticiones de cada medio; ;
- La casilla «Los ensayos incluyen el montaje de la obra»: márcala si, entre dos ensayos, se desmonta y se vuelve a montar la obra.
⚠️ δ se establece antes de analizar los datos. Elegirlo tras haber visto la desviación observada equivale a decidir la conclusión en lugar de constatarla. Se trata de una decisión profesional: ¿a partir de qué desviación entre las dos medias cambiaría tu decisión?
💡 La casilla de repeticiones no es un mero detalle administrativo. Realizar dos mediciones consecutivas sin desmontar la pieza solo mide la repetibilidad de la lectura, no la del montaje: en ese caso, se subestima la repetibilidad, los límites de aceptación son demasiado estrechos y se corre el riesgo de concluir que existe una concordancia que en realidad no existe. La pantalla muestra esta advertencia automáticamente cuando la casilla no está marcada.
2. Pestaña «Medidas»
Dos tablas una al lado de la otra, una por medio, una línea por pieza y una columna por repetición. El medio de referencia se indica mediante una etiqueta. La regla de introducción de datos es la única restricción estricta: una misma línea debe referirse a la misma pieza en ambas tablas; de lo contrario, la desviación calculada no tiene sentido.
Los datos se pegan directamente desde Excel; se reconocen las tabulaciones y los saltos de línea, se acepta el punto decimal y se admiten las celdas vacías.
3. Pestaña «Resultados»: las cinco preguntas
La tabla de diagnóstico plantea las cinco preguntas que hay que responder sí para indicar dos opciones intercambiables. Cada una recibe un indicador, un dato numérico con su intervalo de confianza y una respuesta: sí, no o indeciso.
| Pregunta | Indicador | Lo que detecta |
| ¿Dan ambas medias el mismo valor, salvo por el δ? | TOST sobre la desviación media, IC 90, % | Un sesgo sistemático entre ambos métodos. |
| ¿Es la desviación independiente del nivel medido? | Pente de Deming, IC 95 % | Una diferencia que se acentúa en los extremos inferiores o superiores del rango: los valores medios coinciden en el centro y se separan en los extremos. |
| 95 %: ¿se encuentran las piezas dentro de ±δ? | Límites de aceptación frente a ±δ | Una equivalencia que es cierta en promedio, pero falsa si se analiza pieza por pieza. |
| ¿Tienen ambos métodos una repetibilidad comparable? | Informe de variaciones, IC del 95 % % | Un medio mucho más disperso que el otro. |
| ¿Se ha mantenido estable la diferencia durante la campaña? | Tendencia en el orden de entrada, IC 95 % | Una desviación de uno de los dos medios a lo largo de las mediciones. |
💡 «Indeciso» no es lo mismo. Es la respuesta más frecuente en una campaña corta, y significa que los datos no son suficientes para tomar una decisión. La pantalla no se limita a indicarlo: también indica cuántas unidades habría que añadir para tener un 80 % de probabilidades de cerrar la venta; en el ejemplo, 416 unidades más, es decir, 433 en total. Se trata de una información sobre el dimensionamiento que conviene conocer antes de lanzar la campaña, más que después.
4. Los indicadores cuantitativos
Debajo de los diagnósticos, una fila de iconos muestra los valores que hay que tener en cuenta:
- el sesgo medio y, sobre todo, su porcentaje de δ, en el ejemplo 6,029 l/min, es decir, 60 % del límite de equivalencia: la desviación no es insalvable, pero ya consume dos tercios del presupuesto; ;
- el intervalo de confianza al 90 % % de la diferencia, que debe compararse con la banda ±δ: la equivalencia queda demostrada cuando el intervalo se encuentra íntegramente dentro de la banda; ;
- la pendiente de Deming y su intervalo de confianza. La regresión de Deming, a diferencia de la regresión clásica, admite que ambas medias contienen un error; este es el caso aquí, ya que ninguna de las dos es un valor real; ;
- el sesgo estimado en el extremo inferior y superior del rango. Dos cifras con signos opuestos indican un punto de inflexión: las medias se cruzan en el centro del rango; ;
- el número de piezas fuera del intervalo ±δ: 12 de 17 en el ejemplo, lo cual es el verdadero mensaje de este estudio.
5. La repetibilidad de ambos métodos
En un apartado aparte se indica, para cada uno de los dos métodos, su repetibilidad s_r, la parte del intervalo de tolerancia que ocupa cuando se especifican las tolerancias, y el número medio de repeticiones utilizadas. Se indica la relación λ entre ambas dispersiones, junto con su origen: estimada a partir de las repeticiones o impuesta.
Este bloque suele explicar el resto de la pantalla. Dos métodos cuya repetibilidad difiere notablemente no pueden considerarse intercambiables, aunque sus medias coincidan: el que presente una mayor dispersión dará lugar a juicios de conformidad diferentes sobre las mismas piezas.
6. El diagnóstico en pocas palabras
En la parte inferior de la pestaña, cada criterio no cumplido o sin resolver cuenta con un párrafo en el que se explica qué ocurre y qué hay que hacer. Esta es la parte que hay que leer en primer lugar: traduce los intervalos de confianza en decisiones.
- Las advertencias se refieren al protocolo: ensayos en los que no se reproduce el montaje, falta de tolerancias, número insuficiente de participantes. Invalidan parcialmente las conclusiones y deben abordarse antes de llegar a una conclusión.
- Los diagnósticos se centran en el resultado: sesgo demostrado, límites de aceptación más amplios que δ, desviación durante la campaña. Cada uno de ellos va acompañado de su consecuencia práctica; por ejemplo, que un ajuste de la desviación media no será suficiente si la dispersión individual sigue siendo demasiado elevada.
⚠️ El hecho de que las medias sean equivalentes no permite intercambiar los medios pieza por pieza. Si la decisión de conformidad se toma pieza por pieza, lo que prevalece es la tercera cuestión, el 95 % de % de las piezas dentro de ±δ, y es necesario reducir la dispersión antes de intercambiar los dos valores medios.

7. Pestaña «Gráficos»
Cuatro gráficos, y cada uno responde a una de las preguntas de la tabla de diagnóstico.
- La desviación respecto a la referencia: el gráfico de Bland y Altman. En el eje de abscisas, el valor de la media de referencia; en el eje de ordenadas, la diferencia entre ambas medias. En él se pueden ver de un solo vistazo la desviación media, los límites de aceptación, la banda ±δ y la tendencia de la desviación. Las piezas que se encuentran fuera de la banda están marcadas con un símbolo distintivo: su número es la respuesta a la pregunta sobre la variación entre piezas.
- B en función de A: la nube de pares de medidas, la recta de identidad y = x, la regresión de Deming y la banda de aceptación. Una nube que sigue la recta de identidad y se mantiene dentro de la banda indica intercambiabilidad; una recta de Deming inclinada con respecto a la recta de identidad indica un desacuerdo que depende del nivel.
- El «mountain plot»: la distribución de las desviaciones, representada mediante percentiles plegados. El vértice indica la mediana de las desviaciones, la anchura muestra la dispersión y la simetría revela si existe un sesgo. Es la representación más clara para evaluar si las desviaciones están centradas y agrupadas, o bien dispersas y desalineadas.
- Las desviaciones en el orden de registro: la misma diferencia, representada en el orden en que se realizaron las mediciones. Es el único gráfico que puede revelar una deriva: una desviación que aumenta de forma constante a lo largo de la campaña no es un sesgo, sino que se debe a que el instrumento se desplaza.

Concluir
Ambos métodos son intercambiables cuando las cinco preguntas reciben una respuesta afirmativa. En caso contrario, el procedimiento a seguir depende de la pregunta en la que se haya obtenido una respuesta negativa:
- un sesgo medio demostrado y estable se corrige: se trata de un desajuste que se ajusta mediante calibración o mediante una corrección aplicada a uno de los dos medios; ;
- una discrepancia que depende del nivel medido no se corrige mediante un desplazamiento: hay que restringir el rango de uso común o tratar ambos medios como no sustituibles; ;
- unos límites de aceptación más amplios que δ obligan a reducir la dispersión antes de cualquier intercambio; hay que trabajar la repetibilidad del valor más disperso; ;
- una desviación durante la campaña invalida el propio estudio: hay que volver a realizarlo tras haber estabilizado el medio en cuestión; ;
- Un resultado indeciso no es un fracaso, sino que se deben a la falta de piezas. La pantalla indica el número de piezas necesarias.
💡 Este estudio complementa el R&R, no lo sustituye. El R&R califica un medio en términos absolutos, frente a una tolerancia o a la variación del proceso. La comparación de dos medios evalúa una sustitución: no indica si los medios son buenos, sino si son equivalentes. Dos instrumentos mediocres pueden ser perfectamente intercambiables, y dos instrumentos excelentes pueden no serlo.
