Crear un modelo

Tiempo de lectura

1. El modelo de aprendizaje automático y su tabla

Un proyecto contiene tantos modelos los necesarios, que aparecen en pestañas en la parte superior de la página, con un «+» para crear uno nuevo. Cada plantilla tiene un nombre y se refiere a la tabla que gestiona, elegida justo debajo de su nombre.

⚠️ Cambiar la cuadrícula de un modelo reinicia sus valores X, Y y sus líneas de prueba. Es a propósito: las columnas de otra tabla no tienen por qué coincidir. Para comparar dos conjuntos de datos, crea dos modelos.

2. Elegir las coordenadas X e Y

La tabla de la izquierda muestra las columnas de la cuadrícula con dos columnas de casillas de selección, X y Y.

  • Y es la respuesta correcta. Márcala. nombra el modelo según ella y elige desde el principio el tipo de modelo : regresión lineal si Y es cuantitativa, regresión logística si es cualitativa.
  • X son los factores que lo explican.

Tres reglas de selección que conviene conocer:

  • una columna constante no puede ser X: su casilla está desactivada porque, al no haber variación, no se puede estimar ningún efecto; ;
  • solo las columnas de ensayo 1 se ofrecen en X; ;
  • Una misma columna no puede ser X e Y: al marcar una, se desmarca la otra.

3. Elegir el tipo de plantilla

La lista de tipos depende de la naturaleza de Y.

Y cuantitativo

TipoLo que aporta
Regresión linealEl modelo de referencia: coeficientes legibles, valores p, R². Es el que se utiliza para entender.
Regresión PLSPara un número X de variables, numerosas y correlacionadas entre sí, en los casos en que la regresión clásica se vuelve inestable.
Regresión K-OPLSVersión con núcleo de la PLS: capta las relaciones no lineales.
Proceso gaussianoInterpolación flexible con intervalo de confianza en cada punto. Excelente con pocos datos.
Red neuronalPerceptrón multicapa: relaciones muy no lineales, a costa de la interpretabilidad.

Y cualitativo = ya no se predice un valor, sino un clase :

TipoLo que aporta
Regresión logísticaCoeficientes y valores p, al igual que en la regresión lineal. El modelo de referencia para la clasificación.
Árbol de decisiónNormas claras, que pueden aplicarse directamente como instrucciones de taller.
Bosque aleatorioConjunto de ejes: más preciso, menos legible.
(SVM) Máquina de vectores de soporteFronteras de separación complejas.
(KNN) K vecinos más cercanosClasificación por similitud con casos conocidos.

Hay dos tipos que desaparecen por sí solos cuando no se esfuerzan:

  • el proceso gaussiano exige X todos cuantitativos y como máximo 50 líneas de aprendizaje; además, su coste de cálculo se dispara; ;
  • la regresión K-OPLS desaparece en las tablas de gran tamaño (cuando hay más de 2 000 valores en las columnas seleccionadas).

💡 Empezar siempre mediante regresión lineal o logística, incluso si se sospecha que la relación no es lineal. Proporciona valores p, un R² y coeficientes interpretables: lo necesario para saber ¿cuáles? Hay factores que influyen. Los modelos más flexibles a veces ofrecen mejores predicciones, pero no responden a la pregunta «¿sobre qué hay que actuar?».

4. Las opciones

En el tipo de modelo, la sección Opciones muestra los ajustes específicos del tipo seleccionado (profundidad máxima y número mínimo de individuos por hoja para un árbol; número de árboles y proporción de variables para un bosque; gamma y cost para una SVM; tasa de aprendizaje, número de épocas, regularización y tamaño de la capa oculta para una red neuronal, número de componentes para el PLS).

⚠️ Estos ajustes tienen valores predeterminados razonables. Modificarlos sin un método adecuado puede provocar ajustar en exceso : un modelo que reproduce a la perfección los datos de entrenamiento, pero que se equivoca con cualquier pieza nueva. Es la pestaña Modelo/Observación y las líneas de resultado que indican si has ganado o perdido.

5. Los términos del modelo

En un análisis de regresión, la pestaña Coeficientes No se limita a leer el modelo: ahí es donde lo compone. Un selector de términos permite añadir a los efectos principales:

  • los términos cuadráticos : el cuadrado de un factor, para reflejar la variación. Se reserva para los factores cuantitativos con más de dos niveles: con dos niveles, un cuadrado no se distingue de la constante; ;
  • los interacciones : el producto de dos factores; ;
  • la constante, que, en su caso, se puede eliminar del modelo.

La tabla de coeficientes muestra, término por término: el coeficiente, el’error estándar, la estadística, la valor p, la conclusión significativo y el VIF. En la parte superior figuran el error estándar del modelo, el n (ddl)el  y el R² ajustado, así como la parte derecha del modelo, la ecuación completa, que se puede copiar.

💡 El VIF es el filtro que a menudo se pasa por alto. Mide en qué medida un término es redundante con respecto a los demás. Un VIF elevado significa que el coeficiente obtenido no es fiable, no porque el factor no influya, sino porque los datos no permiten diferenciar su efecto del de otro. En datos observacionales, esto es frecuente; en un diseño experimental bien elaborado, no debería ocurrir.

Se puede eliminar un término, ya sea borrándolo de la tabla de términos del modelo o haciendo clic en «eliminar».»

El análisis automático ofrece dos estrategias para la selección de términos:

  • Hacia delante : partir de la plantilla vacía y añadir los términos necesarios uno a uno; ;
  • Atrás : partir del modelo completo y eliminar los términos innecesarios.

El botón Mejor subconjunto va más allá: enumera las combinaciones de términos hasta un número máximo de términos que establezcas, muestra el número de regresiones lo que esto supone, y clasifica los resultados por R² y R² ajustado. Cada candidato se inscribe con un solo clic.

⚠️ Selección automática de términos invalida los valores p en sentido estricto: se han probado muchos modelos y se ha seleccionado el mejor, algo que el cálculo del valor p no tiene en cuenta. El resultado sigue siendo un excelente punto de partida, pero un modelo obtenido de este modo se lo confirma con nuevos datos, no en las que se utilizaron para elegirlo.

En el caso de variables cualitativas, se puede elegir la modalidad de referencia (incluida en la constante). La modalidad de referencia no aparece en la tabla de Student.

6. Leer los resultados

En la parte derecha de la pantalla se muestran los resultados en pestañas. Los primeros dependen del modelo; los siguientes siempre aparecen.

Pestañas específicas del modelo

PestañaCuando aparece
TaguchiEllistat ha detectado un plan de Taguchi en los datos, y Y es una variable cuantitativa. Muestra el análisis específico de este plan.
MultinivelLos datos lo confirman: efectos y importancia de los términos en función de factores de varios niveles.
CoeficientesRegresión lineal o logística (véase el apartado 5).
ConfiguraciónPLS, K-OPLS, proceso gaussiano, red neuronal, árbol, bosque, SVM, KNN: los diagnósticos propios de cada tipo.

Pestañas comunes

PestañaLo que muestra
Modelo/ObservaciónPrevisión frente a datos observados. En un eje Y cualitativo, es la matriz de confusión.
HistogramaLa distribución, en Y cuantitativa.
ResiduosLos detalles línea por línea: valor observado, predicción, desviación y pertenencia a las líneas de prueba.
PrevisiónIntroduce valores de X y lee la respuesta prevista.
3DDesde 2 X : la superficie de respuesta del modelo.
5DDesde 4 X : la misma interpretación con dos factores adicionales que se reflejan en el color y el tamaño.

💡 «Modelo/Observación» es la única pestaña que evalúa el modelo. Los puntos deben alinearse con la diagonal y, sobre todo, Las líneas de prueba también deben alinearse con ellas. Un modelo que predice a la perfección sus datos de entrenamiento pero falla en las líneas de prueba no ha aprendido nada: simplemente ha memorizado. Ese es el único error que importa, y el R² no lo tiene en cuenta.

7. Taguchi

En el caso de un diseño experimental de dos niveles, la tabla de Taguchi muestra el gráfico de efectos para todas las columnas de la tabla.

Seleccionar o deseleccionar una interacción. Al hacer clic en el nombre de la interacción en rojo, se selecciona y pasa a verde. Lo mismo ocurre al hacer clic en el nombre en verde: pasa a rojo. Al seleccionar una interacción, aparece el gráfico de interacción correspondiente. Se puede cambiar el eje x haciendo clic en el punto azul.

8. Modelo / Observación

Este gráfico muestra, de diferentes formas, el grado de ajuste entre el modelo y los datos observados. Cuanto más se acerquen los puntos a la recta, más fiel será el modelo a los datos.

Un gráfico muy útil es el de «Apalancamientos frente a Residuos». Los puntos deben estar en verde.

Si un punto aparece en rojo, ya sea hacia abajo o hacia arriba, se debe a un problema con la respuesta. Hay una de las respuestas que no se ajusta al modelo (¿valor atípico?).

Si un punto está en rojo hacia la derecha, el problema está en las X. Una de las líneas de prueba es atípica en comparación con las demás (por ejemplo, X varía entre 5 y 10 en todas las líneas excepto en una, en la que X = 20).

9. Histograma de los residuos

Proporciona el histograma y el análisis de normalidad de los residuos

En esta pestaña se encuentra la tabla con los valores medidos, los valores predichos y el valor de los residuos.

Pero es en esta tabla donde se puede elegir entre someter a prueba una proporción de líneas de forma aleatoria, o bien las primeras, las últimas o seleccionando las líneas de la columna «prueba».

10. Previsión

Esta pestaña permite predecir una respuesta y su intervalo de confianza a partir del modelo para cualquier configuración.

11. Gráficos en 3D y 5D

El menú 3D permite obtener una vista en 3D de la superficie de respuesta. Se seleccionan 2 X y una configuración concreta de las demás X para mostrar la representación.

En caso de que se disponga de suficientes factores X, se propone la vista 5D, que permite ver Y en función de 4X en una sola figura (5 dimensiones).

En el ejemplo siguiente se muestra la evolución de la potencia en función de la velocidad en nueve configuraciones de desenfoque/punto. También se puede utilizar una cuadrícula de 5×5 en lugar de una de 3×3 para obtener un análisis más detallado.