Optimización bayesiana

Tiempo de lectura

Se trata de un cambio de enfoque. En lugar de elaborar un plano completo y luego pasar a la modelización, se alterna : unas cuantas pruebas, un modelo, las siguientes pruebas seleccionadas en función del modelo, un modelo mejor, y así sucesivamente. En cada ronda, el programa determina los ajustes que ofrecen mejores resultados.

La herramienta es la proceso gaussiano : predice la respuesta y su incertidumbre en cualquier punto del dominio. Es precisamente esta incertidumbre la que permite elegir de forma inteligente el siguiente ensayo: un punto resulta interesante si promete una buena respuesta o si no se sabe nada al respecto.

💡 Es la alternativa moderna al simple, y el módulo lo asume: los mismos usos: procesos costosos, ensayos largos, mediciones con ruido, pero el proceso gaussiano aprovecha toda la información acumulada en cada iteración, mientras que el simplex solo tiene en cuenta sus últimos vértices.

1. Realizar el estudio

    El panel de la izquierda, Parámetros del estudio :

    AjusteFunción
    Título del estudioIdentifica el estudio, registrado en el proyecto.
    Respuesta que hay que optimizarSu nombre y su unidad.
    ObjetivoMaximizar o Minimizar la respuesta.
    FactoresUn nombre, un mínimo y un máximo por factor. «+ Añadir un factor» y la papelera para eliminarlo.
    Pruebas del plan inicial (Audze-Eglais)El número de ensayos iniciales, distribuidos uniformemente por toda la zona.
    Pruebas propuestas por iteraciónEl tamaño del lote propuesto en cada ronda.
    Estrategia de optimizaciónPrudente, equilibrada, exploratoria (véase más abajo).
    Ruido previsto del procesoBajo, Medio, Alto.
    Calidad de la investigaciónRápido, Estándar, Profundo.
    Semilla aleatoriaHace que las propuestas sean reproducibles.
    Modo de demostración (simulador de procesos)Simula los resultados para familiarizarte con el módulo.

    El botón Generar el plano inicial crea los primeros ensayos. A continuación, los factores son bloqueados : no se puede cambiar el campo de estudio sin empezar de cero; para eso sirve Restablecer el estudio. La sesión se exporta a JSON.

    La estrategia Regla de arbitraje «explotar / explorar»:

    • Prudente = se mantiene cerca de las zonas que ya dan buenos resultados, asume pocos riesgos. Ideal cuando las pruebas son caras
    • Equilibrada = un equilibrio entre aprovechar las áreas prometedoras y explorar lo incierto. La mejor opción por defecto
    • Exploratorio = Prueba también las zonas inciertas para comprender mejor el ámbito. Resulta útil al inicio del estudio.

    El ruido previsto limita el rango de valores que el modelo puede estimar:

    • Bajo = mediciones precisas, proceso estable: el modelo realiza una interpolación precisa (ruido ≤ ~5 % de la varianza); ;
    • Medio = caso general, ruido limitado a ~25 %; ;
    • Alto = medida o proceso muy variable: el modelo no realiza interpolación a través del ruido (hasta ~60 %).

    La calidad de la investigación amplía el número de candidatos que se tienen en cuenta en cada propuesta. Avanzado Se recomienda cuando hay más de 6 factores; tarda más en realizar el cálculo.

    ⚠️ El ruido previsto Es el parámetro que más influye en los resultados, y se reevalúa a lo largo del estudio. Declarar que un proceso es estable cuando no lo es lleva al modelo a interpretar cada fluctuación en las mediciones como un efecto real, lo que desvía los ensayos posteriores por caminos erróneos. Si aparece la advertencia «alto nivel de ruido» en el diagnóstico, hay que volver a revisarlo.

    2. El plan de ensayos

    Esta es la pestaña de trabajo. Una tabla, con una línea por ensayo:

    ColumnaContenido
    N.ºEl orden de ejecución.
    Los factoresLos valores que hay que aplicar.
    La respuestaNo te lo pierdas tras la prueba.
    EstatutoMedido o Tareas pendientes.
    OrigenPlan inicialBO it. n (propuesto en la iteración n) o Manual.
    ¿Por qué este punto? (análisis del modelo)Explicación de la propuesta.

    El modelo se adapta a partir de 4 ensayos medidos. Debajo, el botón de propuesta está desactivado y se explica el motivo. También permanece desactivado mientras haya ensayos propuestos pendientes de resultado: no se propone un nuevo lote sin haber analizado el anterior.

    El botón Proponer los n próximas pruebas inicia el cálculo. En modo de demostración, Simular los resultados de las pruebas pendientes rellena las respuestas.

    Leer las propuestas = cada prueba propuesta lleva una etiqueta y un beneficio esperado :

    EtiquetaSignificado
    PrometedorEl modelo ofrece, potencialmente, mejores predicciones que el mejor ensayo actual. Este es el aspecto que más contribuye a la búsqueda del óptimo.
    ExplotaciónSe acerca al mejor ensayo actual: perfecciona y hace más fiable el óptimo al reducir la incertidumbre local.
    ExploraciónZona aún poco conocida, con gran incertidumbre. Proporciona información sobre las regiones inexploradas y puede revelar una solución óptima mejor en otro lugar.

    💡 Que se propongan dos ensayos muy similares no es un error. El módulo lo indica explícitamente: el modelo centra el esfuerzo en una zona que se considera prometedora, para confirmar la medición y separar la señal del ruido. Este es el comportamiento esperado en un proceso con ruido, y sería un error «corregir» estas duplicaciones manualmente.

    Cuando el beneficio esperado de las próximas pruebas es muy reducido, aparece un mensaje que indica que Es probable que se produzca una convergencia: se puede dar por concluido el estudio o continuar con él para obtener una confirmación.

    3. Las pestañas de lectura

    PestañaLo que muestra
    ConvergenciaEl mejor resultado obtenido según el número de ensayo. La curva que se aplana es la convergencia. Se deben realizar, como mínimo, dos ensayos.
    Posición de los puntosLa superficie de respuesta prevista en función de dos factores a elegir, con los demás fijos, junto con los ensayos realizados y las propuestas. Al marcar una casilla, la visualización cambia a la’incertidumbre en lugar de la respuesta.
    3DA partir de dos factores. Lo mismo ocurre con el aprendizaje automático.
    5DA partir de 4 factores. Lo mismo ocurre con el aprendizaje automático.
    PrevisiónLa respuesta prevista en un punto introducido. Lo mismo ocurre con el aprendizaje automático.
    Diagnóstico (fiabilidad)Véase el apartado 4.4.
    Factores y modeloVéase el apartado 4.5.

    💡 La visualización de la’incertidumbre El mapa de puntos es la mejor herramienta de toma de decisiones de todo el módulo: muestra dónde el modelo no tiene información. Una zona roja de incertidumbre en el límite del dominio explica por sí sola por qué las propuestas se desvían hacia allí.

    3.1 Pestaña «Convergencia»:

    3.2 Pestaña «Superficie»:

    Los puntos negros son los puntos de ensayo realizados; los puntos marrones son los puntos propuestos.

    4. Diagnóstico: ¿puedo confiar en el modelo?

    Esa es la pregunta que plantea literalmente la pestaña, y responde a ella con una validación cruzada «leave-one-out» : se predice cada ensayo como si no se hubiera llevado a cabo. De este modo, se comprueba la capacidad real de generalización, y no la capacidad del modelo para volver a pasar por sus propios puntos.

    Un veredicto general:

    • Modelo globalmente fiable
    • Modelo que debe utilizarse con precaución
    • Modelo que aún no es muy fiable

    A continuación, cuatro indicadores:

    IndicadorLectura
    R² predictivo (Q²)La calidad de la predicción: buena, media o baja.
    RMSE (LOO)El error típico de predicción, en la unidad de la respuesta.
    MAE (LOO)El error absoluto medio.
    Portada 95 %El porcentaje de ensayos que se sitúan dentro del intervalo anunciado.

    Se incluyen dos gráficos: observado frente a previsto y residuos frente a lo previsto con un intervalo de confianza del 95 % (%), en el que cada punto se marca como «bien predicho» o «mal predicho».

    ⚠️ La portada es el indicador más importante y el menos tenido en cuenta. Por debajo de 95 %, el modelo subestima su propia incertidumbre : sus intervalos son demasiado estrechos, por lo que sus propuestas son demasiado seguras. El módulo recomienda, por tanto, aumentar el ruido esperado o añadir ensayos.

    ⚠️ Con muy pocos ensayos, la validación «leave-one-out» no es muy robusta en sí misma —el módulo lo señala—. Hay que reevaluarla tras unas cuantas iteraciones, en lugar de tomarla al pie de la letra en el tercer ensayo.

    5. Factores y modelo

    La pestaña muestra el modelo en sí: Núcleo Matérn 5/2 anisotrópico, log-verosimilitud marginal y el’desviación típica del ruido estimado, la variabilidad de medición y de proceso que absorbe el modelo.

    Sobre todo, muestra la sensibilidad indicativa del modelo (ARD) : un factor cuya longitud de correlación es corta es aquel que, según el modelo, provoca una gran variación en la respuesta.

    ⚠️ El módulo lo deja claro, y hay que repetirlo: esta sensibilidad es una interpretación del modelo, no una prueba de significación ni un análisis de varianza. Se señalan algunas pistas; un análisis estadístico específico las confirma.

    Aparecen advertencias en función del estado del estudio: número insuficiente de pruebas en relación con el número de hiperparámetros que hay que estimar, ruido estimado elevado o notable, longitud de correlación de un factor como mínimo (riesgo de sobreajuste) o como máximo (el modelo prácticamente no detecta ningún efecto).