1. A gépi tanulás modellje és a hozzá tartozó rács

Egy projekt annyi modellek amennyire szükséges, a lap tetején fülök formájában jelennek meg, és egy «+» gombbal lehet újat létrehozni. Minden sablonnak van neve, és a rácsot jelöli amelyet üzemeltet, és amelyet közvetlenül a neve alatt választott ki.
⚠️ A sablon rácsának módosítása visszaállítja az X, Y és a tesztvonalak értékeit. Ez szándékos: egy másik rács oszlopainak nem kell egyezniük. Két adatsor összehasonlításához hozzon létre két modellt.
2. Az X és az Y kiválasztása
A bal oldali táblázat felsorolja a rács oszlopait, valamint két oszlopot, amelyekben jelölőnégyzetek találhatók, X és Y.

- Y ez a várható válasz. Jelölje be nevezze el a modellt szerinte és azonnal kiválasztja a modell típusát : lineáris regresszió, ha Y mennyiségi változó, logisztikai regresszió, ha minőségi változó.
- X ezek a magyarázó tényezők.
Három kiválasztási szabály, amit érdemes ismerni:
- egy oszlop állandó nem lehet X: a mezője ki van kapcsolva, mivel változás hiányában semmilyen hatás nem becsülhető meg; ;
- csak a következő oszlopok 1. próba X-ben kerülnek felajánlásra; ;
- Egy oszlop nem lehet egyszerre X és Y: ha az egyiket bejelöljük, a másik jelölése törlődik.
3. A sablon típusának kiválasztása
A típusok listája Y jellegétől függ.

Y mennyiségi
| Típus | Mit nyújt |
| Lineáris regresszió | A referencia-modell: olvasható együtthatók, p-értékek, R². Ezt használjuk a következőkre: megérteni. |
| PLS-regresszió | Számos, egymással összefüggő X-változó esetén, amikor a klasszikus regresszió instabillá válik. |
| K-OPLS-regresszió | A PLS kernel-változata: a nemlineáris összefüggéseket is figyelembe veszi. |
| Gauss-eloszlás | Rugalmas interpoláció a következővel: konfidenciaintervallum minden ponton. Kiválóan teljesít kis adatmennyiség esetén is. |
| Neurális hálózat | Többrétegű perceptron: rendkívül nemlineáris összefüggések, az értelmezhetőség rovására. |
Y minőségi = már nem egy értéket jósolunk meg, hanem egy osztály :
| Típus | Mit nyújt |
| Logisztikus regresszió | Együtthatók és p-értékek, akárcsak a lineáris regresszió esetében. A besoroláshoz használt referencia-modell. |
| Döntési fa | Egyértelmű szabályok, amelyek közvetlenül átültethetők műhelyi utasításokká. |
| Véletlenszerű erdő | Tengelyrendszer: pontosabb, de kevésbé áttekinthető. |
| (SVM) Támogató vektoros gép | Összetett elválasztó határok. |
| (KNN) K legközelebbi szomszédai | Osztályozás az ismert esetekhez való hasonlóság alapján. |
Két típusú ember magától eltűnik, ha nem igyekszik:
- a gauss-eloszlás X-et követel mindegyik mennyiségi és legfeljebb 50 sor a tanulási fázis után a számítási költségek az egekbe szöknek; ;
- a K-OPLS-regresszió a nagy táblázatokban eltűnik (ha a kiválasztott oszlopokban több mint 2 000 érték szerepel).
💡 Kezdés mindig lineáris vagy logisztikus regresszióval, még akkor is, ha nemlineáris viszonyra gyanakodunk. Ez p-értékeket, R²-értéket és értelmezhető együtthatókat ad: ebből elég ahhoz, hogy megtudjuk melyek Ezek a tényezők fontosak. A rugalmasabb modellek néha pontosabb előrejelzéseket adnak, de nem adnak választ arra a kérdésre, hogy «mire kell beavatkozni?».
4. Beállítások

A modell típusa alatt a Beállítások bemutatja a kiválasztott típusra jellemző beállításokat (maximális mélység és minimális egyedek száma laponként egy fa esetében, fák száma és változók aránya egy erdő esetében, gamma és cost egy SVM esetében, tanulási arány, az iterációk száma, a regularizáció és a rejtett réteg mérete egy neurális hálózat esetében, valamint a komponensek száma a PLS esetében).
⚠️ Ezeknek a beállításoknak ésszerű alapértelmezett értékeik vannak. Ha ezeket módszer nélkül módosítjuk, az a következőhöz vezet: túlbeállítani : egy olyan modell, amely tökéletesen reprodukálja a tanulási adatokat, de minden új darabnál hibázik. Ez a fül Modell/Megfigyelés és a teszt sorok, amelyek megmutatják, nyertél-e vagy vesztettél.
5. A sablon feltételei
Egy regressziós elemzésnél a Együtthatók nem csupán a sablont olvassa el: itt történik a összeállítja. A kifejezésválasztó segítségével a fő effektusokhoz hozzáadhatók:

- a másodfokú kifejezések : egy tényező négyzete, a görbület kifejezésére. Csak a kétnél több szinttel rendelkező mennyiségi tényezők esetében alkalmazható: két szint esetén a négyzet nem különböztethető meg az állandótól; ;
- a kölcsönhatások : két tényező szorzata; ;
- a állandó, amelyet adott esetben eltávolíthatunk a modellből.
Az együtthatók táblázata tételenként a következőket tartalmazza: a együttható, az’szabványos hiba, a statisztika, a p-érték, a következtetés jelentős és a VIF. A fenti táblázatban szerepel a modell standard hibája, a n (ddl)a R² és a Korrigált R², valamint a a modell jobb oldala, a teljes, másolható egyenlet.

💡 A VIF az a biztosíték, amelyet gyakran elfeledünk. Ez méri, hogy egy változó mennyire átfedi a többi változót. A magas VIF-érték azt jelenti, hogy a megjelenített együttható nem megbízható – nem azért, mert a tényező nem hat, hanem azért, mert az adatok nem teszik lehetővé, hogy hatását elkülönítsük egy másik tényező hatásától. Megfigyelési adatok esetében ez gyakran előfordul; egy jól felépített kísérleti terv esetében azonban nem szabad, hogy ez megtörténjen.
Egy kifejezést úgy lehet törölni, hogy vagy eltávolítjuk a modell kifejezéseinek táblázatából, vagy rákattintunk a «Törlés» gombra.»
Az automatikus elemzés két kifejezéskiválasztási stratégiát javasol:
- Előre : induljunk ki az üres sablonból, és adjuk hozzá egyenként a szükséges kifejezéseket; ;
- Vissza : induljunk ki a teljes modellből, és távolítsuk el a felesleges tagokat.
A gomb Legjobb alcsoport még tovább megy: felsorolja a kifejezések kombinációit egészen egy a kifejezések maximális száma amit beállít, azt jeleníti meg regressziók száma hogy ez mit jelent, és az eredményeket az R² és a korrigált R² értékek szerint sorba rendezi. Minden jelöltet egy kattintással lehet alkalmazni.
⚠️ A kifejezések automatikus kiválasztása érvényteleníti a p-értékeket szigorú értelemben véve: számos modellt kipróbáltunk, és a legjobbat választottuk ki, amit a p-érték számítása nem vesz figyelembe. Az eredmény továbbra is kiváló kiindulási pont, de az így kapott modell új adatok alapján megerősíti, nem pedig azokról, amelyek alapján kiválasztották.
Minőségi tényezők esetén kiválasztható a referencia-mód (amely az állandóban szerepel). A referencia-mód nem jelenik meg a Student-táblázatban.
6. Az eredmények megtekintése
A képernyő jobb oldalán a eredmények lapokban jelennek meg. Az első lapok a modelltől függenek, a többi mindig látható.
A modellhez tartozó lapok
| Fül | Mikor jelenik meg |
| Taguchi | Az Ellistat felismerte az adatokban a Taguchi-tervet, és az Y változó mennyiségi. Jelenítse meg az adott tervre vonatkozó elemzést. |
| Többszintű | Az adatok erre alkalmasak: hatások és a kifejezések jelentősége többszintű tényezők alapján. |
| Együtthatók | Lineáris vagy logisztikus regresszió (lásd az 5. §-t). |
| Beállítások | PLS, K-OPLS, gauss-eljárás, neurális hálózat, fa, erdő, SVM, KNN — a típusra jellemző diagnosztikai módszerek. |
Gyakori lapok
| Fül | Mit ábrázol |
| Modell/Megfigyelés | Előrejelzés és tényleges érték. Egy kvalitatív Y-tenzorként ez a konfúziós mátrix. |
| Hisztogram | Az eloszlás a kvantitatív Y-változón. |
| Maradékok | Soronkénti részletek: megfigyelt érték, előrejelzés, eltérés és a tesztcsoportokhoz való tartozás. |
| Előrejelzés | Adja meg az X értékeit, és olvassa el a becsült eredményt. |
| 3D | Már 2 X : a modell érzékenységi területe. |
| 5D | Már 4 X : ugyanaz az értelmezés, két további tényezővel, amelyeket a szín és a méret jelenítenek meg. |
💡 A „Modell/Megjegyzés” az egyetlen fül, amely a modellt értékeli. A pontoknak az átlón kell elhelyezkedniük, és ami a legfontosabb: a tesztvonalaknak is ehhez kell igazodniuk. Az a modell, amely a tanulási adatait tökéletesen előre jelzi, de a tesztsorokat elvéti, nem tanult semmit: csupán memorizált. Ez az egyetlen hiba, ami számít, és az R²-érték ezt nem veszi figyelembe.
7. Taguchi
Két szintű kísérleti terv esetén a Taguchi-táblázat az összes oszlopra vonatkozó hatásdiagramot tartalmazza.

Egy interakció kijelölése vagy kijelölésének megszüntetése. Ha rákattintunk a piros interakció nevére, az kijelölésre kerül, és zöldre vált. Ugyanígy, ha rákattintunk a zöld névre, az pirosra vált. A kijelölt interakció megjeleníteti a hozzá tartozó interakciós grafikont. Az x-tengelyt a kék gombra kattintva lehet megváltoztatni.
8. Modell / Megfigyelés
Ez a grafikon különböző formákban szemlélteti a modell és a megfigyelések közötti egyezést. Minél közelebb vannak a pontok az egyeneshez, annál jobban tükrözi a modell a kísérleti eredményeket.

Egy nagyon hasznos diagram a „Tőkeáttétel vs. Maradvány” diagram. A pontoknak a zöld tartományban kell lenniük.

Ha egy pont lefelé vagy felfelé a piros tartományban van, az a válaszokkal kapcsolatos problémára utal. Az egyik válasz nem illeszkedik a modellbe (kiugró érték?).
Ha egy pont jobbra a piros tartományban van, akkor a probléma az X-tengelyen van. Az egyik tesztvonal eltér a többitől (például az X értéke az összes vonalon 5 és 10 között változik, kivéve egyet, ahol X = 20).
9. A maradékértékek hisztogramja
Adja meg a maradékértékek hisztogramját és a normális eloszlásra vonatkozó elemzést

Ezen a lapon található a táblázat a mért és az előre jelzett értékekkel, valamint a maradékértékekkel.
De ebben a táblázatban lehet úgy dönteni, hogy a sorok egy részét véletlenszerűen választjuk ki tesztelésre, vagy az elsőket, az utolsókat, illetve a „teszt” oszlopból választjuk ki a sorokat.

10. Előrejelzés
Ez a lap lehetővé teszi, hogy a modell alapján bármely konfigurációra vonatkozóan előre jelezzük a választ és annak konfidencia-intervallumát.

11. 3D-s és 5D-s grafika
A 3D-menü segítségével 3D-ben tekinthetjük meg a válaszfelületet. Kiválasztunk 2 X-et, majd a többi X-et egy adott konfigurációban állítjuk be a ábrázolás megjelenítéséhez.

Ha elegendő X-tényező áll rendelkezésre, akkor az 5D-nézet jelenik meg, amely lehetővé teszi, hogy Y-t 4X függvényében egyetlen ábrán (5 dimenzióban) lássuk.
Az alábbi példában a teljesítmény/sebesség függése 9 különböző defókuszálási/spot-beállítás esetén látható. A 3×3-as rács helyett 5×5-ös rácsot is beállíthatunk, hogy pontosabb eredményt kapjunk.

