Classificazione non supervisionata

Tempo di lettura

Cette analyse cherche à regrouper les individus en familles sans qu’on ait défini les familles à l’avance.

Zona 1 : la méthode et ses options.

⇒ K-means : familles de taille comparable, il faut donner leur nombre ;

⇒ Division binaire : découpe successivement le nuage en deux ;

⇒ Mélanges gaussiens : accepte des familles de formes et de dispersions différentes ;

⇒ DBSCAN : trouve le nombre de familles lui-même et sait laisser des points de côté. Réglé par Epsilon (le rayon de voisinage) et Points minimum.

Nombre de clusters (K) fixe le nombre de familles pour les trois premières méthodes. Valeur initiale rend le résultat reproductible d’un calcul à l’autre.

Zona 2 : le nuage dans l’Espace des composantes principales (ACP), en 2D ou 3D, une couleur par groupe.

Zona 3 : pour chaque variable, un test qui répond à cette variable distingue-t-elle réellement les groupes ? — un test de Fisher et un test de Kruskal-Wallis, avec leur conclusion colorée du très significatif au non significatif.

💡 C’est la Zone 3 qui valide la classification. Des groupes bien séparés à l’écran mais dont aucune variable n’est significative n’ont pas de sens métier : la partition existe sur le graphique, pas dans les données.

💡 La même classification est disponible directement dans le plan de l’ACP, par la case « Classification non supervisée (KMeans) ». Le numéro affiché à côté de chaque point est celui de sa famille.