Pré-traitement graphique

Un exemple de pré-traitement est celui qui consiste à préparer les données avant d'utiliser un algorithme d'induction d'arbre de décision. Le but d'un tel algorithme est de construire un modèle des données à partir d'un ensemble de données dont la classe est connue a priori, puis à partir de ce modèle, de retrouver la classe d'un nouvel individu. La plupart des algorithmes d'arbres de décision ne savent faire que des coupes univariées (ne faisant intervenir qu'un seul attribut (colonne) des données, la coupe est parallèle aux axes). Dans le cas d'une frontière oblique, celle-ci sera approximée par des coupes successives formant un "escalier". L'arbre obtenu aura alors beaucoup de nœuds et sera difficilement interprétable. Une solution est alors de visualiser ces données, de tracer interactivement la coupe oblique puis de calculer un nouvel attribut qui sera la distance à la droite tracée (fig.1). Prenons un exemple sur un petit set de données : Drug d'un logiciel commercial, il comporte 6 attributs et 200 individus.

      

Figure 1 - A gauche : Tracé interactif de la frontière, à droite : les mêmes données avec un nouvel attribut

Sur les données initiales, l'arbre de décision obtenu avec C4.5 donne 7,5% d'erreur avec un arbre de taille 19 (en nombre de nœuds). Lorsque l'on créé le nouvel attribut, l'arbre obtenu avec C4.5 donne alors 0% d'erreur avec un arbre de taille 10. Ce simple pré-traitement graphique permet d'une part d'améliorer la compréhensibilité des résultats (la taille de l'arbre a diminuée) et d'autre part d'améliorer le taux de précision de l'algorithme (fig.2).


Figure 2a - Arbre de décision avec les données originales


Figure 2b - Arbre de décision avec le nouvel attribut