Résumé
Dans le domaine de l’analytique, si l'on combine les principales sources de données non structurées (forums, blogs, e-commerce ou réseaux sociaux), près de deux milliards de personnes livrent quotidiennement des informations sur ce qu'elles aiment, ce qu'elles font ou ce qu'elles pensent d'un produit, d'un film, d'une musique, etc. Ces données représentent une véritable mine d'or pour les entreprises et leur maîtrise est devenue, en quelques années, un atout majeur en matière de compétitivité. Dans cet article, nous présentons une application de l'algorithme des forêts aléatoires (Breiman, 2001) sur un jeu de données non structurées provenant d’Amazon. L'objectif est de construire un modèle de classification permettant, à partir d'un commentaire, de prédire et d'expliquer une note attribuée par un consommateur pour un produit donné. Nous présentons la démarche globale, de l'acquisition des données à leur analyse, en prenant en compte le caractère non structuré de celles-ci.