Résumé
Les données sont publiées en continu sur le web et ce de manière décentralisée condui-sant à un web de données hétérogènes. Au vu de l'énorme quantité de données publiées et de leur hétérogénéïté, se pose la difficulté d'accéder efficacement à l'information pertinente d'où la nécessité d'interconnecter ces données. Dans cet article, nous proposons un état de l'art des méthodes et outils traitant du problème de liage de données. La particularité de cette étude est que nous considérons le processus de liage comme un pipeline composé de trois phases: (i) pré-traitement, (ii) appariement d'instances de données et (iii) post-traitement. La tâche proprement dite d'appariement d'instances de données est certainement au coeur de ce processus. Cependant, ce qui se passe avant et ce qui se passe après cette tâche est d'une importance cruciale pour l'efficacité d'un outil de liage de données. Parmi les contributions importantes de cet article il y a la proposition d'une organisation des approches et outils dans une (pseudo-) taxonomie, en fonction des trois grandes étapes du processus. Cette classification comprend plusieurs catégories en fonction des tâches que chaque approche utilise et selon les techniques qui y sont appliquées. Nous considérons par ailleurs une quatrième catégorie de méthodes ap-pelée multi-étapes comprenant les méthodes agissant sur plus d'une étape du processus de liage (ces méthodes peuvent être trouvées sur plusieurs feuilles de notre taxonomie). Enfin, nous pro-posons également une analyse comparative selon plusieurs critères des différentes approches et outils existants dans ce domaine