Résumé
Les variables sources ou les propriétés observables utilisées pour décrire les expérimentations agroécologiques sont hétérogènes, non standardisées et multilingues, rendant leur compréhension, explication et utilisation difficiles dans la modélisation des systèmes de culture et les évaluations multicritères de la performance des systèmes agroécologiques. L’annotation des données via un vocabulaire contrôlé, appelé variables candidates de Agroecological Global Information System (AEGIS), constitue une solution. Les mesures de similarité textuelle jouent un rôle clé dans la désambiguïsation du sens des mots, l’appariement de schémas dans les bases de données et l’annotation des données. Les approches courantes incluent (a) la similarité fondée sur les chaînes de caractères, (b) sur le corpus, (c) sur les connaissances et (d) les approches hybrides combinant deux ou plusieurs de ces méthodes. Ce travail propose une approche hybride, Matching Agroecological Experiment Variables (MAEVa), visant à apparier les variables sources et candidates selon (1) l'appariement des noms, (2) celui des descriptions, (3) une combinaison linéaire de (1) et (2), et (4) une méthode de sélection des résultats pour l'évaluation finale. Pour l’appariement des noms, nous étendons BERT-base avec une couche d’attention multi-têtes externe (BERTmha). Pour les descriptions, nous enrichissons celles existantes avec l'API GPT-3.5 Turbo et utilisons TF-IDF pour la représentation vectorielle. Nos résultats montrent que BERTmha améliore la précision de plus de 11% par rapport à BERT-base seul et que notre corpus améliore celle de TF-IDF de plus de 4%. Notre évaluation (étape 4) montre que MAEVa atteint une précision de plus de 66% de $P@1$ à $P@10$.