METEOR (métrique)
METEOR est un nom utilisé dans le domaine du traitement automatique du langage naturel (TALN ou NLP en anglais) pour plusieurs concepts apparentés mais distincts. Il s'agit tout d'abord d'une métrique automatique bien connue pour évaluer la qualité de la traduction automatique. De plus, en 2024, deux projets de recherche indépendants liés aux grands modèles de langage (LLM) ont été présentés sous le même nom : une méthode d'apprentissage évolutif et un modèle de langage multimodal.
METEOR en tant que métrique d'évaluation de la qualité de la traduction
METEOR (abréviation de Metric for Evaluation of Translation with Explicit ORdering) est une métrique automatique pour évaluer la qualité de la traduction automatique, proposée en 2005 par les chercheurs Satanjeev Banerjee et Alon Lavie de l'Université Carnegie Mellon[1]. Son objectif était d'améliorer la corrélation des évaluations automatiques avec les jugements humains, en particulier au niveau de la phrase, en remédiant à certaines des lacunes de la métrique BLEU antérieure.
Les principales caractéristiques de la métrique METEOR sont :
- Prise en compte de la précision et du rappel : Contrairement à BLEU, qui se concentre uniquement sur la précision (precision), METEOR calcule la moyenne harmonique de la précision et du rappel (recall), ce qui permet de pénaliser les traductions qui omettent des mots importants.
- Appariement flexible des mots : METEOR utilise des caractéristiques linguistiques pour faire correspondre la traduction à la référence. Il prend en compte non seulement les correspondances exactes, mais aussi les différentes formes de mots (grâce au stemming) et les synonymes (à l'aide de WordNet).
- Pénalité pour le désordre des mots : La métrique inclut une pénalité qui sanctionne un ordre incorrect des mots dans la traduction candidate, même si tous les mots correspondent à la référence.
Ces améliorations permettent à la métrique METEOR d'avoir une corrélation significativement meilleure avec les jugements humains par rapport à BLEU[2]. La métrique est largement utilisée dans la recherche sur la traduction automatique, le résumé automatique de texte et l'évaluation des légendes d'images[3].
METEOR en tant que méthode d'apprentissage évolutif pour les LLM
En 2024, un groupe de chercheurs chinois a présenté une méthode intitulée METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth[4]. Cette méthode est conçue pour l'entraînement efficace de LLM spécialisés dans des domaines de niche (par exemple, la finance, la médecine), sans qu'il soit nécessaire d'entraîner le modèle à partir de zéro.
Les auteurs décrivent un schéma en trois phases pour l'« évolution » des LLM :
- Distillation des connaissances d'un modèle fort vers un modèle faible (weak-to-strong data distillation) : Un modèle « enseignant » plus puissant (par exemple, GPT-4) est utilisé pour générer le corpus d'entraînement. Le modèle de domaine génère d'abord un plan de résolution, puis le modèle fort crée la réponse en suivant ce plan. Cela uniformise la distribution des connaissances et permet au modèle cible de les assimiler plus efficacement.
- Entraînement itératif guidé (guided iterative training) : Le modèle entraîné lors de la première phase résout des tâches de manière autonome, tandis que le modèle fort agit comme un « arbitre », évaluant les réponses et signalant les erreurs. Ce cycle réflexif développe la capacité d'auto-vérification du modèle de domaine.
- Auto-évolution (self-evolution) : Le modèle continue de s'améliorer sans superviseur externe, en utilisant les compétences acquises pour générer et corriger de nouvelles données.
Cette méthode propose une approche pratique pour créer des LLM experts, compacts et économiques, pour des secteurs spécifiques[5].
METEOR en tant que modèle LLM multimodal
Toujours en 2024, une équipe de chercheurs du KAIST a présenté un grand modèle de langage multimodal nommé METEOR: Mamba-based Traversal of Rationales[6]. Le modèle est conçu pour la compréhension complexe d'informations visuelles et la génération de réponses à des questions visuelles.
La caractéristique clé de METEOR est l'utilisation de raisonnements (rationales) développés. Le modèle ne se contente pas de fournir une réponse finale, mais génère et s'appuie sur une « chaîne de raisonnement » latente — une explication séquentielle de la manière d'arriver à cette réponse, à l'instar d'un raisonnement humain.
L'architecture de METEOR intègre un module spécial basé sur le modèle Mamba — une architecture efficace pour le traitement de séquences très longues. Ce module encode de longues chaînes de raisonnement, qui peuvent inclure la description d'objets dans une image, leurs relations spatiales et les étapes nécessaires pour résoudre une tâche[7].
Le modèle a été testé avec succès sur des benchmarks multimodaux complexes, tels que MME, AI2D (compréhension de diagrammes) et MathVista (résolution de problèmes mathématiques dans un contexte visuel). Il a montré des résultats élevés sans nécessiter de modules externes de vision par ordinateur supplémentaires, ce qui témoigne d'une utilisation efficace de ses propres paramètres[7].
Références
- ↑ Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
- ↑ Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
- ↑ «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
- ↑ Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
- ↑ 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]