Ce que vaut une traduction machine
Chaque paire de langues de cette boîte affiche un score. Ce score vient de Mozilla, pas de nous, et il mesure une chose précise : ni tout, ni rien. Cette page dit ce qu’il capte, ce qu’il rate, comment il se compare à ce que rendent les traducteurs en ligne, et pourquoi il ne dispense jamais d’une relecture humaine.
L’instrument
Ce que mesure un score COMET22
Le chiffre affiché pour chaque paire de langues s’appelle COMET22, pour « Crosslingual Optimized Metric for Evaluation of Translation ». Ce n’est pas une formule qui compte les mots communs entre deux textes, comme les métriques plus anciennes : c’est une métrique apprise, un modèle entraîné à imiter le jugement d’êtres humains sur la qualité d’une traduction.
Concrètement, COMET22 reçoit trois textes à la fois : la phrase de départ, la traduction produite par une machine, et une traduction de référence écrite par un professionnel. Il a été entraîné à partir de jugements humains recueillis lors des campagnes d’évaluation WMT, de 2017 à 2020, au-dessus d’un modèle de langue multilingue déjà entraîné (XLM-R, publié par Meta AI). Il rend un seul nombre entre 0 et 1, où 1 représente une traduction parfaite. Le « 22 » du nom désigne la version que ses auteurs, l’équipe d’Unbabel, ont présentée à la tâche d’évaluation de la conférence WMT 2022 : c’est cette version précise, publiée sous le nom wmt22-comet-da, que Mozilla et notre propre registre emploient tous les deux.
Parce qu’il compare des sens plutôt que des mots, COMET22 reconnaît une reformulation correcte même quand elle n’emploie aucun des mots de la référence humaine, ce qu’une métrique de comptage pénaliserait à tort. C’est ce qu’il capte : une corrélation, mesurée et publiée, avec le jugement humain moyen sur un grand nombre de phrases. Ce n’est déjà pas rien. Ce qu’il ne capte pas est expliqué plus bas, une fois les chiffres posés.
Le relevé · notre registre, échelle de 0 à 1
Les scores de nos propres paires, lus dans le registre servi
Le registre que nous servons aujourd’hui décrit 112 paires de modèles pour 59 langues, l’anglais compris, qui leur sert de pivot commun. Pour chaque paire, Mozilla publie un score COMET22 mesuré sur son propre jeu de test, flores200-plus (la suite communautaire, tenue par l’Open Language Data Initiative, du jeu FLORES-200 de Meta AI : 3 001 phrases traduites par des professionnels, alignées dans plus de deux cents langues). Nous ne calculons aucun de ces scores : nous les reprenons du registre que Mozilla publie, et nous les servons tels quels à l’adresse /modeles/registre.json.
| Langue | Vers l’anglais | Depuis l’anglais |
|---|---|---|
| Français | 0,886 fr-en | 0,8653 en-fr |
| Espagnol | 0,8572 es-en | 0,854 en-es |
| Arabe | 0,8597 ar-en | 0,8596 en-ar |
| Hindi | 0,8724 hi-en | 0,7902 en-hi |
| Bengali | 0,8547 bn-en | 0,8471 en-bn |
| Chinois simplifié | 0,8482 zh-en | 0,8628 en-zh |
Pour situer l’échelle : la paire la mieux notée de tout le registre est l’anglais vers le finnois, à 0,9079 ; la moins bien notée parmi celles qui ont un score connu est l’anglais vers le marathi, à 0,7599. Une seule paire du registre n’a aucun score publié du tout : le bosniaque-croate-serbe vers l’anglais (hbs-en). Le modèle existe et se télécharge ; le chiffre qui dirait sa qualité, non, et nous ne l’inventons pas.
Meilleure paire du registre
0,9079anglais → finnois · en-fi
Moins bien notée
0,7599anglais → marathi · en-mr
Sans score connu
non publiébosniaque-croate-serbe → anglais · hbs-en
Les valeurs ci-dessus sont celles du registre au moment de la fabrication de cette page : un socle exact, lisible même sans JavaScript. Un script les recharge depuis /modeles/registre.json à l’ouverture de la page pour rester aligné sur ce qui est réellement servi ; s’il ne peut pas s’exécuter ou joindre le fichier, ce sont ces mêmes valeurs qui restent affichées.
Un autre relevé · page Mozilla, échelle sur 100
La comparaison publiée par Mozilla avec les traducteurs en ligne
Mozilla publie par ailleurs une page qui compare son propre moteur, bergamot (celui que notre boîte embarque), à Google Traduction, Microsoft Traducteur, NLLB et OPUS-MT : mozilla.github.io/translations/final-evals. Nous l’avons consultée le 20 août 2026 ; elle peut changer quand Mozilla réévalue ses modèles, ce que notre propre registre, figé au moment de la fabrication de ce site, ne fait pas. Un des jeux de test qu’elle affiche est flores200-plus, le même que celui de notre registre ; les deux autres, nommés bouquet et wmt24pp, n’y figurent pas du tout et ne doivent jamais être confondus avec lui. Voici, pour l’anglais-français, ce qu’elle donnait ce jour-là, score COMET22 sur cent (là où notre registre le sert sur une échelle de 0 à 1).
| Traducteur | bouquet | flores200-plus | wmt24pp |
|---|---|---|---|
| Google (v2) | 90,46 | 89,36 | 83,29 |
| Microsoft (3.0) | 89,63 | 88,44 | 80,77 |
| Bergamot (notre moteur) | 88,32 | 86,53 | 75,65 |
| OPUS-MT | 87,11 | 86,17 | 71,93 |
| NLLB | 86,14 | 85,87 | 71,96 |
Deux choses à en tirer, honnêtement. D’abord, sur flores200-plus, le chiffre que Mozilla publie pour bergamot, 86,53 sur cent, est exactement celui que notre propre registre sert pour en-fr, 0,8653 : même mesure, même source, seulement une autre échelle. Ensuite, sur les trois jeux de test, notre moteur reste troisième sur cinq, derrière Google et Microsoft : l’écart est de 2,14 points sur bouquet et de 2,83 points sur flores200-plus, mais il grimpe à 7,64 points sur wmt24pp. Le même moteur, la même paire de langues, un écart qui plus que triple selon le jeu de phrases sur lequel on mesure : un score ne voyage pas d’un jeu de test à l’autre sans changer.
Le même écart existe ailleurs. Sur l’anglais-hindi, toujours sur flores200-plus, Google atteint 83,06 et Microsoft 81,34 ; notre moteur, 79,02, à un centième de NLLB (79,03) et loin devant OPUS-MT (59,56). Le hindi est déjà, dans notre propre registre, la moins bien notée des six langues de la maison autres que l’anglais : la comparaison de Mozilla montre la même chose par un autre chemin, pas un défaut de mesure propre à l’une ou l’autre source.
Le pivot : deux traductions, deux occasions de se tromper
Aucune paire du registre ne relie directement deux langues autres que l’anglais. Traduire du bengali vers le hindi, par exemple, enchaîne deux modèles : bengali vers anglais, puis anglais vers hindi. Le raisonnement vaut pour n’importe quelle paire de langues tierces servie par cette boîte : une seule traduction est déjà une occasion de se tromper ; deux traductions à la suite en sont deux, et la seconde ne corrige pas les erreurs de la première, elle ajoute les siennes aux siennes.
- Bengali → anglais score connu : 0,8547
- Anglais → hindi score connu : 0,7902
- Bengali → hindi, le trajet complet jamais mesuré, jamais multiplié
Il y a plus honnête encore à dire. Le registre donne un score pour bengali vers anglais (0,8547) et un score pour anglais vers hindi (0,7902), chacun mesuré séparément par Mozilla. Il n’existe en revanche aucun score COMET22 pour la traduction complète, bengali vers hindi, parce que ce trajet en deux étapes n’est jamais évalué comme un tout, ni par Mozilla ni par nous. Nous ne multiplions pas les deux chiffres pour en fabriquer un troisième : ce serait présenter comme mesurée une chose que personne n’a mesurée. Ce que nous savons, ce sont deux taux d’erreur pris séparément ; ce que nous ne savons pas, et ne prétendons pas savoir, c’est celui du trajet complet.
Ce qu’un bon score ne prouve pas
Un score COMET22, aussi élevé soit-il, est une moyenne mesurée sur un jeu de test fixe de quelques milliers de phrases isolées, notées une par une. Il ne certifie rien sur la phrase précise que vous venez de faire traduire, et il reste particulièrement silencieux sur six points.
- Le sens tenu sur tout un texte long : chaque phrase est notée pour elle-même, jamais avec celles qui l’entourent, alors qu’un document réel doit garder le même terme et le même genre d’une phrase à l’autre.
- Les noms propres : le jeu de test ACES, publié à la conférence WMT en 2022, montre que les métriques apprises, COMET22 comprise, comptent parmi les erreurs les moins bien repérées celles qui touchent une entité nommée mal traduite.
- Les chiffres et les unités de mesure : la même étude fait le même constat sur un nombre changé ou une unité substituée, deux erreurs qui pèsent peu sur le score alors qu’elles peuvent tout changer pour qui lit le texte.
- Les négations : un « ne… pas » oublié inverse le sens d’une phrase sans en changer la forme ; une métrique qui compare des sens globaux n’est pas construite pour repérer ce seul mot manquant.
- Le registre de langue : une phrase rendue dans un ton familier là où l’usage attend un ton soutenu dit souvent, au fond, la même chose. Une métrique de sens ne voit pas une faute de ton, seulement une faute de sens.
- Les domaines techniques : COMET22 apprend sur des jugements humains recueillis sur du texte général (actualité, tourisme, articles encyclopédiques), pas sur le vocabulaire d’un métier précis.
Ces six manques ne sont pas des cas d’école : ce sont, très exactement, les familles de fautes qui reviennent le plus souvent dans une traduction automatique, avec des exemples réels et leurs sources. Elles sont détaillées sur les limites, dites franchement ; nous ne les répétons pas ici, pour ne pas en donner une version qui diverge.
Ce que cela change pour vous
Un bon score COMET22 dit une chose vraie et vérifiable : sur un grand nombre de phrases, mesurées par quelqu’un d’autre que nous, cette paire de langues se comporte mieux qu’une autre en moyenne. Il ne dit rien de sûr sur la phrase que vous avez sous les yeux. C’est pour cela qu’une sortie de cette boîte reste toujours étiquetée machine, jamais mélangée à une phrase déjà dite par une personne.
- Pour savoir sur quoi ne jamais se fier à la machine seule, avec des exemples documentés : les limites, dites franchement.
- Pour une phrase déjà écrite et traduite par une personne, avec son nom et sa source à l’appui plutôt qu’un score calculé : le dictionnaire de phrases humaines.
Sources
Vérifiées le 20 août 2026.
- Rei, Stewart, Farinha, Lavie, « COMET: A Neural Framework for MT Evaluation », actes d’EMNLP 2020
- Unbabel, fiche du modèle
wmt22-comet-da(COMET-22), Hugging Face, d’après Rei et al., « COMET-22: Unbabel-IST 2022 Submission for the Metrics Shared Task », WMT 2022 - Unbabel, « COMET: The New Standard in MT Evaluation »
- Amrhein, Moghe, Guillou, « ACES: Translation Accuracy Challenge Sets for Evaluating Machine Translation Metrics », actes de la conférence WMT 2022
- Mozilla, page de comparaison des évaluations finales de Firefox Translations
- Open Language Data Initiative, jeu de données FLORES+ (flores200-plus), suite du FLORES-200 de Meta AI
- Le registre des modèles servis par ce site, reconstruit depuis les données que Mozilla publie