LLM-vertaalbenchmark
Een open vergelijking van grote taalmodellen op vertaalkwaliteit. Dit meet de modellen, niet vertaalproducten, en Fink is geen deelnemer.
Benchmarkresultaten laden
Vergeleken modellen
Zet een model uit om het uit de analyses hieronder te verwijderen.
Directe vergelijking
Hoe dit gemeten is
Elke bewering op deze pagina komt uit de hierboven genoemde run. De methode, en de grenzen ervan, in detail:
Dataset
15 Engelse bronzinnen uit de FLORES-200 devtest-split, afkomstig uit Wikinews, Wikibooks en Wikivoyage, vertaald naar 25 doeltalen. Moeilijkheid wordt puur bepaald door zinslengte: makkelijk onder 15 woorden, gemiddeld 15 tot 30, moeilijk boven 30. FLORES-200 is een openbare dataset, dus we kunnen niet uitsluiten dat deze zinnen in de trainingsdata van de modellen voorkwamen.
Beoordeling
Elk paar vertalingen wordt het beoordelaarsmodel twee keer voorgelegd, de tweede keer in omgekeerde volgorde. De beoordelaar ziet ook de professionele FLORES-200-referentievertaling van die zin, uitdrukkelijk als één geldige weergave en niet als het enige juiste antwoord, zodat hij de betekenis van de brontekst daaraan kan toetsen in plaats van in zijn eentje gezaghebbend te moeten zijn over 25 talen. De beoordelaar mag alleen A, B of gelijkspel antwoorden. Een model wint een vergelijking alleen als beide volgordes het eens zijn. Spreken de twee volgordes elkaar tegen, dan wordt het paar een tweede keer in beide volgordes gelezen: is die ronde het eens, dan geldt haar uitspraak, en zo niet, dan noteren we het paar als gelijkspel, want een beoordelaar die twee vertalingen over vier lezingen heen niet uit elkaar kan houden, zegt daarmee dat ze gelijkwaardig zijn. Die regel ligt vooraf vast, dus hij kan een betwist paar op gelijkspel laten uitkomen, maar nooit een winnaar verzinnen. Hoe vaak de eerste ronde zichzelf tegensprak, staat hierboven als positievertekening. Numerieke scores worden over alle lezingen gemiddeld.
Automatische metrieken
chrF++ en BLEU worden berekend tegen de professionele FLORES-200-referentievertalingen. Geef hier de voorkeur aan chrF++: het werkt op teken-n-grammen en blijft betekenisvol voor talen die woorden niet met spaties scheiden. BLEU wordt alleen gerapporteerd voor talen waar woordtokenisatie goed gedefinieerd is, en anders onderdrukt.
Bekende beperkingen
Vijftien zinnen per taal is een kleine steekproef, en alle bronteksten zijn Engels en komen uit de Wikipedia-familie. Over vertalen naar het Engels, of over de e-mail-, interface- en documentteksten die mensen daadwerkelijk vertalen, zegt dit dus niets. Eén enkel beoordelaarsmodel beoordeelt alle paren, zonder menselijke validatie. Latentie wordt van begin tot eind vanuit Europa gemeten en weerspiegelt de reasoning-configuratie van elk model, niet de ruwe snelheid.
Naar moeilijkheid
Naar schriftsysteem
Winstpercentage over besliste vergelijkingen, gegroepeerd naar het schrift van de doeltaal. Dit patroon vonden we in de data, we zijn er niet naar op zoek gegaan. Lees het dus als een spoor dat navolging verdient, niet als een vaststaand resultaat.
Naar taal
Winstpercentage per doeltaal. De steekproef per taal is klein, lees dit als textuur, niet als ranglijst.
Directe vergelijkingsmatrix
Alle vergelijkingen
Benchmarkresultaten laden
| Doel | Bron | Moeilijkheid | Winnaar | chrF++ | BLEU |
|---|
Probeer de vertaler achter de benchmark
Fink vertaalt en legt daarna uit wat er veranderd is en waarom. Om te beginnen heb je geen account nodig.
App openen