← Terug naar blog

Mistral tegen GLM: een Frans en een Chinees model, gesplitst door het schriftsysteem

Algemeen vertaalt geen van beide modellen beter. Dat hield stand over 375 vertaalparen, 25 doeltalen en 1.500 API-aanroepen. Uitgesplitst naar schriftsysteem liggen de twee echter helemaal niet dicht bij elkaar: Mistral Medium 3.5 is sterker bij het vertalen naar talen met een Latijns schrift, en GLM 5.2 is sterker bij al het andere. Een verschil van 23 punten, statistisch significant, en precies in de richting die je op een kaart zou gokken. Mistral AI bouwt in Parijs. GLM komt van Zhipu AI, in Peking.

De richting is niet het interessante deel. Interessant is de omvang, en het feit dat het überhaupt zichtbaar is: dezelfde 162 vergelijkingen die algemeen geen winnaar aanwijzen, vallen keurig uiteen zodra je ze op schriftsysteem sorteert. De trainingsdata van een model laten een vingerafdruk achter in wat het goed vertaalt, en die vingerafdruk is duidelijk genoeg om je modelkeuze te veranderen.

Fink draait op Mistral-modellen, op EU-infrastructuur, omdat we niet willen dat klantteksten de EU verlaten. Dat is een beperking die we om privacyredenen hebben aanvaard, en de eerlijke zorg bij elke beperking is dat ze kwaliteit kost. Deze benchmark was onze controle.

375vertaalparen
25doeltalen
1.500API-aanroepen
p=0,003naar schriftsysteem

Mistral tegen GLM: het korte antwoord

Mistral Medium 3.5 GLM 5.2
Overwinningen, van 162 beslist 73 89
Winstpercentage 45,1 % (37,6-52,7) 54,9 % (47,3-62,4)
Naar Latijnse schriften 55,8 % 44,2 %
Naar niet-Latijnse schriften 32,9 % 67,1 %
chrF++ 52,9 54,5
BLEU 32,0 33,6
Score van de judge, totaal 8,28 8,28
Latentie, mediaan 987 ms 1.082 ms
Latentie, 95e percentiel 2.113 ms 34.191 ms

Lees de bovenste rijen en de twee modellen zijn niet uit elkaar te houden. Lees de twee vetgedrukte rijen en het zijn bij lange na niet dezelfde modellen. Dat is het hele verhaal. De rest van dit artikel gaat over hoe we daar kwamen en hoeveel vertrouwen het verdient.

Mistral en GLM opgesplitst naar schriftsysteem: Mistral wint 55,8 procent van de beslissende vergelijkingen naar Latijnse schriften, GLM wint 67,1 procent naar niet-Latijnse schriftenMistral en GLM opgesplitst naar schriftsysteem: Mistral wint 55,8 procent van de beslissende vergelijkingen naar Latijnse schriften, GLM wint 67,1 procent naar niet-Latijnse schriften
Twee modellen, één benchmark, en een uitkomst die volledig afhangt van de taal waarnaar je vertaalt.

Mistral wint bij Latijns schrift, GLM bij niet-Latijns

Dit is het deel waar je iets mee kunt. Over 86 beslissende vergelijkingen naar talen met een Latijns schrift won Mistral 55,8 %. Over 76 beslissende vergelijkingen naar niet-Latijnse schriften won het 32,9 %. Een toets op twee proporties zet dat verschil van 23 punten op p = 0,003, wat betekent dat een verschil van deze omvang ongeveer drie op de duizend keer op toeval berust.

Winstpercentage per schriftsysteem met 95-procents betrouwbaarheidsintervallen: Mistral 55,8 procent naar Latijns, GLM 67,1 procent naar niet-LatijnsWinstpercentage per schriftsysteem met 95-procents betrouwbaarheidsintervallen: Mistral 55,8 procent naar Latijns, GLM 67,1 procent naar niet-Latijns
De betrouwbaarheidsintervallen van beide schriftgroepen raken elkaar nauwelijks. Dit is de enige vergelijking in deze run die de modellen duidelijk scheidt.

Niets hiervan is schokkend, en we doen ook niet alsof. Tokenisatie en de verdeling van trainingsdata hangen allebei samen met het schriftsysteem, en de eigen talen van een lab zijn de talen waarvoor het de meeste tekst heeft en de meeste reden om te testen. Een model dat naar verhouding meer Devanagari, Thai en Bengaals heeft gezien en dat efficiënter tokeniseert, heeft daar een echt voordeel dat niets te maken heeft met de vraag of het in het algemeen beter vertaalt.

Wat wél opvalt, is dat het effect groot genoeg is om dwars door een benchmark heen zichtbaar te zijn die verder niets vindt. Algemeen zijn deze twee modellen een muntworp. Groepeer dezelfde 162 vergelijkingen op schriftsysteem en er valt een verschil van 23 punten uit, bij p = 0,003. Als de herkomst van een model zo goed leesbaar is in de uitvoer, dan is "welk model vertaalt het beste" de verkeerde vraag. De bruikbare vraag is: het beste waarnaartoe.

Het overzicht per taal zegt hetzelfde, maar fijnmaziger. Sommige talen zijn eenduidig: GLM won elke beslissende vergelijking naar het Bengaals, Mistral elke vergelijking naar het Indonesisch. Andere zijn volstrekt in evenwicht. De overwinningen van Mistral clusteren in Europese talen met een Latijns schrift zoals Duits, Tsjechisch, Pools en Roemeens, plus de Latijns geschreven Aziatische talen Indonesisch, Vietnamees en Turks. Die van GLM clusteren in Thai, Hindi, Chinees, Koreaans en Perzisch.

Winstpercentage per doeltaal voor 25 talen, gegroepeerd naar schriftsysteem, met Mistral voor bij Latijnse schriften en GLM voor bij niet-LatijnseWinstpercentage per doeltaal voor 25 talen, gegroepeerd naar schriftsysteem, met Mistral voor bij Latijnse schriften en GLM voor bij niet-Latijnse
Elke balk splitst de beslissende vergelijkingen van één taal. De n naast elke taal geeft aan hoeveel dat er waren: losse taalbalken zijn een aanwijzing, geen bewijs.

Twee kanttekeningen, en ze doen ertoe. We hebben op schriftsysteem gegroepeerd nadat we de data hadden gezien, niet ervoor, dus lees p = 0,003 als een sterk spoor en niet als een schone toets. Dat de richting voorspelbaar was helpt; dat juist deze indeling niet vooraf was vastgelegd niet. En met vijftien zinnen per taal kan elke afzonderlijke rij van die grafiek bij een nieuwe run flink verschuiven. Het gegroepeerde resultaat is het betrouwbare deel, de losse talen zijn textuur. Kiest u een model voor één specifiek talenpaar, dan vertelt deze grafiek waar u moet beginnen zoeken, niet wat u moet concluderen. Schriften brengen ook eigen moeilijkheden mee die verder gaan dan tokenisatie, wat mede de reden is dat we ondersteuning voor uitspraak hebben gebouwd voor talen die de meeste mensen niet kunnen uitspreken.

Algemeen eindigden de twee modellen gelijk

GLM 5.2 won 89 vergelijkingen. Mistral Medium 3.5 won er 73. Van de 375 in totaal waren er 162 beslissend en 213 niet. Een tekentoets over die 162 geeft p = 0,21: een verschil van deze omvang zou je bij een eerlijke munt ongeveer één op de vijf keer zien.

Totaal winstpercentage met 95-procents betrouwbaarheidsintervallen: Mistral 45,1 procent, GLM 54,9 procent, tekentoets p is 0,21Totaal winstpercentage met 95-procents betrouwbaarheidsintervallen: Mistral 45,1 procent, GLM 54,9 procent, tekentoets p is 0,21
De intervallen overlappen over vrijwel hun hele bereik, wat hetzelfde op een andere manier zegt.

Een eerdere run van dezelfde benchmark had Mistral voor, 107 tegen 98. De richting van de uitslag kantelde tussen de runs. Dat is precies wat je verwacht als het verschil ruis is: gooi dezelfde munt twee keer en het aantal verschuift, terwijl de munt niet veranderd is. Het is ook de reden dat we niet beweren dat GLM 10 % beter is, en dat we een week eerder niet het omgekeerde zouden hebben beweerd.

Wat chrF++ en BLEU zeggen

Paarsgewijs beoordelen is niet de enige manier om een vertaling te scoren. Elke uitvoer is ook vergeleken met de FLORES-200-referentie, de vertaling die een professionele vertaler maakte, met chrF++ en BLEU. Dat zijn automatische gelijkenismaten: ze kunnen niet zeggen of een vertaling goed is, alleen hoezeer ze lijkt op een vertaling waarvan we weten dat ze goed is.

chrF++, BLEU en judge-scores voor Mistral en GLM, alle binnen ongeveer 1,6 punt van elkaarchrF++, BLEU en judge-scores voor Mistral en GLM, alle binnen ongeveer 1,6 punt van elkaar
Drie onafhankelijke metingen, drie bijna-gelijkspelen, alle een haarbreedte in dezelfde richting.

chrF++ kwam uit op 52,9 voor Mistral en 54,5 voor GLM. BLEU op 32,0 en 33,6. En de gemiddelde score van de judge zelf, op een schaal van één tot tien over nauwkeurigheid, vloeiendheid en gepastheid, kwam voor beide modellen uit op 8,28, identiek tot op drie decimalen.

Die overeenstemming is het punt. Drie metingen die op volstrekt verschillende manieren werken zeggen alle drie "te dicht bij elkaar om te beslissen", en neigen alle drie een haarbreedte dezelfde kant op. Een gelijkspel dat één keer opduikt kan een te zwakke toets zijn. Een gelijkspel dat opduikt in het aantal overwinningen, in de referentiematen én in de absolute scores is een gelijkspel.

Probeer Fink voor je volgende vertaling

Zie de vertaling, elke wijziging en het waarom op één scherm.

App openen

Hoe de meningsverschillen er concreet uitzien

Percentages verbergen wat een overwinning eigenlijk is. Hier dus één zin, door beide modellen naar vier talen vertaald, met wat de judge ervan maakte. Het is elke keer dezelfde Engelse zin:

This sediment was necessary for creating sandbars and beaches, which served as wildlife habitats.

Vrij vertaald: dit sediment was nodig om zandbanken en stranden te vormen, die dienstdeden als leefgebied voor wilde dieren.

Vier talen, twee overwinningen per kant, en vrijwel steeds hangt het hele meningsverschil aan één inhoudswoord: sandbar, de zandbank. Dat is iets specifieks, een zandrug in een rivier of voor een kust. Het is geen strand, geen duin en geen zandstaaf.

Indonesisch Mistral wint
Mistral Sedimen ini diperlukan untuk membentuk gosong pasir dan pantai, yang berfungsi sebagai habitat satwa liar.
GLM Sedimen ini diperlukan untuk menciptakan sandbar dan pantai, yang berfungsi sebagai habitat satwa liar.
Referentie Sedimen ini diperlukan untuk menciptakan gundukan pasir dan pantai, yang berfungsi sebagai habitat satwa liar.

GLM gaf het op en liet sandbar in het Engels staan. Mistral gebruikte gosong pasir, de echte Indonesische term. Al het andere is bijna identiek: de tweede bijzin is in beide woord voor woord hetzelfde.

Hindi Mistral wint
Mistral यह तलछट रेत के टीलों और समुद्र तटों के निर्माण के लिए आवश्यक थी, जो वन्यजीवों के आवास के रूप में काम आते थे।
GLM यह अवसाद रेतीली छड़ें और समुद्र तटों के निर्माण के लिए आवश्यक था, जो वन्यजीव आवासों के रूप में कार्य करते थे।
Referentie वाइल्डलाइफ़ हैबिटेंट्स के रूप में काम करने वाली रेती और तटों को बनाने के लिए गाद ज़रूरी थी.

Twee foute woorden in één zin. GLM's अवसाद is een bestaand woord, maar het betekent vooral neerslachtigheid en niet de geologische term, en रेतीली छड़ें betekent letterlijk "zandige staven". Mistrals रेत के टीलों klopt ook niet helemaal, het betekent zandduinen, maar een duin is tenminste iets dat aan een kust voorkomt.

Thai GLM wint
Mistral ตะกอนนี้จำเป็นต่อการก่อตัวของหาดทรายและชายหาด ซึ่งทำหน้าที่เป็นแหล่งที่อยู่อาศัยของสัตว์ป่า
GLM ตะกอนนี้จำเป็นสำหรับการสร้างสันทรายและหาดทราย ซึ่งทำหน้าที่เป็นแหล่งที่อยู่อาศัยของสัตว์ป่า
Referentie การสร้างตลิ่งทรายและหาดทรายซึ่งทำหน้าที่เป็นถิ่นที่อยู่ของสัตว์ป่านั้นจำเป็นต้องใช้ตะกอนนี้

GLM gebruikte สันทราย voor zandbank en หาดทราย voor strand: twee landvormen, twee woorden. Mistral gebruikte หาดทราย en ชายหาด, die in het Thai vrijwel synoniem zijn voor strand. De bronzin benoemt twee verschillende dingen. De ene vertaling benoemt twee dingen, de andere twee keer hetzelfde.

Bengaals GLM wint
Mistral এই পলি বালিয়াড়ি এবং সমুদ্রসৈকত সৃষ্টির জন্য প্রয়োজনীয় ছিল, যা বন্যপ্রাণীর আবাসস্থল হিসেবে কাজ করত।
GLM এই পলিটি বালুচর এবং সৈকত তৈরির জন্য প্রয়োজনীয় ছিল, যা বন্যপ্রাণীদের বাসস্থান হিসেবে কাজ করত।
Referentie বালুচর এবং সমুদ্রসৈকত তৈরি করার জন্য এই অধঃক্ষেপের প্রয়োজন ছিল, যা বন্যজীবনের বাসস্থান হিসাবে কাজ করে।

GLM koos বালুচর, precies het woord waar ook de professionele vertaler naar greep. Mistral koos বালিয়াড়ি, opnieuw een zandduin. chrF++ geeft de judge hier gelijk: 48,4 tegenover 40,9.

Twee van deze vier liepen af zoals het verschil in schriftsysteem doet verwachten, twee niet. Zo ziet een voorsprong van 23 punten er van dichtbij uit: als een tendens, niet als een regel. Hindi is daarvan het duidelijkste voorbeeld. Mistral verloor Hindi over de hele run met 2 tegen 6, en deze zin is toevallig een van de twee die het won.

Zo hebben we twee vertaalmodellen getest

Vijftien Engelse zinnen uit FLORES-200, een openbare benchmarkset met professioneel vertaalde teksten, elk door beide modellen vertaald naar 25 talen met exact de prompt die onze app in productie gebruikt. Dat zijn 750 vertalingen. Vervolgens vergeleek een derde model, Claude Sonnet 5, als judge elk paar op nauwkeurigheid, vloeiendheid en gepastheid, en elke vergelijking liep een tweede keer met de kandidaten verwisseld. Nog eens 750 aanroepen. Vijftienhonderd in totaal, ongeveer een uur doorlooptijd.

Benchmarkproces: één bronzin, twee vertalingen, een judge die twee keer draait met omgewisselde volgorde, en drie mogelijke uitkomstenBenchmarkproces: één bronzin, twee vertalingen, een judge die twee keer draait met omgewisselde volgorde, en drie mogelijke uitkomsten
Elke vergelijking doorloopt het proces twee keer, bij de tweede ronde met verwisselde A- en B-labels. Alleen overeenstemming over beide rondes telt als resultaat.

Alles staat op de LLM-benchmarkpagina, die automatisch wordt bijgewerkt bij elke nieuwe run: winstpercentages met betrouwbaarheidsintervallen, uitsplitsingen naar moeilijkheidsgraad en taal, en elk van de 375 vergelijkingen met de brontekst, beide vertalingen, de professionele referentie en de redenering van de judge. Denkt u dat de judge er bij één de mist in ging, dan kunt u het nakijken.

Wat dit betekent als u met een LLM vertaalt

Kijk naar wat die vier meningsverschillen gemeen hebben. Elk ervan is één verkeerd gekozen inhoudswoord, midden in een zin die verder vloeiend, grammaticaal en volstrekt zelfverzekerd is. Niets aan रेतीली छड़ें of ชายหาด oogt fout op de pagina. Je hoort het niet, je ziet het niet aan de vorm van de zin, en wie de taal niet leest heeft geen enkele manier om te weten dat het gebeurd is. LLM's produceren elke keer vloeiend, zelfverzekerd proza, ook wanneer ze het mis hebben. Een verkeerd vertaalde vakterm, een nuance die verdampt is, een register dat van formeel naar amicaal afglijdt: alles leest net zo soepel als een correcte vertaling. Dat zijn precies de fouten die een lezer niet kan zien zonder vergelijkingsmateriaal, wat deel uitmaakt van het antwoord op de vraag waarom LLM's zo goed vertalen en waarom die vloeiendheid tegelijk gevaarlijk is.

Dit is het probleem waarvoor Fink is gebouwd. In plaats van u te vragen een zwarte doos te vertrouwen, laat Fink de vertaling zien, elke wijziging onderweg en de redenering erachter. De MQM-kwaliteitscontrole voert een tweede ronde uit die concrete problemen markeert, in nauwkeurigheid, vloeiendheid, terminologie en stijl, en u accepteert of verwerpt elke suggestie. Het insights-paneel geeft een terugvertaling zodat u de betekenis kunt controleren, betekenisnotities voor nuance, en de uitspraak voor talen die u niet kunt uitspreken. De benchmark vertelde ons dat onze modelkeuze geen kwaliteit kost. Het product vertelt u wat de vertaling werkelijk doet. Wilt u de bredere context over hoe mensen er überhaupt toe kwamen met deze modellen te vertalen, dan hebben we de gebruikscijfers apart bekeken.

Veelgestelde vragen

Welk LLM is het beste om mee te vertalen? Dat hangt af van de doeltaal. In deze benchmark was noch Mistral Medium 3.5 noch GLM 5.2 algemeen significant beter; de verhouding was 73 tegen 89 overwinningen uit 162 beslissende vergelijkingen (p = 0,21). Maar Mistral won 55,8 % naar talen met een Latijns schrift en GLM 67,1 % naar niet-Latijnse schriften, en dat verschil is significant bij p = 0,003.

Is Mistral of GLM beter om mee te vertalen? Algemeen geen van beide. Mistral is de sterkere keuze naar talen met een Latijns schrift zoals Duits, Frans, Pools en Indonesisch. GLM is de sterkere keuze naar Thai, Hindi, Bengaals, Chinees, Koreaans en Arabisch. GLM is bovendien gemiddeld ongeveer zes keer trager, omdat het standaard met reasoning aan draait.

Is Mistral goed in vertalen? Ja. Het scoorde 8,28 van de 10 op de totaalbeoordeling van de judge, 52,9 chrF++ en 32,0 BLEU tegenover professionele referentievertalingen, statistisch gelijk aan een concurrent met reasoning aan, en dat met een mediane latentie van onder een seconde. Het is het model dat Fink in productie gebruikt, op EU-infrastructuur.

Welk model is beter voor Chinees, Japans of Arabisch? GLM lag in deze run voor bij Chinees, Koreaans, Thai, Hindi, Bengaals, Arabisch en Perzisch. Japans was de uitzondering onder de niet-Latijnse schriften; daar lag Mistral voor. Met minder dan tien beslissende vergelijkingen per taal geldt elke afzonderlijke taal als een spoor om te volgen, niet als een vaststaand resultaat.

Waarom is GLM 5.2 trager dan Mistral? Het draait standaard met reasoning aan, wat verborgen tokens genereert vóór het antwoord. Dat verschuift de mediaan nauwelijks, 1.082 ms tegenover 987 ms, maar het verschuift de staart enorm: 34.191 ms tegenover 2.113 ms op het 95e percentiel.

Wat is LLM-as-judge bij vertaalevaluatie? Een derde LLM vergelijkt twee vertalingen van dezelfde brontekst en kiest de betere. Wij lieten elke vergelijking twee keer lopen met omgewisselde volgorde om de consistentie te toetsen. De judge sprak zichzelf in 25 % van de gevallen tegen, een nuttige herinnering dat LLM-oordelen ruis bevatten en geen vaststaande waarheid zijn.

Hoe test je een vertaalmodel? Je vertaalt een vaste set bronzinnen naar veel doeltalen en vergelijkt daarna de uitvoer. Wij gebruikten FLORES-200-zinnen, 25 doeltalen, paarsgewijze LLM-beoordeling met controle op de volgorde, en chrF++- en BLEU-scores tegenover professionele referentievertalingen.

Wat is chrF++? Een maat die een vertaling met een referentie vergelijkt door naar teken-n-grammen te kijken. Anders dan BLEU, dat op spaties splitst, werkt chrF++ ook voor talen als Chinees, Japans en Thai, die woorden niet met spaties scheiden.

Methode en beperkingen

De benchmark vergelijkt mistral-medium-3.5 en zai-glm-5-2 (GLM 5.2), beoordeeld door Claude Sonnet 5. Beide kandidaten worden bediend vanaf hetzelfde EU-eindpunt, dus de infrastructuur is constant gehouden. De volledige methode en de code staan beschreven op de benchmarkpagina, en elke grafiek in dit artikel wordt rechtstreeks uit de resultaten van die run gegenereerd.

Wat dit niet aantoont: vijftien zinnen per taal is een kleine steekproef, en de intervallen per taal zijn breed genoeg dat de grafiek per taal als textuur en niet als ranglijst gelezen moet worden. Het verschil in schriftsysteem is in de data gevonden en niet vooraf vastgelegd, dus de p-waarde ervan is eerder een sterk spoor dan een bevestigd effect. Elke bronzin is Engels en afkomstig uit Wikipedia-materiaal, dus niets hier zegt iets over vertalen naar het Engels, of over de e-mail-, interface- en documentteksten die de meeste mensen daadwerkelijk vertalen. Moeilijkheidsgraad is puur op zinslengte gedefinieerd. FLORES-200 is openbaar, dus we kunnen niet uitsluiten dat precies deze zinnen in de trainingsdata van een van beide modellen voorkwamen. Eén judge-model beoordeelde elk paar, zonder menselijke validatie. Laat je elke vergelijking een tweede keer lopen met omgewisselde volgorde, dan verandert de judge zijn antwoord bij 92 van de 375: een kwart van zijn oordelen overleefde de controle dus niet, en dat percentage is het beste beschikbare bewijs voor hoeveel gewicht zo'n oordeel draagt. Ten slotte draaiden de twee modellen niet in dezelfde inferentiemodus, en daarom worden hun latenties apart gerapporteerd en nooit samen gemiddeld.