Die meisten Diskussionen über die Sprachleistung von KI konzentrieren sich nach wie vor auf Englisch. Ein Modell, das in einem Standard-Benchmark gut abschneidet, wird als hochmodern gelobt und weltweit eingesetzt. Doch immer mehr Forschungsergebnisse, zuletzt der neue EU-MMLU-Datensatz der Europäischen Kommission, zeigen, dass eine gute Leistung im Englischen kaum etwas darüber aussagt, wie ein Modell Französisch, Ungarisch oder Maltesisch übersetzt. Für alle, die bei internationalen Veranstaltungen auf KI-Live-Übersetzung , ist diese Diskrepanz keine Randnotiz. Sie entscheidet darüber, ob ein Teilnehmer eine Keynote versteht oder sie komplett verpasst.
Dies ist von Bedeutung, da die zur Bewertung großer Sprachmodelle (LLMs) darüber entscheiden, welche Systeme eingesetzt und als vertrauenswürdig eingestuft werden. Sind diese Benchmarks fast ausschließlich auf Englisch basiert, geben sie keine Auskunft darüber, wie ein Modell in anderen Sprachen funktioniert, insbesondere nicht in den Sprachen der Zielgruppen, für die die KI-Live-Übersetzung gedacht ist.
EU MMLU ist ein neuer, mehrsprachiger Benchmark-Datensatz, der von der Generaldirektion Übersetzung der Europäischen Kommission (GD Übersetzung) veröffentlicht wurde. Er basiert auf Massive Multitask Language Understanding (MMLU), einem der am weitesten verbreiteten Rahmenwerke zur Evaluierung von Sprachlernprogrammen. MMLU testet Modelle anhand Tausender Multiple-Choice-Fragen aus 57 Fachgebieten, von Naturwissenschaften und Recht bis hin zu Ethik und öffentlichen Angelegenheiten.
EU MMLU passt dieses Rahmenwerk speziell an den EU-Kontext an. Es konzentriert sich auf sieben Fachgebiete, die aufgrund ihrer Relevanz für die europäischen Institutionen ausgewählt wurden, und deckt derzeit 16 EU-Amtssprachen ab, darunter Kroatisch, Tschechisch, Niederländisch, Französisch, Deutsch, Griechisch, Ungarisch, Irisch, Italienisch, Litauisch, Polnisch, Portugiesisch, Rumänisch, Slowakisch und Slowenisch. Weitere Sprachen sind geplant. Anstatt einfach bestehende englische Fragen zu übersetzen, verfolgte das Projekt das Ziel, Bedeutung, Schwierigkeitsgrad und Testwert in allen Sprachversionen beizubehalten, sodass eine Punktzahl in Polnisch dieselbe Bedeutung hat wie eine Punktzahl in Französisch.
Die meisten Datensätze zur Evaluierung von KI-Systemen wurden in englischer Sprache erstellt und spiegeln englischsprachige Bildungs-, Kultur- und Gesellschaftskontexte wider. Ein Modell, das überwiegend mit englischen Daten trainiert und getestet wurde, kann sehr leistungsfähig erscheinen, während seine tatsächliche Leistung in anderen Sprachen weitgehend ungemessen bleibt.
Genau diese Lücke wollte die Generaldirektion Übersetzung schließen. Wie die EU-MMLU-Mitteilung verdeutlicht, kann ein Modell im Englischen gute Ergebnisse erzielen, während es im Französischen, Ungarischen oder Maltesischen deutlich schlechter abschneidet. Das eigentliche Problem ist nicht, dass Modelle andere Sprachen gar nicht verarbeiten können. Vielmehr liegt es daran, dass Standard-Benchmarks sie selten gründlich genug testen, um ihre Schwächen aufzudecken. So bleiben Mängel in Grammatik, Nuancen oder fachspezifischer Terminologie unbemerkt, bis ein reales Publikum auf die Ergebnisse angewiesen ist.
Gerade bei der KI-gestützten Live-Übersetzung hat diese uneinheitliche Leistung direkte Konsequenzen. Ein System mag einfache englische Ausgangstexte gut verarbeiten, nur um dann Fehler, ungelenke Formulierungen oder Bedeutungsverluste einzuführen, sobald derselbe Inhalt in eine weniger erprobte Zielsprache übersetzt wird – und zwar genau dann, wenn Genauigkeit für einen Zuhörer, der dem Geschehen in Echtzeit folgt, am wichtigsten ist.
Sprachliche Leistungsunterschiede sind nur ein Teil des Gesamtbildes. Die Generaldirektion Übersetzung hat außerdem Qualitätskriterien für mehrsprachige Benchmarking-Verfahren veröffentlicht, die über die Übersetzungsgenauigkeit hinausgehen und prüfen, wie gut ein KI-Modell EU-Werte widerspiegelt und kulturspezifische Inhalte verarbeitet, darunter Redewendungen, Humor, Anspielungen, Datums- und Zahlenformate sowie Unterschiede im erwarteten Tonfall oder der Höflichkeit.
Genau diese Elemente machen Live-Übersetzungen so schwierig. Ein Konferenzredner, der regionale Redewendungen, kulturspezifische Bezüge oder einen durch lokale Konventionen geprägten Formalitätsgrad verwendet, verlässt sich auf mehr als eine wörtliche Übersetzung. Ein KI-System, dem diese Nuancen einer Sprache fehlen, übersetzt zwar die Wörter wörtlich korrekt, verfehlt aber möglicherweise die beabsichtigte Bedeutung oder den Tonfall völlig. Bei einer mehrsprachigen Veranstaltung kann eine solche Diskrepanz die Wirkung einer Botschaft auf Teile des Publikums beeinflussen, selbst wenn niemand den technischen Fehler bemerkt.
Ein besonders bemerkenswertes Merkmal des EU MMLU ist seine Methodik. Anders als die meisten mehrsprachigen Benchmarks, die sich primär auf maschinelle Übersetzung zur Generierung nicht-englischsprachiger Testfragen stützen, verfolgte der EU MMLU einen nutzerzentrierten Ansatz. Die Generaldirektion Übersetzung arbeitete mit fast 250 studentischen Übersetzern und Projektmanagern des europäischen Masterstudiengangs Übersetzung (EMT) zusammen, die aus 21 Universitäten in ganz Europa stammten, um über 1.000 Benchmark-Fragen zu übersetzen und zu überarbeiten.
Diese Unterscheidung ist bedeutsamer, als es zunächst scheinen mag. Ein auf maschineller Übersetzung basierender Benchmark birgt die Gefahr, dieselben Schwächen zu übernehmen, die er eigentlich aufdecken soll. Er vergleicht die Ergebnisse eines Modells mit denen eines anderen, anstatt sie an einem authentischen menschlichen Standard zu messen. Die menschliche Überprüfung verankert die Bewertung im tatsächlichen Sprachgebrauch der Menschen – dem Standard, der auch bei Live-Übersetzungen in realen Veranstaltungen entscheidend ist, wo das Publikum aus Menschen besteht und die Toleranz für subtile Übersetzungsfehler gering ist.
Die Generaldirektion Übersetzung formuliert ihr langfristiges Ziel klar: die Etablierung eines neuen Standards für die mehrsprachige KI-Evaluierung in Europa, damit KI-Systeme sprach- und kulturübergreifend konsistent funktionieren und nicht primär in englischsprachigen Umgebungen. Wird dieses Ziel erreicht, reichen die praktischen Vorteile weit über die Forschungslabore hinaus.
Für Organisationen, die internationale Konferenzen, institutionelle Treffen oder globale Firmenveranstaltungen ausrichten, bedeutet ein besseres mehrsprachiges Benchmarking mehr Transparenz darüber, welchen KI-Systemen in welchen Sprachen vertraut werden kann. So wird vermieden, erst mitten in einer Veranstaltung festzustellen, dass ein bestimmtes Tool außerhalb des Englischen nicht optimal funktioniert. Dies ermöglicht fundiertere Entscheidungen darüber, wo KI-basierte Live-Übersetzung zuverlässig ist und wo ein hybrider Ansatz, der KI mit menschlicher Dolmetschung kombiniert, Bedeutung und Nuancen für eine bestimmte Sprache oder Zielgruppe besser wahrt.
Benchmarks wie EU MMLU werden nicht alle Lücken in der mehrsprachigen KI über Nacht schließen, aber sie stellen einen bedeutenden Wandel in der Leistungsmessung und -kommunikation dar. Mit zunehmender Reife dieser Bewertungsstandards erhalten Veranstalter, Institutionen und Kommunikationsteams eine klarere Grundlage für die Auswahl von KI-Live-Übersetzungslösungen, die für ein wirklich mehrsprachiges Publikum geeignet sind. Um zu erfahren, wie Interprefy die KI-Live-Übersetzung über verschiedene Sprachen hinweg angeht, erkunden Sie unsere KI-Sprachübersetzungsplattform.