Abschnitt: Technologie & KI Autor: IN Leselänge: ~27 Min Quellen und weiterführende Literatur: 22 Artikel Themen: KI, Benchmarks, ChatGPT, Gemini, Claude, Grok, Tschechisch, Modellbewertung SEO / Arbeitstitel: ChatGPT vs. Gemini vs. Claude vs. Grok: Welche KI ist die beste?
Die Frage ist: Welche KI ist die beste – ChatGPT, Gemini, Claude oder Grok? Es klingt einfach, bis wir merken, dass wir eine Sache nicht vergleichen. Arenapräferenz ist nicht Korrektheit. SWE-bench Verified ist nicht Ihr GitLab und fünf Versuche mit maximalem Aufwand sind kein einziger Versuch. MMLU ist keine allgemeine Intelligenz. Die englische Rangfolge entspricht nicht dem tschechischen Sprachgebrauch. Erst wenn diese vier Dinge getrennt werden, ist es möglich zu lesen, was die öffentlichen Tabellen ab September 2026 aggregieren – und was davon für die Tschechische Republikdie Arbeit fließt nicht.
1. Jedes Ranking vertritt eine andere Aufgabe
Stellen wir uns vor, dass vier Leser dasselbe Wort „am besten“ lesen. Der Produktmanager öffnet LMArena und zeigt die ersten Zeilen der öffentlichen Bestenliste. Er hat Recht, dass die anonymen paarweisen Präferenzen der Leute erfassen, welche Antwort den Benutzern besser gefällt. Paper Chatbot Arena meldet über 240.000 Stimmen von April 2023 bis Januar 2024 und etwa 90.000 Benutzer. Es misst jedoch nicht sachliche Fehler, tschechische Grammatik oder tschechische Rechtsprechung [1].
Der Entwicklungsleiter zückt die SWE-Bank. Er hat Recht, dass der nach bestandenen Tests gelöste Anteil härter ist als der Eindruck aus dem Chat. Aber SWE-Bench Verified besteht aus 500 von Menschen verifizierten Instanzen von Python-GitHub-Problemen. Die ursprüngliche SWE-Bench basiert auf 12 Open-Source-Python-Repositories. Dies ist nicht Ihr Unternehmens-Monorepo, Ihr GitLab, SAP, Ihre interne Bibliothek oder das tschechische Cybersicherheitsgesetz [6][7].
Der Lehrer zeigt MMLU. Er hat Recht, dass der genannte akademische Satz aus 57 Fächern und 15.908 Fragen besteht. Es misst jedoch nicht die offene Arbeit mit Dokumenten, die tschechischen Realitäten oder ob das Modell Unsicherheit zulässt. Und im Anschluss an die Arbeit von Gem et al. Es ist nicht länger möglich, so zu tun, als ob jeder Unterschied in der rohen MMLU reine Modellfähigkeit sei: Die Autoren von MMLU-Redux schätzten, dass 6,49 Prozent der Fragen einen Schlüsselfehler aufwiesen [9][10].
Tschechischer Benutzer fügt BenCzechMark hinzu. Er hat Recht, dass Tschechisch nicht nur übersetztes Englisch ist. BenCzechMark verfügt über 50 Aufgaben, von denen 14 neu zusammengestellt wurden, in 8 Kategorien, mit überwiegend muttersprachlichen Tschechisch- und etwa 10 Prozent maschinell übersetzten Aufgaben. Es verwendet einen Duellsiegwert aus statistischen Tests mit einem Alpha-Wert von 5 Prozent, nicht einen einfachen Durchschnittsprozentsatz. Gleichzeitig mangelt es oft an geschlossenen Modellen, da Autoren bewusst keine Beispiele an kostenpflichtige APIs senden. „Nicht gemessen“nicht „Verlierer“ [17][18].
Auf den ersten Blick handelt es sich um einen Markenstreit. Tatsächlich beschreibt jeder eine andere Rolle. Daher können sie alle teilweise Recht haben und das Gesamturteil „Diese KI ist die Beste“ immer noch falsch. Ein Tisch kann nicht vorbehaltlos über Chat, Programmierung, Schultests, Tschechisch, Sicherheit und Unternehmensverantwortung entscheiden.
Eine Bestenliste ist eine einzelne Aufgabenkarte. Es gibt kein Urteil darüber, wem man auf Tschechisch vertrauen kann.
– Anderer Kontext
2. Eine „beste KI“ hat mindestens fünf Schichten
Wenn man das beste Modell sagt, denkt man oft an eine einzige Zahl. Doch das Ergebnis der öffentlichen Begutachtung entsteht in mehreren Schichten. Das erste ist die Aufgabe. Fragen wir nach Chat-Einstellungen, nach der Behebung eines GitHub-Problems, nach einem Vier-Choice-Test, nach tschechischem NLI, nach Schulstil oder nach der Suche in einem Rechtstext? Dies sind keine unterschiedlichen Beispiele für dasselbe. Es sind unterschiedliche Probleme.
Die zweite Ebene ist eine Population von Eingabeaufforderungen oder Instanzen. Die Arena sammelt selbst ausgewählte Eingabeaufforderungen echter Benutzer und ist hauptsächlich auf Englisch. SWE-Bench arbeitet mit Problemen aus 12 Python-Repositories. MMLU ist eine Bank für Englischprüfungen. BenCzechMark fügt historisches Tschechisch, Schülerstile, gesprochenes Wort und tschechische Aufgaben hinzu [1][6][9][17].
Die dritte Schicht ist die Wertung. Das Bradley-Terry-Modell der paarweisen Präferenzen ist nicht dasselbe wie der Prozentsatz der gelösten Tests. Die Genauigkeit bei vier Auswahlmöglichkeiten ist nicht dasselbe wie ein Duellsiegergebnis mit statistischer Signifikanz. Jede Wertung hat ihre eigene Frage und ihren eigenen blinden Fleck.
Die vierte Ebene ist die Richtlinie zur Nutzung und Offenlegung. Agentengerüst, Denkbudget, Anzahl der Versuche, Docker, aktivierte Tools und Variantenauswahl können das Ergebnis verändern. Paper Leaderboard Illusion hebt private Variantentests und selektive Offenlegung hervor. Dies ist kein kleines Detail, wenn das Ranking zu einem geschäftlichen Argument gemacht werden soll [4].
Die fünfte Ebene sind Kosten, Latenz, Sprache und Ablehnung. Token-Preis, Geschwindigkeit, tschechische Qualität, Datenmodus, Schutz und die Möglichkeit, dass das System einen Teil der Aufgabe ablehnt, passen normalerweise nicht in ein Elo. Gleichzeitig entscheiden sie für Nutzer oft über mehr als den Unterschied einer Zeile im Ranking.
Diese Schichtung ist kein Detail. Es heißt, wenn wir die gleiche Arbeit vergleichen. Wenn ein Modell fünfmal bei maximaler Leistung und das andere einmal in einem anderen Monat lief, teilen sie nicht nur eine Benchmark-Marke. Sie teilen kein Protokoll.
3. Präferenz in der Arena ist keine Korrektheit
Chatbot Arena ist gerade deshalb nützlich, weil es etwas misst, was statische Tests oft nicht können: die Präferenzen der Menschen gegenüber echten Eingabeaufforderungen. Der Nutzer stellt eine Frage, erhält zwei anonyme Antworten und wählt die bessere aus. Aus einer Vielzahl solcher Duelle wird eine Rangliste erstellt. Das Papier von ICML 2024 beschreibt Daten von April 2023 bis Januar 2024, mehr als 240.000 Stimmen und etwa 90.000 Benutzer [1].
Daraus folgt jedoch nicht, dass ein höherer Rang eine zutreffendere Antwort bedeutet. Präferenz kombiniert Ton, Länge, Formatierung, Reaktionsfähigkeit, Höflichkeit, Sicherheit und manchmal auch Korrektheit. Ein Benutzer kann für eine Antwort stimmen, die besser lesbar ist, auch wenn sie einen geringfügigen sachlichen Fehler enthält. Oder umgekehrt kurze Antworten, weil sie seinem Ziel besser entsprechen.
Die Arena ist nicht nutzlos. Es handelt sich um eine Konversationsverhaltenskarte. Es muss einfach als Präferenz gelesen werden, nicht als forensischer Wahrheitsgehalt. Auf die Frage, welches System eine schönere E-Mail geschrieben hat, kommt Arena der Aufgabe näher als MMLU. Wenn wir fragen, welches System den tschechischen Absatz richtig interpretiert, reicht Elo allein nicht aus.
Darüber hinaus entsteht oft eine Präferenz, ohne die richtige Antwort zu kennen. Der Benutzer vergleicht zwei Antworten zu einem Zeitpunkt, zu dem er selbst möglicherweise keine primäre Quelle, keinen Test oder keine rechtliche Unterstützung hat. Das ist in Ordnung, wenn wir die Wahlmöglichkeiten der Benutzer messen. Es ist ein Problem, wenn wir aus dieser Wahl auf die Wahrheit schließen. Ein Modell, das sicher, flüssig und mit guter Artikulation antwortet, kann auch dann eine Stimme erhalten, wenn bei einer späteren Überprüfung ein falsches Zitat gefunden würde. Ein Model, das mit einem kürzeren Satz antwortet und gestehtUnsicherheit, kann schwächer erscheinen, obwohl es für riskante Arbeiten nützlicher ist.
Zum Zeitpunkt der Suche wurde der Live-Erstplatz des Textes Arena nicht genutzt, da es sich ohne einen stabilen Primär-Snapshot um eine Nummer ohne Anker handeln würde. Dies ist keine Schwäche des Arguments. Es ist sein Zustand. Die Bestenliste ändert sich und muss ein Datum, eine URL und eine Beschreibung der gemessenen Ergebnisse enthalten.
4. Länge und Preisnachlass sind keine Möglichkeiten. Sie sind ein Stilfaktor
LMSYS bekämpft das Stilproblem nicht, indem es es leugnet. Der Blog von Li, Angelopoulos und Chiang vom 28.–29. August 2024 zeigt, dass die Antwortlänge der dominierende Stilfaktor in der Bradley-Terry-Regression war. Der Koeffizient der normierten Längendifferenz beträgt 0,249. Die Autoren kontrollierten die Länge und Markdown-Elemente wie Listen, Überschriften und Fettdruck [2].
Dies ist wichtig, da viele Benutzer nicht nur für die Wahrheit stimmen. Er stimmt mit dem Gefühl ab, dass die Antwort vollständig ist. Eine längere Antwort sieht oft fachmännischer aus. Markdown fühlt sich organisierter an. Überschriften und Aufzählungspunkte sorgen für Struktur. Dies mag ein nützliches Merkmal des Produkts sein, ist jedoch nicht dasselbe wie inhaltliche Genauigkeit.
Die Stilkontrolle trennt einen Teil dieses Einflusses. Es entfernt es nicht perfekt. Die Autoren selbst machen auf mögliche Störfaktoren aufmerksam, beispielsweise auf die Gedankenkette oder andere Merkmale der Antwort, die mit der Länge zusammenhängen. Eine Beobachtungskontrolle ist kein randomisiertes Experiment. Er sagt nicht, dass wir nach Abzug des Stils die reine Wahrheit haben [2].
Daher ist es ein Fehler, das stilgesteuerte Ranking als universelles Urteil zu verstehen. Es ist besser als ein grober Eindruck. Es handelt sich immer noch um eine korrigierte Präferenzkarte und nicht um eine sachliche Fehleranzeige. Wenn es bei Ihrer Arbeit darum geht, ob das Zitat den Satz wirklich unterstützt, müssen Sie die Unterstützung des Zitats messen. Nicht nur die Rangliste in der Arena.
5. Eine private Option vor der Veröffentlichung ist keine öffentliche Aufzeichnung
Die Paper Leaderboard Illusion macht auf eine Praxis aufmerksam, die gerade deshalb unangenehm ist, weil die Bestenlisten öffentlich und einfach wirken. Die Autoren berichten von 27 privaten LLM-Varianten eines Anbieters, Meta, die vor der Veröffentlichung von Llama 4 getestet wurden. Sie schätzen auch die Asymmetrie des Zugriffs auf Arena-Daten: 20,4 Prozent für OpenAI, 19,2 Prozent für Google und 29,7 Prozent für die 83 Open-Weight-Modelle zusammen [4].
Diese Anteile wurden von LMSYS in seiner Antwort bestritten. Daher können sie nicht als geschlossene Prüfung der gesamten Arena gelesen werden. Sie können als Warnung gelesen werden, dass das öffentliche Ranking nicht nur Mathematik über einer neutralen Welt darstellt. Wer privat testen darf, wer Partituren herunterlädt, wer nur die beste Variante veröffentlicht und wer Zugriff auf Stimmen hat, beeinflusst, was die Öffentlichkeit sieht [4].
Dies ist eine Prüfung einer Praxis und kein Beweis dafür, dass Rankings wertlos sind. Ganz im Gegenteil: Wenn sie einen Wert haben, brauchen sie ein Protokoll. Sie müssen sagen, welche Variante wann mit welchen Regeln lief und ob das Ergebnis mit dem Serienmodell übereinstimmt. Ohne sie kauft der Benutzer den Gewinner nicht. Es kauft einen Namen, der in der Rangliste möglicherweise etwas anderes bedeutet hat.
6. SWE-bench Verified ist nicht Ihr GitLab
SWE-Bench ist ein leistungsstarker Test, weil er praktisch fragt: Kann das System ein echtes GitHub-Problem lösen, damit der Patch die Tests besteht? Der ursprüngliche Benchmark enthält 2.294 Instanzen aus 12 Open-Source-Python-Repositories. Es wird bewertet, ob der vorgeschlagene Patch die Tests FAIL_TO_PASS und PASS_TO_PASS im gegebenen Kabelbaum besteht [6][8].
SWE-bench Verified wurde erstellt, weil das Originalset verschiedene Verunreinigungen aufwies. Im August 2024 präsentierte OpenAI 500 von Menschen verifizierte Instanzen aus 1.699 zufällig ausgewählten Teststichproben. Bewertet von 93 Python-Entwicklern. In der verifizierten Menge gibt es 196 einfache Instanzen mit einer vom Menschen geschätzten Zeit unter 15 Minuten und 45 schwere Instanzen mit einer geschätzten Zeit von über 1 Stunde. Bei diesen Zeiten handelt es sich um eine menschliche Schätzung, nicht um eine automatisierte Metrik [7].
Verifiziert ist sauberer. Es ist nicht universell. Es misst weiterhin Python-Probleme aus bestimmten Repositorys, in einem bestimmten Kabelbaum und mit spezifischen Tests. Es misst nicht Codeüberprüfung, Sicherheit, Architektur, TypeScript-Monorepo, historische SAP- oder tschechische Dokumentation. Und SWE-Bench Pro ist ein anderes Set: schwerer, mehr Dateien, weniger Ground-Truth-Leckage. Verified ist nicht Pro und Pro ist nicht Ihr GitLab.
Daher ist es sinnvoll, SWE-Bench als Kandidatenfilter für die Programmierung zu verwenden. Es macht keinen Sinn, es als Beweis dafür zu betrachten, dass das Modell Ihr Problem mit der gleichen Geschwindigkeit und dem gleichen Risiko lösen wird. Ihr Gurtzeug, Ihre Tests und Ihre Prüfregeln sind Teil der Leistung.
Entscheidend im Unternehmensrepository ist, was der öffentliche Benchmark nicht sieht. Code kann lokale Tests bestehen und dennoch gegen eine interne Architekturregel verstoßen. Ein Patch ist möglicherweise funktionsfähig, aber für das Team, das ihn verwaltet, nicht lesbar. Der Agent kann das Symptom beheben und umgehen, wo der Fehler tatsächlich entsteht. Oder im Gegenteil, es scheitert nur daran, dass das Unternehmen ihm nicht den gleichen Kontext gegeben hat, den ein Mensch hat: Laufzeitvariablen, historische Entscheidungen, eine interne Bibliothek uswKenntnisse über den Freigabeprozess. Daher muss der Benchmark des Programmierers durch einen eigenen Piloten ergänzt werden. Nicht weil der öffentliche Satz schlecht ist, sondern weil Ihre Arbeit einen anderen Schwellenwert für die Korrektheit hat.
7. Fünf Versuche mit maximaler Anstrengung sind kein einziger Versuch
Die größte Verwirrung entsteht, wenn wir Zahlen mit demselben Benchmark-Namen und unterschiedlichem Protokoll nebeneinander platzieren. Anthropic in Fable 5 und Mythos 5 Systemkarte vom Juni 2026 gibt auf der SWE-Benchmark an, dass 95,5 Prozent für Mythos 5 und 95 Prozent für Fable 5 gelöst wurden. Dabei handelt es sich um selbst gemeldete Zahlen, Durchschnitt aus 5 Versuchen, adaptivem Denken und maximalem Aufwand. Fable verfügt über Produktionsschutzmaßnahmen, einschließlich eines Fallbacks auf Opus 4.8, was die Karte als Grund dafür angibt, dass sie möglicherweise etwas unter Mythos liegt [11][12].
Auf dem SWE-Bench Pro meldet dieselbe Karte 80,3 Prozent für Mythos 5 und 80 Prozent für Fable 5. Google DeepMind meldet in der Modellkarte Gemini 3.1 Pro vom 19. Februar 2026 mit 80,6 Prozent auf dem SWE-Bench Verified für Gemini 3.1 Pro Thinking High, allerdings als Einzelversuch. Beim öffentlichen Split meldet die SWE-Bank Pro 54,2 Prozent, ebenfalls Einzelversuch [11][14].
OpenAI listet 64,6 Prozent auf SWE-bench Pro in der GPT-5.6-Tabelle vom 9. Juli 2026 auf. SWE-bench Verified wird in dieser Tabelle nicht aufgeführt. Der Benchmark zeigt das Fable 5 als 80 Prozent Pro, aber das ist immer noch eine Zahl in der OpenAI-Tabelle und eine Namensübereinstimmung, kein Beweis für den gleichen Lauf mit dem gleichen Geschirr. Historisch gesehen listete OpenAI bei SWE-Bench Verified GPT-4o mit 33,2 Prozent Auflösung im August 2024 auf, wie aus einer Mitteilung an Agentless hervorgeht [7][13].
Was muss getestet werden, bevor zwei Prozent hinzugefügt werden?
Geben Sie „Verifiziert“ oder „Pro“ ein. Anzahl der Versuche. Denken. Kartendatum. Selbstbericht oder unabhängiger Lauf. Gerüstagent. Erlaubte Werkzeuge. Erst dann vergleichen. Ohne das wäre die Zahl 95 neben 80,6 nicht als Kampf der Marken zu lesen. Es ist ein Duell zweier Linien mit unterschiedlichem Protokoll.
Selbstberichtete Ergebnisse tragen den Namen des Benchmarks. Das Protokoll wird nicht geteilt.
– Anderer Kontext
8. MMLU ist keine allgemeine Intelligenz
MMLU hat einen guten Grund, berühmt zu sein. Hendrycks et al. hat einen umfangreichen akademischen Vier-Wahl-Test in Englisch erstellt: 57 Fächer und insgesamt 15.908 Fragen, davon 14.079 Testfragen und 1.540 Validierungsfragen. In der Originalarbeit werden fünf Beispiele für wenige Aufnahmen pro Thema verwendet [9].
Ein solcher Satz trug dazu bei, die Breite des Wissens zu messen. Aber die Breite akademischer Fragen ist nicht gleichbedeutend mit allgemeiner Intelligenz. MMLU misst nicht das tschechische Recht, die tschechischen Realitäten, die offene Arbeit mit einem Dokument oder die Fähigkeit, zuzugeben, dass eine Quelle fehlt. Das Modell kann bei einer Vier-Auswahl-Frage hervorragend sein und bei einem langen tschechischen Brief an einen Kunden schwächer sein. Oder umgekehrt.
Außerdem liest sich der menschliche Anker oft stärker, als es das Papier zulässt. Hendrycks et al. Geben Sie 34,5 Prozent für nicht spezialisierte MTurk und etwa 89,8 Prozent als Expertenschätzung des 95. Perzentils aus Quellenstudien an. Bei dieser Expertenzahl handelt es sich um eine Schätzung, die teilweise auf Perzentilen und teilweise auf fundierten Schätzungen beruht. Es handelt sich nicht um ein maßvolles Expertengremium für die gesamte MMLU [9].
MMLU-Redux und MMLU-Pro sind weitere Objekte. Der Kontaminationsbericht von GEM 2026 erinnert an MMLU als den Archetyp eines Sets, das anfällig für Leckagen im Training und bei wiederholter Verwendung ist [20]. Das soll nicht heißen, dass MMLU keinen Wert hat. Dies bedeutet, dass nicht vorbehaltlos ein Urteil über Arbeiten abgegeben werden kann, die das MMLU nie gemessen hat.
9. Der Fehler im Schlüssel ist kein Modellunterschied
Gema et al. bei der Arbeit Sind wir mit MMLU fertig? 5.700 Fragen aus allen 57 Themen neu kommentiert, um MMLU-Redux zu erstellen. Sie schätzten, dass 6,49 Prozent der Fragen einen Fehler im Schlüssel aufweisen. In der Virologie melden sie im analysierten Bereich 57 Prozent fehlerhafte Eingaben [10].
Das ist methodisch unangenehm. Wenn sich zwei Grenzmodelle bei Roh-MMLU um einen Prozentpunkt unterscheiden, kann ein Teil des Unterschieds auf Label-Rauschen und nicht auf Fähigkeit zurückzuführen sein. Ein Modell kann inhaltlich richtig antworten und mit einem falschen Schlüssel bestraft werden. Oder er drückt eine Taste, die an sich fragwürdig ist.
Es ist nicht fair, daraus den Schluss zu ziehen, MMLU sei nutzlos. Es ist fair, dies als Regel aufzustellen: Je kleiner der Unterschied, desto größer ist die Notwendigkeit, die Etikettenqualität, das Unsicherheitsintervall, die Kontamination und die Art der Aufgabe zu berücksichtigen. Der genaue Prozentsatz kann den fehlerhaften Zustand genau messen.
10. Ein Cluster an der GPQA-Obergrenze ist kein Markenurteil
GPQA Diamond ist eine andere Art von akademischem Test. Rein et al. Sie haben es als Google-sicheres naturwissenschaftliches Kit für Hochschulabsolventen konzipiert. Die Diamant-Teilmenge besteht aus 198 Fragen. Hohe Werte tauchen in den Karten des Modells 2026 auf: Anthropic listet Mythos 5 mit 94,1 Prozent als Durchschnitt aus 5 Versuchen auf, Google listet Gemini 3.1 Pro mit 94,3 Prozent ohne Tools auf und OpenAI listet GPT-5.6 Sol mit 94,6 Prozent auf [11][13][14][22].
Ein Unterschied von 94,1, 94,3 und 94,6 Prozent sieht aus wie ein Rang. Aber es ist ein Cluster an der Decke, über verschiedene Karten und Protokolle hinweg. Ohne den gleichen Lauf in der gleichen Woche, mit dem gleichen Setup und den gleichen öffentlichen Logos ist es unmöglich, ein Markenurteil zu fällen.
Die praktische Frage klingt wieder anders. Wenn Sie ein Modell für wissenschaftliche Fragen und Antworten auswählen, kann GPQA eine nützliche Karte sein. Wenn Sie ein Modell für die tschechische interne Rechtsanalyse wählen, stellt es ein anderes Terrain dar. Eine Höchstpunktzahl in den englischen Naturwissenschaften berechtigt nicht dazu, einem tschechischen Zitat Glauben zu schenken.
11. Das englische Ranking ist kein tschechischer Sprachgebrauch
Tschechisch ist nicht nur ein Wörterbuch. Dabei geht es um Syntax, Flexion, Kontext, kulturelle Bezüge, Schulen, Autoritäten, juristische Formulierungen, diakritische Fehler und die Fähigkeit, einen englischen Satz nicht als tschechischen Satz zu übersetzen. Deshalb sind tschechische Maßstäbe wichtig, auch wenn sie nicht so sichtbar sind wie globale Arenen.
BenCzechMark von TACL 2025 listet 50 Aufgaben, 14 neu gesammelte und 8 Kategorien auf. Es ist überwiegend tschechische Muttersprache; Etwa 10 Prozent der Aufträge werden maschinell übersetzt. Bei der Punktzahl handelt es sich nicht um einen einfachen Genauigkeitsdurchschnitt, sondern um eine Duell-Sieg-Punktzahl aus statistischen Tests mit einem Alpha von 5 Prozent. Dies ist eine andere Bewertungssprache als MMLU oder Arena Elo [17].
Gleichzeitig ist ein Vorbehalt notwendig. BenCzechMark-Autoren senden bewusst keine Beispiele an kostenpflichtige APIs, daher fehlen häufig geschlossene ChatGPT, Claude oder Gemini auf BCM. Dies kann nicht als Niederlage gedeutet werden. Es ist eine Messlücke [17][18].
CzechBench ist ein weiterer tschechischer Track, aber auch hier ist es nicht angebracht, den Anspruch auf Genauigkeit zu erheben, wenn die Quellen voneinander abweichen. Im Dossier heißt es, dass im BenCzechMark-Papier 17 Aufgaben für CzechBench und 8 native Aufgaben erwähnt werden, während in der öffentlichen Bestenliste 15 Aufgaben aufgeführt sind. Daher steht hier keine offizielle CzechBench-Zahl als feste Zahl. Der genannte Benchmark Czeval oder CzEval wurde im September 2026 nicht in Primärquellen gefunden [19].
Wer nur LMArena oder MMLU liest, sieht keine tschechischen Duelle. Wer nur den tschechischen Benchmark ohne geschlossene Modelle liest, sieht auch nicht den gesamten Markt. Der richtige Satz ist nicht „Dieses Modell hat die tschechische Sprache gewonnen“. Der richtige Satz lautet oft: In diesem tschechischen Satz wird dies gemessen, das geschlossene Modell fehlt und ein separater Test ist erforderlich.
Darüber hinaus gibt es im tschechischen Sprachgebrauch mehrere Formen. Ein weiteres Problem ist das Schreiben einer natürlichen Geschäfts-E-Mail. Eine andere besteht darin, das Protokoll des Treffens mit tschechischen Namen und Institutionen zusammenzufassen. Eine andere besteht darin, zu unterscheiden, ob der zitierte Paragraph des Gesetzes gilt, geändert wurde oder zu einem anderen Teil der Rechtsordnung gehört. Und eine andere besteht darin, den Text des Schülers zu korrigieren, damit das System den Stil des Autors nicht in glattes, allgemeines Tschechisch überträgt. Eine einzige Punktzahl kann jeden dieser Jobs näher bringen. Es kann sie nicht alle ersetzen.
12. Preis, Schutz und Ablehnung sind nicht Elo
Die öffentliche Bestenliste führt normalerweise keinen Account. Dabei kauft der Nutzer nicht nur die Fähigkeit, sondern auch das erhaltene Ergebnis. Anthropic listet Fable 5 im Juni 2026 mit 10 $ pro 1 Million Eintritts-Token und 50 $ pro 1 Million Austritts-Token auf. OpenAI listet GPT-5.6 Sol im Juli 2026 mit 5 $ pro 1 Million Input- und 30 $ pro 1 Million Output-Tokens auf [11][12][13].
Diese Zahlen sind kein Urteil für sich. Ein billigerer Token kann teurer sein, wenn das Modell mehr Versuche, mehr Überprüfungen und mehr menschliche Korrekturen benötigt. Ein teureres Modell kann günstiger sein, wenn es die Anzahl der Fehlläufe reduziert. Die Preisliste ist der Preis des Rohmaterials, nicht der Preis des Ergebnisses.
Schutz ist eine weitere Ebene. Anthropic führt bei Fable 5 Produktionsschutzmaßnahmen und einen Fallback auf Opus 4.8 ein, das im Durchschnitt in weniger als 5 Prozent der Sitzungen gestartet wird [11]. Dies kann ein Sicherheitsvorteil sein. Es kann aber auch bedeuten, dass das tschechische „Ich schaffe es nicht“ bei einer bestimmten Aufgabe nicht auf die Unfähigkeit des Modells, sondern auf die Politik des Produkts zurückzuführen ist.
Ablehnung, Latenz und Datenmodus passen nicht einfach in Elo. Dennoch treffen sie Entscheidungen bei der Arbeit. Das beste Modell in der Rangliste ist möglicherweise nicht das beste System für einen Prozess, bei dem Sie Auditing, geringe Latenz, stabile Reaktion, kostengünstige Steuerung und vorhersehbares Verhalten benötigen.
Die gleiche Logik gilt für Schäden. Bei einem Marketingvorschlag kann die Ablehnung nur eine Verzögerung sein. Beim Kundensupport kann eine unvorhersehbare Ablehnung einen Dienstverstoß darstellen. Bei Rechts- oder Gesundheitstexten kann Vorsicht angebracht sein, wenn das System klar angibt, worüber es nicht entscheiden möchte und warum. In einer Bestenliste, die gelöste Probleme oder Chatpräferenzen misst, wird dieser Schwellenwert normalerweise nicht angezeigt. Es muss vom Piloten in einem bestimmten Prozess nachgewiesen werden.
13. Die Grok-Karte ist kein SWE-Diagramm
Grok erscheint in den Debatten als eine weitere Marke im selben Kampf. Das Dossier nennt jedoch eine einfache Grenze: Bei den öffentlichen Karten Grok 4 vom 20. August 2025 und Grok 4.20 vom 7. April 2026 handelt es sich um Sicherheits- und Dual-Use-Bewertungen. Die vergleichbare SWE-Bench-verifizierte xAI-Nummer in diesen Karten wurde zum Zeitpunkt der Suche nicht verifiziert [15][16].
Das Fehlen einer Nummer ist kein Beweis für Unfähigkeit. Es ist ein Beweis dafür, dass diese Karten nicht in einem fairen Kampf auf der SWE-Bank verifiziert werden können. Wenn ein Anbieter eine Kodierungsbewertung in einer Tabellenkalkulation veröffentlicht und ein anderer hauptsächlich eine Sicherheitskarte veröffentlicht, haben wir nicht zwei Messungen derselben Sache.
Dies ist eine allgemeinere Regel. Nicht jede Modellkarte ist eine Bestenliste. Nicht jedes Sicherheitsdokument enthält Angaben zur Produktleistung. Und nicht jede Marketingtabelle verfügt über ein Protokoll, das einen Vergleich mit einer anderen Tabelle ermöglicht. Wenn der Hintergrund fehlt, ist die richtige Antwort „nicht verifiziert“ und nicht „verloren“.
14. Die beste Karte ist die, auf der Sie Fehler ertragen können
Bei den folgenden Empfehlungen handelt es sich nicht um ein Produktranking. Sie sind der Wegweiser zum ersten eigenen Lauf. Sie folgen dem Text Wem erlauben Sie, Fehler zu machen?, das die KI-Auswahl basierend auf der Art des Fehlers übernimmt, den Sie sich leisten können. Dies ist kein zweites Markenurteil. Es geht darum, die Bestenliste wie eine Karte zu lesen.
| Eine Art Misserfolg | Wie sieht er aus? | So testen Sie | Was wird den Schaden begrenzen? |
|---|---|---|---|
| Präferenz als Richtigkeit | Höheres Elo = echteres Tschechisch | Zehn Aufgaben in derselben Sprache; sachlicher Fehler, nicht „Gefällt mir“ | Betrachten Sie Stilkontrolle als Vorbehalt, nicht als Wahrheitsprobe |
| Versteckter Gurt | 95 % neben 80,6 % als Kampf der Marken | Notieren Sie Versuche, Gedanken, Datum, Verifiziert vs. Pro, Selbstbericht vs. unabhängig | Fügen Sie keine Karten mit unterschiedlichen Protokollen hinzu |
| Englische Karte auf Tschechisch | LMArena oder MMLU als Urteil für tschechische Arbeit | BenCzechMark, CzechBench oder benutzerdefiniertes Set; „nicht gemessen“ nicht „verloren“ | Belassen Sie weder MMLU noch rohes Elo in der ersten Spalte |
| Cherry-Pick-Variante | Private Läufe, Download-Scores, einfach die beste Nummer raus | Ich frage, welche Variante in Produktion ist | Leaderboard-Illusion als Vorbehalt an die Tabelle |
| Ein Cluster an der Decke | 94,1 / 94,3 / 94,6 als Markenreihenfolge | GPQA-Diamant: 1 p.p. Unterschied an der Decke | Entscheiden Sie sich nicht um einen Prozentpunkt für einen Kauf |
Anschauliches Diagramm: Drei Spalten – Arena (Präferenzen), SWE-Bench (Geschirrtests), BenCzechMark (tschechische Duelle). Der „beste“ Pfeil führt nicht zwischen den Spalten. Es führt nur ins Innere der Kolumne, mit Datum und Protokoll.
Eine gute Karte ist nicht die mit der größten Zahl. Eine gute Karte ist eine, deren Trugschluss Sie kennen. Wenn es die Präferenz misst, verwenden Sie es für Arbeiten, bei denen die Präferenz sinnvoll ist. Wenn der Patch nach den Tests gemessen wird, können Sie damit Kandidaten für die Programmierung auswählen. Wenn es Tschechisch misst, lesen Sie es auf Tschechisch und mit einer Abdeckungsgrenze.
15. Zehn benutzerdefinierte Aufgaben verraten mehr als nur den ersten Platz
Der Praxistest ist kein Markenkampf. Dabei wird überprüft, ob die Karte zu Ihrer Aufgabe passt. Stellen Sie zehn Quests in derselben Sprache, demselben Genre und mit derselben Schadensschwelle zusammen. Zehn tschechische E-Mails an einen Kunden. Zehn Ausgaben aus Ihrem Repository. Zehn Fragen aus der internen Wissensdatenbank. Zehn kurze Analysen, bei denen Sie die richtige Unterstützung kennen.
So testen Sie zwei Kandidaten am selben Set
Führen Sie zwei Kandidaten am selben Tag durch, mit demselben Denkansatz, ohne die Eingabeaufforderungen zwischen den Durchgängen zu wechseln und mit demselben Zugriff auf Tools. Erfassen Sie sachliche Fehler, halluzinierte Zitate, Ablehnungen, Länge, Kosten und Zeit bis zum verwertbaren Ergebnis. Elo nicht zuschreiben. Addieren Sie, welcher Fehler Ihre Prüfung bestehen würde.
Drei Gurttests
Wenn die Aufgabe tschechisch ist, belassen Sie weder MMLU noch rohe Elo-Arenen als erste Spalte. Die erste Spalte ist BenCzechMark, CzechBench oder Ihr Satz. Wenn das geschlossene Modell nicht auf BenCzechMark steht, schreiben Sie „nicht gemessen“ und nicht „verloren“.
Wenn es sich bei der Aufgabe um Code handelt, geben Sie den Kabelbaum an. „95 Prozent verifiziert“ ohne Anzahl der Versuche, Denkweise und Agentenstapel ist eine Marketing-Schlagzeile, kein Laborrekord. Wenn es sich bei der Aufgabe um eine Recherche handelt, überprüfen Sie die Zitate Satz für Satz. Ein vorhandenes Zitat unterstützt möglicherweise noch keine bestimmte Schlussfolgerung.
Ihr eigenes Set muss nicht groß sein. Es muss wahr sein. Es soll die Arbeit messen, die Sie tatsächlich leisten, in der Sprache, in der Sie sie erledigen, und mit dem Fehler, den Sie sich vorstellen können.
Zu einem guten Satz gehören auch korrekte Negativbeispiele. Es reicht nicht aus, dem Modell zehn Aufgaben zu geben, die reibungslos gelöst werden können. Fügen Sie einen Eintrag hinzu, in dem der Hintergrund fehlt. Fügen Sie ein Dokument hinzu, bei dem ein Konflikt zwischen einer älteren und einer neueren Version besteht. Fügen Sie eine Frage hinzu, deren richtige Antwort „Kann anhand der verfügbaren Daten nicht ermittelt werden“ lautet. In einem solchen Moment wird der Unterschied zwischen einem Modell, das den Satz um jeden Preis beenden will, und einem System, das dabei hilft, die Kontrolle zu behalten, deutlich.
Notieren Sie einfach das Ergebnis. Nicht nur eine Note, sondern eine Art Fehler. Eine erfundene Ressource. Richtige Quelle, falsche Schlussfolgerung. Eine zu lange Antwort. Ablehnung ohne Grund. Gute Antwort, aber zu teuer, um sie zu wiederholen. Nur dieser Eintrag gibt Auskunft darüber, ob der erste Standort auf der öffentlichen Karte zu Ihrem Ziel führt.
16. Selbst gemeldete Ergebnisse sind keine unabhängigen Läufe
Die Selbsteinschätzung eines Lieferanten ist nicht automatisch falsch. Allerdings handelt es sich hierbei um eine andere Beweisart als bei einem unabhängigen Lauf. Eine Modellkarte kann fair und dennoch nicht mit der Karte eines Mitbewerbers vergleichbar sein. Der Unterschied kann in der Anzahl der Versuche, dem Agentengerüst, dem Datum, den zulässigen Tools, der Beispiel- oder Variantenauswahlrichtlinie liegen.
Eine stärkere Schlussfolgerung würde einen unabhängigen, vorregistrierten Lauf desselben SWE-Bench-verifizierten Kabelbaums für ChatGPT, Gemini, Claude und Grok in derselben Woche mit demselben Gerüst, derselben Anzahl von Versuchen, demselben Commit und öffentlichen Protokollen erfordern. Dies würde immer noch nicht über die tschechische Sprache oder das tschechische Recht entscheiden, aber es würde zumindest eine Quelle der Verwirrung beseitigen.
Für die tschechische Sprache wäre eine öffentliche Präferenzliste für die tschechische Sprache mit beschriebenem Sampling und ohne private Rosinenpickerei hilfreich, bei der geschlossene und offene Modelle nebeneinander stünden. Für MMLU wäre ein neu annotierter Nachfolger ohne die geschätzte Schlüsselfehlerrate von 6,49 Prozent hilfreich, bei dem die Reihenfolge der Grenzmodelle stabil stärker variieren würde als das Label-Rauschen [10].
Es wäre auch hilfreich zu zeigen, dass der stilgesteuerte Arena-Score Ihre Unternehmenskennzahlen besser vorhersagt als der benutzerdefinierte Satz: Zeit zum Zusammenführen, Anzahl der Beschwerden, Anzahl halluzinierter Absätze oder Anteil der vom Redakteur zurückgegebenen Antworten. Bis dies geschieht, bleibt die öffentliche Bestenliste eine Jobkarte. Es ist kein Urteil.
17. Eine versteckte Last ist der erste Ort, an dem eine andere Aufgabe gemessen wird
Der erste Platz ist bequem. Es erspart Entscheidungsfindungen, fügt sich in die Präsentation ein und verleiht dem Kauf einen einfachen Satz. Aber genau das sind die versteckten Kosten. Wenn der erste Ort eine andere Rolle misst, bringt er dem Unternehmen Gewissheit, wo die Frage hätte sein sollen.
Rankings sind nicht der Feind. Ohne öffentliche Benchmarks hätten wir nur Werbung und persönliche Eindrücke. Arena hilft dabei, Vorlieben zu erkennen. SWE-Bench hilft dabei, Programmierer-Patches in einem bestimmten Kabelbaum zu erkennen. MMLU und GPQA helfen dabei, akademisches Wissen zu verfolgen. BenCzechMark und CzechBench erinnern daran, dass die tschechische Sprache eine eigene Messung haben muss. Jede Karte ist nützlich, wenn wir wissen, wohin sie führt.
Daher ist es nicht korrekt zu sagen, dass man Benchmarks nicht vertrauen sollte. Genauer gesagt, wir sollten ihnen in dem Maße glauben, wie sie sich selbst beschreiben. Wenn Arena sagt, dass Personen in einem anonymen paarweisen Vergleich eine Antwort bevorzugten, sollten wir daraus nicht den Wahrheitsgehalt des Absatzes ablesen. Wenn SWE-Bench sagt, dass der Patch die Tests bestanden hat, sollte dies nicht als Sicherheit des Designs interpretiert werden. Wenn BenCzechMark sagt, dass das Modell das tschechische Duell überstanden hat, lesen wir das nicht als Leistung eines geschlossenen Modells, das nicht im Set enthalten war.
Die Frage ist nicht, welche KI die beste ist. Es geht darum: welche Aufgabe, welche Aufforderungspopulation und welche Kabelbaumskala misst es – und welchen Fehler werden Sie mit der Zeit an Ihrem eigenen Gerät erkennen?
Verwandte Texte in dieser Reihe
- Wem erlauben Sie, Fehler zu machen? — KI-Auswahl basierend auf der Art des Käfers, den Sie tragen. Bei diesem Text handelt es sich um eine Rangliste, nicht um ein zweites Markenurteil.
- Kann KI Programmierer ersetzen? — SWE-Bank als Kabelbaumwerk, nicht als Elo-Chat.
- Welche Berufe wird KI ersetzen? — Das Model-Ranking misst nicht den Untergang des Berufsstandes.
