Žebříček měří úlohu. Nerozhoduje, komu smíte věřit česky.

Veřejný žebříček je mapa jedné úlohy, jedné populace promptů a jednoho způsobu bodování. Není to rozsudek o tom, který model je nejlepší pro českou práci.

Čtyři odlišné mapy porovnávání modelů umělé inteligence
Redakční ilustrace vytvořená s pomocí AI.Žebříček odpovídá na přesně vymezenou úlohu; nevybírá univerzálně nejlepší model pro každého.
Důkazní stopa

Pas důkazů

Zdroje a kontrola
22 odborných pramenůZdroje ověřeny:
Publikace a aktualizace
Publikováno: Aktualizováno: Neuvedeno
Historie oprav
0 oprav
Metodika
Neuvedeno
Role AI
Neuvedeno
Doba čtení
27 min čtení
Čtení nahlas
00:0000:00
Pokročilé ovládání
1.00 ×
Připraveno
Důkazní stopa

Závěr v kostce

Co je doložené

Veřejný žebříček je mapa jedné úlohy, jedné populace promptů a jednoho způsobu bodování. Není to rozsudek o tom, který model je nejlepší pro českou práci.

Co zůstává nejisté

Doložená technická schopnost sama neurčuje rozsah skutečného nasazení, chybovost v jiném prostředí ani dopad na konkrétní lidi.

Co by závěr změnilo

Závěr by změnil nezávislý audit nasazeného systému, reprodukovatelné měření v odpovídajícím provozu nebo nová data o reálných dopadech.

Obsah článku
  1. Každý žebříček obhajuje jinou úlohu
  2. Jedna „nejlepší AI“ má nejméně pět vrstev
  3. Délka a markdown nejsou schopnost. Jsou style faktor
  4. MMLU není všeobecná inteligence
  5. Cena, safeguard a odmítnutí nejsou Elo
  6. Self-reported skóre není independent run

Rubrika: Technologie & AI Autor: V Délka čtení: ~27 min Prameny a další četba: 22 položek Témata: AI, benchmarky, ChatGPT, Gemini, Claude, Grok, čeština, hodnocení modelů SEO / pracovní titulek: ChatGPT vs. Gemini vs. Claude vs. Grok: Která AI je nejlepší?

Otázka zní: která AI je nejlepší — ChatGPT, Gemini, Claude, nebo Grok? Zní jednoduše jen do chvíle, než si všimneme, že neporovnáváme jednu věc. Preference na Aréně není správnost. SWE-bench Verified není váš GitLab a pět pokusů na max effort není jeden pokus. MMLU není všeobecná inteligence. Anglický žebříček není české použití. Teprve když se tyto čtyři věci oddělí, jde číst, co k září 2026 veřejné tabulky agregují — a co z nich pro českou práci neplyne.

1. Každý žebříček obhajuje jinou úlohu

Představme si čtyři čtenáře téhož slova „nejlepší“. Produktový manažer otevře LMArena a ukáže první řádky veřejného žebříčku. Má pravdu v tom, že anonymní párové preference lidí zachycují, která odpověď se uživatelům líbí víc. Paper Chatbot Arena uvádí více než 240 000 hlasů z období duben 2023 až leden 2024 a přibližně 90 000 uživatelů. Neměří však faktickou chybu, českou gramatiku ani českou judikaturu [1].

Vedoucí vývoje vytáhne SWE-bench. Má pravdu, že podíl resolved po průchodu testy je tvrdší než dojem z chatu. Jenže SWE-bench Verified je 500 lidsky ověřených instancí z pythonových GitHub issue. Původní SWE-bench stojí na 12 open-source pythonových repozitářích. To není váš enterprise monorepo, váš GitLab, SAP, interní knihovna ani český zákon o kybernetické bezpečnosti [6][7].

Učitel ukáže MMLU. Má pravdu, že 57 předmětů a 15 908 otázek tvoří pojmenovanou akademickou sadu. Neměří však otevřenou práci s dokumenty, české reálie ani to, zda model přizná nejistotu. A po práci Gema et al. už nejde předstírat, že každý rozdíl na surovém MMLU je čistá schopnost modelu: autoři MMLU-Redux odhadli 6,49 procenta otázek s chybou v klíči [9][10].

Český uživatel přidá BenCzechMark. Má pravdu, že čeština není jen přeložená angličtina. BenCzechMark má 50 úloh, z toho 14 nově sebraných, v 8 kategoriích, s převážně nativní češtinou a asi 10 procenty strojově přeložených úloh. Používá duel win score ze statistických testů s hladinou alfa 5 procent, nikoli prostý průměr procent. Zároveň v něm často chybí uzavřené modely, protože autoři záměrně neposílají vzorky do placených API. „Není změřen“ není „prohrál“ [17][18].

Na první pohled je to spor značek. Ve skutečnosti každý popisuje jinou úlohu. Proto mohou být všichni částečně správně a společný verdikt „tato AI je nejlepší“ přesto špatně. Jedna tabulka nemůže bez výhrad rozhodnout chat, programování, školní testy, češtinu, bezpečnost a firemní odpovědnost.

Žebříček je mapa jedné úlohy. Není rozsudek o tom, komu smíte věřit česky.

— Jiný Kontext

2. Jedna „nejlepší AI“ má nejméně pět vrstev

Když se řekne nejlepší model, často se myslí jedno číslo. Jenže výsledek veřejného hodnocení vzniká v několika vrstvách. První je úloha. Ptáme se na preference chatu, opravu GitHub issue, čtyřvolbový test, české NLI, školní sloh nebo hledání v právním textu? To nejsou různé příklady téhož. Jsou to různé problémy.

Druhá vrstva je populace promptů nebo instancí. Aréna sbírá self-selected prompty reálných uživatelů a je převážně anglická. SWE-bench pracuje s issue z 12 pythonových repozitářů. MMLU je anglická zkoušková banka. BenCzechMark přidává historickou češtinu, žákovské slohy, mluvené slovo a české úlohy [1][6][9][17].

Třetí vrstva je bodování. Bradley-Terry model z párových preferencí není totéž co procento vyřešených testů. Accuracy na čtyřech volbách není totéž co duel win score se statistickou významností. Každé bodování má svou otázku a své slepé místo.

Čtvrtá vrstva je harness a politika zveřejnění. Agent scaffold, thinking budget, počet pokusů, Docker, povolené nástroje a výběr varianty mohou změnit výsledek. Paper Leaderboard Illusion upozorňuje na privátní testování variant a selektivní zveřejnění. To není drobný detail, pokud se z pořadí dělá obchodní argument [4].

Pátá vrstva jsou náklady, latence, jazyk a odmítnutí. Tokenová cena, rychlost, česká kvalita, datový režim, safeguard a možnost, že systém odmítne část úkolu, se do jednoho Elo obvykle nevejdou. Přitom pro uživatele často rozhodují víc než rozdíl jednoho řádku na žebříčku.

Tato vrstevnatost není detail. Říká, zda porovnáváme tutéž práci. Pokud jeden model běžel pětkrát na max effort a druhý jednou v jiném měsíci, nesdílejí jen značku benchmarku. Nesdílejí protokol.

3. Preference na Aréně není správnost

Chatbot Arena je užitečná právě tím, že měří něco, co statické testy často neumějí: preference lidí nad reálnými promptami. Uživatel položí dotaz, dostane dvě anonymní odpovědi a vybere tu lepší. Z velkého množství takových duelů vzniká žebříček. Paper z ICML 2024 popisuje data od dubna 2023 do ledna 2024, více než 240 000 hlasů a asi 90 000 uživatelů [1].

Z toho však neplyne, že vyšší pozice znamená pravdivější odpověď. Preference slučuje tón, délku, formátování, ochotu odpovědět, zdvořilost, jistotu a někdy i správnost. Uživatel může dát hlas odpovědi, která je čitelnější, i když obsahuje menší faktickou chybu. Nebo naopak odpovědi stručné, protože se víc hodí k jeho cíli.

Aréna není zbytečná. Je to mapa chování v konverzaci. Jen se musí číst jako preference, ne jako soudní znalec pravdy. Když se ptáme, který systém napsal příjemnější e-mail, Aréna je blíž úloze než MMLU. Když se ptáme, který systém správně vyloží český paragraf, samotné Elo nestačí.

Preference navíc často vzniká bez znalosti správné odpovědi. Uživatel porovnává dvě odpovědi v okamžiku, kdy sám nemusí mít primární zdroj, test nebo právní oporu. To je v pořádku, pokud měříme uživatelskou volbu. Je to problém, pokud z této volby odvozujeme pravdivost. Model, který odpoví jistě, plynule a s dobrým členěním, může získat hlas i tam, kde by pozdější kontrola našla chybnou citaci. Model, který odpoví kratší větou a přizná nejistotu, může vypadat slabší, i když je pro rizikovou práci užitečnější.

K datu rešerše nebylo použito živé první místo textové Arény, protože bez stabilního primárního snapshotu by šlo o číslo bez kotvy. To není slabina argumentu. Je to jeho podmínka. Žebříček se mění a musí mít datum, URL a popis toho, co měřil.

4. Délka a markdown nejsou schopnost. Jsou style faktor

LMSYS se s problémem stylu nepere tím, že by jej popřel. Blog Li, Angelopoulos a Chiang z 28. až 29. srpna 2024 ukazuje, že délka odpovědi byla dominantním style faktorem v Bradley-Terry regresi. Koeficient normalizovaného rozdílu délek uvádí 0,249. Autoři kontrolovali délku a markdown prvky, například seznamy, nadpisy a tučné zvýraznění [2].

To je důležité, protože mnoho uživatelů nehlasuje jen o pravdě. Hlasuje o pocitu, že odpověď je úplná. Delší odpověď často vypadá pracovitěji. Markdown působí uspořádaněji. Nadpisy a odrážky dávají pocit struktury. To může být užitečná vlastnost produktu, ale není to totéž co věcná správnost.

Style control část tohoto vlivu odděluje. Neodstraňuje jej dokonale. Autoři sami upozorňují na možné confoundery, například chain-of-thought nebo jiné vlastnosti odpovědi, které s délkou souvisejí. Observační kontrola není randomizovaný experiment. Neříká, že po odečtení stylu máme čistou pravdu [2].

Proto je chyba číst style-controlled žebříček jako univerzální verdikt. Je lepší než hrubý dojem. Stále je to mapa preferencí s korekcí, ne měřič faktických omylů. Pokud vaše práce stojí na tom, zda citace opravdu podporuje větu, musíte měřit oporu citace. Ne jen pořadí v Aréně.

5. Privátní varianta před zveřejněním není veřejný záznam

Paper Leaderboard Illusion upozorňuje na praktiku, která je nepříjemná právě proto, že žebříčky působí veřejně a jednoduše. Autoři uvádějí 27 soukromých LLM variant jednoho poskytovatele, Meta, testovaných před vydáním Llama 4. Dále odhadují asymetrii přístupu k datům Arény: 20,4 procenta pro OpenAI, 19,2 procenta pro Google a 29,7 procenta pro 83 open-weight modelů dohromady [4].

Tyto podíly LMSYS ve své reakci zpochybnil. Proto je nelze číst jako uzavřený audit celé Arény. Lze je číst jako varování, že veřejný žebříček není jen matematika nad neutrálním světem. Kdo smí testovat privátně, kdo stáhne skóre, kdo zveřejní jen nejlepší variantu a kdo má přístup k hlasům, ovlivňuje to, co veřejnost vidí [4].

Jde o audit jedné praktiky, nikoli o důkaz, že žebříčky nemají cenu. Právě naopak: pokud mají cenu, potřebují protokol. Potřebují říct, která varianta běžela, kdy, s jakými pravidly a zda výsledek odpovídá produkčnímu modelu. Bez toho si uživatel nekupuje vítěze. Kupuje název, který mohl v žebříčku znamenat něco trochu jiného.

6. SWE-bench Verified není váš GitLab

SWE-bench je silný test, protože se ptá prakticky: dokáže systém vyřešit reálné GitHub issue tak, aby patch prošel testy? Původní benchmark obsahuje 2 294 instancí z 12 open-source pythonových repozitářů. Hodnotí se, zda navržený patch projde FAIL_TO_PASS i PASS_TO_PASS testy v daném harnessi [6][8].

SWE-bench Verified vznikl proto, že původní sada měla různé nečistoty. OpenAI v srpnu 2024 představila 500 lidsky ověřených instancí z 1 699 náhodně vybraných testovacích vzorků. Posuzovalo je 93 pythonových vývojářů. V ověřené sadě je 196 easy instancí s lidským odhadem času pod 15 minut a 45 hard instancí s odhadem nad 1 hodinu. Tyto časy jsou lidský odhad, ne automatická metrika [7].

Verified je čistší. Není univerzální. Stále měří pythonová issue z konkrétních repozitářů, v konkrétním harnessi, s konkrétními testy. Neměří code review, bezpečnost, architekturu, TypeScript monorepo, historický SAP ani českou dokumentaci. A SWE-bench Pro je zase jiná sada: těžší, více souborů, méně úniku ground truth. Verified není Pro a Pro není váš GitLab.

Proto má smysl brát SWE-bench jako filtr kandidátů pro programování. Nemá smysl jej brát jako důkaz, že model opraví vaše issue stejnou rychlostí a se stejným rizikem. Váš harness, vaše testy a vaše pravidla review jsou součást výkonu.

Ve firemním repozitáři bývá rozhodující právě to, co veřejný benchmark nevidí. Kód může projít lokálními testy a přesto porušit interní architektonické pravidlo. Patch může být funkční, ale nečitelný pro tým, který ho bude udržovat. Agent může opravit symptom a obejít místo, kde se chyba skutečně rodí. Nebo naopak selže jen proto, že mu firma nedala stejný kontext, jaký má člověk: běhové proměnné, historické rozhodnutí, interní knihovnu a znalost release procesu. Proto se programátorský benchmark musí doplnit vlastním pilotem. Ne proto, že by veřejná sada byla špatná, ale proto, že vaše práce má jinou hranici správnosti.

7. Pět pokusů na max effort není jeden pokus

Největší zmatek vzniká, když vedle sebe položíme čísla se stejným názvem benchmarku a jiným protokolem. Anthropic ve Fable 5 a Mythos 5 system card z června 2026 uvádí na SWE-bench Verified 95,5 procenta resolved pro Mythos 5 a 95 procent pro Fable 5. Jde o self-reported čísla, průměr 5 pokusů, adaptive thinking a max effort. Fable má produkční safeguardy včetně fallbacku na Opus 4.8, což karta uvádí jako důvod, proč může být mírně pod Mythosem [11][12].

Na SWE-bench Pro uvádí stejná karta 80,3 procenta pro Mythos 5 a 80 procent pro Fable 5. Google DeepMind v model card Gemini 3.1 Pro z 19. února 2026 uvádí 80,6 procenta na SWE-bench Verified pro Gemini 3.1 Pro Thinking High, ale jako single attempt. Na public split SWE-bench Pro uvádí 54,2 procenta, také single attempt [11][14].

OpenAI v tabulce k GPT-5.6 z 9. července 2026 uvádí 64,6 procenta na SWE-bench Pro. V této tabulce neuvádí SWE-bench Verified. Ve srovnávací tabulce se objevuje Fable 5 jako 80 procent Pro, ale to je pořád číslo v OpenAI tabulce a shoda názvu, ne důkaz stejného běhu se stejným harnessí. Historicky OpenAI u SWE-bench Verified uváděla GPT-4o s 33,2 procenta resolved k srpnu 2024, v poznámce k Agentless [7][13].

Co je potřeba testovat, než sečtete dvě procenta

Zapište Verified nebo Pro. Počet pokusů. Thinking. Datum karty. Self-report nebo independent run. Agent scaffold. Povolené nástroje. Teprve potom porovnávejte. Bez toho nejde číslo 95 vedle 80,6 číst jako souboj značek. Je to souboj dvou řádků s jiným protokolem.

Self-reported skóre sdílí název benchmarku. Nesdílí protokol.

— Jiný Kontext

8. MMLU není všeobecná inteligence

MMLU má dobrý důvod být slavné. Hendrycks et al. postavili rozsáhlý čtyřvolbový akademický test v angličtině: 57 předmětů a 15 908 otázek celkem, z toho 14 079 testovacích a 1 540 validačních. V původním paperu se používá pět few-shot příkladů na předmět [9].

Taková sada pomohla měřit šíři znalostí. Jenže šíře akademických otázek není všeobecná inteligence. MMLU neměří české právo, české reálie, open-ended práci s dokumentem ani schopnost přiznat, že zdroj chybí. Model může být výborný na čtyřvolbové otázce a slabší v dlouhém českém dopise klientovi. Nebo naopak.

Také lidská kotva se často čte silněji, než paper dovoluje. Hendrycks et al. uvádějí 34,5 procenta pro MTurk bez specializace a přibližně 89,8 procenta jako odhad expertního 95. percentilu ze zdrojových zkoušek. Ten expertní údaj je odhad, částečně z percentilů a částečně educated guess. Není to změřený panel expertů na celém MMLU [9].

MMLU-Redux a MMLU-Pro jsou další objekty. Kontaminační review z GEM 2026 připomíná MMLU jako archetyp sady citlivé na únik do tréninku a opakované používání [20]. To neznamená, že MMLU nemá cenu. Znamená to, že z něj nejde bez výhrady udělat soud o práci, kterou MMLU nikdy neměřilo.

9. Chyba v klíči není rozdíl modelů

Gema et al. v práci Are We Done with MMLU? znovu anotovali 5 700 otázek ze všech 57 předmětů a vytvořili MMLU-Redux. Odhadli, že 6,49 procenta otázek má chybu v klíči. Ve virologii v analyzovaném řezu uvádějí 57 procent chybných položek [10].

To je metodicky nepříjemné. Pokud se dva frontier modely liší o jeden procentní bod na surovém MMLU, část rozdílu může být šum labelů, ne schopnost. Model může odpovědět věcně správně a být potrestán chybným klíčem. Nebo může trefit klíč, který je sám sporný.

Není fér z toho udělat větu, že MMLU je k ničemu. Je fér z toho udělat pravidlo: čím menší rozdíl, tím větší potřeba dívat se na kvalitu labelů, interval nejistoty, kontaminaci a povahu úlohy. Přesné procento může přesně měřit vadnou podmínku.

10. Shluk u stropu GPQA není verdikt o značce

GPQA Diamond je jiný typ akademického testu. Rein et al. jej konstruovali jako graduate-level science, google-proof sadu; diamond subset má 198 otázek. V kartách modelů z roku 2026 se objevují vysoké výsledky: Anthropic uvádí Mythos 5 na 94,1 procenta jako průměr 5 pokusů, Google uvádí Gemini 3.1 Pro na 94,3 procenta bez nástrojů a OpenAI uvádí GPT-5.6 Sol na 94,6 procenta [11][13][14][22].

Rozdíl 94,1, 94,3 a 94,6 procenta vypadá jako pořadí. Jenže jde o shluk u stropu, napříč různými kartami a protokoly. Bez stejného běhu ve stejném týdnu, se stejným nastavením a veřejnými logy z toho nejde udělat verdikt značky.

Praktická otázka opět zní jinak. Pokud vybíráte model pro vědecké Q&A, GPQA může být užitečná mapa. Pokud vybíráte model pro český interní právní rozbor, mapuje jiný terén. Stropové skóre na anglické vědě není oprávnění věřit české citaci.

11. Anglický žebříček není české použití

Čeština není jen slovník. Je to syntax, ohýbání, kontext, kulturní odkazy, školy, úřady, právní formulace, chyba v diakritice a schopnost nepřeložit anglickou frázi jako českou větu. Proto jsou české benchmarky důležité, i když nejsou tak viditelné jako globální arény.

BenCzechMark z TACL 2025 uvádí 50 úloh, 14 nově sebraných a 8 kategorií. Převážně jde o nativní češtinu; asi 10 procent úloh je strojově přeloženo. Skóre není prostý průměr accuracy, ale duel win score ze statistických testů s alfa 5 procent. To je jiný jazyk hodnocení než MMLU nebo Arena Elo [17].

Zároveň je nutná výhrada. Autoři BenCzechMark záměrně neposílají vzorky do placených API, takže uzavřené ChatGPT, Claude nebo Gemini na BCM často chybí. To nelze číst jako porážku. Je to mezera v měření [17][18].

CzechBench je další česká stopa, ale ani zde není vhodné předstírat přesnost tam, kde se prameny rozcházejí. Dossier uvádí, že paper BenCzechMark zmiňuje u CzechBench 17 úloh a 8 nativních, zatímco veřejný leaderboard hlásí 15 úloh. Proto zde nestojí jedno oficiální číslo CzechBench jako pevný údaj. Pojmenovaný benchmark Czeval nebo CzEval se v primárních pramenech k září 2026 nenašel [19].

Kdo čte jen LMArena nebo MMLU, nevidí české duely. Kdo čte jen český benchmark bez uzavřených modelů, také nevidí celý trh. Správná věta není „tento model vyhrál češtinu“. Správná věta často zní: v této české sadě je změřeno toto, tamten uzavřený model chybí a vlastní test je nutný.

České použití má navíc několik podob. Jiný problém je napsat přirozený obchodní e-mail. Jiný je shrnout zápis z porady s českými jmény a institucemi. Jiný je rozlišit, zda citovaný odstavec zákona platí, byl změněn nebo patří do jiné části právního řádu. A jiný je opravit žákovský text tak, aby systém nepřepsal styl autora do hladké obecné češtiny. Jedno skóre může některou z těchto prací přiblížit. Nemůže je všechny nahradit.

12. Cena, safeguard a odmítnutí nejsou Elo

Veřejný žebříček obvykle nenese účet. Přitom uživatel nekupuje jen schopnost, ale přijatý výsledek. Anthropic v červnu 2026 uvádí pro Fable 5 cenu 10 USD za 1 milion vstupních tokenů a 50 USD za 1 milion výstupních tokenů. OpenAI v červenci 2026 uvádí pro GPT-5.6 Sol 5 USD za 1 milion vstupních a 30 USD za 1 milion výstupních tokenů [11][12][13].

Tato čísla nejsou sama o sobě verdikt. Levnější token může být dražší, pokud model potřebuje více pokusů, více kontroly a více lidské opravy. Dražší model může být levnější, pokud sníží počet neúspěšných běhů. Ceník je cena suroviny, ne cena výsledku.

Safeguard je další vrstva. Anthropic u Fable 5 uvádí produkční safeguardy a fallback na Opus 4.8, který se spouští v průměru v méně než 5 procentech relací [11]. To může být bezpečnostní výhoda. Může to ale také znamenat, že české „nejde mi to“ v konkrétním úkolu není neschopnost modelu, ale politika produktu.

Odmítnutí, latence a datový režim se do Elo nevejdou snadno. Přesto v práci rozhodují. Nejlepší model v žebříčku nemusí být nejlepší systém pro proces, v němž potřebujete audit, nízkou latenci, stabilní odpověď, levnou kontrolu a předvídatelné chování.

Stejná logika platí pro škodu. U marketingového návrhu může být odmítnutí jen zdržení. U zákaznické podpory může být nepředvídatelné odmítnutí porušením služby. U právního nebo zdravotního textu může být opatrnost žádoucí, pokud systém jasně řekne, co nechce rozhodnout a proč. Žebříček, který měří vyřešené issue nebo preferenci chatu, tuto hranici obvykle neukáže. Musí ji ukázat pilot v konkrétním procesu.

13. Grok karta není SWE tabulka

Grok se v debatách objevuje jako další značka ve stejném souboji. Dossier však uvádí jednoduchý limit: veřejné karty Grok 4 z 20. srpna 2025 a Grok 4.20 ze 7. dubna 2026 jsou bezpečnostní a dual-use assessmenty. Srovnatelné SWE-bench Verified číslo xAI v těchto kartách k datu rešerše nebylo ověřeno [15][16].

Absence čísla není důkaz neschopnosti. Je to důkaz, že z těchto karet nejde sestavit férový souboj na SWE-bench Verified. Pokud jeden dodavatel zveřejní kódovací skóre v tabulce a druhý zveřejní hlavně bezpečnostní kartu, nemáme dvě měření stejné věci.

To je obecnější pravidlo. Ne každá model card je leaderboard. Ne každý bezpečnostní dokument obsahuje produktový výkon. A ne každá marketingová tabulka má protokol, který by umožnil porovnání s jinou tabulkou. Když podklad chybí, přesná odpověď zní „neověřeno“, ne „prohrálo“.

14. Nejlepší mapa je ta, jejíž omyl unesete

Následující doporučení nejsou žebříček produktů. Jsou směrovkou k prvnímu vlastnímu běhu. Navazují na text Komu dovolíte chybovat, který řeší výběr AI podle druhu chyby, již si můžete dovolit. Tady nejde o druhý verdikt značky. Jde o to, jak číst žebříček jako mapu.

Druh selhání Jak vypadá Jak testovat Co omezí škodu
Preference jako správnost Vyšší Elo = pravdivější čeština Deset úloh ve stejném jazyce; faktická chyba, ne „líbí se“ Style control brát jako výhradu, ne jako zkoušku pravdy
Skrytý harness 95 % vedle 80,6 % jako souboj značek Zapsat pokusy, thinking, datum, Verified vs Pro, self-report vs independent Nesčítat karty s různým protokolem
Anglická mapa na česky LMArena nebo MMLU jako verdikt pro českou práci BenCzechMark, CzechBench nebo vlastní sada; „není změřen“ není „prohrál“ Nenechat MMLU ani surové Elo první sloupec
Cherry-pick variant Privátní běhy, stažení skóre, jen nejlepší číslo ven Ptát se, která varianta je v produkci Leaderboard Illusion jako výhrada k tabulce
Shluk u stropu 94,1 / 94,3 / 94,6 jako pořadí značek GPQA Diamond: rozdíl 1 p. b. u stropu Nerozhodovat nákup o jeden procentní bod

Ilustrační schéma: Tři sloupce — Aréna (preference), SWE-bench (testy v harnessi), BenCzechMark (české duely). Šipka „nejlepší“ mezi sloupci nevede. Vede jen uvnitř sloupce, s datem a protokolem.

Dobrá mapa není ta, která má největší číslo. Dobrá mapa je ta, jejíž omyl znáte. Pokud měří preferenci, použijte ji pro práci, kde preference dává smysl. Pokud měří patch po testech, použijte ji pro výběr kandidátů do programování. Pokud měří češtinu, čtěte ji česky a s limitem pokrytí.

15. Deset vlastních úloh řekne víc než první místo

Praktický test není souboj značek. Je to kontrola, zda mapa sedí na vaši úlohu. Sestavte deset úloh ve stejném jazyce, stejném žánru a se stejným prahem škody. Deset českých e-mailů zákazníkovi. Deset issue z vašeho repozitáře. Deset otázek z interní znalostní báze. Deset krátkých rozborů, kde znáte správnou oporu.

Jak testovat dva kandidáty na stejné sadě

Spusťte dva kandidáty ve stejný den, se stejným nastavením thinking, bez přepínání promptu mezi běhy a se stejným přístupem k nástrojům. Zaznamenejte faktickou chybu, halucinovaný citát, odmítnutí, délku, cenu a čas do použitelného výsledku. Nepřičítejte Elo. Přičítejte, která chyba by prošla vaší kontrolou.

Tři testy harnessu

Pokud úloha je čeština, nenechte jako první sloupec MMLU ani surové Elo Arény. První sloupec je BenCzechMark, CzechBench nebo vaše sada. Pokud uzavřený model na BenCzechMark není, napište „není změřen“, ne „prohrál“.

Pokud úloha je kód, uveďte harness. „95 procent Verified“ bez počtu pokusů, thinking režimu a agent stacku je marketingový titulek, ne laboratorní zápis. Pokud úloha je rešerše, kontrolujte citace po větách. Citace, která existuje, ještě nemusí podporovat konkrétní závěr.

Vlastní sada nemusí být velká. Musí být pravdivá. Má měřit práci, kterou opravdu děláte, v jazyce, ve kterém ji děláte, a s chybou, kterou si umíte představit.

Dobrá sada má také správné negativní příklady. Nestačí dát modelu deset úloh, které jdou hladce vyřešit. Přidejte zadání, v němž chybí podklad. Přidejte dokument s rozporem mezi starší a novější verzí. Přidejte otázku, u níž je správná odpověď „z dostupných dat to nejde říct“. V takové chvíli se ukáže rozdíl mezi modelem, který chce za každou cenu dokončit větu, a systémem, který pomáhá udržet kontrolu.

Výsledek zapisujte jednoduše. Nejen známku, ale druh chyby. Vymyšlený zdroj. Správný zdroj, špatný závěr. Příliš dlouhá odpověď. Odmítnutí bez důvodu. Dobrá odpověď, ale příliš drahá na opakování. Teprve tento zápis říká, zda první místo z veřejné mapy vede k vašemu cíli.

16. Self-reported skóre není independent run

Sebehodnocení dodavatele není automaticky nepravdivé. Je však jiný typ důkazu než nezávislý běh. Model card může být poctivá a přesto nesrovnatelná s kartou konkurenta. Rozdíl může být v počtu pokusů, agentním scaffoldu, datu, povolených nástrojích, sample nebo politice výběru varianty.

Silnější závěr by vyžadoval nezávislý, předem zaregistrovaný běh stejného SWE-bench Verified harnessu pro ChatGPT, Gemini, Claude i Grok ve stejném týdnu, se stejným scaffoldem, stejným počtem pokusů, stejným commitem a veřejnými logy. To by ještě nerozhodlo češtinu ani právo, ale vyřešilo by aspoň jeden zdroj zmatku.

Pro češtinu by pomohl veřejný českojazyčný preference leaderboard s popsaným samplingem a bez privátního cherry-picku, kde by uzavřené i otevřené modely stály vedle sebe. Pro MMLU by pomohl reanotovaný nástupce bez odhadované chybovosti klíčů 6,49 procenta, na němž by se pořadí frontier modelů stabilně lišilo víc než šum labelů [10].

Také by pomohl důkaz, že style-controlled Arena skóre predikuje vaši firemní metriku lépe než vlastní sada: čas do merge, počet reklamací, počet halucinovaných paragrafů nebo podíl odpovědí vrácených editorem. Dokud tohle není, veřejný žebříček zůstává mapou úlohy. Není rozsudkem.

17. Skrytým nákladem je první místo, které měří jinou úlohu

První místo je pohodlné. Ušetří rozhodování, vejde se do prezentace a dává nákupu jednoduchou větu. Jenže právě v tom je jeho skrytý náklad. Když první místo měří jinou úlohu, přinese do firmy jistotu tam, kde měla být otázka.

Žebříček není nepřítel. Bez veřejných benchmarků bychom měli jen reklamu a osobní dojem. Aréna pomáhá vidět preference. SWE-bench pomáhá vidět programátorské opravy v určitém harnessi. MMLU a GPQA pomáhají sledovat akademické znalosti. BenCzechMark a CzechBench připomínají, že čeština musí mít vlastní měření. Každá mapa je užitečná, když víme, kam vede.

Proto není přesné říct, že benchmarkům nemáme věřit. Přesnější je říct, že jim máme věřit v rozsahu, který samy popisují. Pokud Aréna říká, že lidé v anonymním párovém srovnání preferovali jednu odpověď, nečtěme z ní pravdivost paragrafu. Pokud SWE-bench říká, že patch prošel testy, nečtěme z něj bezpečnost návrhu. Pokud BenCzechMark říká, že model obstál v českém duelu, nečtěme z něj výkon uzavřeného modelu, který v sadě nebyl.

Otázka nezní, která AI je nejlepší. Zní: kterou úlohu, kterou populaci promptů a který harness žebříček měří — a kterou chybu uvidíte včas na vlastní sadě?

Související texty této řady

Důkazní stopa

Jak text vznikl

Metoda, role AI, opravy a podrobnosti použitých zdrojů na jednom místě.

Zdroje k dalšímu čtení22 odborných pramenů
  1. Recenzovaná studieChatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. ICML / PMLR 235; arXiv:2403.04132. https://proceedings.mlr.press/v235/chiang24b.html
    Studie: Chiang, W.-L. et al. · 2024
  2. Další zdrojDoes style matter? Disentangling style and substance in Chatbot Arena. LMSYS Org, 28. 8. 2024. https://www.lmsys.org/blog/2024-08-28-style-control/
    Metodika: Li, T., Angelopoulos, A., Chiang, W.-L. · 2024
  3. Oficiální statistikaKód / data: LMArena, Contextual Bradley-Terry (style control) a dataset arena-human-preference-140k . https://github.com/lmarena/arena-rank
  4. Oficiální statistikaThe Leaderboard Illusion. arXiv:2504.20879; NeurIPS 2025 Datasets & Benchmarks. https://arxiv.org/abs/2504.20879
    Studie: Singh, S. et al. · 2025
  5. Další zdrojPlatforma: Arena / LMArena (dříve LMSYS Chatbot Arena). Veřejný žebříček. https://lmarena.ai / https://arena.ai
  6. Recenzovaná studieSWE-bench: Can Language Models Resolve Real-world GitHub Issues? ICLR 2024. https://www.swebench.com/
    Studie: Jimenez, C. E. et al. · 2024
  7. Další zdrojupdate 2025). Introducing SWE-bench Verified. https://openai.com/index/introducing-swe-bench-verified/
    Instituce: OpenAI · 2024
  8. Další zdrojLeaderboard: SWE-bench Verified / Full / Lite / Multilingual. https://www.swebench.com/
  9. Recenzovaná studieMeasuring Massive Multitask Language Understanding. ICLR; arXiv:2009.03300. https://arxiv.org/abs/2009.03300
    Studie: Hendrycks, D. et al. · 2021
  10. Recenzovaná studieAre We Done with MMLU? NAACL 2025. https://aclanthology.org/2025.naacl-long.262/
    Studie: Gema, A. P. et al. · 2025
  11. Další zdrojClaude Fable 5 & Claude Mythos 5 System Card. https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf
    Model card: Anthropic · 2026
  12. Další zdrojClaude Fable 5 and Claude Mythos 5. https://www.anthropic.com/news/claude-fable-5-mythos-5
    Oznámení: Anthropic (9. 6. · 2026
  13. Další zdrojGPT-5.6. https://openai.com/index/gpt-5-6/
    Model card: OpenAI (9. 7. · 2026
  14. Další zdrojGemini 3.1 Pro — Model Card. https://deepmind.google/models/model-cards/gemini-3-1-pro/
    Model card: Google DeepMind (19. 2. · 2026
  15. Další zdrojGrok 4 Model Card. https://data.x.ai/2025-08-20-grok-4-model-card.pdf
    Model card: xAI (20. 8. · 2025
  16. Další zdrojGrok 4.20 System Card. https://data.x.ai/2026-04-07-grok-4-20-model-card.pdf
    Model card: xAI (7. 4. · 2026
  17. Recenzovaná studieBenCzechMark: A Czech-Centric Multitask and Multimetric Benchmark… TACL. https://doi.org/10.1162/tacl.a.32
    Studie: Fajcik, M. et al. · 2025
  18. Další zdrojLeaderboard: CZLC, BenCzechMark. Hugging Face Space. https://huggingface.co/spaces/CZLC/BenCzechMark
  19. Recenzovaná studieCzechBench leaderboard / diplomová práce ČVUT. https://huggingface.co/spaces/CIIRC-NLP/czechbench_leaderboard
    Benchmark: Jirkovský, A. et al. · 2024
  20. Systematické reviewsystematic review. https://doi.org/10.18653/v1/2026.gem-main.50
    Přehled kontaminace: Are LLM Benchmarks Already Contaminated? GEM · 2026
  21. Další zdrojDoplněk stylu: LMSYS / Arena, Does Sentiment Matter in AI? https://arena.ai/blog/sentiment-control/
  22. Recenzovaná studieGPQA: Rein, D. et al. GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
Diskuze

Komentáře

Máte doplňující zdroj nebo věcnou připomínku? Přidejte komentář.

0 příspěvků

Přidat komentář