Benchmark modelů: který staví nejlepší web na jeden prompt?
Zajímalo mě, který AI model postaví nejlepší web na jeden prompt. Který se k tomu postaví nejlépe marketingově, esteticky i technicky. A tak jsem to začal testovat. Nové modely průběžně přidávám.
Zakládám specialty coffee kavárnu v centru Brna a potřebuju web. Pomoz mi i s názvem a konceptem, zatím mám jen tuhle představu. - Prémiový pocit, ať je vidět, že kávu bereme vážně. - Hlavní cíl: aby lidi opravdu přišli. Všechno na webu by tomu mělo pomáhat. - Rezervace stolu, zatím jen jako vizuální prototyp bez backendu, databáze a mailů, ale ať se proklikává jako skutečná. - Lidi nemají čas a většina přijde z mobilu. Na použitelnost a plynulost dej maximum: na telefonu to musí být bezchybné, rychlé a pohodlné. - Fotky a grafiku si vygeneruj přes skill nanobanana. Technicky: HTML, CSS a JavaScript, hlavní soubor index.html, otevřít přímo v prohlížeči, bez buildu. Knihovny a fonty klidně z CDN (jsdelivr, unpkg, cdnjs, Google Fonts). Na nic se neptej, rozhodni sám a dotáhni to do konce.
- Čas
- 27 min
- Tokeny
- 3,2 mil. tokenů
- Obrázky
- 6 obrázků
- Effort
- effort high (výchozí)
Kterou kavárnu by si lidé podle webu zvolili?
Šance, že lidi v duelu dají přednost webu před průměrným soupeřem.
Pomůže, když model přemýšlí víc?
Jak se na výsledném webu projeví nastavení úsilí, které má model vynaložit? Třeba v Claude Code ho volíte posuvníkem a může ovlivnit výsledek i víc než volba samotného modelu. Zase se ale velmi odrazí na množství tokenů, které vám práce odčerpá z předplatného, i na tom, za jak dlouho se dostanete k výsledku.
/effort. Klikněte na úroveň a podívejte se, co postavil Claude Opus 5.5.▸Technické detaily: jak běhy probíhaly a jak se počítá žebříček
Modely od Anthropicu běžely v Claude Code, modely od OpenAI v Codexu, oboje na běžném předplatném. Každý běh začínal v čisté instalaci bez mých skillů, nastavení a kontextu. Jediný přidaný nástroj byl skill na generování obrázků přes Nano Banana Pro se stropem 6 obrázků. V hlavním testu měl každý model výchozí nastavení effortu.
Zasáhl jsem jen jednou. Claude Sonnet 4.5 se po zadání obrázků zastavil, jako by čekal, že se vygenerují samy. Dostal jednou „Pokračuj a dotáhni to do konce.“ Web dodělal, obrázek ani tak nevygeneroval.
Tokeny jsou všechny, které model během práce zpracoval, včetně opakovaně čteného kontextu z cache. Proto jsou čísla v milionech, i když výsledný web má pár desítek kilobajtů.
Žebříček počítám metodou Bradley–Terry ze všech duelů najednou, stejně jako LMArena. Nezáleží tak na pořadí hlasů a model přidaný později není znevýhodněný, jen má zpočátku širší pruh nejistoty (90% interval). Modely s malým počtem hlasů losuji do duelů častěji, ať rychle doženou ostatní.
Lokální modely na vlastním Macu jsem na tvorbě webu zkoušel v minulé studii.
Weby od modelů běží na samostatné doméně, ne na aifirst.cz. Je v nich kód, který napsala AI, a ten nemá mít přístup k vašemu přihlášení do kurzu.
Weby jsou syrové, nic dodatečně neupravené. Hlasujete tedy o webu, který model postavil napoprvé, ne o modelu jako takovém. Testoval jsem 3. října 2026, rezervace na webech jsou jen ukázkové.
Newsletter AI First — zdarma
Každou neděli to podstatné z AI a vibe codingu
Osobní výběr novinek, které sám používám a považuji za hodnotné.
Přihlášením souhlasíte se zpracováním osobních údajů podle našich zásad. Odhlásíte se kdykoli jedním klikem.
Nástroje se mění. Mindset zůstává.
Jedna věc jsou nástroje, modely, frameworky. Mnohem důležitější je ale mít chuť s nimi tvořit. Realizovat svoje nápady. Přinášet hodnotu zákazníkům. Posouvat customer experience. A přesně to se snažím učit ve svém kurzu.
Od základů AI a prvních krůčků v Claude Code až po vytváření reálné hodnoty díky vibe codingu. To přesně učím 1 900+ absolventů v kurzu s 24 hodinami praktického know-how.