Nano Banana, nebo ChatGPT: kdo generuje lepší obrázky?
Dal jsem oběma stejná zadání a hodnotil je naslepo. Který je lepší?
Pro generování obrázků a grafik používám dva nástroje: Nano Banana v aplikaci Gemini od Google, nebo obrázky v ChatGPT. Chtěl jsem ale vědět, který je lepší pro běžnou práci i marketingové úkoly. Zkusil jsem teda 12 úloh a testoval naslepo. Tady jsou výsledky.
pro Nano Banana
pro ChatGPT
Co jsem zkoušel a jak jsem to hodnotil
Dva nejlepší modely na obrázky, mezi kterými dnes reálně vybíráte. První bydlí v aplikaci Gemini od Google, druhý v ChatGPT.
Zasadit vlastní produkt do scény, vyrobit reklamní banner s českým textem a udržet stejnou tvář napříč třemi scénami.
Každou úlohu jsem pustil dvakrát, abych viděl i odchylky jednotlivých modelů při stejném zadání. Pořád je to AI a výstup je nedeterministický.
Výstupy jsem zamíchal, schoval štítky a řadil je od nejlepšího. Až potom jsem se podíval, co je čí. Dojmy a hype tím padají.
Dva modely, dvě ceny
Nejlepší model Google na obrázky. Používáte ho v aplikaci Gemini, placené tarify ho odemykají celý.
Model na obrázky uvnitř ChatGPT. Tam si o obrázek řeknete v chatu, který už většina lidí zná.
Ceny jsou za jeden vygenerovaný obrázek a naměřil jsem je na vlastních voláních, ne opsal z ceníku. Proč to není detail, se dočtete v části o penězích.
Máte fotku produktu. A chcete ho na hezké scéně
Nejčastější marketingová úloha vůbec. Půjčovna chce ukázat motorku, kterou ještě nemá na place. Firma potřebuje svůj hrnek v kavárně. Sedm zadání, sedm stejných verdiktů: naslepo jsem pokaždé vybral Nano Banana.
Ducati Multistrada V4 přesně z boku. Tenhle úhel si pamatujte, za chvíli bude důležitý.
Obyčejný firemní hrnek s potiskem.
Kuchyňský mixér Sencor i s drobnými nápisy na těle.
Reklamní kvalita. Silueta, lak, červený rám i nápisy DUCATI a MULTISTRADA V4 zůstaly čitelné.
„Nepoužitelné, naprosto umělé.“ Prohrálo i se starším levným modelem od Google.
Mokrý asfalt, odlesky, motorka sedí ve scéně. Jasně první.
„Hodně umělé.“ Scéna kolem produktu nedrží pohromadě.
Podle tohohle obrázku jsem model poznal naslepo: stojánek je vyklopený, i když se o něj nikdo neprosil.
„Tam motorka stojí, to by spadla.“ Stojánek chybí, stroj se vznáší nad asfaltem.
Nejlepší z trojice. Produkt zachovaný, scéna klidná a uvěřitelná.
„Nepřirozené.“ Produkt v prostoru nesedí.
Reálnější scéna. Vypadá to jako fotka z rána, ne jako inzerát.
„Má ten efekt facebookové reklamní kreativy, kdy je fakt hodně očividné, že jde o produkt od té konkrétní značky.“
První, ale ne bez vady: „na monitoru ten obsah vypadá dost AIčkově.“
„Špatně, hrníček je na hraně notebooku.“ Fyzicky by tam nestál.
„Jednoznačně.“ Tvar hrnku drží i při pohledu shora.
„Hrníček vypadá deformovaný.“ Zákazník svůj produkt pozná.
Klik na obrázek ho zvětší, šipkami ←→ se posunete dál. Dvojice jdou po sobě: nahoře Nano Banana, pod ním ChatGPT na tomtéž zadání.
Kde to ChatGPT ztrácí: ve fyzice, ne v kráse
Když si projdete moje poznámky, opakuje se jedna věc. Motorka bez vyklopeného stojánku. Hrnek na hraně notebooku. Deformovaný tvar. Obrázky z ChatGPT vypadají na první pohled hezky, ale předmět v nich nesedí v prostoru. A přesně to divák podvědomě pozná.
ChatGPT vymění pozadí. Nano Banana zrežíruje fotku
Tohle je rozdíl, kvůli kterému stojí za to číst dál. Na vstupu byla motorka nafocená přesně z boku. ChatGPT ten úhel zachoval do puntíku a jen vyměnil okolí. Nano Banana si motorku sám přetočil do tříčtvrtečního pohledu, kterým se motorky reálně fotí, protože ví, jak takový snímek má vypadat.
Nevíte, jak se vaše věc fotí?
Sáhněte po Nano Banana. Neznalost vám odpustí a řemeslo dodá za vás.
Potřebujete přesně ten úhel z předlohy?
Sáhněte po ChatGPT. Doslovnost je tady výhoda, ne vada.
A ještě jedna věc, ať v tom nehledáte chybu na své straně: lepším zadáním se to nespraví. Zkoušel jsem to na čtyřech vzorcích ve třech různých stylech zadání, včetně postupu z oficiální příručky OpenAI. Úhel to nepohnulo. Není to o promptu, je to vlastnost modelu.
▸Technické detaily: co přesně jsem zkoušel, než jsem tohle napsal
Nejdřív jsem hledal chybu u sebe. První hypotéza zněla, že ChatGPT prostě mělo smůlu. Pustil jsem tedy identické zadání dvakrát: oba běhy dopadly stejně, oba jsem naslepo odmítl. Rozptyl mezi pokusy u ChatGPT existuje, ale hranici použitelnosti nepřekročí.
Druhá hypotéza zněla, že jsem prompty psal „po googlovsku“. Přepsal jsem je tedy podle oficiální příručky OpenAI, včetně ukotvení perspektivy, měřítka a stínů. Pomohlo to měřitelně, výstup byl realističtější. Úhel produktu ale zůstal stejný.
Poctivá výhrada, ať to nevyznívá silněji, než na co mám data: příručka OpenAI pracuje i s více referenčními obrázky najednou, tedy zvlášť produkt a zvlášť cílová scéna. Tuhle techniku jsem netestoval, můj nástroj umí jen jednu referenci na zadání. Netvrdím proto, že jsem vyčerpal všechny možnosti.
Jedna postava napříč více fotkami? Zatím spíš ne
Chtěl jsem stejnou ženu v kanceláři, v kavárně a na konferenci. Popsal jsem ji do posledního detailu: sako, tričko, vlasy, náušnice i nálada držely krásně. Jen to byl pokaždé jiný člověk.
Nejdřív jsem myslel, že za to může změna scény. Pak jsem pustil dvakrát úplně stejné zadání a vrátily se mi dvě různé ženy. Textem se identita neupne, ať ho napíšete jakkoliv.
Druhý běh
První běhPřetáhněte posuvník. Obě fotky vznikly z naprosto stejného zadání, jen jsem tlačítko zmáčkl dvakrát. Přepněte si i druhý model.
Dívejte se na nos, tvar obličeje a věk. Styling drží, člověk ne.
Ve světě rychlého marketingu a malých značek to nejspíš vadit nebude. Youtubeři tuhle metodu běžně používají na náhledy videí. Pro seriózní značku je ale pokaždé mírně jiná osoba v reklamě no-go. Je to stejný problém jako s barvami loga a vaším fontem, jen v bleděmodré.
Chcete konzistenci? Dávejte modelu obrázek jako referenci na vstup
Textový popis na tohle nestačí.
Dělal jsem si kulisy do vlastní hry, kde musí všechny obrazovky vypadat jako z jednoho světa. Nejdřív jsem styl popisoval slovy: tmavý smrkový les, mlha, pixel art, ta a ta paleta. Pokaždé přišlo něco jiného.
Pak jsem jednu kulisu vyrobil a dával ji na vstup jako předlohu. Styl začal držet, a to oběma modelům. Přetáhněte posuvník a uvidíte ten rozdíl na stejném místě.
Jediná kulisa, kterou jsem dělal od nuly. Takhle má vypadat celý svět té hry. Všechny další obrazovky z ní měly vycházet.
S předlohou na vstupu
Jen popis slovyPřetáhněte posuvník. Vlevo styl popsaný jen slovy, vpravo tentýž model s předlohou na vstupu.
Stejný model, stejná scéna. Jediné, co se změnilo, je způsob zadání.
Kolik stojí jeden obrázek a proč ceník neříká úplnou pravdu
Všechna čísla níž jsem naměřil na skutečných voláních, ne opsal z ceníku.
Pevná sazba za kus. Cenu určuje jen rozlišení: běžný i větší obrázek stojí 2,8 Kč, 5 Kč platíte až za ten úplně největší. Tvar obrázku ani přiložená fotka s cenou nehnou.
Pevnou cenu nemá. Účtuje se po kouscích zadání, takže záleží i na tom, jak dlouhý text napíšete a jak velkou fotku přiložíte. Napříč 20 obrázky mi vycházel medián 8,8 Kč.
Kolik stojí jeden obrázek
Třetí sloupec je past: tolik má GPT Image 2 v ceníku, jenže jakmile k zadání přiložíte vlastní fotku, reálně zaplatíte zhruba dvojnásobek. Napříč 20 vlastními voláními se cena pohybovala od 5 do 9 Kč.
A jak dlouho na něj počkáte
Rozdíl, na který se při srovnávání zapomíná: levnější model je zároveň zhruba šestkrát rychlejší (naměřeno 21 až 33 s proti dvěma a půl minutám). U sady dvaceti obrázků je to rozdíl mezi osmi minutami a skoro hodinou čekání.
Většina lidí obrázky po kusech nekupuje, platí si měsíční tarif. Ceny za kus jsem sem dal proto, aby byl vidět skutečný poměr sil. V předplatném ho nepoznáte, tam se rozdíl schová do paušálu.
Za kus začnete platit ve chvíli, kdy si výrobu grafiky zautomatizujete. Jak si takovou linku postavit, jsem popsal v článku Jak nechat Claude Code vyrobit celou sadu grafik.
▸Technické detaily: jak jsem ty ceny naměřil
Nešel jsem přes chatovací aplikace, ale přes vývojářské rozhraní, kde každé volání vrátí přesnou spotřebu. Všechna čísla jsou tedy skutečně zaplacené částky za tentýž úkol, ne odhad z tabulky. Přepočet na koruny drží jeden kurz pro celou naši sekci o obrázcích, aby se stránky navzájem nerozcházely.
Google účtuje pevnou sazbou odstupňovanou podle rozlišení. Ověřoval jsem i to, jestli cenu nemění poměr stran: nemění, čtverec i širokoúhlý obrázek stojí stejně. OpenAI naproti tomu účtuje podle toho, kolik dat dovnitř pošlete a kolik jich vyleze ven. Referenční fotka je velký vstup a obrázek ve vyšším rozlišení velký výstup, takže se cena proti tabulkové zhruba zdvojnásobí. Proto u něj uvádím rozmezí a medián, ne jedno číslo.
Pro pořádek: Google nabízí i frontový režim za přesně poloviční sazbu, kde si na obrázek počkáte. Naše měření ho nepoužívalo, uvedené ceny jsou tedy ty vyšší, běžné.
Který model vybrat podle vaší úlohy?
Kdybyste si měli ze studie odnést jednu jedinou věc, ať je to tahle tabulka.
| Potřebuju | Sáhnu po | Proč |
|---|---|---|
| Zasadit vlastní produkt do hezké scény | Nano Banana | 7 ze 7 naslepo, a ještě je levnější |
| Nevím, jak se moje věc správně fotí | Nano Banana | úhel a kompozici vymyslí za vás |
| Potřebuju přesně ten úhel z reference | ChatGPT | drží předlohu doslova, nic si nepřidá |
| Reklamní banner s vaším logem | ChatGPT | 2 ze 2 naslepo, blíž barvám i písmu značky |
| Jakýkoliv český nápis v obrázku | oba | zvládnou to oba, dokonce i jejich levnější verze |
| Přesnou podobu vašeho loga | ani jeden | překreslí ho po svém oba, pokaždé trochu jinak |
| Série obrázků v jednotném stylu | oba | nerozhoduje model, ale předloha na vstupu |
| Stejná tvář napříč více fotkami | ani jeden | neumí to ani jeden, textem se identita neupne |
Tak kdo generuje lepší obrázky?
Ani jeden. Každý vyhrál něco jiného, a to je ta užitečná odpověď. Na fotku vašeho produktu sáhněte po Nano Banana: vyhrál všech sedm úloh a je k tomu levnější i rychlejší. Na cokoliv, kde jde o vaši značku, sáhněte po ChatGPT.
A jestli si máte odnést jedinou větu: co chcete mít pokaždé stejné, nepopisujte slovy, dejte to na vstup jako předlohu. Platí to pro styl kulis i pro tvář člověka.
A jestli chcete výrobu vašich grafik posunout na úplně jiný level, podívejte se na můj návod, jak výrobu grafiky v Nano Banana a GPT Image 2 nechat na Claude Code. On porozumí zadání, postaví prompty, zavolá modely a zkontroluje kvalitu. Přesně tohle je způsob myšlení a konkrétní postup, které učím v kurzu AI First.
Návody krok za krokem najdete v průvodcích Nano Banana a Obrázky v ChatGPT, přehled celé kategorie v rozcestníku Generování obrázků přes AI. Co zvládne váš vlastní počítač zdarma, jsem měřil v minulé studii.
Výstupy jsou syrové, jeden pokus na zadání, nic dodatečně neupravováno ani neretušováno. Ceny jsem naměřil na vlastních voláních v červenci 2026 a přepočetl kurzem ČNB. Midjourney v testu není, protože nemá rozhraní, kterým by šlo pustit srovnatelné dávky. Nic o něm z těchto dat netvrdím.
Newsletter AI First — zdarma
Každou neděli to podstatné z AI a vibe codingu
Osobní výběr novinek, které sám používám a považuji za hodnotné.
Přihlášením souhlasíte se zpracováním osobních údajů podle našich zásad. Odhlásíte se kdykoli jedním klikem.
Nástroje se mění. Mindset zůstává.
Jedna věc jsou nástroje, modely, frameworky. Mnohem důležitější je ale mít chuť s nimi tvořit. Realizovat svoje nápady. Přinášet hodnotu zákazníkům. Posouvat customer experience. A přesně to se snažím učit ve svém kurzu.
Od základů AI a prvních krůčků v Claude Code až po vytváření reálné hodnoty díky vibe codingu. To přesně učím 1 800+ absolventů v kurzu s 22 hodinami praktického know-how.
