Jak dobré obrázky vygeneruje váš vlastní počítač?
7 modelů na generování obrázků lokálně a zdarma – proti vlajkové lodi Googlu za 2,80 Kč za obrázek.
V minulé studii jsem testoval, jestli lokální modely nahradí Claude Code na vývoj. Dopadlo to jasně pro cloud. Bude to tak jednoznačné i u obrázků?
Zajímalo mě, jestli dnes lokální modely dokážou vygenerovat solidní fotku scenérie nebo lidí. Zkusil jsem také generovat diagramy, abych zjistil, jak dokážou vizualizovat a pracovat s češtinou. A jako marketéra mě zajímalo, jestli dokážou vzít váš produkt a zasadit ho do nějaké reálné scény.
Stejnou úlohu jsem otestoval na 7 lokálních modelech na mém Macu oproti 2 cloudovým od Googlu. Celkem čtyři reálné úlohy, které jsem hodnotil slepým testem. Jak to dopadlo?
Chcete v článku slepý test? Lokální model vs Nano Banana Pro za 2,80 Kč / kus?
Můžete číst klasicky s popisky. Nebo si ve třech kategoriích nejdřív tipnout naslepo – stejným testem, kterým jsem výsledky hodnotil já. Na konci dostanete doporučení na míru podle svých voleb.
Co jsem zkusil a na čem
Všechny modely dostaly identické zadání, stejný seed a jeden pokus. Kroky a nastavení jsem u každého nechal tak, jak je autor doporučuje – fér není „všem stejné kroky“, fér je „každý naplno, zadání identické“.
Stejný stroj jako v minulé studii. Rozdíl: na obrázky tolik paměti nepotřebujete – vítěz scenérií běžel ve 12 GB, většina testu do 19 GB.
Dva zdarma nástroje pro Apple Silicon. Cloud protistrana běžela přes Gemini API (Nano Banana Pro + Flash).
Ilustrační scenérie (náhrada fotobanky), realistické tváře, vlastní produkt v nové scéně a česká infografika z poznámek.
Identické zadání a seed pro všechny, žádné doťukávání. Výsledky jsem řadil ve slepém testu bez popisků – dojmy a hype nehrají.
Dva cloudové modely pro benchmark
Cloud jsem vzal ve dvou patrech – vlajkovou loď i levnou variantu. Ceny uvádím za jeden vygenerovaný obrázek podle oficiálního ceníku Googlu (kurz ČNB, červenec 2026).
Vlajková loď Googlu (gemini-3-pro-image). Strop, na který má lokál dosahovat.
Levnější cloudová liga (gemini-2.5-flash-image). Kontrola, jestli stačí platit málo.
Sedm lokálních modelů v testu
Nejmenší model v testu – a lokální hvězda napříč kategoriemi.
Fotorealistický specialista. V jedné disciplíně přepsal pořadí celého testu.
Open model od Black Forest Labs, dnes asi nejznámější jméno lokální grafiky.
Největší lokál v testu – protiváha: vyhraje velikost?
Čínský model, který má pověst, že umí dobře pracovat s texty v obrázku.
Specialista na typografii – nasazen na českou infografiku.
Lokální úprava fotky – protistrana cloudu v disciplíně vlastního produktu.
▸Technické detaily: nástroje, kvantizace a jeden bug, který málem přepsal závěr
Lokální modely běžely přes mflux (Qwen, Z-Image, FLUX.2 Klein) a Draw Things (FLUX.2 dev, Krea 2, Ideogram 4, Qwen-Image-Edit) – obojí zdarma na Apple Silicon. Zajímavost: nejnovější open modely bývají týdny až měsíce napřed, než je lokální nástroje zabalí; binárku Draw Things jsem musel brát přímo z GitHubu, protože Homebrew nesl katalog o dva měsíce starší.
A poctivost velí přiznat: lokální editační model mi nejdřív generoval čistý šum a já ho málem odepsal. Nebyl špatný model – byl špatně spuštěný nástroj (chybný kvantizační parametr). Po opravě jsem celé editační kolo přeběhl znovu a slepé hodnocení opakoval. Lekce: čistý šum nikdy neznamená „slabý model“, vždycky to je bug v nastavení. Než odepíšete celou kategorii, ověřte si, že ji spouštíte správně.
Rozlišení: lokál generoval nativně ~1 megapixel (1024×1024), cloud vrací 2K v ceně obrázku. V galeriích se obojí zobrazuje stejně velké; ve slepých testech jsem hodnotil stejně zobrazené dvojice – přesně to, co uvidí váš zákazník.
Nahradí AI a lokální model fotky krajiny z fotobanky?
Scénář „náhrada fotobanky“: západ slunce na sopečném pobřeží Gran Canarie, ilustrační vizuál na web. Tohle je kategorie, kvůli které se vyplatí celou studii číst – v slepém testu vyhrál lokál zdarma a vlajka Googlu skončila předposlední. Označil jsem ji, aniž bych věděl, co hodnotím, za instagramový kýč.
Vítěz slepého testu. Živé barvy bez přepálení, uvěřitelné kameny i vlny. Lokál zdarma, který jsem naslepo postavil nad vlajku Googlu.
V plném rosteru moje top dvojka spolu s Kreou – oba lokál. Daň: největší a nejpomalejší model testu, na iterace nepraktický.
Třetí naslepo – a při 36 vteřinách na obrázek nejlepší poměr kvalita/rychlost. „Podezíral jsem ho jen proto, že vím, že je to AI.“
Druhé místo v slepém kole. Nejrychlejší v testu – ale na scenérii ho porazil lokál zdarma.
Vlajka Googlu skončila naslepo předposlední: „hodně kýčová, instagramový kýč, kameny méně realistické.“ Technicky dokonalá, ale právě proto vypadá jako reklama.
Zasněné, měkké, pastelové – na první pohled „AI sen“. A při 9 minutách na obrázek nejpomalejší způsob, jak ho dostat.
Poslední. Popsal jsem ho naslepo jako „clarity na maximum“ – přetexturovaná voda a rozbité mraky, aniž jsem věděl, který model to je.
Klik na obrázek = zvětšení, šipkami ←→ přepínáte mezi výsledky. Časy jsou na můj Mac Studio; ceny cloudu za jeden obrázek.
Proč všechny modely dávají slunce doprostřed?
Když jsem zadal jen obyčejné „západ slunce nad mořem“, všechny modely – lokální i vlajka od Googlu – nezávisle na sobě umístily slunce přesně na střed. Není to náhoda: AI na vágní zadání vrací statistický průměr milionů fotek západů slunce. A průměr je pohlednice.
Slunce přesně na středu – i u vlajkové lodi.
Slunce na středu.
Slunce na středu.
Slunce na středu.
Stejné vágní zadání, čtyři různé modely, čtyřikrát slunce na středu. Průměrnost není vlastnost konkrétního modelu – je to vlastnost vágního zadání.
A tady je důkaz, že hodnota je v zadání
Stejný lokální model (Z-Image Turbo, 6 miliard parametrů, zdarma), stejný seed. Jediné, co se změnilo, je prompt: místo „západ slunce nad mořem“ jsem zadal kompozici jako art director – slunce mimo střed, sopečné útesy, přílivové tůňky, širokoúhlý objektiv, žádná „AI měkkost“. Výsledek se posunul o ligu, na dohled vlajkové lodi.
„Západ slunce nad mořem.“ Hezké moře i mraky – ale symetrická pohlednice, slunce na středu.
Slunce v pravé třetině, čedičové útesy, textura vln. Stejný model zdarma – jiné zadání. „Skutečně vypadá jako útesy na Gran Canarii.“
Nejtěžší disciplína: dvě lidské tváře
Pár v pražské uličce, přirozený smích, žádný produkt. Dvě tváře najednou jsou nejtvrdší test – stačí jediný špatný detail a obličej začne působit uměle, až nepříjemně. A tady se karta obrací: obě cloudové verze skončily na prvních dvou místech, dvakrát po sobě, a poznal jsem je spolehlivě.
Která z těch dvou cloudových je lepší? To nechám na vašem oku. Pro má boží pozadí a světlo, ale tváře až moc vyžehlené, jako když v Lightroomu uberete texturu. Flash mi při druhém pohledu přijde v obličejích realističtější.
Úsměvný detail: cloud i nejlepší lokál shodně „schovaly“ ruce mimo záběr nebo do kapes. Prsty dvou lidí jsou pořád tak těžké, že se jim modely instinktivně vyhýbají.
Boží pozadí a světlo, celek jako z editorialu – v mém slepém řazení skončil první. Při druhém pohledu jsou ale tváře až moc vyžehlené, jako přetažený filtr v Lightroomu.
Druhé místo v obou kolech – a v obličejích mi při druhém pohledu přijde realističtější než vlajka. Posuďte sami. Každopádně i levný cloud porazil všechny lokály.
Jediný lokál, který jsem naslepo označil za použitelný – hned za cloudem. Šestimiliardový model za 36 vteřin zdarma. „Toto je super!“
Král scenérií u lidí kolísá: v jednom slepém kole nejlepší lokál, v druhém „nepoužitelný“. Na tváře se na něj nespolehnete.
Střed pole. 32 miliard parametrů výsledek u tváří nezachránilo.
Padá na opačnou stranu než FLUX: málo textury, měkká „voskovost“. Chvost slepého testu.
Přeostřená pleť, „textura na 100 v Lightroomu“, nerealistický výraz. Chvost obou kol.
Dva protilehlé způsoby, jak lokál u tváří padá: Qwen je měkký a voskový, FLUX.2 přeostřený s křičícím mikrokontrastem. Kdo nemá ani jedno (Z-Image, cloud), vypadá reálně.
„Ducati brzy v nabídce“ – marketér potřebuje ukázat produkt, který ještě nemá v rukách
Scénář z praxe: půjčovna motorek na Gran Canarii rozšiřuje flotilu o Ducati Multistrada V4 a chce ji promovat na svém ostrově dřív, než stroj fyzicky dorazí. K dispozici je jen katalogová fotka. Tohle není „vygeneruj hezký obrázek“ – model musí zachovat cizí produkt do posledního detailu: siluetu, lak, rám, nápisy. Zákazník tu motorku zná.
Přiznám se, že tady jsem čekal debakl všech. Spletl jsem se – vlajka od Googlu to zvládla v reklamní kvalitě. Slepý test tady nedělám: lokály prohrály tak jednoznačně, že by to nebyla hra, ale poprava.
Ducati Multistrada V4 z katalogové fotky. Úkol: posaď ji na pobřeží Gran Canarie, ať ji půjčovna může promovat dřív, než ji vyfotí.
Reklamní kvalita: silueta, stříbrno-černý lak, červený trellis rám, čitelné nápisy DUCATI i MULTISTRADA V4. Jediný prozrazující detail je rozsypaný text na plexi.
Téměř použitelné: zasazení slušné, ale nápisy rozmazané a motorku si přepózoval – u dražšího produktu riskujete tvar.
Nejlepší lokál: tvar motorky i scénu udrží, ale výsledek má „malovaný“ AI nádech – do reklamy bych ho nedal.
Zdeformovaná geometrie – zkrácená motorka. U produktu, který zákazník zná, je tohle diskvalifikace.
Spolehlivý rozpoznávací znak: text a loga. Kde se rozsype nápis, tam poznáte AI – u vlajky zbyl jediný rozsypaný text na plexi štítu.
Druhý pokus: mixér s čistou referencí
Motorka je těžká disciplína – členitá geometrie a spousta nápisů. Zkusil jsem proto i jednodušší zadání: mixér Sencor z čistého studiového pack-shotu na bílém pozadí zasadit do kuchyně.
A tady si lokál poradil výrazně líp než s motorkou. FLUX.2 edit dodal téměř použitelnou produktovku – zkomolil jen drobný nápis „1000 WATTS“. Možná by to při víc pokusech nebo vyladěném promptu dal celé. I tak se ale spíš vyplatí investovat pár korun do modelu od Googlu, ten to dal bezchybně napoprvé.
Izolovaný produkt, ostré logo, žádný šum okolo.
Bezchybné napoprvé: logo SENCOR i drobný nápis „1000 WATTS“ čitelné, model sám dodal prkénko s ovocem. Publikovatelná produktovka.
Téměř použitelné – nejlepší lokální edit celého testu. Produkt i scéna drží, jen nápis „1000 WATTS“ je zkomolený. Víc pokusů nebo vyladěný prompt by to možná dotáhly.
Brainstorming z poznámek: infografika s českým textem
Můj vlastní velmi častý use case: vzít nápad z poznámek nebo hlasové zprávy a nechat z něj vygenerovat ilustrovanou infografiku. Často to používám, třeba když jdu nahrávat podcast.
Vzal jsem si své poznámky k problematice kontextového okna z mého průvodce. A nechal generovat.
Háček je v češtině: háčky a čárky jsou pro generování obrázků nejtvrdší test. Použitelný výstup dodala jediná – Nano Banana Pro od Googlu. Pozor: na češtině padá i levný cloud. Tohle není mezera „cloud vs lokál“, ale „vlajka vs všichni ostatní“.
Jediný použitelný výstup: trefený ilustrativní styl a čeština skoro perfektní. Tohle je pro mě největší pokrok celého testu.
Nejlepší z lokálů – titulek i podtitulek zvládl. Ale dál chyby v češtině a rozsypané znaky: nepoužitelné.
Pozor: i levný cloud na češtině padá. Tahle disciplína není „cloud vs lokál“, ale „vlajka vs všichni ostatní“.
Hvězda fotorealismu na textu skončila: guláš znaků.
Reputace „umí text“ platí pro angličtinu a čínštinu. Česky guláš.
Layout a ilustrativní styl zvládly skoro všechny – zeď, na které lokály padají, je text. A brief rozhoduje brutálně: první pokus s plochým zadáním „mindmapa“ vypadal špatně u všech; ilustrativní styl podle reference povýšil celé pole.
Kolik to stojí – a na jakém stroji to poběží
U minulé studie s kódovacími modely byla paměť brutální bariéra: použitelné modely začínaly na 64 GB. U generování obrázků je svět úplně jinde – a to mění, pro koho lokální cesta dává smysl.
Řádová cena za jednu licencovanou fotku, bez možnosti úprav na míru.
Nano Banana Pro, 1K–2K výstup ($0,134). Ve 4K 5,10 Kč. Dávkově polovina.
Nano Banana Flash ($0,039). Nejrychlejší v testu (6–9 s) – ale čeština nad jeho síly.
Jednou stáhnete model, pak generujete neomezeně. Platíte jen elektřinu – a data neopustí počítač.
Kolik paměti model při generování reálně sežere
Změřená špičková obsazená paměť při generování 1024×1024 (Mac Studio M3 Ultra). Z-Image jel jako jediný bez kvantizace, proto vede. Zajímavost: největší model testu (FLUX.2 dev, 32B) se vešel do 18 GB, protože Draw Things umí váhy streamovat. Pro srovnání: kódovací modely v minulé studii chtěly 19–199 GB a ty použitelné začínaly na 64 GB.
Čas na jeden obrázek (1024×1024)
Nejmenší model (Z-Image, 6B) je nejrychlejší lokál a zároveň lokální hvězda kvality – největší (FLUX.2 dev, 32B) je 12× pomalejší a nevyhrál. Velikost tady není všechno, stejně jako u kódovacích modelů.
▸Technické detaily: jak jsem paměť měřil a co s ní (ne)udělá kvantizace
Měřil jsem špičkovou rezidentní paměť procesu při generování – tedy „kolik RAM si to reálně vezme“, ne velikost staženého souboru. Modely běžely ve stejném nastavení jako v celém benchmarku, takže čísla odpovídají kvalitě v galeriích.
A jedno zjištění navíc: kvantizace „za běhu“ (parametr -q v mflux) špičku paměti nesníží – nástroj nejdřív načte plné váhy a teprve pak je zmenšuje. Ověřil jsem měřením: Z-Image s -q 8 i -q 4 si vzal prakticky stejně jako bez kvantizace. Na menším Macu proto potřebujete předem zmenšené váhy, nebo nástroj, který umí váhy streamovat – přesně tak se 32miliardový FLUX.2 dev vešel do 18 GB přes Draw Things, aplikaci stavěnou i pro iPhony.
Google mezitím udělal obří skok
Nebyl to záměr studie, ale z výsledků to křičí: rozdíl mezi levným a vlajkovým modelem Googlu je propastný – a vlajka dnes zvládá věci, které byly před půl rokem sci-fi. Product placement cizího stroje s čitelným logem. Česká infografika bez jediné chyby v diakritice. To druhé neumí žádný jiný model v testu – ani ten levnější od samotného Googlu.
Prakticky to znamená: nestačí říct „používám AI od Googlu“. Mezi 0,83 Kč a 2,80 Kč za obrázek je rozdíl mezi „téměř použitelné“ a „reklamní kvalita“. U scenérií je to jedno – tam vyhrál lokál zdarma. U vašeho loga rozhodně ne.
Výsledek: Nano Banana Pro vede téměř vždy. Ale pak už je to složitější
Kdybych měl modely obodovat a seřadit do jednoho žebříčku, lhal bych. Nejde ani říct, který model nejvíc dýchá na záda Nano Banana Pro – každý z nich je dobrý na něco jiného.
Nejzajímavější je to u scenérií, kde i vlajka od Googlu dokáže být – aspoň v mých očích – poražena. Hned tři modely generují srovnatelné nebo lepší scény: Krea 2, FLUX.2 dev a Z-Image Turbo. Krea 2 je pro mě navíc největší překvapení testu.
U generování lidí už jsou modely od Googlu v jasné převaze a jediným vyzyvatelem se zdá Z-Image Turbo.
Pro marketérský use case s vlastním produktem nejde moc přemýšlet nad jinou alternativou než Nano Banana Pro (případně modely od ChatGPT a spol., ale ty jsem netestoval). A podobně u diagramů a vizualizací.
| Model | Cena/obrázek | Scenérie | Lidé | Produkt | CZ infografika |
|---|---|---|---|---|---|
| Nano Banana Pro | 2,80 Kč | kýč (4. z 5) | top dvojka | reklamní kvalita | jediná použitelná |
| Nano Banana Flash | 0,83 Kč | solidní | top dvojka | téměř použitelné | chyby v češtině |
| Krea 2 | zdarma | vítěz naslepo | kolísá | neumí | – |
| Z-Image Turbo | zdarma | těsně za špičkou | jediný použitelný lokál | neumí | guláš |
| FLUX.2 dev | zdarma | top dvojka | střed pole | neumí | – |
| FLUX.2 Klein | zdarma | přetexturováno | přeostřená pleť | motorka ne, mixér téměř | – |
| Qwen-Image | zdarma | měkký „AI sen“ | voskové | drží tvar, „malované“ | guláš |
| Ideogram 4 | zdarma | – | – | neumí | nejlepší lokál, chyby |
Pět věcí, které si ze studie odnáším
1 · Google dělá obrovské pokroky. A jeho modely jsou skutečně velmi velmi schopné. Sám ve své práci využívám zatím na 95 % věcí právě model Nano Banana Pro.
2 · Fotobanku na ilustrace už nahradí Mac zadarmo. V slepém testu jsem u scenérie dal přednost lokálu před vlajkou od Googlu – a nepoznal jsem, který je který. Když potřebujete desítky ilustračních vizuálů pro web, lokální generování je dnes reálná náhrada fotobanky: zdarma, bez řešení licencí a data neopustí váš počítač.
3 · Na lidi, vlastní produkty a českou grafiku plaťte top cloud modely. Tváře cloud vyhrál dvakrát po sobě a poznal jsem ho spolehlivě. Product placement s čitelným brandingem zvládl jen Nano Banana Pro od Googlu. A česká infografika je nejtvrdší: tam padá i levnější verze Flash. Tam potřebujete jen to nejlepší.
4 · Hodnota není jen v modelu, ale také v zadání. Všechny modely – včetně vlajky – daly na vágní prompt slunce doprostřed záběru: statistický průměr milionů fotek. Stačilo zadání přepsat jako art director (kompozice, objektiv, „žádný AI soft“) a stejný 6B model zdarma se posunul o ligu výš. Průměrnost není vlastnost AI, je to vlastnost vágního zadání.
5 · Nejde určit nejlepší lokální model. Každý vynikne v jiné disciplíně. Je tedy potřeba testovat a na váš use case zvolit ten nejvhodnější přesně na míru.
Jak dobré obrázky vygeneruje váš vlastní počítač? Překvapivě dobré – na ilustrace a scenérie tak dobré, že jsem je naslepo nadřadil vlajce Googlu. Na lidi, vlastní produkty a českou grafiku si připlaťte 2,80 Kč za obrázek u vlajky. A jestli si z téhle studie odnesete jedinou věc: rozdíl mezi průměrným a skvělým obrázkem nedělá model, ale vaše zadání.
Chcete si lokální generování vyzkoušet? Návod krok za krokem najdete v průvodci Lokální generování obrázků a širší kontext v rozcestníku lokální AI.
Výstupy jsou syrové, jeden pokus na model, nic dodatečně neupravováno ani neretušováno. Ceny cloudu podle oficiálního ceníku Google (přepočet kurzem ČNB). Studie vznikla v červenci 2026.
Newsletter AI First — zdarma
Každou neděli to podstatné z AI a vibe codingu
Osobní výběr novinek, které sám používám a považuji za hodnotné.
Přihlášením souhlasíte se zpracováním osobních údajů podle našich zásad. Odhlásíte se kdykoli jedním klikem.
Nástroje se mění. Mindset zůstává.
Jedna věc jsou nástroje, modely, frameworky. Mnohem důležitější je ale mít chuť s nimi tvořit. Realizovat svoje nápady. Přinášet hodnotu zákazníkům. Posouvat customer experience. A přesně to se snažím učit ve svém kurzu.
Od základů AI a prvních krůčků v Claude Code až po vytváření reálné hodnoty díky vibe codingu. To přesně učím 1 800+ absolventů v kurzu s 22 hodinami praktického know-how.