Google Lens používá přes 1,5 miliardy lidí měsíčně: vyfotí boty, rostlinu nebo součástku a vyhledávač odpoví, aniž by napsali jediné slovo. Na Androidu stačí zakroužkovat cokoliv na obrazovce. Do AI chatbotů lidé nahrávají fotky s otázkou „co to je a kde to seženu". Vyhledávání zkrátka přestává stát jen na textu. Přizpůsobení webu téhle změně se říká multimodální SEO. Hned na začátku řeknu, co si o té nálepce myslím: žádnou novou disciplínu s vlastním rozpočtem v ní nehledejte. Je to hlavně důvod konečně uklidit obrázky a videa na webu. Ten úklid se vyplatil vždycky — jen teď je o dost víc poznat, kdo ho odložil.
Jak se dnes hledá bez psaní
Nejdřív co reálně existuje, žádné výhledy do roku 2030:
Google Lens. Vyfotíte věc, nebo otevřete existující fotku, a Google hledá podle obrazu. K fotce jde přidat i text („podobné, ale v modré") a Lens spojí obojí dohromady. Podle Googlu roste používání Lens o 65 % meziročně a nejčastější dva důvody, proč po něm lidé sahají, jsou nakupování a zvědavost — „co to přede mnou vlastně je".
Zakroužkuj a hledej. Na vybraných telefonech s Androidem (Pixely, Samsungy a postupně další) podržíte tlačítko plochy a zakroužkujete cokoliv na obrazovce: bundu na fotce z Instagramu, židli ve videu. Hledání proběhne rovnou, bez přepínání aplikací.
Fotka v AI nástrojích. Gemini i ChatGPT přijmou nahranou fotku a odpoví na otázku o ní. A Režim AI, který Google spustil v Česku v říjnu 2025, bere dotazy textem, hlasem i fotkou.
Za všemi třemi cestami sedí stejný typ technologie: model, který nezpracovává slova zvlášť a obrázky zvlášť, ale čte text, obraz a video jako jeden celek.
Proč se stránka posuzuje jako celek
Technice uvnitř rozumět nemusíte. Stačí jeden důsledek: vyhledávač už neposuzuje text stránky a obrázky na ní odděleně. Google to má ve své dokumentaci k obrázkovému vyhledávání výslovně: význam obrázku určuje z alt textu, z obsahu okolní stránky a z počítačového vidění dohromady. A doporučuje umisťovat obrázky k textu, ke kterému patří.
Tomuhle přístupu se někdy říká kontextové SEO: nerozhoduje jen to, co na obrázku je, ale co stojí kolem něj. Fotka vašeho výrobku uprostřed odstavce o něčem jiném je pro stroj hádanka. Ta samá fotka pod nadpisem s názvem výrobku, s popiskem a vyplněným alt textem, se přečte sama. Obrázek a text si navzájem půjčují význam — a platí to i obráceně: dobrý text s fotkami, které s ním nesouvisí, ztrácí.

Nechce se vám tohle všechno řešit vlastními silami? Přesně tyhle věci dělám za majitele firem každý den. Pošlete mi adresu webu a do 48 hodin víte, co vás v Googlu brzdí a co bych opravila jako první — zdarma a bez závazku.
Co s tím uděláte na běžném webu
Nic z následujícího není novinka. Dohromady ale rozhodují o tom, jestli váš web v obrázkovém a multimodálním hledání vůbec existuje.
1. Obrázky, které nesou informaci. Ilustrační fotka usmívajících se lidí u notebooku neříká o vaší firmě nic — a model to pozná stejně spolehlivě jako návštěvník. Vlastní fotky provozovny, výrobků, zakázek před a po: to jsou obrázky, které mají co sdělit a podle kterých vás někdo může najít.
2. Alt text, popisek, název souboru. Z těchhle tří polí stroj čte, co na obrázku je. Soubor dubova-deska-truhlarna.jpg řekne víc než IMG_4032.jpg. Když klientský web projedu Screaming Frogem, chybějící alt texty bývají první nález. A tuhle kontrolu si uděláte i sami, nástroj má na ni přímo report. Jak popisy psát, aby k něčemu byly, rozebírám v článku o alt textech.
3. Soulad obrázku s textem. Obrázek patří do sekce, o které vypovídá, ne „někam, ať to není samý text". Popisek pod fotkou je podceňované místo: čte ho člověk i stroj a je to nejpřirozenější způsob, jak k obrázku doplnit fakta.
4. U produktů víc úhlů a čisté pozadí. Takhle dnes vypadá nákup přes Lens: člověk vyfotí věc u známých a hledá, kde ji koupit. Jestli má váš e-shop u produktu jednu tmavou fotku z boku, prohráváte s každým, kdo má tři ostré záběry na neutrálním pozadí. Technickou stránku (formáty, komprese, rozměry) najdete v průvodci optimalizací obrázků.
5. Video s přepisem. Modely video do jisté míry „vidí", ale textová vrstva jim rozumění výrazně usnadňuje — titulky, přepis, popis. Návod mám v článku o přepisech videí a širší souvislosti v textu o optimalizaci videa pro Google.
A protože stejný typ modelů generuje i AI odpovědi ve vyhledávání, platí tahle práce dvakrát: srozumitelná stránka s obrázky, které sedí k textu, se snáz cituje. Návod, jak psát text, ze kterého si AI umí vzít odpověď, máte v článku obsah přátelský k AI.
Pro koho je to velké téma a pro koho okrajové
U e-shopů a vizuálních oborů — nábytek, móda, květiny, rekonstrukce, gastro — bych to řešila hned. Tam lidé fotkou opravdu hledají a fotka produktu je často první kontakt s vaší firmou. Naopak účetní kancelář nebo advokátní web multimodální vyhledávání nespasí ani nepotopí; tam stačí, aby obrázky nebyly děravé (prázdné alty, soubory foto1.jpg), a hlavní pozornost patří textu.
K očekáváním: kolik zákazníků vám hledání fotkou přivede, vám dopředu nikdo seriózně nespočítá. Co se spočítat dá, je současný stav: kolik vašich obrázků se vůbec indexuje a na jaké dotazy se zobrazují.
Jak poznáte, jestli se něco děje
V Search Console přepněte v přehledu Výkon Typ vyhledávání z Webu na Obrázky (případně Video). Uvidíte imprese a prokliky čistě z obrázkového hledání a hlavně dotazy, na které se vaše obrázky ukazují. Čísla bývají proti webovému vyhledávání o řád i dva menší — to je normální a není to důvod k panice. Zajímavé je, jestli rostou a jestli se mezi dotazy objevují vaše produkty.
Časté otázky
Co znamená kontextové SEO?
Práci s okolím obsahu: vyhledávač hodnotí obrázek podle textu kolem něj a každý kus stránky podle celku. Pojem se používá i šířeji — pro psaní podle záměru dotazu místo počítání klíčových slov. V obou významech jde o stejné řemeslo: stroj čte celek, ne izolovaná slova.
Je multimodální SEO totéž co optimalizace obrázků?
Optimalizace obrázků je technická půlka: formáty, komprese, rozměry, rychlost. Multimodální pohled přidává obsahovou: jestli obrázky, text a video na stránce mluví o tomtéž. Bez technické půlky se obrázky špatně načítají, bez obsahové nemají co říct.
Hledají fotkou i Češi?
Čísla jen za Česko Google nezveřejňuje, takže poctivá odpověď zní: přesně to nikdo neví. Lens je ale vestavěný v Chromu i v aplikaci Googlu, Zakroužkuj a hledej jede na nejprodávanějších telefonech a Režim AI s fotkami funguje česky. Bariéra zmizela a u mladších ročníků je hledání fotkou běžná věc, ne kuriozita.
Chcete vědět, jak je na tom váš web doopravdy? Audit zdarma — ručně, do 48 hodin.
Až budete příště nahrávat fotku na web
Zkuste si u ní položit otázku, kterou si v podstatě kladou i multimodální modely: co by z tohohle obrázku pochopil někdo, kdo nevidí zbytek stránky? Když je odpověď „nic moc", víte, co zlepšit — a nestojí to ani korunu navíc, jen chvíli práce navrch při publikování.
Druhá otázka je těžší: co by stroj pochopil z vašeho webu, kdyby z něj zmizel všechen text? Odpověď na ni se dá vyčíst z indexovaných obrázků, chybějících popisů a Search Console. A právě tohle vám umím vyhodnotit spolu se vším ostatním, co vaši viditelnost ovlivňuje.
Zdroje k faktům v článku:
- Google Lens: přes 1,5 miliardy uživatelů měsíčně, meziroční růst 65 %, nejčastější použití nakupování (ověřeno 19. 7. 2026): business.google.com
- Zakroužkuj a hledej: fungování a dostupnost na vybraných telefonech s Androidem (ověřeno 19. 7. 2026): support.google.com
- Doporučení Googlu k obrázkům: alt text + okolní text + počítačové vidění, popisné názvy souborů, umístění obrázků k relevantnímu textu (ověřeno 19. 7. 2026): developers.google.com
- Režim AI v Česku od října 2025, dotazy textem, hlasem i fotkou (ověřeno 19. 7. 2026): blog.google
