Robots.txt bez chyb
Jeden řádek v souboru, který má většina webů tři kilobajty, dokáže sundat celou doménu z vyhledávání a nikdo si toho tři týdny nevšimne. Tady je, co robots.txt umí, co neumí a co v něm nikdy nesmí zůstat po nasazení z testu.
Co robots.txt umí a co si o něm lidé myslí
Robots.txt je textový soubor v kořeni domény, který robotům říká, kam smí lézt. Nic víc. Není to zabezpečení, není to zámek a rozhodně to není nástroj na skrytí obsahu. Soubor je veřejný, kdokoli si ho otevře přidáním lomítka robots.txt za vaši doménu, takže seznam zakázaných složek je zároveň návod, kde hledat.
Slušní roboti pravidla respektují. Googlebot, Seznambot i Bing se jimi řídí. Scrapery a nástroje na sběr mailů si z toho nedělají nic, protože za pravidlem nestojí žádná technická síla, jen dohoda. Když chcete něco opravdu skrýt, patří to za přihlášení nebo za autentizaci na úrovni serveru, ne do robots.txt.
Praktický dopad na běžný web je menší, než si lidé myslí. U prezentace s dvaceti stránkami je správný robots.txt otázka tří řádků a hlavní hodnota je v tom, že tam není nic špatně. U e-shopu s tisícovkami filtrovaných adres je to naopak nástroj, který šetří reálné peníze v podobě rozpočtu na procházení.
Disallow versus noindex: dvě různé věci, které se pletou
Nejdražší nedorozumění v celém SEO. Disallow zakazuje procházení, ne indexaci. Když na blokovanou stránku vede odkaz z jiného webu, Google ji může zařadit do indexu, aniž by ji kdy viděl. Ve výsledcích se pak objeví holá adresa s poznámkou, že popis není k dispozici. Zákazník to vidí a působí to nedodělaně.
Chcete-li stránku z výsledků skutečně dostat, potřebujete značku noindex v hlavičce, nebo hlavičku X-Robots-Tag. A tady je past: aby robot noindex viděl, musí stránku projít. Pokud ji zároveň blokujete v robots.txt, noindex si nikdy nepřečte a stránka v indexu zůstane napořád. Nikdy tyhle dvě věci nekombinujte na téže adrese.
Direktiva Noindex přímo v robots.txt kdysi neoficiálně fungovala, Google ji ale od září 2019 nepodporuje a ignoruje ji. Stejně tak ignoruje Crawl-delay. Kdo má v souboru tyhle řádky z deset let starého návodu, spoléhá na něco, co u Googlu neplatí. Seznam Crawl-delay respektuje, takže mazat to úplně nutné není.
| Nástroj | Co udělá | Kdy ho použít |
|---|---|---|
| Disallow v robots.txt | zakáže procházení, index nezruší | filtry, košík, interní vyhledávání |
| Značka noindex | stránku vyřadí z výsledků | děkovací stránky, tenký obsah |
| Kanonický odkaz | sloučí duplicity na jednu adresu | varianty produktu, parametry |
| Přihlášení nebo heslo | obsah nikdo nepřečte | citlivá data, testovací verze |
| X-Robots-Tag | noindex pro PDF a soubory | ceníky a dokumenty ke stažení |
Čtyři řádky, které vyřadí web z vyhledávání
První a nejčastější katastrofa je zákaz celého webu pro všechny roboty. Vznikne tak, že vývojář zakáže indexaci testovací verze a při nasazení na ostro soubor zapomene přepsat. Web mizí z výsledků během deseti až dvaceti dnů. Nápravu jsem několikrát řešil a návrat na původní pozice trval čtyři až osm týdnů, u větších webů déle.
Druhá je blokace složek se styly a skripty, typicky wp-content nebo assets. Google stránku projde, ale nevykreslí ji. Vidí holý text bez rozvržení, vyhodnotí ji jako nepoužitelnou na mobilu a přijde o polovinu obsahu, který se dogeneruje skriptem. Testem Kontrola URL v Search Console to poznáte za minutu, stačí si prohlédnout vykreslený snímek.
Třetí past je pořadí a konkrétnost pravidel. Google čte nejkonkrétnější shodu, ne pořadí odshora dolů, takže povolení nad zákazem nefunguje intuitivně. A pokud soubor přesáhne 500 kilobajtů, zbytek Google ignoruje. To zní jako teorie, ale u velkých e-shopů s generovaným seznamem zakázaných filtrů to reálně nastává.
- zákaz celého webu pro všechny roboty, tedy lomítko pod hvězdičkou
- blokace složek se styly a skripty, typicky wp-content nebo assets
- plošná blokace všech adres s otazníkem, která vyřadí i stránkování
- direktivy Noindex a Crawl-delay pro Googlebota, obojí ignoruje
- blokace složky s obrázky, když chcete být ve vyhledávání obrázků
- odkaz na sitemapu s protokolem http, když web běží na https
AI crawlery: koho pustit a koho ne
Od roku 2023 vedle vyhledávačů chodí i roboti jazykových modelů. GPTBot od OpenAI, ClaudeBot, PerplexityBot, CCBot od Common Crawl, Bytespider od TikToku a Google-Extended, který řídí použití obsahu pro trénink Gemini, ale nemá vliv na běžné vyhledávání. Každý se dá povolit nebo zakázat samostatně. Seznam se mění každé čtvrtletí, takže soubor z loňska už je neúplný.
Rozhodnutí není technické, ale obchodní. Když prodáváte službu a chcete být uváděni jako zdroj v odpovědích, blokace vás z těch odpovědí vyřadí. Když prodáváte samotný obsah, tedy kurzy, texty nebo fotografie, dává blokace smysl. Pro devět z deseti mých klientů je správná odpověď nechat je projít, protože doporučení modelu už dnes vozí poptávky.
Bytespider je zvláštní případ. U jednoho e-shopu tvořil za měsíc čtvrtinu všech požadavků na server a zpomaloval reálné návštěvníky. Blokace v robots.txt trvala minutu a odezva serveru klesla o třetinu. Sledujte logy, ne dojmy. Bez dat blokujete naslepo a klidně si vypnete zdroj návštěv. Většina hostingů dnes umí přehled robotů vypsat v administraci.
- GPTBot sbírá data pro trénink modelů OpenAI
- OAI-SearchBot a ChatGPT-User obsluhují vyhledávání v ChatGPT
- ClaudeBot je robot společnosti Anthropic
- PerplexityBot hledá zdroje pro odpovědi Perplexity
- Google-Extended řídí použití pro Gemini bez dopadu na vyhledávání
- CCBot patří Common Crawl, ze kterého čerpá kdekdo
- Bytespider bývá agresivní a blokace se často vyplatí kvůli zátěži
Sitemapa, rozpočet na procházení a robots.txt u e-shopu
Direktiva Sitemap patří na konec souboru a uvádí se absolutní adresou včetně https. Odkazů na sitemapy může být víc, u velkých webů jedna hlavní s odkazy na dílčí. Google si sitemapu z robots.txt vezme i bez toho, abyste ji vkládali do Search Console, ale vložení tam zpracování urychlí a dostanete report o pokrytí.
U e-shopu je hlavní práce v blokaci parametrů. Filtry podle barvy, velikosti a ceny generují tisíce kombinací, které nemají žádnou hodnotu. Typicky blokuji řazení, porovnávání, košík, interní vyhledávání a filtrované kombinace tří a více parametrů. Jednoduché filtry s reálnou hledaností, jako dámské boty velikost 38, naopak nechávám procházet a dávám jim vlastní text.
Efekt se ukáže v Search Console ve statistikách procházení. U e-shopu s osmi tisíci produkty se po vyčištění robots.txt počet denně procházených adres přesunul z filtrů na produkty a nové zboží se začalo objevovat v indexu do tří dnů místo dvou týdnů. Žádná změna obsahu, jen míň zbytečných dveří pro robota.
Kontrola, hlídání a ceny
Kontrola je zdarma a trvá deset minut. Otevřete si soubor v prohlížeči, přečtěte ho řádek po řádku a pak v Search Console projeďte několik důležitých adres testem Kontrola URL. Nástroj řekne, jestli je adresa blokovaná a kterým pravidlem. Zvlášť ověřte domovskou stránku, hlavní službu nebo kategorii a jednu stránku s obrázky.
Ceny u mě: revize robots.txt je součástí technického auditu za 4 900, kde kromě něj řeším sitemapu, indexaci a hlavičky. Samostatné sepsání souboru na míru e-shopu s blokací parametrů je 1 900. U nových webů od 19 990 je robots.txt i sitemapa součástí dodání a nasazuji je při spuštění, ne dodatečně po prvním problému.
Nejlevnější je to hlídat. Jednou za měsíc se soubor stáhne a porovná s uloženou verzí, což je pár řádků skriptu. U klientů v režimu Péče za 2 990 měsíčně to běží automaticky a poplach přijde do hodiny od změny. Kdyby měl někdo z tohohle článku udělat jen jednu věc, ať je to tahle.
Časté otázky
Potřebuje robots.txt i malý web s deseti stránkami?
Potřebuje, ale krátký. Stačí povolit vše, zakázat administraci a děkovací stránku a uvést adresu sitemapy. Když soubor chybí úplně, server vrací chybu 404 a Google to bere jako povolení procházet vše, takže se svět nezboří. Horší je soubor s pravidly, kterým nikdo nerozumí a nikdo je roky nekontroloval.
Jak rychle se změna v robots.txt projeví?
Google si soubor stahuje zhruba jednou za 24 hodin a drží si ho v mezipaměti. Uvolnění blokované sekce se tak projeví během jednoho dne, návrat stránek do indexu ale trvá déle, běžně týden až měsíc podle velikosti webu. Urychlit to jde odesláním sitemapy a ruční žádostí o indexaci u klíčových adres.
Mám blokovat AI roboty, aby mi nekradli obsah?
U firmy, která prodává službu nebo zboží, obvykle ne. Blokací se připravíte o uvedení jako zdroj v odpovědích ChatGPT nebo Perplexity, odkud už dnes chodí poptávky. Blokace dává smysl u placeného obsahu, rozsáhlých databází a u robotů, kteří zatěžují server. Rozhodujte se podle logů, ne podle nálady.
Chcete web, který přivádí zákazníky?
Postavím vám ho na míru, s měřením a připravený na reklamy. Návrh dostanete zdarma a nezávazně.
Vybrat si termín hovoru →