Robots.txt: účel, limity a místo v moderním SEO
Robots.txt je textový soubor umístěný v kořenové cestě hostitele (např. https://www.priklad.sk/robots.txt), který poskytuje prohledávačům (crawlerům) pokyny, které části webu mohou nebo nemají procházet. Ačkoli nejde o bezpečnostní mechanismus a nebrání přímému přístupu, správné nastavení výrazně ovlivňuje crawl budget, rychlost indexace a konzistentnost dat pro AIO/AEO a moderní SEO.
Základní struktura souboru a směrnice
- User-agent: definuje, pro kterého robota platí blok pravidel (např.
User-agent: *pro všechny). - Disallow: cesta, kterou robot nemá procházet (např.
Disallow: /admin/). - Allow: cesta, kterou robot může procházet, typicky k upřesnění výjimky v rámci zakázaného adresáře (např.
Allow: /admin/help.html). - Sitemap: odkaz na XML soubor(y) s mapou webu (např.
Sitemap: https://www.priklad.sk/sitemap.xml); může se vyskytovat vícekrát a nemusí být v sekci konkrétního agenta. - Crawl-delay: nestandardní směrnice, kterou některé vyhledávače respektují; Google ji ignoruje. Slouží ke zpomalení počtu požadavků.
- Host a Clean-param: proprietární směrnice (např. pro Yandex); Google je nevyužívá.
Pravidla shody cest, specificita a pořadí
V moderních implementacích (např. Googlebot) platí, že se uplatní nejkonkrétnější pravidlo pro danou URL. Vzory mohou používat zástupné znaky * (libovolná posloupnost znaků) a $ (konec řetězce). Příklady:
Disallow: /vyhladavanie/*zablokuje vše pod/vyhladavanie/.Allow: /vyhladavanie/povolenévytvoří výjimku pro konkrétní cestu.Disallow: /*?session=cílí na URL s parametremsession.Disallow: /*.pdf$cílí na URL končící příponou.pdf.
Rozdíl mezi procházením a indexací
Disallow brání procházení, ne nutně indexaci. Pokud na zablokovanou URL odkazuje mnoho odkazů, může se objevit v indexu bez obsahu (bez snippetu). Chcete-li zabránit indexaci, použijte noindex v meta tagu nebo hlavičce X-Robots-Tag – to však vyžaduje, aby byla stránka přístupná crawleru. Pokud URL zablokujete v robots.txt, robot se k meta tagu nedostane. U citlivých URL proto používejte autentizaci nebo řízení přístupu; robots.txt není bezpečnostní bariéra.
Umístění, rozsah a více hostitelů
- Robots.txt platí pro konkrétního hostitele a protokol:
https://sub.priklad.sk/robots.txtřídí pouzesub.priklad.ska protokol HTTPS.http://a jiné subdomény vyžadují vlastní soubor. - Pro vícejazyčné verze na subdoménách nebo CDN vytvořte samostatný soubor robots.txt na každém hostiteli.
- Maximální velikost zpracovávaného souboru bývá omezená (např. Google zpracuje jen prvních ~500 kB). Dlouhé soubory udržujte stručné a nadbytečné komentáře odstraňte.
Odpovědi HTTP a chování crawlerů
- 200 OK: pravidla se uplatní.
- 404/410: znamená „robots.txt neexistuje“, prohledávač ve výchozím nastavení nic neblokuje.
- 5xx nebo dočasné selhání: někteří prohledávači dočasně omezí nebo odloží procházení, aby nezatěžovali server.
- Robots.txt se ukládá do mezipaměti; změny se nemusí projevit okamžitě. Zohledněte to při nasazování.
Sitemap v robots.txt a jejich vliv
Direktiva Sitemap: usnadňuje objevování XML sitemap a feedů (např. Sitemap: https://www.priklad.sk/sitemap-index.xml). Uveďte také sitemapy obrázků nebo videí, pokud existují. Umístění v robots.txt není povinné – alternativou je odeslání v Search Console nebo deklarace v hlavičkách odpovědí.
Interakce s dalšími direktivami a standardy
- Meta robots (
<meta name="robots" content="noindex,nofollow">) působí až po procházení stránky. Pokud URL zablokujete v robots.txt, robot meta tag neuvidí. - X-Robots-Tag v hlavičce HTTP umožňuje globálnější řízení (např. pro soubory PDF:
X-Robots-Tag: noindex, nofollow). - rel=“nofollow“ u odkazů neblokuje procházení cílové URL, pouze omezuje přenos signálů; chcete-li skutečně snížit zatížení procházením, použijte robots.txt nebo jiné mechanismy.
Strategie pro crawl budget a výkon
Dobře navržený robots.txt pomáhá směrovat crawl na hodnotné stránky a minimalizovat šum. V případě velkých webů (e-commerce, zpravodajství) je vhodné blokovat generované filtry a nekonečné kombinace parametrů, které nepřinášejí další obsah. Zároveň však neblokujte kritické zdroje (CSS/JS), aby si prohledávače zachovaly schopnost správně vykreslovat rozvržení stránky a vyhodnocovat Core Web Vitals.
Doporučené vzory pro běžné scénáře
- Základ pro všechny agenty:
User-agent: *
Disallow: /admin/
Disallow: /krok-platby/
Allow: /admin/help.html
Sitemap: https://www.priklad.sk/sitemap.xml - Přesné cílení parametrů:
User-agent: *
Disallow: /*?sort=
Disallow: /*&sort=
Disallow: /*?session=
Disallow: /*&session= - Výjimka v zakázaném adresáři:
User-agent: *
Disallow: /statika/
Allow: /statika/logo.svg - Specifické pravidlo pro robota (např. rychlejší zpravodajský robot):
User-agent: NewsBot
Disallow:
User-agent: *
Disallow: /interné/ - Blokování typů souborů (pečlivě zvažte):
User-agent: *
Disallow: /*.zip$
Disallow: /*.bak$
Nejčastější chyby a jak se jim vyhnout
- Náhodné zablokování CSS/JS: pravidla typu
Disallow: /wp-includes/mohou bránit vykreslení. Ujistěte se, že kritická aktiva zůstávají dostupná. - Blokování stránek, které mají být indexovány: zablokování
/produkt/povede k chybějícím snippetům a horším výsledkům ve vyhledávání. - Spoléhání se na robots.txt kvůli „noindex“: není podporováno; používejte meta tagy nebo hlavičky.
- Příliš mnoho rozporných pravidel: prohledávače uplatňují nejkonkrétnější pravidlo; přeplněné a protichůdné zápisy zvyšují riziko chyb.
- Chybějící soubor na subdoménách: každý hostitel potřebuje vlastní robots.txt, jinak se ve výchozím nastavení nic neblokuje.
Robots.txt a AIO/AEO: vliv na odpovědi asistentů
Asistenti a systémy LLM stále častěji respektují signály týkající se přístupu k obsahu a rychlosti. Rozumně nastavený robots.txt, který brání procházení bezcenných parametrů a umožňuje vykreslování kritických zdrojů, zlepšuje dostupnost reprezentativního obsahu a stabilitu metrik (LCP/INP/CLS). Přispívá tak ke kvalitnějším citacím, odpovědím a doporučením v kanálech AIO/AEO.
Proces řízení změn, QA a měření dopadu
- Vytvořte stagingové prostředí a ověřte, zda soubor neobsahuje syntaktické chyby (např. duplicitní znaky, mezery, neviditelné znaky).
- Logujte přístupy na
/robots.txta po změně sledujte chování klíčových crawlerů. - Ověřte pokrytí v nástrojích vyhledávačů (např. v přehledech procházení a indexace) a porovnejte rychlost procházení před změnou a po ní.
- Pravidla průběžně auditujte; to, co bylo užitečné včera (blokování starých parametrů), může být po redesignu překážkou.
Šablona pro udržitelný robots.txt
Jednoduchá, okomentovaná kostra, kterou můžete přizpůsobit:
# ZÁKLAD: povolte vše, blokujte pouze skutečný šumUser-agent: *# Administrativa a soukromíDisallow: /admin/Disallow: /kosik/krok-platby/# Parametry bez hodnoty pro indexaciDisallow: /*?sort=Disallow: /*&sort=# Výjimky pro kritická aktivaAllow: /assets/css/Allow: /assets/js/# SitemapySitemap: https://www.priklad.sk/sitemap.xmlSitemap: https://cdn.priklad.sk/sitemap-cdn.xml
Testování a validace bez rizika
- Ověřte, zda se soubor nachází na správné URL a vrací
200 OKs typem obsahutext/plain. - Simulujte pravidla na reprezentativních URL (produkty, kategorie, filtry, obsahové články).
- Sledujte možnost vykreslení: zablokované CSS/JS odhalíte také v nástrojích pro náhled vykreslení a v protokolech požadavků.
„Recepty“ pro specifické CMS a scénáře
- E-shop s filtrováním: blokujte kombinace parametrů, které nevytvářejí unikátní obsah. Použijte vzory s
*a explicitní výjimky pro hodnotné landing pages. - Zpravodajský web: neblokujte archivy ani stránkování, ale omezte interní vyhledávání (
/hladat/), pokud vytváří duplicity. - Vícejazyčný web: každý hostitel/subdoména má vlastní robots.txt; udržujte konzistentní pravidla napříč jazyky.
- Soubory ke stažení: zvažte
X-Robots-Tag: noindexv odpovědi serveru pro PDF/ZIP, pokud je nechcete v indexu, a neřešte jejich indexaci pouze prostřednictvím robots.txt.
Minimalistický, přesný a auditovatelný robots.txt
Úspěšný robots.txt je stručný, přesně zacílený a pravidelně auditovaný. Omezuje šum při crawlování, chrání crawl budget, zachovává možnost vykreslení a nenarušuje indexaci. V kombinaci se sitemapy, meta tagy/X-Robots-Tag a kvalitní architekturou webu tvoří stabilní základ moderního SEO i AIO/AEO – aby se k hodnotnému obsahu dostali lidé i asistenti.
