Robots.txt: soubor s pravidly pro webové crawlery

Robots.txt: Súbor s pravidlami pre webové crawlery

Robots.txt: účel, limity a místo v moderním SEO

Robots.txt je textový soubor umístěný v kořenové cestě hostitele (např. https://www.priklad.sk/robots.txt), který poskytuje prohledávačům (crawlerům) pokyny, které části webu mohou nebo nemají procházet. Ačkoli nejde o bezpečnostní mechanismus a nebrání přímému přístupu, správné nastavení výrazně ovlivňuje crawl budget, rychlost indexace a konzistentnost dat pro AIO/AEO a moderní SEO.

Základní struktura souboru a směrnice

  • User-agent: definuje, pro kterého robota platí blok pravidel (např. User-agent: * pro všechny).
  • Disallow: cesta, kterou robot nemá procházet (např. Disallow: /admin/).
  • Allow: cesta, kterou robot může procházet, typicky k upřesnění výjimky v rámci zakázaného adresáře (např. Allow: /admin/help.html).
  • Sitemap: odkaz na XML soubor(y) s mapou webu (např. Sitemap: https://www.priklad.sk/sitemap.xml); může se vyskytovat vícekrát a nemusí být v sekci konkrétního agenta.
  • Crawl-delay: nestandardní směrnice, kterou některé vyhledávače respektují; Google ji ignoruje. Slouží ke zpomalení počtu požadavků.
  • Host a Clean-param: proprietární směrnice (např. pro Yandex); Google je nevyužívá.

Pravidla shody cest, specificita a pořadí

V moderních implementacích (např. Googlebot) platí, že se uplatní nejkonkrétnější pravidlo pro danou URL. Vzory mohou používat zástupné znaky * (libovolná posloupnost znaků) a $ (konec řetězce). Příklady:

  • Disallow: /vyhladavanie/* zablokuje vše pod /vyhladavanie/.
  • Allow: /vyhladavanie/povolené vytvoří výjimku pro konkrétní cestu.
  • Disallow: /*?session= cílí na URL s parametrem session.
  • Disallow: /*.pdf$ cílí na URL končící příponou .pdf.

Rozdíl mezi procházením a indexací

Disallow brání procházení, ne nutně indexaci. Pokud na zablokovanou URL odkazuje mnoho odkazů, může se objevit v indexu bez obsahu (bez snippetu). Chcete-li zabránit indexaci, použijte noindex v meta tagu nebo hlavičce X-Robots-Tag – to však vyžaduje, aby byla stránka přístupná crawleru. Pokud URL zablokujete v robots.txt, robot se k meta tagu nedostane. U citlivých URL proto používejte autentizaci nebo řízení přístupu; robots.txt není bezpečnostní bariéra.

Umístění, rozsah a více hostitelů

  • Robots.txt platí pro konkrétního hostitele a protokol: https://sub.priklad.sk/robots.txt řídí pouze sub.priklad.sk a protokol HTTPS. http:// a jiné subdomény vyžadují vlastní soubor.
  • Pro vícejazyčné verze na subdoménách nebo CDN vytvořte samostatný soubor robots.txt na každém hostiteli.
  • Maximální velikost zpracovávaného souboru bývá omezená (např. Google zpracuje jen prvních ~500 kB). Dlouhé soubory udržujte stručné a nadbytečné komentáře odstraňte.

Odpovědi HTTP a chování crawlerů

  • 200 OK: pravidla se uplatní.
  • 404/410: znamená „robots.txt neexistuje“, prohledávač ve výchozím nastavení nic neblokuje.
  • 5xx nebo dočasné selhání: někteří prohledávači dočasně omezí nebo odloží procházení, aby nezatěžovali server.
  • Robots.txt se ukládá do mezipaměti; změny se nemusí projevit okamžitě. Zohledněte to při nasazování.

Sitemap v robots.txt a jejich vliv

Direktiva Sitemap: usnadňuje objevování XML sitemap a feedů (např. Sitemap: https://www.priklad.sk/sitemap-index.xml). Uveďte také sitemapy obrázků nebo videí, pokud existují. Umístění v robots.txt není povinné – alternativou je odeslání v Search Console nebo deklarace v hlavičkách odpovědí.

Interakce s dalšími direktivami a standardy

  • Meta robots (<meta name="robots" content="noindex,nofollow">) působí až po procházení stránky. Pokud URL zablokujete v robots.txt, robot meta tag neuvidí.
  • X-Robots-Tag v hlavičce HTTP umožňuje globálnější řízení (např. pro soubory PDF: X-Robots-Tag: noindex, nofollow).
  • rel=“nofollow“ u odkazů neblokuje procházení cílové URL, pouze omezuje přenos signálů; chcete-li skutečně snížit zatížení procházením, použijte robots.txt nebo jiné mechanismy.

Strategie pro crawl budget a výkon

Dobře navržený robots.txt pomáhá směrovat crawl na hodnotné stránky a minimalizovat šum. V případě velkých webů (e-commerce, zpravodajství) je vhodné blokovat generované filtry a nekonečné kombinace parametrů, které nepřinášejí další obsah. Zároveň však neblokujte kritické zdroje (CSS/JS), aby si prohledávače zachovaly schopnost správně vykreslovat rozvržení stránky a vyhodnocovat Core Web Vitals.

Doporučené vzory pro běžné scénáře

  • Základ pro všechny agenty:
    User-agent: *
    Disallow: /admin/
    Disallow: /krok-platby/
    Allow: /admin/help.html
    Sitemap: https://www.priklad.sk/sitemap.xml
  • Přesné cílení parametrů:
    User-agent: *
    Disallow: /*?sort=
    Disallow: /*&sort=
    Disallow: /*?session=
    Disallow: /*&session=
  • Výjimka v zakázaném adresáři:
    User-agent: *
    Disallow: /statika/
    Allow: /statika/logo.svg
  • Specifické pravidlo pro robota (např. rychlejší zpravodajský robot):
    User-agent: NewsBot
    Disallow:
    User-agent: *
    Disallow: /interné/
  • Blokování typů souborů (pečlivě zvažte):
    User-agent: *
    Disallow: /*.zip$
    Disallow: /*.bak$

Nejčastější chyby a jak se jim vyhnout

  • Náhodné zablokování CSS/JS: pravidla typu Disallow: /wp-includes/ mohou bránit vykreslení. Ujistěte se, že kritická aktiva zůstávají dostupná.
  • Blokování stránek, které mají být indexovány: zablokování /produkt/ povede k chybějícím snippetům a horším výsledkům ve vyhledávání.
  • Spoléhání se na robots.txt kvůli „noindex“: není podporováno; používejte meta tagy nebo hlavičky.
  • Příliš mnoho rozporných pravidel: prohledávače uplatňují nejkonkrétnější pravidlo; přeplněné a protichůdné zápisy zvyšují riziko chyb.
  • Chybějící soubor na subdoménách: každý hostitel potřebuje vlastní robots.txt, jinak se ve výchozím nastavení nic neblokuje.

Robots.txt a AIO/AEO: vliv na odpovědi asistentů

Asistenti a systémy LLM stále častěji respektují signály týkající se přístupu k obsahu a rychlosti. Rozumně nastavený robots.txt, který brání procházení bezcenných parametrů a umožňuje vykreslování kritických zdrojů, zlepšuje dostupnost reprezentativního obsahu a stabilitu metrik (LCP/INP/CLS). Přispívá tak ke kvalitnějším citacím, odpovědím a doporučením v kanálech AIO/AEO.

Proces řízení změn, QA a měření dopadu

  • Vytvořte stagingové prostředí a ověřte, zda soubor neobsahuje syntaktické chyby (např. duplicitní znaky, mezery, neviditelné znaky).
  • Logujte přístupy na /robots.txt a po změně sledujte chování klíčových crawlerů.
  • Ověřte pokrytí v nástrojích vyhledávačů (např. v přehledech procházení a indexace) a porovnejte rychlost procházení před změnou a po ní.
  • Pravidla průběžně auditujte; to, co bylo užitečné včera (blokování starých parametrů), může být po redesignu překážkou.

Šablona pro udržitelný robots.txt

Jednoduchá, okomentovaná kostra, kterou můžete přizpůsobit:

  • # ZÁKLAD: povolte vše, blokujte pouze skutečný šum
  • User-agent: *
  • # Administrativa a soukromí
  • Disallow: /admin/
  • Disallow: /kosik/krok-platby/
  • # Parametry bez hodnoty pro indexaci
  • Disallow: /*?sort=
  • Disallow: /*&sort=
  • # Výjimky pro kritická aktiva
  • Allow: /assets/css/
  • Allow: /assets/js/
  • # Sitemapy
  • Sitemap: https://www.priklad.sk/sitemap.xml
  • Sitemap: https://cdn.priklad.sk/sitemap-cdn.xml

Testování a validace bez rizika

  • Ověřte, zda se soubor nachází na správné URL a vrací 200 OK s typem obsahu text/plain.
  • Simulujte pravidla na reprezentativních URL (produkty, kategorie, filtry, obsahové články).
  • Sledujte možnost vykreslení: zablokované CSS/JS odhalíte také v nástrojích pro náhled vykreslení a v protokolech požadavků.

„Recepty“ pro specifické CMS a scénáře

  • E-shop s filtrováním: blokujte kombinace parametrů, které nevytvářejí unikátní obsah. Použijte vzory s * a explicitní výjimky pro hodnotné landing pages.
  • Zpravodajský web: neblokujte archivy ani stránkování, ale omezte interní vyhledávání (/hladat/), pokud vytváří duplicity.
  • Vícejazyčný web: každý hostitel/subdoména má vlastní robots.txt; udržujte konzistentní pravidla napříč jazyky.
  • Soubory ke stažení: zvažte X-Robots-Tag: noindex v odpovědi serveru pro PDF/ZIP, pokud je nechcete v indexu, a neřešte jejich indexaci pouze prostřednictvím robots.txt.

Minimalistický, přesný a auditovatelný robots.txt

Úspěšný robots.txt je stručný, přesně zacílený a pravidelně auditovaný. Omezuje šum při crawlování, chrání crawl budget, zachovává možnost vykreslení a nenarušuje indexaci. V kombinaci se sitemapy, meta tagy/X-Robots-Tag a kvalitní architekturou webu tvoří stabilní základ moderního SEO i AIO/AEO – aby se k hodnotnému obsahu dostali lidé i asistenti.