Robots.txt

Robots.txt: co umí, co neumí a jak ho nastavit | David Hons

Robots.txt: malý soubor, který může změnit procházení webu.

Robots.txt říká robotům, které části webu mohou nebo nemají procházet. Je užitečný pro technické řízení crawlování, ale není to nástroj na spolehlivé skrytí stránky z výsledků vyhledávání.

  • User-agent a pravidla
  • Disallow a Allow
  • Sitemap direktiva
  • Crawl není indexace

Robots.txt je textový soubor umístěný v kořeni domény, typicky na adrese https://domena.cz/robots.txt. Vyhledávače ho čtou před procházením webu a podle pravidel v něm upravují, kam se jejich roboti mohou vydat.

V SEO patří robots.txt do technické vrstvy. Úzce souvisí s technickým SEO, indexací, interními odkazy, stavovými kódy a souborem sitemap.xml.

Jak robots.txt funguje.

Robots.txt je sada pravidel pro roboty. Základ tvoří direktiva User-agent, která určuje, pro jakého robota pravidla platí. Za ní následují pravidla jako Disallow a Allow. Soubor může obsahovat i odkaz na XML sitemapu.

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://www.example.cz/sitemap.xml

Tento příklad říká všem robotům, že nemají procházet adresář /wp-admin/, ale mají povolený soubor admin-ajax.php, který může být pro fungování webu důležitý. Poslední řádek ukazuje umístění sitemap souboru.

Co robots.txt umí a neumí.

Robots.txt umí řídit procházení. To je důležité hlavně u technických URL, interní administrace, výsledků vyhledávání na webu, parametrů, filtrů nebo duplicitních částí webu. Neznamená to ale automaticky, že blokovaná URL zmizí z indexu.

01 · UmíOmezit crawling

Roboti by neměli procházet blokované cesty, pokud pravidla respektují.

02 · UmíUkázat sitemapu

Direktiva Sitemap může robotům pomoci najít XML sitemap soubor.

03 · NeumíZaručit neindexaci

Blokovaná stránka se může objevit ve výsledcích, pokud na ni vedou odkazy a vyhledávač zná její URL.

04 · NeumíChránit citlivá data

Robots.txt je veřejný soubor. Co do něj napíšete, může si kdokoliv přečíst.

05 · NeumíNahradit noindex

Pokud chcete stránku vyřadit z indexu, řeší se to přes meta robots nebo HTTP hlavičku, ne blokací crawlu.

06 · NeumíOpravit slabou strukturu

Robots.txt nenahradí interní prolinkování, canonical tagy ani čistou architekturu webu.

Nejčastější omyl: Disallow není noindex.

Pokud stránku zablokujete v robots.txt, robot ji nemusí projít a neuvidí její meta tag noindex. U stránek, které mají zmizet z výsledků, je proto potřeba pracovat opatrně: stránku nejdřív nechat procházet s noindexem, nebo použít jiné správné technické řešení podle situace.

Kdy robots.txt řešit.

U malého prezentačního webu může být robots.txt velmi jednoduchý. U většího e-shopu, magazínu nebo webu s filtry a parametry už může špatné nastavení ovlivnit crawl budget, indexaci a technickou čistotu webu. Robots.txt proto často kontroluji při SEO auditu nebo hlubší SEO analýze.

01 · MigraceNový web nebo redesign

Po spuštění je potřeba ověřit, že na ostré doméně nezůstala blokace z vývoje.

02 · E-shopFiltry a parametry

Některé kombinace filtrů mohou vytvářet velké množství slabých nebo duplicitních URL.

03 · WordPressAdministrace a systémové části

Typicky se neprochází administrace, ale veřejné CSS, JS a důležité soubory musí zůstat dostupné.

04 · AIRoboti AI nástrojů

U AI vyhledávání je vhodné vědět, které roboty chcete pustit a které naopak omezit.

05 · Crawl budgetVelké weby

U rozsáhlých webů má smysl omezit procházení zbytečných technických cest.

06 · KontrolaSearch Console a crawl

Robots.txt se vyhodnocuje spolu s indexací, stavovými kódy, canonical tagy a sitemapou.

Robots.txt a AI vyhledávání.

Vedle klasických vyhledávačů dnes weby navštěvují i roboti spojené s AI nástroji. Někteří slouží pro vyhledávací funkce, jiní pro sběr dat nebo jiné účely. Robots.txt proto začíná být součástí širšího rozhodování o tom, jak chcete pracovat s AI, GEO a AIO.

Nedává smysl slepě blokovat všechno nové. Stejně tak není dobré pustit všechno bez rozmyslu. U firemního webu je potřeba rozlišovat, jestli řešíte dohledatelnost v AI odpovědích, ochranu obsahu, kapacitu serveru nebo interní pravidla pro práci s daty.

Časté chyby v robots.txt.

  • Blokace celého webu po spuštění kvůli pravidlu Disallow: /, které zůstalo z vývojové verze.
  • Blokace CSS a JavaScriptu, kvůli které vyhledávač nemusí správně vykreslit stránku.
  • Pokus o skrytí citlivých URL ve veřejném souboru, který si může přečíst kdokoliv.
  • Disallow místo noindexu u stránek, které nemají být ve výsledcích vyhledávání.
  • Rozpor mezi robots.txt, sitemapou a canonical tagy, kdy každý signál ukazuje jiným směrem.
  • Příliš agresivní blokace filtrů, která může omylem odříznout důležité kategorie nebo landing pages.

Praktický postup kontroly robots.txt.

  1. Otevřít soubor na adrese /robots.txt a zkontrolovat, jestli se načítá správně.
  2. Prověřit, zda neblokuje důležité stránky, šablony, CSS, JavaScript nebo obrázky.
  3. Zkontrolovat pravidla pro hlavní roboty vyhledávačů a případně AI roboty.
  4. Ověřit, zda uvedená sitemap URL existuje a obsahuje kanonické indexovatelné stránky.
  5. Porovnat robots.txt s nastavením noindex, canonical tagy, interními odkazy a sitemapou.
  6. Po změně sledovat v Google Search Console indexaci a případné problémy s procházením.

Nejste si jistí, jestli robots.txt neblokuje důležité stránky?

Pošlete mi web a podívám se, jestli soubor robots.txt, sitemap, indexace a technické signály dávají dohromady smysl.

Napsat zprávu

Otázky k robots.txt.

Kde má být robots.txt umístěný?

Robots.txt má být v kořeni hostu, například https://www.example.cz/robots.txt. Pravidla platí vždy pro konkrétní protokol, subdoménu a host.

Zabrání robots.txt indexaci stránky?

Ne spolehlivě. Robots.txt řídí crawling, ne samotnou indexaci. Pokud vyhledávač zná URL z odkazů, může ji zobrazit i bez načtení obsahu. Pro vyřazení stránky z indexu se používá noindex nebo jiné vhodné řešení.

Může robots.txt obsahovat odkaz na sitemapu?

Ano. Řádek Sitemap: https://www.example.cz/sitemap.xml může robotům ukázat umístění XML sitemap souboru. Sitemap ale nenahrazuje interní odkazy ani kvalitní strukturu webu.

Mám blokovat administraci WordPressu?

Veřejné procházení administrace obvykle nedává smysl, ale pozor na blokaci souborů, které web potřebuje pro vykreslení. Některé systémové soubory mohou být důležité pro správné fungování šablony.

Má robots.txt význam pro AI nástroje?

Ano, ale záleží na konkrétním robotovi a účelu. Pokud řešíte dohledatelnost v AI vyhledávání, ochranu obsahu nebo zatížení serveru, robots.txt patří mezi první místa ke kontrole.

David Hons — SEO specialista
DH
David Hons SEO & AI konzultant

Pomáhám firmám a e-shopům být vidět v Googlu, Seznamu i AI vyhledávání. Mám 10+ let praxe v SEO, technickém nastavení webů a práci se Shoptetem. Propojuji strategii, obsah, technické SEO a praktické využití AI v marketingu. Jsem také spoluzakladatelem charitativního e-shopu dudlu.cz.

🤖 AI vyhledávání 🔎 SEO strategie ⚙️ Technické SEO 📈 Obsah a růst webu
+420 728 940 398 info@honsdavid.cz Konzultace, audity, dlouhodobá spolupráce