
Na tento problém nedávno upozornila diskusia na Reddite, kde SEO špecialista riešil prípad, kedy Google indexoval spamové vyhľadávacie stránky jeho klienta napriek tomu, že sekcia vyhľadávania bola v súbore robots.txt zakázaná. Do diskusie sa zapojil priamo John Mueller z Google, ktorý vysvetlil, kde vznikla chyba a ako Googlebot v skutočnosti spracováva pravidlá zápisu.
Ako Google číta robots.txt: Pravidlo najšpecifickejšieho agenta
Častým mýtom pri správe robots.txt je predpoklad, že pravidlá definované pre všeobecného robota (User-agent: *) sa automaticky vzťahujú aj na konkrétne definovaných robotov, napríklad pre User-agent: Googlebot.
Logika vyhľadávačov je však odlišná: ak súbor obsahuje špecifickú sekciu pre daného robota, ten úplne ignoruje všeobecnú sekciu User-agent: *.
Ak váš súbor robots.txt vyzerá takto:
User-agent: Googlebot
Disallow: /admin/
User-agent: *
Disallow: /search/
Disallow: /cart/
Googlebot si v tomto prípade prečíta výhradne sekciu User-agent: Googlebot.
Blok pre User-agent: * úplne odignoruje. Výsledkom je, že adresy interného vyhľadávania (/search/) alebo nákupného košíka (/cart/), ktoré ste chceli pred Googlebotom skryť, zostanú preňho voľne prístupné.
Ak chcete, aby Googlebot rešpektoval rovnaké pravidlá ako ostatné roboty, musíte ich do jeho sekcie vyslovene skopírovať, prípadne robotov zoskupiť pod spoločný zápis:
Plaintext
User-agent: Googlebot
User-agent: Bingbot
User-agent: *
Disallow: /search/
Disallow: /cart/
Ako spameri zneužívajú interné vyhľadávanie e-shopu
Táto nenápadná chyba v nastavení sa najčastejšie ukáže vtedy, keď spameri začnú zneužívať interné vyhľadávanie e-shopu.
Spammeri na vašom webe automatizovane vyhľadávajú frázy obsahujúce odkaz alebo názov ich vlastného webu, napr. nerelevantné kľúčové slová, nelegálny obsah či hazard.
Interné vyhľadávanie e-shopu na takúto požiadavku vygeneruje unikátnu URL adresu typu vasedomena.sk/search?q=spamovy+text.
Ak Google takúto URL adresu objaví a v súbore robots.txt nenájde platný zákaz, jednoducho ju zaindexuje. Váš e-shop sa potom vo výsledkoch vyhľadávania začne zobrazovať na pochybné frázy, čo priamo škodí autorite domény aj celkovému SEO.
Zákaz v robots.txt nestačí
Mnohé projekty sa snažia problém vyhľadávacieho spamu riešiť tak, že do robots.txt pridajú pravidlo Disallow: /search. Toto riešenie má však dva zásadné nedostatky:
- robots.txt riadi crawling, nie indexáciu. Ak na vygenerovanú spamovú URL vedie odkaz z inej stránky, Google ju môže zaindexovať aj bez toho, aby ju navštívil.
- Blokovanie v robots.txt znemožní prečítanie noindex. Ak vyhľadávaču zakážete prístup na stránku cez robots.txt, robot sa na stránku nedostane a nespracuje príkaz <meta name=“robots“ content=“noindex“>.
Zhrnutie pre SEO
- Kontrolujte dedičnosť v robots.txt: Ak na webe používate špecifické pravidlá pre Googlebot alebo iné konkrétne crawlery, uistite sa, že obsahujú všetky obmedzenia, ktoré ste definovali vo všeobecnej sekcii User-agent: *.
- Indexáciu riešte metaznačkami, nie súborom robots.txt: Výsledky interného vyhľadávania by mali byť pre robotov dostupné na prechádzanie, ale označené pravidlom noindex.
- Pravidelne auditujte indexovaný obsah: Cez Google Search Console sledujte, či sa medzi indexovanými stránkami nezačínajú objavovať nežiaduce URL adresy interného vyhľadávania.













