Chyby v sitemape a robots.txt, ktoré blokujú indexáciu
18. 9. 2026 · 6 min čítania

Dva textové súbory rozhodujú o tom, či sa Google k vášmu webu vôbec dostane. Ani jeden z nich väčšina firiem nikdy neotvorila — vygeneroval ich plugin alebo programátor pri spustení webu a odvtedy sa ich nikto nedotkol. Pritom jeden riadok v robots.txt dokáže udržať mimo výsledkov celú kategóriu produktov a nikde vám o tom nepríde notifikácia.
Nižšie sú konkrétne chyby, ktoré v týchto súboroch nachádzam najčastejšie, spolu s tým, ako ich skontrolujete.
Čo každý z tých súborov naozaj robí
robots.txt riadi prehľadávanie. Hovorí robotom, kam nesmú vstúpiť. Nehovorí, čo sa nesmie zobraziť vo výsledkoch vyhľadávania. Zablokovaná URL sa môže vo Googli objaviť aj tak — bez popisu, s poznámkou, že informácie nie sú dostupné.
Sitemap.xml je zoznam URL, ktoré považujete za dôležité. Je to odporúčanie, nie príkaz. URL v sitemape nemá garantovanú indexáciu a URL mimo sitemapy sa do indexu dostať môže. Sitemapa pomáha najmä väčším webom a novým stránkam, ku ktorým vedie málo odkazov.
Z toho vyplýva praktický dôsledok: robots.txt dokáže spôsobiť veľkú škodu rýchlo, sitemapa skôr tiché plytvanie.
Chyby v robots.txt
Disallow: / ostalo z testovacej verzie
Najdrahšia chyba, akú v tomto súbore vidím. Web sa vyvíjal na testovacej adrese, kde bolo správne zakázať všetko. Pri nasadení na produkciu sa súbor prekopíroval spolu so stránkami. Web vyzerá v poriadku, len postupne mizne z výsledkov.
Kontrola trvá pár sekúnd: otvorte vasadomena.sk/robots.txt a hľadajte riadok Disallow: / bez ďalšej cesty za lomkou.
Zablokované CSS a JavaScript
Starší návod odporúčal zakázať systémové adresáre. V praxi to znamená, že Google stránku stiahne, ale nedokáže ju vykresliť — nevidí layout, nevidí obsah, ktorý sa doťahuje skriptom. Pri WordPresse ide typicky o Disallow: /wp-includes/ a blokovanie /wp-content/. Skripty a štýly nechajte prístupné.
noindex v robots.txt
Direktíva Noindex: v robots.txt nefunguje, Google ju nepodporuje. Ak potrebujete stránku dostať z indexu, musí byť prehľadávateľná a mať meta tag robots s hodnotou noindex alebo hlavičku X-Robots-Tag.
Disallow a noindex naraz
Toto je najčastejšia logická chyba. Stránka má v HTML noindex, ale zároveň je zakázaná v robots.txt. Robot na stránku nevstúpi, takže sa k tagu nikdy nedostane a URL môže v indexe zostať. Ak chcete niečo odstrániť z výsledkov, blokovanie v robots.txt najprv zrušte.
To isté platí pre canonical. Zablokovanú URL nikto neprečíta, takže ani canonical na nej neplatí — a duplicita, ktorú ste chceli vyriešiť, zostáva.
Príliš široká hviezdička
Riadok typu Disallow: /*? má zablokovať filtre e-shopu. Zablokuje však každú URL s parametrom — vrátane stránkovania, vyhľadávania na webe alebo verzie stránky s UTM. Ak stránkovanie beží na parametroch, práve ste odrezali cestu k produktom v druhej a ďalšej strane výpisu. V takom prípade je bezpečnejšie riešiť filtre cez canonical a interné odkazy než plošným zákazom.
Pravidlá sa nespájajú
Ak má súbor skupinu pre User-agent: * a zvlášť skupinu pre User-agent: Googlebot, Googlebot sa riadi len svojou skupinou. Pravidlá z hviezdičky ignoruje. Videl som weby, kde bola v skupine pre Googlebota jediná riadka z dávneho testu a všetko ostatné, čo malo platiť, sa vôbec nepoužilo.
Súbor na nesprávnej adrese
robots.txt platí vždy len pre jeden host, protokol a port. https://vasadomena.sk/robots.txt neriadi https://blog.vasadomena.sk/. Každá subdoména potrebuje vlastný súbor v koreni. Umiestnenie v podadresári nemá žiadny efekt.
Chybová odpoveď servera
Keď robots.txt vráti 404, Google to berie ako „nič nie je zakázané" a prehľadáva normálne. Keď ale vráti chybu 5xx, správa sa opatrne a prehľadávanie dočasne obmedzí. Pravidelné výpadky tohto súboru sa preto prejavia ako nevysvetliteľné spomalenie indexácie. Kontrolujte, či vracia stav 200 a obsah typu text/plain.
Crawl-delay
Google direktívu Crawl-delay ignoruje. Ak máte problém so zaťažením servera, riešte to rýchlosťou odpovede alebo nastavením v Search Console, nie týmto riadkom.
Chyby v sitemape
V sitemape sú URL, ktoré nemajú byť v indexe
Typický obsah sitemapy z automatického generátora: stránky s noindex, presmerovania, URL s canonicalom na inú adresu, tagové archívy, prílohy obrázkov, stránka košíka. Sitemapa má obsahovať len finálne URL so stavom 200, ktoré chcete mať vo výsledkoch. Každá iná položka je protichodný signál.
404 a presmerovania
Zmazané produkty zostávajú v sitemape mesiace. V Search Console to vidíte ako rastúci počet nájdených, ale neindexovaných URL. Sitemapa sa musí regenerovať pri zmene obsahu, nie raz pri spustení webu.
Nesprávny tvar adries
V sitemape musia byť absolútne URL v presne tej podobe, v akej web beží. Časté nezhody: http:// namiesto https://, verzia s www oproti verzii bez neho, chýbajúca alebo prebytočná koncová lomka, relatívne cesty. Sitemapa tiež nemôže obsahovať URL z inej domény.
lastmod, ktorý lže
Ak generátor zapíše do lastmod dnešný dátum pri všetkých URL pri každom generovaní, hodnota stráca zmysel a prestane sa brať do úvahy. lastmod má odrážať skutočnú zmenu obsahu. Prvky priority a changefreq Google nepoužíva — netreba ich ladiť.
Prekročené limity
Jedna sitemapa smie obsahovať maximálne 50 000 URL a mať najviac 50 MB v nekomprimovanej podobe. Väčší web potrebuje sitemap index, ktorý odkazuje na viac menších súborov. E-shopu s desiatkami tisíc produktov sa vyplatí rozdeliť sitemapy podľa typu obsahu — produkty, kategórie, články. V Search Console potom vidíte, ktorá skupina má problém.
Dve sitemapy naraz
Pri prechode medzi SEO pluginmi často zostane v prevádzke stará sitemapa aj nová. Google dostáva dva zoznamy, jeden s neaktuálnymi adresami. Starú nechajte vrátiť 404 a v Search Console ju odstráňte zo zoznamu.
Sitemapa zablokovaná v robots.txt
Stáva sa to pri širokých pravidlách na parametre alebo na /sitemap. Sitemapa musí byť dostupná. A odkaz na ňu patrí do robots.txt riadkom Sitemap: https://vasadomena.sk/sitemap.xml — je to jediná direktíva, ktorá tam funguje bez ohľadu na user-agenta.
Namiesto XML sa vracia HTML
Ak server na adresu sitemapy odpovie chybovou stránkou, presmerovaním na homepage alebo súborom s BOM na začiatku, parsovanie zlyhá. V Search Console to vyzerá ako „sitemapu sa nepodarilo prečítať".
Kontrola za desať minút
- Otvorte
vasadomena.sk/robots.txtv prehliadači. Prečítajte každý riadok. Ak neviete, na čo niektorý je, je to kandidát na preverenie. - V Search Console otvorte prehľad robots.txt v nastaveniach — uvidíte, kedy bol súbor naposledy stiahnutý, s akým stavom a či v ňom Google našiel chyby.
- V sekcii Sitemapy skontrolujte dátum posledného spracovania a počet nájdených URL. Rozdiel medzi počtom URL v sitemape a počtom indexovaných stránok je vaša pracovná úloha.
- Vezmite päť dôležitých URL — homepage, hlavnú kategóriu, top produkt, najnavštevovanejší článok — a prejdite ich Kontrolou URL. Pri každej sa pozrite, či je prehľadávanie povolené, či je indexácia povolená a aká URL je určená ako kanonická.
- Otvorte sitemapu a pozrite si desať náhodných adries. Musia vrátiť 200 a nemať
noindex.
Ak vám sedí prvé aj druhé, technická brána je otvorená.
Čo to ešte nerieši
Správny robots.txt a čistá sitemapa nie sú dôvod na indexáciu. Sú len podmienkou, aby indexácia bola možná. Keď na stránku nevedie žiadny interný odkaz a nemá vlastný obsah, Google ju pokojne nechá neindexovanú aj napriek sitemape. Preto po oprave týchto dvoch súborov nasleduje práca na internom prelinkovaní a na obsahu jednotlivých stránok.
A teraz konkrétne, čo viem urobiť ja a čo nie. Prechádzam verejné stránky webu a hlásim nálezy na úrovni stránok — duplicitné titulky, slabé popisy, chýbajúce alt texty, rozbité štruktúrované dáta, nesprávne nastavené canonical tagy, pomalé stránky. K dôležitým nálezom napíšem hotový text opravy, vy ho schválite a nasadí sa. Obsah samotného robots.txt a štruktúru sitemapy vám neprepíšem — to je zásah do konfigurácie servera alebo pluginu a patrí do rúk človeka, ktorý web spravuje. Zoznam vyššie je presne ten, podľa ktorého to viete odkontrolovať sami alebo poslať programátorovi.
Začať sa dá auditom stránok a po nasadení opráv zmerať dopad 28 dní pred a po. Pri technickom blokovaní však platí jedno: kým je v robots.txt zbytočný Disallow, na ostatných opravách nezáleží, lebo ich nemá kto prečítať.
Toto píše nástroj, ktorý si viete kúpiť
Článok navrhol a napísal Seonal — ten istý, ktorý na vašom webe nájde chyby, opraví ich a výsledok zmeria. Audit je zadarmo.