ByBence Tools · SEO
Robots.txt ellenőrző
Töltsd be egy domain robots.txt fájlját, adj meg konkrét útvonalat és crawlert, majd lásd pontosan, melyik szabály engedélyezi vagy tiltja a feltérképezést.
Robots.txt útmutató
Ne csak azt lásd, hogy van-e robots.txt — értsd is, melyik szabály dönt egy URL sorsáról.
A robots.txt ellenőrzés akkor hasznos, ha egy konkrét URL-ről szeretnéd tudni, hogy a kiválasztott robot feltérképezheti-e. A puszta fájlmegnyitás kevés: a User-agent csoportokat, az Allow és Disallow mintákat, a leghosszabb egyezést és a szerver válaszát együtt kell értelmezni.
Az eszköz ezért nem egy egyszerű szövegmegjelenítő. Megmutatja a döntő szabályt, a sitemap hivatkozásokat, a fájl HTTP állapotát és azt is, ha a válasz miatt a crawl-döntés bizonytalanabb a szokásosnál.
Fő cél
Crawl döntés
Konkrét URL + konkrét robot alapján.
Direktívák
Allow / Disallow
A ténylegesen illeszkedő szabályok.
Kiegészítő jel
Sitemap
A robots.txt-ben deklarált sitemapek.
Nem erre való
Noindex
A crawl tiltása nem azonos az indexelés tiltásával.
Így ellenőrizd helyesen a robots.txt szabályt
Domain
Add meg a hostot, az eszköz a gyökérben keresi a robots.txt fájlt.
URL-útvonal
Ne csak a fájlt nézd: azt az útvonalat teszteld, amelyik ténylegesen fontos.
User-agent
Googlebot, Bingbot vagy más crawler esetén eltérő csoport lehet érvényes.
Döntő szabály
Nézd meg, melyik Allow vagy Disallow minta adta a végső eredményt.
A robots.txt feltérképezést szabályoz, nem indexelést
Ez a különbség az egyik legfontosabb technikai SEO alap. Ha egy URL-t Disallow tilt, a crawler nem feltétlenül tölti le az oldal tartalmát. Ettől az URL még ismert lehet linkekből, és bizonyos esetekben megjelenhet az indexben is.
Ha valóban azt szeretnéd, hogy egy oldal ne kerüljön az indexbe, a noindex jelzés általában jobb eszköz — viszont ehhez a robotnak hozzá kell férnie az oldalhoz, hogy elolvashassa a direktívát.
Gyenge megoldás
Disallow: /private/
A crawler hozzáférését korlátozza az útvonalhoz.
—
crawl szabály
—
robots.txt-ben van
—
nem garantált deindexelés
Jobb megoldás
meta robots: noindex
Az indexelésre ad egyértelműbb utasítást, ha a crawler el tudja olvasni.
✓
indexelési jelzés
✓
az oldalon vagy headerben van
✓
crawl-hozzáférés kell hozzá
User-agent csoportok és specifikus szabályok
Egy robots.txt több crawlerre külön szabályokat adhat. A wildcard * általános csoport, míg például a Googlebot számára külön blokk is létrehozható. Ha van specifikus csoport, a crawler jellemzően azt használja az általános helyett.
A szabályoknál nem az számít, melyik sort írtad előbb. Az egyezés részletessége és a konkrét crawler robots implementációja fontos. Ezért értékesebb a tényleges URL-teszt, mint a fájl vizuális átfutása.
robots.txt példa
ByBence Tools
User-agent: * Disallow: /admin/ Allow: /admin/public/ Sitemap: https://pelda.hu/sitemap.xml
A robots.txt HTTP válasza is része az eredménynek
Nem mindegy, hogy a robots.txt 200-as választ ad, nem található, átmenetileg túlterhelt a szerver, vagy 5xx hibával válaszol. Különösen incidensnél veszélyes csak a fájl tartalmát nézni és figyelmen kívül hagyni az elérhetőséget.
Az ellenőrző ezért külön jelzi a 429 és szerverhibás helyzeteket, ahol a crawler cache-elt szabályokra vagy ideiglenes kezelésre támaszkodhat.
Élesítés előtt
A staging robots.txt az egyik legdrágább másolási hiba lehet.
Ha fejlesztői környezetben Disallow: / volt beállítva, production deploy után azonnal ellenőrizd a robots.txt fájlt és a legfontosabb landing oldalakat.
Mikor érdemes futtatni?
Migráció, új domain, CMS csere, staging élesítés, hirtelen crawl-visszaesés vagy új AI crawler szabályozása esetén. Ha Search Console-ban feltérképezési problémát látsz, a robots ellenőrzés az egyik első technikai lépés lehet.
01
Migráció
Ellenőrizd, hogy az új struktúra fontos könyvtárai nincsenek-e véletlenül tiltva.
02
AI crawlerek
A GPTBot, OAI-SearchBot és más botok külön User-agent szabályokat kaphatnak.
03
Staging → production
A fejlesztői teljes tiltás ne maradjon éles környezetben.
04
Sitemap kapcsolat
A deklarált sitemap URL-eket külön is vizsgáld meg.
Gyakori kérdések
Mi az a robots.txt?
A robots.txt a domain gyökerében elhelyezett szövegfájl, amellyel crawl szabályokat adhatsz keresőrobotoknak.
A Disallow eltávolítja az oldalt a Google-ből?
Nem feltétlenül. A Disallow a feltérképezést korlátozza, de egy URL más forrásokból továbbra is ismert és bizonyos esetekben indexelt lehet.
Megosztható egy konkrét robots.txt teszt?
Igen. A megosztott URL megőrzi a domaint, útvonalat, User-agentet és a rövid döntési eredményt. A teljes robots.txt megnyitáskor cache-ből vagy friss lekéréssel töltődik.
Lehet külön szabályt adni AI crawlereknek?
Igen. Ha az adott crawler támogatja és tiszteletben tartja a robots.txt protokollt, saját User-agent blokkban külön szabályozható.