bybence
Kapcsolat
bybence

Felfedezés

Eszközök

Academy

Blog

Hírek

Kapcsolat

ByBence Tools · SEO

Robots.txt ellenőrző

Töltsd be egy domain robots.txt fájlját, adj meg konkrét útvonalat és crawlert, majd lásd pontosan, melyik szabály engedélyezi vagy tiltja a feltérképezést.

Robots.txt útmutató

Ne csak azt lásd, hogy van-e robots.txt — értsd is, melyik szabály dönt egy URL sorsáról.

A robots.txt ellenőrzés akkor hasznos, ha egy konkrét URL-ről szeretnéd tudni, hogy a kiválasztott robot feltérképezheti-e. A puszta fájlmegnyitás kevés: a User-agent csoportokat, az Allow és Disallow mintákat, a leghosszabb egyezést és a szerver válaszát együtt kell értelmezni.

Az eszköz ezért nem egy egyszerű szövegmegjelenítő. Megmutatja a döntő szabályt, a sitemap hivatkozásokat, a fájl HTTP állapotát és azt is, ha a válasz miatt a crawl-döntés bizonytalanabb a szokásosnál.

Fő cél

Crawl döntés

Konkrét URL + konkrét robot alapján.

Direktívák

Allow / Disallow

A ténylegesen illeszkedő szabályok.

Kiegészítő jel

Sitemap

A robots.txt-ben deklarált sitemapek.

Nem erre való

Noindex

A crawl tiltása nem azonos az indexelés tiltásával.

Így ellenőrizd helyesen a robots.txt szabályt

01

Domain

Add meg a hostot, az eszköz a gyökérben keresi a robots.txt fájlt.

02

URL-útvonal

Ne csak a fájlt nézd: azt az útvonalat teszteld, amelyik ténylegesen fontos.

03

User-agent

Googlebot, Bingbot vagy más crawler esetén eltérő csoport lehet érvényes.

04

Döntő szabály

Nézd meg, melyik Allow vagy Disallow minta adta a végső eredményt.

A robots.txt feltérképezést szabályoz, nem indexelést

Ez a különbség az egyik legfontosabb technikai SEO alap. Ha egy URL-t Disallow tilt, a crawler nem feltétlenül tölti le az oldal tartalmát. Ettől az URL még ismert lehet linkekből, és bizonyos esetekben megjelenhet az indexben is.

Ha valóban azt szeretnéd, hogy egy oldal ne kerüljön az indexbe, a noindex jelzés általában jobb eszköz — viszont ehhez a robotnak hozzá kell férnie az oldalhoz, hogy elolvashassa a direktívát.

Gyenge megoldás

Disallow: /private/

A crawler hozzáférését korlátozza az útvonalhoz.

crawl szabály

robots.txt-ben van

nem garantált deindexelés

Jobb megoldás

meta robots: noindex

Az indexelésre ad egyértelműbb utasítást, ha a crawler el tudja olvasni.

indexelési jelzés

az oldalon vagy headerben van

crawl-hozzáférés kell hozzá

User-agent csoportok és specifikus szabályok

Egy robots.txt több crawlerre külön szabályokat adhat. A wildcard * általános csoport, míg például a Googlebot számára külön blokk is létrehozható. Ha van specifikus csoport, a crawler jellemzően azt használja az általános helyett.

A szabályoknál nem az számít, melyik sort írtad előbb. Az egyezés részletessége és a konkrét crawler robots implementációja fontos. Ezért értékesebb a tényleges URL-teszt, mint a fájl vizuális átfutása.

robots.txt példa

ByBence Tools

User-agent: *
Disallow: /admin/
Allow: /admin/public/

Sitemap: https://pelda.hu/sitemap.xml

A robots.txt HTTP válasza is része az eredménynek

Nem mindegy, hogy a robots.txt 200-as választ ad, nem található, átmenetileg túlterhelt a szerver, vagy 5xx hibával válaszol. Különösen incidensnél veszélyes csak a fájl tartalmát nézni és figyelmen kívül hagyni az elérhetőséget.

Az ellenőrző ezért külön jelzi a 429 és szerverhibás helyzeteket, ahol a crawler cache-elt szabályokra vagy ideiglenes kezelésre támaszkodhat.

Élesítés előtt

A staging robots.txt az egyik legdrágább másolási hiba lehet.

Ha fejlesztői környezetben Disallow: / volt beállítva, production deploy után azonnal ellenőrizd a robots.txt fájlt és a legfontosabb landing oldalakat.

Mikor érdemes futtatni?

Migráció, új domain, CMS csere, staging élesítés, hirtelen crawl-visszaesés vagy új AI crawler szabályozása esetén. Ha Search Console-ban feltérképezési problémát látsz, a robots ellenőrzés az egyik első technikai lépés lehet.

01

Migráció

Ellenőrizd, hogy az új struktúra fontos könyvtárai nincsenek-e véletlenül tiltva.

02

AI crawlerek

A GPTBot, OAI-SearchBot és más botok külön User-agent szabályokat kaphatnak.

03

Staging → production

A fejlesztői teljes tiltás ne maradjon éles környezetben.

04

Sitemap kapcsolat

A deklarált sitemap URL-eket külön is vizsgáld meg.

Sitemap ellenőrzőSEO Analyzer

Gyakori kérdések

Mi az a robots.txt?

A robots.txt a domain gyökerében elhelyezett szövegfájl, amellyel crawl szabályokat adhatsz keresőrobotoknak.

A Disallow eltávolítja az oldalt a Google-ből?

Nem feltétlenül. A Disallow a feltérképezést korlátozza, de egy URL más forrásokból továbbra is ismert és bizonyos esetekben indexelt lehet.

Megosztható egy konkrét robots.txt teszt?

Igen. A megosztott URL megőrzi a domaint, útvonalat, User-agentet és a rövid döntési eredményt. A teljes robots.txt megnyitáskor cache-ből vagy friss lekéréssel töltődik.

Lehet külön szabályt adni AI crawlereknek?

Igen. Ha az adott crawler támogatja és tiszteletben tartja a robots.txt protokollt, saját User-agent blokkban külön szabályozható.

Kapcsolódó eszközök és útmutatók

Eszköz

Sitemap ellenőrző

Vizsgáld meg a robots.txt-ben hivatkozott sitemapeket.

Eszköz

Canonical ellenőrző

Ellenőrizd az oldal preferált URL-jelzését.

Eszköz

SEO Analyzer

Futtass szélesebb technikai SEO auditot.

Útmutató

Robots.txt útmutató

Részletes háttér, példák és gyakori hibák.