GPTBot vs OAI-SearchBot vs ChatGPT-User: správné nastavení robots.txt
Pokud chcete být dohledatelní ve vyhledávání ChatGPT, povolte OAI-SearchBot. Povolení GPTBotu není pro tento účel nutné, protože se vztahuje k možnému využití obsahu pro trénování modelů. ChatGPT-User představuje požadavek vyvolaný uživatelem a nemusí se chovat jako běžný automatický crawler.
Přehled robotů OpenAI
| User-agent | K čemu slouží | Co se stane při blokaci |
|---|---|---|
OAI-SearchBot |
Vyhledávání ChatGPT | Obsah nebude použit v souhrnech a citacích ChatGPT Search; může se objevit pouze navigační odkaz |
GPTBot |
Možné zlepšování a trénování základních modelů | Obsah z tohoto crawlu nebude použit pro daný tréninkový účel |
ChatGPT-User |
Návštěva stránky na žádost uživatele | Uživatelem vyvolané načtení může selhat; nejde o automatický crawl pro index |
OpenAI uvádí, že pravidla jsou nezávislá. Můžete tedy povolit Search a zakázat training.
Doporučená konfigurace: Search ano, trénink ne
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
Tato varianta je vhodná pro web, který chce získat viditelnost v aktuálních odpovědích ChatGPT, ale nechce crawleru GPTBot povolit použití obsahu pro trénink.
Povolit oba crawlery
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Allow: /
Samotné Allow: / není vždy nutné, pokud neexistuje nadřazená blokace. Explicitní pravidlo je ale přehlednější při auditu.
Povolit jen vybranou část webu
User-agent: OAI-SearchBot
Allow: /znalostni-baze/
Allow: /sluzby/
Disallow: /ucet/
Disallow: /interni-vyhledavani/
Disallow: /kosik/
Robots.txt není bezpečnostní nástroj. Citlivý obsah chraňte autentizací. Disallow pouze slušným robotům sděluje, že nemají URL procházet.
Kdy použít noindex
Robots.txt řídí crawl, zatímco noindex žádá systém, aby stránku nezařadil do indexu. Aby robot metaznačku přečetl, musí stránku nejprve navštívit.
<meta name="robots" content="noindex, follow">
OpenAI upozorňuje, že blokovaná stránka se může v některých situacích objevit jako pouhý navigační odkaz, pokud je její URL známá z jiného zdroje. Chcete-li takovému zobrazení zabránit, použijte noindex a současně dovolte crawleru stránku načíst.
Robots.txt nestačí: zkontrolujte CDN a firewall
Častý problém vypadá takto:
- robots.txt crawler povoluje;
- běžný prohlížeč stránku otevře;
- bezpečnostní vrstva ale robotovi vrací 403, 429 nebo CAPTCHA.
Zkontrolujte:
- logy serveru a CDN;
- pravidla blokující neznámé boty;
- rate limiting;
- geoblokaci;
- ochranu proti automatizaci;
- publikované IP rozsahy OpenAI.
User-agent lze podvrhnout. Pro povolení na firewallu používejte oficiální IP seznamy a správně nastavenou bezpečnostní politiku, ne pouze text hlavičky.
Jak ověřit robots.txt
Otevřete:
https://vasedomena.cz/robots.txt
Pak hledejte:
- obecné pravidlo
User-agent: *sDisallow: /; - samostatný blok pro OAI-SearchBot;
- konfliktní pravidla;
- blokaci celé znalostní báze;
- blokaci CSS, JS nebo API potřebného k zobrazení obsahu.
Příklad problematické konfigurace:
User-agent: *
Disallow: /
User-agent: OAI-SearchBot
Allow: /
Různí interpreti mohou pravidla zpracovávat podle specifikace a nejkonkrétnějšího odpovídajícího bloku. Přesto je lepší konfiguraci udržet jednoduchou a následně ověřit skutečným požadavkem a v logu.
Co sledovat v serverových logách
Pro každý požadavek zapisujte:
- čas;
- požadovanou URL;
- user-agent;
- IP;
- stavový kód;
- velikost odpovědi;
- dobu odezvy.
Hledejte hlavně:
- opakované 403 nebo 429;
- řetězce přesměrování;
- 5xx chyby;
- požadavky jen na robots.txt bez následného crawlu;
- crawl parametrických a nekonečných URL;
- rozdílný obsah pro roboty a uživatele.
Kdy se změna projeví
OpenAI uvádí přibližně 24 hodin pro přizpůsobení systémů změně robots.txt. To neznamená, že stránka bude do 24 hodin citována. Znamená to jen, že nové povolení nebo blokace může být zohledněna v přístupu crawleru.
Nejčastější chyby
- Použití
GPTBotmístoOAI-SearchBotv návodu pro ChatGPT Search. - Povolení v robots.txt, ale blokace na CDN.
- Blokace stránky a současný požadavek, aby crawler přečetl její
noindex. - Veřejně dostupné citlivé URL chráněné jen přes
Disallow. - Předpoklad, že povolení crawleru garantuje citaci.
- Neomezené parametrické URL vytvářející crawl past.
Doporučený auditní postup
- Stáhnout a archivovat aktuální robots.txt.
- Zkontrolovat pravidla pro všechny tři OpenAI user-agenty.
- Provést HTTP test klíčových URL.
- Ověřit meta robots a
X-Robots-Tag. - Zkontrolovat canonical a přesměrování.
- Ověřit firewall a CDN.
- Po změně sledovat logy nejméně několik dní.
- Samostatně měřit výskyt webu v ChatGPT Search.