Přejít na hlavní obsah
Sleva 50% všechny plány, omezený čas. Od $2.48/mo
17 min left
AI a strojové učení

Jak připravit vlastní hostovaný web na AI agenty

S Autor: Samer 17 min čtení
Multiple labeled AI crawler request streams arriving at a self-hosted web server behind a reverse proxy, where one stream is slowed at the gate instead of blocked outright

Ve vlákně na Hacker News o provozu AI crawlerů popsal jeden hostingový administrátor zátěž z pohledu provozovatele: „asi 6 různých dost agresivních AI botů“, kteří se pravidelně zaseknou na stránkách variant produktů nebo kategorií a začnou je bombardovat rychlostí zhruba jednoho požadavku za sekundu, na webu, kde „každé načtení stránky může trvat celou 1 s round-tripu (většinu z toho v MySQL)“. Kumulativní efekt, ve stejném komentáři: „skoro jako by web dostával Slashdot každý jediný den“.

Příprava webu na AI agenty je především otázka kapacity, takže většina práce je konfigurace serveru a jen velmi malá část obsahová strategie. Užitečnou vlastností tohoto provozu je, že z větší části není anonymní: firmy, které jej generují, zveřejňují jména svých crawlerů, dokumentují, k čemu každý slouží, a říkají vám, jak je vypnout. Následuje, co nastavit, co každý mechanismus v praxi vynutí a které dva kroky bych vynechal: zveřejnit llms.txt a přidat schema markup kvůli AI.

Stručně

  • Provoz AI se obvykle dělí na trénování, indexaci pro AI vyhledávání a stahování vyvolaná uživatelem. OpenAI a Anthropic pro tyto účely nabízejí samostatné tokeny, takže je můžete řídit nezávisle; některé víceúčelové crawlery slučují více rolí pod jednu identitu.
  • OpenAI, Anthropic, Perplexity a Common Crawl dokumentují ovládání přes robots.txt pro své automatické crawlery. Výjimkou jsou stahovače spouštěné uživatelem: Anthropic uplatňuje robots.txt i na Claude-User, OpenAI uvádí, že pravidla nemusí platit pro ChatGPT-User, a Perplexity-User je obvykle ignoruje.
  • Soubor robots.txt je mechanismus souhlasu, ne řízení přístupu. RFC 9309 mu nedává žádnou vlastní vynucovací sílu; boti, kteří jej respektují, vám mohou snížit zátěž, ale zpomalit ani zastavit nerespektující provoz soubor nedokáže.
  • Napříč 137 210 doménami v analytické zákaznické bázi Ahrefs nedostalo 97 % zveřejněných souborů llms.txt v květnu 2026 ani jeden požadavek. Klidně jeden zveřejněte, ale nestavte kolem něj nástroje.
  • Strukturovaná data ponechte tam, kde podporují klasické funkce Vyhledávání, ale dokumentace Googlu uvádí, že pro jeho AI funkce není potřeba žádné zvláštní schéma ani textový soubor pro AI.
  • Kritický obsah renderujte na serveru, pokud chcete, aby jej četly OpenAI, ClaudeBot, PerplexityBot nebo CCBot. Vercel zjistil, že tyto crawlery nespouštějí JavaScript; výjimkou jsou Gemini přes Googlebot a AppleBot.
  • Vynucení nad rámec kooperativních pravidel robots.txt sídlí na reverzní proxy, ve WAF, který provozujete sami, nebo za proof-of-work výzvou, a to v tomto pořadí podle nákladů.

Co tento článek nepokrývá

Řeč je o webu, který agenti navštěvují, ne o webu, který s nimi obchoduje. Čtyři příbuzná témata zůstávají stranou.

  • Agentní obchodování a checkout toky, jiný problém pro jiný typ webu.
  • Právní a autorskoprávní spor o trénovací data, což je obchodní rozhodnutí, ne konfigurace serveru.
  • Podrobný návod na implementaci WebMCP, protože standard je stále jen origin trial.
  • Konfigurace specifická pro jednotlivé CDN nad rámec jediné sekce o Cloudflare níže.

Které AI crawlery bombardují váš web

GPTBot a ClaudeBot sbírají obsah, který může být použit k trénování modelů. OAI-SearchBot a Claude-SearchBot podporují AI vyhledávání a načítání. ChatGPT-User a Claude-User stahují stránky jako reakci na akce uživatele. U některých dodavatelů jsou tyto úlohy oddělené, ale ne každý crawler na webu se čistě mapuje na jediný účel.

Obraz dodržování pravidel je přesnější, než naznačuje běžná zkratka. dokumentace crawlerů od Anthropic uvádí, že ClaudeBot, Claude-User a Claude-SearchBot respektují robots.txt. dokumentace botů od OpenAI uvádí, že jeho automatické crawlery používají nezávislé ovládání, ale pravidla robots.txt nemusí platit pro ChatGPT-User, protože tyto požadavky iniciuje člověk. dokumentace crawlerů od Perplexity činí podobné rozlišení: PerplexityBot se řídí nastavením webmastera, zatímco Perplexity-User robots.txt obvykle ignoruje. Paušální tvrzení, že AI boti ignorují robots.txt, tak hází do jednoho pytle zdokumentované crawlery, které soubor respektují, uživatelem spouštěné stahovače, jejichž chování se liší podle dodavatele, a scrapery, které se nikdy vůbec nepředstaví.

Tabulka níže je aktuální k době psaní. Nové tokeny se objevují rychleji, než je jakýkoli článek stihne sledovat, takže ji berte jako výchozí mapu s krátkou trvanlivostí.

Token crawleruProvozovatelCo to děláRespektuje robots.txtJak ověřit identitu
GPTBotOpenAISbírá obsah, který může být použit k trénování modelůAnoopenai.com/gptbot.json
OAI-SearchBotOpenAIZobrazuje weby ve výsledcích vyhledávání ChatGPTAnoopenai.com/searchbot.json
ChatGPT-UserOpenAIStahuje stránku pro akci uživatele ChatGPTNemusí platitopenai.com/chatgpt-user.json
OAI-AdsBotOpenAIOvěřuje odeslané reklamy a vstupní stránkyAnoopenai.com/adsbot.json
ClaudeBotAnthropicSbírá obsah, který může přispět k trénování modelůAnoSpolečný seznam na claude.com/crawling/bots.json
Claude-UserAnthropicNačte stránku, o kterou uživatel Claude požádáAnoSpolečný seznam na claude.com/crawling/bots.json
Claude-SearchBotAnthropicIndexuje obsah pro zlepšení kvality vyhledáváníAnoSpolečný seznam na claude.com/crawling/bots.json
PerplexityBotPerplexity AIIndexuje weby a odkazuje na ně ve výsledcích Perplexity; ne pro trénování základových modelůAnoperplexity.com/perplexitybot.json
Perplexity-UserPerplexity AIStáhne stránku, aby zodpověděl dotaz uživateleObvykle jej ignorujeperplexity.com/perplexity-user.json
Google-ExtendedGoogleŘídí trénování a grounding Gemini mimo VyhledáváníAnoNení to crawler; není co ověřovat
CCBotCommon CrawlBuduje veřejný korpus Common CrawlAnoReverzní DNS pro IPv4; zveřejněné rozsahy v4/v6

Psaní pravidel robots.txt pro AI crawlery

RFC 9309 uvádí, že pravidla v robots.txt nejsou formou autorizace přístupu. IETF v září 2022 standardizovala syntaxi, parsování a cachování; ze souboru tím neudělala nástroj vynucování. Detaily, které v praxi bolí, leží pod syntaxí: soubor musí být v kódování UTF-8, parsery musí zpracovat alespoň 500 kibibajtů a při konfliktu direktiv vyhrává nejkonkrétnější shoda cesty. Na tom, kde pravidlo v souboru stojí, nezáleží.

robots.txt pro AI boty používá stejný soubor a stejnou syntaxi, jakou už máte; mění se jen seznam tokenů. Uspořádejte pravidla podle záměru a přežijí aktuální sestavu dodavatelů. Pokud vám vadí trénování, zablokujte trénovací tokeny a indexery nechte být:

# Block training, keep AI search indexing
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

Pokud chcete poslat celoplošný signál odhlášení každému tokenu uvedenému v tabulce, seskupte je pod jedno pravidlo. Opakovat Disallow jedenáctkrát není třeba:

# Send a site-wide opt-out signal to named AI tokens
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: OAI-AdsBot
User-agent: ClaudeBot
User-agent: Claude-User
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Ani to není univerzální blokace. Anthropic uplatňuje robots.txt na Claude-User, ale OpenAI uvádí, že pravidla nemusí platit pro ChatGPT-User, a Perplexity-User je obvykle ignoruje. Pokud je třeba tato uživatelem spuštěná stahování zastavit, a ne jen odradit, prosaďte to rozhodnutí na proxy nebo ve WAF.

Google-Extended je token, který se nejčastěji chápe špatně, a ten rozdíl je důležitý, pokud vám účty platí provoz z vyhledávání. dokumentace crawlerů od Googlu jej popisuje jako samostatný produktový token, který řídí, zda smí být procházený obsah použit pro trénování a grounding Gemini mimo Vyhledávání, a uvádí, že neovlivňuje zařazení ani pozici webu ve Vyhledávání Google. Jeho zablokování se chování Googlebota ve Vyhledávání nedotkne.

Udržovat seznam tokenů ručně aktuální není dobré využití něčího odpoledne. Komunitně spravovaný repozitář ai.robots.txt sleduje AI user agenty a generuje konfigurace pro robots.txt, nginx, Caddy, HAProxy, Lighttpd a Apache. Správci Apache mohou vygenerovaný blok umístit vedle svých ostatních pravidel .htaccess na úrovni adresáře.

Tip: nevěřte řetězci user-agent. Je to hlavička a hlavičky se dají padělat zadarmo. Dokumentace CCBot od Common Crawl varuje, že se crawlery vydávají za CCBot. U IPv4 ověřujte pomocí dopředně potvrzené reverzní DNS pod *.crawl.commoncrawl.org; u IPv6 použijte rozsahy IP zveřejněné Common Crawl, protože reverzní DNS tam zatím není podporována. Stránky dodavatelů uvedené výše zveřejňují aktuální rozsahy IP i pro ostatní jmenované crawlery. Je to zdokumentovaná cesta ověření u těchto dodavatelů, ne vlastnost AI crawlerů obecně.

Dělá llms.txt vůbec něco?

Podle současných dat téměř nic. llms.txt je navrhovaný textový soubor v kořeni webu, který jazykovým modelům nabízí kurátorované shrnutí vašeho obsahu. Zveřejnit jej je levné, ale současná data vám dávají jen málo důvodů do něj investovat a dokumentace Googlu uvádí, že pro jeho AI funkce vyhledávání jej nepotřebujete.

Formát je minimální. Návrh llms.txt pochází ze září 2024, sídlí na /llms.txt a jedinou povinnou sekcí činí nadpis H1 s názvem webu nebo projektu.

Verdikt plyne z měření. Studie Ahrefs na 137 210 doménách zjistila, že 28 % měřených domén zveřejňovalo soubor llms.txt a že 97 % těchto souborů v květnu 2026 nedostalo ani jeden požadavek. Z požadavků, které skutečně dorazily, jich 19,5 % pocházelo od jmenovitě známých AI nástrojů. Ahrefs také upozorňuje, že stažení souboru nedokazuje, že byl opravdu použit.

Má interpretace těch dat je, že llms.txt je sázka na konvenci, kterou systémy, pro něž byla napsána, široce nepřijaly. Zveřejněte jej, pokud máte rádi uklizené kořeny. Ale nestavte kolem něj generovací pipeline, nedovolte, aby se stal blokujícím krokem vašeho nasazení, a každého, kdo jej prodává jako páku na hodnocení nebo citace, považujte za pořádný kus napřed před důkazy.

Klíčový poznatek: ve studii Ahrefs nedostalo 97 % zveřejněných souborů llms.txt v květnu 2026 vůbec žádný požadavek.

Jak zpřístupnit stránky strojovému čtení

Měření crawlerů od Vercelu zjistilo, že crawlery OpenAI, ClaudeBot, PerplexityBot, Meta-ExternalAgent, Bytespider a CCBot nespouštějí JavaScript. Gemini přes Googlebot a AppleBot ano. Pro crawlery, které nerenderují, je obsah, jenž se objeví až po hydrataci na klientovi, neviditelný, takže vše kritické renderujte na serveru. Markup je jednodušší otázka a vlastní doporučení Googlu k němu je neobvykle přímé:

„Abyste se objevili v těchto funkcích, nemusíte vytvářet nové strojově čitelné soubory, AI textové soubory ani markup. Neexistují ani žádná zvláštní strukturovaná data schema.org, která byste museli přidat.“

Pokyny Google Search Central k AI

Nárůst viditelnosti o 40 %, který se občas cituje na podporu FAQ schématu, pochází z článku GEO přijatého na KDD 2024. Článek uvádí zisky až 40 %, ale testované zásahy se týkají obsahových změn, jako jsou citace, přímé citáty, statistiky, odborná terminologie a plynulá formulace, nikoli FAQPage ani jiného markupu Schema.org. Číslo sedí; jeho napojení na schema markup nikoli.

Strukturovaná data ponechte tam, kde podporují klasickou funkci Vyhledávání a odpovídají viditelné stránce. Google uvádí, že způsobilost pro jeho AI funkce vede přes běžnou indexaci ve Vyhledávání, bez zvláštního požadavku na markup. Jen se neprokázalo, že by hnula citovaností v AI.

Když robots.txt nestačí: rate limiting a WAF na serveru

Čtyři vrstvy kontroly AI crawlerů vedle sebe: robots.txt je čistě kooperativní, reverzní proxy vynucuje četnost požadavků, ale závisí na deklarované identitě, vlastní WAF vynucuje podle chování, cest, četností a pravidel a proof-of-work výzva nutí vybraný provoz zaplatit výpočetní cenu; síla vynucení i provozní náklady rostou zleva doprava.

Direktivy fungují na boty, kteří se k tomu přihlásili. Ve stejném vlákně na Hacker Newspopsalo několik provozovatelů provoz, který to nedělá: crawlery rozprostírající požadavky přes obrovské skupiny IP bloků a střídající user agenty, aby vypadaly jako běžní návštěvníci, což vyřadí naivní limity na IP i shodu podle user agenta. Berte to jako svědectví komunity; nikdo ve vlákně nezveřejňoval měření. Popisuje to ale přesně tu skupinu, na kterou robots.txt nikdy nemohl dosáhnout.

Než začnete šplhat po tomhle žebříku, existuje levnější tah pro provoz, který stále spolupracuje. Zpomalte ho:

User-agent: ClaudeBot
Crawl-delay: 1

Tip: nejdřív přiškrťte, pak blokujte. Dokumentace Anthropic podporuje Crawl-delay pro ClaudeBot , takže těžkého, ale slušně vychovaného crawlera můžete zpomalit a přesto si ho nechat. Tatáž stránka uvádí, že blokování IP není trvalý mechanismus odhlášení. Oba body platí konkrétně pro Anthropic; Crawl-delay není univerzální direktiva, takže si nejdřív ověřte dokumentaci každého dodavatele.

Všechno za tím je vynucování, které provozujete sami, ve třech příčlích s rostoucí cenou i účinností. Každá něco koupí a něčeho se vzdá.

Příčka 1: direktivy reverzní proxy a rate limiting

Jak se rozhoduje pomalý pruh pro crawlery v nginxu: u příchozího požadavku se zkontroluje User-Agent; při shodě s tokenem crawleru dostane klíč pro rate limit a vstoupí do zóny ai_slowlane s 20 požadavky za minutu a burstem 10, za nímž se ve výchozím nastavení vrací 503; požadavek bez shody s tokenem crawleru dostane prázdný klíč a nepočítá se, takže scraper hlásící se jako Chrome tento pruh určený crawlerům zcela obejde.

Rate limiting AI crawlerů začíná na reverzní proxy, prvním prvku vašeho stacku, který požadavek uvidí a dokáže jej zpomalit dřív, než aplikace nebo databáze udělá jakoukoli práci. Dokumentace NGINX k rate limitu uvádí, že požadavky s prázdným klíčem se nepočítají, takže map může přidělit klíč pro rate limit jen těm tokenům crawlerů, které chcete přiškrtit, a neshodující se požadavky nechá mimo limit_req_zone.

# /etc/nginx/nginx.conf, inside the http block
map $http_user_agent $ai_rate_key {
    default              "";
    ~*GPTBot             $binary_remote_addr;
    ~*OAI-SearchBot      $binary_remote_addr;
    ~*ClaudeBot          $binary_remote_addr;
    ~*Claude-SearchBot   $binary_remote_addr;
    ~*PerplexityBot      $binary_remote_addr;
    ~*CCBot              $binary_remote_addr;
}

limit_req_zone $ai_rate_key zone=ai_slowlane:10m rate=20r/m;

# /etc/nginx/sites-available/example.conf, inside the server block
location / {
    limit_req zone=ai_slowlane burst=10 nodelay;
    proxy_pass http://127.0.0.1:8080;
}

Dvojice, kterou budete ladit, je burst=10 nodelay: požadavky nad průměrnou rychlost mohou burst spotřebovat okamžitě a ty za ním dostanou ve výchozím nastavení 503 ve výchozím nastavení. Nastavte to příliš přísně a vyhodíte legitimního crawlera uprostřed procházení, což se diagnostikuje pomaleji než výpadek. Caddy vyjadřuje tytéž dvě myšlenky pomocí matcheru a handleru; pokud mezi nimi vybíráte, konfigurační soubory vedle sebe jsou užitečnější než syntetické číslo propustnosti.

Omezením této příčky je, že pomalý pruh stále závisí na deklarovaném user agentovi. Scraper převlečený za Chrome tento klíč určený crawlerům zcela obejde; k zachycení takového provozu je potřeba širší rate limit podle chování IP/cest nebo příčka WAF níže.

Příčka 2: webový aplikační firewall, který provozujete sami

WAF přesouvá rozhodnutí z jediné hlavičky na sadu pravidel, která čte vzory požadavků, cesty a četnosti dohromady, a přesně to potřebujete, jakmile se provoz přestane hlásit. Provozovat jej na vlastním stroji drží pravidla i logy na vašem disku, kde je můžete grepovat ve tři ráno. BunkerWeb je jedním z takových projektů, SafeLine je druhý a oba běží na VPS, pokud host splňuje architekturní a zdrojové požadavky projektu; obě nabízíme ve verzi na jedno kliknutí, aby vám odpadla instalace, i když zabalení není ta zajímavá část.

To je zároveň cena téhle příčky. Pravidla vyžadují údržbu a pravidlo nastavené dost přísně na to, aby chytilo odhodlaného scrapera, nakonec chytí i člověka. Režimy Monitor, Balanced a Strict v SafeLine činí tento kompromis výslovným: začněte pozorováním provozu dost dlouho na to, abyste našli falešné poplachy, a teprve pak nechte WAF automaticky vracet odpovědi 403.

Příčka 3: proof-of-work výzvy

Anubis obchází problém identifikace úplně. U provozu, který se rozhodnete vyzvat, nechá požadavek zaplatit malou výpočetní cenu dřív, než jej origin obslouží. Jeho systém politik umí požadavky podle shodových pravidel také povolit, zamítnout nebo vyzvat. README projektu jej označuje za Web AI Firewall Utility postavený kolem výzev, který chrání upstream zdroje před scraper boty. Funguje, aniž by každý bot musel správně uvést, kdo je.

Projekt sám označuje tenhle přístup za jadernou odpověď a ta výhrada je zasloužená. Daň dopadá na jakýkoli provoz, který vaše politika vyzve, což při příliš širokých pravidlech může zahrnovat lidi na pomalých zařízeních nebo legitimní crawlery. Nechte si tuhle příčku v záloze pro skutečně nepřátelský provoz. Nadšený crawler bývá problém rate limitu, a rate limit už máte.

Dimenzování na nápor

Zátěž od crawlerů často přichází v návalech, ale jestli je náročná na CPU, databázi nebo I/O, závisí na aplikaci a na procházených URL. Ve výše uvedeném příkladu s WordPressem provozovatel většinu té jedné vteřiny na stránku vystopoval do MySQL, takže onen konkrétní incident byl databázové úzké hrdlo převlečené za problém s provozem.

Tím se dimenzování mění v otázku alokace, a to nepříjemnou: za rezervu platíte průběžně a vydělá si ji jen během špičky, kterou neovládáte. Přesto na špičku dimenzujte. Pokud BunkerWeb sdílí stroj s aplikací a databází, neberte 8 GB jako doporučení pro celý stack. Průvodce rychlým startem BunkerWebu doporučuje 2 vCPU a 8 GB RAM pro testování nebo nasazení s velmi malým počtem služeb a nejméně 4 vCPU s 16 GB RAM pro produkční prostředí chránící mnoho služeb. Nad to připočtěte špičkové CPU samotné aplikace, paměť databáze a rezervu na I/O.

Jádra s vyšším taktem pomáhají, když je zpracování požadavků nebo vykonávání dotazů limitované CPU; více jader pomáhá, když potřebujete držet ve vzduchu víc souběžné práce. Dimenzujte podle špičkové souběžnosti, doby odezvy p95, CPU a I/O waitu databáze a míry cache miss, ne jen podle provozu crawlerů.

Provozovat tuhle vrstvu sami vyžaduje od stroje pod ní dvě věci: root přístup, protože každý mechanismus výše je konfigurační soubor, který editujete, a služba, kterou restartujete, a dost rezervy, aby nápor neshodil web, zatímco pravidla dělají svou práci. Pokud kvůli tomu vybíráte nebo stěhujete stroj, náš Linux VPS vám dá root přístup, který tenhle stack vyžaduje, a umožní vyzkoušet nastavení proxy a WAF dřív, než se upíšete dlouhodobé velikosti.

Zobrazit Linux plány

Stavte na Linux VPS s root přístupem, NVMe a výkonem AMD EPYC.

Zobrazit Linux plány

Nová výchozí nastavení Cloudflare pro AI provoz

Cloudflare rozdělil AI provoz do kategorií Search, Agent a Training ve svém oznámení o AI provozu z července 2026. Od 15. září 2026 budou novým doménám přicházejícím na Cloudflare kategorie Training a Agent ve výchozím nastavení blokované na stránkách zobrazujících reklamu, zatímco Search zůstane povolený. Stávající zákazníci mohou nastavení změnit předem a ovládací prvky jsou dostupné napříč tarify.

Co si z toho odnést, je komplikace, kterou Cloudflare pojmenovává ve vlastním oznámení. V jeho klasifikaci Googlebot, Applebot i Bingbot kombinují vyhledávací práci s trénovací, takže zákazník, který zablokuje kategorii Training, zablokuje i tyto crawlery včetně vyhledávacího chování, které si chtěl ponechat. Je to tatáž past, která číhá u každého ovládání na úrovni kategorií, jež zachází s víceúčelovým crawlerem, jako by měl jediný úkol.

Pokud váš web není za Cloudflare, nic z toho není páka, kterou byste mohli zatáhnout. Vězte ale, že to přichází, protože v září se vzorce provozu pohnou; vašimi nástroji zůstávají tokeny v robots.txt a proxy vrstva výše.

WebMCP: stojí za sledování, ne za stavění

WebMCP je protějšek Model Context Protocolu na straně prohlížeče, tedy konvence, kterou agenti používají k volání strukturovaných nástrojů místo hádání. Oznámení Chromu o origin trialu WebMCP formuluje cíl přímo: místo aby agent hádal, co dělá tlačítko nebo formulářové pole, může web vystavit strukturované funkce a anotované ovládací prvky, které agent zavolá přímo.

Je to první věrohodný pokus dát agentům na vašem webu jinou práci než čtení, což z něj dělá nejzajímavější věc v tomhle článku. Zároveň je experimentální a nedokončený: origin trial v Chrome 149, který se otevřel v červnu 2026. Sledujte specifikaci. Zatím kolem toho nestavte produkční závislost a nechte to mimo svůj kapacitní plán.

Časté dotazy

Zastaví robots.txt AI boty?

Zčásti, a odpovědí je právě ta přesnost. Anthropic uvádí, že ClaudeBot, Claude-User a Claude-SearchBot respektují robots.txt. Automatické crawlery OpenAI jej používají také, ale OpenAI uvádí, že pravidla nemusí platit pro ChatGPT-User; Perplexity říká, že Perplexity-User soubor obvykle ignoruje. Nepojmenované nebo podvržené scrapery jsou mimo robots.txt úplně.

Jaký je rozdíl mezi llms.txt a robots.txt?

Řeší různé problémy. robots.txt říká spolupracujícím crawlerům, co si smějí stáhnout, a je standardizovaný IETF. llms.txt je navrhovaný soubor nabízející jazykovým modelům kurátorované shrnutí vašeho obsahu, bez jakéhokoli požadavku, aby jej něco stahovalo nebo používalo. V měření Ahrefs z května 2026 nedostalo 97 % zveřejněných souborů žádný požadavek. Chcete-li direktivy pro crawlery, standardním mechanismem je robots.txt; llms.txt je volitelný a zatím se používá málo.

Jak zablokuji GPTBot na svém webu?

Přidejte tyto dva řádky do souboru robots.txt v kořeni svého webu:

User-agent: GPTBot
Disallow: /

Tím se váš web odhlásí z automatického trénovacího procházení GPTBot. OAI-SearchBot, který se používá pro vyhledávání v ChatGPT, a ChatGPT-User, který stahuje stránky pro akce uživatele, jsou samostatné tokeny a zůstanou nedotčené.

Zablokuje blokování trénovacích AI crawlerů i indexaci ve Vyhledávání Google?

Ne, pokud použijete správný ovládací prvek. Zablokování Google-Extended nezabrání Googlebotu ve Vyhledávání. Háček nastane, když použijete ovládání na úrovni kategorií, které víceúčelového crawlera řadí pod Training: Cloudflare například klasifikuje Googlebot, Applebot i Bingbot jako kombinaci vyhledávání a trénování, takže zablokování kategorie Training tam zablokuje i tyto identity crawlerů.

Jak poznám, že můj web procházejí AI boti?

Prohledejte grepem svůj access log na zdokumentované tokeny a pak si ověřte, co jste našli:

grep -ohE 'GPTBot|ClaudeBot|CCBot|PerplexityBot|OAI-SearchBot|ChatGPT-User' \
  /var/log/nginx/access.log | sort | uniq -c | sort -rn

Počty ukazují, které deklarované user agenty vás navštěvují a jak často. Protože řetězec lze zfalšovat, ověřte si ty nejvytíženější proti IP rozsahům zveřejněným dodavatelem nebo jeho metodou reverzní DNS, než podle těch čísel začnete jednat.

Sdílet

Diskuse

Komentáře

Přihlaste se a zapojte se do diskuse.

Další z blogu

Pokračuj ve čtení.

Hotov k nasazení? Od 2,48 $/měs.

Nezávislý cloud od roku 2008. AMD EPYC, NVMe, 40 Gbps. Vrácení peněz do 14 dnů.