Перейти до основного вмісту
Знижка 50% усі плани, обмежений час. Від $2.48/mo
17 min left
AI та машинне навчання

Як підготувати свій self-hosted сайт до ШІ-агентів

S Автор: Samer 17 хв читання
Multiple labeled AI crawler request streams arriving at a self-hosted web server behind a reverse proxy, where one stream is slowed at the gate instead of blocked outright

У треді на Hacker News про трафік ШІ-кролерів адміністратор хостингу описав навантаження з боку оператора: «близько 6 різних доволі агресивних ШІ-ботів», які періодично застрягають на сторінках варіантів товару чи категорій і починають гатити по них приблизно по одному запиту за секунду, на сайті, де «кожне завантаження сторінки може займати цілу секунду туди-назад (більшість цього часу — у MySQL)». Сукупний ефект, із того самого коментаря: «майже так, ніби сайт щодня потрапляє під Slashdot-ефект».

Підготовка сайту до ШІ-агентів — це передусім питання ресурсів, тож більшість роботи тут припадає на конфігурацію сервера і майже нічого — на контент-стратегію. Корисна властивість цього трафіку в тому, що здебільшого він не анонімний: компанії, які його генерують, публікують назви своїх кролерів, документують призначення кожного та пояснюють, як їх вимкнути. Далі — що налаштувати, що кожен механізм насправді забезпечує і які два кроки я б пропустив: публікацію llms.txt і додавання schema-розмітки заради ШІ.

TL;DR

  • ШІ-трафік зазвичай поділяється на навчання, індексацію для ШІ-пошуку та запити, ініційовані користувачем. OpenAI та Anthropic надають окремі токени для цих завдань, тож керувати ними можна незалежно; деякі багатоцільові кролери поєднують кілька ролей під однією ідентичністю.
  • OpenAI, Anthropic, Perplexity та Common Crawl документують керування через robots.txt для своїх автоматичних кролерів. Виняток — завантажувачі, запущені користувачем: Anthropic застосовує robots.txt і до Claude-User, OpenAI зазначає, що правила можуть не діяти для ChatGPT-User, а Perplexity-User зазвичай їх ігнорує.
  • Файл robots.txt — це механізм згоди, а не контроль доступу. RFC 9309 не дає йому власних засобів примусу; боти, які його дотримуються, можуть знизити ваше навантаження, але зупинити чи пригальмувати трафік, що його ігнорує, файл не здатен.
  • Серед 137 210 доменів у клієнтській базі аналітики Ahrefs 97 % опублікованих файлів llms.txt не отримали жодного запиту в травні 2026 року. Публікуйте його, якщо хочете, але не будуйте навколо нього інструментарій.
  • Залиште структуровані дані там, де вони підтримують класичні функції Пошуку, але документація Google каже, що для її ШІ-функцій не потрібні ані спеціальна схема, ані текстовий файл для ШІ.
  • Рендерте критичний контент на сервері, якщо хочете, щоб його прочитали OpenAI, ClaudeBot, PerplexityBot чи CCBot. Vercel виявив, що ці кролери не виконують JavaScript; винятки — Gemini через Googlebot та AppleBot.
  • Поза кооперативними правилами robots.txt примус живе на зворотному проксі, у WAF, який ви тримаєте самі, або за challenge з доказом роботи — саме в такому порядку за вартістю.

Чого ця стаття не охоплює

Ідеться про сайт, який відвідують агенти, а не про сайт, що укладає з ними транзакції. Чотири суміжні теми лишаємо осторонь.

  • Агентна комерція та процеси оформлення замовлення — інша задача для іншого типу сайтів.
  • Юридична та авторсько-правова суперечка про навчальні дані — це бізнес-рішення, а не налаштування сервера.
  • Покрокове впровадження WebMCP, оскільки стандарт досі перебуває на стадії origin trial.
  • Налаштування, специфічні для конкретних CDN, окрім єдиного розділу про Cloudflare нижче.

Які ШІ-кролери гатять по вашому сайту

GPTBot і ClaudeBot збирають контент, який може використовуватися для навчання моделей. OAI-SearchBot і Claude-SearchBot обслуговують ШІ-пошук та отримання даних. ChatGPT-User і Claude-User завантажують сторінки у відповідь на дії користувача. У частини постачальників ці завдання розділені, але не кожен кролер у вебі акуратно вкладається в одне призначення.

Картина дотримання правил точніша, ніж підказує поширене спрощення. документація Anthropic щодо кролерів повідомляє, що ClaudeBot, Claude-User та Claude-SearchBot дотримуються robots.txt. документація OpenAI щодо ботів повідомляє, що її автоматичні кролери використовують незалежні механізми керування, але правила robots.txt можуть не діяти для ChatGPT-User, бо ці запити ініціює людина. документація Perplexity щодо кролерів проводить схоже розрізнення: PerplexityBot дотримується налаштувань вебмайстра, тоді як Perplexity-User зазвичай ігнорує robots.txt. Тож огульне твердження, ніби ШІ-боти ігнорують robots.txt, змішує документовані кролери, які поважають файл, із запущеними користувачем завантажувачами, поведінка яких залежить від постачальника, і зі скраперами, що взагалі ніколи не представляються.

Таблиця нижче актуальна на момент написання. Нові токени з'являються швидше, ніж будь-яка стаття встигає їх відстежувати, тож сприймайте її як стартову мапу з коротким терміном придатності.

Токен кролераОператорЩо це даєДотримується robots.txtЯк перевірити справжність
GPTBotOpenAIЗбирає контент, який може використовуватися для навчання моделейТакopenai.com/gptbot.json
OAI-SearchBotOpenAIПоказує сайти в результатах пошуку ChatGPTТакopenai.com/searchbot.json
ChatGPT-UserOpenAIЗавантажує сторінку за дією користувача ChatGPTМоже не діятиopenai.com/chatgpt-user.json
OAI-AdsBotOpenAIПеревіряє надіслані оголошення та цільові сторінкиТакopenai.com/adsbot.json
ClaudeBotAnthropicЗбирає контент, який може долучатися до навчання моделейТакСпільний список на claude.com/crawling/bots.json
Claude-UserAnthropicЗавантажує сторінку, яку запитав користувач ClaudeТакСпільний список на claude.com/crawling/bots.json
Claude-SearchBotAnthropicІндексує контент для підвищення якості пошукуТакСпільний список на claude.com/crawling/bots.json
PerplexityBotPerplexity AIІндексує сайти й посилається на них у результатах Perplexity; не для навчання базових моделейТакperplexity.com/perplexitybot.json
Perplexity-UserPerplexity AIЗавантажує сторінку, щоб відповісти на запитання користувачаЗазвичай ігноруєperplexity.com/perplexity-user.json
Google-ExtendedGoogleКерує навчанням і заземленням Gemini поза ПошукомТакНе кролер; перевіряти нічого
CCBotCommon CrawlФормує публічний корпус Common CrawlТакЗворотний DNS для IPv4; опубліковані діапазони v4/v6

Пишемо правила robots.txt для ШІ-кролерів

RFC 9309 стверджує, що правила в robots.txt не є формою авторизації доступу. IETF стандартизувала синтаксис, розбір і кешування у вересні 2022 року; файл від цього не став механізмом примусу. По-справжньому кусаються деталі нижче синтаксису: файл має бути в кодуванні UTF-8, парсери зобов'язані обробляти щонайменше 500 кібібайт, а за конфлікту директив перемагає найконкретніший збіг шляху. Місце правила у файлі не має жодного значення.

robots.txt для ШІ-ботів використовує той самий файл і той самий синтаксис, що у вас уже є; змінюється лише список токенів. Упорядкуйте правила за наміром — і вони переживуть склад постачальників. Якщо ваше заперечення стосується навчання, блокуйте токени навчання і не чіпайте індексатори:

# Block training, keep AI search indexing
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

Якщо ви хочете надіслати сигнал відмови для всього сайту кожному токену з таблиці, згрупуйте їх під одним правилом. Повторювати Disallow одинадцять разів не потрібно:

# Send a site-wide opt-out signal to named AI tokens
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: OAI-AdsBot
User-agent: ClaudeBot
User-agent: Claude-User
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Це все ще не універсальне блокування. Anthropic застосовує robots.txt до Claude-User, але OpenAI зазначає, що правила можуть не діяти для ChatGPT-User, а Perplexity-User зазвичай їх ігнорує. Якщо ці ініційовані користувачем запити треба саме зупинити, а не просто відмовити, реалізуйте це рішення на проксі або WAF.

Google-Extended — токен, який найчастіше розуміють неправильно, і ця різниця важлива, якщо ваші рахунки оплачує пошуковий трафік. документація Google щодо кролерів описує його як самостійний продуктовий токен, що визначає, чи можна використовувати просканований контент для навчання та заземлення Gemini поза Пошуком, і зазначає, що він не впливає на включення сайту в Пошук Google чи його позиції. Блокування не зачіпає поведінку Googlebot у Пошуку.

Тримати список токенів актуальним вручну — не найкращий спосіб провести день. Підтримуваний спільнотою репозиторій ai.robots.txt відстежує ШІ-агенти користувача та генерує конфігурації для robots.txt, nginx, Caddy, HAProxy, Lighttpd і Apache. Адміністратори Apache можуть покласти згенерований блок поруч зі своїми іншими правил .htaccess на рівні каталогу.

Порада: не довіряйте рядку user-agent. Це заголовок, а заголовки підробляються задарма. Документація Common Crawl щодо CCBot попереджає, що кролери видають себе за CCBot. Для IPv4 перевіряйте через прямо підтверджений зворотний DNS у зоні *.crawl.commoncrawl.org; для IPv6 використовуйте опубліковані Common Crawl діапазони IP, бо зворотний DNS там наразі не підтримується. Сторінки постачальників вище також публікують актуальні діапазони IP для решти названих кролерів. Це задокументований шлях перевірки в цих постачальників, а не властивість ШІ-кролерів загалом.

Чи дає llms.txt хоч щось?

За наявними даними — майже нічого. llms.txt — це запропонований текстовий файл у корені сайту, який пропонує мовним моделям вивірене резюме вашого контенту. Опублікувати його дешево, але нинішні дані дають мало підстав у нього вкладатися, а документація Google каже, що для її ШІ-функцій пошуку він не потрібен.

Формат мінімальний. Пропозиція llms.txt датується вереснем 2024 року, живе за адресою /llms.txt, а єдиним обов'язковим розділом робить заголовок H1 з назвою сайту чи проєкту.

Вирок виносять вимірювання. Дослідження Ahrefs на 137 210 доменах виявило, що 28 % виміряних доменів публікували файл llms.txt і що 97 % цих файлів не отримали жодного запиту в травні 2026 року. Із запитів, які все ж надійшли, 19,5 % походили від відомих на ім'я ШІ-інструментів. Ahrefs також застерігає, що саме завантаження не доводить, що файл справді використали.

Моє прочитання цих даних таке: llms.txt — це ставка на угоду, яку системи, заради яких її придумали, широко не прийняли. Публікуйте, якщо любите охайний корінь сайту. Але не будуйте навколо нього конвеєр генерації, не дозволяйте йому стати блокувальним кроком у деплої, а всіх, хто продає його як важіль ранжування чи цитованості, вважайте такими, що добряче випередили докази.

Ключовий висновок: у дослідженні Ahrefs 97 % опублікованих файлів llms.txt не отримали жодного запиту в травні 2026 року.

Як зробити сторінки машиночитними

Вимірювання кролерів від Vercel виявило, що кролери OpenAI, ClaudeBot, PerplexityBot, Meta-ExternalAgent, Bytespider і CCBot не виконують JavaScript. Gemini через Googlebot та AppleBot — виконують. Для кролерів, які не рендерять, контент, що з'являється лише після клієнтської гідратації, невидимий, тож усе критичне рендерте на сервері. З розміткою простіше, і власні рекомендації Google щодо неї незвично прямі:

«Щоб з'являтися в цих функціях, вам не потрібно створювати нові машиночитні файли, текстові файли для ШІ чи розмітку. Немає й особливих структурованих даних schema.org, які варто було б додати».

Рекомендації Google Search Central щодо ШІ

Приріст видимості на 40 %, який іноді наводять на захист FAQ-схеми, походить із статті GEO , прийнятої на KDD 2024. У статті повідомляється про приріст до 40 %, але перевірені втручання стосуються змін контенту: посилань на джерела, цитат, статистики, технічної термінології та плавних формулювань, а не FAQPage чи будь-якої іншої розмітки Schema.org. Цифра правильна; її прив'язка до schema-розмітки — ні.

Залиште структуровані дані там, де вони підтримують класичну функцію Пошуку й відповідають видимій сторінці. Google каже, що право потрапити до її ШІ-функцій забезпечує звичайна індексація в Пошуку, без окремої вимоги до розмітки. Просто не показано, що вона зрушує цитованість у ШІ.

Коли robots.txt замало: обмеження частоти та WAF на сервері

Чотири рівні контролю ШІ-кролерів поруч: robots.txt суто кооперативний, зворотний проксі задає частоту запитів, але залежить від заявленої ідентичності, власний WAF діє за поведінкою, шляхами, частотою та правилами, а challenge з доказом роботи змушує вибраний трафік платити обчислювальну ціну; і сила примусу, і експлуатаційна вартість зростають зліва направо.

Директиви працюють із ботами, які погодилися грати за правилами. У тому самому треді на Hacker Newsкілька операторів описали трафік, який цього не робить: кролери розкидають запити по величезних пулах IP-блоків і змінюють user-agent, щоб виглядати звичайними відвідувачами, а це зводить нанівець і наївні ліміти на IP, і зіставлення за user-agent. Сприймайте це як свідчення спільноти: вимірювань у треді ніхто не публікував. Але це описує саме ту публіку, до якої robots.txt ніколи й не мав дотягнутися.

Перш ніж лізти цією драбиною, є дешевший хід для трафіку, який ще співпрацює. Пригальмуйте його:

User-agent: ClaudeBot
Crawl-delay: 1

Порада: спершу пригальмуйте, а вже потім блокуйте. Документація Anthropic підтримує Crawl-delay для ClaudeBot , тож важкого, але вихованого кролера можна пригальмувати й лишити. На тій самій сторінці сказано, що блокування за IP не є стійким механізмом відмови. Обидва пункти стосуються саме Anthropic; Crawl-delay не є універсальною директивою, тож спершу звіртеся з документацією кожного постачальника.

Усе далі — це примус, який ви забезпечуєте самі, у трьох щаблях зі зростанням вартості й дієвості. Кожен щось дає і чимось жертвує.

Щабель 1: директиви зворотного проксі та обмеження частоти

Як вирішує повільна смуга nginx для кролерів: у вхідного запиту перевіряється User-Agent; за збігу з токеном кролера запит отримує ключ обмеження і потрапляє в зону ai_slowlane із 20 запитами на хвилину та сплеском у 10, поза яким за замовчуванням повертається 503; якщо збігу немає, запит отримує порожній ключ і не рахується, тож скрапер, що оголошує User-Agent Chrome, повністю обходить цю призначену для кролерів повільну смугу.

Обмеження частоти для ШІ-кролерів починається на зворотному проксі — першому елементі стеку, який бачить запит і може пригальмувати його ще до того, як застосунок чи база даних виконають бодай якусь роботу. Документація NGINX щодо обмеження частоти стверджує, що запити з порожнім ключем не враховуються, тож map може видавати ключ обмеження лише тим токенам кролерів, які ви хочете пригальмувати, залишаючи незбіжні запити поза межами limit_req_zone.

# /etc/nginx/nginx.conf, inside the http block
map $http_user_agent $ai_rate_key {
    default              "";
    ~*GPTBot             $binary_remote_addr;
    ~*OAI-SearchBot      $binary_remote_addr;
    ~*ClaudeBot          $binary_remote_addr;
    ~*Claude-SearchBot   $binary_remote_addr;
    ~*PerplexityBot      $binary_remote_addr;
    ~*CCBot              $binary_remote_addr;
}

limit_req_zone $ai_rate_key zone=ai_slowlane:10m rate=20r/m;

# /etc/nginx/sites-available/example.conf, inside the server block
location / {
    limit_req zone=ai_slowlane burst=10 nodelay;
    proxy_pass http://127.0.0.1:8080;
}

Пара, яку треба налаштувати, — це burst=10 nodelay: запити понад середню частоту можуть одразу вичерпати сплеск, а ті, що йдуть далі, отримують 503 за замовчуванням. Затягнете надто сильно — і викинете легітимного кролера посеред обходу, а таку проблему діагностувати довше, ніж повноцінний збій. Caddy виражає ті самі дві ідеї через matcher і handler; якщо обираєте між ними, конфігураційні файли поруч корисніші за синтетичний показник пропускної здатності.

Обмеження цього щабля в тому, що повільна смуга й далі залежить від заявленого user-agent. Скрапер, перевдягнений у Chrome, повністю обходить цей призначений для кролерів ключ; щоб зловити такий трафік, потрібен ширший ліміт за поведінкою IP чи шляхів або щабель WAF нижче.

Щабель 2: WAF, який ви тримаєте самі

WAF переносить рішення з одного заголовка на набір правил, який читає разом шаблони запитів, шляхи та частоту, а це саме те, що потрібно, коли трафік перестає представлятися. Тримаючи його на власній машині, ви лишаєте правила й логи на своєму диску, де їх можна грепати о третій ночі. BunkerWeb — один із таких проєктів, SafeLine — другий, і обидва працюють на VPS, якщо хост відповідає вимогам проєкту щодо архітектури та ресурсів; ми даємо версії обох в один клік, щоб позбавити вас налаштування, хоча пакування тут не найцікавіше.

У цьому ж і ціна цього щабля. Правила потребують супроводу, а правило, затягнуте достатньо, щоб зловити впертого скрапера, рано чи пізно зловить людину. Режими Monitor, Balanced і Strict у SafeLine роблять цей компроміс явним: спершу поспостерігайте за трафіком достатньо довго, щоб знайти хибні спрацювання, і лише тоді дозволяйте WAF автоматично віддавати 403.

Щабель 3: challenge з доказом роботи

Anubis повністю оминає проблему ідентифікації. Для трафіку, який ви обрали для challenge, він змушує запит сплатити невелику обчислювальну ціну, перш ніж origin його обслужить. Його система політик також може дозволяти, відхиляти або надсилати запити на challenge за правилами зіставлення. README проєкту називає його Web AI Firewall Utility, побудованим навколо challenge'ів для захисту вищих за потоком ресурсів від ботів-скраперів. Він працює, не вимагаючи, щоб кожен бот коректно себе назвав.

Сам проєкт називає цей підхід ядерною відповіддю, і це застереження заслужене. Податок лягає на будь-який трафік, який ваша політика відправляє на challenge, а це можуть бути люди на повільних пристроях чи легітимні кролери, якщо правила надто широкі. Тримайте цей щабель у резерві для справді ворожого трафіку. Надто завзятий кролер — зазвичай питання обмеження частоти, а ліміт у вас уже є.

Розрахунок ресурсів під сплеск

Навантаження від кролерів часто приходить сплесками, але чи впирається воно в CPU, базу даних чи введення-виведення, залежить від застосунку та обходжуваних URL. У прикладі з WordPress вище оператор списав більшу частину тієї секунди на MySQL, тож той конкретний випадок був вузьким місцем бази даних, перевдягненим у проблему трафіку.

Це перетворює розрахунок ресурсів на питання розподілу, ще й незручне: за запас ви платите постійно, а відпрацьовує він лише під час сплеску, який ви не контролюєте. Закладайте запас усе одно. Якщо BunkerWeb ділить хост із застосунком і базою даних, не сприймайте 8 ГБ як рекомендацію для всього стеку. Посібник зі швидкого старту BunkerWeb рекомендує 2 vCPU та 8 ГБ ОЗП для тестування чи розгортань із дуже малою кількістю сервісів і щонайменше 4 vCPU з 16 ГБ ОЗП для продакшн-середовищ, які захищають багато сервісів. Зверху додайте пікове навантаження CPU самого застосунку, пам'ять бази даних і запас на введення-виведення.

Ядра з вищою частотою допомагають, коли обробка запитів або виконання SQL упирається в CPU; більше ядер допомагає, коли потрібно тримати більше паралельної роботи в польоті. Рахуйте за піковою конкурентністю, часом відгуку p95, завантаженням CPU й очікуванням введення-виведення бази даних і часткою промахів кешу, а не за самим лише трафіком кролерів.

Тримати цей шар самому означає вимагати від машини під ним двох речей: root-доступу, адже кожен механізм вище — це конфіг, який ви редагуєте, і сервіс, який ви перезапускаєте, та достатнього запасу, щоб сплеск не поклав сайт, поки правила роблять свою справу. Якщо ви добираєте або переносите машину під це, наш Linux VPS дає root-доступ, якого вимагає цей стек, і дозволяє протестувати зв'язку проксі та WAF, перш ніж брати розмір надовго.

Переглянути тарифи Linux

Розробляйте на Linux VPS з root-доступом, NVMe та потужністю AMD EPYC.

Переглянути тарифи Linux

Нові типові налаштування Cloudflare для ШІ-трафіку

Cloudflare поділив ШІ-трафік на категорії Search, Agent і Training у своєму анонсі про ШІ-трафік від липня 2026 року. Із 15 вересня 2026 року новим доменам, що приєднуються до Cloudflare, категорії Training та Agent типово блокуються на сторінках із рекламою, тоді як Search лишається дозволеним. Наявні клієнти можуть змінити налаштування заздалегідь, і ці елементи керування доступні на всіх тарифах.

Звідси варто взяти ту складність, яку Cloudflare називає у власному анонсі. У його класифікації Googlebot, Applebot і Bingbot кожен поєднує пошукову роботу з навчальною, тож клієнт, який блокує категорію Training, блокує й ці кролери, включно з тією пошуковою поведінкою, яку хотів зберегти. Це та сама пастка, що чигає на будь-яке керування на рівні категорій, яке поводиться з багатоцільовим кролером так, ніби в нього одне завдання.

Якщо ваш сайт не за Cloudflare, жоден із цих важелів вам недоступний. Але знайте, що це насувається, бо у вересні схеми трафіку зрушать; вашими інструментами лишаються токени robots.txt і згаданий вище шар проксі.

WebMCP: варто стежити, але не будувати під нього

WebMCP — це браузерний відповідник Model Context Protocol, угоди, за якою агенти викликають структуровані інструменти замість того, щоб вгадувати. Анонс origin trial WebMCP від Chrome формулює мету прямо: замість того щоб агент вгадував, що робить кнопка чи поле форми, сайт може виставити структуровані функції та анотовані елементи керування, які агент викличе напряму.

Це перша переконлива спроба дати агентам на вашому сайті заняття, крім читання, і саме тому це найцікавіше в цій статті. Водночас воно експериментальне й незавершене: origin trial у Chrome 149, відкритий у червні 2026 року. Стежте за специфікацією. Поки не будуйте навколо цього продакшн-залежності й тримайте це поза планом ресурсів.

Часті запитання

Чи зупиняє robots.txt ШІ-ботів?

Частково, і саме ця точність і є відповіддю. Anthropic повідомляє, що ClaudeBot, Claude-User і Claude-SearchBot дотримуються robots.txt. Автоматичні кролери OpenAI теж його використовують, але OpenAI зазначає, що правила можуть не діяти для ChatGPT-User; Perplexity каже, що Perplexity-User зазвичай ігнорує файл. Безіменні чи підроблені скрапери взагалі перебувають поза межами robots.txt.

Чим llms.txt відрізняється від robots.txt?

Вони розв'язують різні задачі. robots.txt повідомляє кооперативним кролерам, що їм можна завантажувати, і стандартизований IETF. llms.txt — запропонований файл, що пропонує мовним моделям вивірене резюме вашого контенту, без жодної вимоги, щоб хтось його завантажував чи використовував. У вимірюванні Ahrefs за травень 2026 року 97 % опублікованих файлів не отримали жодного запиту. Якщо вам потрібні директиви для кролерів, стандартний механізм — robots.txt; llms.txt необов'язковий і наразі майже не використовується.

Як заблокувати GPTBot на своєму сайті?

Додайте ці два рядки до файлу robots.txt у корені сайту:

User-agent: GPTBot
Disallow: /

Так ваш сайт виходить із автоматичного навчального обходу GPTBot. OAI-SearchBot, який використовується для пошуку в ChatGPT, і ChatGPT-User, що завантажує сторінки за діями користувача, — окремі токени, і їх це не зачіпає.

Чи заблокує блокування навчальних ШІ-кролерів індексацію в Пошуку Google?

Ні, якщо ви користуєтеся правильним важелем. Блокування Google-Extended не відрізає Googlebot від Пошуку. Пастка з'являється, коли ви застосовуєте керування на рівні категорій, що зараховує багатоцільового кролера до Training: Cloudflare, наприклад, класифікує Googlebot, Applebot і Bingbot як таких, що поєднують пошук із навчанням, тож блокування категорії Training там блокує й ці кролерські ідентичності.

Як дізнатися, чи обходять мій сайт ШІ-боти?

Пройдіться grep по журналу доступу в пошуках задокументованих токенів, а тоді перевірте знайдене:

grep -ohE 'GPTBot|ClaudeBot|CCBot|PerplexityBot|OAI-SearchBot|ChatGPT-User' \
  /var/log/nginx/access.log | sort | uniq -c | sort -rn

Підрахунки показують, які заявлені user-agent до вас заходять і як часто. Оскільки рядок можна підробити, перевірте найактивніших за опублікованими постачальником діапазонами IP або його методом зворотного DNS, перш ніж діяти за цими числами.

Поділитися

Обговорення

Коментарі

Увійдіть, щоб долучитися до обговорення.

Більше з блогу

Продовжуйте читати.

Illustration for how AI job risk scores are calculated: a desk computer linked to a gauge of work-task icons and to a timeline of the same tasks
AI та машинне навчання

Як насправді рахують оцінки «ризику втрати роботи через ШІ»

Оцінки ризику для професій через ШІ будуються за різними методиками, від теоретичної вразливості до спостережуваного використання, і жодна не передбачає втрату роботи напряму. Розб

Bruce 10 хв читання
Провідні компанії ШІ-чипів: відеокарта, модуль прискорювача, кремнієва пластина та серверні плати на темно-червоному тлі
AI та машинне навчання

Провідні компанії та виробники ШІ-чипів: альтернативи NVIDIA, які справді постачаються

Провідні компанії ШІ-чипів у порівнянні за реальним доступом: дивіться, які прискорювачі у 2026 році можна орендувати, купити, використати через API або отримати лише через корпора

Jeremy 16 хв читання

Готові розгортати? Від $2,48/міс.

Незалежна хмара з 2008 року. AMD EPYC, NVMe, 40 Gbps. Повернення коштів за 14 днів.