Перейти к основному содержанию
Скидка 50% все планы, ограниченное время. Начиная от $2.48/mo
17 min left
ИИ и машинное обучение

Как подготовить свой self-hosted сайт к ИИ-агентам

S Автор: Samer 17 мин чтения
Multiple labeled AI crawler request streams arriving at a self-hosted web server behind a reverse proxy, where one stream is slowed at the gate instead of blocked outright

В треде на Hacker News о трафике ИИ-краулеров администратор хостинга описал нагрузку со стороны оператора: «около 6 разных довольно агрессивных ИИ-ботов», которые периодически застревают на страницах вариантов товара или категорий и начинают долбить их примерно по одному запросу в секунду, на сайте, где «каждая загрузка страницы может занимать целую секунду туда-обратно (большая часть уходит в MySQL)». Совокупный эффект, из того же комментария: «почти как если бы сайт каждый день попадал под Slashdot-эффект».

Подготовка сайта к ИИ-агентам — прежде всего вопрос ёмкости, поэтому основная часть работы здесь приходится на конфигурацию сервера и почти ничего — на контент-стратегию. Полезное свойство этого трафика в том, что он по большей части не анонимен: компании, которые его генерируют, публикуют имена своих краулеров, документируют назначение каждого и объясняют, как их отключить. Дальше — что настраивать, что каждый механизм действительно обеспечивает и какие два шага я бы пропустил: публикацию llms.txt и добавление schema-разметки ради ИИ.

Кратко (TL;DR)

  • ИИ-трафик обычно делится на обучение, индексацию для ИИ-поиска и запросы, инициированные пользователем. OpenAI и Anthropic предоставляют отдельные токены для этих задач, поэтому управлять ими можно независимо; некоторые многоцелевые краулеры совмещают роли под одним именем.
  • OpenAI, Anthropic, Perplexity и Common Crawl документируют управление через robots.txt для своих автоматических краулеров. Исключение — загрузчики, запускаемые пользователем: Anthropic применяет robots.txt и к Claude-User, OpenAI отмечает, что правила могут не действовать для ChatGPT-User, а Perplexity-User обычно их игнорирует.
  • Файл robots.txt — это механизм согласия, а не контроль доступа. RFC 9309 не даёт ему собственных средств принуждения; соблюдающие его боты могут снизить вашу нагрузку, но остановить или притормозить несоблюдающий трафик он не в силах.
  • Из 137 210 доменов в клиентской базе аналитики Ahrefs 97 % опубликованных файлов llms.txt не получили ни одного запроса в мае 2026 года. Публикуйте его, если хотите, но не стройте вокруг него инструментарий.
  • Оставьте структурированные данные там, где они поддерживают классические функции Поиска, но в документации Google сказано, что для её ИИ-функций не требуется ни особая схема, ни текстовый файл для ИИ.
  • Рендерьте критичный контент на сервере, если хотите, чтобы его прочитали OpenAI, ClaudeBot, PerplexityBot или CCBot. Vercel обнаружил, что эти краулеры не выполняют JavaScript; исключения — Gemini через Googlebot и AppleBot.
  • За пределами кооперативных правил robots.txt принуждение живёт на обратном прокси, в WAF, который вы поднимаете сами, или за challenge с доказательством работы — именно в таком порядке по стоимости.

Чего эта статья не охватывает

Речь идёт о сайте, который посещают агенты, а не о сайте, который совершает с ними транзакции. Четыре смежные темы оставлены в стороне.

  • Агентная коммерция и процессы оформления заказа — другая задача для другого типа сайтов.
  • Юридический спор об авторских правах на обучающие данные — это бизнес-решение, а не настройка сервера.
  • Пошаговое руководство по внедрению WebMCP, поскольку стандарт пока находится на стадии origin trial.
  • Настройка под конкретные CDN, кроме единственного раздела о Cloudflare ниже.

Какие ИИ-краулеры стучатся к вам на сайт

GPTBot и ClaudeBot собирают контент, который может использоваться для обучения моделей. OAI-SearchBot и Claude-SearchBot обслуживают ИИ-поиск и извлечение данных. ChatGPT-User и Claude-User загружают страницы в ответ на действия пользователя. У части вендоров эти задачи разделены, но далеко не каждый краулер в вебе аккуратно ложится в одно назначение.

Картина соблюдения правил точнее, чем подсказывает расхожее упрощение. документация Anthropic по краулерам сообщает, что ClaudeBot, Claude-User и Claude-SearchBot соблюдают robots.txt. документация OpenAI по ботам сообщает, что её автоматические краулеры используют независимые механизмы управления, но правила robots.txt могут не действовать для ChatGPT-User, потому что эти запросы инициирует человек. документация Perplexity по краулерам проводит похожее различие: PerplexityBot следует настройкам вебмастера, а Perplexity-User обычно игнорирует robots.txt. Поэтому огульное утверждение, что ИИ-боты игнорируют robots.txt, смешивает документированные краулеры, которые соблюдают файл, с запускаемыми пользователем загрузчиками, поведение которых зависит от вендора, и со скраперами, которые вообще не представляются.

Таблица ниже актуальна на момент написания. Новые токены появляются быстрее, чем любая статья успевает их отслеживать, так что относитесь к ней как к стартовой карте с коротким сроком годности.

Токен краулераОператорЧто это даётСоблюдает robots.txtКак проверить подлинность
GPTBotOpenAIСобирает контент, который может использоваться для обучения моделейДаopenai.com/gptbot.json
OAI-SearchBotOpenAIПоказывает сайты в результатах поиска ChatGPTДаopenai.com/searchbot.json
ChatGPT-UserOpenAIЗагружает страницу по действию пользователя ChatGPTМожет не действоватьopenai.com/chatgpt-user.json
OAI-AdsBotOpenAIПроверяет отправленные объявления и посадочные страницыДаopenai.com/adsbot.json
ClaudeBotAnthropicСобирает контент, который может участвовать в обучении моделейДаОбщий список на claude.com/crawling/bots.json
Claude-UserAnthropicЗагружает страницу, которую запросил пользователь ClaudeДаОбщий список на claude.com/crawling/bots.json
Claude-SearchBotAnthropicИндексирует контент для повышения качества поискаДаОбщий список на claude.com/crawling/bots.json
PerplexityBotPerplexity AIИндексирует сайты и ссылается на них в результатах Perplexity; не используется для обучения базовых моделейДаperplexity.com/perplexitybot.json
Perplexity-UserPerplexity AIЗагружает страницу, чтобы ответить на вопрос пользователяОбычно игнорируетperplexity.com/perplexity-user.json
Google-ExtendedGoogleУправляет обучением и заземлением Gemini вне ПоискаДаНе краулер; проверять нечего
CCBotCommon CrawlФормирует публичный корпус Common CrawlДаОбратный DNS для IPv4; опубликованные диапазоны v4/v6

Пишем правила robots.txt для ИИ-краулеров

RFC 9309 гласит, что правила в robots.txt не являются формой авторизации доступа. IETF стандартизировал синтаксис, разбор и кэширование в сентябре 2022 года; файл от этого не стал механизмом принуждения. По-настоящему кусаются детали ниже синтаксиса: файл должен быть в кодировке UTF-8, парсеры обязаны обрабатывать не менее 500 кибибайт, а при конфликте директив побеждает наиболее конкретное совпадение пути. Место правила в файле не имеет никакого значения.

robots.txt для ИИ-ботов использует тот же файл и тот же синтаксис, что у вас уже есть; меняется только список токенов. Организуйте правила по намерению, и они переживут смену состава вендоров. Если ваше возражение касается обучения, блокируйте токены обучения и не трогайте индексаторы:

# Block training, keep AI search indexing
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

Если вы хотите отправить сигнал отказа для всего сайта каждому токену из таблицы, объедините их в одно правило. Повторять Disallow одиннадцать раз незачем:

# Send a site-wide opt-out signal to named AI tokens
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: OAI-AdsBot
User-agent: ClaudeBot
User-agent: Claude-User
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Это всё ещё не универсальная блокировка. Anthropic применяет robots.txt к Claude-User, но OpenAI отмечает, что правила могут не действовать для ChatGPT-User, а Perplexity-User обычно их игнорирует. Если эти пользовательские запросы нужно именно остановить, а не просто отговорить, реализуйте это решение на прокси или WAF.

Google-Extended — токен, который понимают неправильно чаще всего, и это различие важно, если поисковый трафик оплачивает ваши счета. документация Google по краулерам описывает его как самостоятельный продуктовый токен, который определяет, можно ли использовать просканированный контент для обучения и заземления Gemini вне Поиска, и указывает, что он не влияет на включение сайта в Google Поиск и его позиции. Блокировка не затрагивает поведение Googlebot в Поиске.

Поддерживать список токенов вручную — не лучший способ провести день. Поддерживаемый сообществом репозиторий ai.robots.txt отслеживает ИИ-агенты и генерирует конфигурации для robots.txt, nginx, Caddy, HAProxy, Lighttpd и Apache. Администраторы Apache могут положить сгенерированный блок рядом со своими остальными правил .htaccess на уровне каталога.

Совет: не доверяйте строке user-agent. Это заголовок, а заголовки подделываются бесплатно. Документация Common Crawl по CCBot предупреждает, что краулеры выдают себя за CCBot. Для IPv4 проверяйте через прямо подтверждённый обратный DNS в зоне *.crawl.commoncrawl.org; для IPv6 используйте опубликованные Common Crawl диапазоны IP, потому что обратный DNS там пока не поддерживается. Страницы вендоров выше также публикуют актуальные диапазоны IP для остальных названных краулеров. Это документированный путь проверки у этих вендоров, а не свойство ИИ-краулеров вообще.

Даёт ли llms.txt хоть что-нибудь?

По имеющимся данным — почти ничего. llms.txt — это предложенный текстовый файл в корне сайта, который предлагает языковым моделям выверенную сводку вашего контента. Опубликовать его дёшево, но нынешние данные дают мало поводов в него вкладываться, а документация Google говорит, что для её ИИ-функций поиска он не нужен.

Формат минимален. Предложение llms.txt датируется сентябрём 2024 года, живёт по адресу /llms.txt, и единственным обязательным разделом делает заголовок H1 с названием сайта или проекта.

Вердикт выносят измерения. Исследование Ahrefs на 137 210 доменах показало, что 28 % измеренных доменов публиковали файл llms.txt и что 97 % этих файлов не получили ни одного запроса в мае 2026 года. Из тех запросов, что всё же пришли, 19,5 % исходили от известных ИИ-инструментов. Ahrefs также предупреждает, что сам факт загрузки не доказывает, что файл действительно использовали.

Мой вывод из этих данных: llms.txt — ставка на соглашение, которое системы, ради которых его придумали, широко не приняли. Публикуйте, если любите аккуратный корень сайта. Но не стройте вокруг него конвейер генерации, не позволяйте ему стать блокирующим шагом в деплое, а всех, кто продаёт его как рычаг ранжирования или цитируемости, считайте изрядно опередившими доказательства.

Главный вывод: в исследовании Ahrefs 97 % опубликованных файлов llms.txt не получили ни одного запроса в мае 2026 года.

Как сделать страницы машиночитаемыми

Измерение краулеров от Vercel показало, что краулеры OpenAI, ClaudeBot, PerplexityBot, Meta-ExternalAgent, Bytespider и CCBot не выполняют JavaScript. Gemini через Googlebot и AppleBot — выполняют. Для нерендерящих краулеров контент, который появляется только после клиентской гидратации, невидим, поэтому всё критичное рендерьте на сервере. С разметкой проще, и собственные рекомендации Google на этот счёт необычно прямолинейны:

«Чтобы появляться в этих функциях, вам не нужно создавать новые машиночитаемые файлы, текстовые файлы для ИИ или разметку. Нет и особых структурированных данных schema.org, которые нужно было бы добавить».

Рекомендации Google Search Central по ИИ

Прирост видимости на 40 %, который иногда приводят в защиту FAQ-схемы, взят из статьи GEO , принятой на KDD 2024. В статье сообщается о приросте до 40 %, но проверенные вмешательства касаются изменений контента: ссылок на источники, цитат, статистики, технической терминологии и гладких формулировок, а не FAQPage или любой другой разметки Schema.org. Цифра верна; её привязка к schema-разметке — нет.

Оставьте структурированные данные там, где они поддерживают классическую функцию Поиска и соответствуют видимой странице. Google говорит, что право на попадание в её ИИ-функции обеспечивается обычной индексацией в Поиске, без отдельных требований к разметке. Просто не показано, что она влияет на цитируемость в ИИ.

Когда robots.txt недостаточно: ограничение частоты и WAF на сервере

Четыре уровня контроля ИИ-краулеров рядом друг с другом: robots.txt работает только на добровольной основе, обратный прокси задаёт частоту запросов, но зависит от заявленной личности, самостоятельно поднятый WAF применяет правила по поведению, путям и частоте, а challenge с доказательством работы заставляет выбранный трафик оплачивать вычислительные затраты; сила принуждения и эксплуатационная стоимость растут слева направо.

Директивы работают с ботами, которые согласились играть по правилам. В том же треде на Hacker Newsнесколько операторов описали трафик, который так не делает: краулеры распределяют запросы по огромным пулам IP-блоков и меняют user-agent, чтобы выглядеть обычными посетителями, что сводит на нет и наивные лимиты по IP, и сопоставление по user-agent. Относитесь к этому как к рассказам сообщества: измерений в треде никто не публиковал. Но это описывает именно ту публику, до которой robots.txt никогда и не был рассчитан достучаться.

Прежде чем лезть по этой лестнице, есть более дешёвый ход для трафика, который пока сотрудничает. Притормозите его:

User-agent: ClaudeBot
Crawl-delay: 1

Совет: сначала притормозите, потом блокируйте. Документация Anthropic поддерживает Crawl-delay для ClaudeBot , так что тяжёлого, но воспитанного краулера можно притормозить и оставить. На той же странице сказано, что блокировка по IP не является устойчивым механизмом отказа. Оба пункта касаются только Anthropic; Crawl-delay не универсальная директива, поэтому сначала сверьтесь с документацией каждого вендора.

Всё, что дальше, — это принуждение, которое вы обеспечиваете сами, в трёх ступенях с растущей стоимостью и эффективностью. Каждая что-то даёт и чем-то жертвует.

Ступень 1: директивы обратного прокси и ограничение частоты

Как решает медленная полоса nginx для краулеров: у входящего запроса проверяется User-Agent; при совпадении с токеном краулера запрос получает ключ ограничения и попадает в зону ai_slowlane с 20 запросами в минуту и всплеском в 10, за пределами которого по умолчанию возвращается 503; если совпадения нет, запрос получает пустой ключ и не учитывается, поэтому скрапер, объявляющий User-Agent Chrome, полностью обходит эту специфичную для краулеров медленную полосу.

Ограничение частоты для ИИ-краулеров начинается на обратном прокси, первом элементе стека, который видит запрос и может притормозить его до того, как приложение или база данных выполнят хоть какую-то работу. Документация NGINX по ограничению частоты утверждает, что запросы с пустым ключом не учитываются, поэтому map может выдавать ключ ограничения только тем токенам краулеров, которые вы хотите притормозить, оставляя несовпавшие запросы за пределами limit_req_zone.

# /etc/nginx/nginx.conf, inside the http block
map $http_user_agent $ai_rate_key {
    default              "";
    ~*GPTBot             $binary_remote_addr;
    ~*OAI-SearchBot      $binary_remote_addr;
    ~*ClaudeBot          $binary_remote_addr;
    ~*Claude-SearchBot   $binary_remote_addr;
    ~*PerplexityBot      $binary_remote_addr;
    ~*CCBot              $binary_remote_addr;
}

limit_req_zone $ai_rate_key zone=ai_slowlane:10m rate=20r/m;

# /etc/nginx/sites-available/example.conf, inside the server block
location / {
    limit_req zone=ai_slowlane burst=10 nodelay;
    proxy_pass http://127.0.0.1:8080;
}

Настраивать нужно пару burst=10 nodelay: запросы сверх средней частоты могут сразу израсходовать всплеск, а те, что идут дальше, получают 503 по умолчанию. Затяните слишком сильно, и вы вышвырнете легитимного краулера посреди обхода, а такую проблему диагностировать дольше, чем полноценный сбой. Caddy выражает те же две идеи через matcher и handler; если выбираете между ними, конфигурационные файлы рядом друг с другом полезнее синтетического показателя пропускной способности.

Ограничение этой ступени в том, что медленная полоса по-прежнему зависит от заявленного user-agent. Скрапер, нарядившийся в Chrome, полностью обходит этот специфичный для краулеров ключ; чтобы поймать такой трафик, нужен более широкий лимит по поведению IP/путей или ступень WAF ниже.

Ступень 2: WAF, который вы держите сами

WAF переносит решение с одного заголовка на набор правил, который читает вместе шаблоны запросов, пути и частоту, а это именно то, что нужно, когда трафик перестаёт представляться. Держа его на своей машине, вы оставляете правила и логи на своём диске, где их можно грепать в три часа ночи. BunkerWeb — один из таких проектов, SafeLine — другой, и оба работают на VPS, если хост соответствует требованиям проекта по архитектуре и ресурсам; мы даём версии обоих в один клик, чтобы избавить вас от установки, хотя упаковка тут не самое интересное.

В этом же и цена ступени. Правила требуют сопровождения, а правило, затянутое достаточно, чтобы поймать упорного скрапера, рано или поздно поймает человека. Режимы SafeLine Monitor, Balanced и Strict делают этот компромисс явным: сначала понаблюдайте за трафиком достаточно долго, чтобы найти ложные срабатывания, и только потом позволяйте WAF автоматически отдавать 403.

Ступень 3: challenge с доказательством работы

Anubis полностью обходит проблему идентификации. Для трафика, который вы решили challenge'ить, он заставляет запрос оплатить небольшие вычислительные затраты, прежде чем origin его обслужит. Его система политик также может пропускать, отклонять или отправлять запросы на challenge по правилам сопоставления. README проекта В README проекта он назван Web AI Firewall Utility, построенным вокруг challenge'ей для защиты вышестоящих ресурсов от ботов-скраперов. Он работает, не требуя, чтобы каждый бот корректно себя называл.

Сам проект называет этот подход ядерным ответом, и оговорка заслуженная. Налог ложится на любой трафик, который ваша политика отправляет на challenge, а это могут быть люди на медленных устройствах или легитимные краулеры, если правила слишком широки. Держите эту ступень в резерве для по-настоящему враждебного трафика. Слишком усердный краулер — обычно задача для ограничения частоты, а лимит у вас уже есть.

Расчёт ресурсов под всплеск

Нагрузка от краулеров часто приходит всплесками, но упирается ли она в CPU, базу данных или ввод-вывод, зависит от приложения и от того, какие URL обходят. В примере с WordPress выше оператор списал большую часть секунды рендера на MySQL, так что тот конкретный инцидент был узким местом базы данных, наряженным в проблему трафика.

Это превращает расчёт ресурсов в вопрос распределения, причём неудобный: за запас вы платите постоянно, а отрабатывает он только во время всплеска, который вы не контролируете. Закладывайте запас всё равно. Если BunkerWeb делит хост с приложением и базой данных, не воспринимайте 8 ГБ как рекомендацию для всего стека. Руководство по быстрому старту BunkerWeb рекомендует 2 vCPU и 8 ГБ ОЗУ для тестов или развёртываний с очень небольшим числом сервисов и не менее 4 vCPU с 16 ГБ ОЗУ для продакшн-окружений, защищающих много сервисов. Сверху добавьте пиковую нагрузку CPU самого приложения, память базы данных и запас по вводу-выводу.

Ядра с более высокой частотой помогают, когда обработка запросов или выполнение SQL упирается в CPU; больше ядер помогает, когда нужно держать больше параллельной работы в полёте. Считайте по пиковой конкурентности, времени отклика p95, загрузке CPU и ожиданию ввода-вывода базы данных и доле промахов кэша, а не по одному лишь трафику краулеров.

Держать этот слой самому — значит требовать от машины под ним двух вещей: root-доступа, ведь каждый механизм выше это конфиг, который вы правите, и сервис, который перезапускаете, и достаточного запаса, чтобы всплеск не уронил сайт, пока правила делают свою работу. Если вы подбираете или переносите машину под это, наш Linux VPS даёт root-доступ, которого требует этот стек, и позволяет протестировать связку прокси и WAF, прежде чем брать размер на долгий срок.

Посмотреть тарифы Linux

Разрабатывайте на Linux VPS с root-доступом, NVMe и мощью AMD EPYC.

Посмотреть тарифы Linux

Новые настройки Cloudflare по умолчанию для ИИ-трафика

Cloudflare разделил ИИ-трафик на категории Search, Agent и Training в своём анонсе о ИИ-трафике от июля 2026 года. С 15 сентября 2026 года у новых доменов, подключающихся к Cloudflare, категории Training и Agent по умолчанию блокируются на страницах с рекламой, а Search остаётся разрешённым. Существующие клиенты могут изменить настройку заранее, и эти элементы управления доступны на всех тарифах.

Взять отсюда стоит ту сложность, которую Cloudflare называет в собственном анонсе. В его классификации Googlebot, Applebot и Bingbot каждый совмещают поисковую работу с обучающей, так что клиент, блокирующий категорию Training, блокирует и этих краулеров, включая то самое поисковое поведение, которое он хотел сохранить. Это та же ловушка, что подстерегает любой контроль на уровне категорий, который обращается с многоцелевым краулером так, будто у него одна задача.

Если ваш сайт не за Cloudflare, ни один из этих рычагов вам недоступен. Но знайте, что это идёт, потому что в сентябре схемы трафика сдвинутся; вашими инструментами остаются токены robots.txt и слой прокси выше.

WebMCP: стоит следить, но не строить под него

WebMCP — это браузерный аналог Model Context Protocol, соглашения, по которому агенты вызывают структурированные инструменты вместо угадывания. Анонс origin trial WebMCP от Chrome Анонс формулирует цель прямо: вместо того чтобы агент угадывал, что делает кнопка или поле формы, сайт может выставить структурированные функции и размеченные элементы управления, которые агент вызовет напрямую.

Это первая заслуживающая доверия попытка дать агентам на вашем сайте занятие помимо чтения, и потому это самое интересное в этой статье. Оно же экспериментальное и незавершённое: origin trial в Chrome 149, открытый в июне 2026 года. Следите за спецификацией. Пока не ставьте на него production-зависимость и не закладывайте в план по ресурсам.

Часто задаваемые вопросы

Останавливает ли robots.txt ИИ-ботов?

Отчасти, и вся суть ответа в точности формулировок. Anthropic сообщает, что ClaudeBot, Claude-User и Claude-SearchBot соблюдают robots.txt. Автоматические краулеры OpenAI тоже его используют, но OpenAI отмечает, что правила могут не действовать для ChatGPT-User; Perplexity говорит, что Perplexity-User обычно игнорирует файл. Безымянные или маскирующиеся скраперы вообще находятся за пределами robots.txt.

Чем llms.txt отличается от robots.txt?

Они решают разные задачи. robots.txt сообщает кооперативным краулерам, что им можно загружать, и стандартизирован IETF. llms.txt — предложенный файл, который предлагает языковым моделям выверенную сводку вашего контента, без всякого требования, чтобы кто-то его загружал или использовал. По замеру Ahrefs за май 2026 года 97 % опубликованных файлов не получили ни одного запроса. Если вам нужны директивы для краулеров, robots.txt — стандартный механизм; llms.txt необязателен и пока используется мало.

Как заблокировать GPTBot на своём сайте?

Добавьте эти две строки в файл robots.txt в корне сайта:

User-agent: GPTBot
Disallow: /

Так ваш сайт выходит из автоматического обучающего обхода GPTBot. OAI-SearchBot, который используется для поиска в ChatGPT, и ChatGPT-User, который загружает страницы по действиям пользователя, — отдельные токены, и их это не затрагивает.

Заблокирует ли блокировка обучающих ИИ-краулеров индексацию в Google Поиске?

Нет, если вы используете правильный рычаг. Блокировка Google-Extended не отрезает Googlebot от Поиска. Ловушка появляется, когда вы пользуетесь контролем на уровне категорий, который относит многоцелевого краулера к Training: Cloudflare, например, классифицирует Googlebot, Applebot и Bingbot как совмещающих поиск с обучением, так что блокировка категории Training там блокирует и эти краулерные личности.

Как понять, что мой сайт обходят ИИ-боты?

Пройдитесь grep по журналу доступа в поисках документированных токенов, а затем проверьте найденное:

grep -ohE 'GPTBot|ClaudeBot|CCBot|PerplexityBot|OAI-SearchBot|ChatGPT-User' \
  /var/log/nginx/access.log | sort | uniq -c | sort -rn

Счётчики показывают, какие заявленные user-agent к вам ходят и как часто. Поскольку строку можно подделать, проверьте самых активных по опубликованным вендором диапазонам IP или его методу обратного DNS, прежде чем действовать по этим числам.

Поделиться

Обсуждение

Комментарии

Войдите, чтобы присоединиться к обсуждению.

Ещё в блоге

Читайте дальше.

Illustration for how AI job risk scores are calculated: a desk computer linked to a gauge of work-task icons and to a timeline of the same tasks
ИИ и машинное обучение

Как на самом деле считают оценки «риска потери работы из-за ИИ»

Оценки риска для профессий из-за ИИ строятся по разным методикам, от теоретической подверженности до наблюдаемого использования, и ни одна напрямую не предсказывает потерю работы.

Bruce 10 мин чтения
Ведущие компании ИИ-чипов: видеокарта, модуль ускорителя, кремниевая пластина и серверные платы на тёмно-красном фоне
ИИ и машинное обучение

Ведущие компании и производители ИИ-чипов: альтернативы NVIDIA, которые реально поставляются

Ведущие компании ИИ-чипов в сравнении по реальному доступу: смотрите, какие ускорители можно арендовать, купить, использовать через API или получить только через корпоративные прод

Jeremy 16 мин чтения

Готовы к развёртыванию? От $2,48/мес.

Независимое облако с 2008 года. AMD EPYC, NVMe, 40 Gbps. Возврат денег в течение 14 дней.