En un hilo de Hacker News sobre el tráfico de rastreadores de IA, un administrador de hosting describió la carga desde el lado del operador: «unos 6 bots de IA bastante agresivos» que cada cierto tiempo se atascan en páginas de variantes de producto o de categoría y empiezan a golpearlas a razón de aproximadamente una petición por segundo, en un sitio donde «cada carga de página puede tardar un segundo completo de ida y vuelta (la mayor parte en MySQL)». El efecto acumulado, en el mismo comentario: «casi como si al sitio le hicieran un Slashdot todos los días».
Preparar tu sitio para los agentes de IA es antes que nada un problema de capacidad, así que casi todo el trabajo es configuración de servidor y muy poco es estrategia de contenido. Lo útil de este tráfico es que en su mayoría no es anónimo: las empresas que lo generan publican los nombres de sus rastreadores, documentan para qué sirve cada uno y explican cómo desactivarlos. Lo que sigue es qué configurar, qué impone cada mecanismo en la práctica y los dos pasos que yo me saltaría: publicar un llms.txt y añadir marcado schema para IA.
TL;DR
- El tráfico de IA suele dividirse en entrenamiento, indexación para búsqueda con IA y peticiones iniciadas por el usuario. OpenAI y Anthropic exponen tokens distintos para cada propósito, así que puedes controlarlos por separado; algunos rastreadores polivalentes combinan varios roles bajo una sola identidad.
- OpenAI, Anthropic, Perplexity y Common Crawl documentan controles de robots.txt para sus rastreadores automáticos. Los recuperadores activados por el usuario son la excepción: Anthropic aplica robots.txt también a Claude-User, OpenAI dice que las reglas pueden no aplicarse a ChatGPT-User y Perplexity-User suele ignorarlas.
- El archivo robots.txt es un mecanismo de consentimiento, no un control de acceso. RFC 9309 no le da capacidad de aplicación propia; los bots que lo respetan pueden reducir tu carga, pero el archivo no puede frenar ni detener el tráfico que no lo respeta.
- En 137.210 dominios de la base de clientes de analítica de Ahrefs, el 97 % de los archivos llms.txt publicados no recibió ninguna petición en mayo de 2026. Publica uno si quieres, pero no montes herramientas a su alrededor.
- Mantén los datos estructurados donde dan soporte a funciones clásicas de la Búsqueda, pero la documentación de Google dice que sus funciones de IA no requieren ningún esquema especial ni archivo de texto para IA.
- Renderiza en el servidor el contenido crítico si quieres que OpenAI, ClaudeBot, PerplexityBot o CCBot lo lean. Vercel comprobó que esos rastreadores no ejecutan JavaScript; Gemini a través de Googlebot y AppleBot son las excepciones.
- Más allá de las reglas cooperativas de robots.txt, la aplicación real vive en el proxy inverso, en un WAF que gestionas tú mismo o detrás de un desafío de prueba de trabajo, en ese orden de coste.
Lo que este artículo no cubre
Esto trata de un sitio visitado por agentes, no de un sitio que hace transacciones con ellos. Se dejan de lado cuatro temas colindantes.
- El comercio agéntico y los flujos de pago, un problema distinto para otro tipo de sitio.
- El debate legal y de derechos de autor sobre los datos de entrenamiento, que es una decisión de negocio y no una configuración de servidor.
- Un tutorial de implementación de WebMCP, ya que el estándar sigue siendo una prueba de origen.
- La configuración específica de cada CDN, más allá de la única sección de Cloudflare que aparece abajo.
Qué rastreadores de IA están golpeando tu sitio
GPTBot y ClaudeBot recopilan contenido que puede usarse para entrenar modelos. OAI-SearchBot y Claude-SearchBot dan soporte a la búsqueda y recuperación con IA. ChatGPT-User y Claude-User van a buscar páginas como respuesta a acciones del usuario. Esos cometidos están separados en algunos proveedores, pero no todos los rastreadores de la web encajan limpiamente en un solo propósito.
El panorama del cumplimiento es más preciso de lo que sugiere el atajo habitual. la documentación de rastreadores de Anthropic dice que ClaudeBot, Claude-User y Claude-SearchBot respetan robots.txt. la documentación de bots de OpenAI dice que sus rastreadores automáticos usan controles independientes, pero que las reglas de robots.txt pueden no aplicarse a ChatGPT-User porque esas peticiones las inicia una persona. la documentación de rastreadores de Perplexity hace una distinción parecida: PerplexityBot sigue los controles del webmaster, mientras que Perplexity-User suele ignorar robots.txt. Así que la afirmación general de que los bots de IA ignoran robots.txt mezcla rastreadores documentados que respetan el archivo con recuperadores activados por el usuario cuyo comportamiento varía según el proveedor, además de scrapers que nunca se identifican.
La tabla siguiente está actualizada al momento de escribir. Aparecen tokens nuevos más rápido de lo que cualquier artículo puede seguir, así que tómala como un mapa inicial con poca vida útil.
| Token del rastreador | Operador | Qué hace | Respeta robots.txt | Cómo verificar la identidad |
|---|---|---|---|---|
| GPTBot | OpenAI | Recopila contenido que puede usarse para entrenar modelos | Sí | openai.com/gptbot.json |
| OAI-SearchBot | OpenAI | Muestra sitios en los resultados de búsqueda de ChatGPT | Sí | openai.com/searchbot.json |
| ChatGPT-User | OpenAI | Recupera una página a raíz de una acción del usuario de ChatGPT | Puede no aplicarse | openai.com/chatgpt-user.json |
| OAI-AdsBot | OpenAI | Valida los anuncios y páginas de destino enviados | Sí | openai.com/adsbot.json |
| ClaudeBot | Anthropic | Recopila contenido que puede contribuir al entrenamiento de modelos | Sí | Lista compartida en claude.com/crawling/bots.json |
| Claude-User | Anthropic | Recupera una página que pide un usuario de Claude | Sí | Lista compartida en claude.com/crawling/bots.json |
| Claude-SearchBot | Anthropic | Indexa contenido para mejorar la calidad de la búsqueda | Sí | Lista compartida en claude.com/crawling/bots.json |
| PerplexityBot | Perplexity AI | Indexa y enlaza sitios en los resultados de Perplexity; no sirve para entrenar modelos fundacionales | Sí | perplexity.com/perplexitybot.json |
| Perplexity-User | Perplexity AI | Recupera una página para responder a la pregunta de un usuario | Suele ignorarlo | perplexity.com/perplexity-user.json |
| Google-Extended | Controla el entrenamiento y el anclaje de Gemini fuera de la Búsqueda | Sí | No es un rastreador; nada que verificar | |
| CCBot | Common Crawl | Construye el corpus público de Common Crawl | Sí | DNS inverso para IPv4; rangos v4/v6 publicados |
Escribir reglas de robots.txt para rastreadores de IA
RFC 9309 dice que las reglas de robots.txt no son una forma de autorización de acceso. El IETF estandarizó la sintaxis, el análisis y el almacenamiento en caché en septiembre de 2022; no convirtió el archivo en un mecanismo de aplicación. Los detalles que muerden en la práctica están por debajo de la sintaxis: el archivo debe estar codificado en UTF-8, los analizadores deben procesar al menos 500 kibibytes y, cuando las directivas entran en conflicto, gana la coincidencia de ruta más específica. El lugar que ocupa una regla en el archivo no influye en nada.
Un robots.txt para bots de IA usa el mismo archivo y la misma sintaxis que ya tienes; lo que cambia es la lista de tokens. Organiza las reglas por intención y sobrevivirán al reparto de proveedores. Si tu objeción es el entrenamiento, bloquea los tokens de entrenamiento y deja en paz a los indexadores:
# Block training, keep AI search indexing
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Si quieres enviar una señal de exclusión para todo el sitio a cada token nombrado en la tabla, agrúpalos bajo una sola regla. No hace falta repetir el Disallow once veces:
# Send a site-wide opt-out signal to named AI tokens
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: OAI-AdsBot
User-agent: ClaudeBot
User-agent: Claude-User
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Eso sigue sin ser un bloqueo universal. Anthropic aplica robots.txt a Claude-User, pero OpenAI dice que las reglas pueden no aplicarse a ChatGPT-User, y Perplexity-User suele ignorarlas. Si esas peticiones activadas por el usuario hay que detenerlas y no solo desalentarlas, aplica esa decisión en el proxy o en el WAF.
Google-Extended es el token que peor se entiende, y la distinción importa si el tráfico de búsqueda paga tus facturas. la documentación de rastreadores de Google lo describe como un token de producto independiente que controla si el contenido rastreado puede usarse para el entrenamiento y el anclaje de Gemini fuera de la Búsqueda, y dice que no afecta a la inclusión ni a la posición de un sitio en la Búsqueda de Google. Bloquearlo no toca el comportamiento de Googlebot en la Búsqueda.
Mantener a mano una lista de tokens actualizada no es el mejor uso de la tarde de nadie. El repositorio comunitario ai.robots.txt sigue la pista de los user agents de IA y genera configuraciones para robots.txt, nginx, Caddy, HAProxy, Lighttpd y Apache. Quienes usan Apache pueden dejar el bloque generado junto a sus otras reglas .htaccess a nivel de directorio.
Consejo pro: no te fíes de la cadena user-agent. Es una cabecera, y falsificar cabeceras no cuesta nada. La documentación de CCBot de Common Crawl advierte de que hay rastreadores que se identifican falsamente como CCBot. Para IPv4, verifica con DNS inverso confirmado en ambos sentidos bajo *.crawl.commoncrawl.org; para IPv6, usa los rangos de IP publicados por Common Crawl, porque allí el DNS inverso todavía no está soportado. Las páginas de proveedor citadas arriba también publican los rangos de IP actuales de los demás rastreadores nombrados. Esa es una vía de verificación documentada para estos proveedores, no una propiedad de los rastreadores de IA en general.
¿Sirve de algo llms.txt?
Con la evidencia actual, casi nada. llms.txt es un archivo de texto propuesto en la raíz de tu sitio que ofrece a los modelos de lenguaje un resumen curado de tu contenido. Publicarlo sale barato, pero la evidencia actual te da pocas razones para invertir en él, y la documentación de Google dice que no lo necesitas para sus funciones de Búsqueda con IA.
El formato es mínimo. La propuesta de llms.txt data de septiembre de 2024, vive en /llms.txt, y convierte un H1 con el nombre del sitio o del proyecto en la única sección obligatoria.
El veredicto viene de las mediciones. El estudio de Ahrefs sobre 137.210 dominios encontró que el 28 % de los dominios medidos publicaba un archivo llms.txt y que el 97 % de esos archivos no recibió ninguna petición en mayo de 2026. De las peticiones que sí llegaron, el 19,5 % venía de herramientas de IA identificadas. Ahrefs también advierte de que una descarga no demuestra que el archivo se usara realmente.
Mi lectura de esos datos es que llms.txt es una apuesta por una convención que los sistemas para los que se escribió no han adoptado de forma amplia. Publícalo si te gustan las raíces ordenadas. Pero no montes una cadena de generación a su alrededor, no dejes que se convierta en un paso bloqueante de tu despliegue, y a quien te lo venda como palanca de posicionamiento o de citación considéralo bastante por delante de la evidencia.
Conclusión clave: en el estudio de Ahrefs, el 97 % de los archivos llms.txt publicados no recibió ninguna petición en mayo de 2026.
Cómo hacer que tus páginas sean legibles por máquinas
La medición de rastreadores de Vercel encontró que los rastreadores de OpenAI, ClaudeBot, PerplexityBot, Meta-ExternalAgent, Bytespider y CCBot no ejecutan JavaScript. Gemini a través de Googlebot y AppleBot sí lo hacen. Para los rastreadores que no renderizan, el contenido que solo aparece tras la hidratación en el cliente es invisible, así que renderiza en el servidor todo lo crítico. El marcado es la pregunta más fácil, y la propia guía de Google al respecto es inusualmente directa:
«No necesitas crear nuevos archivos legibles por máquinas, archivos de texto para IA ni marcado para aparecer en estas funciones. Tampoco hay datos estructurados de schema.org especiales que debas añadir».
El aumento de visibilidad del 40 % que a veces se cita en apoyo del esquema FAQ viene del artículo GEO , aceptado en KDD 2024. El artículo reporta mejoras de hasta el 40 %, pero las intervenciones que probó se centran en cambios de contenido como citas, citas textuales, estadísticas, terminología técnica y redacción fluida, no en FAQPage ni en ningún otro marcado de Schema.org. La cifra es correcta; su vinculación con el marcado schema no lo es.
Mantén los datos estructurados donde dan soporte a una función clásica de la Búsqueda y coinciden con la página visible. Google dice que la elegibilidad para sus funciones de IA pasa por la indexación normal de la Búsqueda, sin requisito de marcado aparte. Simplemente, no se ha demostrado que muevan la citación por parte de la IA.
Cuando robots.txt no basta: limitación de tasa y WAF en el servidor
Las directivas funcionan con los bots que se han apuntado. En el mismo hilo de Hacker News, varios operadores describieron el tráfico que no lo hace: rastreadores que reparten sus peticiones entre grandes bolsas de bloques de IP y rotan user agents para parecer visitantes normales, lo que derrota por igual a los límites ingenuos por IP y a la coincidencia por user agent. Tómalo como testimonio de la comunidad; nadie en el hilo publicaba mediciones. Pero describe justo a la población que robots.txt nunca estuvo pensado para alcanzar.
Antes de subir por esa escalera, hay una jugada más barata para el tráfico que todavía coopera. Ralentízalo:
User-agent: ClaudeBot
Crawl-delay: 1
Consejo pro: limita antes de bloquear. La documentación de Anthropic admite Crawl-delay para ClaudeBot , así que puedes ralentizar a un rastreador pesado pero bien educado y conservarlo. La misma página dice que el bloqueo por IP no es un mecanismo de exclusión persistente. Ambos puntos son específicos de Anthropic; Crawl-delay no es una directiva universal, así que consulta primero la documentación de cada proveedor.
Todo lo que viene después es aplicación que gestionas tú, en tres peldaños de coste y eficacia crecientes. Cada uno compra algo y renuncia a algo.
Peldaño 1: directivas de proxy inverso y limitación de tasa
La limitación de tasa para rastreadores de IA empieza en el proxy inverso, lo primero de tu pila que ve una petición y puede frenarla antes de que la aplicación o la base de datos hagan trabajo alguno. La documentación de NGINX sobre limitación de tasa afirma que las peticiones con clave vacía no se contabilizan, así que un map puede dar una clave de limitación solo a los tokens de rastreadores que quieres frenar, dejando las peticiones que no coinciden fuera de limit_req_zone.
# /etc/nginx/nginx.conf, inside the http block
map $http_user_agent $ai_rate_key {
default "";
~*GPTBot $binary_remote_addr;
~*OAI-SearchBot $binary_remote_addr;
~*ClaudeBot $binary_remote_addr;
~*Claude-SearchBot $binary_remote_addr;
~*PerplexityBot $binary_remote_addr;
~*CCBot $binary_remote_addr;
}
limit_req_zone $ai_rate_key zone=ai_slowlane:10m rate=20r/m;
# /etc/nginx/sites-available/example.conf, inside the server block
location / {
limit_req zone=ai_slowlane burst=10 nodelay;
proxy_pass http://127.0.0.1:8080;
}
El par que hay que ajustar es burst=10 nodelay: las peticiones por encima de la tasa media pueden consumir la ráfaga de inmediato, y las que la superan reciben un 503 por defecto. Ajústalo demasiado y rebotarás a un rastreador legítimo a mitad del recorrido, un problema más lento de diagnosticar que una caída. Caddy expresa las mismas dos ideas con un matcher y un handler; si dudas entre ambos, los archivos de configuración comparados lado a lado son más útiles que una cifra de rendimiento sintética.
La limitación de este peldaño es que el carril lento sigue dependiendo del user agent declarado. Un scraper disfrazado de Chrome se salta por completo esta clave específica de rastreadores; atrapar ese tráfico exige una limitación más amplia basada en el comportamiento por IP/ruta, o el peldaño del WAF que viene a continuación.
Peldaño 2: un firewall de aplicaciones web que gestionas tú
Un WAF traslada la decisión de una sola cabecera a un conjunto de reglas que lee a la vez patrones de petición, rutas y tasas, que es justo lo que necesitas cuando el tráfico deja de anunciarse. Ejecutarlo en tu propia máquina mantiene las reglas y los registros en tu disco, donde puedes hacerles grep a las tres de la madrugada. BunkerWeb es uno de esos proyectos, SafeLine es otro, y ambos funcionan en un VPS siempre que la máquina cumpla los requisitos de arquitectura y recursos del proyecto; ofrecemos versiones de un clic de los dos para ahorrarte la instalación, aunque el empaquetado no es lo interesante.
Ese es también el coste del peldaño. Las reglas requieren mantenimiento, y una regla lo bastante ajustada para atrapar a un scraper decidido acabará atrapando a una persona. Los modos Monitor, Balanced y Strict de SafeLine hacen explícito ese compromiso: empieza observando el tráfico el tiempo suficiente para encontrar falsos positivos antes de dejar que el WAF devuelva respuestas 403 automáticamente.
Peldaño 3: desafíos de prueba de trabajo
Anubis se salta por completo el problema de la identificación. Para el tráfico que decides desafiar, hace que la petición pague un pequeño coste de cómputo antes de que el origen la sirva. Su sistema de políticas también puede permitir, denegar o desafiar peticiones según reglas de coincidencia. El README del proyecto lo llama una utilidad de firewall web contra IA, construida alrededor de desafíos para proteger los recursos de origen frente a bots scrapers. Funciona sin exigir que cada bot se identifique correctamente.
El propio proyecto describe el enfoque como una respuesta nuclear, y la cautela está justificada. El impuesto recae sobre todo el tráfico que tu política desafía, lo que puede incluir a personas con dispositivos lentos o a rastreadores legítimos si las reglas son demasiado amplias. Guarda este peldaño en reserva para tráfico genuinamente hostil. Un rastreador entusiasta suele ser un problema de limitación de tasa, y la limitación ya la tienes.
Dimensionar para la ráfaga
La carga de rastreo suele llegar a ráfagas, pero si pesa más en CPU, en base de datos o en E/S depende de la aplicación y de las URL que se rastrean. En el ejemplo de WordPress de más arriba, el operador atribuyó a MySQL casi todo el segundo de carga de página, así que aquel incidente concreto era un cuello de botella de base de datos disfrazado de problema de tráfico.
Eso convierte el dimensionamiento en una cuestión de asignación, y bastante incómoda: pagas el margen de forma continua y solo se gana el sueldo durante un pico que no controlas. Aun así, provisiona para el pico. Si BunkerWeb comparte máquina con la aplicación y la base de datos, no tomes los 8 GB como recomendación para toda la pila. La guía de inicio rápido de BunkerWeb recomienda 2 vCPU y 8 GB de RAM para pruebas o despliegues con muy pocos servicios, y al menos 4 vCPU con 16 GB de RAM para entornos de producción que protegen muchos servicios. Suma encima el pico de CPU de la propia aplicación, la memoria de la base de datos y el margen de E/S.
Los núcleos de mayor frecuencia ayudan cuando el manejo de peticiones o la ejecución de consultas está limitado por CPU; más núcleos ayudan cuando necesitas más trabajo concurrente en vuelo. Dimensiona a partir de la concurrencia pico, el tiempo de respuesta p95, la CPU y la espera de E/S de la base de datos, y la tasa de fallos de caché, y no solo del tráfico de rastreo.
Ejecutar esa capa tú mismo le pide dos cosas a la máquina de debajo: acceso root, ya que cada mecanismo de arriba es un archivo de configuración que editas y un servicio que reinicias, y margen suficiente para que una ráfaga no tumbe el sitio mientras las reglas hacen su trabajo. Si estás dimensionando o mudando una máquina para esto, nuestro Linux VPS te da el acceso root que exige esta pila y te deja probar la configuración de proxy y WAF antes de comprometerte con un tamaño a largo plazo.
Construye sobre un VPS Linux con acceso root, NVMe y la potencia de AMD EPYC.
Ver planes LinuxLos nuevos valores por defecto de Cloudflare para el tráfico de IA
Cloudflare dividió el tráfico de IA en las categorías Search, Agent y Training en su anuncio de julio de 2026 sobre el tráfico de IA. A partir del 15 de septiembre de 2026, los dominios nuevos que se incorporen a Cloudflare tendrán Training y Agent bloqueados por defecto en las páginas que muestran anuncios, mientras que Search sigue permitido. Los clientes actuales pueden cambiar el ajuste antes de esa fecha, y los controles están disponibles en todos los planes.
Lo que conviene tomar prestado es la complicación que la propia Cloudflare menciona en su anuncio. En su clasificación, Googlebot, Applebot y Bingbot combinan cada uno el trabajo de búsqueda con el de entrenamiento, así que quien bloquea la categoría Training bloquea también a esos rastreadores, incluido el comportamiento de búsqueda que quería conservar. Es la misma trampa que acecha en cualquier control por categorías que trate a un rastreador polivalente como si tuviera un solo cometido.
Si tu sitio no está detrás de Cloudflare, nada de esto es una palanca que puedas accionar. Ten presente que llega, porque moverá los patrones de tráfico en septiembre; tus controles siguen siendo los tokens de robots.txt y la capa de proxy de más arriba.
WebMCP: vale la pena vigilarlo, no construir para él
WebMCP es la contraparte, del lado del navegador, del Model Context Protocol, la convención que usan los agentes para llamar a herramientas estructuradas en vez de adivinar. El anuncio de la prueba de origen de WebMCP de Chrome plantea el objetivo sin rodeos: en lugar de que un agente adivine qué hace un botón o un campo de formulario, un sitio puede exponer funciones estructuradas y controles anotados que el agente puede invocar directamente.
Es el primer intento creíble de dar a los agentes algo que hacer en tu sitio más allá de leerlo, y eso lo convierte en lo más interesante de este artículo. También es experimental e inacabado: una prueba de origen en Chrome 149 que se abrió en junio de 2026. Vigila la especificación. No despliegues todavía una dependencia de producción a su alrededor, y déjalo fuera de tu plan de capacidad.
Preguntas frecuentes
¿Detiene robots.txt a los bots de IA?
En parte, y la precisión es la respuesta. Anthropic dice que ClaudeBot, Claude-User y Claude-SearchBot respetan robots.txt. Los rastreadores automáticos de OpenAI también lo usan, pero OpenAI advierte de que las reglas pueden no aplicarse a ChatGPT-User; Perplexity dice que Perplexity-User suele ignorar el archivo. Los scrapers anónimos o suplantadores quedan por completo fuera del alcance de robots.txt.
¿Qué diferencia hay entre llms.txt y robots.txt?
Resuelven problemas distintos. robots.txt dice a los rastreadores cooperativos qué pueden descargar y está estandarizado por el IETF. llms.txt es un archivo propuesto que ofrece a los modelos de lenguaje un resumen curado de tu contenido, sin exigencia alguna de que nada lo descargue ni lo use. En la medición de Ahrefs de mayo de 2026, el 97 % de los archivos publicados no recibió ninguna petición. Si quieres directivas para rastreadores, robots.txt es el mecanismo estándar; llms.txt es opcional y por ahora se usa poco.
¿Cómo bloqueo GPTBot en mi sitio web?
Añade estas dos líneas al archivo robots.txt en la raíz de tu sitio:
User-agent: GPTBot
Disallow: /
Con eso tu sitio queda fuera del rastreo automático de entrenamiento de GPTBot. OAI-SearchBot, que se usa para la búsqueda de ChatGPT, y ChatGPT-User, que recupera páginas por acciones del usuario, son tokens distintos y no se ven afectados.
¿Bloquear los rastreadores de entrenamiento de IA bloquea también la indexación en la Búsqueda de Google?
No, si usas el control adecuado. Bloquear Google-Extended no impide que Googlebot alimente la Búsqueda. La trampa aparece cuando usas un control por categorías que trata a un rastreador polivalente como Training: Cloudflare, por ejemplo, clasifica a Googlebot, Applebot y Bingbot como combinación de búsqueda y entrenamiento, así que bloquear allí la categoría Training bloquea también esas identidades de rastreador.
¿Cómo sé si hay bots de IA rastreando mi sitio?
Haz grep en tu registro de accesos buscando los tokens documentados y luego verifica lo que encuentres:
grep -ohE 'GPTBot|ClaudeBot|CCBot|PerplexityBot|OAI-SearchBot|ChatGPT-User' \
/var/log/nginx/access.log | sort | uniq -c | sort -rn
Los recuentos muestran qué user agents declarados te visitan y con qué frecuencia. Como la cadena puede falsificarse, verifica a los que más pegan contra los rangos de IP publicados por el proveedor o su método de DNS inverso antes de actuar según esas cifras.
Debate
Comentarios
Inicia sesión para unirte al debate.