Yapay zekâ tarayıcı trafiğine dair bir Hacker News başlığında, bir hosting yöneticisi yükü işletmeci tarafından şöyle anlattı: ürün varyantı veya kategori sayfalarında düzenli olarak takılıp saniyede kabaca bir istek hızıyla vurmaya başlayan «yaklaşık 6 farklı, epeyce agresif yapay zekâ botu» ve «her sayfa yüklenişinin tam 1 sn gidiş-dönüş sürebildiği (çoğu MySQL'de geçen)» bir site. Aynı yorumdaki birikimli etki: «neredeyse sitenin her gün Slashdot etkisine uğraması gibi».
Sitenizi yapay zekâ ajanlarına hazırlamak her şeyden önce bir kapasite meselesidir; dolayısıyla buradaki işin çoğu sunucu yapılandırması, çok azı içerik stratejisidir. Bu trafiğin işe yarar tarafı, büyük bölümünün anonim olmaması: onu üreten şirketler tarayıcılarının adlarını yayımlıyor, her birinin ne işe yaradığını belgeliyor ve nasıl kapatılacağını söylüyor. Aşağıda neyin yapılandırılacağını, her mekanizmanın pratikte neyi dayattığını ve atlayacağım iki adımı bulacaksınız: bir llms.txt yayımlamak ve yapay zekâ için schema işaretlemesi eklemek.
Özetle
- Yapay zekâ trafiği genellikle eğitim, yapay zekâ aramasına yönelik indeksleme ve kullanıcı tetikli getirmeler olarak ayrılır. OpenAI ve Anthropic bu amaçlar için ayrı belirteçler sunar, dolayısıyla bunları bağımsız denetleyebilirsiniz; bazı çok amaçlı tarayıcılar ise birden fazla rolü tek bir kimlik altında birleştirir.
- OpenAI, Anthropic, Perplexity ve Common Crawl otomatik tarayıcıları için robots.txt denetimlerini belgeliyor. İstisna, kullanıcı tetikli getiriciler: Anthropic robots.txt'yi Claude-User için de uyguluyor, OpenAI kuralların ChatGPT-User için geçerli olmayabileceğini söylüyor, Perplexity-User ise bunları genellikle yok sayıyor.
- robots.txt dosyası bir rıza mekanizmasıdır, erişim denetimi değil. RFC 9309 ona kendine ait bir zorlama gücü vermez; kurallara uyan botlar dosyayı dikkate alarak yükünüzü azaltabilir, ama dosya uymayan trafiği ne kısabilir ne durdurabilir.
- Ahrefs'in analitik müşteri tabanındaki 137.210 alan adı genelinde, yayımlanan llms.txt dosyalarının %97'si Mayıs 2026'da hiç istek almadı. İsterseniz bir tane yayımlayın; ama etrafına araç seti kurmayın.
- Yapılandırılmış veriyi klasik Arama özelliklerini desteklediği yerde tutun; ancak Google'ın belgeleri, yapay zekâ özellikleri için özel bir şema ya da yapay zekâ metin dosyası gerekmediğini söylüyor.
- OpenAI, ClaudeBot, PerplexityBot ya da CCBot'un okumasını istediğiniz kritik içeriği sunucu tarafında oluşturun. Vercel bu tarayıcıların JavaScript çalıştırmadığını tespit etti; Googlebot üzerinden Gemini ve AppleBot istisna.
- İşbirliğine dayalı robots.txt kurallarının ötesindeki zorlama, ters vekil sunucuda, kendi işlettiğiniz bir WAF'ta ya da iş kanıtı temelli bir meydan okumanın ardında yaşar; maliyet sırası da budur.
Bu Makalenin Kapsamadığı Konular
Konumuz ajanların ziyaret ettiği bir site; onlarla işlem yapan bir site değil. Komşu dört başlık kapsam dışı bırakıldı.
- Ajan tabanlı ticaret ve ödeme akışları; farklı türde bir site için farklı bir sorun.
- Eğitim verisi üzerindeki hukuki ve telif tartışması; bu bir iş kararıdır, sunucu yapılandırması değil.
- WebMCP uygulama adımları; çünkü standart hâlâ bir origin trial aşamasında.
- Aşağıdaki tek Cloudflare bölümü dışındaki CDN'e özgü yapılandırmalar.
Sitenize hangi yapay zekâ tarayıcıları yükleniyor
GPTBot ve ClaudeBot, model eğitiminde kullanılabilecek içerik toplar. OAI-SearchBot ve Claude-SearchBot yapay zekâ aramasını ve getirmeyi destekler. ChatGPT-User ile Claude-User ise kullanıcı eylemlerine yanıt olarak sayfa çeker. Bu görevler bazı sağlayıcılarda ayrıdır, ama web'deki her tarayıcı tek bir amaca temiz biçimde oturmaz.
Uyum tablosu, yaygın kestirme anlatının ima ettiğinden daha kesin. Anthropic'in tarayıcı belgeleri ClaudeBot, Claude-User ve Claude-SearchBot'un robots.txt'ye uyduğunu söylüyor. OpenAI'ın bot belgeleri otomatik tarayıcılarının bağımsız denetimler kullandığını, ancak robots.txt kurallarının ChatGPT-User için geçerli olmayabileceğini söylüyor; çünkü bu istekleri bir insan başlatıyor. Perplexity'nin tarayıcı belgeleri benzer bir ayrım yapıyor: PerplexityBot web yöneticisi denetimlerine uyarken Perplexity-User robots.txt'yi genellikle yok sayıyor. Dolayısıyla yapay zekâ botlarının robots.txt'yi yok saydığı yönündeki toptan iddia, dosyaya uyan belgelenmiş tarayıcıları, davranışı sağlayıcıya göre değişen kullanıcı tetikli getiricileri ve kendini hiç tanıtmayan kazıyıcıları aynı torbaya koyuyor.
Aşağıdaki tablo yazıldığı an itibarıyla günceldir. Yeni belirteçler, herhangi bir makalenin izleyebileceğinden daha hızlı ortaya çıkıyor; bu yüzden onu raf ömrü kısa bir başlangıç haritası olarak görün.
| Tarayıcı belirteci | İşletmeci | Ne yapar | robots.txt'ye uyar | Kimlik nasıl doğrulanır |
|---|---|---|---|---|
| GPTBot | OpenAI | Model eğitiminde kullanılabilecek içerik toplar | Evet | openai.com/gptbot.json |
| OAI-SearchBot | OpenAI | Siteleri ChatGPT arama sonuçlarında gösterir | Evet | openai.com/searchbot.json |
| ChatGPT-User | OpenAI | ChatGPT kullanıcı eylemi için bir sayfa çeker | Geçerli olmayabilir | openai.com/chatgpt-user.json |
| OAI-AdsBot | OpenAI | Gönderilen reklamları ve açılış sayfalarını doğrular | Evet | openai.com/adsbot.json |
| ClaudeBot | Anthropic | Model eğitimine katkı sunabilecek içerik toplar | Evet | Ortak liste: claude.com/crawling/bots.json |
| Claude-User | Anthropic | Bir Claude kullanıcısının istediği sayfayı getirir | Evet | Ortak liste: claude.com/crawling/bots.json |
| Claude-SearchBot | Anthropic | Arama kalitesini artırmak için içerik indeksler | Evet | Ortak liste: claude.com/crawling/bots.json |
| PerplexityBot | Perplexity AI | Siteleri indeksler ve Perplexity sonuçlarında bağlantılar; temel model eğitimi için değil | Evet | perplexity.com/perplexitybot.json |
| Perplexity-User | Perplexity AI | Bir kullanıcı sorusunu yanıtlamak için sayfa çeker | Genellikle yok sayar | perplexity.com/perplexity-user.json |
| Google-Extended | Arama dışındaki Gemini eğitimini ve temellendirmesini denetler | Evet | Tarayıcı değil; doğrulanacak bir şey yok | |
| CCBot | Common Crawl | Kamuya açık Common Crawl derlemini oluşturur | Evet | IPv4 için ters DNS; yayımlanan v4/v6 aralıkları |
Yapay zekâ tarayıcıları için robots.txt kuralları yazmak
RFC 9309 robots.txt içindeki kuralların bir erişim yetkilendirmesi biçimi olmadığını söylüyor. IETF sözdizimini, ayrıştırmayı ve önbelleklemeyi Eylül 2022'de standartlaştırdı; ama dosyayı bir zorlama mekanizmasına dönüştürmedi. Pratikte canınızı yakan ayrıntılar sözdiziminin altında yatıyor: dosya UTF-8 kodlu olmalı, ayrıştırıcılar en az 500 kibibayt işlemeli ve yönergeler çeliştiğinde en özgül yol eşleşmesi kazanır. Bir kuralın dosyadaki yeri ise hiçbir şeyi değiştirmez.
Yapay zekâ botlarına yönelik bir robots.txt, zaten sahip olduğunuz dosyayı ve sözdizimini kullanır; değişen tek şey belirteç listesidir. Kuralları niyete göre düzenleyin, sağlayıcı kadrosundan daha uzun ömürlü olsunlar. İtirazınız eğitimeyse, eğitim belirteçlerini engelleyin ve indeksleyicilere dokunmayın:
# Block training, keep AI search indexing
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Tablodaki her adlandırılmış belirtece site genelinde bir vazgeçme sinyali göndermek istiyorsanız, hepsini tek bir kural altında toplayın. Disallow'u on bir kez tekrarlamaya gerek yok:
# Send a site-wide opt-out signal to named AI tokens
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: OAI-AdsBot
User-agent: ClaudeBot
User-agent: Claude-User
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Bu hâlâ evrensel bir engelleme değil. Anthropic robots.txt'yi Claude-User'a uyguluyor, ama OpenAI kuralların ChatGPT-User için geçerli olmayabileceğini söylüyor ve Perplexity-User bunları genellikle yok sayıyor. Bu kullanıcı tetikli getirmelerin caydırılması değil durdurulması gerekiyorsa, o kararı vekil sunucuda ya da WAF'ta uygulayın.
Google-Extended, en sık yanlış anlaşılan belirteçtir ve faturalarınızı arama trafiği ödüyorsa bu ayrım önemlidir. Google'ın tarayıcı belgeleri onu, taranan içeriğin Arama dışında Gemini eğitimi ve temellendirmesi için kullanılıp kullanılamayacağını denetleyen bağımsız bir ürün belirteci olarak tanımlıyor ve bir sitenin Google Arama'daki yer alışını veya sıralamasını etkilemediğini söylüyor. Onu engellemek Googlebot'un Arama davranışına dokunmaz.
Bir belirteç listesini elle güncel tutmak kimsenin öğleden sonrasını harcamaya değmez. Toplulukça bakımı yapılan ai.robots.txt deposu yapay zekâ kullanıcı aracılarını izler ve robots.txt, nginx, Caddy, HAProxy, Lighttpd ile Apache için yapılandırmalar üretir. Apache işletenler, üretilen bloğu diğer dizin düzeyindeki .htaccess kurallarının yanına koyabilir.
Profesyonel İpucu: user-agent dizesine güvenmeyin. O bir başlıktır ve başlıkları taklit etmek bedavadır. Common Crawl'ın CCBot belgeleri bazı tarayıcıların kendini sahte biçimde CCBot olarak tanıttığı konusunda uyarıyor. IPv4 için, ileri yönde doğrulanmış ters DNS ile şu alan altında doğrulayın: *.crawl.commoncrawl.org; IPv6 için Common Crawl'ın yayımladığı IP aralıklarını kullanın, çünkü orada ters DNS şu an desteklenmiyor. Yukarıdaki sağlayıcı sayfaları da diğer adlandırılmış tarayıcılar için güncel IP aralıklarını yayımlıyor. Bu, söz konusu sağlayıcılarda belgelenmiş bir doğrulama yolu; genel olarak yapay zekâ tarayıcılarının bir özelliği değil.
llms.txt bir işe yarıyor mu?
Mevcut kanıtlara bakılırsa neredeyse hiçbir şey. llms.txt, sitenizin kök dizininde bulunması önerilen, dil modellerine içeriğinizin derlenmiş bir özetini sunan düz metin dosyasıdır. Yayımlaması ucuzdur, ama eldeki kanıtlar buna yatırım yapmak için pek sebep vermiyor ve Google'ın belgeleri, yapay zekâ arama özellikleri için buna ihtiyacınız olmadığını söylüyor.
Biçim son derece sade. llms.txt önerisi Eylül 2024'e dayanıyor, şurada duruyor: /llms.txtve zorunlu tek bölüm olarak site ya da proje adını taşıyan bir H1 başlığı bırakıyor.
Hüküm ölçümlerden geliyor. Ahrefs'in 137.210 alan adı üzerindeki çalışması ölçülen alan adlarının %28'inin bir llms.txt dosyası yayımladığını ve bu dosyaların %97'sinin Mayıs 2026'da hiç istek almadığını buldu. Gerçekten gelen isteklerin %19,5'i adı bilinen yapay zekâ araçlarındandı. Ahrefs ayrıca bir dosyanın çekilmesinin, onun gerçekten kullanıldığını kanıtlamadığı uyarısında bulunuyor.
Bu verilerden çıkardığım sonuç şu: llms.txt, kendisi için yazıldığı sistemlerin geniş çapta benimsemediği bir uzlaşıya oynanan bir bahis. Derli toplu kök dizinleri seviyorsanız yayımlayın. Ama etrafına bir üretim hattı kurmayın, dağıtımınızda engelleyici bir adım hâline gelmesine izin vermeyin ve onu sıralama ya da atıf kaldıracı diye satan herkesi kanıtların epey önünde koşuyor sayın.
Temel çıkarım: Ahrefs'in çalışmasında, yayımlanan llms.txt dosyalarının %97'si Mayıs 2026'da hiç istek almadı.
Sayfalarınızı makinelerin okuyabileceği hâle getirmek
Vercel'in tarayıcı ölçümü OpenAI'ın tarayıcılarının, ClaudeBot'un, PerplexityBot'un, Meta-ExternalAgent'ın, Bytespider'ın ve CCBot'un JavaScript çalıştırmadığını buldu. Googlebot üzerinden Gemini ile AppleBot ise çalıştırıyor. Çalıştırmayan tarayıcılar için, yalnızca istemci tarafı hidrasyondan sonra beliren içerik görünmezdir; bu yüzden kritik olan her şeyi sunucuda oluşturun. İşaretleme daha kolay bir soru ve Google'ın bu konudaki kendi yönlendirmesi alışılmadık ölçüde açık:
«Bu özelliklerde görünmek için yeni makine tarafından okunabilir dosyalar, yapay zekâ metin dosyaları veya işaretleme oluşturmanız gerekmez. Eklemeniz gereken özel bir schema.org yapılandırılmış verisi de yoktur.»
SSS şeması lehine kimi zaman alıntılanan %40'lık görünürlük artışı şuradan geliyor: GEO makalesi KDD 2024'e kabul edilen bu makale, %40'a varan kazanımlar bildiriyor; ama test ettiği müdahaleler kaynak gösterme, alıntı, istatistik, teknik terminoloji ve akıcı ifade gibi içerik değişikliklerine odaklanıyor, FAQPage'e ya da başka herhangi bir Schema.org işaretlemesine değil. Rakam doğru; onun şema işaretlemesine iliştirilmesi değil.
Yapılandırılmış veriyi, klasik bir Arama özelliğini desteklediği ve görünen sayfayla örtüştüğü yerde tutun. Google, yapay zekâ özelliklerine uygunluğun sıradan Arama indekslemesinden geçtiğini, ayrı bir işaretleme koşulu olmadığını söylüyor. Sadece, yapay zekâ atıflarını kıpırdattığı gösterilmiş değil.
robots.txt yetmediğinde: sunucuda hız sınırlama ve WAF
Yönergeler, oyuna dahil olmayı seçen botlarda işe yarar. Aynı Hacker News başlığındabaşlıkta birçok işletmeci, bunu yapmayan trafiği anlattı: isteklerini geniş IP blok havuzlarına yayan ve sıradan ziyaretçi gibi görünmek için kullanıcı aracılarını döndüren tarayıcılar; bu da hem naif IP başına limitleri hem de kullanıcı aracısı eşleştirmesini boşa çıkarıyor. Bunu topluluk anlatısı olarak alın; başlıkta kimse ölçüm yayımlamıyordu. Ama tam da robots.txt'nin hiçbir zaman ulaşmak üzere tasarlanmadığı kitleyi tarif ediyor.
O merdivene tırmanmadan önce, hâlâ işbirliği yapan trafik için daha ucuz bir hamle var: yavaşlatın:
User-agent: ClaudeBot
Crawl-delay: 1
Profesyonel İpucu: engellemeden önce hızını kısın. Anthropic'in belgeleri ClaudeBot için Crawl-delay'i destekliyor , böylece ağır ama terbiyeli bir tarayıcıyı yavaşlatıp yine de tutabilirsiniz. Aynı sayfa, IP engellemenin kalıcı bir vazgeçme mekanizması olmadığını söylüyor. Her iki nokta da Anthropic'e özgü; Crawl-delay evrensel bir yönerge değil; bu yüzden önce her sağlayıcının belgelerine bakın.
Bunun ötesindeki her şey, kendi işlettiğiniz bir zorlama; maliyeti ve etkisi artan üç basamak hâlinde. Her basamak bir şey kazandırır, bir şeyden de vazgeçtirir.
Basamak 1: Ters vekil yönergeleri ve hız sınırlama
Yapay zekâ tarayıcılarına hız sınırlaması, ters vekil sunucuda başlar: yığınınızda bir isteği ilk gören ve uygulama ya da veritabanı herhangi bir iş yapmadan önce onu yavaşlatabilen katman. NGINX'in hız sınırlama belgeleri boş anahtarlı isteklerin sayılmadığını belirtiyor; dolayısıyla bir map yalnızca kısmak istediğiniz tarayıcı belirteçlerine bir hız sınırlama anahtarı verebilir; eşleşmeyen istekleri ise şunun dışında bırakır: limit_req_zone.
# /etc/nginx/nginx.conf, inside the http block
map $http_user_agent $ai_rate_key {
default "";
~*GPTBot $binary_remote_addr;
~*OAI-SearchBot $binary_remote_addr;
~*ClaudeBot $binary_remote_addr;
~*Claude-SearchBot $binary_remote_addr;
~*PerplexityBot $binary_remote_addr;
~*CCBot $binary_remote_addr;
}
limit_req_zone $ai_rate_key zone=ai_slowlane:10m rate=20r/m;
# /etc/nginx/sites-available/example.conf, inside the server block
location / {
limit_req zone=ai_slowlane burst=10 nodelay;
proxy_pass http://127.0.0.1:8080;
}
Ayarlamanız gereken çift şudur: burst=10 nodelay: ortalama hızın üzerindeki istekler patlamayı anında tüketebilir, onun da ötesindekiler ise varsayılan olarak şunu alır: 503 Fazla sıkı ayarlarsanız, meşru bir tarayıcıyı taramanın ortasında kapı dışarı edersiniz; bu, bir kesintiden daha yavaş teşhis edilen bir sorundur. Caddy aynı iki fikri bir eşleştirici ve bir işleyiciyle ifade eder; ikisi arasında seçim yapıyorsanız, yan yana konulmuş yapılandırma dosyaları sentetik bir işlem hacmi rakamından daha faydalıdır.
Bu basamağın sınırı, yavaş şeridin hâlâ beyan edilen kullanıcı aracısına bağlı olması. Chrome kılığına girmiş bir kazıyıcı, tarayıcıya özgü bu anahtarı tümüyle atlar; o trafiği yakalamak için IP/yol davranışına dayalı daha geniş bir hız sınırı ya da aşağıdaki WAF basamağı gerekir.
Basamak 2: Kendi işlettiğiniz bir web uygulama güvenlik duvarı
Bir WAF, kararı tek bir başlıktan alıp istek örüntülerini, yolları ve hızları birlikte okuyan bir kural kümesine taşır; trafik kendini tanıtmayı bıraktığında ihtiyacınız olan tam da budur. Onu kendi makinenizde çalıştırmak, kuralları ve günlükleri kendi diskinizde tutar; sabahın üçünde grep'leyebileceğiniz yerde. BunkerWeb bu projelerden biri, SafeLine bir diğeri; ve ana makine projenin mimari ve kaynak gereksinimlerini karşıladığında ikisi de bir VPS üzerinde çalışır. Kurulumdan kurtulmanız için ikisinin de tek tıkla sürümlerini sunuyoruz, gerçi asıl ilginç kısım paketleme değil.
Bu aynı zamanda bu basamağın maliyeti. Kurallar bakım ister ve kararlı bir kazıyıcıyı yakalayacak kadar sıkı ayarlanmış bir kural, er ya da geç bir insanı da yakalar. SafeLine'ın Monitor, Balanced ve Strict modları bu ödünleşimi açıkça ortaya koyar: WAF'ın otomatik olarak 403 yanıtı döndürmesine izin vermeden önce, yanlış pozitifleri bulacak kadar uzun süre trafiği gözlemleyerek başlayın.
Basamak 3: İş kanıtı meydan okumaları
Anubis, kimlik belirleme sorununu tamamen atlar. Meydan okumayı seçtiğiniz trafik için, kaynak sunucu isteği karşılamadan önce ona küçük bir hesaplama maliyeti ödetir. Politika sistemi eşleşme kurallarına göre istekleri ayrıca izin verebilir, reddedebilir veya meydan okumaya tabi tutabilir. Projenin README dosyası onu, kazıyıcı botlardan yukarı akış kaynaklarını korumak için meydan okumalar etrafında kurulmuş bir Web AI Firewall Utility olarak tanımlıyor. Her botun kendini doğru tanıtmasını gerektirmeden çalışır.
Projenin kendi anlatımı bu yaklaşımı nükleer bir yanıt olarak niteliyor ve bu çekince hak edilmiş. Vergiyi, politikanızın meydan okuduğu her tür trafik öder; kurallar fazla genişse buna yavaş cihazlardaki insanlar ya da meşru tarayıcılar da dahil olur. Bu basamağı gerçekten düşmanca trafik için yedekte tutun. Hevesli bir tarayıcı genellikle bir hız sınırı sorunudur, ve hız sınırınız zaten var.
Ani yüke göre boyutlandırma
Tarayıcı yükü çoğu zaman dalgalar hâlinde gelir, ama CPU'yu mu, veritabanını mı, yoksa G/Ç'yi mi zorladığı uygulamaya ve taranan adreslere bağlıdır. Yukarıdaki WordPress örneğinde işletmeci, bir saniyelik sayfa süresinin çoğunu MySQL'e bağladı; yani o özel olay, trafik sorunu kılığında gelen bir veritabanı darboğazıydı.
Bu da boyutlandırmayı bir tahsis meselesine dönüştürüyor, hem de rahatsız edici bir meseleye: pay için sürekli ödeme yaparsınız, ama o pay ancak sizin denetiminizde olmayan bir zirvede hakkını verir. Yine de zirveye göre kaynak ayırın. BunkerWeb, uygulama ve veritabanıyla aynı makineyi paylaşıyorsa, 8 GB'ı tüm yığın için bir tavsiye saymayın. BunkerWeb'in hızlı başlangıç kılavuzu test ortamları veya çok az servisli kurulumlar için 2 vCPU ile 8 GB RAM, çok sayıda servisi koruyan üretim ortamları içinse en az 4 vCPU ile 16 GB RAM öneriyor. Bunun üstüne uygulamanın kendi CPU zirvesini, veritabanı belleğini ve G/Ç payını ekleyin.
Saat hızı yüksek çekirdekler, istek işleme ya da sorgu yürütme CPU'ya bağlıysa işe yarar; daha fazla çekirdek ise aynı anda daha fazla iş yürütmeniz gerektiğinde. Boyutlandırmayı yalnızca tarayıcı trafiğine değil; zirve eşzamanlılığa, p95 yanıt süresine, veritabanı CPU ve G/Ç beklemesine ve önbellek ıskalama oranına göre yapın.
Bu katmanı kendiniz işletmek, altındaki makineden iki şey ister: root erişimi, çünkü yukarıdaki her mekanizma düzenlediğiniz bir yapılandırma dosyası ve yeniden başlattığınız bir servistir; bir de kurallar işini yaparken bir ani yükün siteyi devirmemesine yetecek pay. Bunun için bir makine boyutlandırıyor ya da taşıyorsanız, Linux VPS Linux VPS'imiz bu yığının gerektirdiği root erişimini verir ve uzun vadeli bir boyuta bağlanmadan önce vekil ile WAF kurulumunu denemenizi sağlar.
Root erişimi, NVMe ve AMD EPYC gücüne sahip bir Linux VPS üzerinde geliştir.
Linux Planlarını GörCloudflare'in yapay zekâ trafiği için yeni varsayılanları
Cloudflare, yapay zekâ trafiğini Search, Agent ve Training kategorilerine ayırdı; bunu Temmuz 2026 tarihli yapay zekâ trafiği duyurusunda yaptı. 15 Eylül 2026'dan itibaren Cloudflare'e yeni katılan alan adlarında, reklam gösteren sayfalarda Training ve Agent varsayılan olarak engellenecek, Search ise izinli kalacak. Mevcut müşteriler ayarı önceden değiştirebiliyor ve denetimler tüm planlarda mevcut.
Alınacak ders, Cloudflare'in kendi duyurusunda adını koyduğu karmaşa. Cloudflare'in sınıflandırmasında Googlebot, Applebot ve Bingbot'un her biri Arama işini Eğitim işiyle birleştiriyor; dolayısıyla Training kategorisini engelleyen bir müşteri, korumak istediği arama davranışı dahil o tarayıcıları da engelliyor. Çok amaçlı bir tarayıcıya tek işi varmış gibi davranan her kategori düzeyindeki denetimde aynı tuzak bekliyor.
Siteniz Cloudflare'in arkasında değilse, bunların hiçbiri çekebileceğiniz bir kol değil. Yine de geldiğini bilin; çünkü eylülde trafik desenlerini değiştirecek. Sizin denetimleriniz robots.txt belirteçleri ve yukarıdaki vekil katmanı olmayı sürdürüyor.
WebMCP: İzlemeye değer, üstüne inşa etmeye değil
WebMCP, ajanların tahmin yürütmek yerine yapılandırılmış araçları çağırmak için kullandığı uzlaşı olan Model Context Protocol'ün tarayıcı tarafındaki karşılığıdır. Chrome'un WebMCP origin trial duyurusu hedefi doğrudan ortaya koyuyor: bir ajanın bir düğmenin veya form alanının ne yaptığını tahmin etmesi yerine, site yapılandırılmış işlevleri ve açıklamalı denetimleri sunabilir, ajan da bunları doğrudan çağırabilir.
Ajanlara sitenizde okumanın ötesinde yapacak bir şey vermeye yönelik ilk inandırıcı girişim bu ve onu bu makaledeki en ilginç şey yapan da bu. Aynı zamanda deneysel ve yarım: Haziran 2026'da açılan bir Chrome 149 origin trial. Spesifikasyonu izleyin. Henüz etrafına üretim bağımlılığı kurmayın ve kapasite planınızın dışında tutun.
Sıkça Sorulan Sorular
robots.txt yapay zekâ botlarını durdurur mu?
Kısmen, ve cevabın kendisi bu kesinlikte saklı. Anthropic, ClaudeBot, Claude-User ve Claude-SearchBot'un robots.txt'ye uyduğunu söylüyor. OpenAI'ın otomatik tarayıcıları da onu kullanıyor, ama OpenAI kuralların ChatGPT-User için geçerli olmayabileceğini belirtiyor; Perplexity ise Perplexity-User'ın dosyayı genellikle yok saydığını söylüyor. Adı sanı belirsiz ya da kimliğini taklit eden kazıyıcılar ise tümüyle robots.txt'nin dışında.
llms.txt ile robots.txt arasındaki fark nedir?
Farklı sorunları çözüyorlar. robots.txt, işbirliği yapan tarayıcılara neyi getirebileceklerini söyler ve IETF tarafından standartlaştırılmıştır. llms.txt ise dil modellerine içeriğinizin derlenmiş bir özetini sunmayı öneren bir dosyadır; onu herhangi bir şeyin getirmesi ya da kullanması şart değildir. Ahrefs'in Mayıs 2026 ölçümünde, yayımlanan dosyaların %97'si hiç istek almadı. Tarayıcı yönergeleri istiyorsanız standart mekanizma robots.txt'dir; llms.txt isteğe bağlıdır ve şimdilik pek kullanılmıyor.
GPTBot'u sitemden nasıl engellerim?
Sitenizin kök dizinindeki robots.txt dosyasına şu iki satırı ekleyin:
User-agent: GPTBot
Disallow: /
Bu, sitenizi GPTBot'un otomatik eğitim taramasından çıkarır. ChatGPT aramasında kullanılan OAI-SearchBot ile kullanıcı eylemleri için sayfa çeken ChatGPT-User ayrı belirteçlerdir ve bundan etkilenmezler.
Yapay zekâ eğitim tarayıcılarını engellemek Google Arama indekslemesini de engeller mi?
Doğru denetimi kullanırsanız hayır. Google-Extended'i engellemek Googlebot'u Arama'dan alıkoymaz. Tuzak, çok amaçlı bir tarayıcıyı Training sayan kategori düzeyinde bir denetim kullandığınızda ortaya çıkar: örneğin Cloudflare, Googlebot, Applebot ve Bingbot'u Arama ile Eğitim'i birleştiriyor diye sınıflandırır, dolayısıyla orada Training kategorisini engellemek bu tarayıcı kimliklerini de engeller.
Sitemi yapay zekâ botlarının tarayıp taramadığını nasıl anlarım?
Erişim günlüğünüzde belgelenmiş belirteçleri grep'leyin, sonra bulduklarınızı doğrulayın:
grep -ohE 'GPTBot|ClaudeBot|CCBot|PerplexityBot|OAI-SearchBot|ChatGPT-User' \
/var/log/nginx/access.log | sort | uniq -c | sort -rn
Sayımlar, hangi beyan edilmiş kullanıcı aracılarının ne sıklıkla uğradığını gösterir. Dize taklit edilebildiği için, sayılara göre hareket etmeden önce en yüklü olanları sağlayıcının yayımladığı IP aralıklarına ya da ters DNS yöntemine karşı doğrulayın.
Tartışma
Yorumlar
Tartışmaya katılmak için giriş yapın.