Lewati ke konten utama
diskon 50% semua paket, waktu terbatas. Mulai dari $2.48/mo
17 min left
AI dan Machine Learning

Cara menyiapkan situs swakelola Anda untuk agen AI

S Oleh Samer 17 menit baca
Multiple labeled AI crawler request streams arriving at a self-hosted web server behind a reverse proxy, where one stream is slowed at the gate instead of blocked outright

Dalam sebuah utas Hacker News tentang trafik perayap AI, seorang admin hosting menggambarkan bebannya dari sisi operator: "sekitar 6 bot AI yang cukup agresif" yang secara berkala tersangkut di halaman varian produk atau kategori lalu mulai menghantamnya dengan laju kira-kira satu permintaan per detik, pada situs yang "setiap pemuatan halamannya bisa memakan satu detik penuh bolak-balik (sebagian besar dihabiskan di MySQL)". Efek kumulatifnya, dalam komentar yang sama: "nyaris seperti situs terkena efek Slashdot setiap hari".

Menyiapkan situs Anda untuk agen AI pertama-tama adalah persoalan kapasitas, sehingga sebagian besar pekerjaannya berupa konfigurasi server dan sangat sedikit yang berupa strategi konten. Sifat yang berguna dari trafik ini adalah sebagian besarnya tidak anonim: perusahaan yang menghasilkannya menerbitkan nama perayap mereka, mendokumentasikan kegunaan masing-masing, dan memberi tahu cara mematikannya. Berikut ini adalah apa yang perlu dikonfigurasi, apa yang benar-benar ditegakkan setiap mekanisme, dan dua langkah yang akan saya lewati: menerbitkan llms.txt dan menambahkan markup schema untuk AI.

TL;DR

  • Trafik AI umumnya terbagi menjadi pelatihan, pengindeksan untuk pencarian AI, dan pengambilan yang dipicu pengguna. OpenAI dan Anthropic menyediakan token terpisah untuk tujuan-tujuan itu, sehingga Anda bisa mengendalikannya secara mandiri; sebagian perayap serbaguna menggabungkan beberapa peran dalam satu identitas.
  • OpenAI, Anthropic, Perplexity, dan Common Crawl mendokumentasikan kontrol robots.txt untuk perayap otomatis mereka. Pengecualiannya adalah pengambil yang dipicu pengguna: Anthropic menerapkan robots.txt pada Claude-User juga, OpenAI menyatakan aturannya mungkin tidak berlaku bagi ChatGPT-User, dan Perplexity-User umumnya mengabaikannya.
  • Berkas robots.txt adalah mekanisme persetujuan, bukan kontrol akses. RFC 9309 tidak memberinya daya paksa apa pun; bot yang patuh bisa menurunkan beban Anda dengan menghormatinya, tetapi berkas itu tidak bisa mengekang atau menghentikan trafik yang tidak patuh.
  • Di antara 137.210 domain dalam basis pelanggan analitik Ahrefs, 97% berkas llms.txt yang diterbitkan tidak menerima satu pun permintaan pada Mei 2026. Terbitkan satu kalau Anda mau, tetapi jangan bangun perkakas di sekitarnya.
  • Pertahankan data terstruktur di tempat ia menopang fitur Penelusuran klasik, tetapi dokumentasi Google menyatakan bahwa fitur AI-nya tidak memerlukan skema khusus maupun berkas teks untuk AI.
  • Render konten penting di sisi server jika Anda ingin OpenAI, ClaudeBot, PerplexityBot, atau CCBot membacanya. Vercel menemukan bahwa perayap-perayap itu tidak menjalankan JavaScript; Gemini lewat Googlebot dan AppleBot adalah pengecualian.
  • Penegakan di luar aturan kooperatif robots.txt berada di reverse proxy, di WAF yang Anda jalankan sendiri, atau di balik tantangan proof-of-work, dalam urutan biaya seperti itu.

Apa yang Tidak Dibahas Artikel Ini

Ini tentang situs yang dikunjungi agen, bukan situs yang bertransaksi dengan mereka. Empat topik bersebelahan sengaja tidak dibahas.

  • Perdagangan berbasis agen dan alur checkout, persoalan berbeda untuk jenis situs yang berbeda.
  • Perdebatan hukum dan hak cipta soal data pelatihan, yang merupakan keputusan bisnis, bukan konfigurasi server.
  • Panduan langkah demi langkah implementasi WebMCP, karena standarnya masih berstatus origin trial.
  • Konfigurasi khusus CDN di luar satu bagian Cloudflare di bawah ini.

Perayap AI mana yang sedang menghantam situs Anda

GPTBot dan ClaudeBot mengumpulkan konten yang mungkin dipakai untuk melatih model. OAI-SearchBot dan Claude-SearchBot mendukung pencarian dan pengambilan berbasis AI. ChatGPT-User dan Claude-User mengambil halaman sebagai respons atas tindakan pengguna. Tugas-tugas itu terpisah pada sebagian vendor, tetapi tidak setiap perayap di web bisa dipetakan rapi ke satu tujuan.

Gambaran kepatuhannya lebih presisi daripada yang disiratkan ungkapan singkat yang beredar. dokumentasi perayap Anthropic menyatakan bahwa ClaudeBot, Claude-User, dan Claude-SearchBot mematuhi robots.txt. dokumentasi bot OpenAI menyatakan bahwa perayap otomatisnya memakai kontrol tersendiri, tetapi aturan robots.txt mungkin tidak berlaku bagi ChatGPT-User karena permintaan itu dimulai oleh seseorang. dokumentasi perayap Perplexity membuat pembedaan serupa: PerplexityBot mengikuti kontrol webmaster, sementara Perplexity-User umumnya mengabaikan robots.txt. Jadi klaim pukul rata bahwa bot AI mengabaikan robots.txt mencampuradukkan perayap terdokumentasi yang mematuhi berkas itu dengan pengambil yang dipicu pengguna yang perilakunya beragam antarvendor, ditambah scraper yang tidak pernah memperkenalkan diri sama sekali.

Tabel di bawah ini akurat pada saat penulisan. Token baru muncul lebih cepat daripada yang bisa diikuti artikel mana pun, jadi anggaplah ini peta awal yang cepat basi.

Token perayapOperatorApa fungsinyaMematuhi robots.txtCara memverifikasi identitas
GPTBotOpenAIMengumpulkan konten yang mungkin dipakai untuk melatih modelYaopenai.com/gptbot.json
OAI-SearchBotOpenAIMenampilkan situs di hasil pencarian ChatGPTYaopenai.com/searchbot.json
ChatGPT-UserOpenAIMengambil halaman untuk tindakan pengguna ChatGPTMungkin tidak berlakuopenai.com/chatgpt-user.json
OAI-AdsBotOpenAIMemvalidasi iklan dan halaman arahan yang dikirimkanYaopenai.com/adsbot.json
ClaudeBotAnthropicMengumpulkan konten yang mungkin berkontribusi pada pelatihan modelYaDaftar bersama di claude.com/crawling/bots.json
Claude-UserAnthropicMengambil halaman yang diminta pengguna ClaudeYaDaftar bersama di claude.com/crawling/bots.json
Claude-SearchBotAnthropicMengindeks konten untuk meningkatkan kualitas pencarianYaDaftar bersama di claude.com/crawling/bots.json
PerplexityBotPerplexity AIMengindeks dan menautkan situs di hasil Perplexity; bukan untuk pelatihan model fondasiYaperplexity.com/perplexitybot.json
Perplexity-UserPerplexity AIMengambil halaman untuk menjawab pertanyaan penggunaUmumnya mengabaikannyaperplexity.com/perplexity-user.json
Google-ExtendedGoogleMengontrol pelatihan dan grounding Gemini di luar PenelusuranYaBukan perayap; tidak ada yang perlu diverifikasi
CCBotCommon CrawlMembangun korpus publik Common CrawlYaReverse DNS untuk IPv4; rentang v4/v6 yang dipublikasikan

Menulis aturan robots.txt untuk perayap AI

RFC 9309 menyatakan bahwa aturan dalam robots.txt bukanlah bentuk otorisasi akses. IETF menstandarkan sintaksis, penguraian, dan caching pada September 2022; itu tidak mengubah berkas ini menjadi mekanisme penegakan. Rincian yang benar-benar menggigit dalam praktik berada di bawah lapisan sintaksis: berkas harus berkode UTF-8, pengurai harus memproses setidaknya 500 kibibyte, dan ketika direktif berbenturan, kecocokan jalur yang paling spesifiklah yang menang. Letak sebuah aturan di dalam berkas sama sekali tidak berpengaruh.

robots.txt untuk bot AI memakai berkas dan sintaksis yang sama dengan yang sudah Anda punya; yang berubah hanyalah daftar tokennya. Susun aturan berdasarkan niatnya, dan aturan itu akan bertahan lebih lama daripada susunan vendor. Kalau keberatan Anda soal pelatihan, blokir token pelatihan dan biarkan pengindeksnya:

# Block training, keep AI search indexing
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

Kalau Anda ingin mengirim sinyal penolakan untuk seluruh situs ke setiap token yang disebut di tabel, kelompokkan semuanya di bawah satu aturan. Tidak perlu mengulang Disallow sebelas kali:

# Send a site-wide opt-out signal to named AI tokens
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: OAI-AdsBot
User-agent: ClaudeBot
User-agent: Claude-User
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Itu pun belum menjadi pemblokiran menyeluruh. Anthropic menerapkan robots.txt pada Claude-User, tetapi OpenAI menyatakan aturannya mungkin tidak berlaku bagi ChatGPT-User, dan Perplexity-User umumnya mengabaikannya. Jika pengambilan yang dipicu pengguna itu harus dihentikan, bukan sekadar dicegah, tegakkan keputusan itu di proxy atau WAF.

Google-Extended adalah token yang paling sering disalahpahami, dan pembedaannya penting kalau trafik pencarian yang membayar tagihan Anda. dokumentasi perayap Google menggambarkannya sebagai token produk mandiri yang mengendalikan apakah konten hasil perayapan boleh dipakai untuk pelatihan dan grounding Gemini di luar Penelusuran, dan menyatakan bahwa ia tidak memengaruhi pencantuman maupun peringkat situs di Google Penelusuran. Memblokirnya tidak menyentuh perilaku Googlebot di Penelusuran.

Menjaga daftar token tetap mutakhir secara manual bukan cara yang baik menghabiskan sore hari. Repositori ai.robots.txt yang dikelola komunitas melacak user agent AI dan menghasilkan konfigurasi untuk robots.txt, nginx, Caddy, HAProxy, Lighttpd, dan Apache. Pengelola Apache bisa menaruh blok hasil generasi itu bersama aturan .htaccess tingkat direktori.

Tips Pro: jangan percaya string user-agent. Itu cuma header, dan header gratis untuk dipalsukan. Dokumentasi CCBot dari Common Crawl memperingatkan bahwa ada perayap yang mengaku-ngaku sebagai CCBot. Untuk IPv4, verifikasi dengan reverse DNS terkonfirmasi maju di bawah *.crawl.commoncrawl.org; untuk IPv6, gunakan rentang IP yang diterbitkan Common Crawl, karena reverse DNS saat ini belum didukung di sana. Halaman-halaman vendor di atas juga menerbitkan rentang IP terkini untuk perayap bernama lainnya. Itu jalur verifikasi yang terdokumentasi untuk vendor-vendor tersebut, bukan sifat perayap AI pada umumnya.

Apakah llms.txt Ada Gunanya?

Berdasarkan bukti yang ada sekarang, nyaris tidak ada gunanya. llms.txt adalah berkas teks biasa yang diusulkan berada di akar situs Anda, menyajikan ringkasan konten yang sudah dikurasi kepada model bahasa. Menerbitkannya murah, tetapi bukti yang ada memberi sedikit sekali alasan untuk berinvestasi di sana, dan dokumentasi Google menyatakan Anda tidak memerlukannya untuk fitur Penelusuran AI-nya.

Formatnya sangat minim. Usulan llms.txt berasal dari September 2024, berada di /llms.txt, dan menjadikan sebuah H1 berisi nama situs atau proyek sebagai satu-satunya bagian yang wajib.

Vonisnya datang dari hasil pengukuran. Studi Ahrefs atas 137.210 domain menemukan bahwa 28% domain yang diukur menerbitkan berkas llms.txt dan bahwa 97% berkas itu tidak menerima permintaan apa pun pada Mei 2026. Dari permintaan yang memang datang, 19,5% berasal dari perkakas AI yang jelas namanya. Ahrefs juga mengingatkan bahwa pengambilan berkas tidak membuktikan berkas itu benar-benar dipakai.

Bacaan saya atas data itu: llms.txt adalah taruhan pada sebuah konvensi yang belum diadopsi luas oleh sistem-sistem yang menjadi sasarannya. Terbitkan kalau Anda suka akar situs yang rapi. Tapi jangan bangun jalur produksi di sekitarnya, jangan biarkan ia menjadi langkah penghambat dalam proses rilis Anda, dan anggaplah siapa pun yang menjualnya sebagai pengungkit peringkat atau kutipan sedang berlari jauh di depan bukti.

Poin utama: dalam studi Ahrefs, 97% berkas llms.txt yang diterbitkan sama sekali tidak menerima permintaan pada Mei 2026.

Membuat Halaman Anda Terbaca Mesin

Pengukuran perayap oleh Vercel menemukan bahwa perayap OpenAI, ClaudeBot, PerplexityBot, Meta-ExternalAgent, Bytespider, dan CCBot tidak menjalankan JavaScript. Gemini lewat Googlebot dan AppleBot menjalankannya. Bagi perayap yang tidak merender, konten yang baru muncul setelah hidrasi di sisi klien menjadi tak terlihat, jadi render semua yang penting di sisi server. Soal markup lebih mudah, dan panduan Google sendiri soal ini luar biasa lugas:

"Anda tidak perlu membuat berkas terbaca mesin yang baru, berkas teks untuk AI, atau markup apa pun agar muncul di fitur-fitur ini. Tidak ada pula data terstruktur schema.org khusus yang perlu Anda tambahkan."

Panduan AI dari Google Search Central

Peningkatan visibilitas 40% yang kadang dikutip untuk membela skema FAQ berasal dari makalah GEO yang diterima di KDD 2024. Makalah itu melaporkan peningkatan hingga 40%, tetapi intervensi yang diujinya berfokus pada perubahan konten seperti sitasi, kutipan, statistik, terminologi teknis, dan susunan kalimat yang lancar, bukan FAQPage atau markup Schema.org mana pun. Angkanya benar; pengaitannya dengan markup schema tidak.

Pertahankan data terstruktur di tempat ia menopang fitur Penelusuran klasik dan cocok dengan halaman yang terlihat. Google menyatakan bahwa kelayakan untuk fitur AI-nya melalui pengindeksan Penelusuran biasa, tanpa syarat markup terpisah. Hanya saja, belum terbukti bahwa ia menggerakkan kutipan oleh AI.

Ketika robots.txt Tidak Cukup: Pembatasan Laju dan WAF di Server

Empat lapis kendali perayap AI yang dibandingkan berdampingan: robots.txt hanya bersifat kooperatif, reverse proxy menegakkan laju permintaan tetapi bergantung pada identitas yang dinyatakan, WAF swakelola menegakkan berdasarkan perilaku, jalur, laju, dan aturan, sedangkan tantangan proof-of-work membuat trafik terpilih membayar biaya komputasi, dengan kekuatan penegakan maupun biaya operasional sama-sama meningkat dari kiri ke kanan.

Direktif berlaku bagi bot yang memang ikut bermain. Dalam utas Hacker News yang samabeberapa operator menggambarkan trafik yang tidak begitu: perayap yang menyebar permintaannya ke kumpulan blok IP yang sangat besar dan merotasi user agent agar tampak seperti pengunjung biasa, yang mematahkan baik pembatasan per-IP yang naif maupun pencocokan user agent. Anggap itu laporan komunitas; tak seorang pun di utas itu menerbitkan hasil pengukuran. Tapi itu menggambarkan tepat populasi yang memang tak pernah bisa dijangkau robots.txt.

Sebelum menaiki tangga itu, ada langkah yang lebih murah untuk trafik yang masih mau bekerja sama. Perlambat saja:

User-agent: ClaudeBot
Crawl-delay: 1

Tips Pro: batasi lajunya dulu sebelum memblokir. Dokumentasi Anthropic mendukung Crawl-delay untuk ClaudeBot , sehingga Anda bisa memperlambat perayap yang berat tetapi sopan dan tetap mempertahankannya. Halaman yang sama menyatakan bahwa pemblokiran IP bukan mekanisme penolakan yang bertahan. Kedua poin itu khusus Anthropic; Crawl-delay bukan direktif universal, jadi periksa dulu dokumentasi tiap vendor.

Segala hal setelah itu adalah penegakan yang Anda jalankan sendiri, dalam tiga anak tangga dengan biaya dan efektivitas yang meningkat. Masing-masing membeli sesuatu dan melepaskan sesuatu.

Anak Tangga 1: Direktif Reverse Proxy dan Pembatasan Laju

Cara jalur lambat perayap di nginx mengambil keputusan: User-Agent permintaan yang masuk diperiksa; jika cocok dengan token perayap, permintaan itu mendapat kunci pembatas laju dan masuk zona ai_slowlane sebesar 20 permintaan per menit dengan burst 10, dan di luar burst itu secara bawaan dikembalikan 503; sedangkan permintaan yang tidak cocok dengan token perayap mana pun mendapat kunci kosong dan tidak dihitung, sehingga scraper yang menyatakan User-Agent Chrome sepenuhnya melewati jalur lambat khusus perayap ini.

Pembatasan laju perayap AI dimulai di reverse proxy, hal pertama dalam tumpukan Anda yang melihat sebuah permintaan dan bisa memperlambatnya sebelum aplikasi atau basis data melakukan pekerjaan apa pun. Dokumentasi pembatasan laju NGINX menyatakan bahwa permintaan dengan kunci kosong tidak dihitung, sehingga sebuah map bisa memberi kunci pembatas laju hanya kepada token perayap yang ingin Anda kekang, sementara permintaan yang tidak cocok dibiarkan di luar limit_req_zone.

# /etc/nginx/nginx.conf, inside the http block
map $http_user_agent $ai_rate_key {
    default              "";
    ~*GPTBot             $binary_remote_addr;
    ~*OAI-SearchBot      $binary_remote_addr;
    ~*ClaudeBot          $binary_remote_addr;
    ~*Claude-SearchBot   $binary_remote_addr;
    ~*PerplexityBot      $binary_remote_addr;
    ~*CCBot              $binary_remote_addr;
}

limit_req_zone $ai_rate_key zone=ai_slowlane:10m rate=20r/m;

# /etc/nginx/sites-available/example.conf, inside the server block
location / {
    limit_req zone=ai_slowlane burst=10 nodelay;
    proxy_pass http://127.0.0.1:8080;
}

Pasangan yang perlu Anda setel adalah burst=10 nodelay: permintaan di atas laju rata-rata bisa langsung menghabiskan jatah burst, dan permintaan di luar itu mendapat 503 secara bawaan. Setel terlalu ketat dan Anda akan menendang perayap sah di tengah perayapannya, masalah yang lebih lambat didiagnosis daripada situs mati. Caddy mengungkapkan dua gagasan yang sama dengan sebuah matcher dan sebuah handler; kalau Anda sedang memilih di antara keduanya, berkas konfigurasi yang disandingkan lebih berguna daripada angka throughput sintetis.

Batasan anak tangga ini adalah bahwa jalur lambatnya masih bergantung pada user agent yang dinyatakan. Scraper yang menyamar sebagai Chrome sepenuhnya melewati kunci khusus perayap ini; menangkap trafik semacam itu memerlukan pembatasan laju yang lebih luas berdasarkan perilaku IP/jalur, atau anak tangga WAF di bawah.

Anak Tangga 2: Web Application Firewall yang Anda Jalankan Sendiri

WAF memindahkan keputusan dari satu header ke sekumpulan aturan yang membaca pola permintaan, jalur, dan laju sekaligus, dan itulah yang Anda butuhkan begitu trafik berhenti memperkenalkan diri. Menjalankannya di mesin sendiri membuat aturan dan lognya tetap di disk Anda, tempat Anda bisa mem-grep-nya pukul tiga pagi. BunkerWeb adalah salah satu proyek semacam itu, SafeLine adalah yang lain, dan keduanya berjalan di VPS selama hostnya memenuhi persyaratan arsitektur dan sumber daya proyek; kami menyediakan versi sekali klik untuk keduanya agar Anda tak perlu repot memasang, meski pemaketan bukanlah bagian yang menarik.

Itu juga biaya dari anak tangga ini. Aturan butuh perawatan, dan aturan yang disetel cukup ketat untuk menangkap scraper yang gigih pada akhirnya akan menangkap manusia. Mode Monitor, Balanced, dan Strict milik SafeLine membuat pertukaran itu eksplisit: mulailah dengan mengamati trafik cukup lama untuk menemukan positif palsu sebelum Anda membiarkan WAF mengembalikan respons 403 secara otomatis.

Anak Tangga 3: Tantangan Proof-of-Work

Anubis melewati persoalan identifikasi sama sekali. Untuk trafik yang Anda pilih untuk ditantang, ia membuat permintaan itu membayar sedikit biaya komputasi sebelum origin melayaninya. Sistem kebijakannya juga bisa mengizinkan, menolak, atau menantang permintaan berdasarkan aturan pencocokan. README proyeknya menyebutnya sebagai Web AI Firewall Utility yang dibangun di sekitar tantangan untuk melindungi sumber daya hulu dari bot scraper. Ia bekerja tanpa mengharuskan setiap bot memperkenalkan diri dengan benar.

Proyek itu sendiri menyebut pendekatan ini sebagai respons nuklir, dan kehati-hatian itu memang beralasan. Pajaknya jatuh pada trafik apa pun yang ditantang kebijakan Anda, yang bisa mencakup manusia dengan perangkat lambat atau perayap sah kalau aturannya terlalu luas. Simpan anak tangga ini sebagai cadangan untuk trafik yang benar-benar bermusuhan. Perayap yang terlalu bersemangat biasanya persoalan pembatasan laju, dan pembatas laju itu sudah Anda punya.

Menentukan Ukuran untuk Lonjakan

Beban perayap sering datang dalam lonjakan, tetapi apakah ia berat di CPU, basis data, atau I/O tergantung pada aplikasinya dan URL yang dirayapi. Dalam contoh WordPress di atas, operatornya melacak sebagian besar waktu satu detik per halaman itu ke MySQL, jadi insiden khusus itu adalah kemacetan basis data yang datang berbaju masalah trafik.

Ini mengubah penentuan ukuran menjadi persoalan alokasi, dan persoalan yang tidak nyaman: Anda membayar ruang cadangan terus-menerus, padahal ia baru menghasilkan saat lonjakan yang tidak Anda kendalikan. Tetap sediakan untuk lonjakan itu. Kalau BunkerWeb berbagi host dengan aplikasi dan basis data, jangan anggap 8 GB sebagai rekomendasi untuk seluruh tumpukan. Panduan mulai cepat BunkerWeb menyarankan 2 vCPU dan RAM 8 GB untuk pengujian atau penerapan dengan sangat sedikit layanan, dan setidaknya 4 vCPU dengan RAM 16 GB untuk lingkungan produksi yang melindungi banyak layanan. Tambahkan di atasnya puncak CPU aplikasi itu sendiri, memori basis data, dan ruang cadangan I/O.

Inti dengan clock lebih tinggi membantu ketika penanganan permintaan atau eksekusi kueri terbatas CPU; jumlah inti yang lebih banyak membantu ketika Anda perlu lebih banyak pekerjaan berjalan bersamaan. Tentukan ukuran dari puncak konkurensi, waktu respons p95, CPU dan I/O wait basis data, serta laju cache miss, bukan semata dari trafik perayap.

Menjalankan lapisan itu sendiri menuntut dua hal dari mesin di bawahnya: akses root, karena setiap mekanisme di atas adalah berkas konfigurasi yang Anda sunting dan layanan yang Anda mulai ulang, serta ruang cadangan yang cukup agar sebuah lonjakan tidak menjatuhkan situs sementara aturannya bekerja. Kalau Anda sedang menentukan ukuran atau memindahkan mesin untuk ini, Linux VPS Linux VPS kami memberi akses root yang dituntut tumpukan ini dan memungkinkan Anda menguji penyiapan proxy dan WAF sebelum berkomitmen pada ukuran jangka panjang.

Lihat Paket Linux

Bangun di VPS Linux dengan akses root, NVMe, dan tenaga AMD EPYC.

Lihat Paket Linux

Setelan Bawaan Baru Cloudflare untuk Trafik AI

Cloudflare membagi trafik AI ke dalam kategori Search, Agent, dan Training dalam pengumuman trafik AI Juli 2026. Mulai 15 September 2026, domain baru yang bergabung ke Cloudflare akan mendapati Training dan Agent diblokir secara bawaan pada halaman yang menampilkan iklan, sementara Search tetap diizinkan. Pelanggan lama bisa mengubah setelannya lebih dulu, dan kontrolnya tersedia di semua paket.

Bagian yang layak dipetik adalah kerumitan yang disebut Cloudflare sendiri dalam pengumumannya. Dalam klasifikasi Cloudflare, Googlebot, Applebot, dan Bingbot masing-masing menggabungkan pekerjaan Search dengan Training, jadi pelanggan yang memblokir kategori Training ikut memblokir perayap-perayap itu, termasuk perilaku pencarian yang justru ingin dipertahankannya. Itulah jebakan yang sama yang menanti pada setiap kontrol tingkat kategori yang memperlakukan perayap serbaguna seolah-olah ia hanya punya satu tugas.

Kalau situs Anda tidak berada di belakang Cloudflare, tak satu pun dari ini menjadi tuas yang bisa Anda tarik. Tetap ketahuilah bahwa ini akan datang, sebab pola trafik akan bergeser pada September; kendali Anda tetap token robots.txt dan lapisan proxy di atas tadi.

WebMCP: Layak Diamati, Belum Layak Dibangun

WebMCP adalah padanan di sisi peramban dari Model Context Protocol, konvensi yang dipakai agen untuk memanggil perkakas terstruktur alih-alih menebak. Adapun pengumuman origin trial WebMCP dari Chrome merumuskan tujuannya secara langsung: alih-alih agen menebak-nebak apa fungsi sebuah tombol atau kolom formulir, situs bisa memaparkan fungsi terstruktur dan kontrol beranotasi yang dapat dipanggil agen secara langsung.

Ini upaya kredibel pertama untuk memberi agen sesuatu yang bisa dikerjakan di situs Anda selain membacanya, dan itulah yang membuatnya jadi hal paling menarik dalam artikel ini. Ia juga masih eksperimental dan belum rampung: sebuah origin trial Chrome 149 yang dibuka pada Juni 2026. Pantau spesifikasinya. Jangan dulu membangun ketergantungan produksi di sekitarnya, dan jangan masukkan ke rencana kapasitas Anda.

Pertanyaan yang Sering Diajukan

Apakah robots.txt Menghentikan Bot AI?

Sebagian, dan justru ketelitiannya itulah jawabannya. Anthropic menyatakan ClaudeBot, Claude-User, dan Claude-SearchBot mematuhi robots.txt. Perayap otomatis OpenAI juga memakainya, tetapi OpenAI menyatakan aturannya mungkin tidak berlaku bagi ChatGPT-User; Perplexity menyatakan Perplexity-User umumnya mengabaikan berkas itu. Scraper tanpa nama atau yang memalsukan identitas sama sekali berada di luar jangkauan robots.txt.

Apa Bedanya llms.txt dan robots.txt?

Keduanya menyelesaikan persoalan yang berbeda. robots.txt memberi tahu perayap kooperatif apa yang boleh mereka ambil, dan sudah distandarkan oleh IETF. llms.txt adalah berkas usulan yang menyajikan ringkasan konten Anda yang sudah dikurasi kepada model bahasa, tanpa keharusan apa pun bahwa ada yang mengambil atau memakainya. Dalam pengukuran Ahrefs pada Mei 2026, 97% berkas yang diterbitkan tidak menerima permintaan sama sekali. Kalau Anda ingin direktif untuk perayap, robots.txt adalah mekanisme standarnya; llms.txt bersifat opsional dan sejauh ini sedikit sekali dipakai.

Bagaimana Cara Memblokir GPTBot dari Situs Saya?

Tambahkan dua baris ini ke berkas robots.txt di akar situs Anda:

User-agent: GPTBot
Disallow: /

Dengan begitu situs Anda keluar dari perayapan pelatihan otomatis GPTBot. OAI-SearchBot, yang dipakai untuk pencarian ChatGPT, dan ChatGPT-User, yang mengambil halaman untuk tindakan pengguna, adalah token terpisah dan tidak terpengaruh.

Apakah Memblokir Perayap Pelatihan AI Juga Memblokir Pengindeksan Google Penelusuran?

Tidak, kalau Anda memakai kontrol yang tepat. Memblokir Google-Extended tidak menghalangi Googlebot di Penelusuran. Jebakannya muncul ketika Anda memakai kontrol tingkat kategori yang menggolongkan perayap serbaguna sebagai Training: Cloudflare, misalnya, mengklasifikasikan Googlebot, Applebot, dan Bingbot sebagai penggabung Search dan Training, sehingga memblokir kategori Training di sana ikut memblokir identitas perayap itu.

Bagaimana Saya Tahu Bot AI Sedang Merayapi Situs Saya?

Grep log akses Anda untuk token yang terdokumentasi, lalu verifikasi apa yang Anda temukan:

grep -ohE 'GPTBot|ClaudeBot|CCBot|PerplexityBot|OAI-SearchBot|ChatGPT-User' \
  /var/log/nginx/access.log | sort | uniq -c | sort -rn

Hitungannya menunjukkan user agent mana saja yang berkunjung dan seberapa sering. Karena string itu bisa dipalsukan, verifikasi para pengunjung terberat terhadap rentang IP yang diterbitkan vendor atau metode reverse DNS mereka sebelum bertindak berdasarkan angka-angka itu.

Bagikan

Diskusi

Komentar

Masuk untuk bergabung dalam diskusi.

Lebih banyak dari blog

Lanjutkan membaca.

Siap deploy? Mulai $2,48/bln.

Cloud independen, sejak 2008. AMD EPYC, NVMe, 40 Gbps. Garansi uang kembali 14 hari.