Trong một chủ đề trên Hacker News về lưu lượng của trình thu thập AI, một quản trị viên hosting đã mô tả tải từ phía nhà vận hành: "khoảng 6 con bot AI khá hung hăng" thỉnh thoảng lại mắc kẹt ở các trang biến thể sản phẩm hoặc trang danh mục rồi bắt đầu dội vào đó với tốc độ chừng một yêu cầu mỗi giây, trên một website mà "mỗi lần tải trang có thể mất trọn 1 giây khứ hồi (phần lớn nằm ở MySQL)". Hiệu ứng tích lũy, trong cùng bình luận đó: "gần như website bị Slashdot mỗi ngày".
Chuẩn bị website cho tác nhân AI trước hết là bài toán về năng lực xử lý, nên phần lớn công việc ở đây là cấu hình máy chủ và rất ít là chiến lược nội dung. Điểm hữu ích của loại lưu lượng này là phần lớn không ẩn danh: các công ty tạo ra nó đều công bố tên trình thu thập của mình, ghi rõ mỗi cái dùng để làm gì và chỉ cho bạn cách tắt chúng. Phần tiếp theo là những gì cần cấu hình, mỗi cơ chế thực sự áp đặt được điều gì, và hai bước tôi sẽ bỏ qua: công bố một tệp llms.txt và thêm schema markup cho AI.
Tóm tắt nhanh
- Lưu lượng AI thường chia thành ba nhóm: huấn luyện, lập chỉ mục cho tìm kiếm AI, và các lần tải trang do người dùng kích hoạt. OpenAI và Anthropic cung cấp các token riêng cho từng mục đích, nên bạn có thể kiểm soát chúng độc lập; một số trình thu thập đa mục đích lại gộp nhiều vai trò dưới một danh tính.
- OpenAI, Anthropic, Perplexity và Common Crawl đều có tài liệu về cách điều khiển trình thu thập tự động của họ qua robots.txt. Ngoại lệ là các trình tải do người dùng kích hoạt: Anthropic áp dụng robots.txt cho cả Claude-User, OpenAI nói rằng các quy tắc có thể không áp dụng cho ChatGPT-User, còn Perplexity-User thì thường bỏ qua chúng.
- Tệp robots.txt là một cơ chế xin phép, không phải kiểm soát truy cập. RFC 9309 không trao cho nó bất kỳ quyền cưỡng chế nào; những bot tuân thủ có thể giảm tải cho bạn bằng cách tôn trọng nó, nhưng bản thân tệp không thể bóp băng thông hay chặn được lưu lượng không tuân thủ.
- Trên 137.210 tên miền trong tệp khách hàng phân tích của Ahrefs, 97% số tệp llms.txt đã công bố không nhận được yêu cầu nào trong tháng 5 năm 2026. Cứ công bố một tệp nếu bạn thích, nhưng đừng xây dựng công cụ xoay quanh nó.
- Hãy giữ dữ liệu có cấu trúc ở nơi nó hỗ trợ các tính năng Tìm kiếm cổ điển, nhưng tài liệu của Google nói rằng các tính năng AI của họ không đòi hỏi schema đặc biệt hay tệp văn bản dành cho AI nào cả.
- Hãy kết xuất nội dung quan trọng ở phía máy chủ nếu bạn muốn OpenAI, ClaudeBot, PerplexityBot hay CCBot đọc được. Vercel nhận thấy các trình thu thập này không chạy JavaScript; Gemini thông qua Googlebot và AppleBot là ngoại lệ.
- Việc thực thi vượt ra ngoài các quy tắc mang tính hợp tác của robots.txt nằm ở reverse proxy, ở một WAF do bạn tự vận hành, hoặc phía sau một thử thách proof-of-work, theo đúng thứ tự chi phí đó.
Bài viết này không đề cập đến điều gì
Bài này nói về một website được các tác nhân ghé thăm, chứ không phải một website giao dịch với chúng. Bốn chủ đề lân cận được để sang một bên.
- Thương mại do tác nhân thực hiện và các luồng thanh toán, một bài toán khác dành cho một loại website khác.
- Tranh luận pháp lý và bản quyền quanh dữ liệu huấn luyện, vốn là một quyết định kinh doanh chứ không phải cấu hình máy chủ.
- Hướng dẫn triển khai WebMCP từng bước, vì tiêu chuẩn này vẫn còn ở giai đoạn origin trial.
- Cấu hình riêng cho từng CDN, ngoài mục Cloudflare duy nhất ở bên dưới.
Những trình thu thập AI nào đang dội vào website của bạn
GPTBot và ClaudeBot thu thập nội dung có thể được dùng để huấn luyện mô hình. OAI-SearchBot và Claude-SearchBot phục vụ tìm kiếm và truy xuất bằng AI. ChatGPT-User và Claude-User tải trang để đáp lại thao tác của người dùng. Ở một số nhà cung cấp, các nhiệm vụ này tách bạch, nhưng không phải trình thu thập nào trên web cũng khớp gọn gàng với một mục đích duy nhất.
Bức tranh tuân thủ chi tiết hơn những gì cách nói tắt thông thường gợi ra. tài liệu về trình thu thập của Anthropic cho biết ClaudeBot, Claude-User và Claude-SearchBot đều tuân thủ robots.txt. tài liệu về bot của OpenAI cho biết các trình thu thập tự động của họ dùng cơ chế điều khiển riêng, nhưng quy tắc robots.txt có thể không áp dụng cho ChatGPT-User vì những yêu cầu đó do một con người khởi tạo. tài liệu về trình thu thập của Perplexity cũng đưa ra phân biệt tương tự: PerplexityBot tuân theo các thiết lập của quản trị viên web, còn Perplexity-User thì thường bỏ qua robots.txt. Vì vậy, khẳng định vơ đũa cả nắm rằng bot AI phớt lờ robots.txt đã gộp chung những trình thu thập có tài liệu và tôn trọng tệp này với các trình tải do người dùng kích hoạt vốn hành xử khác nhau tùy nhà cung cấp, cộng thêm những scraper chẳng bao giờ khai báo danh tính.
Bảng dưới đây cập nhật tại thời điểm viết bài. Các token mới xuất hiện nhanh hơn mức bất kỳ bài viết nào theo kịp, nên hãy xem nó như một bản đồ khởi đầu có hạn dùng ngắn.
| Token trình thu thập | Nhà vận hành | Nó làm gì | Tuân thủ robots.txt | Cách xác minh danh tính |
|---|---|---|---|---|
| GPTBot | OpenAI | Thu thập nội dung có thể được dùng để huấn luyện mô hình | Có | openai.com/gptbot.json |
| OAI-SearchBot | OpenAI | Đưa website xuất hiện trong kết quả tìm kiếm của ChatGPT | Có | openai.com/searchbot.json |
| ChatGPT-User | OpenAI | Tải một trang cho thao tác của người dùng ChatGPT | Có thể không áp dụng | openai.com/chatgpt-user.json |
| OAI-AdsBot | OpenAI | Kiểm định quảng cáo và trang đích được gửi lên | Có | openai.com/adsbot.json |
| ClaudeBot | Anthropic | Thu thập nội dung có thể góp phần huấn luyện mô hình | Có | Danh sách dùng chung tại claude.com/crawling/bots.json |
| Claude-User | Anthropic | Truy xuất trang mà người dùng Claude yêu cầu | Có | Danh sách dùng chung tại claude.com/crawling/bots.json |
| Claude-SearchBot | Anthropic | Lập chỉ mục nội dung để cải thiện chất lượng tìm kiếm | Có | Danh sách dùng chung tại claude.com/crawling/bots.json |
| PerplexityBot | Perplexity AI | Lập chỉ mục và dẫn liên kết tới website trong kết quả Perplexity; không dùng để huấn luyện mô hình nền tảng | Có | perplexity.com/perplexitybot.json |
| Perplexity-User | Perplexity AI | Tải một trang để trả lời câu hỏi của người dùng | Thường bỏ qua | perplexity.com/perplexity-user.json |
| Google-Extended | Kiểm soát việc huấn luyện và tra cứu nền tảng của Gemini bên ngoài Tìm kiếm | Có | Không phải trình thu thập; không có gì để xác minh | |
| CCBot | Common Crawl | Xây dựng kho ngữ liệu công khai Common Crawl | Có | Reverse DNS cho IPv4; các dải v4/v6 đã công bố |
Viết quy tắc robots.txt cho trình thu thập AI
RFC 9309 nói rằng các quy tắc trong robots.txt không phải là một hình thức cấp quyền truy cập. IETF đã chuẩn hóa cú pháp, cách phân tích và bộ nhớ đệm vào tháng 9 năm 2022; điều đó không biến tệp này thành một cơ chế cưỡng chế. Những chi tiết thực sự gây đau nằm bên dưới lớp cú pháp: tệp phải được mã hóa UTF-8, bộ phân tích phải xử lý được ít nhất 500 kibibyte, và khi các chỉ thị xung đột thì kết quả khớp đường dẫn cụ thể nhất sẽ thắng. Vị trí của một quy tắc trong tệp thì chẳng ảnh hưởng gì.
Một tệp robots.txt dành cho bot AI dùng đúng tệp và đúng cú pháp bạn đã có; thứ thay đổi chỉ là danh sách token. Hãy sắp xếp các quy tắc theo mục đích, chúng sẽ sống lâu hơn danh sách nhà cung cấp. Nếu điều bạn phản đối là việc huấn luyện, hãy chặn các token huấn luyện và để yên cho những trình lập chỉ mục:
# Block training, keep AI search indexing
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Nếu bạn muốn gửi tín hiệu từ chối cho toàn site tới mọi token có tên trong bảng, hãy gom chúng dưới một quy tắc duy nhất. Không cần lặp lại Disallow mười một lần:
# Send a site-wide opt-out signal to named AI tokens
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: OAI-AdsBot
User-agent: ClaudeBot
User-agent: Claude-User
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Như vậy vẫn chưa phải là một lệnh chặn phổ quát. Anthropic áp dụng robots.txt cho Claude-User, nhưng OpenAI nói rằng các quy tắc có thể không áp dụng cho ChatGPT-User, còn Perplexity-User thì thường bỏ qua chúng. Nếu những lượt tải do người dùng kích hoạt đó buộc phải bị chặn chứ không chỉ được khuyên can, hãy thực thi quyết định ấy ở proxy hoặc WAF.
Google-Extended là token bị hiểu sai nhiều nhất, và sự phân biệt này quan trọng nếu lưu lượng tìm kiếm là thứ trả hóa đơn cho bạn. tài liệu về trình thu thập của Google mô tả nó như một token sản phẩm độc lập, kiểm soát việc nội dung đã thu thập có được dùng cho việc huấn luyện và tra cứu nền tảng của Gemini bên ngoài Tìm kiếm hay không, và nói rằng nó không ảnh hưởng đến việc website được đưa vào hay xếp hạng trong Google Tìm kiếm. Chặn nó không đụng gì tới hành vi Tìm kiếm của Googlebot.
Cập nhật danh sách token bằng tay không phải là cách hay để dùng hết một buổi chiều. Kho lưu trữ ai.robots.txt do cộng đồng duy trì theo dõi các user agent AI và sinh ra cấu hình cho robots.txt, nginx, Caddy, HAProxy, Lighttpd và Apache. Người vận hành Apache có thể thả khối cấu hình được sinh ra ấy cạnh những quy tắc .htaccess ở cấp thư mục.
Mẹo hay: đừng tin chuỗi user-agent. Nó chỉ là một header, và header thì giả mạo miễn phí. Tài liệu về CCBot của Common Crawl cảnh báo rằng có những trình thu thập mạo danh CCBot. Với IPv4, hãy xác minh bằng reverse DNS được xác nhận xuôi trong miền *.crawl.commoncrawl.org; với IPv6, hãy dùng các dải IP mà Common Crawl công bố, vì reverse DNS hiện chưa được hỗ trợ ở đó. Các trang nhà cung cấp nêu trên cũng công bố dải IP hiện hành cho những trình thu thập có tên còn lại. Đó là một lối xác minh có tài liệu ở những nhà cung cấp này, chứ không phải đặc tính của trình thu thập AI nói chung.
llms.txt có tác dụng gì không?
Theo bằng chứng hiện có thì gần như không có tác dụng gì. llms.txt là một tệp văn bản thuần được đề xuất đặt ở gốc website, cung cấp cho các mô hình ngôn ngữ một bản tóm tắt đã được biên tập về nội dung của bạn. Công bố nó thì rẻ, nhưng bằng chứng hiện tại cho bạn rất ít lý do để đầu tư vào đó, và tài liệu của Google nói rằng bạn không cần nó cho các tính năng Tìm kiếm AI của họ.
Định dạng rất tối giản. Đề xuất llms.txt có từ tháng 9 năm 2024, nằm ở /llms.txt, và chỉ bắt buộc duy nhất một mục: một thẻ H1 mang tên website hoặc tên dự án.
Phán quyết đến từ các phép đo. Nghiên cứu trên 137.210 tên miền của Ahrefs cho thấy 28% số tên miền được đo có công bố tệp llms.txt, và 97% trong số các tệp đó không nhận được yêu cầu nào trong tháng 5 năm 2026. Trong số các yêu cầu thực sự đến, 19,5% đến từ những công cụ AI có tên tuổi. Ahrefs cũng lưu ý rằng việc tệp bị tải về không chứng minh được rằng nó đã thực sự được sử dụng.
Cách tôi đọc dữ liệu đó là: llms.txt là một canh bạc đặt vào một quy ước mà chính những hệ thống nó nhắm tới vẫn chưa áp dụng rộng rãi. Cứ công bố nếu bạn thích thư mục gốc gọn gàng. Nhưng đừng dựng một dây chuyền sinh tệp quanh nó, đừng để nó trở thành một bước chặn trong quy trình triển khai, và ai bán nó cho bạn như một đòn bẩy thứ hạng hay trích dẫn thì hãy coi là họ đang chạy trước bằng chứng khá xa.
Điểm mấu chốt: trong nghiên cứu của Ahrefs, 97% số tệp llms.txt đã công bố không nhận được yêu cầu nào trong tháng 5 năm 2026.
Làm cho các trang của bạn máy đọc được
Phép đo trình thu thập của Vercel cho thấy các trình thu thập của OpenAI, ClaudeBot, PerplexityBot, Meta-ExternalAgent, Bytespider và CCBot đều không chạy JavaScript. Gemini thông qua Googlebot và AppleBot thì có. Với những trình không kết xuất, nội dung chỉ xuất hiện sau khi hydrate ở phía client là vô hình, nên hãy kết xuất mọi thứ quan trọng ở phía máy chủ. Chuyện đánh dấu thì dễ trả lời hơn, và chính hướng dẫn của Google về việc này lại thẳng thắn một cách bất thường:
"Bạn không cần tạo thêm tệp máy đọc được, tệp văn bản dành cho AI, hay đánh dấu nào để xuất hiện trong các tính năng này. Cũng không có dữ liệu có cấu trúc schema.org đặc biệt nào mà bạn phải thêm vào."
Mức tăng khả năng hiển thị 40% đôi khi được viện dẫn để bênh vực schema FAQ đến từ bài báo GEO được nhận đăng tại KDD 2024. Bài báo báo cáo mức cải thiện lên tới 40%, nhưng các can thiệp mà nó thử nghiệm đều xoay quanh thay đổi nội dung như trích dẫn nguồn, trích dẫn nguyên văn, số liệu thống kê, thuật ngữ chuyên ngành và cách diễn đạt trôi chảy, chứ không phải FAQPage hay bất kỳ đánh dấu Schema.org nào. Con số thì đúng; việc gán nó cho schema markup thì không.
Hãy giữ dữ liệu có cấu trúc ở nơi nó hỗ trợ một tính năng Tìm kiếm cổ điển và khớp với trang mà người dùng nhìn thấy. Google nói rằng điều kiện để vào các tính năng AI của họ đi qua việc lập chỉ mục Tìm kiếm thông thường, không có yêu cầu đánh dấu riêng. Chỉ là chưa có gì cho thấy nó lay chuyển được việc AI trích dẫn.
Khi robots.txt là chưa đủ: giới hạn tốc độ và WAF ngay tại máy chủ
Các chỉ thị chỉ có tác dụng với những bot đã đồng ý tuân theo. Trong cùng chủ đề trên Hacker News đóđó, vài nhà vận hành đã mô tả loại lưu lượng không như vậy: những trình thu thập rải yêu cầu khắp các dải IP khổng lồ và luân phiên đổi user agent để trông như khách truy cập bình thường, làm vô hiệu cả giới hạn theo IP ngây thơ lẫn việc so khớp user agent. Hãy xem đó là lời kể từ cộng đồng; không ai trong chủ đề đó công bố số liệu đo đạc. Nhưng nó mô tả đúng nhóm mà robots.txt vốn chưa bao giờ được thiết kế để chạm tới.
Trước khi leo lên cái thang đó, còn một nước đi rẻ hơn dành cho lưu lượng vẫn đang hợp tác: hãy làm nó chậm lại:
User-agent: ClaudeBot
Crawl-delay: 1
Mẹo hay: hãy bóp băng thông trước khi chặn. Tài liệu của Anthropic hỗ trợ Crawl-delay cho ClaudeBot , nên bạn có thể làm chậm một trình thu thập nặng nhưng cư xử đàng hoàng mà vẫn giữ lại nó. Cũng trang đó nói rằng chặn IP không phải là một cơ chế từ chối bền vững. Cả hai điểm này đều chỉ đúng với Anthropic; Crawl-delay không phải là một chỉ thị phổ quát, nên hãy đọc tài liệu của từng nhà cung cấp trước đã.
Mọi thứ vượt quá điểm đó đều là việc thực thi do chính bạn vận hành, chia thành ba nấc với chi phí và hiệu quả tăng dần. Mỗi nấc mua được một thứ và phải đánh đổi một thứ.
Nấc 1: Chỉ thị reverse proxy và giới hạn tốc độ
Việc giới hạn tốc độ trình thu thập AI bắt đầu ở reverse proxy, thứ đầu tiên trong hệ thống của bạn nhìn thấy một yêu cầu và có thể làm nó chậm lại trước khi ứng dụng hay cơ sở dữ liệu phải làm bất cứ việc gì. Tài liệu về giới hạn tốc độ của NGINX nêu rằng các yêu cầu có khóa rỗng sẽ không bị tính, nên một map có thể chỉ cấp khóa giới hạn tốc độ cho những token trình thu thập mà bạn muốn bóp lại, đồng thời để các yêu cầu không khớp nằm ngoài limit_req_zone.
# /etc/nginx/nginx.conf, inside the http block
map $http_user_agent $ai_rate_key {
default "";
~*GPTBot $binary_remote_addr;
~*OAI-SearchBot $binary_remote_addr;
~*ClaudeBot $binary_remote_addr;
~*Claude-SearchBot $binary_remote_addr;
~*PerplexityBot $binary_remote_addr;
~*CCBot $binary_remote_addr;
}
limit_req_zone $ai_rate_key zone=ai_slowlane:10m rate=20r/m;
# /etc/nginx/sites-available/example.conf, inside the server block
location / {
limit_req zone=ai_slowlane burst=10 nodelay;
proxy_pass http://127.0.0.1:8080;
}
Cặp giá trị cần tinh chỉnh là burst=10 nodelay: các yêu cầu vượt mức trung bình có thể tiêu ngay phần burst, còn những yêu cầu vượt quá đó sẽ nhận 503 theo mặc định. Siết quá chặt thì bạn sẽ hất một trình thu thập hợp lệ ra giữa chừng, một vấn đề chẩn đoán còn chậm hơn cả sự cố sập site. Caddy diễn đạt đúng hai ý tưởng đó bằng một matcher và một handler; nếu bạn đang chọn giữa hai bên, thì các tệp cấu hình đặt cạnh nhau hữu ích hơn một con số thông lượng tổng hợp.
Hạn chế của nấc này là làn chậm vẫn phụ thuộc vào user agent được khai báo. Một scraper khoác lên user agent của Chrome sẽ né hoàn toàn khóa dành riêng cho trình thu thập; để bắt được loại lưu lượng đó cần một giới hạn tốc độ rộng hơn dựa trên hành vi theo IP/đường dẫn, hoặc nấc WAF ở phần dưới.
Nấc 2: Tường lửa ứng dụng web do bạn tự vận hành
Một WAF chuyển quyết định từ một header duy nhất sang một bộ quy tắc đọc đồng thời mẫu yêu cầu, đường dẫn và tốc độ, và đó chính là thứ bạn cần khi lưu lượng thôi tự khai báo. Chạy nó trên máy của chính bạn giữ các quy tắc và nhật ký ngay trên đĩa của bạn, nơi bạn có thể grep chúng lúc ba giờ sáng. BunkerWeb là một dự án như vậy, SafeLine là một dự án khác, và cả hai đều chạy được trên VPS khi máy chủ đáp ứng yêu cầu về kiến trúc và tài nguyên của dự án; chúng tôi cung cấp bản cài một cú nhấp cho cả hai để bạn khỏi mất công thiết lập, dù việc đóng gói không phải phần thú vị.
Đó cũng chính là cái giá của nấc này. Các quy tắc cần được bảo trì, và một quy tắc siết đủ chặt để bắt được một scraper lì lợm thì rốt cuộc cũng sẽ bắt nhầm một con người. Các chế độ Monitor, Balanced và Strict của SafeLine làm rõ sự đánh đổi đó: hãy bắt đầu bằng việc quan sát lưu lượng đủ lâu để tìm ra các cảnh báo sai, trước khi để WAF tự động trả về mã 403.
Nấc 3: Thử thách proof-of-work
Anubis bỏ qua hoàn toàn bài toán nhận diện. Với lưu lượng mà bạn chọn để thử thách, nó buộc yêu cầu phải trả một chi phí tính toán nhỏ trước khi origin phục vụ. Hệ thống chính sách của nó cũng có thể cho qua, từ chối hoặc đặt thử thách cho các yêu cầu theo quy tắc so khớp. README của dự án gọi nó là một Web AI Firewall Utility được xây quanh các thử thách nhằm bảo vệ tài nguyên phía sau khỏi bot scraper. Nó hoạt động mà không đòi hỏi mọi bot phải khai báo danh tính chính xác.
Chính dự án gọi cách tiếp cận này là một đòn hạt nhân, và sự dè dặt đó là xứng đáng. Khoản thuế này rơi lên bất kỳ lưu lượng nào mà chính sách của bạn đặt thử thách, có thể bao gồm cả người dùng máy chậm hoặc trình thu thập hợp lệ nếu quy tắc quá rộng. Hãy để dành nấc này cho lưu lượng thực sự thù địch. Một trình thu thập quá hăng hái thường chỉ là bài toán giới hạn tốc độ, mà giới hạn đó thì bạn đã có rồi.
Tính dung lượng cho đợt bùng
Tải từ trình thu thập thường đến theo từng đợt, nhưng nó nặng về CPU, cơ sở dữ liệu hay I/O thì tùy vào ứng dụng và những URL đang bị thu thập. Trong ví dụ WordPress ở trên, người vận hành lần ra rằng phần lớn một giây xử lý mỗi trang nằm ở MySQL, nên sự cố cụ thể đó là một nút thắt cơ sở dữ liệu khoác áo bài toán lưu lượng.
Điều đó biến việc tính dung lượng thành một bài toán phân bổ, và là bài toán khó chịu: bạn trả tiền cho phần dư liên tục, mà nó chỉ đáng đồng tiền vào đúng lúc có một đợt tăng vọt bạn không kiểm soát được. Dù vậy vẫn cứ dự phòng cho đợt tăng đó. Nếu BunkerWeb dùng chung máy với ứng dụng và cơ sở dữ liệu, đừng coi 8 GB là khuyến nghị cho cả hệ thống. Hướng dẫn bắt đầu nhanh của BunkerWeb khuyến nghị 2 vCPU và 8 GB RAM cho môi trường thử nghiệm hoặc triển khai với rất ít dịch vụ, và tối thiểu 4 vCPU cùng 16 GB RAM cho môi trường sản xuất bảo vệ nhiều dịch vụ. Hãy cộng thêm mức CPU đỉnh của chính ứng dụng, bộ nhớ cho cơ sở dữ liệu và phần dư cho I/O.
Nhân xung nhịp cao có ích khi việc xử lý yêu cầu hoặc thực thi truy vấn bị nghẽn ở CPU; nhiều nhân hơn có ích khi bạn cần chạy song song nhiều việc hơn. Hãy tính dung lượng từ mức đồng thời đỉnh, thời gian phản hồi p95, CPU và thời gian chờ I/O của cơ sở dữ liệu, cùng tỷ lệ trượt cache, chứ đừng chỉ nhìn vào lưu lượng của trình thu thập.
Tự vận hành lớp này đòi hỏi hai thứ ở cỗ máy bên dưới: quyền root, vì mọi cơ chế ở trên đều là một tệp cấu hình bạn sửa và một dịch vụ bạn khởi động lại; và đủ phần dư để một đợt bùng lưu lượng không làm sập site trong lúc các quy tắc đang làm việc. Nếu bạn đang chọn cấu hình hoặc chuyển máy cho việc này, Linux VPS Linux VPS của chúng tôi cấp cho bạn quyền root mà hệ thống này đòi hỏi, và cho phép bạn thử nghiệm cấu hình proxy cùng WAF trước khi chốt một cấu hình dài hạn.
Xây dựng trên VPS Linux với quyền root, NVMe và sức mạnh AMD EPYC.
Xem các gói LinuxCác mặc định mới của Cloudflare cho lưu lượng AI
Cloudflare đã chia lưu lượng AI thành ba nhóm Search, Agent và Training trong thông báo về lưu lượng AI hồi tháng 7 năm 2026. Từ ngày 15 tháng 9 năm 2026, các tên miền mới gia nhập Cloudflare sẽ mặc định bị chặn Training và Agent trên những trang có hiển thị quảng cáo, còn Search vẫn được cho phép. Khách hàng hiện hữu có thể đổi thiết lập này từ trước, và các tùy chọn điều khiển có mặt ở mọi gói.
Điều đáng học ở đây là chính sự rắc rối mà Cloudflare gọi tên trong thông báo của mình. Theo cách phân loại của Cloudflare, Googlebot, Applebot và Bingbot đều kiêm cả việc Search lẫn Training, nên khách hàng nào chặn nhóm Training thì cũng chặn luôn những trình thu thập đó, kể cả phần hành vi tìm kiếm mà họ vốn muốn giữ. Đó đúng là cái bẫy chờ sẵn ở mọi cơ chế kiểm soát theo nhóm khi nó coi một trình thu thập đa mục đích như thể chỉ có một nhiệm vụ.
Nếu website của bạn không nằm sau Cloudflare thì chẳng có đòn bẩy nào ở đây để bạn kéo cả. Nhưng hãy biết rằng nó đang đến, bởi nó sẽ làm dịch chuyển các mẫu lưu lượng trong tháng 9; công cụ của bạn vẫn là các token trong robots.txt và lớp proxy ở phần trên.
WebMCP: Đáng theo dõi, chưa đáng để xây dựng theo
WebMCP là phiên bản phía trình duyệt của Model Context Protocol, quy ước mà các tác nhân dùng để gọi những công cụ có cấu trúc thay vì đoán mò. Thông báo về origin trial WebMCP của Chrome nêu thẳng mục tiêu: thay vì để tác nhân đoán xem một nút bấm hay ô nhập liệu làm gì, website có thể phơi ra những hàm có cấu trúc và các điều khiển được chú giải để tác nhân gọi trực tiếp.
Đây là nỗ lực đáng tin cậy đầu tiên nhằm cho các tác nhân một việc gì đó để làm trên website của bạn ngoài chuyện đọc, và điều đó khiến nó là thứ thú vị nhất trong bài này. Nó cũng đang thử nghiệm và còn dang dở: một origin trial trên Chrome 149, mở từ tháng 6 năm 2026. Hãy theo dõi bản đặc tả. Đừng vội đưa một phụ thuộc sản xuất nào lên nó, và cũng đừng đưa nó vào kế hoạch dung lượng.
Câu hỏi thường gặp
robots.txt có chặn được bot AI không?
Một phần thôi, và chính sự chính xác ấy mới là câu trả lời. Anthropic nói ClaudeBot, Claude-User và Claude-SearchBot đều tuân thủ robots.txt. Các trình thu thập tự động của OpenAI cũng dùng nó, nhưng OpenAI nói các quy tắc có thể không áp dụng cho ChatGPT-User; Perplexity thì nói Perplexity-User thường bỏ qua tệp này. Còn những scraper vô danh hoặc mạo danh thì nằm hoàn toàn ngoài tầm với của robots.txt.
llms.txt và robots.txt khác nhau ở chỗ nào?
Chúng giải quyết những bài toán khác nhau. robots.txt cho các trình thu thập chịu hợp tác biết chúng được phép tải gì, và đã được IETF chuẩn hóa. llms.txt là một tệp được đề xuất, cung cấp cho mô hình ngôn ngữ bản tóm tắt đã biên tập về nội dung của bạn, mà không hề đòi hỏi có thứ gì phải tải hay dùng nó. Trong phép đo tháng 5 năm 2026 của Ahrefs, 97% số tệp đã công bố không nhận được yêu cầu nào. Nếu bạn muốn có chỉ thị cho trình thu thập, robots.txt là cơ chế chuẩn; llms.txt là tùy chọn và hiện gần như không được dùng tới.
Làm sao để chặn GPTBot khỏi website của tôi?
Thêm hai dòng này vào tệp robots.txt ở thư mục gốc của website:
User-agent: GPTBot
Disallow: /
Như vậy website của bạn rút khỏi lượt thu thập huấn luyện tự động của GPTBot. OAI-SearchBot, vốn dùng cho tìm kiếm trong ChatGPT, và ChatGPT-User, vốn tải trang theo thao tác của người dùng, là những token riêng và không bị ảnh hưởng.
Chặn trình thu thập huấn luyện AI có chặn luôn việc lập chỉ mục của Google Tìm kiếm không?
Không, nếu bạn dùng đúng công cụ. Chặn Google-Extended không hề chặn Googlebot khỏi Tìm kiếm. Cái bẫy chỉ xuất hiện khi bạn dùng một cơ chế kiểm soát theo nhóm mà nó xếp một trình thu thập đa mục đích vào Training: chẳng hạn Cloudflare phân loại Googlebot, Applebot và Bingbot là vừa làm Search vừa làm Training, nên chặn nhóm Training ở đó cũng chặn luôn các danh tính trình thu thập ấy.
Làm sao biết bot AI đang thu thập dữ liệu website của tôi?
Hãy grep nhật ký truy cập của bạn để tìm các token đã được ghi nhận, rồi xác minh những gì tìm thấy:
grep -ohE 'GPTBot|ClaudeBot|CCBot|PerplexityBot|OAI-SearchBot|ChatGPT-User' \
/var/log/nginx/access.log | sort | uniq -c | sort -rn
Các con số này cho thấy những user agent nào đang ghé thăm và với tần suất ra sao. Vì chuỗi đó có thể bị giả mạo, hãy xác minh những kẻ vào nhiều nhất dựa trên dải IP mà nhà cung cấp công bố hoặc phương pháp reverse DNS của họ, trước khi hành động theo các con số.
Thảo luận
Bình luận
Đăng nhập để tham gia thảo luận.