Kiểm tra robots.txt có chặn crawler AI không, và chặn nhầm bot nào
Dán nội dung robots.txt vào, công cụ đối chiếu với mười bốn user-agent của các hãng AI lớn rồi cho biết từng bot đang được phép hay bị chặn, kèm giải thích bot đó phục vụ việc huấn luyện mô hình hay việc trích dẫn nguồn trong câu trả lời. Có sẵn ba khối robots.txt để chép: cho phép tất cả, chặn crawler huấn luyện nhưng giữ crawler trích dẫn, hoặc chặn tất cả.
Tính năng nổi bật
- Phân tích riêng mười bốn user-agent AI của OpenAI, Anthropic, Perplexity, Google, Apple, Meta, Amazon, ByteDance và Common Crawl
- Với mỗi bot cho biết đang được phép hay bị chặn, kèm đúng dòng luật đã quyết định kết quả đó
- Phân loại từng bot theo mục đích: huấn luyện mô hình, trích dẫn trong câu trả lời, hay tải trang theo yêu cầu người dùng
- Cảnh báo riêng khi bạn đang chặn nhầm nhóm bot phục vụ trích dẫn, tức nhóm mang lại lưu lượng truy cập
- Kiểm tra theo đường dẫn cụ thể, không chỉ trang gốc, để soi luật áp dụng cho từng khu vực của site
- Sinh sẵn ba khối robots.txt theo ba lựa chọn chính sách, chép một nút là xong
- Đánh dấu rõ Google-Extended và Applebot-Extended là token điều khiển chứ không phải crawler thật
- Chạy hoàn toàn trong trình duyệt, nội dung robots.txt bạn dán vào không rời khỏi máy
Vì sao cần một công cụ soi riêng nhóm user-agent AI
Phần lớn file robots.txt trên site Việt Nam được viết từ nhiều năm trước, khi danh sách crawler còn gói gọn trong Googlebot và Bingbot. Từ năm 2023 tới nay, hàng loạt user-agent mới xuất hiện, và chúng khác nhau về bản chất theo cách mà tên gọi không hề gợi ra. GPTBot lấy dữ liệu huấn luyện, còn OAI-SearchBot lập chỉ mục để ChatGPT trích dẫn kèm link về site bạn. Hai bot cùng của OpenAI nhưng chặn nhầm cái thứ hai là tự cắt một nguồn truy cập đang lớn dần. Tình huống hay gặp nhất trong thực tế là chủ site đọc một bài viết khuyên chặn AI, rồi dán vào robots.txt một khối chặn hết tất cả những gì có chữ AI hoặc GPT, và vô tình khóa luôn nhóm bot đưa link site mình vào phần nguồn của câu trả lời. Công cụ này làm đúng một việc mà ba công cụ robots.txt còn lại trên site không làm: nó không kiểm tra cú pháp chung chung mà đối chiếu file của bạn với danh sách user-agent AI cụ thể, rồi giải thích hậu quả thực tế của từng lựa chọn bằng ngôn ngữ dễ hiểu.
Lợi ích khi sử dụng
- Biết chính xác mình đang chặn ai, thay vì đoán từ một khối luật chép ở đâu đó về
- Phân biệt được bot huấn luyện với bot trích dẫn, hai thứ có hậu quả kinh doanh trái ngược nhau
- Có ngay khối robots.txt phù hợp với chính sách đã chọn, không cần tự gõ tên từng bot
- Danh sách user-agent gom về một chỗ kèm nguồn tài liệu chính thức để tự rà lại
- Không cần cài đặt, không gửi nội dung file đi đâu, dùng được cả với site nội bộ
Cách kiểm tra robots.txt với nhóm crawler AI
- 1Mở địa chỉ tên miền của bạn kèm đuôi gạch chéo robots.txt trên trình duyệt, bấm Ctrl+A rồi Ctrl+C để chép toàn bộ nội dung.
- 2Dán nội dung vừa chép vào ô văn bản lớn ở khối bên trái, kết quả phân tích cập nhật ngay không cần bấm nút.
- 3Để nguyên dấu gạch chéo ở ô đường dẫn nếu muốn kiểm tra trang gốc, hoặc nhập đường dẫn cụ thể như /blog để soi riêng khu vực đó.
- 4Đọc bảng kết quả theo từng user-agent, chú ý cột mục đích để biết bot nào phục vụ huấn luyện và bot nào phục vụ trích dẫn.
- 5Chọn một trong ba khối robots.txt sinh sẵn ở cuối trang, chép rồi dán vào cuối file robots.txt hiện có trên máy chủ, đừng thay thế toàn bộ file.
Ba nhóm crawler AI và hậu quả kinh doanh khác nhau của việc chặn
Toàn bộ user-agent AI hiện nay chia được thành ba nhóm theo mục đích sử dụng dữ liệu, và đây là phân biệt quan trọng nhất cần nắm. Nhóm thứ nhất là crawler lấy dữ liệu huấn luyện, gồm GPTBot của OpenAI, ClaudeBot của Anthropic, CCBot của Common Crawl, Bytespider của ByteDance và meta-externalagent của Meta. Chúng đọc nội dung để đưa vào tập dữ liệu huấn luyện mô hình thế hệ sau, và việc này không mang lại lượt truy cập nào cho bạn. Nhóm thứ hai là crawler phục vụ tìm kiếm và trích dẫn, gồm OAI-SearchBot, Claude-SearchBot, PerplexityBot và Amazonbot. Chúng lập chỉ mục để khi người dùng hỏi, câu trả lời hiện kèm thẻ nguồn có link dẫn về site bạn, tức là chúng mang lại lượt truy cập thật. Nhóm thứ ba là bot tải trang theo yêu cầu tức thời của người dùng, gồm ChatGPT-User, Claude-User và Perplexity-User. Chúng chỉ chạy khi có người dán link hoặc yêu cầu mở trang cụ thể, và chặn chúng nghĩa là người dùng đưa link site bạn vào trợ lý AI sẽ nhận thông báo không đọc được. Ba nhóm này cần ba quyết định khác nhau, gộp chung thành một là gốc của gần như mọi sai lầm cấu hình.
Google-Extended và Applebot-Extended không phải crawler, và điều đó có ý nghĩa gì
Hai cái tên này gây nhầm lẫn nhiều nhất vì chúng nằm trong robots.txt như mọi user-agent khác nhưng bản chất hoàn toàn khác. Không có con bot nào tự xưng là Google-Extended đi thu thập trang của bạn cả. Đây là token điều khiển: Googlebot vẫn thu thập nội dung site bình thường cho Google Tìm kiếm, còn dòng khai báo Google-Extended chỉ quyết định phần nội dung đã thu thập đó có được dùng để huấn luyện Gemini và các tính năng AI sinh nội dung hay không. Hệ quả thực tế rất đáng chú ý: đặt Disallow cho Google-Extended hoàn toàn không ảnh hưởng tới việc lập chỉ mục hay thứ hạng của bạn trên Google Tìm kiếm. Đây là lựa chọn gần như không rủi ro cho ai muốn giữ nội dung khỏi tập huấn luyện. Applebot-Extended hoạt động theo đúng cơ chế đó với Apple: Applebot vẫn thu thập cho Siri và Spotlight, còn token Extended chỉ chi phối việc dùng dữ liệu để huấn luyện mô hình nền. Nắm được điểm này giúp bạn tránh nỗi sợ vô căn cứ rằng cứ chặn thứ gì của Google là mất thứ hạng.
Robots.txt hoạt động theo nguyên tắc nào khi có nhiều nhóm chồng nhau
Hiểu sai cơ chế khớp luật dẫn tới việc chủ site tưởng mình đã chặn nhưng thực ra chưa, hoặc ngược lại. Quy tắc thứ nhất là chọn nhóm: crawler đọc toàn bộ file, tìm nhóm nào có dòng User-agent ghi đúng tên nó, và chỉ tuân theo nhóm đó. Nhóm có dấu sao chỉ được dùng khi không có nhóm nào ghi đích danh tên bot. Nghĩa là nếu bạn viết một khối User-agent dấu sao với Disallow gạch chéo để chặn cả site, rồi bên dưới có riêng một khối User-agent GPTBot với Allow gạch chéo, thì GPTBot vẫn vào được, vì nó tuân theo khối riêng của nó và bỏ qua hoàn toàn khối dấu sao. Quy tắc thứ hai là trong cùng một nhóm, luật có đường dẫn dài nhất khớp với URL sẽ thắng, không phải luật đứng đầu tiên. Nếu độ dài bằng nhau, Allow thắng Disallow. Quy tắc thứ ba là dòng Disallow để trống nghĩa là không chặn gì cả, khác hẳn Disallow kèm dấu gạch chéo là chặn toàn site, và nhầm hai dòng này là lỗi kinh điển. Công cụ này áp dụng đúng ba quy tắc trên và hiển thị dòng luật thắng ở cột cuối bảng để bạn tự đối chiếu.
Nên chọn chính sách nào cho site của bạn
Không có câu trả lời đúng cho mọi trường hợp, nhưng có thể suy ra từ mô hình kinh doanh. Nếu site của bạn tồn tại để bán hàng hoặc bán dịch vụ, nội dung chỉ là phương tiện thu hút khách, thì lựa chọn hợp lý là chặn crawler huấn luyện và mở hoàn toàn cho crawler trích dẫn. Bạn không mất gì khi nội dung không vào tập huấn luyện, nhưng mất rất nhiều nếu tên công ty biến mất khỏi câu trả lời của trợ lý AI, nơi ngày càng nhiều người bắt đầu hành trình tìm nhà cung cấp. Nếu site của bạn bán chính nội dung, chẳng hạn báo điện tử thu phí, khóa học trực tuyến hay cơ sở dữ liệu chuyên ngành, thì cân nhắc chặn chặt hơn, vì mô hình học được nội dung của bạn rồi trả lời thay bạn là mất doanh thu trực tiếp. Nếu site là tài liệu kỹ thuật của một sản phẩm phần mềm, hãy mở hết, vì mô hình biết cách dùng sản phẩm của bạn là lợi thế cạnh tranh chứ không phải thiệt hại. Trường hợp duy nhất nên chặn tất cả là site nội bộ hoặc nội dung nhạy cảm, và khi đó robots.txt cũng không phải công cụ đủ mạnh, hãy dùng xác thực đăng nhập.
Giới hạn của robots.txt và những việc nó không làm được
Robots.txt là quy ước tự nguyện, không phải hàng rào kỹ thuật. Bot nghiêm túc của các hãng lớn tuân thủ, nhưng bot lậu hoàn toàn có thể bỏ qua, thậm chí giả mạo user-agent của bot khác. Kiểm chứng bằng cách xem log truy cập máy chủ và đối chiếu địa chỉ IP với dải IP mà hãng công bố, đây là cách duy nhất biết chắc bot có thật hay không. Điểm giới hạn thứ hai: robots.txt chỉ ngăn việc thu thập, không xóa được nội dung đã bị lấy trước đó. Dữ liệu vào tập huấn luyện rồi thì việc thêm dòng Disallow hôm nay không rút nó ra được. Điểm thứ ba, và hay bị bỏ sót nhất: chặn crawler không ngăn được nội dung của bạn xuất hiện gián tiếp qua site khác đã sao chép lại bài viết của bạn. Cuối cùng, file này công khai với mọi người, nên đừng liệt kê trong đó những đường dẫn nhạy cảm mà bạn muốn giấu, vì làm vậy chẳng khác nào đưa danh sách cho người tò mò. Với nội dung thật sự cần bảo vệ, hãy đặt sau lớp đăng nhập, đó là biện pháp duy nhất có hiệu lực thực sự.
Câu hỏi thường gặp (FAQ)
Vì sao công cụ không tự tải robots.txt từ URL tôi nhập?
Vì trình duyệt chặn yêu cầu sang tên miền khác theo chính sách CORS, mọi công cụ chạy hoàn toàn phía người dùng đều gặp rào này. Bù lại, nội dung bạn dán vào không rời khỏi máy. Cách lấy file nhanh nhất là mở địa chỉ tên miền kèm gạch chéo robots.txt rồi bấm Ctrl+A và Ctrl+C.
Chặn GPTBot có làm ChatGPT không nhắc tới website của tôi nữa không?
Không. GPTBot chỉ lấy dữ liệu huấn luyện. Bot phụ trách việc đưa link site bạn vào câu trả lời khi ChatGPT tìm kiếm trực tuyến là OAI-SearchBot, một user-agent hoàn toàn khác. Muốn vừa giữ nội dung khỏi tập huấn luyện vừa được trích dẫn, hãy chặn GPTBot và mở OAI-SearchBot.
Chặn Google-Extended có tụt thứ hạng trên Google không?
Không. Google-Extended không phải crawler mà chỉ là token điều khiển việc dùng dữ liệu cho Gemini và các tính năng AI sinh nội dung. Googlebot vẫn thu thập và lập chỉ mục site bạn y như cũ. Đây là lựa chọn gần như không có rủi ro nếu bạn muốn giữ nội dung khỏi tập huấn luyện.
Tôi đã có ba công cụ robots.txt khác trên site này, dùng cái nào cho việc gì?
Robots.txt Generator để dựng nguyên file từ đầu, Robots.txt Validator để soát cú pháp toàn file, Robots Meta Checker để soi thẻ meta robots ở mức từng trang. Trang này chỉ làm một việc ba công cụ kia không làm: đối chiếu với danh sách user-agent AI và giải thích mục đích từng bot.
Vì sao khối User-agent dấu sao chặn hết site mà GPTBot vẫn được phép?
Vì crawler chỉ tuân theo nhóm ghi đích danh tên nó, và chỉ dùng nhóm dấu sao khi không tìm thấy nhóm riêng. Nếu file của bạn có một khối User-agent GPTBot riêng, khối đó thắng hoàn toàn khối dấu sao, kể cả khi nó nằm phía dưới trong file.
Dòng Disallow để trống khác gì Disallow kèm dấu gạch chéo?
Khác hoàn toàn và đây là lỗi kinh điển. Disallow để trống nghĩa là không chặn gì cả, tức cho phép toàn bộ. Disallow kèm một dấu gạch chéo nghĩa là chặn toàn bộ site. Viết nhầm một ký tự là đảo ngược hẳn ý định của bạn.
Chặn rồi thì nội dung đã bị lấy trước đó có bị xóa khỏi mô hình không?
Không. Robots.txt chỉ ngăn việc thu thập từ lúc bạn thêm dòng luật trở đi, nó không có tác dụng hồi tố. Dữ liệu đã vào tập huấn luyện của một mô hình đã phát hành thì không rút ra được bằng cách sửa file này.
Bot có thể giả mạo user-agent để lách robots.txt không?
Có, và robots.txt vốn là quy ước tự nguyện chứ không phải hàng rào kỹ thuật. Bot của các hãng lớn tuân thủ, bot lậu thì không. Muốn kiểm chứng, hãy xem log máy chủ và đối chiếu địa chỉ IP truy cập với dải IP mà từng hãng công bố công khai.
Chặn meta-externalagent có làm mất ảnh xem trước khi chia sẻ lên Facebook không?
Không. Việc dựng ảnh và tiêu đề xem trước khi chia sẻ link do một bot khác của Meta đảm nhiệm. Bot meta-externalagent chỉ thu thập nội dung phục vụ huấn luyện mô hình AI của họ. Hai việc tách bạch, chặn cái này không ảnh hưởng cái kia.
Danh sách mười bốn bot này có còn đúng không?
Danh sách trong công cụ tham chiếu tháng 08/2025 và các hãng vẫn thêm bớt user-agent theo thời gian. Toàn bộ danh sách được đặt thành một hằng số duy nhất trong mã nguồn kèm địa chỉ trang tài liệu chính thức của từng hãng, để việc rà soát định kỳ chỉ phải sửa ở một chỗ.
Tôi nên chặn hay mở crawler AI cho website doanh nghiệp dịch vụ?
Với site bán dịch vụ, lựa chọn cân bằng là chặn nhóm crawler huấn luyện và mở hoàn toàn nhóm crawler trích dẫn. Nội dung không vào tập huấn luyện thì bạn không mất gì đáng kể, nhưng biến mất khỏi phần nguồn trong câu trả lời của trợ lý AI là mất một kênh tìm khách đang lớn dần.
Khối robots.txt sinh sẵn có dán đè lên file cũ được không?
Không nên. Hãy dán vào cuối file hiện có, vì phần khai báo cho crawler thường và dòng Sitemap vẫn cần giữ nguyên. Sau khi tải lên máy chủ, mở lại địa chỉ robots.txt trên trình duyệt để chắc chắn nội dung mới đã có hiệu lực, rồi dán ngược vào đây kiểm tra lần cuối.
Từ khóa liên quan
- kiểm tra robots.txt chặn AI
- chặn GPTBot
- chặn ClaudeBot
- PerplexityBot là gì
- Google-Extended robots.txt
- Applebot-Extended
- OAI-SearchBot
- CCBot common crawl
- Bytespider chặn thế nào
- meta-externalagent
- user agent crawler AI
- chặn AI thu thập nội dung website
- cho phép AI trích dẫn website
- robots.txt cho AI search
- GEO tối ưu cho công cụ AI
- AI crawler checker
- ChatGPT-User user agent
- bot huấn luyện và bot trích dẫn
- kiểm tra file robots txt online
- bảo vệ nội dung khỏi AI
