Tan Phat Media

AI Crawler Checker

Soi riêng nhóm user-agent AI trong robots.txt và cho biết từng bot phục vụ mục đích gì

Lấy nội dung robots.txt của bạn

Công cụ không tự tải file về từ URL. Trình duyệt chặn yêu cầu sang tên miền khác vì chính sách CORS, nên mọi công cụ chạy hoàn toàn trong trình duyệt đều phải nhận nội dung dán tay. Đổi lại, nội dung bạn dán không rời khỏi máy.

Cách lấy nhanh nhất: mở https://tenmiencuaban.com/robots.txt trên trình duyệt, bấm Ctrl+A rồi Ctrl+C, dán vào ô bên dưới. Trên máy chủ Linux có thể dùng curl https://tenmiencuaban.com/robots.txt. Nếu site chạy WordPress mà file nằm trong Yoast hoặc Rank Math, vào mục sửa robots.txt của plugin để chép nguyên văn.

Nội dung robots.txt

Mặc định kiểm tra trang gốc. Nhập đường dẫn cụ thể như /blog/bai-viet để xem luật nào áp dụng cho riêng trang đó.

Tổng quan

Bot được phép

12

Bot bị chặn

2

Bot huấn luyện bị chặn

2

Bot trích dẫn bị chặn

0

Công cụ này khác gì ba công cụ robots.txt kia

Trang này chỉ làm đúng một việc: đối chiếu file robots.txt của bạn với danh sách user-agent của các hãng AI và giải thích mỗi bot phục vụ mục đích gì. Nó không dạy cú pháp robots.txt cơ bản, không kiểm tra sitemap, không đọc thẻ meta.

Cần việc khác thì dùng đúng công cụ của nó:

  • Robots.txt Generator — dựng nguyên file robots.txt từ đầu, gồm cả crawler thường và khai báo sitemap.
  • Robots.txt Validator — kiểm tra cú pháp toàn file, bắt lỗi viết sai chỉ thị và thứ tự nhóm.
  • Robots Meta Checker — soi thẻ meta robots và header X-Robots-Tag ở mức từng trang, thứ robots.txt không đụng tới.
Kết quả theo từng user-agent AI
User-agentHãngMục đíchTrạng tháiLuật quyết định
GPTBotOpenAIHuấn luyện mô hìnhBị chặnDisallow: / (trong nhóm User-agent: GPTBot)
OAI-SearchBotOpenAITrích dẫn trong câu trả lờiĐược phépAllow: / (trong nhóm User-agent: *)
ChatGPT-UserOpenAITải trang theo yêu cầu người dùngĐược phépAllow: / (trong nhóm User-agent: *)
ClaudeBotAnthropicHuấn luyện mô hìnhĐược phépAllow: / (trong nhóm User-agent: *)
Claude-UserAnthropicTải trang theo yêu cầu người dùngĐược phépAllow: / (trong nhóm User-agent: *)
Claude-SearchBotAnthropicTrích dẫn trong câu trả lờiĐược phépAllow: / (trong nhóm User-agent: *)
PerplexityBotPerplexityTrích dẫn trong câu trả lờiĐược phépAllow: / (trong nhóm User-agent: PerplexityBot)
Perplexity-UserPerplexityTải trang theo yêu cầu người dùngĐược phépAllow: / (trong nhóm User-agent: *)
Google-Extended
token điều khiển
GoogleHuấn luyện mô hìnhĐược phépAllow: / (trong nhóm User-agent: *)
Applebot-Extended
token điều khiển
AppleHuấn luyện mô hìnhĐược phépAllow: / (trong nhóm User-agent: *)
CCBotCommon CrawlHuấn luyện mô hìnhBị chặnDisallow: / (trong nhóm User-agent: CCBot)
BytespiderByteDanceHuấn luyện mô hìnhĐược phépAllow: / (trong nhóm User-agent: *)
meta-externalagentMetaHuấn luyện mô hìnhĐược phépAllow: / (trong nhóm User-agent: *)
AmazonbotAmazonTrích dẫn trong câu trả lờiĐược phépAllow: / (trong nhóm User-agent: *)

GPTBot

Bị chặn

Thu thập nội dung để đưa vào dữ liệu huấn luyện các mô hình GPT thế hệ sau.

Nếu chặn: Nội dung của bạn không vào tập huấn luyện mới. Không ảnh hưởng tới việc ChatGPT trích dẫn bạn khi tìm kiếm trực tuyến.

https://platform.openai.com/docs/bots

OAI-SearchBot

Được phép

Lập chỉ mục trang để ChatGPT hiển thị và trích dẫn kèm liên kết trong phần tìm kiếm.

Nếu chặn: Site của bạn biến mất khỏi kết quả tìm kiếm trong ChatGPT. Đây thường là điều bạn không muốn.

https://platform.openai.com/docs/bots

ChatGPT-User

Được phép

Tải một trang cụ thể ngay lúc người dùng dán link hoặc yêu cầu ChatGPT mở trang đó.

Nếu chặn: Người dùng dán link site bạn vào ChatGPT sẽ nhận thông báo không đọc được nội dung.

https://platform.openai.com/docs/bots

ClaudeBot

Được phép

Thu thập nội dung phục vụ huấn luyện mô hình Claude.

Nếu chặn: Nội dung không vào tập huấn luyện. Không ảnh hưởng tới khả năng Claude mở link theo yêu cầu người dùng.

https://support.anthropic.com

Claude-User

Được phép

Tải trang theo yêu cầu trực tiếp của người dùng trong một phiên trò chuyện.

Nếu chặn: Người dùng yêu cầu Claude đọc trang của bạn sẽ bị từ chối.

https://support.anthropic.com

Claude-SearchBot

Được phép

Lập chỉ mục để Claude tìm và trích dẫn nguồn khi trả lời câu hỏi cần thông tin ngoài.

Nếu chặn: Site khó được Claude nêu làm nguồn tham khảo trong câu trả lời.

https://support.anthropic.com

PerplexityBot

Được phép

Lập chỉ mục cho công cụ trả lời của Perplexity, nguồn được hiện thành thẻ trích dẫn có link.

Nếu chặn: Mất hoàn toàn cơ hội xuất hiện trong phần nguồn của Perplexity.

https://docs.perplexity.ai/guides/bots

Perplexity-User

Được phép

Tải trang khi người dùng bấm vào một liên kết hoặc yêu cầu đọc trang cụ thể.

Nếu chặn: Yêu cầu đọc trực tiếp trang của bạn sẽ không thực hiện được.

https://docs.perplexity.ai/guides/bots

Google-Extended

Được phép

Không phải crawler. Đây là token điều khiển riêng, quyết định nội dung đã thu thập có được dùng cho Gemini và các tính năng AI sinh nội dung hay không.

Nếu chặn: Nội dung không dùng để huấn luyện Gemini. Thứ hạng và việc lập chỉ mục trong Google Tìm kiếm hoàn toàn không đổi.

https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Applebot-Extended

Được phép

Không phải crawler. Token điều khiển việc dữ liệu Applebot đã thu thập có được dùng huấn luyện mô hình nền của Apple hay không.

Nếu chặn: Nội dung không vào tập huấn luyện của Apple. Applebot vẫn thu thập bình thường cho tìm kiếm Siri và Spotlight.

https://support.apple.com/en-us/119829

CCBot

Bị chặn

Crawler của tổ chức phi lợi nhuận Common Crawl. Kho dữ liệu này được rất nhiều bên tải về dùng làm nguyên liệu huấn luyện.

Nếu chặn: Nội dung không vào kho Common Crawl, gián tiếp giảm khả năng bị nhiều mô hình khác nhau dùng lại.

https://commoncrawl.org/ccbot

Bytespider

Được phép

Crawler của ByteDance, công ty mẹ TikTok, thu thập dữ liệu cho các sản phẩm AI của họ.

Nếu chặn: Nội dung không vào dữ liệu huấn luyện của ByteDance. Bot này có tiếng là truy cập với tần suất cao.

https://support.bytedance.com

meta-externalagent

Được phép

Crawler của Meta, thu thập nội dung cho việc huấn luyện các mô hình AI của họ.

Nếu chặn: Nội dung không vào tập huấn luyện của Meta. Không ảnh hưởng tới ảnh xem trước khi chia sẻ link lên Facebook, việc đó do một bot khác lo.

https://developers.facebook.com/docs/sharing/webmasters/web-crawlers/

Amazonbot

Được phép

Thu thập nội dung phục vụ trợ lý Alexa trả lời câu hỏi và cải thiện tìm kiếm của Amazon.

Nếu chặn: Nội dung không được Alexa dùng để trả lời.

https://developer.amazon.com/en/amazonbot

Sinh sẵn khối robots.txt cho crawler AI
# Khối khai báo cho nhóm crawler AI
# Sinh bằng công cụ AI Crawler Checker của Tấn Phát Digital
# Danh sách user-agent tham chiếu tháng 08/2025, nên rà lại mỗi vài tháng

# Chặn crawler lấy dữ liệu huấn luyện, giữ nguyên crawler phục vụ trích dẫn.
# Đây là lựa chọn cân bằng: nội dung không bị đem đi huấn luyện,
# nhưng site vẫn xuất hiện trong phần nguồn của ChatGPT, Claude và Perplexity.

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: meta-externalagent
Disallow: /

# Các bot dưới đây phục vụ tìm kiếm và trích dẫn, nên để mở

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Amazonbot
Allow: /

Dán khối vừa chép vào cuối file robots.txt hiện có, đừng thay thế toàn bộ file vì phần khai báo cho crawler thường và dòng Sitemap vẫn cần giữ. Sau khi tải file lên, mở lại địa chỉ robots.txt trên trình duyệt để chắc chắn nội dung mới đã có hiệu lực, rồi dán ngược vào đây kiểm tra lần cuối.

Hợp tác ngay với Tấn Phát Digital

Chúng tôi không chỉ thiết kế website, mà còn giúp doanh nghiệp xây dựng thương hiệu số mạnh mẽ. Cung cấp dịch vụ thiết kế website trọn gói từ thiết kế đến tối ưu SEO. Hãy liên hệ ngay với Tấn Phát Digital để cùng tạo nên những giải pháp công nghệ đột phá, hiệu quả và bền vững cho doanh nghiệp của bạn tại Hồ Chí Minh.

Kiểm tra robots.txt có chặn crawler AI không, và chặn nhầm bot nào

Dán nội dung robots.txt vào, công cụ đối chiếu với mười bốn user-agent của các hãng AI lớn rồi cho biết từng bot đang được phép hay bị chặn, kèm giải thích bot đó phục vụ việc huấn luyện mô hình hay việc trích dẫn nguồn trong câu trả lời. Có sẵn ba khối robots.txt để chép: cho phép tất cả, chặn crawler huấn luyện nhưng giữ crawler trích dẫn, hoặc chặn tất cả.

Tính năng nổi bật

  • Phân tích riêng mười bốn user-agent AI của OpenAI, Anthropic, Perplexity, Google, Apple, Meta, Amazon, ByteDance và Common Crawl
  • Với mỗi bot cho biết đang được phép hay bị chặn, kèm đúng dòng luật đã quyết định kết quả đó
  • Phân loại từng bot theo mục đích: huấn luyện mô hình, trích dẫn trong câu trả lời, hay tải trang theo yêu cầu người dùng
  • Cảnh báo riêng khi bạn đang chặn nhầm nhóm bot phục vụ trích dẫn, tức nhóm mang lại lưu lượng truy cập
  • Kiểm tra theo đường dẫn cụ thể, không chỉ trang gốc, để soi luật áp dụng cho từng khu vực của site
  • Sinh sẵn ba khối robots.txt theo ba lựa chọn chính sách, chép một nút là xong
  • Đánh dấu rõ Google-Extended và Applebot-Extended là token điều khiển chứ không phải crawler thật
  • Chạy hoàn toàn trong trình duyệt, nội dung robots.txt bạn dán vào không rời khỏi máy

Vì sao cần một công cụ soi riêng nhóm user-agent AI

Phần lớn file robots.txt trên site Việt Nam được viết từ nhiều năm trước, khi danh sách crawler còn gói gọn trong Googlebot và Bingbot. Từ năm 2023 tới nay, hàng loạt user-agent mới xuất hiện, và chúng khác nhau về bản chất theo cách mà tên gọi không hề gợi ra. GPTBot lấy dữ liệu huấn luyện, còn OAI-SearchBot lập chỉ mục để ChatGPT trích dẫn kèm link về site bạn. Hai bot cùng của OpenAI nhưng chặn nhầm cái thứ hai là tự cắt một nguồn truy cập đang lớn dần. Tình huống hay gặp nhất trong thực tế là chủ site đọc một bài viết khuyên chặn AI, rồi dán vào robots.txt một khối chặn hết tất cả những gì có chữ AI hoặc GPT, và vô tình khóa luôn nhóm bot đưa link site mình vào phần nguồn của câu trả lời. Công cụ này làm đúng một việc mà ba công cụ robots.txt còn lại trên site không làm: nó không kiểm tra cú pháp chung chung mà đối chiếu file của bạn với danh sách user-agent AI cụ thể, rồi giải thích hậu quả thực tế của từng lựa chọn bằng ngôn ngữ dễ hiểu.

Lợi ích khi sử dụng

  • Biết chính xác mình đang chặn ai, thay vì đoán từ một khối luật chép ở đâu đó về
  • Phân biệt được bot huấn luyện với bot trích dẫn, hai thứ có hậu quả kinh doanh trái ngược nhau
  • Có ngay khối robots.txt phù hợp với chính sách đã chọn, không cần tự gõ tên từng bot
  • Danh sách user-agent gom về một chỗ kèm nguồn tài liệu chính thức để tự rà lại
  • Không cần cài đặt, không gửi nội dung file đi đâu, dùng được cả với site nội bộ

Cách kiểm tra robots.txt với nhóm crawler AI

  1. 1Mở địa chỉ tên miền của bạn kèm đuôi gạch chéo robots.txt trên trình duyệt, bấm Ctrl+A rồi Ctrl+C để chép toàn bộ nội dung.
  2. 2Dán nội dung vừa chép vào ô văn bản lớn ở khối bên trái, kết quả phân tích cập nhật ngay không cần bấm nút.
  3. 3Để nguyên dấu gạch chéo ở ô đường dẫn nếu muốn kiểm tra trang gốc, hoặc nhập đường dẫn cụ thể như /blog để soi riêng khu vực đó.
  4. 4Đọc bảng kết quả theo từng user-agent, chú ý cột mục đích để biết bot nào phục vụ huấn luyện và bot nào phục vụ trích dẫn.
  5. 5Chọn một trong ba khối robots.txt sinh sẵn ở cuối trang, chép rồi dán vào cuối file robots.txt hiện có trên máy chủ, đừng thay thế toàn bộ file.

Ba nhóm crawler AI và hậu quả kinh doanh khác nhau của việc chặn

Toàn bộ user-agent AI hiện nay chia được thành ba nhóm theo mục đích sử dụng dữ liệu, và đây là phân biệt quan trọng nhất cần nắm. Nhóm thứ nhất là crawler lấy dữ liệu huấn luyện, gồm GPTBot của OpenAI, ClaudeBot của Anthropic, CCBot của Common Crawl, Bytespider của ByteDance và meta-externalagent của Meta. Chúng đọc nội dung để đưa vào tập dữ liệu huấn luyện mô hình thế hệ sau, và việc này không mang lại lượt truy cập nào cho bạn. Nhóm thứ hai là crawler phục vụ tìm kiếm và trích dẫn, gồm OAI-SearchBot, Claude-SearchBot, PerplexityBot và Amazonbot. Chúng lập chỉ mục để khi người dùng hỏi, câu trả lời hiện kèm thẻ nguồn có link dẫn về site bạn, tức là chúng mang lại lượt truy cập thật. Nhóm thứ ba là bot tải trang theo yêu cầu tức thời của người dùng, gồm ChatGPT-User, Claude-User và Perplexity-User. Chúng chỉ chạy khi có người dán link hoặc yêu cầu mở trang cụ thể, và chặn chúng nghĩa là người dùng đưa link site bạn vào trợ lý AI sẽ nhận thông báo không đọc được. Ba nhóm này cần ba quyết định khác nhau, gộp chung thành một là gốc của gần như mọi sai lầm cấu hình.

Google-Extended và Applebot-Extended không phải crawler, và điều đó có ý nghĩa gì

Hai cái tên này gây nhầm lẫn nhiều nhất vì chúng nằm trong robots.txt như mọi user-agent khác nhưng bản chất hoàn toàn khác. Không có con bot nào tự xưng là Google-Extended đi thu thập trang của bạn cả. Đây là token điều khiển: Googlebot vẫn thu thập nội dung site bình thường cho Google Tìm kiếm, còn dòng khai báo Google-Extended chỉ quyết định phần nội dung đã thu thập đó có được dùng để huấn luyện Gemini và các tính năng AI sinh nội dung hay không. Hệ quả thực tế rất đáng chú ý: đặt Disallow cho Google-Extended hoàn toàn không ảnh hưởng tới việc lập chỉ mục hay thứ hạng của bạn trên Google Tìm kiếm. Đây là lựa chọn gần như không rủi ro cho ai muốn giữ nội dung khỏi tập huấn luyện. Applebot-Extended hoạt động theo đúng cơ chế đó với Apple: Applebot vẫn thu thập cho Siri và Spotlight, còn token Extended chỉ chi phối việc dùng dữ liệu để huấn luyện mô hình nền. Nắm được điểm này giúp bạn tránh nỗi sợ vô căn cứ rằng cứ chặn thứ gì của Google là mất thứ hạng.

Robots.txt hoạt động theo nguyên tắc nào khi có nhiều nhóm chồng nhau

Hiểu sai cơ chế khớp luật dẫn tới việc chủ site tưởng mình đã chặn nhưng thực ra chưa, hoặc ngược lại. Quy tắc thứ nhất là chọn nhóm: crawler đọc toàn bộ file, tìm nhóm nào có dòng User-agent ghi đúng tên nó, và chỉ tuân theo nhóm đó. Nhóm có dấu sao chỉ được dùng khi không có nhóm nào ghi đích danh tên bot. Nghĩa là nếu bạn viết một khối User-agent dấu sao với Disallow gạch chéo để chặn cả site, rồi bên dưới có riêng một khối User-agent GPTBot với Allow gạch chéo, thì GPTBot vẫn vào được, vì nó tuân theo khối riêng của nó và bỏ qua hoàn toàn khối dấu sao. Quy tắc thứ hai là trong cùng một nhóm, luật có đường dẫn dài nhất khớp với URL sẽ thắng, không phải luật đứng đầu tiên. Nếu độ dài bằng nhau, Allow thắng Disallow. Quy tắc thứ ba là dòng Disallow để trống nghĩa là không chặn gì cả, khác hẳn Disallow kèm dấu gạch chéo là chặn toàn site, và nhầm hai dòng này là lỗi kinh điển. Công cụ này áp dụng đúng ba quy tắc trên và hiển thị dòng luật thắng ở cột cuối bảng để bạn tự đối chiếu.

Nên chọn chính sách nào cho site của bạn

Không có câu trả lời đúng cho mọi trường hợp, nhưng có thể suy ra từ mô hình kinh doanh. Nếu site của bạn tồn tại để bán hàng hoặc bán dịch vụ, nội dung chỉ là phương tiện thu hút khách, thì lựa chọn hợp lý là chặn crawler huấn luyện và mở hoàn toàn cho crawler trích dẫn. Bạn không mất gì khi nội dung không vào tập huấn luyện, nhưng mất rất nhiều nếu tên công ty biến mất khỏi câu trả lời của trợ lý AI, nơi ngày càng nhiều người bắt đầu hành trình tìm nhà cung cấp. Nếu site của bạn bán chính nội dung, chẳng hạn báo điện tử thu phí, khóa học trực tuyến hay cơ sở dữ liệu chuyên ngành, thì cân nhắc chặn chặt hơn, vì mô hình học được nội dung của bạn rồi trả lời thay bạn là mất doanh thu trực tiếp. Nếu site là tài liệu kỹ thuật của một sản phẩm phần mềm, hãy mở hết, vì mô hình biết cách dùng sản phẩm của bạn là lợi thế cạnh tranh chứ không phải thiệt hại. Trường hợp duy nhất nên chặn tất cả là site nội bộ hoặc nội dung nhạy cảm, và khi đó robots.txt cũng không phải công cụ đủ mạnh, hãy dùng xác thực đăng nhập.

Giới hạn của robots.txt và những việc nó không làm được

Robots.txt là quy ước tự nguyện, không phải hàng rào kỹ thuật. Bot nghiêm túc của các hãng lớn tuân thủ, nhưng bot lậu hoàn toàn có thể bỏ qua, thậm chí giả mạo user-agent của bot khác. Kiểm chứng bằng cách xem log truy cập máy chủ và đối chiếu địa chỉ IP với dải IP mà hãng công bố, đây là cách duy nhất biết chắc bot có thật hay không. Điểm giới hạn thứ hai: robots.txt chỉ ngăn việc thu thập, không xóa được nội dung đã bị lấy trước đó. Dữ liệu vào tập huấn luyện rồi thì việc thêm dòng Disallow hôm nay không rút nó ra được. Điểm thứ ba, và hay bị bỏ sót nhất: chặn crawler không ngăn được nội dung của bạn xuất hiện gián tiếp qua site khác đã sao chép lại bài viết của bạn. Cuối cùng, file này công khai với mọi người, nên đừng liệt kê trong đó những đường dẫn nhạy cảm mà bạn muốn giấu, vì làm vậy chẳng khác nào đưa danh sách cho người tò mò. Với nội dung thật sự cần bảo vệ, hãy đặt sau lớp đăng nhập, đó là biện pháp duy nhất có hiệu lực thực sự.

Câu hỏi thường gặp (FAQ)

Vì sao công cụ không tự tải robots.txt từ URL tôi nhập?

Vì trình duyệt chặn yêu cầu sang tên miền khác theo chính sách CORS, mọi công cụ chạy hoàn toàn phía người dùng đều gặp rào này. Bù lại, nội dung bạn dán vào không rời khỏi máy. Cách lấy file nhanh nhất là mở địa chỉ tên miền kèm gạch chéo robots.txt rồi bấm Ctrl+A và Ctrl+C.

Chặn GPTBot có làm ChatGPT không nhắc tới website của tôi nữa không?

Không. GPTBot chỉ lấy dữ liệu huấn luyện. Bot phụ trách việc đưa link site bạn vào câu trả lời khi ChatGPT tìm kiếm trực tuyến là OAI-SearchBot, một user-agent hoàn toàn khác. Muốn vừa giữ nội dung khỏi tập huấn luyện vừa được trích dẫn, hãy chặn GPTBot và mở OAI-SearchBot.

Chặn Google-Extended có tụt thứ hạng trên Google không?

Không. Google-Extended không phải crawler mà chỉ là token điều khiển việc dùng dữ liệu cho Gemini và các tính năng AI sinh nội dung. Googlebot vẫn thu thập và lập chỉ mục site bạn y như cũ. Đây là lựa chọn gần như không có rủi ro nếu bạn muốn giữ nội dung khỏi tập huấn luyện.

Tôi đã có ba công cụ robots.txt khác trên site này, dùng cái nào cho việc gì?

Robots.txt Generator để dựng nguyên file từ đầu, Robots.txt Validator để soát cú pháp toàn file, Robots Meta Checker để soi thẻ meta robots ở mức từng trang. Trang này chỉ làm một việc ba công cụ kia không làm: đối chiếu với danh sách user-agent AI và giải thích mục đích từng bot.

Vì sao khối User-agent dấu sao chặn hết site mà GPTBot vẫn được phép?

Vì crawler chỉ tuân theo nhóm ghi đích danh tên nó, và chỉ dùng nhóm dấu sao khi không tìm thấy nhóm riêng. Nếu file của bạn có một khối User-agent GPTBot riêng, khối đó thắng hoàn toàn khối dấu sao, kể cả khi nó nằm phía dưới trong file.

Dòng Disallow để trống khác gì Disallow kèm dấu gạch chéo?

Khác hoàn toàn và đây là lỗi kinh điển. Disallow để trống nghĩa là không chặn gì cả, tức cho phép toàn bộ. Disallow kèm một dấu gạch chéo nghĩa là chặn toàn bộ site. Viết nhầm một ký tự là đảo ngược hẳn ý định của bạn.

Chặn rồi thì nội dung đã bị lấy trước đó có bị xóa khỏi mô hình không?

Không. Robots.txt chỉ ngăn việc thu thập từ lúc bạn thêm dòng luật trở đi, nó không có tác dụng hồi tố. Dữ liệu đã vào tập huấn luyện của một mô hình đã phát hành thì không rút ra được bằng cách sửa file này.

Bot có thể giả mạo user-agent để lách robots.txt không?

Có, và robots.txt vốn là quy ước tự nguyện chứ không phải hàng rào kỹ thuật. Bot của các hãng lớn tuân thủ, bot lậu thì không. Muốn kiểm chứng, hãy xem log máy chủ và đối chiếu địa chỉ IP truy cập với dải IP mà từng hãng công bố công khai.

Chặn meta-externalagent có làm mất ảnh xem trước khi chia sẻ lên Facebook không?

Không. Việc dựng ảnh và tiêu đề xem trước khi chia sẻ link do một bot khác của Meta đảm nhiệm. Bot meta-externalagent chỉ thu thập nội dung phục vụ huấn luyện mô hình AI của họ. Hai việc tách bạch, chặn cái này không ảnh hưởng cái kia.

Danh sách mười bốn bot này có còn đúng không?

Danh sách trong công cụ tham chiếu tháng 08/2025 và các hãng vẫn thêm bớt user-agent theo thời gian. Toàn bộ danh sách được đặt thành một hằng số duy nhất trong mã nguồn kèm địa chỉ trang tài liệu chính thức của từng hãng, để việc rà soát định kỳ chỉ phải sửa ở một chỗ.

Tôi nên chặn hay mở crawler AI cho website doanh nghiệp dịch vụ?

Với site bán dịch vụ, lựa chọn cân bằng là chặn nhóm crawler huấn luyện và mở hoàn toàn nhóm crawler trích dẫn. Nội dung không vào tập huấn luyện thì bạn không mất gì đáng kể, nhưng biến mất khỏi phần nguồn trong câu trả lời của trợ lý AI là mất một kênh tìm khách đang lớn dần.

Khối robots.txt sinh sẵn có dán đè lên file cũ được không?

Không nên. Hãy dán vào cuối file hiện có, vì phần khai báo cho crawler thường và dòng Sitemap vẫn cần giữ nguyên. Sau khi tải lên máy chủ, mở lại địa chỉ robots.txt trên trình duyệt để chắc chắn nội dung mới đã có hiệu lực, rồi dán ngược vào đây kiểm tra lần cuối.

Từ khóa liên quan

  • kiểm tra robots.txt chặn AI
  • chặn GPTBot
  • chặn ClaudeBot
  • PerplexityBot là gì
  • Google-Extended robots.txt
  • Applebot-Extended
  • OAI-SearchBot
  • CCBot common crawl
  • Bytespider chặn thế nào
  • meta-externalagent
  • user agent crawler AI
  • chặn AI thu thập nội dung website
  • cho phép AI trích dẫn website
  • robots.txt cho AI search
  • GEO tối ưu cho công cụ AI
  • AI crawler checker
  • ChatGPT-User user agent
  • bot huấn luyện và bot trích dẫn
  • kiểm tra file robots txt online
  • bảo vệ nội dung khỏi AI

Công cụ SEO Tools liên quan

Dịch vụ của Tấn Phát Digital

Công cụ giúp bạn tìm ra việc cần làm. Phần triển khai liên tục thì để chúng tôi:

Dịch vụ chăm sóc website định kỳ

Viết content SEO, tối ưu thứ hạng và A/B test chuyển đổi hàng tháng, cam kết KPI theo hợp đồng.

Từ 2.000.000đ/thángXem chi tiết →

Dịch vụ SEO Google Maps

Tối ưu Google Business Profile để lên top 3 Local Pack, tăng lượt gọi từ khách quanh khu vực.

Từ 3.000.000đ/thángXem chi tiết →

Dịch vụ thiết kế landing page

Trang đích riêng cho từng chiến dịch quảng cáo, tỷ lệ chuyển đổi 3–8%, bàn giao trong 5–21 ngày.

Từ 3.000.000đXem chi tiết →

Dịch vụ thiết kế website tại Hồ Chí Minh

Website doanh nghiệp, bán hàng và đặt lịch, chuẩn SEO ngay từ cấu trúc, tốc độ tải dưới 3 giây.

Từ 5.000.000đXem chi tiết →

Tư vấn và báo giá miễn phí trong 24 giờ. Xem toàn bộ dịch vụ

Zalo
Facebook
Tấn Phát Digital
Zalo
Facebook