Kiểm tra thẻ meta robots: đọc noindex, nofollow và các chỉ thị đi kèm
Công cụ tải mã nguồn HTML của một URL bất kỳ rồi tìm thẻ meta name robots trong phần head, tách ra năm chỉ thị ảnh hưởng trực tiếp tới việc lên chỉ mục là index, follow, archive, snippet và imageindex. Kết quả hiện nguyên văn nội dung thẻ kèm trạng thái cho phép hay chặn của từng chỉ thị, thay vì phải mở mã nguồn và tự dò bằng mắt.
Tính năng nổi bật
- Nhập một URL đầy đủ và nhận về nguyên văn nội dung thẻ meta robots của trang đó
- Tách năm chỉ thị index, follow, archive, snippet, imageindex thành từng dòng có trạng thái riêng
- Đánh dấu rõ chỉ thị nào đang cho phép và chỉ thị nào đang chặn
- Báo riêng trường hợp trang không có thẻ meta robots, kèm nhắc rằng mặc định khi đó là cho phép lập chỉ mục và theo liên kết
- Kiểm tra được cả trang không thuộc quyền sở hữu của bạn, tiện khi soi cấu hình của đối thủ
- Phân tích HTML ngay trong trình duyệt bằng DOMParser, không có bước lưu lại kết quả
- Nhấn Enter ở ô nhập là chạy luôn, không cần rê chuột tìm nút
- Báo lỗi rõ khi không tải được trang, thường do URL sai hoặc máy chủ đích chặn truy cập
Vì sao một dòng thẻ meta lại quyết định trang có mặt trên Google hay không
Thẻ meta robots là công tắc trực tiếp nhất giữa trang của bạn và chỉ mục tìm kiếm. Chỉ cần chuỗi noindex nằm trong thẻ, Google sẽ chủ động loại trang khỏi kết quả tìm kiếm dù nội dung tốt tới đâu, dù bạn đã đi bao nhiêu backlink. Tình huống kinh điển là bản dựng thử nghiệm được cài noindex cho khỏi lọt ra ngoài, rồi khi đưa lên chính thức thì không ai nhớ gỡ. Trang chạy bình thường, người dùng vào vẫn thấy đầy đủ, chỉ có lưu lượng từ tìm kiếm là bằng không, và phải mất vài tuần mới có người đặt câu hỏi. Kiểm tra thủ công thì phải mở mã nguồn, tìm giữa hàng trăm dòng thẻ, dễ nhìn nhầm giữa meta robots và meta googlebot. Công cụ này rút gọn việc đó thành một lần dán URL, và quan trọng hơn là nó phân tách từng chỉ thị để bạn không bỏ sót những cái ít gặp như nosnippet hay noimageindex.
Lợi ích khi sử dụng
- Phát hiện trong vài giây nguyên nhân phổ biến nhất khiến một trang không lên chỉ mục
- Không phải mở mã nguồn rồi dò bằng mắt giữa hàng trăm thẻ
- Kiểm tra được cả trang của người khác nên dùng được khi khảo sát đối thủ
- Hiểu đúng ý nghĩa từng chỉ thị thay vì chỉ nhìn thấy một chuỗi khó đọc
- Dùng tốt ngay sau khi triển khai bản mới, đúng thời điểm lỗi noindex hay xuất hiện nhất
Cách kiểm tra thẻ meta robots của một trang
- 1Dán URL đầy đủ của trang cần kiểm tra vào ô nhập, nhớ có cả phần https ở đầu vì thiếu giao thức thì việc tải trang sẽ thất bại.
- 2Nhấn Enter hoặc bấm nút tìm kiếm, công cụ sẽ tải mã nguồn trang rồi phân tích ngay trong trình duyệt.
- 3Đọc dòng nội dung nguyên văn của thẻ để biết chính xác trang đang khai báo chuỗi gì.
- 4Rà năm chỉ thị bên dưới, chỉ thị nào đang bị chặn sẽ được đánh dấu khác với chỉ thị đang cho phép.
- 5Nếu công cụ báo không tìm thấy thẻ, hiểu rằng trang đang chạy theo mặc định là cho phép lập chỉ mục và theo liên kết, và hãy kiểm tra thêm tiêu đề X-Robots-Tag bằng công cụ dòng lệnh vì công cụ này không đọc phần đó.
Năm chỉ thị công cụ đang đọc và ảnh hưởng thật của chúng
Chỉ thị noindex loại trang khỏi kết quả tìm kiếm, đây là chỉ thị nặng nhất và cũng là thứ cần kiểm tra đầu tiên khi một trang biến mất. Chỉ thị nofollow đặt trong thẻ meta áp dụng cho toàn bộ liên kết trên trang chứ không riêng liên kết nào, nên nó ảnh hưởng cả liên kết nội bộ và thường gây hại nhiều hơn lợi. Chỉ thị noarchive ngăn bản lưu của trang được hiển thị, không ảnh hưởng thứ hạng nhưng làm mất một đường dự phòng khi máy chủ chết. Chỉ thị nosnippet chặn hiển thị đoạn mô tả trong kết quả tìm kiếm, khiến trang chỉ còn tiêu đề trơ trọi và tỷ lệ nhấp thường tụt hẳn; muốn giới hạn độ dài thay vì cắt sạch, bạn nên dùng max-snippet với một số cụ thể. Chỉ thị noimageindex ngăn ảnh trên trang xuất hiện trong tìm kiếm hình ảnh, đáng quan tâm với trang thương mại điện tử và trang bất động sản vì hình ảnh là nguồn lưu lượng thật. Công cụ nhận diện các chỉ thị này bằng cách dò chuỗi trong nội dung thẻ, và vì Google cũng không phân biệt chữ hoa chữ thường nên viết kiểu nào cũng cho cùng kết quả.
Khác biệt giữa thẻ meta robots và tập tin robots.txt
Hai thứ này hay bị dùng lẫn nhau và đó là nguồn gốc của rất nhiều lỗi lập chỉ mục dai dẳng. Tập tin robots.txt nằm ở gốc tên miền và điều khiển việc thu thập dữ liệu: nó nói với bot rằng đừng tải đường dẫn này. Thẻ meta robots nằm trong phần head của từng trang và điều khiển việc lập chỉ mục: nó nói với bot rằng đã tải rồi thì đừng đưa vào kết quả. Điểm mấu chốt là muốn đọc được thẻ meta thì bot phải tải được trang. Nếu bạn vừa chặn đường dẫn trong robots.txt vừa đặt noindex trong thẻ meta, bot không bao giờ thấy được cái noindex ấy, và địa chỉ vẫn có thể xuất hiện trong kết quả tìm kiếm dưới dạng chỉ có liên kết mà không có mô tả nếu có trang khác trỏ tới. Cách làm đúng là chọn một trong hai: cần trang biến mất khỏi kết quả thì để đường dẫn mở trong robots.txt và đặt noindex; cần tiết kiệm ngân sách thu thập cho những khu vực vô giá trị như bộ lọc sản phẩm thì mới dùng robots.txt.
Những gì công cụ này không kiểm tra
Công cụ chỉ đọc thẻ có thuộc tính name là robots. Nếu trang đặt chỉ thị riêng cho từng bot bằng thẻ name googlebot hoặc name bingbot thì công cụ sẽ không thấy, mà chỉ thị riêng cho bot lại được ưu tiên hơn chỉ thị chung. Công cụ cũng không đọc tiêu đề phản hồi X-Robots-Tag, vốn là cách đặt chỉ thị ở tầng máy chủ và là cách duy nhất để đặt noindex cho tập tin không phải HTML như PDF hay ảnh. Một trang có thể hoàn toàn sạch ở phần thẻ meta nhưng vẫn bị chặn qua tiêu đề này, nên khi kết quả ở đây báo bình thường mà trang vẫn không lên chỉ mục, việc tiếp theo là kiểm tra tiêu đề phản hồi bằng lệnh curl kèm tham số I hoặc bằng tab Network trong công cụ dành cho nhà phát triển của trình duyệt. Ngoài ra công cụ đọc đúng phần HTML mà máy chủ trả về, không chạy JavaScript, nên với trang chèn thẻ robots bằng mã phía trình duyệt thì kết quả ở đây sẽ khác với thứ Google thấy sau khi kết xuất.
Đường đi của yêu cầu và điều cần biết về quyền riêng tư
Trình duyệt của bạn không thể tự tải mã nguồn của một tên miền khác do chính sách chia sẻ tài nguyên giữa các nguồn, nên công cụ đi vòng qua một dịch vụ trung gian công cộng để lấy nội dung trang rồi mới phân tích tại máy bạn. Điều này có hai hệ quả cần biết. Thứ nhất, địa chỉ bạn nhập vào có đi qua bên thứ ba, nên không nên dùng công cụ với những đường dẫn nội bộ chứa mã phiên, khóa xem trước hay tham số nhạy cảm. Thứ hai, nếu máy chủ đích chặn truy cập từ dịch vụ trung gian, hoặc trang yêu cầu đăng nhập, hoặc có tường lửa chống bot đứng trước, công cụ sẽ báo không tải được trang dù đường dẫn hoàn toàn đúng. Trong trường hợp đó cách kiểm tra chắc chắn nhất là mở chính trang đó rồi xem mã nguồn gốc, hoặc dùng công cụ kiểm tra URL trong Google Search Console nếu bạn có quyền quản trị tên miền, vì công cụ đó cho biết đúng những gì Googlebot nhìn thấy.
Bốn lỗi thường gặp khiến kết quả bị hiểu sai
Lỗi thứ nhất là quên rằng thiếu thẻ không có nghĩa là có vấn đề. Phần lớn trang trên internet không khai báo thẻ meta robots và đó là trạng thái bình thường, vì mặc định đã là cho phép lập chỉ mục và theo liên kết. Lỗi thứ hai là gắn noindex cho các trang phân trang thứ hai trở đi với hy vọng gom sức mạnh về trang đầu; làm vậy khiến bot mất đường đi tới các mục nằm sâu, kết quả là sản phẩm hoặc bài viết ở trang trong không được phát hiện. Lỗi thứ ba là dùng nofollow ở tầng thẻ meta để xử lý vài liên kết quảng cáo; chỉ thị này quét sạch toàn bộ liên kết trên trang, cách đúng là gắn thuộc tính rel với giá trị nofollow hoặc sponsored cho đúng liên kết cần chặn. Lỗi thứ tư là nghĩ rằng gỡ noindex xong là trang lên ngay; thực tế Google phải quay lại thu thập mới nhận ra thay đổi, quá trình này mất từ vài ngày tới vài tuần, và bạn có thể rút ngắn bằng cách yêu cầu lập chỉ mục trong công cụ kiểm tra URL của Search Console.
Câu hỏi thường gặp (FAQ)
Trang không có thẻ meta robots thì có bị ảnh hưởng gì không?
Không. Khi không có thẻ, các bot hiểu mặc định là được phép lập chỉ mục và được phép theo liên kết, đúng như trạng thái mong muốn của phần lớn trang. Bạn chỉ cần thêm thẻ này khi muốn hạn chế bớt hành vi mặc định, chẳng hạn chặn lập chỉ mục trang cảm ơn sau khi gửi biểu mẫu hay trang kết quả tìm kiếm nội bộ.
Chỉ thị noindex có ngăn Google thu thập dữ liệu trang không?
Không. Google vẫn phải tải trang mới đọc được chỉ thị noindex, nên trang vẫn bị thu thập bình thường, chỉ là không được đưa vào kết quả tìm kiếm. Muốn chặn hẳn việc thu thập thì phải dùng robots.txt, nhưng khi đó bot lại không đọc được noindex, nên hai cách này không nên dùng chồng lên nhau cho cùng một đường dẫn.
Vì sao công cụ báo bình thường mà trang vẫn không lên Google?
Có vài khả năng nằm ngoài phạm vi công cụ này kiểm tra được: chỉ thị đặt trong tiêu đề X-Robots-Tag ở tầng máy chủ, thẻ khai báo riêng cho googlebot, thẻ canonical trỏ sang trang khác, đường dẫn bị chặn trong robots.txt, hoặc đơn giản là trang mới và Google chưa kịp thu thập. Nên kiểm tra tiếp bằng công cụ kiểm tra URL trong Search Console.
Công cụ có đọc được X-Robots-Tag không?
Không. Công cụ chỉ phân tích thẻ nằm trong mã HTML, còn X-Robots-Tag nằm trong tiêu đề phản hồi HTTP. Bạn kiểm tra phần đó bằng lệnh curl kèm tham số I rồi tìm dòng có tên x-robots-tag, hoặc mở tab Network trong công cụ dành cho nhà phát triển của trình duyệt và xem phần tiêu đề phản hồi của tài liệu chính.
Đặt chỉ thị riêng cho Google mà vẫn cho Bing lập chỉ mục được không?
Được. Thay vì dùng thuộc tính name với giá trị robots áp dụng cho mọi bot, bạn khai báo thẻ với name là googlebot cho riêng Google hoặc bingbot cho riêng Bing. Khi có cả thẻ chung và thẻ riêng, bot sẽ ưu tiên thẻ dành riêng cho nó. Lưu ý công cụ này không đọc các thẻ dành riêng đó nên bạn phải tự kiểm tra trong mã nguồn.
Chỉ thị nofollow trong thẻ meta khác gì thuộc tính rel nofollow trên liên kết?
Chỉ thị trong thẻ meta áp dụng đồng loạt cho mọi liên kết trên trang, kể cả liên kết nội bộ dẫn tới các trang quan trọng của bạn. Thuộc tính rel gắn trên từng thẻ liên kết chỉ tác động đúng liên kết đó. Với liên kết quảng cáo hay nội dung do người dùng đăng, cách đúng là gắn rel với giá trị sponsored hoặc ugc cho từng liên kết.
Chỉ thị nosnippet ảnh hưởng thế nào tới lượng nhấp?
Khi có nosnippet, kết quả tìm kiếm chỉ còn tiêu đề và địa chỉ, không có dòng mô tả, khiến người dùng khó đoán nội dung nên tỷ lệ nhấp thường giảm rõ. Nếu mục đích chỉ là hạn chế độ dài đoạn trích chứ không phải bỏ hẳn, hãy dùng max-snippet kèm số ký tự mong muốn, cách này giữ được phần giới thiệu mà vẫn kiểm soát được nội dung lộ ra.
Gỡ noindex xong bao lâu thì trang xuất hiện trở lại?
Không có mốc cố định vì phụ thuộc tần suất Google quay lại thu thập tên miền của bạn, thường từ vài ngày tới vài tuần. Trang mới hoặc tên miền ít cập nhật sẽ lâu hơn. Cách rút ngắn là mở công cụ kiểm tra URL trong Search Console, xác nhận trang đã cho phép lập chỉ mục rồi bấm yêu cầu lập chỉ mục cho đúng đường dẫn đó.
Có thể chặn lập chỉ mục cho một phần nội dung trong trang không?
Không, chỉ thị noindex luôn tác động lên toàn bộ trang chứ không lên một khối nội dung. Nếu chỉ một phần nội dung không nên xuất hiện trong tìm kiếm, cách xử lý hợp lý là tách phần đó ra một địa chỉ riêng rồi đặt noindex cho địa chỉ ấy, hoặc đặt sau lớp đăng nhập nếu nội dung thực sự cần bảo mật.
Vì sao có URL kiểm tra được, có URL lại báo lỗi tải trang?
Công cụ phải lấy mã nguồn qua một dịch vụ trung gian, nên trang yêu cầu đăng nhập, trang có tường lửa chống bot đứng trước, hoặc máy chủ chặn dải địa chỉ của dịch vụ đó đều sẽ trả về lỗi. Lỗi này không nói lên điều gì về cấu hình lập chỉ mục của trang, bạn nên kiểm tra lại bằng cách mở mã nguồn trực tiếp trên trình duyệt.
Kết quả ở đây có giống đúng thứ Googlebot nhìn thấy không?
Giống ở phần HTML gốc mà máy chủ trả về. Điểm khác là Googlebot còn chạy JavaScript rồi mới quyết định, nên nếu trang của bạn chèn hoặc gỡ thẻ robots bằng mã phía trình duyệt thì hai kết quả sẽ lệch nhau. Với các trang dựng bằng khung giao diện phía trình duyệt, nên đối chiếu thêm bằng công cụ kiểm tra URL của Search Console.
Có nên đặt noindex cho các trang phân trang không?
Thường là không nên. Trang thứ hai trở đi là đường để bot đi tới các mục nằm sâu, đặt noindex ở đó dễ khiến sản phẩm hoặc bài viết cũ không được phát hiện. Cách hợp lý hơn là để phân trang lập chỉ mục bình thường với tiêu đề phân biệt được, hoặc bổ sung liên kết nội bộ khác dẫn tới nội dung nằm sâu.
Từ khóa liên quan
- kiểm tra thẻ meta robots
- robots meta tag checker
- kiểm tra noindex
- kiểm tra nofollow
- noindex là gì
- nofollow là gì
- meta robots noarchive
- nosnippet là gì
- noimageindex
- x-robots-tag
- robots.txt và meta robots khác nhau
- trang không được google index
- cách chặn google index trang
- công cụ seo kỹ thuật
- kiểm tra index google
- google search console kiểm tra url
- thẻ meta robots đặt ở đâu
- gỡ noindex bao lâu thì lên google
- kiểm tra seo onpage
- audit kỹ thuật website
