Liệt kê liên kết trên một trang: phân loại nội bộ, bên ngoài và thuộc tính rel
Công cụ tải mã HTML của một địa chỉ về phía máy chủ, quét toàn bộ thẻ liên kết rồi liệt kê chúng kèm chữ neo, phân loại nội bộ hay bên ngoài và trạng thái nofollow. Kết quả xem theo từng thẻ, lọc được theo từ khóa và tải về dưới dạng CSV. Công cụ đọc mã HTML gốc, không chạy JavaScript.
Tính năng nổi bật
- Phân tích một địa chỉ mỗi lần, lấy mã HTML từ phía máy chủ nên không bị giới hạn cùng nguồn
- Quét toàn bộ thẻ liên kết trong mã nguồn và trích ra địa chỉ đích cùng chữ neo
- Chuyển mọi đường dẫn tương đối thành địa chỉ tuyệt đối trước khi phân loại
- Phân loại nội bộ hay bên ngoài bằng cách so tên máy chủ với tên máy chủ của trang gốc
- Đọc thuộc tính rel và tách riêng nhóm có nofollow
- Bỏ qua liên kết neo trong trang cùng các dạng javascript, mailto và tel
- Lọc nhanh danh sách theo địa chỉ hoặc theo chữ neo bằng ô tìm kiếm
- Xuất tệp CSV gồm địa chỉ, chữ neo, phân loại, thuộc tính rel và trạng thái theo dõi
Nhìn toàn bộ liên kết của một trang trong một danh sách
Khi rà soát một trang đích hay một bài viết dài, thứ bạn cần là danh sách phẳng của mọi liên kết chứ không phải đi tìm từng cái bằng mắt trong bố cục. Có danh sách rồi thì mấy câu hỏi khó chịu nhất được trả lời trong vài giây: bài này trỏ ra ngoài bao nhiêu lần và trỏ đi đâu, có liên kết nào còn sót lại từ bản nháp không, phần chân trang có đang trỏ về một tên miền cũ không, và các liên kết tiếp thị liên kết đã gắn thuộc tính rel chưa. Cách khác để làm việc này là mở mã nguồn trang rồi tự đọc, nhưng mã nguồn của một trang thật thường vài trăm kilobyte và thẻ liên kết nằm rải rác giữa các lớp thẻ chia khối. Cách thứ ba là dùng phần mềm thu thập toàn website, nhưng khi chỉ cần soi một trang thì việc chạy cả một lượt thu thập là thừa. Công cụ này lấp đúng khoảng giữa: nhanh hơn đọc mã nguồn, nhẹ hơn chạy phần mềm thu thập.
Lợi ích khi sử dụng
- Thấy toàn bộ liên kết của một trang trong một danh sách thay vì lần từng cái trong bố cục
- Phát hiện nhanh liên kết trỏ ra ngoài chưa gắn thuộc tính rel phù hợp
- Đọc được chữ neo của từng liên kết, thứ quyết định giá trị của liên kết nội bộ
- Không cần cài phần mềm thu thập dữ liệu chỉ để soi một trang
- Xuất CSV nên ghép được vào bảng theo dõi liên kết nội bộ đang có
Cách phân tích liên kết của một trang
- 1Dán địa chỉ đầy đủ của trang cần soi, có cả phần giao thức https ở đầu.
- 2Bấm phân tích và chờ máy chủ tải mã HTML về rồi quét, thời gian phụ thuộc vào tốc độ phản hồi của trang đó.
- 3Đọc bốn ô thống kê ở trên để nắm tỷ lệ giữa liên kết nội bộ, bên ngoài và nhóm nofollow.
- 4Chuyển giữa các thẻ để xem từng nhóm, dùng ô tìm kiếm nếu cần khoanh vùng theo một chuỗi trong địa chỉ hoặc chữ neo.
- 5Bấm xuất CSV để mở tiếp trong bảng tính khi cần đối chiếu với danh sách trang đích đã lên kế hoạch.
Công cụ chỉ đọc HTML gốc, không chạy JavaScript
Đây là giới hạn quan trọng nhất và nó quyết định kết quả có dùng được với website của bạn hay không. Máy chủ tải về đúng khối mã HTML mà trang trả về trong phản hồi đầu tiên, rồi quét thẻ liên kết trong đó. Nếu website của bạn dựng bằng một khung ứng dụng một trang và các liên kết được sinh ra sau khi JavaScript chạy trong trình duyệt, mã HTML gốc sẽ gần như trống và công cụ báo về rất ít liên kết hoặc không có liên kết nào, dù trên màn hình bạn thấy đầy. Tình huống tương tự xảy ra với các khối được tải thêm khi cuộn xuống, với menu chỉ dựng lên khi người dùng bấm, và với danh sách bài viết liên quan lấy về bằng lệnh gọi riêng. Cách kiểm tra nhanh xem trang của bạn thuộc loại nào: mở trang, bấm chuột phải chọn xem mã nguồn trang, rồi tìm một liên kết bạn biết chắc là có; nếu tìm thấy trong mã nguồn thì công cụ sẽ thấy, còn nếu không thì công cụ cũng không thấy. Với những trang như vậy, bạn cần công cụ có khả năng dựng trang bằng trình duyệt thật, thường gọi là chế độ thu thập có kết xuất JavaScript.
Cách phân loại nội bộ và bên ngoài, cùng chỗ dễ gây hiểu nhầm
Việc phân loại dựa trên phép so sánh tên máy chủ của liên kết với tên máy chủ của địa chỉ bạn nhập vào, và phép so sánh này là so khớp chính xác từng ký tự. Hệ quả cần biết trước: liên kết trỏ từ tanphatdigital.com sang www.tanphatdigital.com sẽ bị xếp vào nhóm bên ngoài, vì hai chuỗi tên máy chủ khác nhau dù đó vẫn là website của bạn. Điều tương tự áp dụng cho mọi tên miền phụ, chẳng hạn blog hay shop đặt ở tên miền phụ đều bị tính là liên kết ra ngoài. Thực ra cách phân loại này không sai về mặt kỹ thuật vì công cụ tìm kiếm cũng coi tên miền phụ là một trang web riêng, nhưng khi đọc con số thống kê bạn cần nhớ điều đó để không kết luận nhầm rằng trang đang trỏ ra ngoài quá nhiều. Một điểm nữa: danh sách đã loại bỏ trùng lặp theo địa chỉ đích, nghĩa là nếu cùng một địa chỉ xuất hiện năm lần trên trang với năm chữ neo khác nhau thì chỉ lần đầu tiên được giữ lại. Vì vậy con số tổng là số địa chỉ khác nhau chứ không phải tổng số lần liên kết xuất hiện.
Nofollow, sponsored và ugc: ba thuộc tính khác nhau
Công cụ đọc thuộc tính rel và hiển thị nguyên văn giá trị của nó, nhưng phần phân loại theo dõi hay không chỉ dựa trên việc chuỗi rel có chứa từ nofollow. Nghĩa là một liên kết gắn rel bằng sponsored hoặc bằng ugc mà không kèm nofollow vẫn được xếp vào nhóm có theo dõi, dù thực tế Google xử lý nó khác. Bối cảnh cần biết: từ tháng 9 năm 2019, Google giới thiệu hai giá trị mới bên cạnh nofollow. Giá trị sponsored dùng cho liên kết quảng cáo, tài trợ hoặc tiếp thị liên kết. Giá trị ugc dùng cho liên kết do người dùng tạo ra như bình luận và bài đăng trên diễn đàn. Cùng thời điểm đó, Google chuyển cách xử lý cả ba giá trị này từ mệnh lệnh bắt buộc sang gợi ý, tức họ có thể vẫn dùng liên kết làm tín hiệu nếu thấy hợp lý. Về mặt thực hành, khi rà soát bạn nên xem cột rel chứ đừng chỉ nhìn nhãn phân loại, và bảo đảm mọi liên kết có yếu tố thương mại đều mang ít nhất một trong hai giá trị sponsored hoặc nofollow, vì đây cũng là yêu cầu về công bố nội dung quảng cáo chứ không chỉ là chuyện tối ưu tìm kiếm.
Ô đếm liên kết hỏng và những gì công cụ không kiểm tra
Cần nói rõ để bạn không đọc sai: công cụ không gửi yêu cầu tới từng liên kết để kiểm tra mã trạng thái, nên ô đếm liên kết hỏng thực tế luôn bằng không kể cả khi trang có liên kết chết. Việc quét mã HTML chỉ cho biết liên kết tồn tại và trỏ đi đâu, không cho biết đích đến còn sống hay đã chuyển hướng. Muốn kiểm tra thật, bạn cần một công cụ gửi yêu cầu tới từng địa chỉ và ghi lại mã trạng thái, việc này tốn thời gian và có thể bị bên nhận coi là dò quét nếu làm hàng loạt. Một cách nhẹ nhàng là xuất tệp CSV rồi kiểm tra thủ công những địa chỉ đáng ngờ, thường là liên kết trỏ tới các trang tin đã ngừng hoạt động hoặc tài liệu tải về đăng từ lâu. Ngoài liên kết hỏng, công cụ cũng không đánh giá được liên kết có nằm trong phần nội dung chính hay chỉ nằm ở chân trang, không phân biệt được liên kết đặt trong khối điều hướng lặp lại trên mọi trang, và không kiểm tra được trang đích có gắn thẻ noindex hay không. Đây đều là những thứ ảnh hưởng tới giá trị thật của một liên kết nội bộ nhưng nằm ngoài phạm vi của việc quét mã nguồn.
Đọc kết quả để cải thiện liên kết nội bộ
Khi có danh sách trong tay, có bốn thứ đáng soi. Thứ nhất là chữ neo: hãy tìm những dòng có chữ neo kiểu tại đây, xem thêm hoặc đọc tiếp, vì chúng không nói gì về trang đích. Thay bằng cụm mô tả nội dung trang đích sẽ giúp cả người đọc lẫn công cụ tìm kiếm hiểu trang đó nói về gì, và đây là một trong số ít cải thiện vừa dễ làm vừa có tác dụng rõ. Thứ hai là số lượng liên kết nội bộ: một bài viết dài mà chỉ có hai ba liên kết nội bộ là quá ít, còn một trang nhồi hàng trăm liên kết thì giá trị bị pha loãng và người đọc cũng rối. Thứ ba là hướng trỏ: hãy kiểm tra xem những trang quan trọng nhất với bạn có thực sự được các bài viết khác trỏ về hay không, vì trang không có liên kết nội bộ nào trỏ tới thường bị công cụ tìm kiếm coi là ít quan trọng. Thứ tư là liên kết ra ngoài: trỏ tới nguồn uy tín để dẫn chứng là điều nên làm, nhưng cần rà lại xem có liên kết nào đang trỏ tới trang đã đổi chủ hoặc trang không còn phù hợp không.
Câu hỏi thường gặp (FAQ)
Công cụ chạy trong trình duyệt của tôi hay trên máy chủ?
Trên máy chủ. Trình duyệt gửi địa chỉ bạn nhập tới một điểm cuối phía máy chủ, máy chủ tải mã HTML của trang đó về rồi quét và trả kết quả. Cách này cần thiết vì trình duyệt bị chặn không cho đọc nội dung của tên miền khác theo chính sách cùng nguồn.
Vì sao trang của tôi có nhiều liên kết mà kết quả trả về rất ít?
Vì công cụ chỉ đọc mã HTML gốc và không chạy JavaScript. Nếu liên kết được sinh ra sau khi JavaScript chạy, chúng không có trong mã nguồn nên công cụ không thấy. Cách kiểm tra là mở mã nguồn trang bằng chuột phải rồi tìm một liên kết bạn biết chắc là có.
Vì sao liên kết sang tên miền phụ của tôi lại bị tính là bên ngoài?
Vì phân loại dựa trên phép so khớp chính xác tên máy chủ. Tên miền phụ có tên máy chủ khác nên được xếp vào nhóm bên ngoài, và cả trường hợp trỏ từ bản không có www sang bản có www cũng vậy. Về mặt kỹ thuật đây là cách công cụ tìm kiếm nhìn nhận nên không sai, chỉ cần nhớ khi đọc số liệu.
Ô đếm liên kết hỏng luôn bằng không, có phải trang tôi không có liên kết chết?
Không kết luận được. Công cụ không gửi yêu cầu tới từng liên kết để lấy mã trạng thái nên ô này luôn bằng không kể cả khi trang có liên kết chết. Muốn kiểm tra thật, hãy xuất tệp CSV rồi tự kiểm tra những địa chỉ đáng ngờ, hoặc dùng công cụ chuyên kiểm tra trạng thái liên kết.
Cùng một địa chỉ xuất hiện nhiều lần có được đếm nhiều lần không?
Không. Danh sách đã loại trùng theo địa chỉ đích, nên nếu một địa chỉ xuất hiện năm lần với năm chữ neo khác nhau thì chỉ lần đầu tiên được giữ lại. Con số tổng vì thế là số địa chỉ khác nhau chứ không phải tổng số lần liên kết xuất hiện trên trang.
Liên kết gắn rel bằng sponsored có bị tính là nofollow không?
Không. Phần phân loại chỉ kiểm tra chuỗi rel có chứa từ nofollow hay không, nên liên kết chỉ gắn sponsored hoặc ugc vẫn nằm trong nhóm có theo dõi. Cột rel vẫn hiển thị nguyên giá trị nên khi rà soát bạn hãy đọc cột đó thay vì chỉ nhìn nhãn phân loại.
Sponsored và ugc khác nofollow thế nào?
Từ tháng 9 năm 2019, Google giới thiệu sponsored cho liên kết quảng cáo và tiếp thị liên kết, ugc cho liên kết do người dùng tạo như bình luận và diễn đàn. Cùng lúc đó họ chuyển cách xử lý cả ba giá trị từ mệnh lệnh bắt buộc sang gợi ý, tức có thể vẫn dùng liên kết làm tín hiệu.
Liên kết neo trong trang và liên kết mailto có được liệt kê không?
Không. Công cụ bỏ qua các liên kết bắt đầu bằng dấu thăng vì chúng chỉ nhảy trong cùng trang, đồng thời bỏ qua các dạng javascript, mailto và tel vì chúng không dẫn tới một trang web nào. Điều này giúp danh sách gọn hơn nhưng nghĩa là bạn không dùng nó để rà soát mục lục trong bài.
Phân tích được nhiều trang cùng lúc không?
Không, mỗi lần chỉ một địa chỉ. Đây không phải công cụ thu thập toàn website mà là công cụ soi một trang. Với nhu cầu quét toàn bộ website, bạn cần phần mềm thu thập dữ liệu chuyên dụng chạy trên máy hoặc dịch vụ kiểm toán website.
Báo lỗi không thể phân tích thì nguyên nhân thường là gì?
Hay gặp nhất là trang yêu cầu đăng nhập, trang trả về mã lỗi, hoặc tường lửa ứng dụng của website chặn yêu cầu vì nó đến từ một trình tự động chứ không phải trình duyệt thật. Trang chạy nội bộ hoặc trên localhost cũng không phân tích được vì máy chủ không truy cập tới được.
Tệp CSV mở ra bị lệch cột thì xử lý thế nào?
Nguyên nhân thường là chữ neo của một liên kết nào đó có chứa dấu phẩy, khiến bảng tính hiểu nhầm đó là ranh giới cột. Cách xử lý là mở tệp bằng chức năng nhập dữ liệu của bảng tính và chọn thủ công dấu phân cách, hoặc dò lại những dòng bị lệch rồi sửa tay.
Chữ neo quan trọng tới mức nào?
Rất quan trọng vì nó là mô tả ngắn gọn nhất về trang đích, dùng cho cả người đọc lẫn công cụ tìm kiếm. Những chữ neo kiểu tại đây, xem thêm hay đọc tiếp không nói gì về trang đích. Thay chúng bằng cụm mô tả nội dung là một trong số ít cải thiện vừa dễ làm vừa thấy tác dụng.
Từ khóa liên quan
- kiểm tra liên kết trên trang
- phân tích internal link
- công cụ kiểm tra link nội bộ
- nofollow là gì
- rel sponsored và ugc
- anchor text là gì
- tối ưu liên kết nội bộ
- kiểm tra link hỏng
- external link trong seo
- cấu trúc liên kết website
- trang mồ côi không có internal link
- quét link bằng regex html
- seo cho website javascript
- kết xuất javascript khi crawl
- xuất danh sách link ra csv
- kiểm tra link affiliate có nofollow chưa
- trỏ link về trang quan trọng
- audit on-page seo
- screaming frog thay thế
- công cụ seo miễn phí kiểm tra link
