Từ điển

Thu thập dữ liệu (crawl) là gì?

Thu thập dữ liệu (crawl) là quá trình bot của công cụ tìm kiếm (như Googlebot) đi khắp web, lần theo các liên kết để khám phá và đọc nội dung các trang. Đây là bước đầu tiên trong

Thu thập dữ liệu (crawl) là gì?

Thu thập dữ liệu (crawl) là quá trình bot của công cụ tìm kiếm (như Googlebot) đi khắp web, lần theo các liên kết để khám phá và đọc nội dung các trang. Đây là bước đầu tiên trong 3 bước Google xử lý website: crawl → index → rank.

Nói đơn giản: trước khi Google có thể cho bạn lên top, bot của nó phải “ghé thăm” và đọc được trang của bạn đã.

Bot thu thập dữ liệu hoạt động như thế nào?

Googlebot bắt đầu từ danh sách URL đã biết (từ lần crawl trước, từ sitemap bạn gửi…), tải trang về, đọc nội dung, rồi lần theo mọi liên kết trên trang để tìm URL mới. Cứ thế lan rộng như mạng nhện khắp web.

Tần suất bot ghé thăm mỗi site khác nhau: báo lớn được crawl mỗi phút, còn website nhỏ mới lập có thể vài ngày bot mới ghé một lần. Google quyết định dựa trên độ uy tín và tần suất cập nhật nội dung của site — site càng chăm đăng bài chất lượng, bot càng siêng ghé.

Crawl budget: “ngân sách” bot dành cho bạn

Google không crawl vô hạn. Mỗi website được phân bổ một crawl budget (ngân sách thu thập) — số trang bot chịu crawl trong một khoảng thời gian, phụ thuộc vào độ uy tín và tốc độ phản hồi của server.

Với site nhỏ (vài trăm trang), crawl budget hiếm khi là vấn đề. Nhưng với site thương mại điện tử hàng chục nghìn trang, bot có thể “hết ngân sách” trước khi đọc tới các trang quan trọng. Lãng phí crawl budget vào trang rác — trang lọc trùng lặp, tham số theo dõi, trang lỗi 404 — là sai lầm phổ biến khiến trang xịn bị bot bỏ qua.

4 cách giúp bot thu thập tốt hơn

1. Gửi sơ đồ trang XML. Sơ đồ trang XML là file liệt kê mọi URL quan trọng — như bản đồ đưa tận tay bot, thay vì để nó tự mò mẫm.

2. Đừng chặn nhầm trong robots.txt. File robots.txt điều khiển bot được vào khu vực nào. Một dòng Disallow: / đặt nhầm (thường quên xóa sau khi đưa site từ staging lên production) là cả website biến mất khỏi Google.

3. Xây dựng liên kết nội bộ tốt. Bot khám phá trang mới chủ yếu qua link. Liên kết nội bộ chặt chẽ giúp bot (và người đọc) đi tới mọi ngóc ngách. Trang nào không có link nào trỏ tới — gọi là orphan page (trang mồ côi) — gần như vô hình với bot.

4. Tăng tốc độ tải trang. Bot cũng “mất kiên nhẫn”: trang tải chậm thì trong cùng ngân sách bot crawl được ít trang hơn. Xem thêm: Dung lượng trang.

Ví dụ thực tế

Bạn đăng bài viết mới lúc 9h sáng nhưng 3 ngày sau tìm trên Google vẫn không thấy. Nguyên nhân thường gặp: site mới, ít backlink, bot chưa biết có trang mới. Cách xử lý nhanh: vào Google Search Console → URL Inspection → Request Indexing để “gọi” bot tới ngay; đồng thời đảm bảo bài được link từ trang chủ hoặc trang chuyên mục, và sitemap đã cập nhật URL mới.

Lỗi thường gặp

  • Chặn bot trong robots.txt mà không biết — kiểm tra lại sau mỗi lần deploy.
  • Trang mồ côi (orphan page): không có internal link nào trỏ tới, bot không bao giờ tìm thấy.
  • Nội dung phụ thuộc JavaScript: bot có thể không render được nội dung chỉ hiện sau khi JS chạy. Xem thêm: Nội dung phụ thuộc JavaScript.
  • Chuỗi chuyển hướng quá dài khiến bot bỏ cuộc giữa chừng.
Thu thập dữ liệu (crawl) là gì? - infographic

Xem thêm

Kiểm tra ngay

Dùng extension SEO-Check quét website của bạn — mục Technical báo ngay nếu robots.txt đang chặn bot, thiếu sitemap hay tồn tại trang mồ côi. Tải extension miễn phí tại seocheck.vn/chrome-extension.

← Xem toàn bộ từ điển
Thu thập dữ liệu (crawl) là gì? — Từ điển SEO-Check