Từ điển
Robots.txt là gì?
Robots.txt là một file văn bản nằm ở thư mục gốc của website, dùng để hướng dẫn các bot của công cụ tìm kiếm như Googlebot, Bingbot… biết khu vực nào trên website được phép hoặc không được phép crawl. Ví dụ, file robots.txt thường có địa chỉ: Nói đơn giản, robots.txt giống như một biển chỉ dẫn […]
Robots.txt là một file văn bản nằm ở thư mục gốc của website, dùng để hướng dẫn các bot của công cụ tìm kiếm như Googlebot, Bingbot… biết khu vực nào trên website được phép hoặc không được phép crawl.
Ví dụ, file robots.txt thường có địa chỉ:
Nói đơn giản, robots.txt giống như một biển chỉ dẫn dành cho bot khi chúng truy cập website.
Một file robots.txt cơ bản có thể như sau:
User-agent: *
Disallow: /admin/
Allow: /
Sitemap: https://example.com/sitemap.xml
Trong đó:
User-agent: *nghĩa là áp dụng cho tất cả bot.Disallow: /admin/yêu cầu bot không crawl thư mục/admin/.Allow: /cho phép crawl các khu vực còn lại.Sitemap:khai báo vị trí của sitemap XML.
Robots.txt dùng để làm gì?
Mục đích chính của robots.txt là quản lý hoạt động crawl.
Ví dụ một website có thể không muốn Googlebot truy cập:
- trang quản trị;
- trang tìm kiếm nội bộ;
- URL có tham số không cần thiết;
- khu vực staging;
- một số file hoặc thư mục kỹ thuật.
Việc này giúp bot tập trung crawl những trang thực sự quan trọng, đặc biệt với website lớn có hàng chục nghìn hoặc hàng triệu URL.
Đây còn được gọi là tối ưu crawl budget.
Robots.txt không phải công cụ chặn index tuyệt đối
Đây là điểm rất dễ bị nhầm.
Nếu bạn thêm:
Disallow: /page-a/
điều đó có nghĩa:
Không muốn bot crawl URL này.
Nhưng không đồng nghĩa chắc chắn URL đó sẽ biến mất khỏi Google.
Nếu Google phát hiện URL thông qua backlink, sitemap hoặc các nguồn khác, URL vẫn có thể xuất hiện trong kết quả tìm kiếm dù nội dung chưa được crawl đầy đủ.
Nếu mục tiêu thực sự là không cho một trang xuất hiện trên Google, thông thường nên sử dụng:
<meta name="robots" content="noindex">
hoặc HTTP header tương ứng.
Vì vậy cần phân biệt:
robots.txt = kiểm soát crawl
noindex = kiểm soát index
Robots.txt có ảnh hưởng đến SEO không?
Có.
Một cấu hình robots.txt sai có thể khiến Google không crawl được các trang quan trọng.
Ví dụ:
User-agent: *
Disallow: /
Dòng này yêu cầu toàn bộ bot không crawl website.
Nếu vô tình sử dụng trên website production, SEO có thể bị ảnh hưởng nghiêm trọng.
Ngược lại, robots.txt được cấu hình hợp lý có thể giúp website:
- crawl hiệu quả hơn;
- hạn chế URL rác;
- giảm crawl các trang không có giá trị SEO;
- giúp bot tập trung vào nội dung quan trọng.
Robots.txt trong thời đại AI
Ngoài Googlebot và Bingbot, hiện nay website còn có thể được truy cập bởi nhiều bot phục vụ AI và hệ thống tìm kiếm thế hệ mới.
Vì vậy, khi làm SEO, AEO và GEO, robots.txt không chỉ là vấn đề của Google Search nữa.
Doanh nghiệp cần hiểu rõ bot nào đang được phép truy cập website, bởi việc chặn một crawler có thể ảnh hưởng tới khả năng nội dung được tìm thấy, phân tích hoặc sử dụng bởi một số hệ thống AI.
Tóm lại:
Robots.txt là file hướng dẫn bot nên và không nên crawl phần nào của website.
Nó là một thành phần nhỏ nhưng rất quan trọng trong Technical SEO, và một cấu hình sai đôi khi có thể khiến cả chiến lược SEO bị ảnh hưởng.