Robots.txt là gì? Hướng dẫn đọc, viết và kiểm tra chuẩn kỹ thuật 2026

Tú Cao
Tú Cao
Xuất bản: 22/07/2026 Cập nhật: 22/07/2026 | 0 Bình luận
Tóm tắt AI:
Đã sao chép prompt! Đang chuyển hướng...

Robots.txt là một tệp văn bản thuần túy (plain text) đặt tại thư mục gốc của website, có nhiệm vụ chỉ định cho các bot tìm kiếm (như Googlebot) biết những đường dẫn nào được phép hoặc không được phép thu thập dữ liệu (crawl). Đây là thành phần đầu tiên Googlebot tìm đọc trước khi tiến hành crawl bất kỳ trang nào trên domain.

Nếu traffic tự nhiên của website đột ngột sụt giảm, hoặc Google Search Console báo lỗi "Đã bị chặn bởi robots.txt", nguyên nhân cốt lõi thường nằm ở cấu hình tệp này. Bài viết dưới đây sẽ giúp bạn hiểu rõ bản chất, cách viết file chuẩn và quy trình kiểm tra để không vô tình chặn Google lập chỉ mục (index) website.

Robots.txt là gì và cơ chế hoạt động với Googlebot

Robots.txt là văn bản tuân theo chuẩn Robots Exclusion Protocol (REP), dùng để hướng dẫn các trình thu thập dữ liệu web (crawler) về việc truy cập các đường dẫn (path) cụ thể trên website. Theo tài liệu chính thức từ Google Search Central, đây là một chỉ dẫn (directive) mang tính khuyến nghị đối với các bot hợp pháp, không phải là một lệnh cấm truy cập tuyệt đối ở tầng máy chủ.

Vị trí đặt file và cấu trúc cơ bản

Tệp robots.txt bắt buộc phải được đặt tại thư mục gốc (root) của domain, ví dụ https://seodoctor.vn/robots.txt . Nếu bạn đặt ở thư mục con như /blog/robots.tx t, tệp này sẽ hoàn toàn vô tác dụng.

Cấu trúc của file bao gồm các nhóm quy tắc (rule group), mỗi nhóm chỉ định một hoặc nhiều user-agent đi kèm danh sách các đường dẫn được phép hoặc bị chặn:

User-agent: Googlebot
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

User-agent: *
Disallow: /tmp/

Sitemap: https://seodoctor.vn/sitemap.xml

Có 3 nguyên tắc kỹ thuật cốt lõi bạn cần ghi nhớ khi làm việc với file này:

  1. Phân biệt chữ hoa và chữ thường (case-sensitive): Đường dẫn /File.pdf và /file.pdf được Googlebot hiểu là hai URL hoàn toàn khác nhau.
  2. Giới hạn kích thước: Google chỉ xử lý tối đa 500 KiB đầu tiên của file robots.txt. Bất kỳ nội dung nào vượt quá giới hạn này sẽ bị bỏ qua.
  3. Thời gian lưu cache: Google lưu bộ nhớ đệm (cache) nội dung robots.txt tối đa 24 giờ. Do đó, những thay đổi mới trên file có thể không mang lại hiệu lực ngay lập tức.

Lưu ý: Nếu chẳng may bạn cấu hình robots.txt nhầm và muốn GoogleBot thu thập lại ngay lập tức thì có thể yêu cẩu qua GSC.

Bạn có thể yêu cầu thu thập lại ngay qua GSC
Bạn có thể yêu cầu thu thập lại ngay qua GSC

Robots.txt có phải là công cụ bảo mật không?

Không. Robots.txt là một tệp công khai, bất kỳ ai cũng có thể xem được bằng cách truy cập trực tiếp URL. Tệp này chỉ có tác dụng điều hướng các bot "biết tuân thủ" (well-behaved crawlers) như Googlebot hay Bingbot. Các bot cào dữ liệu độc hại (scraper) hoàn toàn có thể phớt lờ các quy tắc này.

Một sai lầm rất phổ biến trong SEO là sử dụng lệnh Disallow để "giấu" các trang nhạy cảm như /admin / hoặc /checkout/ . Thực tế, việc này chỉ ngăn bot thu thập dữ liệu nội dung trang. Nếu URL đó nhận được backlink từ một trang khác, Google vẫn có thể lập chỉ mục và hiển thị nó trên kết quả tìm kiếm (dưới dạng một kết quả không có thẻ meta description). Để bảo mật dữ liệu thật sự, bạn cần thiết lập xác thực mật khẩu (authentication) ở tầng server.

Bot sẽ luôn hỏi robots.txt có hay không
Sơ đồ minh họa cách Googlebot đọc robots.txt trước khi crawl website, từ bước request file đến quyết định crawl/không crawl

Nên đọc: Các loại trang mà Googlebot có thể lập chỉ mục trên website của bạn.

Website không có robots.txt có ảnh hưởng đến SEO không?

Việc không có tệp robots.txt không phải là một lỗi kỹ thuật nghiêm trọng. Khi đó, Googlebot sẽ mặc định hiểu là nó được phép thu thập dữ liệu toàn bộ website. Tuy nhiên, đối với các website quy mô lớn hoặc nền tảng thương mại điện tử, việc thiếu tệp này sẽ gây lãng phí ngân sách thu thập dữ liệu (crawl budget) một cách trầm trọng.

Điều gì xảy ra khi bot không đọc được file?

Chả sao cả, khi Googlebot gửi yêu cầu và nhận về mã lỗi 404 (Không tìm thấy file), nó sẽ tiến hành crawl bình thường toàn bộ các URL trên site.

Ngược lại, nếu máy chủ trả về mã lỗi 5xx (Lỗi server) khi Googlebot request file robots.txt, Google sẽ tạm dừng toàn bộ quá trình crawl website. Đây là cơ chế bảo vệ của Google nhằm tránh làm sập máy chủ của bạn. Tình trạng này nghiêm trọng hơn rất nhiều so với việc không có file.

Khi nào bạn thực sự cần cấu hình robots.txt?

Bảng dưới đây tóm tắt các trường hợp thực tế để bạn quyết định có nên can thiệp vào file này hay không:

Tình huống websiteMức độ cần thiếtLý do kỹ thuật
Website nhỏ (dưới 500 trang), không có khu vực quản trị công khaiKhông bắt buộcGoogle tự phân bổ crawl hợp lý, không gây lãng phí crawl budget.
Website TMĐT có bộ lọc, phân trang, tham số URL (?color=red)Bắt buộcTránh việc bot "đốt" crawl budget vào hàng nghìn URL trùng lặp nội dung.
Có khu vực staging/dev chạy trên subdomainBắt buộcNgăn chặn Google index nhầm phiên bản website đang thử nghiệm.
Muốn xóa hoàn toàn 1 trang khỏi Google SearchKhông dùng DisallowCần dùng thẻ meta noindex hoặc công cụ Removals trong Search Console.
Cần khai báo vị trí Sitemap cho botNên cóLệnh Sitemap: giúp các công cụ tìm kiếm phát hiện sitemap nhanh hơn.

Cách đọc hiểu và viết robots.txt chuẩn kỹ thuật

Một tệp robots.txt chuẩn SEO thường chỉ xoay quanh 4 chỉ dẫn (directive) cơ bản: User-agent, Disallow, Allow , và Sitemap . Việc nắm rõ thứ tự ưu tiên xử lý của Googlebot sẽ quyết định file của bạn có hoạt động đúng logic hay không.

Các directive quan trọng và quy tắc xử lý ưu tiên

  • User-agent: Chỉ định loại bot áp dụng quy tắc (ví dụ: Googlebot, Bingbot, hoặc * đại diện cho tất cả các bot).
  • Disallow: Chặn bot thu thập dữ liệu một đường dẫn hoặc thư mục cụ thể.
  • Allow: Cho phép bot thu thập dữ liệu (thường được dùng để "mở khóa" một đường dẫn con nằm bên trong một thư mục đã bị lệnh Disallow chặn trước đó).
  • Sitemap: Khai báo đường dẫn tuyệt đối (absolute URL) trỏ đến file sitemap.xml.

Khi xảy ra xung đột giữa lệnh AllowDisallow cho cùng một user-agent, Googlebot sẽ áp dụng quy tắc khớp dài nhất (longest match rule): Đường dẫn có chuỗi ký tự dài hơn và cụ thể hơn sẽ được ưu tiên áp dụng.

Ví dụ thực tế:

User-agent: *
Disallow: /category/
Allow: /category/seo-tips/

Với cấu hình trên, mọi URL nằm trong thư mục /category/ đều bị chặn crawl, ngoại trừ thư mục con /category/seo-tips/ vẫn được thu thập dữ liệu bình thường vì lệnh Allow có chuỗi ký tự dài hơn.

Mẫu cấu hình an toàn cho các nền tảng phổ biến

Dưới đây là các mẫu cấu hình được đội ngũ chuyên gia của SEO Doctor khuyên dùng dựa trên đặc thù của từng loại website:

Loại websiteMẫu Disallow khuyến nghịGhi chú kỹ thuật
WordPress/wp-admin/ (Cần Allow /wp-admin/admin-ajax.php)Chặn khu vực quản trị nhưng vẫn cho phép file AJAX hoạt động để render front-end.
Thương mại điện tử/cart/, /checkout/, /*?*sort=, /*?*filter=Chặn các tham số bộ lọc và sắp xếp để tránh lỗi duplicate content.
Site có thanh tìm kiếm/search/, /*?s=Trang kết quả tìm kiếm nội bộ (internal search) không nên để Google index.
Website AI/tim-kiem/Chỉ cần chặn trang tìm kiếm. Admin đã được chặn cứng .

 Mẫu robots.txt tổng quát và an toàn cho phần lớn các website hiện nay:

User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /search/
Allow: /

Sitemap: https://tenmiencuaban.vn/sitemap.xml

Hướng dẫn tạo và kiểm tra robots.txt từng bước

Việc tạo file khá đơn giản, nhưng khâu kiểm tra trước khi đưa lên môi trường thực tế (production) mới là bước quan trọng nhất. Chỉ cần sai một dấu gạch chéo /, bạn có thể vô tình xóa sổ toàn bộ website khỏi Google.

Chúng ta sẽ làm theo 4 bước: Tạo, tải lên và xác nhận tệp

  • Tạo một tệp .txt bằng Notepad hoặc các trình soạn thảo code (tuyệt đối không dùng Microsoft Word vì phần mềm này sinh ra các định dạng ẩn gây lỗi file).
  • Đặt tên tệp chính xác là robots.txt (viết thường toàn bộ các ký tự).
  • Tải tệp lên thư mục gốc của domain thông qua FTP, File Manager của hosting, hoặc chỉnh sửa trực tiếp qua các plugin SEO (nếu không rõ hãy hỏi đơn vị thiết kế website
  • Xác nhận tệp đã hoạt động bằng cách truy cập trực tiếp tenmiencuaban.vn/robots.txt trên trình duyệt web.

Cách kiểm tra file để tránh sai sót nghiêm trọng

Đây là bước thường bị bỏ qua nhiều nhất. Trước khi lưu bất kỳ thay đổi nào, bạn cần sử dụng công cụ giả lập bot để kiểm tra thay vì chỉ đọc bằng mắt thường.

Quy trình kiểm tra chuẩn kỹ thuật:

  • Hãy sử dụng tiện ích SEO Doctor để kiểm tra khả năng lập chỉ mục.
  • Hệ thống sẽ phân tích từng dòng lệnh và cảnh báo các quy tắc mâu thuẫn (ví dụ: lệnh Disallow đang chặn nhầm thư mục chứa file CSS/JS quan trọng cho việc render giao diện).
  • Truy cập những trang quan trọng (ví dụ: /san-pham/ao-thun) để xem URL đó đang bị chặn hay không.
  • Đối chiếu song song với báo cáo Robots.txt trong mục Cài đặt (Settings) của Google Search Console để đảm bảo Google đang đọc đúng phiên bản mới nhất, không phải bản cache cũ.
Kiểm tra bằng công cụ SEO Doctor
Kiểm tra bằng công cụ SEO Doctor

4 sai lầm phổ biến khi cấu hình robots.txt

  1. Dùng Disallow để "ẩn" trang khỏi kết quả tìm kiếm: Đây là lỗi nhận thức phổ biến nhất. Disallow chỉ chặn quá trình crawl, không chặn index. Cách làm đúng là sử dụng thẻ trên mã nguồn trang, đồng thời không dùng Disallow cho trang này (vì nếu bị Disallow, Googlebot không thể truy cập trang để đọc được thẻ noindex).
  2. Chặn nhầm thư mục chứa CSS/JS: Việc chặn các thư mục như /wp-content/ hoặc /assets/ sẽ khiến Googlebot không thể render giao diện trang web. Điều này ảnh hưởng trực tiếp đến đánh giá trải nghiệm người dùng (Core Web Vitals) và thứ hạng SEO.
  3. Copy nguyên bản robots.txt từ website khác: Mỗi website có một cấu trúc URL và tham số riêng biệt. Việc sao chép mù quáng dễ dẫn đến tình trạng chặn nhầm các đường dẫn quan trọng của chính mình.
  4. Quên xóa lệnh chặn khi đưa web từ staging lên production: Như case study đề cập ở trên, chỉ một dòng lệnh sai có thể xóa sổ toàn bộ công sức SEO của doanh nghiệp.

Câu hỏi thường gặp

Sửa robots.txt xong bao lâu thì Google cập nhật?
Google thường lưu cache file robots.txt trong khoảng 24 giờ hoặc vài tuần (tùy website). Bạn có thể chủ động yêu cầu Google đọc lại file sớm hơn thông qua báo cáo Robots.txt trong phần Cài đặt của Google Search Console.
Website không có file robots.txt có bị phạt không?
Không, website không bị phạt. Google sẽ mặc định hiểu là không có giới hạn nào và tiến hành crawl toàn bộ dữ liệu. Tuy nhiên, với các website lớn có nhiều tham số URL, việc thiếu file này sẽ gây lãng phí nghiêm trọng ngân sách thu thập dữ liệu (crawl budget).
Robots.txt có ngăn được Google index trang không?
Không hoàn toàn. Robots.txt chỉ ngăn chặn quá trình thu thập dữ liệu (crawl). Nếu URL đó nhận được liên kết từ một trang web khác, Google vẫn có thể lập chỉ mục nó. Để chặn index chắc chắn, bạn phải dùng thẻ meta noindex hoặc xóa trang để trả về mã lỗi 404/410.

Vậy bạn cần nhớ. Robots.txt là công cụ quản lý luồng thu thập dữ liệu (crawl), không phải là công cụ bảo mật hay ẩn trang. Việc hiểu đúng bản chất kỹ thuật này sẽ giúp bạn tránh được 90% các sự cố mất traffic oan uổng. 

Trước khi áp dụng bất kỳ thay đổi nào, hãy luôn sử dụng công cụ kiểm tra Robots.txt của SEO Doctor để đảm bảo an toàn tuyệt đối cho website.

5.0
1 Đánh giá

Bạn thấy bài viết này hữu ích?

Hãy chia sẻ để giúp bạn bè của bạn cũng chọn được sản phẩm phù hợp nhé!

Tú Cao

Tú Cao

Chuyên gia SEO

Tác giả là chuyên gia SEO và thiết kế Webite với 10 năm kinh nghiệm. Anh hiện là CEO của Sudo - một công ty cung cấp dịch vụ xây dựng Website chất ...

Bài Viết Liên Quan

Bình Luận

Địa chỉ email của bạn sẽ không được công khai. Các trường bắt buộc được đánh dấu *

Thông báo