Trang chủ AI Search Chi tiết bài viết
AI Search

Robots.txt là gì? Cách kiểm soát Google Bot khi SEO Website

Robots.txt là file văn bản nằm ở thư mục gốc của website, dùng để hướng dẫn các công cụ tìm kiếm như Googlebot biết khu vực nào nên hoặc không nên thu thập dữ liệu. Trong SEO kỹ…

👤 PGS Bảo ◷ 12 phút đọc ▣ 14/07/2026 ↻ Cập nhật 17/07/2026
NHẬN ĐỊNH NHANH

Robots.txt là file văn bản nằm ở thư mục gốc của website, dùng để hướng dẫn các công cụ tìm kiếm như Googlebot biết khu vực nào nên hoặc không nên thu thập dữ liệu. Trong SEO kỹ…

Robots.txt là file văn bản nằm ở thư mục gốc của website, dùng để hướng dẫn các công cụ tìm kiếm như Googlebot biết khu vực nào nên hoặc không nên thu thập dữ liệu. Trong SEO kỹ thuật, robots.txt giúp doanh nghiệp kiểm soát crawl, hạn chế bot truy cập vào trang không cần thiết và hỗ trợ tối ưu ngân sách thu thập dữ liệu.

Tại PGS Agency, khi audit Technical SEO, robots.txt luôn là hạng mục cần kiểm tra kỹ vì chỉ một cấu hình sai cũng có thể khiến Google không crawl được trang quan trọng. Một file robots.txt tốt cần không chặn nhầm trang cần SEO, không chặn tài nguyên quan trọng, khai báo sitemap rõ ràng và phù hợp với cấu trúc website.

Robots.txt là gì?

Robots.txt là một file văn bản được đặt ở thư mục gốc của website, dùng để hướng dẫn bot công cụ tìm kiếm như Googlebot được phép hoặc không được phép thu thập dữ liệu ở một số URL, thư mục hoặc tài nguyên nhất định.

Thông thường, file robots.txt có đường dẫn dạng:

https://tenmien.com/robots.txt

Trong SEO, robots.txt là một phần quan trọng của Technical SEO vì nó giúp kiểm soát quá trình crawl website. Nếu cấu hình đúng, file này giúp bot tìm kiếm tập trung vào các trang quan trọng. Nếu cấu hình sai, robots.txt có thể khiến Google không crawl được những trang cần SEO.

Một file robots.txt cơ bản thường có dạng:

  • User-agent: *
  • Disallow: /wp-admin/
  • Allow: /wp-admin/admin-ajax.php
  • Sitemap: https://example.com/sitemap.xml

Trong đó, User-agent xác định bot được áp dụng quy tắc, Disallow dùng để chặn crawl, Allow dùng để cho phép crawl một URL cụ thể và Sitemap khai báo đường dẫn sitemap XML của website.

Robots.txt là gì?
Robots.txt là gì?

Robots.txt có tác dụng gì trong SEO?

Robots.txt không trực tiếp giúp từ khóa lên top Google, nhưng nó ảnh hưởng lớn đến khả năng Google thu thập dữ liệu và hiểu cấu trúc website. Đây là nền tảng kỹ thuật cần được kiểm tra kỹ khi triển khai SEO, đặc biệt với website lớn, website thương mại điện tử hoặc website có nhiều URL tham số.

Kiểm soát bot crawl website

Robots.txt giúp website hướng dẫn bot tìm kiếm không crawl những khu vực không cần thiết như trang quản trị, trang đăng nhập, trang tìm kiếm nội bộ, URL filter hoặc các thư mục kỹ thuật.

Ví dụ, với website WordPress, khu vực /wp-admin/ thường không cần Google crawl. Vì vậy, robots.txt có thể được dùng để chặn khu vực này, đồng thời vẫn cho phép bot truy cập file cần thiết như admin-ajax.php.

Tối ưu crawl budget

Crawl budget là lượng tài nguyên mà Google dành để thu thập dữ liệu trên một website. Với các website nhỏ, vấn đề này thường không quá nghiêm trọng. Tuy nhiên, với website có hàng nghìn URL, robots.txt có thể giúp Googlebot không lãng phí thời gian vào các URL ít giá trị.

Thay vì để bot crawl trang giỏ hàng, trang thanh toán, bộ lọc sản phẩm hoặc URL tham số trùng lặp, website có thể dùng robots.txt để hướng bot tập trung vào trang danh mục, sản phẩm, bài viết và landing page quan trọng.

Khai báo sitemap cho công cụ tìm kiếm

Robots.txt thường được dùng để khai báo sitemap XML: https://example.com/sitemap.xml

Việc khai báo sitemap trong robots.txt giúp công cụ tìm kiếm dễ phát hiện danh sách URL quan trọng trên website. Đây không phải yếu tố bắt buộc, nhưng là một thực hành tốt trong Technical SEO.

Robots.txt hoạt động như thế nào?

Khi bot công cụ tìm kiếm truy cập website, bot thường kiểm tra file robots.txt trước để biết khu vực nào được phép hoặc không được phép crawl. Sau đó, bot sẽ dựa trên các quy tắc trong file này để quyết định có tiếp tục thu thập dữ liệu một URL hay không.

Điểm quan trọng cần hiểu là robots.txt kiểm soát quá trình crawl, không trực tiếp kiểm soát index.

Nói cách khác, nếu một URL bị chặn bằng Disallow, Googlebot sẽ không crawl nội dung URL đó. Tuy nhiên, URL vẫn có thể xuất hiện trên Google nếu Google phát hiện đường dẫn từ nguồn khác, chẳng hạn như backlink hoặc internal link.

Vì vậy, nếu mục tiêu là không cho một trang xuất hiện trên kết quả tìm kiếm, robots.txt không phải lựa chọn tối ưu. Trong trường hợp này, cần dùng thẻ noindex, kiểm soát trạng thái HTTP hoặc phương án kỹ thuật phù hợp hơn.

Robots.txt cũng không phải là lớp bảo mật. Nếu có dữ liệu nhạy cảm, không nên chỉ chặn bằng robots.txt. Website cần sử dụng đăng nhập, phân quyền, xác thực truy cập hoặc cấu hình bảo mật ở cấp server.

Cấu trúc file robots.txt gồm những gì?

Một file robots.txt thường gồm các thành phần chính sau:

User-agent

User-agent xác định bot nào sẽ áp dụng quy tắc.

  • Áp dụng cho tất cả bot: User-agent: *
  • Áp dụng riêng cho Googlebot: User-agent: Googlebot

Dấu * đại diện cho tất cả bot. Đây là cách dùng phổ biến nhất với các website thông thường.

Disallow

Disallow dùng để chặn bot crawl một URL hoặc thư mục nhất định.

Ví dụ: Disallow: /wp-admin/

Dòng này hướng dẫn bot không crawl thư mục /wp-admin/.

Allow

Allow dùng để cho phép bot crawl một URL cụ thể, đặc biệt trong trường hợp URL đó nằm trong thư mục đang bị chặn.

Ví dụ: Allow: /wp-admin/admin-ajax.php

Cấu hình này thường gặp ở website WordPress.

Cấu trúc file robots.txt gồm những gì?
Cấu trúc file robots.txt gồm những gì?

Sitemap

Sitemap dùng để khai báo đường dẫn sitemap XML.

Ví dụ: Sitemap: https://example.com/sitemap.xml

Với website WordPress dùng plugin SEO, sitemap có thể có dạng: Sitemap: https://example.com/sitemap_index.xml

Crawl-delay

Crawl-delay là chỉ thị yêu cầu một số bot giảm tốc độ crawl. Tuy nhiên, không phải công cụ tìm kiếm nào cũng hỗ trợ đầy đủ chỉ thị này. Vì vậy, không nên phụ thuộc hoàn toàn vào Crawl-delay khi muốn kiểm soát tần suất bot truy cập website.

Robots.txt khác gì với noindex, canonical và sitemap?

Robots.txt, noindex, canonical và sitemap đều liên quan đến SEO kỹ thuật, nhưng mục đích sử dụng khác nhau.

Robots.txt dùng để kiểm soát bot có được crawl một khu vực hay không. Nó phù hợp khi bạn muốn hạn chế bot truy cập những URL không cần thiết cho SEO.

Noindex dùng khi bạn không muốn một trang xuất hiện trên kết quả tìm kiếm. Đây là lựa chọn phù hợp hơn robots.txt nếu mục tiêu chính là ngăn index.

Canonical dùng khi website có nhiều URL có nội dung giống hoặc gần giống nhau. Thẻ canonical giúp Google hiểu đâu là phiên bản chính cần ưu tiên.

Sitemap dùng để cung cấp danh sách URL quan trọng cho công cụ tìm kiếm, giúp Google phát hiện và crawl các trang cần thiết hiệu quả hơn.

Hiểu đơn giản:

  • Muốn hạn chế crawl: dùng robots.txt.
  • Muốn chặn xuất hiện trên Google: dùng noindex.
  • Muốn xử lý nội dung trùng lặp: dùng canonical.
  • Muốn Google phát hiện URL quan trọng: dùng sitemap.

Những lỗi robots.txt thường gặp

Robots.txt là file nhỏ, nhưng nếu cấu hình sai có thể gây ảnh hưởng lớn đến SEO. Dưới đây là những lỗi phổ biến cần tránh.

Chặn nhầm toàn bộ website

Đây là lỗi nghiêm trọng nhất: User-agent: * Disallow: /

Cấu hình này chặn bot crawl toàn bộ website. Nó chỉ nên được dùng trong môi trường staging, website đang test hoặc website chưa muốn công cụ tìm kiếm thu thập dữ liệu.

Nếu cấu hình này xuất hiện trên website chính thức đang SEO, Google có thể không crawl được các trang quan trọng.

Chặn nhầm URL cần SEO

Một số website vô tình chặn các thư mục quan trọng như: Disallow: /blog/ Disallow: /dich-vu/ Disallow: /san-pham/

Nếu các trang bài viết, dịch vụ hoặc sản phẩm bị chặn crawl, Google sẽ gặp khó khăn trong việc thu thập dữ liệu và đánh giá nội dung.

Dùng robots.txt để chặn index

Robots.txt không phải cách tối ưu để chặn index. Nếu một URL bị chặn crawl, Googlebot có thể không truy cập được trang để đọc thẻ noindex.

Vì vậy, nếu muốn ngăn một trang xuất hiện trên Google, cần dùng phương án phù hợp hơn như thẻ noindex, bảo vệ bằng đăng nhập hoặc xử lý trạng thái HTTP đúng cách.

Những lỗi robots.txt thường gặp - Chặn index
Những lỗi robots.txt thường gặp – Chặn index

Chặn CSS, JavaScript hoặc hình ảnh quan trọng

Google cần truy cập các tài nguyên như CSS, JavaScript và hình ảnh để render trang giống người dùng. Nếu robots.txt chặn các tài nguyên quan trọng, Google có thể không hiểu đầy đủ giao diện, nội dung hoặc trải nghiệm trang.

Điều này có thể ảnh hưởng đến quá trình đánh giá chất lượng trang, đặc biệt với các website phụ thuộc nhiều vào JavaScript hoặc layout động.

Quên khai báo sitemap

Thiếu sitemap trong robots.txt không phải lỗi quá nghiêm trọng, nhưng khai báo sitemap là một cách giúp bot phát hiện cấu trúc URL tốt hơn.

Nếu website có sitemap XML, nên thêm dòng sitemap vào cuối file robots.txt.

Cách kiểm tra robots.txt

Để kiểm tra robots.txt, bạn có thể thực hiện theo các cách sau.

Kiểm tra trực tiếp trên trình duyệt

Nhập đường dẫn sau trên trình duyệthttps://tenmien.com/robots.txt

Nếu file tồn tại, trình duyệt sẽ hiển thị nội dung robots.txt. Nếu không thấy file hoặc trả về lỗi, cần kiểm tra lại cấu hình website, hosting hoặc plugin SEO.

Kiểm tra trong Google Search Console

Google Search Console giúp theo dõi các vấn đề liên quan đến crawl, index và URL bị chặn. Khi một URL quan trọng không được index, bạn nên kiểm tra xem URL đó có bị robots.txt chặn hay không.

Công cụ URL Inspection trong Google Search Console cũng có thể giúp xem trạng thái thu thập dữ liệu của từng URL cụ thể.

Kiểm tra bằng công cụ crawl SEO

Các công cụ như Screaming Frog, Sitebulb, Ahrefs Site Audit hoặc Semrush Site Audit có thể hỗ trợ phát hiện URL bị chặn bởi robots.txt.

Khi audit website, nên kiểm tra các nhóm URL quan trọng như:

  • Trang chủ.
  • Trang dịch vụ.
  • Bài viết SEO.
  • Danh mục sản phẩm.
  • Trang sản phẩm.
  • Landing page chuyển đổi.
  • CSS, JavaScript và hình ảnh quan trọng.
  • Đường dẫn sitemap XML.

Cách tạo robots.txt chuẩn SEO

Để tạo robots.txt chuẩn SEO, không nên bắt đầu bằng việc copy một mẫu có sẵn. Thay vào đó, cần xác định rõ cấu trúc website và mục tiêu crawl.

Bước 1: Xác định URL cần Google crawl

Trước tiên, hãy xác định những nhóm URL quan trọng cần Google thu thập dữ liệu. Thông thường bao gồm:

  • Trang chủ.
  • Trang giới thiệu.
  • Trang dịch vụ.
  • Bài blog chất lượng.
  • Danh mục sản phẩm quan trọng.
  • Trang sản phẩm có giá trị SEO.
  • Landing page phục vụ chuyển đổi.

Đây là những URL nên được mở crawl để Google có thể hiểu nội dung, chủ đề và giá trị của website.

Bước 2: Xác định URL không cần crawl

Tiếp theo, cần xác định những URL không mang nhiều giá trị SEO hoặc có khả năng tạo nội dung mỏng, trùng lặp.

Một số nhóm URL có thể cân nhắc chặn crawl gồm:

  • Trang quản trị.
  • Trang đăng nhập.
  • Trang giỏ hàng.
  • Trang thanh toán.
  • Trang tài khoản người dùng.
  • Trang tìm kiếm nội bộ.
  • URL filter không có giá trị SEO.
  • URL tham số tạo nhiều phiên bản trùng lặp.

Với website bán hàng, bước này đặc biệt quan trọng vì bộ lọc sản phẩm và URL tham số có thể tạo ra rất nhiều trang không cần thiết.

Bước 3: Viết file robots.txt

Sau khi xác định nhóm URL cần crawl và không cần crawl, bạn có thể viết file robots.txt.

Mẫu cơ bản cho nhiều website WordPress:

  • User-agent: *
  • Disallow: /wp-admin/
  • Allow: /wp-admin/admin-ajax.php
  • Sitemap: https://example.com/sitemap.xml

Nếu dùng plugin SEO tạo sitemap dạng index, có thể khai báo: Sitemap: https://example.com/sitemap_index.xml

Cách tạo robots.txt chuẩn SEO
Cách tạo robots.txt chuẩn SEO

Bước 4: Upload robots.txt lên thư mục gốc

File robots.txt cần được đặt tại thư mục gốc của website để có thể truy cập qua đường dẫn:https://example.com/robots.txtNếu website dùng WordPress, một số plugin SEO có thể hỗ trợ chỉnh sửa robots.txt trực tiếp trong phần quản trị. Tuy nhiên, sau khi chỉnh sửa vẫn cần kiểm tra lại trên trình duyệt.

Bước 5: Kiểm tra sau khi triển khai

Sau khi tạo hoặc chỉnh sửa robots.txt, cần kiểm tra lại ngay các URL quan trọng.

Hãy đảm bảo rằng:

  • Trang chủ không bị chặn.
  • Trang dịch vụ không bị chặn.
  • Bài viết SEO không bị chặn.
  • Danh mục và sản phẩm quan trọng không bị chặn.
  • Sitemap được khai báo đúng.
  • CSS, JavaScript và hình ảnh quan trọng không bị chặn.
  • Không còn cấu hình chặn toàn site từ môi trường staging.

Kinh nghiệm tối ưu robots.txt từ góc nhìn SEO thực chiến

Trong thực tế triển khai SEO, robots.txt thường gây lỗi khi website migrate, redesign, đổi CMS hoặc chuyển từ môi trường test sang website chính thức.

Một lỗi phổ biến là website staging được chặn toàn bộ bằng robots.txt, nhưng sau khi đưa lên môi trường live, đội kỹ thuật quên gỡ cấu hình này. Kết quả là Googlebot không crawl được website chính thức.

Với website thương mại điện tử, robots.txt cần được xử lý cẩn thận hơn. Các URL filter, sắp xếp, tìm kiếm nội bộ hoặc tham số tracking có thể tạo ra số lượng URL rất lớn. Tuy nhiên, không phải lúc nào cũng chỉ dùng robots.txt là đủ. Trong nhiều trường hợp, cần kết hợp canonical, noindex, cấu trúc danh mục rõ ràng và internal link hợp lý.

Ngoài ra, không nên chặn tài nguyên quan trọng phục vụ render trang. Google cần nhìn thấy website gần giống người dùng thật. Nếu chặn CSS, JavaScript hoặc hình ảnh quan trọng, quá trình đánh giá nội dung và trải nghiệm trang có thể bị ảnh hưởng.

Robots.txt có giúp website lên top Google không?

Robots.txt không phải yếu tố xếp hạng trực tiếp. Việc thêm robots.txt không làm từ khóa tự động lên top.

Tuy nhiên, robots.txt là một phần quan trọng trong nền tảng Technical SEO. Nếu file này được cấu hình đúng, Googlebot có thể crawl website hiệu quả hơn. Nếu cấu hình sai, các trang quan trọng có thể không được thu thập dữ liệu, từ đó ảnh hưởng đến khả năng index và hiệu quả SEO tổng thể.

Để SEO hiệu quả, robots.txt cần được tối ưu cùng với các yếu tố khác như:

  • Sitemap XML.
  • Cấu trúc website rõ ràng.
  • Internal link hợp lý.
  • Canonical đúng.
  • Noindex đúng trang.
  • Nội dung chất lượng.
  • Tốc độ tải trang.
  • Trải nghiệm người dùng.
  • Entity và E-E-A-T rõ ràng.

Robots.txt không thay thế cho chiến lược SEO tổng thể, nhưng là một phần kỹ thuật cần được kiểm soát cẩn thận.

Robots.txt có giúp website lên top Google không?
Robots.txt có giúp website lên top Google không?

Khi nào cần kiểm tra lại robots.txt?

Bạn nên kiểm tra robots.txt trong các trường hợp sau:

  • Website mới đưa lên Google.
  • Website vừa redesign.
  • Website vừa đổi hosting.
  • Website vừa đổi giao diện hoặc CMS.
  • Website bị giảm index bất thường.
  • Google Search Console báo lỗi “Blocked by robots.txt”.
  • Trang quan trọng không xuất hiện trên Google.
  • Website có nhiều URL filter hoặc URL tham số.
  • Vừa cài plugin SEO, plugin cache hoặc plugin bảo mật mới.

Việc kiểm tra robots.txt nên được đưa vào checklist audit Technical SEO định kỳ, đặc biệt với các website đang đầu tư SEO dài hạn.

Robots.txt là file văn bản dùng để hướng dẫn bot công cụ tìm kiếm được phép hoặc không được phép crawl một số khu vực trên website. Trong SEO, file này giúp kiểm soát quá trình thu thập dữ liệu, tối ưu crawl budget và hạn chế bot truy cập vào các URL không cần thiết.

Tuy nhiên, robots.txt cần được cấu hình cẩn thận vì nếu chặn nhầm Googlebot, URL quan trọng hoặc tài nguyên cần render, hiệu quả SEO có thể bị ảnh hưởng. Nếu website bị lỗi index, URL quan trọng không xuất hiện trên Google hoặc Google Search Console báo “Blocked by robots.txt”, PGS Agency có thể hỗ trợ audit Technical SEO, kiểm tra robots.txt, sitemap, noindex, canonical và internal link để đề xuất hướng xử lý an toàn.
Đánh giá bài viết
CÔNG CỤ TỰ KIỂM TRA

Hệ thống hiện tại của bạn đã sẵn sàng chuyển đổi chưa?

Đánh dấu từng tiêu chí để xem điểm sẵn sàng.

0/100Hãy đánh dấu các tiêu chí đang có.
GIẢI ĐÁP THẮC MẮC

Câu hỏi thường gặp

Có. Doanh nghiệp nhỏ càng cần ưu tiên đúng thứ tự, tập trung vào điểm nghẽn quan trọng và đo lường hiệu quả trước khi mở rộng ngân sách.

Nên theo dõi dữ liệu hằng tuần và đánh giá tổng thể theo chu kỳ 30 ngày để có đủ dữ liệu về hành vi, chất lượng khách hàng và chi phí chuyển đổi.

PGS có thể khảo sát Website, Fanpage, nội dung và quảng cáo hiện tại để xác định điểm nghẽn trước khi đề xuất phương án triển khai phù hợp.

TƯ VẤN CHIẾN LƯỢC MIỄN PHÍ

Bạn muốn biết hệ thống đang thất thoát ở đâu?

Hãy để lại thông tin liên hệ. PGS Agency sẽ thực hiện một đợt đánh giá nhanh về quảng cáo, Website, SEO và hệ thống đo lường hoàn toàn miễn phí, từ đó chỉ ra điểm nghẽn và đề xuất lộ trình tăng trưởng phù hợp với quy mô doanh nghiệp.

3 GIÁ TRỊ NHẬN ĐƯỢC SAU KHI ĐĂNG KÝ

Nhận diện đúng điểm nghẽn: Xác định nguyên nhân khiến lượt truy cập chưa chuyển thành khách hàng tiềm năng chất lượng.

Kiểm soát ngân sách tốt hơn: Phát hiện các khu vực đang tiêu tốn chi phí nhưng chưa tạo ra hiệu quả tương xứng.

Nhận lộ trình triển khai rõ ràng: Đề xuất các bước ưu tiên phù hợp với nguồn lực, mục tiêu và giai đoạn phát triển hiện tại.

ĐĂNG KÝ TƯ VẤN

Nhận đánh giá nhanh từ PGS

PGS sẽ liên hệ lại trong giờ làm việc

    *Cam kết bảo mật thông tin 100% (NDA)
    Zalo hỗ trợ trực tiếp →