Chia sẻ f X in
Website và Hạ Tầng

Cách Tạo File Robots.txt Cho Website Chuẩn SEO

Tạo file robot txt cho website là bước kỹ thuật giúp bạn kiểm soát cách các bot tìm kiếm thu thập dữ liệu trên trang. Chỉ với một file văn bản nhỏ đặt đúng vị trí, bạn có thể hướng bot tập trung vào nội dung quan trọng và tránh những khu vực không cần...

Nguyễn Anh Quang Nguyễn Anh Quang 08/08/2026 15 phút đọc
Chia sẻ f X in

Tạo file robot txt cho website là bước kỹ thuật giúp bạn kiểm soát cách các bot tìm kiếm thu thập dữ liệu trên trang. Chỉ với một file văn bản nhỏ đặt đúng vị trí, bạn có thể hướng bot tập trung vào nội dung quan trọng và tránh những khu vực không cần thiết. TechVon hướng dẫn cú pháp cơ bản, mẫu file thông dụng, cách tối ưu và kiểm tra lỗi robots.txt đúng chuẩn SEO.

Tóm tắt nhanh: Tạo file robots.txt cho website là việc tạo một file văn bản đặt tại thư mục gốc của trang, dùng để hướng dẫn các bot tìm kiếm những phần nào được phép hoặc không được phép crawl. File này dùng cú pháp cơ bản gồm User-agent, Disallow, Allow và có thể khai báo Sitemap. Bài này hướng dẫn cách tạo, mẫu file thông dụng và cách kiểm tra lỗi robots.txt.

1. File Robots.txt Là Gì Và Chức Năng Của Nó?

File robots.txt là một file văn bản thuần (plain text) đặt ở thư mục gốc của website (ví dụ example.com/robots.txt), dùng để chỉ định cho các bot tìm kiếm biết những đường dẫn nào được phép hoặc không được phép crawl, khác với việc chặn index bằng thẻ noindex.

Nói ngắn gọn, robots.txt là gì có thể hiểu như một tấm biển chỉ dẫn đặt ở cửa website. Khi một bot tìm kiếm như Googlebot ghé thăm, nó thường đọc file này trước để biết chủ website muốn cho phép hay hạn chế thu thập ở những khu vực nào. File đặt cố định tại thư mục gốc và truy cập được qua đường dẫn tên miền kèm robots.txt, ví dụ dạng example.com/robots.txt.

Chức năng chính của robots.txt là điều hướng hành vi crawl chứ không phải chặn hiển thị. Nó giúp bạn tránh để bot lãng phí tài nguyên vào các khu vực không cần thiết như trang quản trị, trang lọc trùng lặp hay tệp hệ thống. Tuy nhiên, cần phân biệt rõ: chặn crawl bằng robots.txt không đồng nghĩa với chặn một trang xuất hiện trên Google. Nếu muốn một trang không được index, cách đúng là dùng thẻ meta noindex, không phải chỉ dựa vào robots.txt.

Hiểu đúng ranh giới này rất quan trọng để tránh sai lầm phổ biến. Robots.txt là một phần trong bức tranh kỹ thuật của cách làm SEO cho website, hoạt động song song với sitemap và các cấu hình khác, chứ không phải công cụ vạn năng quyết định thứ hạng.

File robots.txt là gì
File robots.txt là gì

2. Cú Pháp Cơ Bản Của File Robots.txt

File robots.txt dùng một bộ cú pháp đơn giản, chủ yếu xoay quanh bốn thành phần. Bảng dưới tóm tắt ý nghĩa của từng directive để bạn nắm trước khi viết file.

Directive Ý nghĩa Ví dụ giá trị
User-agent Chỉ định quy tắc áp dụng cho bot nào * (mọi bot) hoặc Googlebot
Disallow Chặn bot crawl đường dẫn được chỉ định /wp-admin/
Allow Cho phép crawl một đường dẫn dù thư mục cha bị chặn /wp-admin/admin-ajax.php
Sitemap Khai báo địa chỉ sitemap của website https://example.com/sitemap.xml

Một khối quy tắc bắt đầu bằng dòng User-agent xác định bot áp dụng, tiếp theo là các dòng Disallow hoặc Allow. Dấu sao trong User-agent nghĩa là quy tắc áp dụng cho mọi bot. Đường dẫn trong Disallow tính từ thư mục gốc, và một dòng Disallow để trống nghĩa là không chặn gì. Cú pháp phân biệt chữ hoa chữ thường ở phần đường dẫn, nên cần viết chính xác theo cấu trúc URL thật của website.

Ngoài các directive cơ bản, Google còn hỗ trợ hai ký tự đặc biệt trong phần đường dẫn để khớp mẫu linh hoạt hơn. Dấu sao đại diện cho một chuỗi ký tự bất kỳ, ví dụ một quy tắc có thể chặn mọi URL chứa một đoạn nhất định. Dấu đô la đánh dấu điểm kết thúc của URL, hữu ích khi muốn chặn các đường dẫn có phần đuôi cụ thể như một loại tệp. Hai ký tự này giúp viết quy tắc gọn hơn, nhưng cũng dễ gây chặn nhầm nếu dùng thiếu cẩn thận, nên hãy kiểm tra kỹ sau khi áp dụng.

Bạn cũng có thể viết nhiều khối quy tắc trong cùng một file, mỗi khối cho một hoặc một nhóm bot khác nhau. Ví dụ, bạn để một khối chung cho mọi bot và một khối riêng cho một bot cụ thể nếu muốn áp dụng quy tắc khác biệt. Khi một bot đọc file, nó sẽ ưu tiên khối quy tắc dành riêng cho mình nếu có, nếu không mới áp dụng khối chung. Cách tổ chức rõ ràng theo từng khối giúp file dễ đọc và tránh mâu thuẫn giữa các quy tắc.

Cú pháp cơ bản robots.txt
Cú pháp cơ bản robots.txt

3. Cách Tạo File Robots.txt Chuẩn Cho Website

3.1. Tạo Robots.txt Cho Website WordPress

WordPress mặc định tạo sẵn một file robots.txt ảo với vài quy tắc cơ bản. Để chỉnh sửa dễ dàng mà không cần đụng đến FTP, bạn có thể dùng plugin SEO như Yoast SEO hoặc Rank Math, cả hai đều có mục cho phép xem và chỉnh nội dung robots.txt ngay trong trang quản trị. Sau khi lưu, plugin sẽ ghi đè file ảo bằng nội dung bạn nhập, giúp việc bổ sung directive hoặc khai báo sitemap trở nên đơn giản.

3.2. Tạo Robots.txt Cho Website Không Dùng WordPress

Với website tĩnh hoặc nền tảng khác, bạn tạo một file văn bản đặt tên chính xác là robots.txt, soạn nội dung bằng trình soạn thảo văn bản thuần, rồi tải lên thư mục gốc của website qua trình quản lý tệp của hosting hoặc FTP. Điều quan trọng là file phải nằm ở gốc để truy cập được đúng đường dẫn tên miền kèm robots.txt, chứ không đặt trong thư mục con. Sau khi tải lên, hãy mở địa chỉ đó trên trình duyệt để xác nhận nội dung hiển thị đúng.

3.3. Kiểm Tra Lại File Ngay Sau Khi Tạo

Dù tạo bằng plugin hay tải lên thủ công, bạn nên kiểm tra lại file ngay sau khi hoàn tất. Trước hết, mở địa chỉ robots.txt trên trình duyệt và đọc kỹ từng dòng để chắc rằng không có quy tắc nào chặn nhầm nội dung chính. Tiếp theo, thử đối chiếu một vài URL quan trọng với các quy tắc trong file: nếu một bài viết cần index lại rơi vào phạm vi một dòng Disallow, đó là dấu hiệu cần sửa ngay. Việc rà soát sớm giúp tránh tình huống đáng tiếc khi cả website bị chặn khỏi crawl chỉ vì một dòng viết sai, điều mà nhiều người chỉ phát hiện sau khi lượng truy cập giảm.

Cách Tạo File Robots.txt Chuẩn Cho Website
Cách Tạo File Robots.txt Chuẩn Cho Website

4. Các Mẫu File Robots.txt Thông Dụng

Dưới đây là vài mẫu file robots.txt phổ biến để bạn tham khảo và điều chỉnh theo nhu cầu thực tế. Hãy luôn kiểm tra lại đường dẫn cho khớp với cấu trúc website của mình trước khi áp dụng.

Mẫu cho phép mọi bot crawl toàn bộ website và khai báo sitemap:

User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml

Mẫu WordPress cơ bản, chặn khu vực quản trị nhưng vẫn cho phép tệp xử lý cần thiết:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml

Với các mẫu trên, hãy thay example.com bằng tên miền thật và điều chỉnh đường dẫn sitemap cho khớp. Nếu website đang trong giai đoạn phát triển và bạn chưa muốn công khai, có thể tạm chặn toàn bộ bằng cách dùng Disallow gạch chéo, nhưng nhớ gỡ bỏ trước khi ra mắt để không vô tình chặn cả trang khỏi kết quả tìm kiếm.

Mẫu file robots.txt thông dụng
Mẫu file robots.txt thông dụng

5. Những Khu Vực Nên Và Không Nên Chặn Trong Robots.txt

Một trong những băn khoăn lớn nhất khi tạo file robots.txt là chặn gì và để mở gì. Chặn quá tay dễ khiến bot không tiếp cận được nội dung giá trị, còn để mở mọi thứ đôi khi làm bot lãng phí tài nguyên vào các trang vô nghĩa. Bảng dưới đây tóm tắt định hướng chung để bạn cân nhắc.

Khu vực Nên hay không nên chặn Lý do
Trang quản trị, đăng nhập Nên chặn Không có giá trị tìm kiếm, tránh lãng phí crawl
Kết quả tìm kiếm nội bộ, trang lọc trùng Cân nhắc chặn Dễ tạo nội dung trùng lặp, gây loãng crawl
Bài viết, trang sản phẩm, chuyên mục Không nên chặn Đây là nội dung cần được crawl và index
Tệp CSS, JavaScript, hình ảnh Không nên chặn Bot cần chúng để hiển thị và hiểu trang đúng

Một lỗi kinh điển là chặn nhầm thư mục chứa CSS và JavaScript vì nghĩ chúng không quan trọng với SEO. Thực tế, khi bot không đọc được các tệp này, nó có thể hiểu sai bố cục và trải nghiệm trang, ảnh hưởng đến cách đánh giá. Vì vậy hãy để mở các tài nguyên cần thiết cho việc hiển thị, và chỉ chặn những gì thực sự không cần xuất hiện trong quá trình crawl.

Những Khu Vực Nên Và Không Nên Chặn Trong Robots.txt
Những Khu Vực Nên Và Không Nên Chặn Trong Robots.txt

6. Cách Tối Ưu Robots.txt Để Điều Hướng Bot Tìm Kiếm Hiệu Quả

Tối ưu robots.txt cho seo không nằm ở việc chặn thật nhiều, mà ở việc chặn đúng chỗ. Nguyên tắc là chỉ hạn chế những khu vực thực sự không cần xuất hiện trong kết quả tìm kiếm hoặc gây lãng phí tài nguyên crawl, còn lại nên để bot tự do tiếp cận nội dung giá trị. Việc chặn nhầm các thư mục chứa tài nguyên quan trọng có thể khiến trang hiển thị sai hoặc bị đánh giá thấp.

Một thực hành nên có là khai báo địa chỉ sitemap ngay trong robots.txt, giúp mọi công cụ tìm kiếm tìm thấy danh sách URL một cách nhất quán. Nếu bạn chưa có sitemap, hãy xem trước bài tạo sitemap cho website để chuẩn bị file này. Ngoài ra, tránh dùng robots.txt để cố giấu thông tin nhạy cảm, vì file này công khai và ai cũng đọc được; dữ liệu cần bảo mật nên được bảo vệ bằng cơ chế phía máy chủ.

Lưu ý: Robots.txt điều hướng crawl, không đảm bảo hay quyết định thứ hạng. Cấu hình sai có thể gây hại, nhưng cấu hình đúng cũng không tự đưa website lên top; nó chỉ là một phần trong tổng thể SEO kỹ thuật.

7. Cách Kiểm Tra Lỗi File Robots.txt Trên Website

Sau khi tạo hoặc chỉnh sửa, việc kiểm tra lỗi robots.txt giúp bạn chắc chắn không vô tình chặn nhầm nội dung quan trọng. Cách đơn giản nhất là mở trực tiếp địa chỉ robots.txt trên trình duyệt để đọc lại toàn bộ quy tắc, xem có dòng nào chặn nhầm hay sai đường dẫn không. Đây là bước rà soát nhanh mà ai cũng làm được.

Để kiểm tra kỹ hơn, bạn có thể dùng các công cụ dành cho quản trị website. Google Search Console cung cấp báo cáo về khả năng crawl và cho biết nếu một URL bị chặn bởi robots.txt. Ngoài ra còn có các công cụ kiểm tra robots.txt cho phép thử một đường dẫn cụ thể xem có bị chặn với một bot nhất định hay không. Nếu phát hiện lỗi, hãy chỉnh lại directive tương ứng, lưu file và kiểm tra lại cho đến khi các trang quan trọng đều ở trạng thái cho phép crawl.

Sau mỗi lần thay đổi lớn về cấu trúc website, bạn nên rà soát robots.txt một lần để đảm bảo nó vẫn phản ánh đúng ý định. Việc theo dõi định kỳ trong Google Search Console cũng giúp phát hiện sớm nếu có trang quan trọng bất ngờ bị chặn khỏi kết quả tìm kiếm.

Một thói quen tốt là lưu lại bản sao nội dung robots.txt mỗi khi chỉnh sửa, kèm ghi chú ngắn về lý do thay đổi. Khi website gặp sự cố về crawl, bạn có thể nhanh chóng đối chiếu để biết thay đổi nào có thể là nguyên nhân và khôi phục lại cấu hình cũ nếu cần. Với các dự án có nhiều người cùng quản trị, việc thống nhất trước khi sửa file này giúp tránh tình trạng mỗi người chỉnh một kiểu gây xung đột quy tắc.

Kiểm tra lỗi robots.txt
Kiểm tra lỗi robots.txt

8. Robots.txt Liên Quan Gì Đến Sitemap, Backlink Và SEO Tổng Thể?

Robots.txt chỉ là một mắt xích trong hệ thống kỹ thuật SEO. Hiểu cách nó kết nối với các phần khác giúp bạn biết nên hoàn thiện tiếp điều gì.

Gần gũi nhất là sitemap: robots.txt điều hướng bot nên và không nên crawl gì, còn sitemap cung cấp danh sách URL cần crawl, hai file bổ trợ trực tiếp cho nhau. Ở khía cạnh hạ tầng, nơi đặt và cấu hình file phụ thuộc vào máy chủ, nên nếu bạn tự vận hành hosting thì bài cách làm hosting cho website sẽ hữu ích. Để nội dung được hiểu rõ hơn, bạn có thể kết hợp tạo schema cho website, còn về uy tín thì tạo backlink cho website mới là yếu tố củng cố thứ hạng.

Muốn đo lường hiệu quả sau khi cấu hình, bạn nên cài công cụ theo dõi theo hướng dẫn trong bài tạo Google Analytics cho website. Nếu bạn phụ trách vận hành lâu dài, việc nắm quản trị website là làm gì giúp duy trì các cấu hình kỹ thuật ổn định, và khi cần phân tích một tên miền, bạn có thể kiểm tra ngày lập trang web để có thêm bối cảnh.

9. Câu Hỏi Thường Gặp

Website không có file robots.txt thì có sao không?

Không sao trong phần lớn trường hợp. Khi không tìm thấy robots.txt, bot thường mặc định được phép crawl toàn bộ website. Tuy nhiên, có file robots.txt vẫn nên hơn vì nó cho bạn quyền kiểm soát khu vực nào bot nên tránh và là nơi khai báo sitemap, giúp việc thu thập dữ liệu gọn gàng hơn.

Robots.txt có ngăn được trang bị index trên Google không?

Không hoàn toàn. Robots.txt ngăn bot crawl một đường dẫn, nhưng nếu trang đó được liên kết từ nơi khác, nó vẫn có thể xuất hiện trong kết quả tìm kiếm mà không kèm mô tả. Để chắc chắn một trang không được index, bạn nên dùng thẻ meta noindex thay vì chỉ dựa vào robots.txt.

Sửa sai file robots.txt có ảnh hưởng đến SEO không?

Có thể ảnh hưởng đáng kể. Một dòng Disallow đặt sai có thể vô tình chặn cả website hoặc các trang quan trọng khỏi việc crawl, khiến chúng dần biến mất khỏi kết quả tìm kiếm. Vì vậy sau mỗi lần chỉnh sửa, hãy kiểm tra kỹ và theo dõi trong Google Search Console để phát hiện sớm nếu có trục trặc.

WordPress có tự tạo robots.txt mặc định không?

Có. WordPress tạo sẵn một file robots.txt ảo với vài quy tắc cơ bản, ví dụ chặn thư mục quản trị nhưng vẫn cho phép tệp xử lý cần thiết. Bạn có thể ghi đè file ảo này bằng nội dung tùy chỉnh thông qua plugin SEO hoặc bằng cách tạo file robots.txt thật đặt ở thư mục gốc.

Robots.txt và thẻ meta noindex khác nhau thế nào?

Robots.txt kiểm soát việc bot có được crawl một đường dẫn hay không, còn thẻ meta noindex nằm trong mã trang và yêu cầu công cụ tìm kiếm không index trang đó. Muốn chặn crawl thì dùng robots.txt; muốn trang không xuất hiện trên Google thì dùng noindex. Lưu ý là nếu chặn crawl bằng robots.txt, bot có thể không đọc được thẻ noindex bên trong trang.

Tạo file robots.txt cho website là việc kỹ thuật đơn giản nhưng cần cẩn trọng, vì cấu hình sai có thể chặn nhầm nội dung quan trọng. Hãy dùng đúng cú pháp, kiểm tra kỹ và xem nó là một phần trong tổng thể SEO kỹ thuật. Khám phá thêm hướng dẫn tại chuyên mục Website & Hạ Tầng của TechVon và đăng ký nhận bản tin để cập nhật mới nhất. Nội dung được biên tập bởi Nguyễn Anh Quang.
Nguyễn Anh Quang
Về tác giả

Nguyễn Anh Quang

Hello mọi người

Tìm hiểu về Nguyễn Anh Quang →

Bước tiếp theo của bạn

Nhận checklist xây Website từ A-Z

Checklist gọn giúp bạn kiểm tra tên miền, hosting, WordPress, nội dung và SEO.

    Không spam. Bạn có thể hủy đăng ký bất cứ lúc nào.