Robots.txt — текстовый файл в корне сайта, который сообщает поисковым роботам, какие страницы можно сканировать, а какие — нет. Этот механизм называется Robots Exclusion Protocol (REP).
Синтаксис robots.txt
User-agent: * — правило применяется ко всем роботам. Можно указать конкретного: User-agent: Googlebot.
Disallow: /admin/ — запрещает сканирование раздела /admin/.
Allow: /admin/public — разрешает конкретный путь внутри запрещённого раздела.
Sitemap: https://example.com/sitemap.xml — указывает расположение XML-карты сайта.
Типичные ошибки
Disallow: / — блокирует весь сайт. Критическая ошибка, которую часто допускают случайно на продакшн-сайтах.
Блокировка CSS и JS файлов — Google не сможет правильно отрендерить страницу и оценить контент.
Конфликтующие правила — Disallow и Allow для одного пути. Роботы применяют более специфичное правило.
Как проверить robots.txt?
Используйте инструмент проверки robots.txt на domaudit.com — он отображает содержимое файла и проверяет корректность синтаксиса.