Файл robots.txt: синтаксис, правила и частые ошибки

Файл robots.txt управляет тем, какие страницы сайта могут сканировать поисковые роботы. Полное руководство с примерами и типичными ошибками.

Robots.txt — текстовый файл в корне сайта, который сообщает поисковым роботам, какие страницы можно сканировать, а какие — нет. Этот механизм называется Robots Exclusion Protocol (REP).

Синтаксис robots.txt

User-agent: * — правило применяется ко всем роботам. Можно указать конкретного: User-agent: Googlebot.

Disallow: /admin/ — запрещает сканирование раздела /admin/.

Allow: /admin/public — разрешает конкретный путь внутри запрещённого раздела.

Sitemap: https://example.com/sitemap.xml — указывает расположение XML-карты сайта.

Типичные ошибки

Disallow: / — блокирует весь сайт. Критическая ошибка, которую часто допускают случайно на продакшн-сайтах.

Блокировка CSS и JS файлов — Google не сможет правильно отрендерить страницу и оценить контент.

Конфликтующие правила — Disallow и Allow для одного пути. Роботы применяют более специфичное правило.

Как проверить robots.txt?

Используйте инструмент проверки robots.txt на domaudit.com — он отображает содержимое файла и проверяет корректность синтаксиса.

Часто задаваемые вопросы

Robots.txt запрещает индексацию страниц?
Нет! Disallow запрещает только сканирование. Страница может быть проиндексирована по ссылкам с других сайтов. Для запрета индексации используйте <meta name="robots" content="noindex">.
Обязателен ли robots.txt?
Нет, но рекомендуется для любого сайта. Без него роботы могут сканировать технические разделы и перегружать сервер.
Файл robots.txt: синтаксис, правила и частые ошибки | DomAudit