Robots.txt

Robots.txt — это текстовый файл в корневой директории сайта, который содержит инструкции для поисковых роботов о том, какие разделы и страницы сайта им разрешено или запрещено сканировать.

С помощью robots.txt владелец сайта может управлять обходом определённых URL. Например, ограничить сканирование технических разделов, страниц с параметрами, результатов внутреннего поиска или других адресов, которые нецелесообразно регулярно посещать поисковым роботам.

Основные директивы robots.txt:

  • User-agent — определяет, для какого поискового робота предназначены правила;
  • Disallow — указывает адреса, которые не следует сканировать;
  • Allow — разрешает сканирование определённых страниц или разделов;
  • Sitemap — указывает расположение XML-карты сайта.

Robots.txt связан с краулинговым бюджетом, поскольку позволяет ограничить обход ненужных страниц и направить ресурсы поискового робота на более важные разделы сайта. Особенно это актуально для крупных интернет-магазинов, каталогов и сайтов с большим количеством динамических URL.

При этом запрет сканирования в robots.txt не является гарантированным способом исключить страницу из индексации. Если поисковику известен URL из других источников, он в некоторых случаях может сохранить его в индексе, не сканируя содержимое страницы. Поэтому robots.txt не следует считать заменой директиве Noindex.

Неправильная настройка файла может случайно закрыть от сканирования важные страницы или целые разделы сайта. Поэтому проверка robots.txt является одной из задач технической SEO-оптимизации.

Загрузка