Проверка robots.txt
Проверка robots.txt идет по RFC 9309, тому же документу, по которому файл читают поисковые роботы. Вставьте файл или имя сайта и добавьте адреса: в таблице будет видно, открыт каждый из них или закрыт и какая директива это решила.
- Бесплатно
- Без регистрации
- Результат таблицей
Работа инструмента 0 руб. Таблица открывается на этой же странице, файл xlsx скачивается после регистрации. Другие инструменты
| Адрес | Решение | Правило | Группа |
|---|---|---|---|
| https://seohand.ru/rabota/ | открыт | Allow: / | * |
| https://seohand.ru/order/12 | закрыт | Disallow: /order/ | * |
| https://seohand.ru/tarify/ | открыт | Allow: / | * |
| https://seohand.ru/api/site/1 | закрыт | Disallow: /api/ | * |
| https://seohand.ru/blog/ | открыт | Allow: / | * |
Что в отчете
- Решение по каждому адресу. Четыре колонки: адрес, открыт или закрыт, правило, которое это решило, и группа, где это правило стоит.
- Видно само правило. В таблице стоит не вердикт, а строка из файла. Спорить с результатом можно, глядя на нее, а не на догадки.
- Разбор под выбранного робота. Яндекс, Google или любой другой. Если для робота есть своя группа User-agent, звездочку он не читает вовсе, и отчет это учитывает.
- Сводка по файлу. Источник, робот, карты сайта из файла, число правил и число групп. Сразу видно, если Sitemap забыли или групп оказалось больше, чем вы думали.
Инструмент отвечает на один вопрос: закрыт этот url в robots.txt или открыт, и какой директивой. Не догадка, а строка из файла и группа, в которой она стоит. Разбор идет по RFC 9309, тому же документу, по которому файл читают поисковые роботы.
Какое правило выигрывает
Директив, подходящих к одному url, обычно несколько, и это главный источник путаницы. Побеждает самое длинное подходящее правило. К адресу /catalog/shoes/nike/ подходят и Disallow: /catalog/, и Allow: /catalog/shoes/. Выиграет Allow: его строка длиннее. Если длина совпала, выигрывает тоже Allow.
Порядок строк в файле на решение не влияет, хотя многие уверены в обратном. Переставлять Allow выше Disallow бесполезно, длина все равно решит по-своему. Поэтому в таблице стоит колонка с правилом: когда вердикт кажется странным, обычно находится строка длиннее той, на которую вы смотрели. Синтаксис тут простой, ошибки чаще в голове, чем в файле.
Звездочка, доллар и начало адреса
Правило без спецсимволов сравнивается с началом пути. На домене example.com директива Disallow: /catalog закроет и /catalog, и /catalog/shoes/, и /catalogue-2024/, потому что все три с нее начинаются.
- Звездочка внутри правила подменяет любой кусок адреса: /*.pdf подходит и к /docs/a.pdf, и к /b.pdf.
- Доллар в конце означает конец url: /catalog$ закрывает ровно /catalog и не трогает /catalog/shoes/.
- Звездочка и доллар вместе, вида /*.php$, закрывают страницы, которые кончаются на .php, и пропускают те, где после .php идет строка параметров.
Группы и роботы
Файл состоит из групп, каждая начинается со строки User-agent. Робот выбирает себе одну группу и читает только ее. Если в файле есть User-agent: Yandex, Яндекс работает по ней, а группу со звездочкой не смотрит вовсе, даже если в ней лежат важные запреты. Google в том же файле читает звездочку, если своей группы у него нет.
Отсюда частая поломка: добавили отдельную группу для Яндекса с парой строк, а все остальные запреты остались в звездочке и для Яндекса перестали работать. Поэтому в инструменте есть выбор робота, и один и тот же файл имеет смысл разобрать дважды. Строка Crawl-delay сюда же: она про скорость обхода, а не про доступ, и на запреты не влияет вовсе.
Запрет тут не убирает страницу из выдачи
Самое дорогое заблуждение про robots.txt. Disallow запрещает роботу заходить на страницу, а не показывать ее. Робот не зашел, значит noindex внутри страницы он не прочитал. Адрес при этом остается в выдаче голой ссылкой без описания, и висеть там может долго.
Чтобы страница ушла из выдачи, порядок обратный: открыть ее в robots.txt и поставить noindex на самой странице. Робот зайдет, прочитает запрет и уберет страницу. Закрывать ее в robots.txt можно после того, как она из выдачи пропала, и то обычно уже незачем.
Когда файл отдает ошибку
Код ответа у robots.txt важен не меньше содержимого. Ответ 4xx поиск читает как пустой файл: разрешено все, весь сайт открыт. Ответ 5xx робот читает как временную недоступность сайта. Поэтому при разборе смотрите и на текст файла, и на код, которым он отвечает.
Что проверять рядом
Если страницы нет в индексе, robots.txt это первая версия, но не единственная. Дальше идут мета-тег robots и заголовок ответа сервера, канонический адрес и наличие страницы в карте сайта. Что с url на самом деле, показывает проверка индексации, а адреса для нее удобно брать из sitemap.xml: строки Sitemap из robots.txt мы выводим под таблицей как раз для этого. Такой разбор занимает минуту и снимает половину вопросов технического seo.
Кому подходит
- Страница пропала из индекса, и надо понять, не закрыл ли ее robots.txt
- Переписали файл и хотите проверить черновик до выкладки
- Нужно показать разработчику, какое именно правило рубит раздел
Когда не нужно
- Если надо убрать страницу из выдачи: robots.txt для этого не годится
- Если страница закрыта мета-тегом robots или заголовком ответа сервера
- Если вопрос про скорость обхода и нагрузку на сервер
Сколько это стоит
- Разбор и список дел за две-три минуты
- Без регистрации и без банковской карты
- Задание копирайтеру, 490 руб, docx за 5 минут
- Что показывать в поиске, 1 900 руб, xlsx за 20 минут
- Ссылки, которых не хватает, 1 900 руб, xlsx за 20 минут
- Семантика и структура, 3 900 руб, xlsx за 15 минут