Что такое индексация сайта
Индексация нужна, чтобы поисковая система добавила страницы сайта в свою базу и могла показать их пользователям.
Обновлено 11 сентября 2026
Индексация сайта показывает, какие страницы поисковик нашел, прочитал и добавил в свою базу. За 20-30 минут можно проверить состояние сайта в Яндексе и Google, найти причины выпадения страниц и запустить повторный обход.
Что такое индексация
Индексация сайта - это обработка страниц поисковым роботом и сохранение подходящих документов в индексе (базе данных поисковой системы). После этого страница может попасть в поисковую выдачу по подходящим запросам.
Не путайте три разных действия:
- Обход - робот открывает URL, переходит по ссылкам и читает содержимое.
- Индексирование - поисковик анализирует текст, код, изображения и связь страницы с другими документами.
- Показ - система решает, выводить ли страницу пользователю и на какой позиции.
Поэтому наличие страницы в индексе не гарантирует ее видимость по запросам. Документ может индексироваться, но находиться далеко от первой страницы. Поисковик также может временно убрать URL из результатов, если обнаружит техническую ошибку, дубликат или слабое содержание.
Веб-индексация сайта на практике: робот получает адрес, скачивает ответ сервера, проверяет правила robots.txt, извлекает ссылки и оценивает содержание. Затем поисковик решает, хранить ли страницу в индексе.
Как робот обходит сайт
Робот находит URL из нескольких источников: внутренних ссылок, XML-карты сайта, внешних ссылок, истории обхода и сообщений владельца в панели вебмастера. Дальше он отправляет HTTP-запрос. Сервер должен вернуть страницу без авторизации и с понятным статусом.
- Робот проверяет файл robots.txt. Запрет в нем может остановить обход раздела.
- Сервер возвращает код ответа. Код 200 сообщает, что документ доступен. Коды 301 и 308 передают адрес на другой URL, а 404 и 410 сообщают об отсутствии страницы.
- Робот читает HTML и видит ссылки, метатег robots, canonical, заголовок, текст и структурированные данные.
- Поисковик проверяет, нет ли похожего документа с более подходящим URL.
- После обработки страница получает один из статусов: попала в индекс, ожидает обработки, исключена или заблокирована.
Частота обхода зависит от размера сайта, скорости сервера, количества изменений и внутренних ссылок. Публикация новой страницы сама по себе не запускает мгновенное индексирование.
Robots.txt и запрет индексации
Запрос "закрыть сайт от индексации robots txt" часто приводит к ошибке. Директива Disallow запрещает роботу заходить на URL, но не удаляет адрес из поиска. Если на закрытую страницу ссылаются извне, поисковик может показать ее адрес без текста.
Чтобы закрыть отдельную страницу от индекса, используйте в HTML:
<meta name="robots" content="noindex, follow">
Для PDF, изображений и других файлов применяют HTTP-заголовок X-Robots-Tag: noindex. Робот должен иметь доступ к URL, чтобы увидеть этот запрет. Поэтому нельзя одновременно закрывать страницу через robots.txt и ждать, что noindex сработает.
Почему страницы не попадают в поиск
Сначала разделите проблему. Страница может не индексироваться, не отображаться по нужной фразе или выпасть после обновления сайта. Проверка зависит от причины.
- Запрет в robots.txt. Правило может закрывать весь сайт, папку, параметры URL или нужный файл.
- noindex. Метатег в шаблоне иногда случайно остается после разработки или тестового запуска.
- Неправильный canonical. Страница указывает каноническим другой URL, поэтому поисковик выбирает его.
- Ошибка сервера. Ответ 5xx, долгая загрузка, обрыв соединения или защита от роботов мешают скачиванию.
- Редирект. Новый URL ведет через цепочку из нескольких переходов или возвращается на старый адрес.
- Дубликаты. Фильтры, параметры, версии с www и без www создают много похожих страниц.
- Слабая страница. На ней мало самостоятельного текста, повторяются фразы с других URL или нет ответа на запрос пользователя.
- Нет внутренних ссылок. Одинокий URL в карте сайта робот посещает реже, чем страницу из меню или тематической статьи.
- Медленный сервер. При ограниченном времени обхода робот не успевает загрузить весь сайт.
- Сайт требует вход. Страница доступна владельцу, но не анонимному роботу.
Сообщение "скрыто из поисковой выдачи" не всегда означает санкцию. Часто речь идет о техническом исключении: дубле, noindex, недоступности или выборе другой канонической страницы.
Минимальные ориентиры для проверки
| Показатель | Что считать тревожным сигналом | Что проверить |
|---|---|---|
| HTTP-ответ | 404, 410 или 5xx у рабочей страницы | Логи, сервер, ссылки и настройки CMS |
| Редиректы | 2 и более переходов до конечного URL | Цепочку 301/308 и ссылки на старый адрес |
| robots.txt | Disallow: / или закрытая нужная папка | Правила для робота и карту сайта |
| XML-карта | В ней есть 404, редиректы и URL с noindex | Оставить только доступные канонические страницы |
| Скорость ответа | Сервер отвечает дольше 2-3 секунд стабильно | Хостинг, кеширование, базу данных и тяжелые скрипты |
| Внутренние ссылки | У страницы нет ссылок с других URL | Меню, хлебные крошки, категории и тематические блоки |
Эти числа служат практическими ориентирами, а не автоматическими санкциями. Один медленный ответ не исключает страницу, но постоянные ошибки сильно мешают обходу.
Проверка индексирования
Проверка в Яндексе
- Откройте Яндекс Вебмастер и выберите нужный сайт.
- Перейдите в раздел Индексирование, затем откройте Проверка страницы.
- Вставьте полный URL и нажмите Проверить.
- Посмотрите, доступна ли страница роботу, какой canonical выбран и есть ли запрет в robots.txt.
- Если URL исправен, нажмите Переобход страниц или используйте кнопку отправки страницы на переобход.
- Для общей картины откройте отчет Индексирование и изучите исключенные страницы, ошибки ответа и найденные URL.
Проверяйте адрес с протоколом, поддоменом и завершающим слешем в точности так, как он открывается на сайте. Варианты http, https, www и без www могут считаться разными ресурсами.
Проверка в Google
- Откройте Google Search Console и выберите ресурс.
- Вставьте URL в верхнюю строку Проверка URL.
- Изучите строку URL есть в Google или причину, по которой страница отсутствует.
- Раскройте блоки Индексирование, Сканирование и Проверка доступности страницы.
- Нажмите Проверить опубликованный URL, если хотите проверить текущую версию, а не сохраненный результат.
- После исправлений нажмите Запросить индексирование. У Google есть ограничение на частоту таких запросов, поэтому не отправляйте один URL десятки раз.
Для массовой диагностики откройте отчет Индексирование страниц. В нем видны страницы с ошибками, исключенные URL и документы, которые Google нашел, но пока не добавил в индекс. Отчет Файлы Sitemap показывает, прочитал ли поисковик XML-карту и сколько URL из нее обработал.
Проверка без панелей
Введите в поиске запрос site:example.ru. Он покажет часть страниц домена, но не полный список и не точный статус каждой страницы. Для конкретного URL можно использовать site:example.ru/page, однако результат иногда обновляется с задержкой.
Сравните найденные адреса с XML-картой и списком страниц в CMS. Этот же список можно получить готовым: Seohand собирает его бесплатно за пару минут.
Не делайте вывод по одной проверке. Сверьте URL в панели вебмастера, код ответа, исходный HTML и фактическое открытие страницы в режиме без авторизации.
Как ускорить обнаружение страниц
- Добавьте URL в XML-карту. Оставьте там только канонические страницы со статусом 200. Укажите карту в robots.txt строкой Sitemap: https://example.ru/sitemap.xml.
- Создайте внутренние ссылки. Свяжите новую статью с категорией, главной страницей и двумя-тремя близкими материалами. Ссылка должна быть обычной HTML-ссылкой, а не только обработчиком JavaScript.
- Отправьте адрес на переобход. В Яндекс Вебмастере используйте Переобход страниц, в Google Search Console - Запросить индексирование.
- Уберите технические блокировки. Проверьте robots.txt, noindex, canonical, авторизацию и настройки CDN.
- Ускорьте сервер. Включите кеширование, сожмите изображения, удалите лишние запросы и проверьте время ответа без браузера.
- Дайте странице пользу. Добавьте ответ на конкретный запрос, примеры, характеристики, условия, изображения с понятными alt и ссылки на источники.
- Не создавайте сотни почти одинаковых URL. Закройте служебные параметры, сортировки и пустые страницы фильтров, если они не нужны пользователю.
После изменений подождите. Переобход может занять от нескольких часов до нескольких недель, особенно у небольшого сайта с редкими обновлениями. Повторная отправка каждые пять минут не ускоряет процесс.
Типичные ошибки
- Проверять только site:. Поисковый оператор дает неполную выборку и не показывает точную причину исключения.
- Закрыть все через robots.txt. Так часто пытаются убрать старые страницы, но получают URL без содержимого в выдаче. Для удаления сначала открывают страницу роботу и ставят noindex, либо используют инструмент удаления в панели.
- Оставить noindex в шаблоне. Проверяйте исходный код, а не только видимую страницу. Ищите строку meta name="robots".
- Добавить в sitemap все подряд. Редиректы, 404 и страницы с параметрами снижают доверие к карте сайта и усложняют диагностику.
- Считать 200 гарантией индекса. Такой код говорит о доступности ответа, но не о решении поисковика хранить документ.
- Менять URL после каждой проверки. Так появляются дубли и теряется история адреса. Сначала исправьте страницу, затем отправьте ее на переобход.
- Проверять сайт из аккаунта администратора. Владелец видит закрытые разделы, кешированную версию или страницу после авторизации. Откройте URL в режиме инкогнито и проверьте его без cookie.
- Забыть про мобильную версию. Ошибка адаптивности, скрытый текст или сломанный JavaScript могут повлиять на обработку страницы.
- Удалить страницу без перенаправления. Если у старого URL есть ссылки и трафик, настройте 301 на близкую по смыслу страницу или верните 410, когда замены нет.
Как поставить задачу нейросети
Нейросеть пригодится для первичного разбора выгрузки. Дайте ей URL, статусы, заголовки, canonical, robots и сообщения из панелей. Не передавайте пароли, токены и персональные данные.
Ты технический SEO-аналитик. Проанализируй список URL сайта и подготовь таблицу с колонками: URL, HTTP-код, robots.txt, meta robots, canonical, наличие в XML-карте, внутренняя ссылка, вероятная причина отсутствия в индексе, действие и приоритет. Раздели выводы на подтвержденные факты и гипотезы. Не придумывай данные, которых нет в файле. Для каждой гипотезы укажи, какой проверкой в Яндекс Вебмастере или Google Search Console ее подтвердить. Отдельно найди: 404 и 5xx, цепочки редиректов, noindex, закрытые robots.txt URL, canonical на другой адрес, дубли и страницы без внутренних ссылок. В конце составь пошаговый план исправлений на сегодня, эту неделю и позже. Вот данные: [вставьте выгрузку]
Нейросеть не видит закрытые отчеты, серверные логи и реальные правила CDN, если вы не передали их текстом. Она может перепутать запрет обхода с запретом индексации, назвать страницу дублем без сравнения контента или уверенно выдумать кнопку в интерфейсе панели. Проверяйте каждый вывод по исходному HTML, ответу сервера, robots.txt и отчетам Проверка URL. Решение об отправке на переобход принимайте после ручной проверки.