Если страницы сайта не индексируются, они не смогут участвовать в поиске и получать органический трафик. Причины бывают разными: поисковый робот еще не обнаружил новый сайт, доступ закрыт техническими настройками, страница является дублем или поисковая система решила не добавлять ее в индекс.

При этом отсутствие сайта по нужному запросу еще не означает проблемы с индексацией. Страница может находиться в базе поисковой системы, но занимать низкие позиции. Поэтому диагностику нужно начинать с проверки самого факта индексирования.

Что такое индексация сайта

Индексация — это обработка найденной страницы поисковой системой и добавление информации о ней в поисковую базу. До этого робот должен обнаружить URL и просканировать его содержимое.

Упрощенно процесс выглядит так:

  1. поисковый робот узнает о странице;
  2. переходит по URL и загружает содержимое;
  3. анализирует текст, ссылки и другие элементы;
  4. принимает решение об индексировании;
  5. проиндексированная страница получает возможность участвовать в поиске.

Яндекс отдельно выделяет обход сайта, загрузку и обработку информации, формирование поисковой базы и непосредственно формирование результатов поиска. Поэтому «робот посетил страницу» и «страница попала в поиск» — не одно и то же.

Как проверить, индексируется ли сайт

Начать можно с простого поискового оператора:

site:example.ru

Вместо example.ru укажите свой домен. Если поисковик показывает страницы сайта, значит хотя бы часть ресурса уже находится в индексе. Google также рекомендует оператор site: как один из способов первоначальной проверки присутствия сайта или отдельной страницы в поисковой базе.

Но этот способ подходит только для быстрой диагностики. Более точную информацию стоит смотреть в сервисах поисковых систем.

Проверка в Яндекс.Вебмастере

Добавьте сайт в Яндекс.Вебмастер и проверьте данные об индексировании. Сервис позволяет посмотреть страницы в поиске, статистику обхода и причины, по которым отдельные URL были исключены.

Для конкретного URL также можно использовать инструмент Яндекса «Анализ индексации страницы». Он помогает определить, известна ли страница поисковой системе и есть ли технические проблемы, мешающие ее индексированию.

Проверка в Google Search Console

В Google Search Console откройте раздел «Индексирование страниц». В нем показывается количество проиндексированных и непроиндексированных URL, а также причины, по которым страницы не были добавлены в индекс.

Если нужно проверить один адрес, воспользуйтесь инструментом проверки URL.

Почему сайт не индексируется

Сайт или страница появились недавно

Поисковая система не узнает о новой странице мгновенно. Сначала робот должен обнаружить ее, например через внутреннюю или внешнюю ссылку, sitemap либо инструменты вебмастера.

Особенно заметна задержка у недавно созданных сайтов. Яндекс указывает, что после добавления сайта в Вебмастер его появление в результатах поиска может занять до двух недель.

Чтобы помочь роботу быстрее обнаружить ресурс:

  • добавьте сайт в Яндекс.Вебмастер и Google Search Console;
  • создайте sitemap.xml и добавьте ссылку на карту сайта в панели Я.Вебмастер и Google Search Console;
  • добавьте внутренние ссылки на новые страницы;
  • отправьте наиболее важные URL на переобход.

Индексация запрещена в robots.txt

Файл robots.txt находится в корне сайта и содержит инструкции для поисковых роботов.

Например:

Disallow: /

может закрыть от обхода весь сайт для робота, к которому относится правило.

Такая ошибка нередко появляется после переноса проекта с тестового домена на основной: разработчики закрывают тестовую версию от поисковиков, а после запуска забывают убрать ограничение.

Важно: robots.txt в первую очередь управляет сканированием, а не гарантированным удалением URL из поисковой базы. Google прямо отмечает, что заблокированный через robots.txt адрес при определенных условиях все равно может быть известен поисковой системе.

На странице установлен noindex

Другой вариант — директива:

<meta name="robots" content="noindex">

Она сообщает поисковому роботу, что страницу не нужно добавлять в индекс.

Если страница должна участвовать в поиске, проверьте ее HTML-код и HTTP-заголовки. Google Search Console отдельно показывает URL, исключенные из индекса из-за директивы noindex.

Особое внимание уделите сайту после редизайна, переноса или запуска новой CMS: технические запреты иногда переносятся с тестовой версии на рабочую.

Сервер работает с ошибками

Робот должен получить страницу с корректным HTTP-ответом. Если сервер возвращает ошибки 5xx, периодически недоступен или отвечает некорректно, поисковая система может не получить содержимое страницы.

В документации Яндекса при проблемах с появлением сайта в поиске рекомендуется в том числе проверить доступность страниц и ответ сервера. Google Search Console также выделяет ошибки 5xx как отдельную причину отсутствия URL в индексе.

Для обычной доступной страницы, которую требуется индексировать, сервер в большинстве случаев должен отдавать код 200 OK.

Поисковый робот не может найти страницы

Страница может быть технически доступна, но практически изолирована от остального сайта. Например, на нее нигде нет ссылок и она отсутствует в sitemap.xml.

Создайте логичную внутреннюю перелинковку: важные страницы должны быть доступны через категории, меню, статьи, карточки товаров и другие документы сайта.

Google отдельно рекомендует связывать страницы ссылками так, чтобы робот мог переходить к ним от уже известных частей сайта.

Есть ошибки в sitemap.xml

Файл sitemap.xml помогает поисковым роботам обнаруживать важные URL сайта. Особенно он полезен для крупных ресурсов, интернет-магазинов и сайтов, где регулярно появляются новые страницы.

Проверьте, чтобы в sitemap:

  • находились актуальные URL;
  • не было удаленных страниц;
  • не попадали адреса, закрытые от индексирования;
  • использовался правильный протокол и домен.

Google рекомендует проверять доступность Sitemap и корректность указанных в нем URL.

Страница является дублем

Если несколько URL содержат одинаковый или практически одинаковый контент, поисковая система может выбрать одну каноническую версию, а остальные не индексировать отдельно.

Например:

example.ru/catalog/
example.ru/catalog/?utm_source=vk
example.ru/catalog/?sort=popular

Для пользователя это могут быть практически одинаковые страницы, хотя технически у них разные адреса.

В Search Console такие URL могут отображаться как копии или альтернативные версии. Само их отсутствие в индексе не обязательно является ошибкой: важно, чтобы индексировалась правильная основная страница.

Проверьте настройки rel="canonical", параметры URL, версии с www и без него, а также HTTP и HTTPS.

Контент страницы недостаточно полезен

Даже если никаких технических запретов нет, поисковая система не обязана добавлять в индекс каждый обнаруженный URL.

Проблемы чаще возникают у страниц, которые почти полностью повторяют другие документы, содержат мало самостоятельной информации или создаются массово по одному шаблону. Яндекс, например, может исключать из поиска малоценные или маловостребованные страницы.

Вместо попыток постоянно отправлять такие URL на переобход лучше сначала улучшить сами страницы:

  • добавить полезную для посетителя информацию;
  • убрать ненужные дубли;
  • объединить несколько слабых страниц, если они решают одну задачу;
  • сделать содержание страницы соответствующим реальному поисковому запросу пользователя.

Неправильно настроены редиректы и canonical

Страница может не индексироваться потому, что сама сообщает поисковику о наличии другого основного URL.

Например, установлен:

rel="canonical"

на другую страницу либо настроен 301-редирект.

В такой ситуации поисковая система может совершенно корректно исключить исходный адрес и проиндексировать конечный. В отчетах Google отдельные URL с редиректами и альтернативные канонические версии не считаются страницами, которые обязательно нужно возвращать в индекс.

Поэтому перед исправлением сначала определите: должен ли конкретный URL вообще индексироваться?

Что делать, если сайт не индексируется

Лучше проверять причины последовательно:

  1. Убедитесь, что страницы действительно отсутствуют в индексе.
  2. Посмотрите причину в Яндекс.Вебмастере и Google Search Console.
  3. Проверьте robots.txt.
  4. Найдите на нужных страницах директиву noindex.
  5. Проверьте HTTP-коды ответов.
  6. Убедитесь, что важные URL добавлены в sitemap.xml.
  7. Проверьте внутренние ссылки.
  8. Проанализируйте canonical, редиректы и дубли.
  9. Оцените качество и полезность страниц.
  10. После устранения ошибки отправьте важные URL на повторный обход.

В Яндекс.Вебмастере для этого предусмотрен инструмент «Переобход страниц». В Google Search Console повторное сканирование отдельной страницы можно запросить через инструмент проверки URL. При этом отправка URL не гарантирует мгновенного добавления в индекс: окончательное решение остается за поисковой системой.

Главное

Если сайт не индексируется, не стоит сразу искать санкции или пытаться массово отправлять все страницы на переобход. Сначала определите этап, на котором возникла проблема: робот не знает о странице, не может ее просканировать или просканировал, но решил не индексировать.

В большинстве случаев начинать диагностику стоит с Яндекс.Вебмастера и Google Search Console, а затем проверять robots.txt, noindex, ответы сервера, sitemap.xml, перелинковку, дубли и canonical.

И еще один важный момент: если страница уже присутствует в индексе, но не находится по целевым запросам, проблема связана не с индексированием, а с ранжированием. В этом случае нужно анализировать SEO-оптимизацию, контент и конкурентов в поисковой выдаче.