Почему поисковые системы не индексируют страницы услуг и каталога
Содержание 12 разделов
Страница может открываться в браузере и при этом отсутствовать в поиске. Это не одна ошибка, а несколько разных этапов: робот должен узнать URL, получить корректный ответ, прочитать и отрендерить содержимое, выбрать страницу канонической и решить, что она подходит для индекса. Диагностика становится быстрее, если проверять эти этапы по порядку.
Сначала уточните, что именно произошло
Фраза «страница не индексируется» может означать разные состояния:
- поисковик ещё не знает адрес;
- адрес известен, но робот не смог его загрузить;
- страница загружена, но закрыта правилами индексации;
- поисковик выбрал другой URL каноническим;
- страница обработана, но пока не включена в индекс;
- страница есть в индексе, но не показывается по ожидаемому запросу.
Последний случай относится уже не к технической индексации, а к релевантности и ранжированию. Проверка оператором site: может дать ориентир, но не заменяет URL Inspection в Google Search Console и отчёты Яндекс Вебмастера.
Этап 1. Поисковик должен обнаружить URL
Новая страница услуги или категория каталога часто остаётся «сиротой»: на неё нет обычной HTML-ссылки, она появляется только после выбора фильтра, отправки формы или выполнения JavaScript. Sitemap помогает сообщить поисковику об адресах, но является подсказкой, а не гарантией обхода или индексирования [1].
Проверьте три источника обнаружения:
- страница присутствует в актуальном sitemap как абсолютный канонический URL;
- на неё ведёт ссылка из доступного роботу раздела сайта;
- ссылка имеет настоящий
href, а не существует только как обработчик клика.
Для каталога особенно важна глубина. Если карточку можно найти только после пяти переходов по пагинации, а sitemap давно не обновлялся, обнаружение и переобход будут медленнее.
Этап 2. Сервер должен отдать правильный ответ
Индексируемая страница обычно отвечает 200 OK и содержит основной текст в ответе. Ошибки 4xx и 5xx, длительные тайм-ауты, циклические редиректы и перенаправление на нерелевантную страницу мешают обработке. Яндекс рекомендует для исключённых страниц отдельно проверять HTTP-ответ, sitemap и правила запрета [2].
Не ограничивайтесь запросом из своего браузера. CDN, WAF или защита от ботов могут отдавать роботу другой статус. Проверьте ответ с user-agent поискового робота, заголовки, цепочку редиректов и серверные логи.
Мягкая ошибка 404
Страница может отвечать 200, но показывать «товар не найден», пустую категорию или почти одинаковую заглушку. Для поисковика это выглядит как soft 404. Если объекта больше нет и нет точного аналога, нужен настоящий 404 или 410. Если есть равнозначная замена, возможен точный 301-редирект. Массовый редирект удалённых карточек на главную не решает проблему.
Этап 3. Проверьте запреты обхода и индексации
robots.txt
robots.txt сообщает, какие URL робот может запрашивать. Правило может случайно закрыть весь раздел услуг, каталог, параметр или ресурс, без которого страница нормально не рендерится. Для Google запрет обхода не гарантирует удаления самого URL из результатов: адрес может быть известен по ссылкам [3].
meta robots и X-Robots-Tag
Проверьте исходный HTML и HTTP-заголовки на noindex. Директива может приходить из шаблона тестовой версии, модуля SEO, настройки раздела или конфигурации веб-сервера. Для Google noindex сработает только после доступного обхода страницы; если тот же URL закрыт в robots.txt, робот не увидит запрет [4].
Авторизация и защита
Если основной контент виден только после входа, принятия нестандартного межстраничного шага или проверки, которую робот пройти не может, страница не подходит для обычного поискового индекса. Публичная посадочная должна показывать содержательный ответ без авторизации.
Этап 4. Убедитесь, что поисковик видит содержимое
Современные поисковые системы исполняют JavaScript, но рендеринг добавляет отдельный этап и новые точки отказа. Google рекомендует делать ссылки доступными для обхода и учитывать ограничения JavaScript-приложений [5]. Возможные причины:
- основной текст подгружается API-запросом, который возвращает ошибку роботу;
- контент появляется только после прокрутки или действия пользователя;
- ресурсы заблокированы в
robots.txtили политикой доступа; - клиентский код меняет canonical или robots meta после загрузки;
- сервер отдаёт пустой шаблон, а рендеринг завершается ошибкой.
Сравните три представления: исходный HTML, DOM после выполнения JavaScript и снимок страницы в инструменте проверки URL. Для важных услуг и категорий основное содержание, ссылки и canonical надёжнее отдавать сразу с сервера.
Этап 5. Проверьте canonical и дубли
Страница может быть доступна, но считаться вариантом другого URL. Причины: canonical на родительский раздел, дубли из-за параметров, одинаковые страницы для городов, несколько путей товара, HTTP/HTTPS или www/без www.
В Google Search Console сравнивают объявленный пользователем и выбранный Google canonical. rel="canonical" — сильный сигнал, но не приказ; его эффективность повышается, когда внутренние ссылки, редиректы и sitemap указывают на ту же версию [6]. В Яндекс Вебмастере причины «дубль» и «не является канонической» отображаются среди исключённых страниц [2].
Канонический URL должен:
- отвечать 200 и быть доступным для обхода;
- содержать эквивалентный материал;
- не перенаправлять на третий адрес;
- не быть закрытым
noindex; - использоваться во внутренних ссылках и sitemap.
Этап 6. Оцените самостоятельную ценность страницы
Отсутствие технических ошибок не обязывает поисковик включать URL в индекс. Google прямо указывает, что запрос на повторный обход не гарантирует мгновенного или обязательного включения: системы отдают приоритет качественному и полезному содержимому [7]. Яндекс также может исключать маловостребованные страницы, которые не отвечают заметным пользовательским запросам [8].
У страниц услуг и каталога чаще всего встречаются следующие проблемы:
- десятки страниц отличаются только названием системы или города;
- описание состоит из нескольких общих абзацев и повторяет соседние услуги;
- у категории нет товаров или остаётся один случайный товар;
- title и H1 обещают одно, а основной текст отвечает на другое;
- нет цены, условий, характеристик, состава результата или ответа на вопрос пользователя;
- страница создана для ключевой фразы, но не помогает выполнить задачу.
Решение — не добавлять абзацы ради объёма. Страница услуги должна объяснять ситуацию клиента, результат, устройство решения, порядок работы, проверку и особенности конкретной системы. Категория должна помогать выбирать: давать ассортимент, фильтры, характеристики и понятную навигацию.
Диагностика одного URL: рабочий порядок
- Открыть URL в Google Search Console и Яндекс Вебмастере, записать точный статус.
- Проверить HTTP-код, редиректы,
Content-TypeиX-Robots-Tag. - Проверить разрешение в
robots.txtотдельно для Googlebot и Yandex. - Найти
meta name="robots"и canonical в исходном HTML. - Сравнить объявленный и выбранный поисковиком canonical.
- Посмотреть отрендеренный HTML и убедиться, что основной текст и ссылки доступны.
- Проверить внутренние ссылки и присутствие канонического URL в sitemap.
- Найти полные и почти полные дубли по заголовку, тексту и шаблону URL.
- Оценить, какой запрос страница закрывает лучше соседних страниц.
- После исправления отправить несколько важных URL на переобход и наблюдать статус, не повторяя запрос ежедневно.
Как диагностировать проблему на всём разделе
Если пропала не одна страница, а десятки услуг или карточек, ручная проверка каждой не показывает закономерность. Нужна таблица по всем URL со следующими колонками:
- код ответа и конечный URL;
- разрешение в robots.txt;
- robots meta и X-Robots-Tag;
- canonical;
- наличие в sitemap;
- количество внутренних ссылок и глубина;
- title, H1, объём и хеш основного текста;
- статус в Google и Яндексе;
- последний визит робота по логам.
Затем URL группируют по причине. Например, все страницы нового шаблона получили noindex; все карточки второго раздела имеют canonical на первый; все услуги без внутренних ссылок известны только из sitemap. Исправление шаблона или генератора в таком случае важнее ручного редактирования сотен страниц.
Что обычно не помогает
- многократно отправлять неизменённый URL на переобход;
- увеличивать текст, не меняя его полезность и отличие от соседних страниц;
- добавлять в sitemap URL, который закрыт или указывает canonical на другую страницу;
- закрывать URL в robots.txt, чтобы Google увидел
noindex; - проверять только главную страницу раздела;
- считать отсутствие страницы по запросу доказательством отсутствия в индексе.
Как понять, что причина устранена
Сначала меняются технические сигналы: робот получает 200, видит содержимое, правильный canonical и внутреннюю ссылку. Затем обновляется статус обхода и исключения. Появление в индексе и показов происходит позже и не имеет фиксированного срока. Оценивать результат нужно по группе однотипных страниц: доле проиндексированных URL, показам, выбранным canonical и повторным ошибкам в новом контенте.
Источники
[1] Google Search Central — Build and submit a sitemap — https://developers.google.com/search/docs/crawling-indexing/sitemaps/build-sitemap
[2] Яндекс Вебмастер — Почему страницы исключены из поиска — https://yandex.ru/support/webmaster/ru/site-indexing/excluded-pages
[3] Google Search Central — Introduction to robots.txt — https://developers.google.com/search/docs/crawling-indexing/robots/intro
[4] Google Search Central — Block Search indexing with noindex — https://developers.google.com/search/docs/crawling-indexing/block-indexing
[5] Google Search Central — JavaScript SEO basics — https://developers.google.com/search/docs/crawling-indexing/javascript/javascript-seo-basics
[6] Google Search Central — How to specify a canonical URL — https://developers.google.com/search/docs/crawling-indexing/consolidate-duplicate-urls
[7] Google Search Central — Ask Google to recrawl your URLs — https://developers.google.com/search/docs/crawling-indexing/ask-google-to-recrawl
[8] Яндекс Вебмастер — Страницы в поиске и маловостребованные страницы — https://yandex.ru/support/webmaster/ru/service/searchable