2900 страниц в Яндексе, а на сайте — 640: как нашли лишние
Откройте Яндекс.Вебмастер, раздел «Индексирование → Страницы в поиске», и сравните число со списком реальных URL в CMS. Если страниц в поиске в разы больше — это фильтры каталога, старые адреса после редизайна, поддомены или задвоенная пагинация, о которых сайт уже забыл. Их находят выгрузкой из Вебмастера, а закрывают canonical, robots.txt и статусом 410.
история одного каталога: 2900 страниц против 640
Компания продаёт промышленную арматуру через сайт на 640 карточек и категорий — маркетолог знает это число наизусть, сам сверял структуру каталога перед запуском рекламы. В марте он открыл Яндекс.Вебмастер, чтобы понять, почему обновлённые карточки третью неделю не всплывают в поиске. В разделе «Страницы в поиске» — 2900 адресов.
Разница в 2260 страниц не тревожила бы, если бы новые карточки индексировались нормально. Но именно с ними Яндекс тянул: робот тратил обходы на комбинации фильтра «диаметр + материал + резьба» — каждое сочетание чекбоксов давало свой URL с параметрами, и часть адресов дублировала друг друга почти дословно. Пока робот перебирал фильтры, до свежей карточки насоса, которую поставили в приоритет продаж, обход просто не доходил.
Разбор логов сервера добавил ещё два источника. Тестовый поддомен catalog-test, который забыли закрыть после весеннего редизайна, и постраничная навигация: адрес вида /catalog/nasosy/?PAGEN_1=14 индексировался Яндексом как отдельная страница с тем же заголовком, что и первая страница категории.
К маю органический трафик на категорию «насосы» просел: карточки, которые должны были тянуть сезонный спрос, просто не попали в поиск вовремя. Отдел продаж считал потери не абстрактно, а звонками, которые не поступили — по прикидке менеджера, три-четыре в неделю на одну категорию, и это только на одном направлении каталога из полутора десятков.
как посчитать разрыв между сайтом и индексом Яндекса
Сравнивать страницы по одной бессмысленно — нужен разрыв в цифрах, который виден сразу, а не список из тысячи строк без структуры.
- ✓Яндекс.Вебмастер → «Индексирование» → «Страницы в поиске»: выгрузить список в CSV — там точный URL, статус и дата обхода.
- ✓Реальный список страниц — не sitemap.xml (он часто приукрашен и не обновлялся полгода), а выгрузка из CMS: категории, карточки, статичные страницы.
- ✓Оператор site:домен.ru в поиске Яндекса — грубая, но быстрая оценка, полезна как контрольная цифра, если доступа к Вебмастеру ещё нет.
- ✓Оба списка — в одну таблицу, отсортировать URL по сегментам пути (/catalog/, /basket/, /search/): разница обычно концентрируется в двух-трёх паттернах, а не размазана равномерно по всему сайту.
Если считать эти цифры самостоятельно некогда, обычно это делают в рамках аудита сайта вместе с проверкой остальных восьми направлений.
когда разрыв — это норма, а не ошибка
Не любая разница между сайтом и индексом — повод для тревоги. У каталога, который растёт быстрее, чем успевает индексироваться, число страниц в поиске временно отстаёт от реального — это нормально и закрывается само за одну-две недели активного обновления sitemap.xml. Постраничная навигация тоже не проблема сама по себе, если на второй и третьей странице категории стоит корректный canonical или rel=next/prev — тогда Яндекс видит связь между страницами и не плодит из них дубли.
Тревожный признак другой: разрыв растёт месяц за месяцем без видимой причины, а среди страниц в поиске — адреса с параметрами, которых нет в навигации сайта и на которые никто не ставил ссылку сознательно. Такие URL робот находит сам — через старые бэклинки, через закешированные версии, через комбинации, которые когда-то были доступны из фильтра. Отличить рабочий рост каталога от накопленного мусора помогает как раз сравнение из предыдущего раздела: у нормального роста разница размазана по новым карточкам, у мусора — сконцентрирована в одном-двух паттернах URL.
🔍 пять источников фантомных страниц
- ✓параметры фильтров и сортировки каталога — каждое сочетание чекбоксов Яндекс может принять за новый адрес, и на каталоге из пары сотен товаров таких комбинаций набегают тысячи;
- ✓дубли по протоколу и домену — http и https, с www и без, со слэшем на конце и без, если редиректы настроены не на все варианты сразу, а только на очевидный;
- ✓постраничная навигация и версии для печати — /page/2/ и ?print=Y индексируются отдельно от основной страницы с тем же содержимым и тем же заголовком;
- ✓старые адреса после переезда или редизайна — раздел переименовали, а старый URL без 301 остался в индексе и живёт своей жизнью, иногда годами;
- ✓тестовые поддомены и staging-версии — dev., test., staging. открыты для роботов, потому что robots.txt на боевой сайт скопировали не полностью или забыли перенести.
частая ошибка: закрыть в robots.txt — не значит убрать из индекса
Здесь чаще всего застревают: страницу закрыли в robots.txt и считают вопрос решённым. Но если адрес уже был в индексе или на него ведёт хотя бы одна внешняя ссылка, Яндекс может продолжать держать его в базе со статусом «URL известен, но не обходится из-за ограничений в robots.txt» — без сниппета, но и без реального удаления, иногда неделями.
Правильный порядок обратный: сначала разрешить обход и поставить noindex в html-коде страницы или отдать статус 410, дождаться, пока Яндекс перечитает страницу и уберёт её из индекса, и только потом при необходимости закрывать раздел в robots.txt для экономии обхода. И отдельно стоит проверить, что noindex стоит в исходном HTML, а не добавляется JavaScript'ом после загрузки — робот может не дождаться выполнения скрипта и прочитать страницу без метатега.
как найти лишние страницы: три способа и что выбрать
| способ | что показывает | точность | когда использовать |
|---|---|---|---|
| Яндекс.Вебмастер | точный список проиндексированных URL с датой обхода и статусом | высокая, данные напрямую от Яндекса | основной источник, но нужен подтверждённый доступ к сайту |
| оператор site: | оценочное число страниц в выдаче без подробностей | средняя, округляет и не даёт список адресов | быстрая прикидка, если доступа к Вебмастеру ещё нет |
| анализ логов сервера | какие URL реально запрашивал робот Яндекса и как часто | высокая для оценки расхода краулингового бюджета | когда нужно понять, куда уходят обходы, а не только что в индексе |
| ручной обход структуры CMS | полный эталонный список страниц, которые сайт должен показывать | высокая, но трудозатратная на крупных каталогах | сверка перед сравнением с данными Вебмастера |
во что обходится раздутый индекс
Лишние страницы не штрафуют напрямую, но экономику портят сразу с нескольких сторон. Краулинговый бюджет ограничен: робот приходит на сайт не бесконечное число раз в сутки, и если основная часть обходов уходит на комбинации фильтров, у новых и обновлённых карточек остаётся мало шансов попасть в индекс быстро — вместо дней ожидание растягивается на недели. Дублированный контент размывает релевантность: две-три почти одинаковые страницы конкурируют друг с другом за одни и те же запросы, и обе показываются в выдаче хуже, чем показала бы одна сильная страница.
Отдельно накапливается техдолг: чем дольше фантомные страницы живут в индексе, тем больше на них успевает натечь внешних и внутренних ссылок, а значит тем дольше и болезненнее их потом выводить. А в сезон, когда трафик особенно ценен, именно эти недели простоя нужных страниц в индексе стоят реальных заявок — как в истории с насосами, где отдел продаж считал потери звонками, а не строчками в отчёте.
как закрыть лишнее без потери позиций нужных страниц
Метод закрытия зависит от того, жива страница или нет, а не от того, насколько она мешает.
- ✓рабочая страница-дубль (например, версия с параметром сортировки) — canonical на основную версию;
- ✓целый раздел, который не должен попадать в поиск (личный кабинет, корзина, результаты внутреннего поиска) — Disallow в robots.txt, с проверкой, что Яндекс не проиндексировал его ещё до правки;
- ✓страница, которой физически больше нет (снятый с продажи товар, старая акция) — статус ответа 410 вместо тихого 404, так робот быстрее убирает адрес из индекса;
- ✓переехавший после редизайна URL — постоянный 301-редирект на новый адрес, а не оставленная страница с noindex, которая всё равно продолжает числиться в базе.
Яндекс не убирает страницы из индекса мгновенно. Через Вебмастер можно отправить адреса на переобход и через одну-две недели проверить тот же отчёт «Страницы в поиске» ещё раз — чтобы увидеть, что число действительно пошло вниз, а не просто закрыть задачу на бумаге.
что входит в проверку индексации в нашем аудите
Разбор индекса Яндекса — одно из направлений аудита сайта по 9 направлениям: мы выгружаем реальный список страниц из Вебмастера, сверяем его со структурой сайта, размечаем находки по источнику — фильтры, дубли, старые URL, поддомены — и отдаём таблицу с конкретным действием на каждую группу адресов, а не общий совет «почистите индекс».
В отчёте отдельно фиксируем страницы, закрытые в robots.txt, но всё ещё числящиеся в индексе — это тот самый частый случай, когда разработчик уверен, что вопрос закрыт, а Яндекс думает иначе.
Стоимость и формат работ — на странице тарифов: аудит можно заказать как разовую проверку перед сезоном или включить в постоянное сопровождение, если каталог обновляется каждую неделю и разрыв между сайтом и индексом появляется снова.
❓ Частые вопросы
Сколько времени занимает поиск лишних страниц в индексе Яндекса?
На типовом каталоге сравнение Яндекс.Вебмастера со структурой сайта занимает несколько часов: выгрузка списка страниц, выгрузка данных CMS и сортировка по паттернам URL. Разбор причин по каждой группе адресов и подготовка плана закрытия — ещё день-два, в зависимости от числа найденных источников.
Может ли большое число лишних страниц привести к понижению сайта в поиске?
Прямого наказания за это нет, но эффект похож: краулинговый бюджет уходит на мусорные адреса, новые страницы индексируются медленнее, а дублирующийся контент конкурирует сам с собой в выдаче. Итоговые позиции нужных страниц оказываются ниже, чем могли бы быть.
Что делать со старыми URL после смены дизайна или структуры сайта?
Поставить постоянный 301-редирект со старого адреса на новый — не noindex и не тихое удаление. Так Яндекс переносит накопленный вес страницы на новый адрес, а не индексирует оба варианта одновременно.
Как проверить, что Яндекс действительно убрал закрытую страницу из индекса?
Отправить URL на переобход через Яндекс.Вебмастер и через одну-две недели снова открыть отчёт «Страницы в поиске». Если адрес пропал из списка — удаление подтверждено, а не просто выполнена правка на сайте.
Входит ли проверка индексации в разовый аудит сайта?
Да, разбор индекса Яндекса — одно из направлений комплексного аудита сайта, наравне с проверкой технических ошибок, скорости и структуры. Его можно заказать отдельно или в составе полной проверки перед сезоном.
Если ошибка возвращается или мешает работать каждый день — это уже не разовый сбой, а повод передать сопровождение специалистам: техническая поддержка 1С с договором и регламентом реакции.
Или позвоните: +7 495 133-92-44 — в рабочее время с 9:00 до 19:00
Остались вопросы? Нужна помощь?
Менеджеры компании с радостью ответят на ваши вопросы, произведут расчет стоимости услуг и подготовят индивидуальное коммерческое предложение.
Бесплатная консультация

