сайт в топ-10 яндекса, но chatgpt о нём не знает: разбор одного аудита
Аудит сайта под ИИ проверяет, видят ли нейросетевые ассистенты — ChatGPT, Claude, Perplexity, Алиса — содержимое страниц: не блокирует ли доступ robots.txt, отдаёт ли сервер текст без JavaScript и есть ли разметка для цитирования цены и характеристик. Сайт из топ-10 Яндекса при этом может ни разу не всплыть в ответе чат-бота.
клиент спросил у чат-бота, а не у яндекса
Менеджер по продажам подмосковного поставщика серверного оборудования услышал на переговорах фразу: «Я спрашивал у чат-бота, кому из подрядчиков доверять по обслуживанию серверов — вашу компанию он не назвал». Сайт компании стоял на четвёртой позиции в Яндексе по этому запросу, и директор с гордостью показывал эту цифру на планёрках. Но между строчкой в топ-10 поиска и ответом нейросети оказалась пропасть: один источник компанию видел, второй — нет.
Разница касается не отвлечённой «видимости», а конкретных заявок. Клиент, который формулирует запрос через голосового ассистента или чат-бота, не открывает десять вкладок и не сравнивает сайты — он получает три названия и звонит по ним. Если компании в этой тройке нет, заявка не появляется ни в CRM, ни в счётчиках посещений: сравнивать не с чем, потому что она никогда не приходила. Директор узнал о проблеме случайно, от одного разговорчивого клиента. Сколько таких разговоров прошло молча — никто не считал, и посчитать задним числом уже нельзя.
Отдел маркетинга при этом отчитывался по своим метрикам исправно: трафик из органики рос, отказы держались на обычном уровне, конверсия в заявку с сайта не проседала. Метрика, которой не было в отчётах, — упоминания в ответах нейросетей: ни одна система веб-аналитики не считает её по умолчанию.
первая проверка: что видит бот, а что видит человек
Разбор начали с простого — открыли сайт не глазами человека, а глазами краулера. Запрос с подменой User-Agent на GPTBot вернул почти пустой HTML: заголовок, футер и строка «Loading...» вместо каталога. Каталог собирался на JavaScript уже в браузере пользователя, а поисковый бот Яндекса научился этот код выполнять — отсюда и место в топ-10. Языковые модели в момент ответа так не умеют: они читают то, что сервер отдал сразу, без рендеринга в браузере.
Второе, что нашли — в robots.txt висело правило, добавленное прошлым подрядчиком ещё в 2024 году «на всякий случай, чтобы нейросети не забирали тексты». Строка Disallow закрывала обход всему, что начиналось на GPTBot и ClaudeBot. Замысел понятен: защитить контент от переобучения чужих моделей. На практике то же правило заодно выключило и тех ботов, которые заходят на страницу не ради обучения, а в момент, когда пользователь задаёт конкретный вопрос и ждёт свежий ответ.
проверить за пять минут самостоятельно
Ни один из трёх шагов ниже не требует доступа к панели администратора сайта — их может проделать директор или маркетолог, ещё до звонка подрядчику.
- ✓открыть файл site.ru/robots.txt и поискать строки с User-agent: GPTBot, ClaudeBot, PerplexityBot, Google-Extended — если после них стоит Disallow: /, бот на сайт не зайдёт;
- ✓загрузить главную и карточку товара через сервис проверки рендеринга или curl с подменой заголовка User-Agent — если в ответе нет текста каталога, значит контент рисует JavaScript;
- ✓открыть карточку товара и проверить исходный код страницы (не через «Просмотр кода», а именно то, что отдаёт сервер) на разметку schema.org.
Если чинить самим некогда — эти же три пункта входят в наш аудит сайта, только вместе с остальными восемью направлениями сразу.
какие боты вообще читают сайт
Боты нейросетей ведут себя по-разному, и закрывать их одним общим запретом — ошибка. Одни только собирают тексты для обучения будущих версий модели и на живой ответ пользователю не влияют напрямую. Другие заходят на сайт в момент, когда человек задаёт вопрос, и без этого захода ответ вообще не появится.
| бот | кто им пользуется | выполняет javascript | статус на сайте клиента до аудита |
|---|---|---|---|
| GPTBot | ChatGPT — обучение и часть ответов | нет | заблокирован в robots.txt |
| ClaudeBot | Claude | нет | заблокирован в robots.txt |
| PerplexityBot | Perplexity — ответы со ссылкой на источник | нет | разрешён, но получал пустой каталог |
| YandexBot | поиск Яндекса и генеративные ответы Алисы | да | индексировал сайт штатно |
| Google-Extended | обучение моделей Google | нет | доступ открыт, но контента бот не видел |
обучение или ответ в моменте
Разница между строчками в таблице не формальность. Бот, который только пополняет обучающую выборку, влияет на то, что модель будет «знать» о компании через несколько месяцев, после очередного обновления. Бот, который заходит на страницу при конкретном вопросе пользователя, влияет на ответ прямо сейчас. Заблокировать первого и оставить второго — рабочая стратегия для тех, кто не хочет отдавать тексты в чужое обучение, но хочет попадать в живые ответы. У клиента запрет стоял без разбора и бил по обеим категориям сразу. Похожая путаница встречается у многих b2b-сайтов, которые правили robots.txt за последний год «на всякий случай» и не разбирались, какому боту какая строка адресована.
карточки без разметки: бот читает текст, но не понимает, где цена
Даже там, где боты получили доступ, толку было немного. Карточка товара — сплошной текст: название, абзац описания, таблица характеристик, вставленная как картинка. Для человека привычно, для машины — набор символов без структуры: непонятно, какая цифра в тексте цена, а какая — артикул или срок гарантии. PerplexityBot, судя по логам сервера, страницу открывал регулярно, но в ответах пользователям компанию не цитировал ни разу за две недели наблюдения — открыть страницу и понять её содержимое оказались разными задачами.
Ставка здесь не только в упущенных заявках. Если разметки нет, а у конкурента она есть, при следующем обновлении модели именно его цену и наличие товара нейросеть подставит в ответ — даже если данные устарели на полгода. Разбираться с недовольным клиентом, которому чат-бот назвал не ту цену, придётся менеджеру по телефону, а не автору сайта.
заблуждение «мы закрылись от ботов — значит в безопасности»
Логика прежнего подрядчика выглядела разумно: чем меньше ботов на сайте, тем меньше риск, что тексты утекут в чужую модель. Проблема в том, что закрытие сработало наглухо, без учёта цели. Строка Disallow: GPTBot действительно останавливает переобучение на текстах сайта. Но она же убирает компанию из круга источников, на которые модель может сослаться, когда отвечает пользователю сегодня, а не через полгода после очередного обновления. Получилась защита от гипотетического риска ценой реального: живых обращений, которые не пришли, потому что бот на сайт просто не заходил.
Разумная настройка — не «открыть всё» и не «закрыть всё», а развести боты по цели: тем, что собирают корпус для обучения, можно оставить запрет, если это принципиально для компании. Тем, что формируют ответ в моменте, доступ нужен обязательно — иначе смысла в остальной части аудита нет, сайт может быть безупречен технически и всё равно оставаться невидимым там, где клиент задаёт вопрос. На практике разграничение занимает пару строк в robots.txt — не сложнее одного общего правила, которое стояло там раньше.
что поправили и что изменилось
- ✓из robots.txt убрали блокировку GPTBot, ClaudeBot и PerplexityBot, оставив закрытыми только служебные разделы — админку и корзину;
- ✓для карточек каталога настроили серверный рендеринг, чтобы бот получал готовый HTML, а не пустой контейнер с надписью «Loading»;
- ✓добавили разметку schema.org Product и Offer с ценой, наличием и характеристиками для каждой позиции каталога;
- ✓завели файл llms.txt с кратким описанием сайта — чем занимается компания и где искать основные разделы.
Через несколько недель у менеджеров начали появляться похожие фразы в переписке с клиентами — но с другим знаком: «спросил у Алисы, назвала вас в числе трёх». В логах сервера GPTBot и ClaudeBot из нулевых значений перешли в регулярные заходы на страницы каталога — до аудита там не было ни одной записи за месяцы наблюдения. Точное число новых заявок никто не измерял: канал, которого не существовало, не с чем сравнивать. Но разговор, из-за которого всё началось, больше не повторялся.
чем аудит под ии отличается от обычного seo-аудита
Классический SEO-аудит смотрит на позиции, ссылки и скорость загрузки — метрики, которые нейросеть в момент ответа не читает вообще. Ей не важен тИЦ и отчёт Яндекс.Вебмастера. Ей нужен ответ на другой вопрос: если пользователь спросит ассистента про вашу услугу, сможет ли тот вообще дотянуться до страницы и разобрать, что на ней написано. Проверка доступа ботов, рендеринга и разметки — отдельный слой поверх обычного технического аудита, а не замена ему: сайт с идеальной скоростью и чистой вёрсткой может быть при этом наглухо закрыт от всех, кто формирует ответы нейросетей.
У нас эта проверка идёт как одно из направлений в аудите сайта по девяти направлениям — вместе с технической частью, безопасностью и соответствием законодательству, потому что по отдельности эти вещи проверять малополезно: заблокированный для ботов сайт может одновременно быть безупречен по скорости и вёрстке, а толку клиенту от этого никакого.
По конкретной компании из истории выше отчёт занял несколько страниц: список заблокированных ботов, страницы без серверного рендеринга, карточки без разметки — с пометкой, что чинить в первую очередь, а что может подождать следующего релиза. Состав и стоимость такой проверки — на странице тарифов, там же можно прикинуть объём работ по количеству карточек в каталоге.
❓ Частые вопросы
чем аудит сайта под ИИ отличается от обычного SEO-аудита?
SEO-аудит смотрит на позиции в Яндексе, ссылки и скорость загрузки — метрики, которые нейросеть в момент ответа не читает. Аудит под ИИ проверяет доступ ботов ChatGPT, Claude и Perplexity к сайту: не блокирует ли их robots.txt, отдаёт ли сервер текст без JavaScript и есть ли разметка для цитирования цены и характеристик.
как проверить, блокирует ли мой сайт GPTBot и ClaudeBot?
Откройте site.ru/robots.txt и найдите строки User-agent: GPTBot и User-agent: ClaudeBot. Если сразу под ними стоит Disallow: /, бот на сайт не заходит вовсе. Если строк с этими именами нет вообще, боты, скорее всего, допущены — но это не отменяет проверку рендеринга и разметки на самих страницах.
нужно ли открывать доступ всем ИИ-ботам подряд?
Нет. Ботов, которые собирают тексты для обучения будущих моделей — например, GPTBot и Google-Extended, — можно оставить закрытыми, если компания не хочет отдавать контент в чужой корпус. А ботов, которые заходят на страницу в момент ответа пользователю, закрывать не стоит — иначе компания выпадает из ответов.
сколько времени занимает аудит сайта под ИИ?
Срок зависит от размера каталога и от того, на каком движке собран сайт: SPA с тяжёлым JavaScript разбирать дольше, чем сайт с серверным рендерингом из коробки. Проверка входит в общий аудит сайта по девяти направлениям, точный срок и состав работ уточняются после просмотра сайта.
если ИИ уже называет конкурента вместо нас, это можно исправить?
Да, но не мгновенно. После снятия блокировок в robots.txt, настройки рендеринга и добавления разметки боты заново обходят сайт и учитывают его в ответах. Скорость зависит от того, как часто конкретная модель обновляет индекс для живых ответов — счёт идёт на недели, а не на один день.
Или позвоните: +7 906 045-28-27 — в рабочее время с 9:00 до 19:00
Остались вопросы? Нужна помощь?
Менеджеры компании с радостью ответят на ваши вопросы, произведут расчет стоимости услуг и подготовят индивидуальное коммерческое предложение.
Бесплатная консультация

