ChatGPT не открывает вашу страницу в 93% быстрых ответов
Исследование 1249 ответов ChatGPT показало: в 93% быстрых ответов модель читает готовую карточку — заголовок плюс сниппет на 200 символов — вместо вашей страницы. Вот что с этим делать.
Когда кто-то спрашивает у ChatGPT о вашем продукте без включённого режима рассуждений, модель обычно вообще не заходит на ваш сайт. Согласно анализу, опубликованному на Habr и основанному на корпусе данных французской команды RESONEO, ChatGPT открывает страницу «вживую» примерно в 7% быстрых ответов. В остальных 93% используется карточка, вырезанная задолго до вопроса. Это меняет то, что и куда стоит помещать на странице.
Что модель видит на самом деле
Карточка состоит из двух частей: полный заголовок страницы (исследователи фиксировали заголовки длиной до 289 символов) и сниппет примерно на 200 символов. Сниппет вырезается один раз, в момент обхода, начиная с H1 и того, что визуально расположено рядом — хлебные крошки, категория, дата, автор, оглавление, alt-текст изображения. Отбора по релевантности нет, потому что в момент обхода вопроса ещё не существует.
Отсюда два следствия. Во-первых, всё, что ниже первого экрана — таблица характеристик, условия доставки, блок с ценой — не попадает к модели в быстром режиме. Во-вторых, один и тот же фрагмент из 200 символов выдаётся и на вопрос о цене, и на вопрос о сроках доставки. Пока страницу не обойдут заново, другой версии у неё нет.
Мета-описание в этом сценарии игнорируется. Оно писалось для поисковой выдачи, где сниппет пересобирается под каждый запрос; в индексе OpenAI это место уже занято текстом со страницы. В выгрузках RESONEO мета-описание использовалось примерно в одном случае из трёх, и только для результатов, полученных скрейпингом из выдачи Google.
Проблема с разметкой
Там, где страница действительно открывается — режим рассуждений и те самые 7% быстрых ответов — HTML преобразуется в текст. Теги script, iframe и JSON-LD полностью вырезаются. Структурированные данные, которые вы добавили специально для машин, не попадают к модели ни в каком виде. А вот alt-текст изображений и текст, скрытый через CSS, сохраняются.
Поэтому факт, существующий только внутри блока JSON-LD, для ChatGPT не существует ни в одном из режимов. Страница может пройти валидатор структурированных данных, давать аккуратный сниппет в Google — и молчать в ответе ИИ. В исследовании также отмечен жёсткий лимит в 4 МБ на страницу: выше него запрос возвращает HTTP 400, и страница вообще не читается — без усечения, просто ничего.
Есть и слой кэширования. Загруженная копия считается свежей примерно 30 минут, после чего отдаётся устаревшая версия, пока в фоне идёт обновление. В корпусе встречались копии старше 90 дней, и этот слой игнорирует Cache-Control: no-store и noindex.
Почему это важно для малого бизнеса
Большинство владельцев полагают, что красивой страницы и правильной разметки достаточно, чтобы их цитировали. Но вывод исследования в том, что в большинстве быстрых ответов вашу страницу сегодня никто не смотрел; модель повторяет фрагмент, снятый в неизвестную более раннюю дату. Если с тех пор изменились цена, зона обслуживания или условия доставки, ответ будет неверным — и вы этого даже не увидите в аналитике. Клики по видимым ссылкам несут метку utm_source=chatgpt.com, но страницы, которые модель открыла и прочитала в режиме рассуждений, не несут UTM-меток вообще, потому что человек по ним не кликал. Строка «трафик из ChatGPT» в вашей аналитике описывает хвост процесса, а не ваше присутствие в ответах.
Ещё одна полезная деталь: режим рассуждений — не платная привилегия. Бесплатный аккаунт с кнопкой Think выдавал 35,3 URL на диалог против 35,1 у платного режима рассуждений. Один клик примерно удваивал число источников — с 15,1 до 35,3.
Что сделать в этом месяце
- Прочитайте первые 200 символов после H1 на ваших ключевых страницах. Если это хлебные крошки, дата и имя автора — именно так ваш сайт представляется в 93% ответов.
- Поместите цену, дату, автора и назначение продукта в обычные предложения основного текста, рядом с H1, и повторите тот же факт в alt-тексте соседнего изображения. Структурированные данные оставьте — их читают Google и Яндекс, — но никогда не держите факт только там.
- Проверьте
robots.txtдля каждого краулера отдельно. GPTBot собирает данные для обучения; OAI-SearchBot решает, попадёте ли вы в цитаты и поисковые сниппеты; ChatGPT-User приходит по инициативе пользователя; OAI-AdsBot проверяет рекламные посадочные страницы. ОбщийUser-agent: *сDisallow: /, или скопированный список ИИ-ботов, закрывает поискового краулера вместе с обучающим. Системы OpenAI подхватывают изменения robots.txt примерно за сутки. - Не полагайтесь на sitemap как на способ получить обход новых страниц. За 16 дней наблюдения GPTBot ежедневно скачивал карту сайта, но не заходил на URL, существовавшие только там — 0 из 8, — тогда как 8 страниц с обычной входящей ссылкой были обойдены в тот же день.
- Проверьте вес страницы. Всё, что приближается к 4 МБ HTML, рискует быть отклонено полностью.
Ничего из этого не требует нового сайта. Требуется перенести три-четыре факта, о которых спрашивает клиент, из таблиц, вкладок и разметки в обычные предложения ближе к верху страницы, и убедиться, что краулер, формирующий цитаты, не заблокирован. Остальное — терпение: карточка пересобирается только при повторном обходе страницы.
ИсточникНаписано по материалу Habr. Оригинал: ChatGPT не открывает страницу в 93% быстрых ответов: что видит модель и что чинить на сайте ↗