ChatGPT не открывает вашу страницу в 93% быстрых ответов

Исследование 1249 ответов ChatGPT показало: в 93% быстрых ответов модель читает готовую карточку — заголовок плюс сниппет на 200 символов — вместо вашей страницы. Вот что с этим делать.

Когда кто-то спрашивает у ChatGPT о вашем продукте без включённого режима рассуждений, модель обычно вообще не заходит на ваш сайт. Согласно анализу, опубликованному на Habr и основанному на корпусе данных французской команды RESONEO, ChatGPT открывает страницу «вживую» примерно в 7% быстрых ответов. В остальных 93% используется карточка, вырезанная задолго до вопроса. Это меняет то, что и куда стоит помещать на странице.

Что модель видит на самом деле

Карточка состоит из двух частей: полный заголовок страницы (исследователи фиксировали заголовки длиной до 289 символов) и сниппет примерно на 200 символов. Сниппет вырезается один раз, в момент обхода, начиная с H1 и того, что визуально расположено рядом — хлебные крошки, категория, дата, автор, оглавление, alt-текст изображения. Отбора по релевантности нет, потому что в момент обхода вопроса ещё не существует.

Отсюда два следствия. Во-первых, всё, что ниже первого экрана — таблица характеристик, условия доставки, блок с ценой — не попадает к модели в быстром режиме. Во-вторых, один и тот же фрагмент из 200 символов выдаётся и на вопрос о цене, и на вопрос о сроках доставки. Пока страницу не обойдут заново, другой версии у неё нет.

Мета-описание в этом сценарии игнорируется. Оно писалось для поисковой выдачи, где сниппет пересобирается под каждый запрос; в индексе OpenAI это место уже занято текстом со страницы. В выгрузках RESONEO мета-описание использовалось примерно в одном случае из трёх, и только для результатов, полученных скрейпингом из выдачи Google.

Проблема с разметкой

Там, где страница действительно открывается — режим рассуждений и те самые 7% быстрых ответов — HTML преобразуется в текст. Теги script, iframe и JSON-LD полностью вырезаются. Структурированные данные, которые вы добавили специально для машин, не попадают к модели ни в каком виде. А вот alt-текст изображений и текст, скрытый через CSS, сохраняются.

Поэтому факт, существующий только внутри блока JSON-LD, для ChatGPT не существует ни в одном из режимов. Страница может пройти валидатор структурированных данных, давать аккуратный сниппет в Google — и молчать в ответе ИИ. В исследовании также отмечен жёсткий лимит в 4 МБ на страницу: выше него запрос возвращает HTTP 400, и страница вообще не читается — без усечения, просто ничего.

Есть и слой кэширования. Загруженная копия считается свежей примерно 30 минут, после чего отдаётся устаревшая версия, пока в фоне идёт обновление. В корпусе встречались копии старше 90 дней, и этот слой игнорирует Cache-Control: no-store и noindex.

Почему это важно для малого бизнеса

Большинство владельцев полагают, что красивой страницы и правильной разметки достаточно, чтобы их цитировали. Но вывод исследования в том, что в большинстве быстрых ответов вашу страницу сегодня никто не смотрел; модель повторяет фрагмент, снятый в неизвестную более раннюю дату. Если с тех пор изменились цена, зона обслуживания или условия доставки, ответ будет неверным — и вы этого даже не увидите в аналитике. Клики по видимым ссылкам несут метку utm_source=chatgpt.com, но страницы, которые модель открыла и прочитала в режиме рассуждений, не несут UTM-меток вообще, потому что человек по ним не кликал. Строка «трафик из ChatGPT» в вашей аналитике описывает хвост процесса, а не ваше присутствие в ответах.

Ещё одна полезная деталь: режим рассуждений — не платная привилегия. Бесплатный аккаунт с кнопкой Think выдавал 35,3 URL на диалог против 35,1 у платного режима рассуждений. Один клик примерно удваивал число источников — с 15,1 до 35,3.

Что сделать в этом месяце

  • Прочитайте первые 200 символов после H1 на ваших ключевых страницах. Если это хлебные крошки, дата и имя автора — именно так ваш сайт представляется в 93% ответов.
  • Поместите цену, дату, автора и назначение продукта в обычные предложения основного текста, рядом с H1, и повторите тот же факт в alt-тексте соседнего изображения. Структурированные данные оставьте — их читают Google и Яндекс, — но никогда не держите факт только там.
  • Проверьте robots.txt для каждого краулера отдельно. GPTBot собирает данные для обучения; OAI-SearchBot решает, попадёте ли вы в цитаты и поисковые сниппеты; ChatGPT-User приходит по инициативе пользователя; OAI-AdsBot проверяет рекламные посадочные страницы. Общий User-agent: * с Disallow: /, или скопированный список ИИ-ботов, закрывает поискового краулера вместе с обучающим. Системы OpenAI подхватывают изменения robots.txt примерно за сутки.
  • Не полагайтесь на sitemap как на способ получить обход новых страниц. За 16 дней наблюдения GPTBot ежедневно скачивал карту сайта, но не заходил на URL, существовавшие только там — 0 из 8, — тогда как 8 страниц с обычной входящей ссылкой были обойдены в тот же день.
  • Проверьте вес страницы. Всё, что приближается к 4 МБ HTML, рискует быть отклонено полностью.

Ничего из этого не требует нового сайта. Требуется перенести три-четыре факта, о которых спрашивает клиент, из таблиц, вкладок и разметки в обычные предложения ближе к верху страницы, и убедиться, что краулер, формирующий цитаты, не заблокирован. Остальное — терпение: карточка пересобирается только при повторном обходе страницы.

ИсточникНаписано по материалу Habr. Оригинал: ChatGPT не открывает страницу в 93% быстрых ответов: что видит модель и что чинить на сайте

Ещё статьиВсе статьи
Лендинги · 5 мин чтения

Сколько стоит сайт для малого бизнеса?

У сайта два ценника: разовая разработка и ежемесячные расходы на его поддержку. Разбираем, что входит в каждый из них, когда достаточно конструктора, а когда собственный код окупается по-настоящему.

Разбор
Внутр. инструменты · 4 мин чтения

Кандидаты-дипфейки и простые проверки при найме, которые реально работают

Фальшивые кандидаты, фальшивые рекрутеры и вредонос в тестовых заданиях превращают собеседования в канал атаки. Рассказываем, как устроены эти схемы и какие проверки небольшая компания может внедрить уже на этой неделе.

по материалам Habr