O ChatGPT Não Abre a Sua Página em 93% das Respostas Rápidas
Um estudo com 1.249 respostas do ChatGPT concluiu que o modelo lê um cartão pré-construído — título mais um excerto de 200 caracteres — em vez da sua página em 93% das respostas rápidas. Eis o que corrigir.
Quando alguém pergunta ao ChatGPT sobre o seu produto sem ativar o modo de raciocínio, o modelo normalmente nem sequer visita o seu site. Segundo uma análise publicada no Habr, baseada num corpus reunido pela equipa francesa RESONEO, o ChatGPT abre a página em tempo real em cerca de 7% das respostas rápidas. Nos outros 93%, usa um cartão que foi recortado muito antes de a pergunta ser feita. Isso muda o que se deve colocar, e onde, numa página.
O que o modelo realmente vê
O cartão tem duas partes: o título completo da página (os investigadores registaram títulos com até 289 caracteres) e um excerto de cerca de 200 caracteres. O excerto é recortado uma única vez, no momento da indexação, a partir do H1 e do que estiver visualmente ao lado — breadcrumb, categoria, data, autor, índice, texto alternativo de imagem. Não há seleção por relevância, porque no momento da indexação a pergunta ainda não existe.
Isto tem duas consequências. Primeiro, tudo o que está abaixo do primeiro ecrã — a sua tabela de especificações, condições de entrega, bloco de preços — não chega ao modelo no modo rápido. Segundo, o mesmo fragmento de 200 caracteres é servido tanto para uma pergunta sobre preço como para uma pergunta sobre prazos de entrega. Até a página ser indexada de novo, não existe outra versão.
A meta description é ignorada neste percurso. Foi escrita para os resultados de pesquisa, onde o excerto é reconstruído por consulta; no índice da OpenAI, esse espaço já está preenchido com texto da própria página. Nas capturas da RESONEO, a meta description foi usada em cerca de um caso em três, e apenas em resultados obtidos por raspagem dos resultados de pesquisa do Google.
O problema da marcação
Onde a página é de facto aberta — o modo de raciocínio e esses 7% de respostas rápidas — o HTML é convertido em texto. As tags script, iframes e JSON-LD são completamente removidas. Os dados estruturados que adicionou especificamente para máquinas não chegam ao modelo em nenhum campo. Já o texto alternativo de imagens e o texto escondido por CSS sobrevivem.
Ou seja, um facto que exista apenas dentro de um bloco JSON-LD não existe para o ChatGPT em nenhum dos dois modos. Uma página pode passar num validador de dados estruturados, produzir um excerto arrumado no Google, e ficar muda numa resposta de IA. O estudo também assinala um limite rígido de 4 MB por página: acima disso, o pedido devolve HTTP 400 e a página não é lida de todo — não há corte parcial, simplesmente nada.
Há ainda uma camada de cache. Uma cópia obtida é considerada fresca durante cerca de 30 minutos, após os quais é servida uma versão desatualizada enquanto uma atualização corre em segundo plano. O corpus continha cópias com mais de 90 dias, e esta camada ignora o Cache-Control: no-store e o noindex.
Porque é que isto importa para um pequeno negócio
A maioria dos donos de negócios assume que uma página com bom aspeto e marcação correta já basta para ser citada. A conclusão é que, na maioria das respostas rápidas, ninguém olhou para a sua página hoje; o modelo repete um fragmento capturado numa data anterior desconhecida. Se o seu preço, a sua área de serviço ou as suas condições de entrega mudaram desde então, a resposta está errada, e também não vai ver isso no seu analytics. Os cliques em links visíveis trazem um utm_source de chatgpt.com, mas as páginas que o modelo abriu e realmente leu no modo de raciocínio não trazem qualquer tag UTM, porque ninguém clicou. A sua linha de "tráfego do ChatGPT" descreve a cauda do processo, não a sua presença nas respostas.
Mais um detalhe útil: o modo de raciocínio não é um privilégio pago. Uma conta gratuita com o botão Think devolveu 35,3 URLs por conversa, contra 35,1 no modo de raciocínio pago. Um único clique praticamente duplicou o número de fontes, de 15,1 para 35,3.
O que fazer este mês
- Leia os primeiros 200 caracteres depois do seu H1 nas páginas-chave. Se forem um breadcrumb, uma data e uma assinatura de autor, é assim que o seu site se apresenta em 93% das respostas.
- Coloque preço, data, autor e para que serve o produto em frases correntes no corpo do texto, perto do H1, e repita o mesmo facto no texto alternativo da imagem próxima. Mantenha os seus dados estruturados — o Google e o Yandex leem-nos — mas nunca deixe um facto viver só ali.
- Verifique o seu
robots.txtpor cada crawler. O GPTBot recolhe dados de treino; o OAI-SearchBot decide se aparece em citações e excertos de pesquisa; o ChatGPT-User surge por iniciativa de um utilizador; o OAI-AdsBot verifica páginas de destino de anúncios. UmUser-agent: *genérico comDisallow: /, ou uma lista copiada de bots de IA, fecha o crawler de pesquisa junto com o de treino. Os sistemas da OpenAI captam alterações ao robots.txt em cerca de um dia. - Não confie no sitemap para que novas páginas sejam indexadas. Na observação de 16 dias, o GPTBot descarregou o sitemap diariamente mas não visitou URLs que só existiam ali — 0 em 8 — enquanto 8 páginas com uma ligação de entrada normal foram indexadas no mesmo dia.
- Verifique o peso da página. Tudo o que se aproxime de 4 MB de HTML arrisca ser recusado por completo.
Nada disto exige um site novo. Exige tirar os três ou quatro factos que um cliente pergunta de dentro de tabelas, separadores e marcação, e colocá-los em frases simples perto do topo da página, e garantir que o crawler que produz citações tem acesso permitido. O resto é paciência: o cartão só é reconstruído quando a página é indexada de novo.
FonteEscrito a partir da reportagem de Habr. Leia o original: ChatGPT не открывает страницу в 93% быстрых ответов: что видит модель и что чинить на сайте ↗