Índice do ChatGPT também inclui sites pequenos, aponta estudo

Pesquisa da Resoneo mostra como o ChatGPT recupera páginas, forma snippets e usa fontes de sites com e sem acordos de licenciamento de conteúdo

Diego IvoDiego Ivo5 min
Compartilhar:

Sites pequenos e publicações sem acordos comerciais com a OpenAI também aparecem no índice interno utilizado pelo ChatGPT. A conclusão faz parte de um estudo da Resoneo que examinou mais de 1.200 respostas e 27 mil páginas recuperadas pelo assistente.

O levantamento registrou 58 mil URLs recuperadas. Desse conjunto, 7.600 foram promovidas a fontes visíveis, 5 mil apareceram como citações no texto e apenas 760 tiveram seu conteúdo integral aberto pelo modelo. Na maior parte das vezes, portanto, o sistema trabalhou com título, endereço e um trecho curto.

A pesquisa também comparou páginas de veículos licenciados e não licenciados. Segundo os testes, a existência de um acordo não alterou formato, extensão ou atualização do trecho entregue pelo índice próprio da OpenAI, identificado pelos pesquisadores como “labrador”.

Estudo analisou 58 mil URLs recuperadas pelo ChatGPT

A Resoneo acompanhou respostas reais produzidas pelo ChatGPT e analisou os mecanismos que forneceram resultados ao modelo. A base inclui 58 mil URLs recuperadas, das quais aproximadamente 13% foram exibidas como fontes e menos de 9% foram citadas diretamente no texto das respostas.

A abertura efetiva das páginas foi menos frequente. Apenas 760 URLs, cerca de uma em cada 76 recuperações, foram abertas para leitura integral. O restante foi representado por informações fornecidas pelo mecanismo de busca: título, URL e snippet.

Os pesquisadores separaram os resultados por configuração de conta e modo de resposta. Essa distinção é necessária porque o conjunto de fontes muda conforme o usuário utiliza respostas instantâneas ou modos de raciocínio.

Índice próprio domina respostas gratuitas em determinadas configurações

Nos testes atualizados, o modo Think de contas gratuitas recuperou, em média, 35,3 URLs por conversa. Aproximadamente 74,7% vieram do índice interno da OpenAI, 22,2% de um fornecedor de resultados e 3,1% de resultados associados ao Google.

Já o modo de raciocínio de contas pagas apresentou composição diferente. Nesse grupo, 75,3% dos resultados analisados foram associados ao Google, enquanto 24,7% vieram do índice próprio. Os volumes foram semelhantes, mas as bases consultadas mudaram.

O estudo ressalta que esses percentuais descrevem as configurações testadas. Eles não representam todos os usuários nem garantem que uma mesma pergunta produzirá o mesmo conjunto de fontes em contas diferentes.

Sites licenciados e não licenciados receberam tratamento equivalente

A análise da Resoneo sobre o índice interno não encontrou diferença de formato entre páginas de empresas com acordos de conteúdo e sites sem contrato com a OpenAI. Centenas de publicações não licenciadas receberam snippets com a mesma extensão, estrutura e atualização observadas entre parceiros.

Esse resultado não mede a frequência com que cada domínio é selecionado nem indica igualdade de visibilidade. A pesquisa verificou como as páginas já presentes no índice foram armazenadas e apresentadas ao modelo. A probabilidade de citação ficou fora do escopo.

Além disso, acordos comerciais podem alterar a forma de ingestão do conteúdo. Publicações parceiras podem chegar por feeds, enquanto outros sites dependem do rastreamento. O levantamento não examinou as condições contratuais desses acordos.

ChatGPT recebe cerca de 200 caracteres por página no índice interno

Quando o índice próprio fornece um resultado, o snippet contém aproximadamente 200 caracteres extraídos do início do corpo renderizado. A meta description não foi a origem predominante desse texto nos casos analisados.

Entre 534 páginas citadas que foram examinadas em detalhe, 463 tinham marcação H1. O título apareceu no snippet de 387 delas, equivalentes a 83,6%. Em 77% desses casos, o H1 foi o primeiro elemento do trecho armazenado.

Elementos posicionados antes ou logo após o título consumiram parte do espaço disponível. Identificação de seção apareceu em 29% das páginas, datas em 11% e texto alternativo da primeira imagem em 9%. Uma em cada sete páginas analisadas não tinha H1.

Resultado de busca e leitura integral usam estruturas diferentes

A pesquisa identificou dois armazenamentos. O índice de busca guarda o snippet usado para localizar uma página. Já o cache de leitura mantém uma cópia mais ampla, convertida em Markdown, quando uma URL é aberta sob demanda.

O OAI-SearchBot alimenta o índice e também pode fornecer páginas ao cache. O ChatGPT-User é acionado em determinadas solicitações iniciadas por usuários e atualiza a cópia de leitura, mas não o snippet usado na busca.

Nos testes da Resoneo, uma visita do ChatGPT-User não alterou o trecho já armazenado no índice. Portanto, a atualização do conteúdo integral e a atualização do snippet seguem processos distintos dentro da infraestrutura observada.

Metodologia combina captura de respostas e análise de páginas

O conjunto principal reuniu 1.249 respostas capturadas. Os pesquisadores acompanharam campos presentes no fluxo do ChatGPT, compararam formatos de snippets e repetiram perguntas em contas gratuitas, pagas e sem autenticação.

A equipe também buscou 534 páginas citadas para confrontar o HTML renderizado com o texto guardado pelo índice. Essa etapa permitiu medir presença do H1, elementos anteriores ao título e extensão do conteúdo efetivamente enviado ao modelo.

Parte da identificação dos mecanismos dependia de um campo que deixou de aparecer no fluxo do produto. Por isso, o estudo mantém os dados anteriores como retrato de um período específico e usa características de formato para análises posteriores.

Pesquisa não mede impacto de alterações na chance de citação

Os números descrevem o caminho entre recuperação, exibição e citação. Eles não demonstram que editar o H1, remover elementos do template ou mudar o primeiro parágrafo elevará a probabilidade de uma página ser citada.

Também não há teste causal sobre licenciamento. O estudo mostra que páginas licenciadas e não licenciadas receberam tratamento equivalente depois de entrarem no mesmo índice, mas não compara sua chance inicial de inclusão.

A principal evidência é operacional: na maior parte das recuperações analisadas, o modelo recebeu uma representação curta da página. A leitura integral ocorreu em uma parcela pequena do conjunto observado.

Cadastre-se gratuitamente para ver o conteúdo

Preencha o formulário para acessar o conteúdo completo.

Grátis. Sem spam. Cancele a qualquer momento.

Diego Ivo

Escrito por Diego Ivo

Diego é CEO da Conversion, agência Líder em SEO e especializada em Search. Possui mais de uma década de experiência no mercado digital e é um dos principais experts no Brasil em SEO.

Comentários

Deixe um comentário

Receba o melhor conteúdo de SEO & Marketing em seu e-mail.

Assine nossa newsletter e fique informado sobre tudo o que acontece no mercado