GEO for products

Google-Extended: o que o controle bloqueia e o que não

By Citoriq editorial team · · 6 min

Google-Extended é um token do robots.txt que permite ao site limitar o uso do conteúdo rastreado pelo Google no treinamento e no grounding dos modelos Gemini. Segundo o Google, ele não afeta a inclusão na Busca nem funciona como sinal de ranqueamento. Para controlar o que aparece nas AI Overviews e no Modo IA, as ferramentas são outras.

O que é o Google-Extended, exatamente?

A documentação do Google o descreve como um "token de produto independente": uma etiqueta que o editor usa no robots.txt para decidir se o conteúdo que o Google rastreia pode servir para treinar as próximas gerações de modelos Gemini, que alimentam o app Gemini e o Vertex AI. A mesma página diz que o token também cobre o grounding, isto é, o momento em que o Google entrega conteúdo do índice da Busca ao modelo no instante da pergunta.

Um detalhe técnico muda a forma de pensar. O Google-Extended não tem uma string de user agent HTTP própria. Não existe um robô chamado Google-Extended batendo no seu servidor. O rastreamento continua sendo feito pelos user agents que o Google já usa, e o token funciona como uma chave de cômodo: o rastreador entra na casa pela mesma porta de sempre, mas a chave decide em quais cômodos o conteúdo pode ser usado depois.

Isso responde por que você não encontra esse nome nos logs. Se você audita o tráfego de robôs, como mostramos em Bots de IA nos logs: como auditar quem lê o seu site, os rastreadores da OpenAI e da Perplexity aparecem com nome. O Google-Extended não aparece, porque é uma regra de uso, não um visitante.

Por que ele não mexe na Busca nem nas AI Overviews?

A resposta está em duas frases do Google. A primeira: o Google-Extended "não afeta a inclusão de um site na Busca nem é usado como sinal de ranqueamento". A segunda, na página sobre recursos de IA: como a IA está embutida na própria Busca, o controle em nível de site para esses recursos são as regras do Googlebot no robots.txt. E, para limitar treino e grounding "em alguns dos outros sistemas do Google", a página aponta para o Google-Extended.

Traduzindo: bloquear o Google-Extended não tira o seu produto das AI Overviews, e liberá-lo não garante entrada. A página do Google sobre o tema diz também que não há requisitos adicionais nem otimizações especiais para aparecer nesses recursos; vale a base de sempre, com página indexável e elegível a aparecer com snippet. Já a exibição do seu texto dentro da Busca com IA se controla com nosnippet, data-nosnippet, max-snippet e noindex, tema que detalhamos em Nosnippet e max-snippet: controlar o Google com IA.

Treino e grounding: qual a diferença prática?

Treino é o que o modelo aprende de antemão. Grounding é o que o modelo consulta na hora para não responder de memória. Para uma marca de eletrônicos, a diferença é concreta: o primeiro molda o que o modelo "acha que sabe" sobre sua linha, e o segundo decide se a página atual do seu produto, com preço e ficha técnica de hoje, entra na resposta.

Aqui entra a parte que exige cautela. A documentação diz que o token governa os dois usos, mas nós não encontramos medição pública do efeito de bloquear ou liberar sobre a frequência com que uma marca é recomendada. Quem afirma o contrário está extrapolando. O que dá para dizer é o caminho lógico: se o grounding de um produto depende de ler a página, uma página bloqueada para esse uso tem menos chance de ser a fonte do dado. Isso é hipótese, não resultado, e deve ser testado.

Como decidir se a sua marca deve bloquear?

Pense em três perguntas, nesta ordem.

  1. O conteúdo é proprietário de verdade? Manuais, especificações e páginas de produto existem para ser lidos e citados. Conteúdo pago, restrito a parceiros ou com licença específica merece outra conta.
  2. Quem decide na empresa? Jurídico e marketing costumam discordar. Documente a decisão com data, porque ela vai ser revista quando o ecossistema mudar.
  3. Você consegue medir antes e depois? Sem uma linha de base, qualquer mudança vira opinião.

Para a terceira pergunta, nós recomendamos um teste simples: monte um conjunto fixo de perguntas de consumidor, rode antes de mudar o robots.txt e repita depois, anotando modelo, data e prompt. A variação entre execuções é grande por natureza, como explicamos em Variância de resposta: por que a IA muda de opinião, então uma rodada isolada não prova nada.

O que muda no Search Console?

Nada relacionado a este token. O Google informa que os sites exibidos nos recursos de IA entram no tráfego geral de busca do Search Console, no relatório de desempenho, no tipo de busca "Web". A página que lemos não menciona um filtro dedicado para separar o que veio de AI Overviews. Se você mexer no Google-Extended esperando ver um degrau nessa curva, o Search Console não é o instrumento certo.

Como o Google-Extended se compara aos robôs de outras empresas?

Em OpenAI e Perplexity, cada função tem um nome: busca, treino e acesso a pedido do usuário aparecem como rastreadores distintos, descritos em OAI-SearchBot, GPTBot e ChatGPT-User e em PerplexityBot e Perplexity-User. No Google, a separação existe, mas sob outro desenho: o rastreador é o mesmo, e a decisão de uso vem do token. Quem copia regras de um ecossistema para o outro sem ler essa diferença acaba bloqueando o que não queria ou liberando o que não devia.

O que levar daqui

  • O Google-Extended controla treino e grounding de modelos Gemini; não controla inclusão nem ranking na Busca.
  • Ele não tem user agent próprio, então não aparece nos logs como um visitante.
  • Para AI Overviews e Modo IA, valem as regras do Googlebot e os controles de snippet.
  • Não há medição pública, que tenhamos lido, do efeito do bloqueio sobre recomendações: teste antes de decidir.
  • Registre a decisão e a data, e repita a medição quando o Google atualizar a documentação.

Perguntas frequentes

Bloquear o Google-Extended tira meu site das AI Overviews?

Não, segundo o Google: o token não afeta a inclusão na Busca. A presença nos recursos de IA da Busca depende de a página estar indexada e elegível a aparecer com snippet.

O Google-Extended aparece nos logs do servidor?

Não. O Google informa que ele não tem string de user agent HTTP separada; o rastreamento usa os user agents já existentes do Google.

Devo bloquear para proteger meu conteúdo de produto?

Depende de como você valoriza ser lido pelo grounding do Gemini contra o risco de uso do conteúdo. Decida com jurídico e marketing, e meça o efeito com perguntas fixas antes e depois.

Se você quer ver como as respostas de IA tratam hoje os seus produtos antes de mexer em qualquer regra, o diagnóstico gratuito mostra uma leitura experimental, feita via API, que não replica a interface de consumo dos assistentes. A forma como medimos está descrita em /methodology.

Sources

Sources last verified: October 11, 2026

Related articles