GEO for products

Bots de IA nos logs: como auditar quem lê o seu site

By Citoriq editorial team · · 5 min

Para auditar bots de IA nos logs do servidor, filtre os registros pelos nomes de agente publicados (OAI-SearchBot, GPTBot, ChatGPT-User, PerplexityBot, Perplexity-User), confira o IP contra as listas oficiais e cruze com o status HTTP de cada URL de produto. O resultado mostra quem consegue ler suas páginas, mas não prova que alguém será recomendado.

Por que olhar logs, e não só o robots.txt?

O robots.txt é uma intenção. O log é o que de fato aconteceu. Entre um e outro costumam existir surpresas: um CDN que bloqueia tráfego "desconhecido", um firewall que devolve 403 para um agente, uma página de produto que só renderiza com JavaScript pesado.

Gostamos da imagem do livro de visitas de um hotel. O robots.txt é o cartaz na porta dizendo quem é bem-vindo. O livro de visitas registra quem entrou, a que horas e se foi atendido ou barrado na recepção. Para uma marca de eletrônicos, a pergunta útil é: o rastreador que alimenta a busca da IA chegou até a ficha do meu produto e recebeu a página?

Quais agentes procurar?

A documentação oficial da OpenAI lista quatro: OAI-SearchBot (alimenta a busca do ChatGPT), GPTBot (coleta para treinamento), ChatGPT-User (visitas acionadas por uma pessoa dentro do ChatGPT) e OAI-AdsBot (verifica páginas de destino enviadas como anúncios). A OpenAI publica listas de IPs em arquivos JSON para cada um.

A Perplexity documenta dois: PerplexityBot, que exibe e linka sites nos resultados, e Perplexity-User, acionado por uma pergunta do usuário. Este último, segundo a própria documentação, "geralmente ignora regras do robots.txt", porque a visita foi pedida por uma pessoa.

O Google, por sua vez, informa que seus rastreadores se identificam por três sinais: o cabeçalho user-agent, o endereço IP de origem e o DNS reverso desse IP. A página de visão geral remete a outra página para as etapas de verificação.

Detalhamos a função de cada agente em dois posts anteriores: OAI-SearchBot, GPTBot e ChatGPT-User e PerplexityBot e Perplexity-User.

Como fazer a auditoria, passo a passo?

  1. Exporte 30 dias de logs de acesso do servidor ou do CDN. Se o CDN fica na frente, o log dele é o que vale; o do servidor de origem pode nem ver a requisição bloqueada.
  2. Filtre pelo texto do user-agent. Procure os nomes acima, sem diferenciar maiúsculas de minúsculas. A OpenAI avisa que o número de versão do token pode mudar, então não filtre pela versão.
  3. Valide o IP. User-agent é texto e qualquer um pode copiá-lo. Compare o IP com os arquivos JSON oficiais de cada fornecedor. Requisições com o nome certo e o IP errado não são o bot que você pensa.
  4. Separe por finalidade. Agrupe em três baldes: busca (OAI-SearchBot, PerplexityBot), treinamento (GPTBot) e ação do usuário (ChatGPT-User, Perplexity-User). A decisão de negócio é diferente em cada balde.
  5. Cruze com o status HTTP. Para cada URL de produto, anote 200, 301, 403, 404 e 5xx. Uma sequência de 403 para o rastreador de busca é o achado mais importante da auditoria.
  6. Liste o que não apareceu. Se nenhuma requisição de um agente chegou a páginas de produto em 30 dias, o motivo pode ser bloqueio, baixa descoberta ou simplesmente ausência de demanda. O log não separa essas causas sozinho.

O que cada achado significa?

Um padrão que vale registrar: a OpenAI afirma que as configurações de cada bot são independentes, e que um site pode permitir o OAI-SearchBot e proibir o GPTBot. Ou seja, bloquear treinamento não precisa implicar sumir da busca. O contrário também vale: uma regra genérica de "bloquear bots de IA" pode derrubar os dois.

Outro cuidado: a documentação da OpenAI diz que, como as requisições do ChatGPT-User são acionadas por pessoas, regras do robots.txt podem não se aplicar a elas. A da Perplexity diz algo parecido sobre o Perplexity-User. Se você quer controlar acesso desses fetchers, o robots.txt não é o instrumento certo; controle por firewall ou por permissões da própria página.

As duas documentações também dizem que mudanças no robots.txt podem levar cerca de 24 horas para valer. Não conclua nada de um log colhido logo após editar o arquivo.

O que o log não responde?

Muita coisa. Ele não diz se o conteúdo foi usado numa resposta, qual foi a posição da sua marca, nem se a IA recomendou o produto ou o concorrente. Acesso é condição de leitura; recomendação é outra variável.

É por isso que, na nossa metodologia, tratamos acesso, legibilidade da página e recomendação observada como camadas separadas. O log cobre a primeira. As outras exigem observar as respostas das IAs, que variam por modelo, prompt e dia.

O que levar daqui

  • Log de acesso é evidência do que aconteceu; robots.txt é só intenção.
  • Filtre pelos nomes oficiais dos agentes e valide o IP contra as listas publicadas por cada fornecedor.
  • Separe busca, treinamento e ação do usuário: cada balde pede uma decisão diferente.
  • Respostas 403 para rastreadores de busca em páginas de produto são o primeiro alerta a corrigir.
  • Ser lido não é ser recomendado; use o log como etapa zero, não como métrica final.

Perguntas frequentes

Bloquear o GPTBot tira meu site da busca do ChatGPT?

Segundo a documentação da OpenAI, não necessariamente: as configurações são independentes, e o OAI-SearchBot controla a presença na busca. Confira o seu robots.txt para ter certeza de que nenhuma regra genérica bloqueia os dois.

Por que vejo ChatGPT-User mesmo com o robots.txt bloqueando?

A OpenAI informa que, por serem ações iniciadas por uma pessoa, as regras do robots.txt podem não se aplicar a essas requisições. Ela também ressalta que o ChatGPT-User não determina a presença na busca.

Preciso de ferramenta paga para ler os logs?

Não. Uma planilha ou um script simples que filtre user-agent e IP já resolve a primeira rodada. Ferramentas ajudam quando o volume cresce.

Próximo passo

Com o acesso verificado, falta saber o que as IAs de fato dizem sobre seus produtos. O diagnóstico gratuito em /geo-scanner é uma análise experimental para dar essa primeira leitura, e a demonstração mostra o processo completo.

Sources

Sources last verified: October 10, 2026

Related articles