A OpenAI usa três identificadores: OAI-SearchBot alimenta a busca do ChatGPT, GPTBot coleta conteúdo para treinar modelos e ChatGPT-User age quando uma pessoa pede ao ChatGPT para visitar uma página. Cada um tem regras próprias no robots.txt, e tratá-los como um só é um erro caro.
Por que três rastreadores em vez de um?
Imagine a portaria de um prédio com três tipos de visitante: o carteiro que lista quem mora ali para o catálogo da cidade, o fotógrafo que registra a fachada para um arquivo histórico e o convidado que foi chamado por um morador específico. Você não daria a mesma regra aos três.
É essa a lógica da documentação de rastreadores da OpenAI. Separar funções permite que o dono do site tome decisões diferentes: aparecer na busca, ficar de fora do treinamento, ou ambos. A leitura ruim é a que nós vemos com frequência: alguém bloqueia "tudo que é de IA" por precaução e depois estranha a ausência da marca nas respostas com busca.
O que faz o OAI-SearchBot?
Ele sustenta os recursos de busca do ChatGPT, ou seja, é o que faz seu site poder aparecer em respostas que consultam a web. Segundo a OpenAI, sites que bloqueiam o OAI-SearchBot não aparecem nas respostas de busca do ChatGPT, embora ainda possam surgir como links de navegação. A empresa recomenda permitir esse rastreador no robots.txt para ajudar a garantir a presença nos resultados.
Para quem trabalha com GEO, é o rastreador mais relevante. Ele tem a ver com recuperação, o caminho em que a IA busca páginas no momento da pergunta, que explicamos em Conhecimento paramétrico x recuperação.
A central de ajuda da OpenAI põe duas condições para o site ser elegível: permitir o OAI-SearchBot e confirmar que o provedor de hospedagem ou a CDN aceita o tráfego dos IPs publicados pela OpenAI para esse rastreador. E uma frase que vale ficar na parede: a colocação não é garantida.
O que faz o GPTBot?
O GPTBot rastreia conteúdo para treinar os modelos de fundação generativos da OpenAI e melhorar a segurança deles. Bloqueá-lo sinaliza que o conteúdo do site não deve ser usado nesse treinamento. É o mecanismo principal para quem quer sair dos dados de treino.
O ponto sutil: bloquear o GPTBot e permitir o OAI-SearchBot é uma combinação legítima. Ela diz "não treinem com meu conteúdo, mas me encontrem quando alguém pesquisar". Se isso é a decisão certa para sua marca é uma questão de negócio e jurídica; nós não damos aconselhamento jurídico. O que dizemos é que a combinação existe e deve ser escolhida, não herdada de um modelo de robots.txt copiado.
O que faz o ChatGPT-User?
Esse identificador aparece em ações iniciadas por usuários, como quando alguém pede ao ChatGPT para abrir uma página ou quando uma aplicação externa é acionada por GPT Actions. A documentação é direta: o ChatGPT-User não é usado para rastrear a web de forma automática, e, como as ações partem de uma pessoa, as regras do robots.txt podem não se aplicar. Ele também não determina a elegibilidade para a busca.
Na prática: se um consumidor cola o link da sua página de produto e pede um resumo, é esse perfil que pode aparecer nos seus logs. Não tire dele conclusões sobre ranking.
Como configurar sem se arrepender?
Um passo a passo curto:
- Decida a política em três linhas: busca (sim ou não), treinamento (sim ou não), ações de usuário (informativo).
- Escreva as regras por nome de rastreador, por exemplo com um bloco
User-agent: OAI-SearchBotseguido deAllow: /, e outroUser-agent: GPTBotcom a diretiva que corresponda à sua decisão. - Revise regras genéricas como
User-agent: *comDisallow, que podem bloquear rastreadores que você queria liberar. - Confira a camada de rede: firewall, WAF ou CDN podem barrar o tráfego mesmo com o robots.txt correto. A OpenAI cita explicitamente a necessidade de permitir os IPs publicados.
- Verifique nos logs se o OAI-SearchBot está chegando às páginas de produto, não só à home.
- Registre a data da mudança, para correlacionar com variações de presença nas respostas.
Isso resolve a porta de entrada. O que acontece depois, como a página é lida, citada e comparada, é outra etapa, tratada em Citabilidade: o que é e como avaliar uma página.
Liberar o rastreador basta?
Não. Liberar é condição necessária, nunca suficiente. A própria OpenAI diz que a colocação não é garantida e que os resultados de busca podem ser incompletos, desatualizados ou incorretos. Ser rastreável é como ter o endereço no mapa: ninguém promete visitas.
Por isso a Citoriq mede o resultado, não a configuração. Nosso diagnóstico gratuito é uma análise experimental via API e não replica a interface de consumidor do ChatGPT, e legibilidade da página não equivale a ser recomendado. Detalhes na metodologia.
O que levar daqui
- OAI-SearchBot = busca do ChatGPT; GPTBot = treinamento; ChatGPT-User = ações iniciadas por uma pessoa.
- Bloquear o OAI-SearchBot tira o site das respostas de busca; bloquear o GPTBot sinaliza recusa ao treinamento.
- Permitir busca e recusar treinamento é uma combinação possível, que exige decisão consciente.
- Robots.txt correto não basta se firewall ou CDN barrarem o tráfego.
- Rastreabilidade é pré-requisito; recomendação é outra conversa.
Perguntas frequentes
Se eu bloquear o GPTBot, saio das respostas do ChatGPT?
Segundo a documentação da OpenAI, o GPTBot está ligado ao treinamento de modelos, enquanto a busca depende do OAI-SearchBot. Bloquear um não é o mesmo que bloquear o outro.
O robots.txt controla o ChatGPT-User?
A OpenAI diz que, por serem ações iniciadas por uma pessoa, as regras do robots.txt podem não se aplicar a ele.
Permitir o OAI-SearchBot garante que minha marca apareça?
Não. A OpenAI afirma que a colocação não é garantida. Permitir é o primeiro requisito de elegibilidade.
Se quiser entender o que acontece depois da porta de entrada, rode o diagnóstico gratuito ou veja a plataforma em uma demonstração.