PerplexityBot e Perplexity-User são dois agentes diferentes. O primeiro rastreia páginas para que o seu site apareça e seja linkado nos resultados do Perplexity; o segundo busca uma página quando um usuário faz uma pergunta e, segundo a Perplexity, em geral ignora o robots.txt. Bloquear um não bloqueia o outro.
Por que dois nomes para o mesmo produto?
Imagine uma biblioteca. Existe o bibliotecário que, de madrugada, percorre as estantes e atualiza o catálogo. E existe o leitor que, de dia, pede um livro específico ao balcão e recebe o volume na mão. São trabalhos distintos, com regras distintas, e a Perplexity separou os dois em agentes diferentes na documentação oficial de seus bots.
PerplexityBot é o bibliotecário da madrugada. A documentação diz que ele foi projetado para exibir e linkar sites nos resultados de busca da Perplexity, e que não é usado para rastrear conteúdo para modelos de fundação de IA. Ou seja: o objetivo declarado é aparecer em resultados, não treinar modelo.
Perplexity-User é o leitor no balcão. Ele entra em ação quando uma pessoa faz uma pergunta e a plataforma decide visitar uma página para responder, linkando essa página na resposta. A documentação também afirma que ele não é usado para rastreamento nem para coletar conteúdo de treinamento.
O que muda no robots.txt?
Aqui está a parte que costuma surpreender. A documentação explica que, como foi o usuário quem pediu a busca, esse fetcher "generally ignores robots.txt rules", isto é, em geral ignora as regras do robots.txt. Já o PerplexityBot respeita a configuração, e a recomendação da empresa é permiti-lo para que o site possa aparecer nos resultados.
Duas consequências práticas, ambas leituras nossas a partir do texto oficial:
- Um
Disallowpara PerplexityBot não é uma garantia de que a Perplexity jamais acessará a página; o acesso iniciado por usuário segue outra lógica. - Um bloqueio no robots.txt é uma decisão sobre visibilidade, não um muro. Se a sua intenção é restringir acesso de verdade, a ferramenta é outra (autenticação, regras no servidor), e vale ler a política vigente antes de decidir.
A própria documentação avisa que cada configuração funciona de forma independente e que pode levar até 24 horas para os sistemas da Perplexity refletirem mudanças. Se você alterou o robots.txt hoje, não conclua nada amanhã cedo.
Como liberar sem abrir a porta errada?
Muitas marcas de eletrônicos protegem o site com um WAF (firewall de aplicação) que bloqueia tráfego automatizado por padrão. É o cenário em que o robots.txt diz "pode entrar" e o firewall responde "não". A orientação da documentação é identificar os agentes combinando o user-agent com os intervalos de IP publicados, que ficam em arquivos JSON (perplexity.com/perplexitybot.json e perplexity.com/perplexity-user.json) e são tratados como a fonte da verdade.
Um roteiro curto de verificação:
- Abra o robots.txt e confirme que não há uma regra genérica barrando o PerplexityBot por acidente (regras amplas para "todos os bots" podem barrá-lo sem que ninguém perceba).
- Confira nos logs do servidor se aparecem requisições com os user-agents
PerplexityBot/1.0ePerplexity-User/1.0. - Se houver WAF ou CDN com proteção contra bots, crie uma regra que combine user-agent e faixa de IP, e não apenas o nome do agente, porque um user-agent sozinho é fácil de falsificar.
- Anote a data da mudança e reavalie depois de pelo menos 24 horas.
Ser rastreado é o mesmo que ser recomendado?
Não, e este é o ponto em que a maioria dos textos sobre crawlers para. Permitir o PerplexityBot cria a condição para que sua página possa ser encontrada e linkada. A documentação da empresa não faz nenhuma promessa sobre posição nem sobre recomendação, e nós também não faremos.
No método da Citoriq, acesso é a primeira camada de uma pilha. Depois dela vêm a legibilidade da página (specs, identificadores, dados estruturados) e, só então, a pergunta que importa para a marca: quando um consumidor pede uma indicação, o produto aparece, em que posição e com que justificativa? Nosso diagnóstico gratuito é uma análise experimental via API e não replica a interface de consumo do Perplexity; os resultados variam por modelo, por pergunta e por dia. Detalhamos isso em /methodology.
Vale ler este texto junto com o nosso guia sobre OAI-SearchBot, GPTBot e ChatGPT-User: a lógica de separar "rastrear para aparecer" de "buscar a pedido do usuário" aparece em mais de um ecossistema, mas cada empresa tem nomes, regras e promessas próprias. Para controlar o trecho que aparece em respostas do Google, veja nosnippet e max-snippet.
O que levar daqui
- PerplexityBot e Perplexity-User têm funções diferentes: indexar para resultados e buscar a pedido do usuário.
- Segundo a documentação, o fetcher disparado por usuário em geral ignora o robots.txt; tratar o arquivo como proteção absoluta é um erro.
- Mudanças no robots.txt podem levar até 24 horas para valer; teste com paciência.
- Se existe WAF ou CDN, a liberação precisa combinar user-agent e IP publicado.
- Ser acessível é condição, não resultado: acesso não equivale a ser recomendado.
Perguntas frequentes
O PerplexityBot é usado para treinar modelos de IA?
Segundo a documentação oficial da Perplexity, não: ele serve para exibir e linkar sites nos resultados e não é usado para rastrear conteúdo para modelos de fundação. A mesma página diz isso sobre o Perplexity-User.
Posso bloquear o Perplexity-User pelo robots.txt?
A documentação afirma que, por ser uma busca pedida por um usuário, esse fetcher em geral ignora as regras do robots.txt. Por isso, o arquivo não deve ser sua única linha de controle se o acesso for sensível.
Liberar o PerplexityBot garante que minha marca apareça nas respostas?
Não. Liberar o acesso permite que a página seja encontrada, mas a documentação não promete posição ou recomendação, e a escolha de produtos depende do modelo, da pergunta e de outros sinais da página.
Quer ver como as IAs tratam hoje os seus produtos, e não só se conseguem lê-los? Rode o diagnóstico gratuito em /geo-scanner ou peça uma demonstração em /demo.