Para testar se uma IA recomenda seus produtos, monte de 30 a 60 perguntas reais de consumidor, divididas por intenção de compra, e rode todas mais de uma vez. O resultado só vale se as perguntas forem variadas, em português do Brasil e sem o nome da sua marca. Uma pergunta isolada mede sorte, não visibilidade.
Por que as perguntas decidem o resultado?
Imagine pescar para saber se há dourado num rio. Se você joga a linha num único ponto, num único horário, sua conclusão diz mais sobre o ponto do que sobre o rio. Testar marca em IA tem a mesma armadilha: quem pergunta só "qual o melhor notebook?" mede apenas uma esquina da conversa.
O Google descreve que seus recursos de IA podem usar uma técnica de query fan-out, emitindo várias buscas relacionadas por subtópicos e fontes de dados para montar a resposta. Isso vale para a Busca do Google; não sabemos como cada assistente faz o equivalente. Mas a lição serve para qualquer teste: uma pergunta de consumidor não é uma consulta, é uma família delas. Já exploramos isso em Query fan-out: como a IA multiplica uma pergunta de compra.
Quais intenções devo cobrir?
Nós dividimos o conjunto em seis intenções. Cada uma expõe uma fragilidade diferente.
- Descoberta ampla: "que fone de ouvido sem fio vale a pena até R$ 500?". Mede se sua marca entra na lista curta.
- Uso específico: "qual notebook leve aguenta edição de vídeo?". Mede se suas especificações respondem a um cenário.
- Comparação direta: "A ou B para quem joga online?". Mede como você aparece diante do concorrente.
- Dúvida técnica: "esse monitor funciona com o console?". Mede se a informação técnica existe e é encontrável.
- Confiança e pós-venda: "tem assistência técnica no Brasil?". Mede garantia, suporte e reputação.
- Preço e momento: "vale esperar a Black Friday?". Mede oferta, estoque e atualização.
Uma distribuição equilibrada evita um erro comum: marcas fortes em descoberta ampla (onde são conhecidas) e invisíveis nas dúvidas técnicas (onde os dados são fracos). Só o conjunto completo mostra esse contraste.
Como escrever perguntas que não viciam o teste?
Vamos a regras práticas, aprendidas do que mais distorce resultados.
- Não cite sua marca nas perguntas de descoberta. Se você pergunta "o notebook da Aurora é bom?", a resposta mede apenas a sua entidade, não a sua competitividade.
- Escreva como o consumidor fala. "Celular que não esquenta jogando" é mais real que "smartphone com dissipação térmica eficiente".
- Varie o registro. Inclua frases curtas, frases longas, erros leves de digitação e perguntas com contexto ("tenho um apartamento pequeno e...").
- Fixe a faixa de preço e o país. Sem isso, a IA responde para um consumidor hipotético qualquer.
- Registre o texto exato de cada pergunta. Se você a ajustar depois, perde a comparação no tempo.
Quantas vezes rodar cada pergunta?
Mais de uma. A mesma pergunta, no mesmo modelo, pode devolver respostas diferentes em dias diferentes. Por isso, nosso procedimento é rodar cada pergunta várias vezes e olhar a frequência de aparição, não a primeira resposta. Uma marca presente em 2 de 10 execuções tem uma situação muito diferente de uma presente em 9 de 10, embora ambas possam "aparecer" numa captura de tela.
Dê atenção também ao modelo. O que um modelo diz não vale para outro. Se você testa um só, seu relatório vale para um só. Veja em Share of recommendation como transformar essa frequência numa métrica comparável.
O que registrar em cada resposta?
Uma planilha simples resolve. Para cada execução, anote:
- se sua marca foi citada, mencionada ou recomendada (diferença que explicamos em Citação, menção e recomendação);
- quais concorrentes apareceram e em que posição;
- que atributos a resposta usou para justificar (preço, bateria, garantia);
- se a informação estava correta;
- quais fontes a resposta exibiu, quando exibiu.
O quarto item costuma ser o mais valioso. Respostas erradas sobre seu produto (um conector que ele não tem, uma garantia que não existe) apontam direto para a página ou fonte que precisa ser corrigida.
Quais são os limites deste método?
Sendo diretos: um conjunto de perguntas é uma amostra, e amostras erram. Nosso diagnóstico gratuito, por exemplo, é uma análise experimental via API e não replica a interface de consumo do ChatGPT, que pode ter personalização, memória e busca em tempo real. Um bom teste reduz o ruído; nunca o elimina. Leia a metodologia para ver como tratamos essas limitações.
O que levar daqui
- Uma pergunta mede sorte; um conjunto de 30 a 60, em seis intenções, mede visibilidade.
- Não use sua marca nas perguntas de descoberta e escreva como o consumidor fala.
- Rode cada pergunta várias vezes e compare frequências, não capturas de tela.
- Registre o tipo de aparição, os concorrentes e os erros factuais: os erros dizem o que corrigir primeiro.
Perguntas frequentes
Quantas perguntas são suficientes para um primeiro teste?
Sugerimos de 30 a 60, distribuídas pelas seis intenções. Menos que isso torna cada pergunta pesada demais no resultado.
Posso reaproveitar perguntas de SEO?
Em parte. Palavras-chave de busca são curtas; perguntas para IA costumam trazer contexto e restrições. Use as palavras-chave como semente e reescreva-as em linguagem natural.
Preciso testar vários assistentes?
Se o objetivo é entender sua visibilidade geral, sim. Os resultados variam por modelo, e um único assistente não representa os outros.
Quer começar sem montar tudo à mão? O diagnóstico gratuito executa um conjunto estruturado de perguntas e mostra as respostas como evidência.