Segundo a OpenAI, modelos de linguagem alucinam em parte porque o treino e a avaliação padrão premiam o palpite confiante em vez de admitir incerteza. Para uma marca, a consequência prática é que lacunas na ficha técnica convidam a IA a preencher o vazio. Dado explícito na página é a melhor defesa que a marca controla.
O que a OpenAI diz sobre alucinações?
Em um texto sobre por que modelos de linguagem alucinam, a OpenAI define alucinações como situações em que um modelo gera com confiança uma resposta que não é verdadeira. Os argumentos centrais são dois.
O primeiro: a avaliação premia o chute. Num teste que só conta acertos, sem penalidade para erros, chutar pode render pontos e se abster nunca rende. O exemplo da OpenAI é a data de aniversário de uma pessoa: um palpite aleatório tem cerca de uma chance em 365 de acertar, enquanto "não sei" vale zero. Em muitas perguntas, o modelo que chuta parece melhor no placar.
O segundo: no pré-treinamento, o modelo aprende prevendo a próxima palavra, sem rótulos de verdadeiro ou falso. Padrões regulares, como a ortografia, ficam confiáveis com escala. Fatos arbitrários e raros, como o aniversário de alguém, não se deduzem de padrões, e os erros aparecem.
Que números o texto traz?
Uma comparação do texto no teste SimpleQA mostra o efeito. O gpt-5-thinking-mini se absteve em 52% das vezes e errou em 26%. O o4-mini se absteve em 1% e errou em 75%. A taxa de acerto do segundo foi só um pouco maior (24% contra 22%), então o chute estratégico, nas palavras do resumo, acrescentou sobretudo erros.
A OpenAI propõe punir mais o erro confiante do que a incerteza e dar crédito parcial a respostas que expressam dúvida adequadamente. O texto também afirma que a precisão nunca chegará a 100%, porque algumas perguntas são impossíveis de responder, e que alucinações não são inevitáveis, já que os modelos podem se abster quando estão em dúvida.
O que isso significa para um fabricante de eletrônicos?
Opinião, com a evidência na frente: a ficha técnica deixou de ser um documento de apoio e virou a principal ferramenta de uma marca contra a invenção.
Pense em uma prova de múltipla escolha em que ninguém perde ponto por errar. Uma pergunta sobre o modelo da sua marca ("esse monitor tem entrada HDMI 2.1?") é uma questão da prova. Se a página não responde, o modelo tem dois caminhos: abster-se ou chutar. O texto da OpenAI descreve por que o treino empurra para o segundo. A sua página pode oferecer um terceiro: a resposta certa, escrita, ao alcance da recuperação.
Atenção ao que não afirmamos. A OpenAI trata de treinamento e avaliação de modelos, e não de recuperação de páginas da web por assistentes de compra. Também não temos medição de quantas especificações erradas as IAs atribuem a produtos. A conexão entre os dois assuntos é a nossa hipótese de trabalho, não um resultado do artigo.
Como a recuperação entra nessa história?
Quando um assistente consulta páginas além do que aprendeu, o dado fica ancorado em algo que se pode verificar. Descrevemos essa diferença em conhecimento paramétrico x recuperação e o mecanismo de ancoragem em grounding em IA. Em resumo: o que o modelo aprendeu é memória; o que ele lê agora é consulta. Para fatos que mudam com o modelo do produto, a consulta tende a ser o terreno onde a marca ganha ou perde.
O que fazer na ficha técnica
- Preencher todos os campos que o comprador compara, mesmo quando a resposta é um "não possui". Ausência escrita é diferente de ausência silenciosa.
- Usar a mesma formulação da especificação em página, feed e marketplaces, para o modelo não encontrar duas versões.
- Separar as variantes. Uma ficha única para três versões convida à mistura de atributos; veja entidade de produto e variantes.
- Datar a revisão da ficha, para que mudanças de modelo não deixem especificações antigas circulando.
- Testar com perguntas reais e registrar os erros separadamente das ausências. Para montar o roteiro, veja perguntas de consumidor: como testar sua marca em IA.
O quinto ponto é uma escolha de método que defendemos: erro e ausência são problemas diferentes e merecem colunas diferentes. Uma marca ausente perde uma oportunidade. Uma marca descrita com especificação errada paga o custo de uma devolução e de uma avaliação ruim.
Como isso aparece na medição?
Uma boa leitura separa quatro situações: o produto foi omitido, foi citado com dado correto, foi citado com dado incorreto ou a IA declarou que não sabia. A última, pelo texto da OpenAI, é um comportamento que se quer estimular, não punir. O diagnóstico gratuito da Citoriq é uma análise experimental via API, não replica a interface de consumidor e os resultados variam por modelo, prompt e dia, como mostra a variância de resposta. Os critérios estão em /methodology.
O que levar daqui
- Segundo a OpenAI, avaliações que só contam acerto premiam o palpite e desestimulam o "não sei".
- Lacuna na ficha técnica é espaço para o modelo preencher; escreva até o "não possui".
- Mantenha a mesma especificação em todas as superfícies e separe as variantes.
- Meça erro e ausência separadamente: o custo para a marca é diferente.
- A ligação entre treino e fichas de produto é hipótese nossa, não resultado do artigo da OpenAI.
Perguntas frequentes
O que é uma alucinação, segundo a OpenAI?
É uma situação em que o modelo gera com confiança uma resposta que não é verdadeira. A OpenAI atribui parte do problema a avaliações que premiam o palpite.
Uma ficha técnica completa impede a IA de errar?
Não há garantia. A ficha reduz a necessidade de o modelo adivinhar quando ele consulta a página, mas o resultado varia por modelo, prompt e dia.
Vale escrever "não possui" na ficha técnica?
Sim, quando for verdade. Uma ausência escrita deixa claro que o dado foi considerado, enquanto o silêncio deixa espaço para o modelo preencher.
Para ver como a IA descreve hoje as especificações dos seus produtos, rode o diagnóstico gratuito. Se quiser montar um roteiro de testes para erros de especificação, conheça a demonstração.