Alucinação, em inteligência artificial, é quando um modelo de linguagem gera uma informação factualmente errada, inventada ou contraditória com a fonte — mas a apresenta com a mesma fluência e confiança de uma resposta correta. Não é um erro de digitação nem um "não sei" disfarçado: é o modelo produzindo uma afirmação específica, coerente e plausível que simplesmente não é verdade. É o tipo de erro mais perigoso de um sistema de IA generativa, porque não vem acompanhado de nenhum sinal de dúvida.
O que é, exatamente, uma alucinação de IA
Um [LLM](/artigo/o-que-e-um-llm-guia-modelos-linguagem) não consulta um banco de dados de fatos ao responder: ele prevê, token a token, qual sequência de palavras é estatisticamente mais provável dado o contexto. Na maior parte do tempo, essa previsão coincide com a realidade porque o modelo foi treinado sobre um volume gigantesco de texto correto. O problema aparece quando o modelo não tem — ou perdeu, ao longo da [janela de contexto](/artigo/tokens-janela-de-contexto-llm) — informação suficiente sobre o assunto. Em vez de travar, ele continua gerando a sequência mais plausível, e o resultado pode ser uma citação que não existe, uma API com parâmetros que nunca foram documentados ou uma estatística que soa precisa demais para ser real.
Alucinação não é o mesmo que informação desatualizada. Um modelo que diz que o dólar está a R$ 5,10 porque seu treinamento parou antes de uma mudança cambial está errado, mas de forma rastreável. Alucinação é o modelo inventar um número, uma fonte ou um evento que nunca existiu — e defendê-lo com a mesma convicção de um fato correto.
Por que os modelos alucinam
A explicação técnica de base é a geração probabilística: como o modelo sempre escolhe a próxima palavra mais provável, ele nunca tem uma forma nativa de dizer "não tenho essa informação" — dizer isso também é apenas mais uma sequência de palavras que compete, estatisticamente, com todas as outras. Mas há um segundo fator, menos óbvio, que ganhou força em 2025: a forma como os modelos são avaliados durante o desenvolvimento.
Um paper publicado pela OpenAI em setembro de 2025 ("Why Language Models Hallucinate", de Adam Tauman Kalai e Ofir Nachum) argumenta que boa parte da alucinação não vem de dados ruins nem de arquitetura, mas do próprio jeito como os modelos são pontuados nos benchmarks. Segundo reportagens que analisaram o paper — como The Register e a Computerworld —, a maioria das avaliações usa nota binária: uma resposta errada e uma resposta "não sei" recebem a mesma pontuação zero, enquanto um chute correto vale ponto cheio. Isso cria um incentivo direto para o modelo chutar em vez de admitir incerteza, porque estatisticamente chutar compensa mais do que seria de se esperar. Os autores propõem benchmarks que dão crédito parcial à incerteza bem calibrada e penalizam mais um erro confiante do que um "não sei" honesto.
- Geração probabilística: prever a próxima palavra plausível é diferente de recuperar um fato verificado.
- Lacunas no treinamento: perguntas sobre eventos recentes, nichos pouco documentados ou dados privados da empresa do usuário.
- Incentivo de avaliação: benchmarks que penalizam "não sei" igual a uma resposta errada, recompensando o chute confiante.
- Contexto longo mal aproveitado: informação relevante "perdida no meio" de um prompt muito extenso.
- Prompt ambíguo: perguntas vagas deixam mais espaço para o modelo preencher lacunas com suposições.
Tipos de alucinação
Vale distinguir dois eixos. O primeiro é intrínseca vs. extrínseca: uma alucinação intrínseca contradiz diretamente o material fornecido no próprio prompt (o modelo resume um contrato e inverte uma cláusula); uma extrínseca inventa algo que não estava nem a favor nem contra o texto-fonte — simplesmente não existe nele. O segundo eixo é fechada vs. aberta: em uma tarefa fechada (resumir um documento específico), é possível checar a resposta contra a fonte; em uma tarefa aberta ("explique a história da Petrobras"), a checagem depende do conhecimento de mundo do modelo, o que é mais difícil de auditar.
Um subtipo estudado por pesquisadores da Universidade de Oxford — Sebastian Farquhar e equipe, em paper publicado na Nature em 2024 — recebeu o nome de confabulação: respostas erradas e arbitrárias, sensíveis a detalhes irrelevantes como a semente aleatória da geração. Os autores propuseram medir a chamada entropia semântica (a variação de significado entre várias respostas geradas para a mesma pergunta) como forma de detectar esse tipo específico de erro sem precisar de uma base de fatos externa.
Como isso é medido na prática
O Hallucination Leaderboard, mantido pela Vectara, é a referência mais usada para comparar taxas de alucinação entre modelos. Segundo o repositório oficial do projeto no GitHub, a metodologia pede que cada modelo resuma um documento com a instrução explícita "resuma usando apenas a informação da passagem, sem inferir", com temperatura zero para eliminar variação aleatória, sobre uma base de mais de 7.700 artigos de áreas como notícia, tecnologia, ciência, medicina, direito e negócios. Um modelo de avaliação próprio (o HHEM) então mede se cada resumo permanece factualmente consistente com o documento original — não a qualidade da escrita, só a fidelidade aos fatos apresentados.
Como é uma tabela viva, atualizada continuamente pela Vectara conforme novos modelos são lançados, os números mudam de mês a mês — vale sempre conferir a versão mais recente do leaderboard antes de usar um valor específico em uma decisão de produto.
Técnicas comprovadas para reduzir alucinação
A documentação oficial da Anthropic para o Claude lista um conjunto de técnicas práticas — que valem, com adaptações, para qualquer LLM comercial:
- Permitir dizer "não sei": dar permissão explícita, no prompt, para o modelo admitir incerteza reduz drasticamente respostas inventadas.
- Citação e extração de trechos: para documentos longos, pedir que o modelo extraia as citações exatas antes de responder ancora a resposta no texto real.
- Verificação com fontes: fazer o modelo citar a origem de cada afirmação e retratar a afirmação se não encontrar uma citação de apoio.
- Cadeia de raciocínio (chain-of-thought): pedir que o modelo explique o raciocínio passo a passo antes da resposta final expõe premissas falhas.
- Best-of-N: rodar o mesmo prompt várias vezes e comparar as respostas — inconsistência entre elas é um sinal de alucinação.
- Restrição a fontes fornecidas: instruir explicitamente o modelo a usar só o que está no documento, não o conhecimento geral dele.
A técnica com maior retorno arquitetural continua sendo o [RAG (Retrieval-Augmented Generation)](/artigo/rag-retrieval-augmented-generation-o-que-e-como-funciona): em vez de depender só do que o modelo "lembra" do treinamento, o sistema busca documentos relevantes e os injeta no prompt antes da geração, ancorando a resposta em [embeddings](/artigo/embeddings-o-que-sao-como-funcionam-ia) de uma base de conhecimento real. RAG reduz muito a alucinação em tarefas de domínio fechado, mas não a elimina — o modelo ainda pode interpretar mal um trecho recuperado ou misturar informação de fontes conflitantes.
# Exemplo de instrução para reduzir alucinação (baseado na doc da Anthropic)
Responda à pergunta do usuário usando apenas as informações contidas em <documento>.
1. Antes de responder, extraia as citações literais mais relevantes do documento.
2. Se não encontrar uma citação relevante, responda: "Não encontrei essa informação no documento fornecido."
3. Ao final, liste cada afirmação da sua resposta junto com a citação que a sustenta.
4. Se não houver citação de apoio para uma afirmação, remova essa afirmação.Onde essas técnicas ainda falham
Nenhuma técnica atual elimina alucinação por completo — todas reduzem a probabilidade, nenhuma zera o risco. Há também um efeito colateral pouco intuitivo: modelo mais novo ou com mais capacidade de raciocínio não é sinônimo de menos erro factual. No próprio system card do o3 e do o4-mini (abril de 2025), a OpenAI reportou que o3 alucinou em 33% das perguntas do benchmark interno PersonQA — o dobro do 16% do modelo anterior, o1 —, enquanto o o4-mini chegou a 48%. A explicação dada pela própria OpenAI é que modelos de raciocínio mais longo fazem mais afirmações no total, o que gera mais acertos, mas também mais alucinações; a empresa reconheceu que "mais pesquisa é necessária" para entender por que o problema piorou com a escala. Na prática, isso significa que qualquer aplicação de alto risco — jurídico, médico, financeiro — ainda precisa de validação humana antes de uma decisão final, mesmo usando o modelo mais recente disponível.
Alucinação, LGPD e responsabilidade no Brasil
Um risco pouco discutido: quando um modelo alucina um dado pessoal — um número de CPF, um endereço, uma acusação atribuída a uma pessoa real que nunca ocorreu —, a empresa que expôs essa saída ao usuário final pode responder por isso perante a [LGPD](/artigo/lgpd-checklist-startups-2026), mesmo que a informação tenha sido "inventada" pelo modelo e não extraída de uma base real. Vale notar que isso é diferente de um ataque de [prompt injection](/artigo/prompt-injection-o-que-e-como-funciona-como-proteger), em que um terceiro manipula deliberadamente a saída do modelo: alucinação é um erro espontâneo do sistema, não uma exploração ativa — mas o dever de mitigação, na prática, é parecido: validar a saída antes de expor um dado sensível ao usuário final.
Alucinação fecha, por ora, a sequência de fundamentos que começou com "o que é um LLM" e passou por tokens, embeddings e RAG: entender por que o modelo erra é o que torna possível decidir quando confiar nele sem checagem e quando exigir uma camada humana ou automatizada de verificação antes de publicar, decidir ou responder um cliente com o que a IA disse.
Perguntas frequentes
Não, pelo menos não com a tecnologia atual. Técnicas como RAG, permitir "não sei" e verificação por citação reduzem bastante a frequência, mas nenhuma garante zero alucinação. Para decisões de alto risco, validação humana continua necessária.