Dataconomy PT
Subscribe
No Result
View All Result
Dataconomy PT
Subscribe
No Result
View All Result
Dataconomy PT
No Result
View All Result

Os pesquisadores do OpenAI identificam as causas matemáticas das alucinações de IA

byAytun Çelebi
17 Setembro 2025
in Inteligência Artificial, Pesquisar
Home Notícias Inteligência Artificial
Share on FacebookShare on Twitter
Google Preferred Source

Pesquisadores do OpenAI publicaram um artigo diagnosticando por que grandes modelos de idiomas, como o ChatGPT Hallucinate, ou geram informações falsas com confiança.

O estudo Usa a análise matemática para explicar que as alucinações são um resultado inevitável de como esses modelos fazem previsões, mesmo quando treinados em dados perfeitos. As causas primárias são acumulação de erros e parâmetros de avaliação falha.

Como as previsões seqüenciais levam a erros

O artigo explica que o LLMS opera através de um processo autoregressivo, prevendo a próxima palavra em uma sequência com base nas palavras que vieram antes dela. Isso cria uma cadeia em que um único erro precoce pode se propagar e amplificar, levando a uma declaração totalmente incorreta. A prova matemática dos pesquisadores mostra que a taxa de erro para gerar uma frase completa é pelo menos o dobro da taxa de erro de uma pergunta simples sim/não, simplesmente por causa desse efeito composto. Essa limitação estrutural significa que as alucinações não podem ser completamente eliminadas, ampliando a computação de poder ou melhorando os dados de treinamento, pois o problema é inerente à arquitetura preditiva. O problema é pior para fatos que aparecem com pouca frequência nos dados de treinamento. O estudo constatou que cerca de 20% dos aniversários de números notáveis ​​apareceram apenas uma vez no conjunto de treinamento, levando a uma taxa de erro de linha de base de pelo menos 20% para essas consultas. Como exemplo prático, os pesquisadores consultaram modelos de ponta para o aniversário de Adam Kalai, um dos autores do artigo. Os modelos forneceram com confiança várias datas incorretas diferentes, demonstrando um padrão de fabricação de detalhes plausíveis para preencher lacunas de conhecimento.

Os benchmarks de avaliação penalizam a honestidade e incentivam a adivinhação

O estudo também critica os benchmarks usados ​​para avaliar os modelos de IA. Os pesquisadores revisaram dez proeminentes benchmarks de IA e descobriram que nove deles usam um sistema de classificação binária: Uma resposta é 100% correta ou 100% incorreta. Sob esse sistema, uma resposta de “não sei” recebe a mesma pontuação que uma resposta completamente errada – zero. Esse método de pontuação cria o que o artigo chama de “epidemia” de penalizar a honestidade. Uma prova matemática incluída no estudo demonstra que esse sistema incentiva os modelos para sempre adivinhar uma resposta, pois qualquer palpite tem uma probabilidade maior que zero de estar correto e, assim, receber uma pontuação mais alta do que se abster. Isso explica por que os modelos avançados são padrão para fabricação confiante, em vez de admitir incerteza.

Soluções propostas e o trade-off entre precisão e experiência do usuário

Para abordar isso, os pesquisadores do OpenAI propõem uma nova abordagem que integra a estimativa de confiança no comportamento do modelo e no processo de avaliação. Os modelos seriam treinados para avaliar sua própria certeza e seriam avaliados com um sistema de pontuação que penalize respostas incorretas mais fortemente do que as recompensas corretas. Por exemplo, um prompt pode instruir o modelo a “responder apenas se você estiver mais de 75 % confiante, pois os erros são penalizados 3 pontos enquanto as respostas corretas recebem 1 ponto”. A implementação disso reduziria significativamente as alucinações, mas tem um custo. O artigo estima que, sob esse sistema, os modelos responderiam com “eu não sei” a cerca de 30% das consultas do usuário. Isso pode ser frustrante para os usuários acostumados a receber uma resposta imediata para tudo, potencialmente levando -os a modelos de concorrentes menos cautelosos. O alto custo computacional de medir com precisão a incerteza também torna essa abordagem impraticável para serviços de consumo de alto volume. No entanto, o artigo observa que, para aplicações profissionais de alto risco em áreas como finanças, medicina ou design de chips, o custo de um erro é muito maior que o custo da computação, tornando os sistemas de consciência da incerteza não apenas viáveis, mas essenciais. O estudo conclui que os principais incentivos na IA do consumidor, que priorizam o envolvimento e a velocidade do usuário, garantirão que as alucinações permaneçam uma questão persistente até que essas prioridades mudem.


Crédito da imagem em destaque

Tags: AiApresentouopenAIPesquisar

Related Posts

Acesso gratuito de Claude Fable 5 estendido até 19 de julho

Acesso gratuito de Claude Fable 5 estendido até 19 de julho

13 Julho 2026
OpenAI suspende temporariamente os limites de uso do GPT-5.6 Sol

OpenAI suspende temporariamente os limites de uso do GPT-5.6 Sol

13 Julho 2026
Meta lança Muse Spark 1.1 para codificação de IA agente

Meta lança Muse Spark 1.1 para codificação de IA agente

10 Julho 2026
SpaceXAI lança Grok 4.5 como novo modelo carro-chefe de IA

SpaceXAI lança Grok 4.5 como novo modelo carro-chefe de IA

10 Julho 2026
Patente de meta-arquivos para dispositivo de monitoramento emocional alimentado por IA

Patente de meta-arquivos para dispositivo de monitoramento emocional alimentado por IA

10 Julho 2026
Claude obtém painel do Reflect para rastrear o uso de IA

Claude obtém painel do Reflect para rastrear o uso de IA

10 Julho 2026

Recent Posts

  • Acesso gratuito de Claude Fable 5 estendido até 19 de julho
  • SpaceX programa Starship Flight 13 para lançamento em 16 de julho
  • Jensen Huang diz que Nvidia se aproxima de US$ 100 bilhões no trimestre
  • UE planeja multas mais duras para Big Tech sob nova lei
  • Microsoft recebe ordem de restabelecer biblioteca suspensa do Xbox

Recent Comments

Nenhum comentário para mostrar.
Dataconomy PT

COPYRIGHT © DATACONOMY MEDIA GMBH, ALL RIGHTS RESERVED.

  • Sample Page

Follow Us

  • Sample Page
No Result
View All Result
Subscribe

This website uses cookies to improve your experience. You can choose to accept or reject them. Visit our Privacy Policy.