RadarTrend
Inteligencia de tendencias
Escaneando tendencias...
Voltar ao Portal • tecnologia • 28 Sep. 2026 • 93 Views

Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency

⚡ Score de Impacto: 85/100 Detectado há 1 semana · Fonte: arxiv
Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency

Modelos de IA que "pensam demais": pesquisa revela como reduzir custos sem perder precisão

Se você já usou ferramentas de inteligência artificial como ChatGPT, Gemini ou Claude para resolver problemas complexos de matemática ou programação, provavelmente notou que elas podem levar bastante tempo "pensando" antes de dar a resposta final. Esse processo, conhecido no jargão técnico como "cadeia de raciocínio" (chain of thought), é o que permite que esses modelos cheguem a conclusões mais precisas — mas tem um custo: cada token gerado consome poder computacional, e isso se traduz diretamente em dinheiro no bolso de quem opera esses sistemas em escala.

Uma nova pesquisa, porém, aponta para uma solução surpreendentemente elegante para esse problema. Em vez de forçar o modelo a "pensar menos" por meio de regras explícitas, os pesquisadores descobriram que basta ensiná-lo a reconhecer quando já sabe a resposta. É como se, em vez de dizer ao funcionário "seja mais breve", você o treinasse para perceber sozinho quando já tem convicção suficiente para decidir.

Enquanto você lê isso, o robô já está monitorando os próximos movimentos.

Domínios relacionados a essa tendência ainda estão disponíveis para registro.

Criar conta grátis →

O problema dos modelos que "pensam demais"

Modelos de raciocínio modernos são projetados para explorar múltiplos caminhos antes de cravar uma resposta. Isso é ótimo para a qualidade, mas péssimo para a eficiência. Em benchmarks de matemática, ciência e programação, essas IAs podem gerar milhares de tokens em uma única resposta — muitos deles redundantes ou simplesmente repetitivos.

Até agora, as abordagens para lidar com isso seguiam dois caminhos principais:

  • Interromper em tempo real: mecanismos que detectam quando o modelo está "enrolando" e cortam a geração antes do final.
  • Penalizar o tamanho no treinamento: usar aprendizado por reforço para punir respostas longas e premiar as curtas.

O problema é que ambos os métodos podem sacrificar qualidade. Ao cortar ou penalizar, o modelo pode perder passos importantes do raciocínio.

RadarTrend detectou essa tendência antes de virar notícia

A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.

Criar conta grátis →

A descoberta: confiança como bússola interna

A nova pesquisa propõe algo diferente. Em vez de ensinar o modelo a ser mais curto, os cientistas o treinaram para prever sua própria confiança na resposta ao longo do caminho. E aqui está o detalhe curioso: essa confiança foi usada apenas durante o treinamento. Na hora de responder de verdade, o modelo segue o procedimento normal, sem nenhum mecanismo especial de parada ou "detecção de confiança".

O resultado? Mesmo sem nenhum incentivo explícito para encurtar o raciocínio, os modelos passaram a

Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.

Baseado em dados coletados de: arxiv

Essa foi detectada antes de ser notícia

A próxima está sendo monitorada agora.

Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.