Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency
Modelos de IA que "pensam demais": pesquisa revela como reduzir custos sem perder precisão
Se você já usou ferramentas de inteligência artificial como ChatGPT, Gemini ou Claude para resolver problemas complexos de matemática ou programação, provavelmente notou que elas podem levar bastante tempo "pensando" antes de dar a resposta final. Esse processo, conhecido no jargão técnico como "cadeia de raciocínio" (chain of thought), é o que permite que esses modelos cheguem a conclusões mais precisas — mas tem um custo: cada token gerado consome poder computacional, e isso se traduz diretamente em dinheiro no bolso de quem opera esses sistemas em escala.
Uma nova pesquisa, porém, aponta para uma solução surpreendentemente elegante para esse problema. Em vez de forçar o modelo a "pensar menos" por meio de regras explícitas, os pesquisadores descobriram que basta ensiná-lo a reconhecer quando já sabe a resposta. É como se, em vez de dizer ao funcionário "seja mais breve", você o treinasse para perceber sozinho quando já tem convicção suficiente para decidir.
Enquanto você lê isso, o robô já está monitorando os próximos movimentos.
Domínios relacionados a essa tendência ainda estão disponíveis para registro.
Criar conta grátis →O problema dos modelos que "pensam demais"
Modelos de raciocínio modernos são projetados para explorar múltiplos caminhos antes de cravar uma resposta. Isso é ótimo para a qualidade, mas péssimo para a eficiência. Em benchmarks de matemática, ciência e programação, essas IAs podem gerar milhares de tokens em uma única resposta — muitos deles redundantes ou simplesmente repetitivos.
Até agora, as abordagens para lidar com isso seguiam dois caminhos principais:
- Interromper em tempo real: mecanismos que detectam quando o modelo está "enrolando" e cortam a geração antes do final.
- Penalizar o tamanho no treinamento: usar aprendizado por reforço para punir respostas longas e premiar as curtas.
O problema é que ambos os métodos podem sacrificar qualidade. Ao cortar ou penalizar, o modelo pode perder passos importantes do raciocínio.
RadarTrend detectou essa tendência antes de virar notícia
A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.
Criar conta grátis →A descoberta: confiança como bússola interna
A nova pesquisa propõe algo diferente. Em vez de ensinar o modelo a ser mais curto, os cientistas o treinaram para prever sua própria confiança na resposta ao longo do caminho. E aqui está o detalhe curioso: essa confiança foi usada apenas durante o treinamento. Na hora de responder de verdade, o modelo segue o procedimento normal, sem nenhum mecanismo especial de parada ou "detecção de confiança".
O resultado? Mesmo sem nenhum incentivo explícito para encurtar o raciocínio, os modelos passaram a
Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.
Baseado em dados coletados de: arxiv
Tendências relacionadas detectadas esta semana
Towards Automatically Pruning Logging Code with Coding Agents: How Far Are We?
há 15 horas Score 85/100Latent-Lagrangian Neural Networks for Reduced Order Modeling of Non-autonomous Nonlinear Dynamical Systems
há 15 horas Score 85/100ArtCraft Apps – open-source Adobe compatible suite written in Rust
há 1 diaTópicos Relacionados Detectados
Ver todos →Quase um bilhão de pessoas usam o ChatGPT semanalmente, diz presidente da OpenAI
tecnologia · há 5 meses
Como dois irmãos usaram IA para criar uma empresa de US$ 1,8 bilhão
tecnologia · há 5 meses
OpenAI releases GPT-5.5 and GPT-5.5 Pro in the API
tecnologia · há 5 meses
OpenAI models coming to Amazon Bedrock: Interview with OpenAI and AWS CEOs
tecnologia · há 5 meses
Essa foi detectada antes de ser notícia
A próxima está sendo monitorada agora.
Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.