HISPO: Hierarchical Importance-Sampling Policy Optimization with Entropy-Derived Segments
HISPO: a nova técnica que promete turbinar o raciocínio matemático das IAs
Pesquisadores acabam de apresentar uma nova abordagem de treinamento que pode mudar a forma como modelos de linguagem aprendem a resolver problemas matemáticos complexos. Batizada de HISPO (sigla em inglês para Otimização de Política com Amostragem de Importância Hierárquica), a técnica propõe uma correção intermediária no processo de aprendizado, entre duas estratégias já conhecidas no mercado. E os números preliminares são promissores.
Para entender a relevância disso, é preciso primeiro compreender o cenário atual. Nos últimos anos, o chamado aprendizado por reforço com recompensas verificáveis (RLVR, na sigla em inglês) se tornou o método padrão para ensinar modelos de linguagem a "pensar" melhor em matemática. A ideia é simples na essência: o sistema recebe uma recompensa quando acerta a resposta final de um problema, e vai ajustando seu comportamento com base nesse feedback.
Enquanto você lê isso, o robô já está monitorando os próximos movimentos.
Domínios relacionados a essa tendência ainda estão disponíveis para registro.
Criar conta grátis →O problema, porém, aparece quando as respostas ficam longas. Uma solução matemática completa pode ter dezenas ou centenas de etapas, e nem todas contribuem da mesma forma para o acerto final. Alguns trechos são decisivos, outros são apenas passos intermediários triviais. A essa dificuldade os especialistas dão o nome de "problema de atribuição de crédito" — ou seja, definir quem merece o mérito (ou a culpa) quando o resultado final sai certo ou errado.
O que existe hoje no mercado
As abordagens atuais para lidar com essa questão se dividem, basicamente, em dois extremos:
- Nível de token (GRPO e DAPO): a correção é aplicada palavra por palavra (ou pedaço por pedaço de texto). É como avaliar um time de futebol olhando jogada a jogada.
- Nível de sequência (GSPO): a correção é aplicada ao texto inteiro de uma só vez. É como avaliar o time apenas pelo placar final da partida.
O problema é que nenhuma das duas abordagens captura bem a estrutura real de um raciocínio matemático. Avaliar palavra por palavra ignora o contexto maior; avaliar só o resultado final perde detalhes importantes pelo caminho.
RadarTrend detectou essa tendência antes de virar notícia
A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.
Criar conta grátis →A proposta do HISPO
É exatamente nesse espaço intermediário que o HISPO atua. A técnica funciona em três etapas principais:
- Segmentação automática: durante a geração da resposta, o modelo identifica trechos contíguos de texto com base na "entropia" — uma medida de incerteza que indica onde o modelo está mais hesitante ou
Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.
Baseado em dados coletados de: arxiv
Tendências relacionadas detectadas esta semana
Towards Automatically Pruning Logging Code with Coding Agents: How Far Are We?
há 15 horas Score 85/100Latent-Lagrangian Neural Networks for Reduced Order Modeling of Non-autonomous Nonlinear Dynamical Systems
há 15 horas Score 85/100ArtCraft Apps – open-source Adobe compatible suite written in Rust
há 1 diaTópicos Relacionados Detectados
Ver todos →Quase um bilhão de pessoas usam o ChatGPT semanalmente, diz presidente da OpenAI
tecnologia · há 5 meses
Como dois irmãos usaram IA para criar uma empresa de US$ 1,8 bilhão
tecnologia · há 5 meses
OpenAI releases GPT-5.5 and GPT-5.5 Pro in the API
tecnologia · há 5 meses
OpenAI models coming to Amazon Bedrock: Interview with OpenAI and AWS CEOs
tecnologia · há 5 meses
Essa foi detectada antes de ser notícia
A próxima está sendo monitorada agora.
Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.