RadarTrend
Inteligencia de tendencias
Escaneando tendencias...
Voltar ao Portal • tecnologia • 15 Sep. 2026 • 78 Views

HISPO: Hierarchical Importance-Sampling Policy Optimization with Entropy-Derived Segments

⚡ Score de Impacto: 85/100 Detectado há 3 semanas · Fonte: arxiv
HISPO: Hierarchical Importance-Sampling Policy Optimization with Entropy-Derived Segments

HISPO: a nova técnica que promete turbinar o raciocínio matemático das IAs

Pesquisadores acabam de apresentar uma nova abordagem de treinamento que pode mudar a forma como modelos de linguagem aprendem a resolver problemas matemáticos complexos. Batizada de HISPO (sigla em inglês para Otimização de Política com Amostragem de Importância Hierárquica), a técnica propõe uma correção intermediária no processo de aprendizado, entre duas estratégias já conhecidas no mercado. E os números preliminares são promissores.

Para entender a relevância disso, é preciso primeiro compreender o cenário atual. Nos últimos anos, o chamado aprendizado por reforço com recompensas verificáveis (RLVR, na sigla em inglês) se tornou o método padrão para ensinar modelos de linguagem a "pensar" melhor em matemática. A ideia é simples na essência: o sistema recebe uma recompensa quando acerta a resposta final de um problema, e vai ajustando seu comportamento com base nesse feedback.

Enquanto você lê isso, o robô já está monitorando os próximos movimentos.

Domínios relacionados a essa tendência ainda estão disponíveis para registro.

Criar conta grátis →

O problema, porém, aparece quando as respostas ficam longas. Uma solução matemática completa pode ter dezenas ou centenas de etapas, e nem todas contribuem da mesma forma para o acerto final. Alguns trechos são decisivos, outros são apenas passos intermediários triviais. A essa dificuldade os especialistas dão o nome de "problema de atribuição de crédito" — ou seja, definir quem merece o mérito (ou a culpa) quando o resultado final sai certo ou errado.

O que existe hoje no mercado

As abordagens atuais para lidar com essa questão se dividem, basicamente, em dois extremos:

  • Nível de token (GRPO e DAPO): a correção é aplicada palavra por palavra (ou pedaço por pedaço de texto). É como avaliar um time de futebol olhando jogada a jogada.
  • Nível de sequência (GSPO): a correção é aplicada ao texto inteiro de uma só vez. É como avaliar o time apenas pelo placar final da partida.

O problema é que nenhuma das duas abordagens captura bem a estrutura real de um raciocínio matemático. Avaliar palavra por palavra ignora o contexto maior; avaliar só o resultado final perde detalhes importantes pelo caminho.

RadarTrend detectou essa tendência antes de virar notícia

A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.

Criar conta grátis →

A proposta do HISPO

É exatamente nesse espaço intermediário que o HISPO atua. A técnica funciona em três etapas principais:

  • Segmentação automática: durante a geração da resposta, o modelo identifica trechos contíguos de texto com base na "entropia" — uma medida de incerteza que indica onde o modelo está mais hesitante ou

Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.

Baseado em dados coletados de: arxiv

Essa foi detectada antes de ser notícia

A próxima está sendo monitorada agora.

Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.