RadarTrend
Inteligencia de tendencias
Escaneando tendencias...
Voltar ao Portal • tecnologia • 21 Sep. 2026 • 44 Views

RheoSampling: Resolving the One-Hot Dilemma in Stochastic Dynamic-Tree Speculative Decoding

⚡ Score de Impacto: 85/100 Detectado há 2 semanas · Fonte: arxiv
RheoSampling: Resolving the One-Hot Dilemma in Stochastic Dynamic-Tree Speculative Decoding

RheoSampling: a nova técnica que resolve o dilema do "one-hot" na decodificação especulativa de LLMs

Pesquisadores acabam de apresentar uma solução engenhosa para um dos gargalos mais incômodos da inferência de grandes modelos de linguagem (LLMs, na sigla em inglês): o conflito entre a construção de árvores de rascunho contextuais e a manutenção da aleatoriedade necessária para respostas criativas. A técnica, batizada de RheoSampling, promete acelerar a geração de texto sem sacrificar a qualidade probabilística que caracteriza os modelos modernos.

Para entender a relevância disso, é preciso voltar um passo. A decodificação especulativa é uma estratégia que vem ganhando tração na indústria para tornar os LLMs mais rápidos. Em vez de gerar um token por vez — o que consome tempo e poder computacional —, o modelo cria vários "rascunhos" de tokens em paralelo e depois verifica quais deles são aceitáveis. Métodos baseados em árvores, como o EAGLE-3, vão além: organizam esses rascunhos em estruturas hierárquicas que imitam o contexto da conversa, melhorando a eficiência.

Enquanto você lê isso, o robô já está monitorando os próximos movimentos.

Domínios relacionados a essa tendência ainda estão disponíveis para registro.

Criar conta grátis →

O problema do "one-hot" na decodificação estocástica

O que poucos percebem é que essa abordagem funciona muito bem apenas em um cenário específico: a chamada decodificação gananciosa (greedy decoding), em que o modelo sempre escolhe o token mais provável. Nesse modo, a expansão top-K determinística e a poda global das árvores mantêm a coerência.

Porém, quando o usuário quer respostas mais variadas — a chamada decodificação estocástica (com temperatura T>0) —, o mecanismo quebra. A distribuição de rascunho colapsa em probabilidades "one-hot", ou seja, um único token concentra toda a chance, como se a aleatoriedade simplesmente desaparecesse. O resultado é uma queda drástica na taxa de aceitação dos tokens especulados, tornando o método lento e ineficaz.

RadarTrend detectou essa tendência antes de virar notícia

A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.

Criar conta grátis →

Isso cria um dilema cruel: métodos de árvore dinâmica, como o EAGLE-3, sacrificam a amostragem estocástica para preservar a topologia sensível ao contexto. Já os métodos de árvore estática preservam a aleatoriedade, mas com estruturas que ignoram o contexto. Nenhum dos dois entrega o melhor dos dois mundos.

A causa raiz: uma distribuição, dois papéis conflitantes

A raiz do problema está no acoplamento de funções. A mesma distribuição de probabilidades é usada para

Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.

Baseado em dados coletados de: arxiv

Essa foi detectada antes de ser notícia

A próxima está sendo monitorada agora.

Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.