RheoSampling: Resolving the One-Hot Dilemma in Stochastic Dynamic-Tree Speculative Decoding
RheoSampling: a nova técnica que resolve o dilema do "one-hot" na decodificação especulativa de LLMs
Pesquisadores acabam de apresentar uma solução engenhosa para um dos gargalos mais incômodos da inferência de grandes modelos de linguagem (LLMs, na sigla em inglês): o conflito entre a construção de árvores de rascunho contextuais e a manutenção da aleatoriedade necessária para respostas criativas. A técnica, batizada de RheoSampling, promete acelerar a geração de texto sem sacrificar a qualidade probabilística que caracteriza os modelos modernos.
Para entender a relevância disso, é preciso voltar um passo. A decodificação especulativa é uma estratégia que vem ganhando tração na indústria para tornar os LLMs mais rápidos. Em vez de gerar um token por vez — o que consome tempo e poder computacional —, o modelo cria vários "rascunhos" de tokens em paralelo e depois verifica quais deles são aceitáveis. Métodos baseados em árvores, como o EAGLE-3, vão além: organizam esses rascunhos em estruturas hierárquicas que imitam o contexto da conversa, melhorando a eficiência.
Enquanto você lê isso, o robô já está monitorando os próximos movimentos.
Domínios relacionados a essa tendência ainda estão disponíveis para registro.
Criar conta grátis →O problema do "one-hot" na decodificação estocástica
O que poucos percebem é que essa abordagem funciona muito bem apenas em um cenário específico: a chamada decodificação gananciosa (greedy decoding), em que o modelo sempre escolhe o token mais provável. Nesse modo, a expansão top-K determinística e a poda global das árvores mantêm a coerência.
Porém, quando o usuário quer respostas mais variadas — a chamada decodificação estocástica (com temperatura T>0) —, o mecanismo quebra. A distribuição de rascunho colapsa em probabilidades "one-hot", ou seja, um único token concentra toda a chance, como se a aleatoriedade simplesmente desaparecesse. O resultado é uma queda drástica na taxa de aceitação dos tokens especulados, tornando o método lento e ineficaz.
RadarTrend detectou essa tendência antes de virar notícia
A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.
Criar conta grátis →Isso cria um dilema cruel: métodos de árvore dinâmica, como o EAGLE-3, sacrificam a amostragem estocástica para preservar a topologia sensível ao contexto. Já os métodos de árvore estática preservam a aleatoriedade, mas com estruturas que ignoram o contexto. Nenhum dos dois entrega o melhor dos dois mundos.
A causa raiz: uma distribuição, dois papéis conflitantes
A raiz do problema está no acoplamento de funções. A mesma distribuição de probabilidades é usada para
Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.
Baseado em dados coletados de: arxiv
Tendências relacionadas detectadas esta semana
Towards Automatically Pruning Logging Code with Coding Agents: How Far Are We?
há 15 horas Score 85/100Latent-Lagrangian Neural Networks for Reduced Order Modeling of Non-autonomous Nonlinear Dynamical Systems
há 15 horas Score 85/100ArtCraft Apps – open-source Adobe compatible suite written in Rust
há 1 diaTópicos Relacionados Detectados
Ver todos →Quase um bilhão de pessoas usam o ChatGPT semanalmente, diz presidente da OpenAI
tecnologia · há 5 meses
Como dois irmãos usaram IA para criar uma empresa de US$ 1,8 bilhão
tecnologia · há 5 meses
OpenAI releases GPT-5.5 and GPT-5.5 Pro in the API
tecnologia · há 5 meses
OpenAI models coming to Amazon Bedrock: Interview with OpenAI and AWS CEOs
tecnologia · há 5 meses
Essa foi detectada antes de ser notícia
A próxima está sendo monitorada agora.
Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.