RadarTrend
Inteligencia de tendencias
Escaneando tendencias...
Voltar ao Portal • tecnologia • 29 May. 2026 • 179 Views

Unlocking the Working Memory of Large Language Models for Latent Reasoning

⚡ Score de Impacto: 85/100 Detectado há 4 meses · Fonte: arxiv
Unlocking the Working Memory of Large Language Models for Latent Reasoning

O Fim das Cadeias de Raciocínio? Novo Método Imita a "Memória de Trabalho" Humana em IAs

Empresários e gestores que acompanham o mercado de inteligência artificial sabem que um dos maiores gargalos atuais é o custo computacional. Modelos de linguagem de grande escala (LLMs), como o GPT-4 e o Gemini, são incrivelmente poderosos, mas seu processo de raciocínio é, digamos, barulhento. Para chegar a uma resposta, eles geram uma longa sequência de "pensamentos" intermediários — uma cadeia de raciocínio —, o que consome tempo e poder de processamento.

Uma nova abordagem promete revolucionar esse processo. Batizada de RiM (Reasoning in Memory, ou Raciocínio na Memória), a técnica busca eliminar essa etapa ruidosa, substituindo a geração automática de passos de raciocínio por "blocos de memória" fixos. A inspiração? Nada menos que o funcionamento do cérebro humano.

O Problema do "Pensamento em Voz Alta"

Atualmente, a maioria dos LLMs raciocina de forma semelhante a uma pessoa que resolve um problema falando cada passo em voz alta. No mundo da tecnologia, isso é chamado de raciocínio autoregressivo. O modelo "pensa" gerando tokens (palavras ou fragmentos de palavras) que representam cada etapa do cálculo, até chegar à conclusão final.

Esse método tem uma consequência direta para os negócios: o custo. Cada token gerado exige processamento. Quanto mais complexo o raciocínio, mais tokens são necessários, mais tempo a GPU (unidade de processamento gráfico) fica ocupada e maior é a conta na nuvem. Além disso, a IA acaba "confundindo" o processo interno de pensamento com a necessidade de comunicar externamente cada passo, o que nem sempre é eficiente.

Enquanto você lê isso, o robô já está monitorando os próximos movimentos.

Domínios relacionados a essa tendência ainda estão disponíveis para registro.

Criar conta grátis →

A Solução RiM: Pensar em "Silêncio"

O RiM propõe um caminho diametralmente oposto: o pensamento interno sem externalização. Em vez de gerar passos de raciocínio, o modelo utiliza blocos de memória. Esses blocos são sequências fixas de tokens especiais que funcionam como uma "memória de trabalho" interna.

  • Como funciona na prática: Em vez de escrever "2+2=4, 4+1=5", o modelo simplesmente processa um bloco de memória, realiza a operação internamente e entrega o resultado final "5".
  • Eficiência computacional: Como os blocos de memória são fixos (não são gerados palavra por palavra), eles podem ser processados em uma única passagem pela rede neural. Isso reduz drasticamente o tempo de inferência e o custo por chamada de API.
  • Simulação da cognição humana: O método é inspirado na capacidade humana de usar a memória de trabalho para manter e manipular informações internamente, sem a necessidade de verbalizar cada micromovimento lógico.

Como Ensinar a IA a Usar a "Memória de Trabalho"?

A implementação do RiM não é trivial. Os pesquisadores desenvolveram um currículo de treinamento em duas etapas para que o modelo aprenda a usar esses blocos de memória de forma eficaz:

  1. Fase 1 – Dependência de Muletas: Inicialmente, o modelo é treinado para prever passos de raciocínio explícitos após cada bloco de memória. É como ensinar uma criança a somar pedindo que ela escreva cada passo no papel. Isso ancora o significado do bloco de memória a uma ação concreta.
  2. Fase 2 – Raciocínio Latente: A supervisão passo a passo é descartada. O modelo é então treinado para refinar a resposta final após cada bloco de memória, sem mais "escrever no papel". Ele é forçado a internalizar o raciocínio.

Essa progressão é fundamental. Ela permite que o modelo aprenda a representar operações lógicas complexas dentro do espaço vetorial dos blocos fixos, sem a necessidade de uma saída textual explícita para cada etapa.

RadarTrend detectou essa tendência antes de virar notícia

A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.

Criar conta grátis →

Resultados e Implicações para o Mercado

Os testes realizados em benchmarks de raciocínio (como matemática e lógica) mostraram que o RiM consegue igualar ou superar os métodos de raciocínio latente existentes, mas com uma vantagem crucial: elimina a geração autoregressiva de pensamentos intermediários.

Para o empresário brasileiro, isso se traduz em duas oportunidades imediatas:

  • Redução de Custos Operacionais: Aplicações que exigem raciocínio complexo (análise de contratos, planejamento tributário, modelagem financeira) podem se tornar significativamente mais baratas para rodar em produção. Menos tokens gerados = menos consumo de GPU.
  • Menor Latência: Em chatbots e assistentes virtuais, a eliminação do "pensamento em voz alta" pode reduzir o tempo de resposta para perguntas complexas de segundos para milissegundos, melhorando drasticamente a experiência do usuário.
  • Maior Escalabilidade: Com um processamento mais eficiente, o mesmo hardware consegue atender a um volume muito maior de requisições simultâneas, um fator crítico para SaaS e plataformas digitais.

O RiM ainda é uma técnica experimental, mas aponta para um futuro onde a inteligência artificial não precisará mais "falar enquanto pensa". Para o ecossistema de tecnologia e inovação no Brasil, isso representa um avanço significativo na direção de modelos mais enxutos, rápidos e, acima de tudo, mais acessíveis para a transformação digital de empresas de todos os portes.

Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.

Baseado em dados coletados de: arxiv

Essa foi detectada antes de ser notícia

A próxima está sendo monitorada agora.

Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.