RadarTrend
Inteligencia de tendencias
Escaneando tendencias...
Voltar ao Portal • tecnologia • 30 Jul. 2026 • 186 Views

InferScale: GPU-Native KV Injection for Personalized LLM Serving

⚡ Score de Impacto: 85/100 Detectado há 2 meses · Fonte: arxiv
InferScale: GPU-Native KV Injection for Personalized LLM Serving

InferScale: A Nova Tecnologia que Acelera Assistentes de IA com Memória Personalizada

Em um cenário onde assistentes virtuais e chatbots baseados em grandes modelos de linguagem (LLMs) se tornam cada vez mais comuns, um desafio persistente incomoda os desenvolvedores: como manter conversas longas ou perfis de memória do usuário sem sacrificar a velocidade de resposta. Sistemas como Mem0, MemGPT e Zep já são usados para armazenar e recuperar trechos relevantes do histórico de cada usuário, mas essa abordagem tem um custo oculto. Cada vez que uma nova pergunta é feita, o motor de inferência precisa reprocessar todo o contexto recuperado, aumentando o tempo de espera. É um gargalo que penaliza justamente aplicações que mais precisam de personalização, como assistentes de saúde, suporte ao cliente ou mentores educacionais.

Pesquisadores apresentaram agora uma solução que pode mudar esse jogo. O InferScale é um sistema de memória nativo para GPU que elimina a etapa repetitiva de pré-processamento de prompts ao injetar diretamente o estado reutilizável das conversas no cache do motor de inferência. Em testes com modelos abertos e o benchmark LoCoMo, a tecnologia reduziu o tempo até o primeiro token (TTFT) em até 79%, mantendo a qualidade das respostas quase intacta e aumentando a vazão em até 4,5 vezes sob carga concorrente. O trabalho promete desacoplar a latência do tamanho do contexto recuperado, uma virada de chave para empresas que dependem de LLMs com memória persistente.

O dilema das memórias compartilhadas em IA

Para entender a importância do InferScale, vale mergulhar no problema que ele resolve. Quando um usuário interage com um assistente de IA que lembra de suas preferências ou histórico, o sistema normalmente usa uma camada de memória externa. Essa camada recupera fatos relevantes – como "o cliente prefere respostas curtas" ou "ele perguntou sobre investimentos ontem" – e os insere no prompt antes de enviar ao modelo. A cada nova interação, porém, o motor de inferência precisa recalcular o contexto desses mesmos fatos, um processo chamado "prefilling".

Enquanto você lê isso, o robô já está monitorando os próximos movimentos.

Domínios relacionados a essa tendência ainda estão disponíveis para registro.

Criar conta grátis →

À medida que a quantidade de informações recuperadas aumenta – digamos, 50 fatos em vez de 5 –, o tempo de processamento dispara. O TTFT pode saltar de milissegundos para segundos, frustrando o usuário mesmo que a memória subjacente não tenha mudado. É um desperdício computacional que lembra os primórdios dos bancos de dados sem cache: a mesma consulta repetida resulta no mesmo trabalho pesado. Empresas que operam múltiplas sessões simultâneas sentem ainda mais esse impacto, com a vazão caindo vertiginosamente.

Como o InferScale reescreve as regras do cache de contexto

O InferScale ataca a raiz do problema ao tratar cada fato da memória como um bloco reutilizável de estado computacional, não como texto bruto. Em vez de injetar o prompt inteiro, ele pré-calculou o que os pesquisadores chamam de "estado KV" (chave-valor) de cada fato – as representações internas que o modelo usa para gerar texto. Esses estados são armazenados diretamente na GPU, junto com embeddings semânticos que permitem busca rápida por similaridade.

Quando uma nova requisição chega, o sistema recupera os fatos relevantes e injeta seus estados KV no cache paginado do vLLM – um popular motor de inferência de código aberto. O modelo então gera a resposta sem precisar reprocessar o contexto. Para viabilizar essa mágica, dois desafios técnicos foram superados.

Superando obstáculos com engenharia criativa

O primeiro desafio é lidar com as posições rotativas dos embeddings (RoPE), um mecanismo que dá ao modelo noção de ordem das palavras. Se cada fato for codificado isoladamente, sua posição numérica pode conflitar com a posição real durante a injeção. A solução veio com o Chunked RoPE: as chaves são armazenadas antes da rotação, e a posição correta só é aplicada no instante da inserção, garantindo que os pedaços de memória se encaixem sem contradições.

RadarTrend detectou essa tendência antes de virar notícia

A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.

Criar conta grátis →

O segundo obstáculo é a perda de contexto entre fatos. Quando codificados separadamente, eles perdem a nuance que teriam se processados juntos – como entender que "Maria está triste" se relaciona com "Ela cancelou a reunião". Para mitigar isso, o InferScale usa Context-Window Encoding: cada fato é codificado junto com uma janela pequena de conversas anteriores, mas apenas o estado KV do fato alvo é armazenado. Assim, o contexto inter-fatos é preservado sem custo adicional de armazenamento.

Implementação transparente e ganhos expressivos

Um dos pontos altos do InferScale é sua integração sem dor. A implementação usa a interface KV-connector do vLLM, o que significa que não exige modificação no motor de inferência nem ajuste fino (fine-tuning) dos modelos. Qualquer empresa que já use vLLM pode adotar a abordagem como um plugin, desde que disponha de GPU compatível.

Os números falam por si. Em testes com três modelos de código aberto (incluindo variantes do Llama e Mistral) no dataset LoCoMo, que simula conversas longas e contextualizadas, o InferScale manteve o TTFT praticamente constante mesmo com 50 fatos de memória. A redução chegou a 79% – de quase 4 segundos para cerca de 1 segundo –, uma diferença de 3,6 a 4,8 vezes. A acurácia, medida como a capacidade de responder corretamente, ficou em 60,3%, contra 63,3% do Mem0 tradicional, uma queda modesta considerando que o cálculo em tempo real foi totalmente evitado. Sob carga concorrente, a vazão

Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.

Baseado em dados coletados de: arxiv

Essa foi detectada antes de ser notícia

A próxima está sendo monitorada agora.

Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.