InferScale: GPU-Native KV Injection for Personalized LLM Serving
InferScale: A Nova Tecnologia que Acelera Assistentes de IA com Memória Personalizada
Em um cenário onde assistentes virtuais e chatbots baseados em grandes modelos de linguagem (LLMs) se tornam cada vez mais comuns, um desafio persistente incomoda os desenvolvedores: como manter conversas longas ou perfis de memória do usuário sem sacrificar a velocidade de resposta. Sistemas como Mem0, MemGPT e Zep já são usados para armazenar e recuperar trechos relevantes do histórico de cada usuário, mas essa abordagem tem um custo oculto. Cada vez que uma nova pergunta é feita, o motor de inferência precisa reprocessar todo o contexto recuperado, aumentando o tempo de espera. É um gargalo que penaliza justamente aplicações que mais precisam de personalização, como assistentes de saúde, suporte ao cliente ou mentores educacionais.
Pesquisadores apresentaram agora uma solução que pode mudar esse jogo. O InferScale é um sistema de memória nativo para GPU que elimina a etapa repetitiva de pré-processamento de prompts ao injetar diretamente o estado reutilizável das conversas no cache do motor de inferência. Em testes com modelos abertos e o benchmark LoCoMo, a tecnologia reduziu o tempo até o primeiro token (TTFT) em até 79%, mantendo a qualidade das respostas quase intacta e aumentando a vazão em até 4,5 vezes sob carga concorrente. O trabalho promete desacoplar a latência do tamanho do contexto recuperado, uma virada de chave para empresas que dependem de LLMs com memória persistente.
O dilema das memórias compartilhadas em IA
Para entender a importância do InferScale, vale mergulhar no problema que ele resolve. Quando um usuário interage com um assistente de IA que lembra de suas preferências ou histórico, o sistema normalmente usa uma camada de memória externa. Essa camada recupera fatos relevantes – como "o cliente prefere respostas curtas" ou "ele perguntou sobre investimentos ontem" – e os insere no prompt antes de enviar ao modelo. A cada nova interação, porém, o motor de inferência precisa recalcular o contexto desses mesmos fatos, um processo chamado "prefilling".
Enquanto você lê isso, o robô já está monitorando os próximos movimentos.
Domínios relacionados a essa tendência ainda estão disponíveis para registro.
Criar conta grátis →À medida que a quantidade de informações recuperadas aumenta – digamos, 50 fatos em vez de 5 –, o tempo de processamento dispara. O TTFT pode saltar de milissegundos para segundos, frustrando o usuário mesmo que a memória subjacente não tenha mudado. É um desperdício computacional que lembra os primórdios dos bancos de dados sem cache: a mesma consulta repetida resulta no mesmo trabalho pesado. Empresas que operam múltiplas sessões simultâneas sentem ainda mais esse impacto, com a vazão caindo vertiginosamente.
Como o InferScale reescreve as regras do cache de contexto
O InferScale ataca a raiz do problema ao tratar cada fato da memória como um bloco reutilizável de estado computacional, não como texto bruto. Em vez de injetar o prompt inteiro, ele pré-calculou o que os pesquisadores chamam de "estado KV" (chave-valor) de cada fato – as representações internas que o modelo usa para gerar texto. Esses estados são armazenados diretamente na GPU, junto com embeddings semânticos que permitem busca rápida por similaridade.
Quando uma nova requisição chega, o sistema recupera os fatos relevantes e injeta seus estados KV no cache paginado do vLLM – um popular motor de inferência de código aberto. O modelo então gera a resposta sem precisar reprocessar o contexto. Para viabilizar essa mágica, dois desafios técnicos foram superados.
Superando obstáculos com engenharia criativa
O primeiro desafio é lidar com as posições rotativas dos embeddings (RoPE), um mecanismo que dá ao modelo noção de ordem das palavras. Se cada fato for codificado isoladamente, sua posição numérica pode conflitar com a posição real durante a injeção. A solução veio com o Chunked RoPE: as chaves são armazenadas antes da rotação, e a posição correta só é aplicada no instante da inserção, garantindo que os pedaços de memória se encaixem sem contradições.
RadarTrend detectou essa tendência antes de virar notícia
A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.
Criar conta grátis →O segundo obstáculo é a perda de contexto entre fatos. Quando codificados separadamente, eles perdem a nuance que teriam se processados juntos – como entender que "Maria está triste" se relaciona com "Ela cancelou a reunião". Para mitigar isso, o InferScale usa Context-Window Encoding: cada fato é codificado junto com uma janela pequena de conversas anteriores, mas apenas o estado KV do fato alvo é armazenado. Assim, o contexto inter-fatos é preservado sem custo adicional de armazenamento.
Implementação transparente e ganhos expressivos
Um dos pontos altos do InferScale é sua integração sem dor. A implementação usa a interface KV-connector do vLLM, o que significa que não exige modificação no motor de inferência nem ajuste fino (fine-tuning) dos modelos. Qualquer empresa que já use vLLM pode adotar a abordagem como um plugin, desde que disponha de GPU compatível.
Os números falam por si. Em testes com três modelos de código aberto (incluindo variantes do Llama e Mistral) no dataset LoCoMo, que simula conversas longas e contextualizadas, o InferScale manteve o TTFT praticamente constante mesmo com 50 fatos de memória. A redução chegou a 79% – de quase 4 segundos para cerca de 1 segundo –, uma diferença de 3,6 a 4,8 vezes. A acurácia, medida como a capacidade de responder corretamente, ficou em 60,3%, contra 63,3% do Mem0 tradicional, uma queda modesta considerando que o cálculo em tempo real foi totalmente evitado. Sob carga concorrente, a vazão
Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.
Baseado em dados coletados de: arxiv
Tendências relacionadas detectadas esta semana
Towards Automatically Pruning Logging Code with Coding Agents: How Far Are We?
há 15 horas Score 85/100Latent-Lagrangian Neural Networks for Reduced Order Modeling of Non-autonomous Nonlinear Dynamical Systems
há 15 horas Score 85/100ArtCraft Apps – open-source Adobe compatible suite written in Rust
há 1 diaTópicos Relacionados Detectados
Ver todos →Quase um bilhão de pessoas usam o ChatGPT semanalmente, diz presidente da OpenAI
tecnologia · há 5 meses
Como dois irmãos usaram IA para criar uma empresa de US$ 1,8 bilhão
tecnologia · há 5 meses
OpenAI releases GPT-5.5 and GPT-5.5 Pro in the API
tecnologia · há 5 meses
OpenAI models coming to Amazon Bedrock: Interview with OpenAI and AWS CEOs
tecnologia · há 5 meses
Essa foi detectada antes de ser notícia
A próxima está sendo monitorada agora.
Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.