ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation
NVIDIA Revela ARDY: IA que Gera Movimentos Humanos em Tempo Real com Controle por Texto
A busca por movimentos tridimensionais realistas, gerados em tempo real, é um dos maiores desafios para áreas como animação digital, simulações e robótica humanóide. Até agora, as técnicas existentes enfrentavam um dilema: ou geravam movimentos de altíssima qualidade, mas levavam minutos para processar (métodos offline), ou eram rápidas o suficiente para jogos e interações, mas sacrificavam o controle fino e a capacidade de entender comandos complexos. A NVIDIA Research acaba de anunciar uma solução que promete quebrar essa barreira: o ARDY.
Apresentado como um modelo de streaming de última geração, o ARDY (sigla em inglês para Difusão Autoregressiva com Representação Híbrida) permite gerar movimentos humanos realistas em tempo real, controlados por prompts de texto e restrições cinemáticas (como posição de mãos, pés ou trajetória). O sistema foi desenvolvido para funcionar em aplicações interativas, como videogames, realidade virtual e simulações de robôs, sem a latência que afeta outros modelos.
A Arquitetura Inovadora: Representação Híbrida e Denoising Autoregressivo
O segredo do ARDY está em sua arquitetura de dois estágios. Primeiro, ele utiliza uma representação híbrida que combina características explícitas da raiz do personagem (a base do movimento, como a posição pélvica) com um embedding latente do corpo (uma codificação comprimida de todas as articulações). Isso permite um controle preciso da trajetória e dos pés no chão, sem perder a eficiência computacional.
Em seguida, o modelo opera um processo de denoising autoregressivo (remoção gradual de ruído) em duas etapas. Ele utiliza um transformer que, diferentemente dos modelos tradicionais, mantém um contexto de histórico variável. Isso significa que o sistema pode "lembrar" de instruções dadas há vários segundos (como "corra e depois pare") e ajustar o movimento de forma suave, algo que os concorrentes falham ao fazer devido a janelas de contexto limitadas.
Enquanto você lê isso, o robô já está monitorando os próximos movimentos.
Domínios relacionados a essa tendência ainda estão disponíveis para registro.
Criar conta grátis →- Controle por Texto em Tempo Real: O usuário pode digitar comandos como "acene a mão direita enquanto caminha em círculo" e o personagem responde na hora.
- Restrições Cinemáticas Flexíveis: Suporta a definição de poses-chave (keyframes), trajetórias de caminho e até controle por mouse e teclado para locomoção interativa.
- Treinamento em Escala: O modelo foi treinado no dataset HumanML3D (referência acadêmica) e no massivo Bones Rigplay, garantindo movimentos realistas e variados.
- Geração Autocontrolada: Diferente de modelos que exigem pós-processamento, o ARDY aprende nativamente a respeitar restrições espaciais e temporais, como "não atravesse a parede" ou "mantenha o pé no chão por 0,5 segundos".
Resultados e Aplicações Práticas
Os testes realizados pela equipe da NVIDIA mostram que o ARDY supera os métodos offline em termos de velocidade de inferência, mantendo qualidade comparável. Em avaliações no benchmark HumanML3D, o modelo atingiu altas pontuações de fidelidade de movimento e aderência às restrições.
A praticidade foi demonstrada em um demo interativo onde o usuário pode controlar um personagem com comandos de texto dinâmicos, restrições de pose-chave (como definir uma posição de "dança" para um frame específico), seguir caminhos pré-definidos e até usar o mouse para locomover o avatar em tempo real. Para a indústria, isso abre portas para:
- Animação de Jogos: Criar movimentos de NPCs (personagens não jogáveis) sob demanda, sem animações pré-gravadas.
- Simulação Robótica: Treinar robôs humanóides com movimentos gerados em tempo real para tarefas de navegação e manipulação.
- Realidade Virtual: Gerar avatares que reagem a comandos de voz do usuário em metaversos.
- Produção de Filmes: Agilizar o processo de animação com direção por texto em tempo real.
O Cenário e os Próximos Passos
O ARDY chega em um momento crucial para a computação gráfica. Enquanto modelos como o MDM e o MotionDiffuse já provaram a viabilidade da geração de movimentos por difusão, eles eram lentos demais para interação. Por outro lado, abordagens online como o GMD (Graph Motion Diffusion) falhavam com comandos complexos de longo prazo.
RadarTrend detectou essa tendência antes de virar notícia
A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.
Criar conta grátis →A abordagem da NVIDIA resolve esse dilema: o modelo é treinado diretamente em pares de texto e movimento, com restrições cinemáticas amostradas das poses verdadeiras (ground truth), o que força o sistema a aprender a controlar o movimento de forma causal, prevendo o próximo frame com base no histórico e nos comandos.
Os pesquisadores disponibilizarão o código-fonte e os modelos pré-treinados no site do projeto, o que deve acelerar a adoção por startups de animação e laboratórios de robótica. O repositório oficial está em https://research.nvidia.com/labs/sil/projects/ardy/, com vídeos suplementares e detalhes técnicos.
Para empreendedores e desenvolvedores brasileiros, o ARDY representa uma ferramenta poderosa para reduzir custos com animação manual e elevar o realismo de produtos digitais. A capacidade de controlar movimentos por texto simples e em tempo real pode ser o diferencial competitivo que faltava para aplicações de treinamento corporativo em VR ou para jogos mobile de alto padrão.
Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.
Baseado em dados coletados de: arxiv
Tendências relacionadas detectadas esta semana
Towards Automatically Pruning Logging Code with Coding Agents: How Far Are We?
há 16 horas Score 85/100Latent-Lagrangian Neural Networks for Reduced Order Modeling of Non-autonomous Nonlinear Dynamical Systems
há 16 horas Score 85/100ArtCraft Apps – open-source Adobe compatible suite written in Rust
há 1 diaTópicos Relacionados Detectados
Ver todos →Quase um bilhão de pessoas usam o ChatGPT semanalmente, diz presidente da OpenAI
tecnologia · há 5 meses
Como dois irmãos usaram IA para criar uma empresa de US$ 1,8 bilhão
tecnologia · há 5 meses
OpenAI releases GPT-5.5 and GPT-5.5 Pro in the API
tecnologia · há 5 meses
OpenAI models coming to Amazon Bedrock: Interview with OpenAI and AWS CEOs
tecnologia · há 5 meses
Essa foi detectada antes de ser notícia
A próxima está sendo monitorada agora.
Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.