PhysStream: Streaming Physics-Grounded Video Generation with Structured Scene Memory and Fine-Grained Motion Control
PhysStream: a nova geração de vídeos gerados por IA que respeita as leis da física
Se você acompanha o universo da inteligência artificial, já deve ter visto vídeos gerados por modelos como Sora, Runway ou Kling. São resultados impressionantes, mas há um problema que qualquer empresário do setor audiovisual conhece bem: a física desses vídeos costuma ser uma bagunça. Copos que flutuam, bolas que atravessam mesas, objetos que mudam de direção sem explicação. É exatamente essa lacuna que um novo estudo propõe fechar.
Pesquisadores apresentaram o PhysStream, um modelo autorregressivo de geração de vídeo a partir de imagens que coloca a física — e não apenas a aparência — no centro do processo. Em vez de descrever o que deve aparecer na tela com um texto genérico, o usuário pode controlar diretamente o comportamento físico dos objetos, como se estivesse "empurrando" elementos de uma cena em tempo real.
Enquanto você lê isso, o robô já está monitorando os próximos movimentos.
Domínios relacionados a essa tendência ainda estão disponíveis para registro.
Criar conta grátis →O problema das ferramentas atuais
Os métodos de controle de vídeo disponíveis hoje enfrentam duas limitações sérias. A primeira: quase todos exigem que você defina todo o roteiro de controle antes de começar a geração. Ou seja, não dá para ajustar no meio do caminho. A segunda: os sinais de controle são baseados em pixels, ou seja, dizem apenas "onde o objeto deve estar", mas não "como ele deve se comportar fisicamente". Isso significa que o modelo não aprende as forças por trás do movimento — apenas copia posições.
É como dirigir um carro olhando apenas para o retrovisor: você sabe onde esteve, mas não entende por que o veículo se move daquela forma.
Como o PhysStream resolve isso
O diferencial do PhysStream está em dois pilares técnicos:
- Memória estruturada da cena: o modelo mantém mapas de posição e rastreamento dos objetos, gerados automaticamente a partir dos quadros anteriores. Isso dá ao sistema uma noção de continuidade — ele "lembra" onde cada objeto estava e como se movia.
- Sinais esparsos de incremento de velocidade: em vez de forçar posições, o usuário informa pequenas variações de velocidade que representam grandezas físicas reais. Assim, o modelo aprende a dinâmica subjacente — inércia, aceleração, colisões — e não apenas a replicar coordenadas.
O treinamento acontece em duas etapas. Primeiro, um modelo bidirecional é ajustado com condicionamento de controle de movimento. Depois, um modelo autorregressivo causal é treinado com a memória estruturada adicional, o que melhora a consistência física quadro a quadro.
RadarTrend detectou essa tendência antes de virar notícia
A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.
Criar conta grátis →Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.
Baseado em dados coletados de: arxiv
Tendências relacionadas detectadas esta semana
Towards Automatically Pruning Logging Code with Coding Agents: How Far Are We?
há 15 horas Score 85/100Latent-Lagrangian Neural Networks for Reduced Order Modeling of Non-autonomous Nonlinear Dynamical Systems
há 15 horas Score 85/100ArtCraft Apps – open-source Adobe compatible suite written in Rust
há 1 diaTópicos Relacionados Detectados
Ver todos →Quase um bilhão de pessoas usam o ChatGPT semanalmente, diz presidente da OpenAI
tecnologia · há 5 meses
Como dois irmãos usaram IA para criar uma empresa de US$ 1,8 bilhão
tecnologia · há 5 meses
OpenAI releases GPT-5.5 and GPT-5.5 Pro in the API
tecnologia · há 5 meses
OpenAI models coming to Amazon Bedrock: Interview with OpenAI and AWS CEOs
tecnologia · há 5 meses
Essa foi detectada antes de ser notícia
A próxima está sendo monitorada agora.
Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.