Attention Function as an Intrinsic Inductive Bias: How Models' Behavior Diverges in Novel Contexts
O "instinto" escondido das IAs: novo estudo revela como modelos de linguagem mudam de comportamento fora da zona de conforto
Uma pesquisa recente publicada por cientistas de aprendizado de máquina traz uma descoberta que pode mudar a forma como empresas e desenvolvedores pensam sobre o treinamento de modelos de linguagem. O estudo investiga se os Transformers — a arquitetura por trás de ferramentas como ChatGPT, Gemini e Claude — possuem algo parecido com o que psicólogos do desenvolvimento chamam de "priors" (predisposições inatas). Em bebês, essas predisposições existem antes de qualquer experiência e ficam mascaradas em ambientes controlados, mas voltam à tona em situações imprevisíveis. A pergunta central dos pesquisadores: será que algo semelhante acontece com a inteligência artificial?
Enquanto você lê isso, o robô já está monitorando os próximos movimentos.
Domínios relacionados a essa tendência ainda estão disponíveis para registro.
Criar conta grátis →O que é o MoFA e por que ele importa
Para testar essa hipótese, os autores propuseram uma modificação chamada Mixture of Function Attention (MoFA), ou "Atenção de Mistura de Funções", em tradução livre. Trata-se de uma alteração sem parâmetros novos no mecanismo de atenção de múltiplas cabeças — o coração dos Transformers. Em vez de deixar o modelo decidir tudo sozinho, os pesquisadores fixaram, antes do treinamento, uma proporção entre dois tipos de funções de ativação: softmax e sigmoid. É como definir, de antemão, que parte dos "neurônios" do modelo vai se comportar de uma forma e parte de outra, sem dar margem para o treinamento mudar isso.
O experimento usou um modelo GPT-2 de 124 milhões de parâmetros, cinco proporções diferentes de mistura e cinco sementes aleatórias para garantir reprodutibilidade. O resultado tem duas camadas — e a segunda é a mais surpreendente.
Dentro da zona de conforto, quase nenhuma diferença
Quando avaliado em dados parecidos com aqueles usados no treinamento — o chamado cenário "in-distribution" —, o modelo praticamente ignorou a proporção escolhida. As diferenças entre as configurações foram estatisticamente irrelevantes para misturas moderadas e continuaram pequenas mesmo nos extremos, ou seja, quando quase todas as cabeças eram softmax ou quase todas eram sigmoid.
RadarTrend detectou essa tendência antes de virar notícia
A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.
Criar conta grátis →Para um empresário brasileiro, isso significa algo direto: em tarefas rotineiras e bem definidas, a arquitetura interna parece não importar tanto quanto se imagina. O modelo se comporta de forma parecida, independentemente da "predisposição" que recebeu.
Fora da zona de conforto, o instinto reaparece
A história muda radicalmente quando o modelo é exposto a dados completamente diferentes do treinamento —
Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.
Baseado em dados coletados de: arxiv
Tendências relacionadas detectadas esta semana
Towards Automatically Pruning Logging Code with Coding Agents: How Far Are We?
há 15 horas Score 85/100Latent-Lagrangian Neural Networks for Reduced Order Modeling of Non-autonomous Nonlinear Dynamical Systems
há 15 horas Score 85/100ArtCraft Apps – open-source Adobe compatible suite written in Rust
há 1 diaTópicos Relacionados Detectados
Ver todos →Quase um bilhão de pessoas usam o ChatGPT semanalmente, diz presidente da OpenAI
tecnologia · há 5 meses
Como dois irmãos usaram IA para criar uma empresa de US$ 1,8 bilhão
tecnologia · há 5 meses
OpenAI releases GPT-5.5 and GPT-5.5 Pro in the API
tecnologia · há 5 meses
OpenAI models coming to Amazon Bedrock: Interview with OpenAI and AWS CEOs
tecnologia · há 5 meses
Essa foi detectada antes de ser notícia
A próxima está sendo monitorada agora.
Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.