RadarTrend
Inteligencia de tendencias
Escaneando tendencias...
Voltar ao Portal • tecnologia • 01 Oct. 2026 • 44 Views

Attention Function as an Intrinsic Inductive Bias: How Models' Behavior Diverges in Novel Contexts

⚡ Score de Impacto: 85/100 Detectado há 5 dias · Fonte: arxiv
Attention Function as an Intrinsic Inductive Bias: How Models' Behavior Diverges in Novel Contexts

O "instinto" escondido das IAs: novo estudo revela como modelos de linguagem mudam de comportamento fora da zona de conforto

Uma pesquisa recente publicada por cientistas de aprendizado de máquina traz uma descoberta que pode mudar a forma como empresas e desenvolvedores pensam sobre o treinamento de modelos de linguagem. O estudo investiga se os Transformers — a arquitetura por trás de ferramentas como ChatGPT, Gemini e Claude — possuem algo parecido com o que psicólogos do desenvolvimento chamam de "priors" (predisposições inatas). Em bebês, essas predisposições existem antes de qualquer experiência e ficam mascaradas em ambientes controlados, mas voltam à tona em situações imprevisíveis. A pergunta central dos pesquisadores: será que algo semelhante acontece com a inteligência artificial?

Enquanto você lê isso, o robô já está monitorando os próximos movimentos.

Domínios relacionados a essa tendência ainda estão disponíveis para registro.

Criar conta grátis →

O que é o MoFA e por que ele importa

Para testar essa hipótese, os autores propuseram uma modificação chamada Mixture of Function Attention (MoFA), ou "Atenção de Mistura de Funções", em tradução livre. Trata-se de uma alteração sem parâmetros novos no mecanismo de atenção de múltiplas cabeças — o coração dos Transformers. Em vez de deixar o modelo decidir tudo sozinho, os pesquisadores fixaram, antes do treinamento, uma proporção entre dois tipos de funções de ativação: softmax e sigmoid. É como definir, de antemão, que parte dos "neurônios" do modelo vai se comportar de uma forma e parte de outra, sem dar margem para o treinamento mudar isso.

O experimento usou um modelo GPT-2 de 124 milhões de parâmetros, cinco proporções diferentes de mistura e cinco sementes aleatórias para garantir reprodutibilidade. O resultado tem duas camadas — e a segunda é a mais surpreendente.

Dentro da zona de conforto, quase nenhuma diferença

Quando avaliado em dados parecidos com aqueles usados no treinamento — o chamado cenário "in-distribution" —, o modelo praticamente ignorou a proporção escolhida. As diferenças entre as configurações foram estatisticamente irrelevantes para misturas moderadas e continuaram pequenas mesmo nos extremos, ou seja, quando quase todas as cabeças eram softmax ou quase todas eram sigmoid.

RadarTrend detectou essa tendência antes de virar notícia

A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.

Criar conta grátis →

Para um empresário brasileiro, isso significa algo direto: em tarefas rotineiras e bem definidas, a arquitetura interna parece não importar tanto quanto se imagina. O modelo se comporta de forma parecida, independentemente da "predisposição" que recebeu.

Fora da zona de conforto, o instinto reaparece

A história muda radicalmente quando o modelo é exposto a dados completamente diferentes do treinamento —

Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.

Baseado em dados coletados de: arxiv

Essa foi detectada antes de ser notícia

A próxima está sendo monitorada agora.

Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.