DAPO: An Open-Source RL System from ByteDance Seed and Tsinghua Air
DAPO: o sistema de aprendizado por reforço open-source que promete baratear a corrida da IA
Um novo projeto de código aberto vem movimentando os bastidores da comunidade global de inteligência artificial. Batizado de DAPO, o sistema foi desenvolvido em parceria entre o laboratório ByteDance Seed — divisão de pesquisa em IA da dona do TikTok — e o Tsinghua Air, instituto de inovação da Universidade de Tsinghua, uma das mais respeitadas da China. A novidade apareceu com força no Hacker News, o principal fórum de tecnologia do mundo, e rapidamente virou assunto entre desenvolvedores e investidores.
Mas afinal, por que isso interessa a um empresário brasileiro? A resposta está em uma das etapas mais caras e decisivas da construção de modelos de linguagem, como o ChatGPT. Entender o DAPO é entender como a próxima geração de IA pode ficar mais barata — e mais acessível — para quem quer usar a tecnologia no negócio.
Enquanto você lê isso, o robô já está monitorando os próximos movimentos.
Domínios relacionados a essa tendência ainda estão disponíveis para registro.
Criar conta grátis →O que é aprendizado por reforço, em bom português
Quando uma empresa treina uma IA generativa, ela passa por algumas fases. Primeiro, o modelo "lê" montanhas de texto para aprender padrões de linguagem. Depois, precisa ser ensinado a se comportar bem: dar respostas úteis, não inventar fatos e seguir instruções. É aqui que entra o chamado aprendizado por reforço — em inglês, Reinforcement Learning ou apenas RL.
Funciona mais ou menos como treinar um cachorro com petiscos: quando o modelo dá uma boa resposta, recebe uma "recompensa"; quando erra, é corrigido. A técnica ficou famosa como RLHF (aprendizado por reforço com feedback humano), usada para lapidar modelos como o GPT. O problema é que esse processo é lento, caro e exige uma infraestrutura pesada de servidores.
RadarTrend detectou essa tendência antes de virar notícia
A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.
Criar conta grátis →O diferencial do DAPO
O DAPO propõe uma alternativa mais eficiente a esse esquema. Ele é o que os especialistas chamam de sistema de RL open-source — ou seja, com o código aberto, disponível para qualquer empresa ou pesquisador baixar, estudar e adaptar. Na prática, isso significa que companhias menores, sem os bilhões de dólares de um gigante de tecnologia, podem treinar seus próprios modelos com uma receita pública e já testada.
Segundo a divulgação do projeto, o DAPO foi construído para ser escalável e reprodutível, dois pontos que historicamente travam a pesquisa em IA. "Reprodutível" quer dizer que outros times conseguem chegar aos mesmos resultados seguindo as mesmas instruções — algo raro num mercado onde
Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.
Baseado em dados coletados de: hacker_news
Tendências relacionadas detectadas esta semana
Towards Automatically Pruning Logging Code with Coding Agents: How Far Are We?
há 15 horas Score 85/100Latent-Lagrangian Neural Networks for Reduced Order Modeling of Non-autonomous Nonlinear Dynamical Systems
há 15 horas Score 85/100ArtCraft Apps – open-source Adobe compatible suite written in Rust
há 1 diaTópicos Relacionados Detectados
Ver todos →Quase um bilhão de pessoas usam o ChatGPT semanalmente, diz presidente da OpenAI
tecnologia · há 5 meses
Como dois irmãos usaram IA para criar uma empresa de US$ 1,8 bilhão
tecnologia · há 5 meses
OpenAI releases GPT-5.5 and GPT-5.5 Pro in the API
tecnologia · há 5 meses
OpenAI models coming to Amazon Bedrock: Interview with OpenAI and AWS CEOs
tecnologia · há 5 meses
Essa foi detectada antes de ser notícia
A próxima está sendo monitorada agora.
Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.