RadarTrend
Inteligencia de tendencias
Escaneando tendencias...
Voltar ao Portal • tecnologia • 21 Sep. 2026 • 40 Views

DAPO: An Open-Source RL System from ByteDance Seed and Tsinghua Air

⚡ Score de Impacto: 85/100 Detectado há 2 semanas · Fonte: hacker_news
DAPO: An Open-Source RL System from ByteDance Seed and Tsinghua Air

DAPO: o sistema de aprendizado por reforço open-source que promete baratear a corrida da IA

Um novo projeto de código aberto vem movimentando os bastidores da comunidade global de inteligência artificial. Batizado de DAPO, o sistema foi desenvolvido em parceria entre o laboratório ByteDance Seed — divisão de pesquisa em IA da dona do TikTok — e o Tsinghua Air, instituto de inovação da Universidade de Tsinghua, uma das mais respeitadas da China. A novidade apareceu com força no Hacker News, o principal fórum de tecnologia do mundo, e rapidamente virou assunto entre desenvolvedores e investidores.

Mas afinal, por que isso interessa a um empresário brasileiro? A resposta está em uma das etapas mais caras e decisivas da construção de modelos de linguagem, como o ChatGPT. Entender o DAPO é entender como a próxima geração de IA pode ficar mais barata — e mais acessível — para quem quer usar a tecnologia no negócio.

Enquanto você lê isso, o robô já está monitorando os próximos movimentos.

Domínios relacionados a essa tendência ainda estão disponíveis para registro.

Criar conta grátis →

O que é aprendizado por reforço, em bom português

Quando uma empresa treina uma IA generativa, ela passa por algumas fases. Primeiro, o modelo "lê" montanhas de texto para aprender padrões de linguagem. Depois, precisa ser ensinado a se comportar bem: dar respostas úteis, não inventar fatos e seguir instruções. É aqui que entra o chamado aprendizado por reforço — em inglês, Reinforcement Learning ou apenas RL.

Funciona mais ou menos como treinar um cachorro com petiscos: quando o modelo dá uma boa resposta, recebe uma "recompensa"; quando erra, é corrigido. A técnica ficou famosa como RLHF (aprendizado por reforço com feedback humano), usada para lapidar modelos como o GPT. O problema é que esse processo é lento, caro e exige uma infraestrutura pesada de servidores.

RadarTrend detectou essa tendência antes de virar notícia

A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.

Criar conta grátis →

O diferencial do DAPO

O DAPO propõe uma alternativa mais eficiente a esse esquema. Ele é o que os especialistas chamam de sistema de RL open-source — ou seja, com o código aberto, disponível para qualquer empresa ou pesquisador baixar, estudar e adaptar. Na prática, isso significa que companhias menores, sem os bilhões de dólares de um gigante de tecnologia, podem treinar seus próprios modelos com uma receita pública e já testada.

Segundo a divulgação do projeto, o DAPO foi construído para ser escalável e reprodutível, dois pontos que historicamente travam a pesquisa em IA. "Reprodutível" quer dizer que outros times conseguem chegar aos mesmos resultados seguindo as mesmas instruções — algo raro num mercado onde

Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.

Baseado em dados coletados de: hacker_news

Essa foi detectada antes de ser notícia

A próxima está sendo monitorada agora.

Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.