When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control
O Dilema dos Modelos de Linguagem: Quando Eles Devem Admitir que Não Sabem?
No cenário atual da inteligência artificial generativa, as empresas brasileiras estão cada vez mais integrando Grandes Modelos de Linguagem (LLMs, na sigla em inglês) em seus fluxos de trabalho. A promessa é sedutora: respostas rápidas, atendimento automatizado e análise de dados em segundos. No entanto, há um problema silencioso e caro que assombra essa adoção: a "alucinação". Modelos de linguagem são máquinas de fluência; eles são projetados para gerar texto que parece correto, mesmo quando os fatos por trás daquela afirmação são fracos ou inexistentes.
Para um gestor, isso representa um risco de negócio significativo. Imagine um chatbot de suporte técnico que inventa uma especificação de produto ou um assistente jurídico que cita uma lei inexistente com total confiança. O custo do erro pode ser altíssimo. É nesse contexto que uma nova pesquisa surge como um farol, propondo uma abordagem de "autocontrole seletivo de risco".
Enquanto você lê isso, o robô já está monitorando os próximos movimentos.
Domínios relacionados a essa tendência ainda estão disponíveis para registro.
Criar conta grátis →A Solução: Chain-of-Self-Questioning (CoSQ)
Um novo estudo acadêmico introduz um conceito chamado Chain-of-Self-Questioning (CoSQ), que podemos traduzir livremente como "Cadeia de Autoquestionamento". A premissa é simples, mas poderosa: em vez de forçar o modelo a sempre dar uma resposta final, o sistema o ensina a avaliar se possui informação suficiente para responder à pergunta antes de se comprometer.
Diferente de ajustes complexos no código do modelo (fine-tuning), esta é uma técnica de prompt (comando de texto). Ou seja, é uma solução ágil e de baixo custo de implementação. O modelo passa por um processo explícito de autoavaliação: ele "pergunta a si mesmo" se os dados que tem em mãos são realmente suficientes para embasar uma resposta. Se a avaliação for negativa, o modelo tem a opção de se abster (não responder) ou encaminhar a questão para um humano.
RadarTrend detectou essa tendência antes de virar notícia
A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.
Criar conta grátis →Os Números da Confiabilidade
A pesquisa não ficou apenas na teoria. Os cientistas testaram três variantes dessa técnica (Grounded-CoSQ, Critical-CoSQ e Adaptive-CoSQ) em um dos benchmarks mais rigorosos do mundo, o TruthfulQA. O teste envolveu 817 perguntas de múltipla escolha e 11 famílias diferentes de modelos, incluindo opções de pesos abertos e serviços hospedados.
Os resultados são animadores para o setor empresarial. No protocolo final de avaliação, a variante chamada Grounded-CoSQ (com um limite de confiança de 0,90) apresentou os seguintes resultados:
Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.
Baseado em dados coletados de: arxiv
Tendências relacionadas detectadas esta semana
Towards Automatically Pruning Logging Code with Coding Agents: How Far Are We?
há 15 horas Score 85/100Latent-Lagrangian Neural Networks for Reduced Order Modeling of Non-autonomous Nonlinear Dynamical Systems
há 15 horas Score 85/100ArtCraft Apps – open-source Adobe compatible suite written in Rust
há 1 diaTópicos Relacionados Detectados
Ver todos →Quase um bilhão de pessoas usam o ChatGPT semanalmente, diz presidente da OpenAI
tecnologia · há 5 meses
Como dois irmãos usaram IA para criar uma empresa de US$ 1,8 bilhão
tecnologia · há 5 meses
OpenAI releases GPT-5.5 and GPT-5.5 Pro in the API
tecnologia · há 5 meses
OpenAI models coming to Amazon Bedrock: Interview with OpenAI and AWS CEOs
tecnologia · há 5 meses
Essa foi detectada antes de ser notícia
A próxima está sendo monitorada agora.
Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.