RadarTrend
Inteligencia de tendencias
Escaneando tendencias...
Voltar ao Portal • tecnologia • 16 Sep. 2026 • 71 Views

When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control

⚡ Score de Impacto: 85/100 Detectado há 2 semanas · Fonte: arxiv
When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control

O Dilema dos Modelos de Linguagem: Quando Eles Devem Admitir que Não Sabem?

No cenário atual da inteligência artificial generativa, as empresas brasileiras estão cada vez mais integrando Grandes Modelos de Linguagem (LLMs, na sigla em inglês) em seus fluxos de trabalho. A promessa é sedutora: respostas rápidas, atendimento automatizado e análise de dados em segundos. No entanto, há um problema silencioso e caro que assombra essa adoção: a "alucinação". Modelos de linguagem são máquinas de fluência; eles são projetados para gerar texto que parece correto, mesmo quando os fatos por trás daquela afirmação são fracos ou inexistentes.

Para um gestor, isso representa um risco de negócio significativo. Imagine um chatbot de suporte técnico que inventa uma especificação de produto ou um assistente jurídico que cita uma lei inexistente com total confiança. O custo do erro pode ser altíssimo. É nesse contexto que uma nova pesquisa surge como um farol, propondo uma abordagem de "autocontrole seletivo de risco".

Enquanto você lê isso, o robô já está monitorando os próximos movimentos.

Domínios relacionados a essa tendência ainda estão disponíveis para registro.

Criar conta grátis →

A Solução: Chain-of-Self-Questioning (CoSQ)

Um novo estudo acadêmico introduz um conceito chamado Chain-of-Self-Questioning (CoSQ), que podemos traduzir livremente como "Cadeia de Autoquestionamento". A premissa é simples, mas poderosa: em vez de forçar o modelo a sempre dar uma resposta final, o sistema o ensina a avaliar se possui informação suficiente para responder à pergunta antes de se comprometer.

Diferente de ajustes complexos no código do modelo (fine-tuning), esta é uma técnica de prompt (comando de texto). Ou seja, é uma solução ágil e de baixo custo de implementação. O modelo passa por um processo explícito de autoavaliação: ele "pergunta a si mesmo" se os dados que tem em mãos são realmente suficientes para embasar uma resposta. Se a avaliação for negativa, o modelo tem a opção de se abster (não responder) ou encaminhar a questão para um humano.

RadarTrend detectou essa tendência antes de virar notícia

A próxima oportunidade pode chegar no seu Telegram antes de todo mundo saber.

Criar conta grátis →

Os Números da Confiabilidade

A pesquisa não ficou apenas na teoria. Os cientistas testaram três variantes dessa técnica (Grounded-CoSQ, Critical-CoSQ e Adaptive-CoSQ) em um dos benchmarks mais rigorosos do mundo, o TruthfulQA. O teste envolveu 817 perguntas de múltipla escolha e 11 famílias diferentes de modelos, incluindo opções de pesos abertos e serviços hospedados.

Os resultados são animadores para o setor empresarial. No protocolo final de avaliação, a variante chamada Grounded-CoSQ (com um limite de confiança de 0,90) apresentou os seguintes resultados:

Publicado por RadarTrend AI Journalist via Análise de Tendências em Tempo Real.

Baseado em dados coletados de: arxiv

Essa foi detectada antes de ser notícia

A próxima está sendo monitorada agora.

Conflitos geopolíticos, escassez de materiais, movimentos de IA — o robô monitora tudo 24h e te avisa quando uma oportunidade emerge.