🎬 Assista esta matéria
Um trabalho divulgado em 28 de agosto de 2026 pelo pesquisador Chen Yueh-Han, bolsista da Anthropic, apresentou o AAR — sigla em inglês para Pesquisador Automatizado de Alinhamento. O sistema faz sozinho o ciclo que normalmente cabe a uma equipe humana: procura na literatura, propõe métodos e treina modelos para testá-los.
Cada iteração leva cerca de 30 minutos.
O que o experimento mostrou
Os autores submeteram o sistema a dez benchmarks de desalinhamento — testes que medem se um modelo se comporta de forma contrária ao que seus operadores pretendem. O AAR melhorou o desempenho em todos os dez ao mesmo tempo, sem degradar a capacidade geral dos modelos.
O trecho mais citado do artigo é a comparação direta com humanos: “o melhor método do AAR supera o que pesquisadores experientes propõem, em média dentro de seis horas”.
A diferença de custo é a parte mais concreta do resultado. O sistema gasta cerca de US$ 4 por hora em inferência de API. Um pesquisador humano, na conta apresentada, sai por US$ 150 a hora. O artigo também registra que direcionar a pesquisa com sugestões humanas não produziu resultados melhores do que deixar o sistema escolher os próprios caminhos.
Por que isso importa — e onde trava
O interesse do trabalho está no que ele antecipa. Se um sistema consegue melhorar as práticas de treinamento de outros sistemas, o passo seguinte é a autoaperfeiçoamento recursivo, cenário em que modelos passam a conduzir a própria pesquisa. É simultaneamente a promessa e o receio que atravessam o debate sobre segurança de IA.
Aqui, porém, o resultado tem um limite bem demarcado, e o próprio artigo o reconhece: o sistema só é tão bom quanto os benchmarks que o avaliam.
Otimizar dez testes de desalinhamento não é o mesmo que tornar um modelo alinhado. Se as métricas não capturam o objetivo real, um otimizador eficiente encontra atalhos que satisfazem a medida sem atender ao propósito — problema conhecido em aprendizado de máquina muito antes desta pesquisa.
Os autores apontam ainda que manter os benchmarks atualizados e ampliar as fontes de literatura consultadas exige trabalho contínuo. O gargalo, em outras palavras, migra do pesquisador para o avaliador.
A publicação sai em um momento em que a Anthropic tem colocado dinheiro nesse tipo de agenda — e em que a própria empresa enfrenta questionamentos jurídicos sobre como obteve os dados que treinam seus modelos.
Fontes: TechCrunch
🎙️ Gostou? Receba só o que te interessa, todo dia
Escolha seus temas e receba um briefing diário em áudio e texto, de graça, no WhatsApp ou e-mail.
Montar meu briefing grátis