article

Claude lidera 26% da pesquisa que cria o próximo Claude

3 min de leitura

🎬 Assista esta matéria

A Anthropic divulgou em 17 de setembro de 2026 um levantamento interno em que afirma que o Claude já “lidera” 26% do trabalho de pesquisa e desenvolvimento que produz seus próprios modelos. Em fevereiro, o mesmo indicador ficava abaixo de 1%.

O número é o primeiro painel público em que um laboratório de fronteira tenta medir, com método declarado, quanto da própria construção de IA já é feita por IA. A empresa também informou que cerca de 30 mil agentes operavam simultaneamente em sua principal plataforma interna durante agosto.

Como a conta foi feita

A medição não veio de um único teste. Em julho de 2026, a Anthropic passou a sortear 20% do quadro de funcionários por semana e a analisar registros de Slack para mapear o que essas pessoas efetivamente faziam. Saíram dali cerca de 15 mil tarefas granulares, agrupadas em uma taxonomia congelada de 542 nós, dos quais 378 são categorias finais.

Cada categoria recebeu peso conforme o tempo humano investido nela e foi classificada em uma escala de automação que vai de AL0 a AL5. O patamar AL4, chamado de “IA lidera”, descreve tarefas em que o modelo conclui a maior parte do trabalho a partir de uma instrução de alto nível, com humanos supervisionando. É esse nível que responde pelos 26%.

Acima de 90% do trabalho medido já está em AL3 — “IA colabora” — ou superior, o que significa blocos grandes de execução sob direção humana próxima. Nenhuma categoria chegou ao AL5, a autonomia plena. O próprio relatório trata isso como o dado central: o Claude não conduz uma agenda de pesquisa sozinho, e sim executa trechos cada vez maiores dela.

Monitoramento e o que o número não diz

A empresa afirma que 100% das ações dos agentes na plataforma medida passam por uma camada de monitoramento on-line capaz de bloquear ou redirecionar um comando, em geral em segundos, e que tudo é reprocessado depois por um sistema off-line.

Em agosto, esse monitor examinou mais de 1 bilhão de decisões e barrou 0,002% delas — aproximadamente uma a cada 47 mil. É um índice baixo, mas em volume absoluto significa dezenas de milhares de ações interrompidas no mês.

Há uma ressalva relevante para quem lê o painel como prova de automelhoria: os 26% descrevem classificação de automação de tarefas catalogadas, não descoberta científica independente. Trabalho que ninguém mapeou na taxonomia de julho simplesmente não entra na conta, e o critério de “liderar” foi definido pela própria Anthropic.

O anúncio chega cinco dias depois do ensaio em que Dario Amodei pediu desaceleração na corrida da IA e propôs abrir a empresa a avaliadores externos permanentes — e no mesmo período em que OpenAI, Anthropic e Google DeepMind discutem um órgão conjunto de padrões para testar modelos antes do lançamento.

Fontes: The Hill, Data Studios, Anthropic

🎙️ Gostou? Receba só o que te interessa, todo dia

Escolha seus temas e receba um briefing diário em áudio e texto, de graça, no WhatsApp ou e-mail.

Montar meu briefing grátis