🎬 Assista esta matéria
Um artigo publicado no arXiv em 16 de setembro de 2026 propõe um teste diferente para agentes de programação: em vez de receber um enunciado escrito, o modelo precisa descobrir sozinho o que um aplicativo faz — clicando nele — e então reimplementar esse comportamento em uma versão incompleta do código.
O trabalho se chama ProgramDistill e é assinado por pesquisadores da KAIST, da Microsoft Research Montréal e da Microsoft AI, entre eles Jeonghye Kim, Minseon Kim, Young Jin Kim, Marc-Alexandre Côté e Alessandro Sordoni.
Como o teste é montado
O ponto de partida é um problema prático de avaliação. Benchmarks de engenharia de software costumam entregar a especificação pronta: corrija este bug, implemente esta função descrita em duas linhas. No mundo real, boa parte do trabalho é inferir o comportamento esperado a partir de software que já funciona.
A pipeline dos autores, batizada de mine-craft-patch, faz isso sem intervenção humana. Ela explora 26 aplicações web interativas, registra 1.975 comportamentos verificados por replay — ou seja, que podem ser reproduzidos automaticamente — e gera a partir deles 4.063 tarefas de programação.
Cada tarefa remove parte de uma aplicação funcional e pede que o agente restaure o comportamento, usando a versão completa apenas como referência para interagir, nunca como código à vista.
Os resultados
Nove agentes de fronteira foram avaliados. Na reconstrução de aplicação completa, medida por fluxos de trabalho cumulativos, o GPT-6 Astra terminou 49,2% das tarefas e o Claude Opus 5, 28,8%.
A distância entre os dois números é o achado mais citado desde a publicação, mas o dado mais revelador do artigo é outro: a taxa de sucesso desaba conforme aumenta a profundidade da restauração. Em reconstrução parcial, o desempenho cai de 100% para 64,0% quando o teste chega a oito níveis de dependência encadeada.
Em outras palavras, os agentes se saem bem quando precisam recompor uma peça isolada e perdem o fio quando a peça depende de outras que também foram removidas. Erros se acumulam ao longo da cadeia.
Na reconstrução parcial isolada, o Astra lidera com 84,3% de pontuação binária, seguido pelo Claude Opus 5 e pelo GPT-5.6 Sol.
O benchmark entra numa fila cada vez mais longa de testes que tentam medir agentes em tarefas realistas, como Terminal-Bench e TerminalWorld. O diferencial aqui é dispensar anotação manual: se a pipeline funciona como descrito, novos aplicativos podem virar novas tarefas sem custo humano — o que também torna o conjunto mais difícil de saturar por contaminação de dados de treino.
Fontes: arXiv, Hugging Face Papers
🎙️ Gostou? Receba só o que te interessa, todo dia
Escolha seus temas e receba um briefing diário em áudio e texto, de graça, no WhatsApp ou e-mail.
Montar meu briefing grátis