article

DeepMind faz 1º teste duplo-cego em modelo fechado

3 min de leitura

🎬 Assista esta matéria

O Google DeepMind anunciou em 27 de agosto de 2026 o que descreve como a primeira avaliação duplo-cega de um modelo de IA proprietário de fronteira. Na prática, um avaliador externo mediu o desempenho de um modelo Gemini sem enxergar os pesos, enquanto o Google não teve acesso às perguntas usadas no teste.

O piloto foi conduzido em parceria com o AI Safety Institute de Cingapura, a OpenMined, a AVERI e a MLCommons. O modelo avaliado foi o Gemini Flash Lite, submetido a benchmarks confidenciais.

O problema da contaminação

A motivação é um incômodo antigo da área: a contaminação de benchmarks. Quando as perguntas de um teste circulam publicamente, elas acabam entrando nos dados de treinamento dos modelos, e o resultado deixa de medir capacidade para medir memorização. Isso corrói a confiança nas tabelas de desempenho que a indústria usa para comparar sistemas.

O caminho oposto também tem custo. Laboratórios independentes que quisessem aplicar testes rigorosos precisariam, em tese, de acesso ao modelo — algo que as empresas resistem a conceder por questões de propriedade intelectual e segurança.

Como funciona a caixa criptográfica

A solução adotada usa o Confidential Space, serviço de computação confidencial do Google Cloud. Modelo e conjunto de avaliação são carregados em um ambiente isolado e verificável, onde a execução acontece sem que nenhuma das partes possa extrair o material da outra. O avaliador não alcança os pesos; o Google não vê os prompts.

Ao final, apenas os resultados agregados saem do ambiente. Como as perguntas nunca ficam expostas, o mesmo conjunto pode ser reaproveitado em avaliações futuras sem risco de vazar para os dados de treinamento — o que é justamente o que dá vida útil longa a um benchmark.

O DeepMind divulgou um relatório técnico com a metodologia e os resultados do piloto. A empresa afirma que a expectativa é que a abordagem estabeleça um novo patamar de supervisão de modelos, permitindo que organizações independentes testem sistemas avançados sem abrir mão de soberania sobre os próprios dados.

Por que isso importa

Governos e institutos de segurança de IA vêm sendo cobrados a auditar modelos comerciais, mas esbarram exatamente nesse impasse de confiança mútua. Um mecanismo que permita a terceiros rodar testes sem receber o modelo — e sem entregar o teste — é uma peça de infraestrutura que reguladores podem passar a exigir.

O piloto ainda é limitado a um modelo menor da família Gemini, e não há indicação de quando a prática será estendida aos modelos de maior porte da empresa ou adotada por outros laboratórios.

Fontes: Google DeepMind · The New Stack

🎙️ Gostou? Receba só o que te interessa, todo dia

Escolha seus temas e receba um briefing diário em áudio e texto, de graça, no WhatsApp ou e-mail.

Montar meu briefing grátis