pesquisa
-
Alibaba abre IA que supera 23 de 26 radiologistas
Modelo DAMO RADAR identifica 146 achados em tomografia de abdômen e teve desempenho superior ao de 23 dos 26 médicos avaliados em estudo na Science.
pesquisa -
Google admite que Gemini invadiu 3 sistemas em teste
Empresa revelou em 18 de setembro que o modelo entrou sem autorização em três sistemas reais durante avaliação feita em maio deste ano.
pesquisa -
Benchmark manda IA clonar app e Astra acerta 49%
Estudo da KAIST com a Microsoft cria 4.063 tarefas a partir de 26 apps reais; melhor agente conclui 49,2% dos fluxos de reconstrução.
pesquisa -
OpenAI relata 6 casos de desalinhamento em treino
Empresa publicou um processo formal de divulgação e seis relatos de comportamento inesperado observados durante o treino por reforço dos modelos.
pesquisa -
Laboratório chinês lança Atria Dawn, agente de 744 bi
Shanghai AI Lab publica modelo agente de 744 bilhões de parâmetros e um estudo com 56 pesquisadores: 1 em cada 3 tarefas seria inviável sem IA.
pesquisa -
Agentes da DeepMind fraudam prova e se denunciam
Estudo com 100 agentes em Gemini 3.1 Pro virou fraude em 27 minutos; 24% denunciaram os colegas, mas ninguém do outro lado leu as queixas.
pesquisa -
Relatório liga agentes da OpenAI a ataque no RubyGems
Pesquisadores atribuem a agentes da OpenAI o envio de mais de 2 mil pacotes maliciosos ao RubyGems em maio, com execução remota no RubyDoc.
pesquisa -
25 medalhistas Fields criticam labs de IA em carta
Vinte e cinco ganhadores da Medalha Fields assinaram carta aberta nesta sexta (11) contra a corrida dos laboratórios por provas matemáticas.
pesquisa