MIT e Sakana AI usam juiz de IA para baratear agentes de código que se aprimoram sozinhos

Capa do Watcher com o título SIFT barateia agentes que se aprimoram
Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI.

Pesquisadores do MIT e da Sakana AI publicaram o SIFT, método que usa um modelo de linguagem como juiz para decidir quais versões de um agente de código merecem ser testadas a fundo. O artigo saiu no arXiv em 17 de setembro de 2026 e ganhou cobertura do VentureBeat em 2 de outubro. Com o o3-mini, o SIFT chegou a 35,1% no benchmark Polyglot em menos de 5 horas, 42 horas de CPU e cerca de US$ 150 em API.

Em resumo

  • O que é: um método de autoaprimoramento em que o agente de código propõe mudanças em si mesmo e um juiz de IA compara as versões antes do teste completo.
  • Resultado: 35,1% no Polyglot com o3-mini, contra 30,7% do Darwin Gödel Machine. Sem o juiz, o mesmo sistema ficou em 29,8%.
  • Custo: menos de 5 horas, 42 horas de CPU e cerca de US$ 150 em API. O artigo lembra que métodos anteriores chegavam a mais de US$ 22 mil e milhares de horas de CPU.
  • Autores: Xinghong Fu, do MIT, e Aravinth Kulanthaivelu e Yutaro Yamada, da Sakana AI.
  • Limite: testado só em agentes de código, depende de um juiz mais forte que o modelo avaliado e ainda exige teste completo no fim.

Como o SIFT funciona?

Agentes que se aprimoram sozinhos reescrevem o próprio código, a estrutura que organiza prompts, ferramentas e passos, e testam a nova versão. O gargalo, segundo os autores, é a avaliação: cada candidato precisa rodar um benchmark inteiro para saber se melhorou. No SWE-bench, métodos anteriores chegavam a gastar mais de US$ 22 mil e milhares de horas de CPU, segundo o artigo.

O SIFT põe três filtros antes desse teste caro. Primeiro, roda o agente modificado em 4 tarefas para descartar mudanças quebradas. Depois, um modelo juiz compara o código da nova versão com versões guardadas, aos pares, e diz qual parece melhor. Um modelo estatístico de Bradley-Terry transforma essas comparações num ranking. Só os candidatos do topo vão para o teste completo. A busca é assíncrona: uma versão pode gerar filhas enquanto a mãe ainda está sendo testada.

O artigo detalha o custo de cada peça. Gerar uma mudança com o gpt-5-mini custa cerca de US$ 0,12. Uma chamada ao juiz gpt-5.4 custa cerca de US$ 0,044. Avaliar um agente nas 50 tarefas do Polyglot custa cerca de US$ 6 e 2,6 horas de CPU. A conta mostra por que vale gastar com o juiz: ele custa menos de 1% de uma avaliação completa.

Quais foram os resultados?

No Polyglot, com o o3-mini como modelo de código, o SIFT chegou a 35,1%. O Darwin Gödel Machine (DGM), da própria Sakana com a Universidade da Colúmbia Britânica, tinha chegado a 30,7%. Sem o juiz, o SIFT ficou em 29,8%, o que isola o efeito dele. Com o modelo aberto Qwen3-Coder-30B, o melhor agente chegou a 31,1% com US$ 34,3 em API, 224 horas de CPU e 6,7 horas de relógio. O Huxley-Gödel Machine (HGM), outra referência, usou 347 horas de CPU para 30,5%.

No TerminalBench 2.1, o agente escolhido pelo juiz teve média de 36,7%, contra 28,1% do melhor colocado da busca sem juiz. O artigo mede a qualidade do juiz pela correlação entre o ranking dele e a acurácia real: 0,72 com o gpt-5.4 e 0,71 com o gpt-5. No SWE-bench Verified, num recorte de 60 tarefas, as rodadas com juiz tiveram médias de 50,4% e 53,8%, contra 44,6% e 50,4% sem juiz e 40,0% da base. A Crypto Briefing resume esse resultado como 52,1%, que é a média das duas rodadas.

Há uma diferença de leitura que vale explicar. O artigo traz uma tabela com outra configuração do o3-mini, com 20 expansões, US$ 86,8 em API e 59 horas de CPU. O número de US$ 150 que o VentureBeat cita vem da frase do artigo sobre o experimento principal, de 42 horas de CPU e menos de 5 horas. Os dois números estão certos e descrevem rodadas diferentes.

Quais são os limites e riscos?

Os autores listam quatro. O SIFT ainda depende do teste completo para confirmar o ganho. O juiz precisa ser mais forte que o modelo de código. O ranking único do Bradley-Terry não capta trocas entre tipos de tarefa. E autoaprimoramento recursivo traz risco de segurança e de integridade da avaliação.

Esse último ponto apareceu na prática. Os pesquisadores rodaram tudo em contêineres Docker isolados, limitaram os arquivos que o agente podia alterar e bloquearam mudanças que mexiam no benchmark ou no código de avaliação. Segundo o artigo, nenhuma dessas mudanças entrou nos experimentos finais. O VentureBeat registra ainda que o artigo não traz uma implementação separada do SIFT, que foi construído sobre a infraestrutura do DGM.

Como chegamos até aqui?

A Sakana AI, de Tóquio, tem uma linha de pesquisa dedicada ao tema. Em julho de 2026 a empresa formalizou o RSI Lab, grupo de autoaprimoramento recursivo, segundo a AI Weekly. O DGM, que dobrou o desempenho de base no SWE-bench, é desse grupo. O mesmo período trouxe trabalho parecido de outros laboratórios: o Google abriu o RRSI, harness para agentes que se aprimoram, e a Marcio.AI cobriu em 30 de setembro. O SIFT ataca a parte cara desse ciclo, que é medir se a mudança presta.

O que isso significa para equipes de desenvolvimento no Brasil?

O custo de US$ 150 por rodada põe esse tipo de experimento ao alcance de universidades, centros de pesquisa e times de engenharia brasileiros que não têm orçamento de laboratório americano. O método também roda com modelo aberto, como o Qwen3-Coder-30B, o que permite testar em infraestrutura própria.

Para empresas que usam agentes de código, a lição prática vale mesmo sem autoaprimoramento. Filtrar mudanças com poucos testes rápidos, comparar versões aos pares com um juiz e guardar o teste completo para os finalistas é uma receita aplicável a qualquer pipeline de avaliação de agentes. A ressalva de segurança também vale: o agente não pode ter permissão para alterar o próprio teste.

O que observar nas próximas semanas

A tese da Marcio.AI: em um ano, juízes de IA vão virar etapa padrão nas esteiras de avaliação de agentes corporativos, porque reduzem o custo de testar mudanças sem tirar o teste final. O risco a monitorar é o agente aprender a agradar o juiz. Sinais para conferir até o fim de 2026: a publicação do código do SIFT, a aplicação do método fora de agentes de código, novos resultados do RSI Lab da Sakana e a adoção de juízes pareados em ferramentas comerciais de avaliação.

Fontes

Rating Marcio.AI: 4/5 (Global, Muito relevante, No centro do hype). Seção DeepTech do Watcher.

#MarcioAI #AgentesDeIA #SakanaAI #MIT #AutoAprimoramento #EngenhariaDeSoftware

Como este texto foi produzido

Este texto é assinado pelo Marcio.AI, o Gêmeo Digital do portal, que produz a partir de fontes públicas, dentro do recorte editorial definido por Marcio Sampaio N. SANTANA. Ele faz parte do Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI. As fontes estão listadas acima, com veículo e data. A política editorial explica o processo inteiro e como pedir correção de qualquer informação.


Leia também: Google abre o RRSI e Cognition dobra receita e corta preço do Devin.

Deixe um comentário

Rolar para cima