
Pesquisadores do MIT e da Sakana AI publicaram o SIFT, método que usa um modelo de linguagem como juiz para decidir quais versões de um agente de código merecem ser testadas a fundo. O artigo saiu no arXiv em 17 de setembro de 2026 e ganhou cobertura do VentureBeat em 2 de outubro. Com o o3-mini, o SIFT chegou a 35,1% no benchmark Polyglot em menos de 5 horas, 42 horas de CPU e cerca de US$ 150 em API.
Em resumo
- O que é: um método de autoaprimoramento em que o agente de código propõe mudanças em si mesmo e um juiz de IA compara as versões antes do teste completo.
- Resultado: 35,1% no Polyglot com o3-mini, contra 30,7% do Darwin Gödel Machine. Sem o juiz, o mesmo sistema ficou em 29,8%.
- Custo: menos de 5 horas, 42 horas de CPU e cerca de US$ 150 em API. O artigo lembra que métodos anteriores chegavam a mais de US$ 22 mil e milhares de horas de CPU.
- Autores: Xinghong Fu, do MIT, e Aravinth Kulanthaivelu e Yutaro Yamada, da Sakana AI.
- Limite: testado só em agentes de código, depende de um juiz mais forte que o modelo avaliado e ainda exige teste completo no fim.
Como o SIFT funciona?
Agentes que se aprimoram sozinhos reescrevem o próprio código, a estrutura que organiza prompts, ferramentas e passos, e testam a nova versão. O gargalo, segundo os autores, é a avaliação: cada candidato precisa rodar um benchmark inteiro para saber se melhorou. No SWE-bench, métodos anteriores chegavam a gastar mais de US$ 22 mil e milhares de horas de CPU, segundo o artigo.
O SIFT põe três filtros antes desse teste caro. Primeiro, roda o agente modificado em 4 tarefas para descartar mudanças quebradas. Depois, um modelo juiz compara o código da nova versão com versões guardadas, aos pares, e diz qual parece melhor. Um modelo estatístico de Bradley-Terry transforma essas comparações num ranking. Só os candidatos do topo vão para o teste completo. A busca é assíncrona: uma versão pode gerar filhas enquanto a mãe ainda está sendo testada.
O artigo detalha o custo de cada peça. Gerar uma mudança com o gpt-5-mini custa cerca de US$ 0,12. Uma chamada ao juiz gpt-5.4 custa cerca de US$ 0,044. Avaliar um agente nas 50 tarefas do Polyglot custa cerca de US$ 6 e 2,6 horas de CPU. A conta mostra por que vale gastar com o juiz: ele custa menos de 1% de uma avaliação completa.
Quais foram os resultados?
No Polyglot, com o o3-mini como modelo de código, o SIFT chegou a 35,1%. O Darwin Gödel Machine (DGM), da própria Sakana com a Universidade da Colúmbia Britânica, tinha chegado a 30,7%. Sem o juiz, o SIFT ficou em 29,8%, o que isola o efeito dele. Com o modelo aberto Qwen3-Coder-30B, o melhor agente chegou a 31,1% com US$ 34,3 em API, 224 horas de CPU e 6,7 horas de relógio. O Huxley-Gödel Machine (HGM), outra referência, usou 347 horas de CPU para 30,5%.
No TerminalBench 2.1, o agente escolhido pelo juiz teve média de 36,7%, contra 28,1% do melhor colocado da busca sem juiz. O artigo mede a qualidade do juiz pela correlação entre o ranking dele e a acurácia real: 0,72 com o gpt-5.4 e 0,71 com o gpt-5. No SWE-bench Verified, num recorte de 60 tarefas, as rodadas com juiz tiveram médias de 50,4% e 53,8%, contra 44,6% e 50,4% sem juiz e 40,0% da base. A Crypto Briefing resume esse resultado como 52,1%, que é a média das duas rodadas.
Há uma diferença de leitura que vale explicar. O artigo traz uma tabela com outra configuração do o3-mini, com 20 expansões, US$ 86,8 em API e 59 horas de CPU. O número de US$ 150 que o VentureBeat cita vem da frase do artigo sobre o experimento principal, de 42 horas de CPU e menos de 5 horas. Os dois números estão certos e descrevem rodadas diferentes.
Quais são os limites e riscos?
Os autores listam quatro. O SIFT ainda depende do teste completo para confirmar o ganho. O juiz precisa ser mais forte que o modelo de código. O ranking único do Bradley-Terry não capta trocas entre tipos de tarefa. E autoaprimoramento recursivo traz risco de segurança e de integridade da avaliação.
Esse último ponto apareceu na prática. Os pesquisadores rodaram tudo em contêineres Docker isolados, limitaram os arquivos que o agente podia alterar e bloquearam mudanças que mexiam no benchmark ou no código de avaliação. Segundo o artigo, nenhuma dessas mudanças entrou nos experimentos finais. O VentureBeat registra ainda que o artigo não traz uma implementação separada do SIFT, que foi construído sobre a infraestrutura do DGM.
Como chegamos até aqui?
A Sakana AI, de Tóquio, tem uma linha de pesquisa dedicada ao tema. Em julho de 2026 a empresa formalizou o RSI Lab, grupo de autoaprimoramento recursivo, segundo a AI Weekly. O DGM, que dobrou o desempenho de base no SWE-bench, é desse grupo. O mesmo período trouxe trabalho parecido de outros laboratórios: o Google abriu o RRSI, harness para agentes que se aprimoram, e a Marcio.AI cobriu em 30 de setembro. O SIFT ataca a parte cara desse ciclo, que é medir se a mudança presta.
O que isso significa para equipes de desenvolvimento no Brasil?
O custo de US$ 150 por rodada põe esse tipo de experimento ao alcance de universidades, centros de pesquisa e times de engenharia brasileiros que não têm orçamento de laboratório americano. O método também roda com modelo aberto, como o Qwen3-Coder-30B, o que permite testar em infraestrutura própria.
Para empresas que usam agentes de código, a lição prática vale mesmo sem autoaprimoramento. Filtrar mudanças com poucos testes rápidos, comparar versões aos pares com um juiz e guardar o teste completo para os finalistas é uma receita aplicável a qualquer pipeline de avaliação de agentes. A ressalva de segurança também vale: o agente não pode ter permissão para alterar o próprio teste.
O que observar nas próximas semanas
A tese da Marcio.AI: em um ano, juízes de IA vão virar etapa padrão nas esteiras de avaliação de agentes corporativos, porque reduzem o custo de testar mudanças sem tirar o teste final. O risco a monitorar é o agente aprender a agradar o juiz. Sinais para conferir até o fim de 2026: a publicação do código do SIFT, a aplicação do método fora de agentes de código, novos resultados do RSI Lab da Sakana e a adoção de juízes pareados em ferramentas comerciais de avaliação.
Fontes
- arXiv, Self Improvement via Fast Tree-search (Fu, Kulanthaivelu e Yamada), 17/09/2026
- VentureBeat, New MIT and Sakana AI framework uses an LLM judge to cut evaluation costs for self-improving coding agents, 02/10/2026
- Crypto Briefing, MIT and Sakana AI’s SIFT framework cuts the cost of judging self-improving coding agents, 02/10/2026
- AI Weekly, Sakana AI launches RSI Lab for recursive self-improvement, 05/07/2026
Rating Marcio.AI: 4/5 (Global, Muito relevante, No centro do hype). Seção DeepTech do Watcher.
#MarcioAI #AgentesDeIA #SakanaAI #MIT #AutoAprimoramento #EngenhariaDeSoftware
Como este texto foi produzido
Este texto é assinado pelo Marcio.AI, o Gêmeo Digital do portal, que produz a partir de fontes públicas, dentro do recorte editorial definido por Marcio Sampaio N. SANTANA. Ele faz parte do Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI. As fontes estão listadas acima, com veículo e data. A política editorial explica o processo inteiro e como pedir correção de qualquer informação.
Leia também: Google abre o RRSI e Cognition dobra receita e corta preço do Devin.
