
Pesquisadores do Google Cloud AI Research publicaram o RRSI, um método em que agentes de IA reescrevem o próprio harness, o conjunto de prompts, ferramentas, memória e fluxo de controle que envolve o modelo, sem decorar os testes usados para medir o avanço. O artigo saiu no arXiv em 21 de setembro de 2026 e o código foi aberto no GitHub com licença Apache 2.0. No teste de programação Terminal-Bench 2.1, o agente passou de 74,2% para 80,2% de acerto.
Em resumo
- O que é: um método para melhorar automaticamente o harness de um agente, com o modelo congelado, sem mexer nos pesos.
- Problema atacado: métodos anteriores sobem a nota no teste usado na otimização e perdem o ganho, ou pioram, em tarefas novas.
- Resultado central: Terminal-Bench 2.1 de 74,2% para 80,2% e SWE-bench Verified de 82,0% para 83,8% sem nunca ter sido otimizado nele.
- Custo: os harnesses gerados gastaram 2,42 milhões de tokens por tentativa, contra 3,80 milhões na evolução sem regularização.
- Detalhe curioso: o modelo usado como base nos testes principais foi o Claude Opus 4.8, da Anthropic, rodando na Vertex AI do Google.
O que o Google publicou?
O RRSI, sigla em inglês para autoaperfeiçoamento recursivo regularizado, trata o harness como algo que pode evoluir sozinho. Em cada rodada, um modelo propõe mudanças no código que cerca o agente. As mudanças são testadas e só ficam as que passam por uma série de filtros. O modelo de base fica congelado o tempo todo.
A equipe é liderada por pesquisadores do Google Cloud AI Research, entre eles Tomas Pfister e Chen-Yu Lee, com participação de Stanford, da Universidade Washington em St. Louis e da Universidade da Carolina do Norte. O repositório traz o código para rodar a linha de base e a evolução em cada domínio testado.
Qual problema o método resolve?
Quem otimiza um agente contra um conjunto de testes corre o risco de ver a nota subir enquanto o agente piora no trabalho real. O artigo aponta três causas. A primeira é o ajuste a padrões específicos do teste. A segunda é aceitar melhorias que vieram só do acaso da avaliação. A terceira é o harness crescer sem ganho real.
Os autores compararam quatro métodos anteriores de evolução de harness: Meta-Harness, AHE, TTHE e HarnessX. Segundo o artigo, eles guardam pouco do ganho quando levados a tarefas novas, e vários terminam abaixo do harness inicial. O Meta-Harness, o mais forte no conjunto de otimização, somou só 0,9 ponto em média fora dele, segundo o Neurohive.
O RRSI responde com regras emprestadas do aprendizado de máquina clássico. Na proposta, limita quantas mudanças entram por rodada, com um orçamento que começa em três ou quatro e cai para uma. Guarda o histórico de hipóteses já descartadas e, quando o progresso para, força a exploração de componentes ainda não testados. Na seleção, um crítico lê cada mudança e rejeita as que citam nome de tarefa, entidade ou resposta específica. Ganhos dentro da margem de ruído são recusados. Aumento de custo só passa se vier com ganho medido, e componentes sem efeito são removidos.
Quais foram os resultados?
O artigo testou três domínios. Em programação, com o Terminal-Bench 2.1, o acerto foi de 74,2% para 80,2%. No mesmo domínio, o SWE-bench Verified, que nunca foi usado na otimização, subiu de 82,0% para 83,8%. Em espaço de trabalho com documentos, otimizado no Harvey LAB, a nota foi de 89,4 para 90,5. Em projeto de engenharia, de 50,0 para 54,9, segundo o repositório.
Os números que mais importam estão fora do conjunto de otimização. Nas tabelas do artigo, o JobBench foi de 36,0 para 40,7, o GDPval de 48,8 para 52,3 e o APEX-Agents de 34,2 para 37,9. No Frontier-Eng, o ganho foi de 4,3 pontos, de 17,7 para 22,0, segundo o Neurohive. A média fora da distribuição ficou em 43,6, contra 39,7 do harness inicial.
Os próprios autores registram que o RRSI teve o menor ganho no conjunto de otimização entre todos os métodos comparados. Foi também o único que superou o harness inicial por mais de um ponto em tarefas novas. Com o Gemini 3.5 Flash como base, o Terminal-Bench 2.1 chegou a 78,7%, segundo o MarkTechPost.
Como chegamos até aqui?
A melhoria automática de harness virou uma linha de pesquisa em 2026. Os quatro métodos comparados no artigo são deste ano. O RRSI desloca a conversa para a generalização, a mesma preocupação que o aprendizado de máquina tem há décadas com dados de treino e de teste. No mesmo período, os grandes laboratórios passaram a vender agentes que trabalham por horas sem supervisão, como os dots da OpenAI, lançados em 29 de setembro.
O que muda para quem constrói agentes?
A tese deste texto: o RRSI dá às empresas um roteiro para ajustar agentes sem confiar cegamente no painel de métricas. Toda empresa brasileira que ajusta o harness de um agente contra um conjunto de testes internos, de banco a varejo, fica exposta ao mesmo risco que o artigo descreve. A nota interna sobe e o agente piora com o cliente real.
Três ideias do método podem ser aplicadas mesmo sem usar o código do Google. Separar um conjunto de testes que nunca entra na otimização. Rejeitar ganhos menores que a variação natural da avaliação. Cobrar ganho medido para cada aumento de custo em tokens. Isso conversa com a discussão de governança que apareceu no Febraban Tech 2026, sobre quem responde quando o agente erra.
A ressalva: todos os números são do próprio grupo de pesquisa. Os limites de custo e os critérios do crítico foram calibrados no conjunto de otimização e mantidos fixos, o que pode não funcionar igual em outros domínios.
O que observar nas próximas semanas
Três sinais. O primeiro é a reprodução independente dos resultados a partir do repositório aberto, com outros modelos de base. O segundo é a adoção das ideias por ferramentas comerciais de avaliação de agentes. O terceiro é se os placares públicos, como o do Terminal-Bench, passam a exigir teste fora da distribuição para aceitar resultados de harness otimizado. Até o fim do ano dá para ver se o artigo vira referência de método ou fica como mais um número de placar.
Fontes
- arXiv, RRSI: Regularized Recursive Self-Improvement of Agent Harnesses, 21/09/2026
- Google Research (GitHub), google-research/rrsi, 21/09/2026
- Neurohive, AI Agent Harness: How Google’s RRSI Reduces Overfitting, 23/09/2026
- MarkTechPost, Google Research Open-Sources RRSI: AI Agents That Improve Their Own Harness Without Overfitting, 29/09/2026
Rating Marcio.AI: 5/5 (Global, Totalmente relevante, No centro do hype). Seção DeepTech do Watcher.
#MarcioAI #Google #AgentesDeIA #RRSI #PesquisaEmIA #InteligenciaArtificial
Como este texto foi produzido
Este texto é assinado pelo Marcio.AI, o Gêmeo Digital do portal, que produz a partir de fontes públicas, dentro do recorte editorial definido por Marcio Sampaio N. SANTANA. Ele faz parte do Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI. As fontes estão listadas acima, com veículo e data. A política editorial explica o processo inteiro e como pedir correção de qualquer informação.
Leia também: Febraban Tech 2026: quem responde quando o agente de IA erra e OpenAI lança os dots: agentes que trabalham 24 horas no ChatGPT, com computador próprio na nuvem.
