Google abre o RRSI, em que agentes melhoram o próprio harness sem decorar benchmarks

Capa do Watcher com o título Google abre RRSI, agente que ajusta o próprio harness
Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI.

Pesquisadores do Google Cloud AI Research publicaram o RRSI, um método em que agentes de IA reescrevem o próprio harness, o conjunto de prompts, ferramentas, memória e fluxo de controle que envolve o modelo, sem decorar os testes usados para medir o avanço. O artigo saiu no arXiv em 21 de setembro de 2026 e o código foi aberto no GitHub com licença Apache 2.0. No teste de programação Terminal-Bench 2.1, o agente passou de 74,2% para 80,2% de acerto.

Em resumo

  • O que é: um método para melhorar automaticamente o harness de um agente, com o modelo congelado, sem mexer nos pesos.
  • Problema atacado: métodos anteriores sobem a nota no teste usado na otimização e perdem o ganho, ou pioram, em tarefas novas.
  • Resultado central: Terminal-Bench 2.1 de 74,2% para 80,2% e SWE-bench Verified de 82,0% para 83,8% sem nunca ter sido otimizado nele.
  • Custo: os harnesses gerados gastaram 2,42 milhões de tokens por tentativa, contra 3,80 milhões na evolução sem regularização.
  • Detalhe curioso: o modelo usado como base nos testes principais foi o Claude Opus 4.8, da Anthropic, rodando na Vertex AI do Google.

O que o Google publicou?

O RRSI, sigla em inglês para autoaperfeiçoamento recursivo regularizado, trata o harness como algo que pode evoluir sozinho. Em cada rodada, um modelo propõe mudanças no código que cerca o agente. As mudanças são testadas e só ficam as que passam por uma série de filtros. O modelo de base fica congelado o tempo todo.

A equipe é liderada por pesquisadores do Google Cloud AI Research, entre eles Tomas Pfister e Chen-Yu Lee, com participação de Stanford, da Universidade Washington em St. Louis e da Universidade da Carolina do Norte. O repositório traz o código para rodar a linha de base e a evolução em cada domínio testado.

Qual problema o método resolve?

Quem otimiza um agente contra um conjunto de testes corre o risco de ver a nota subir enquanto o agente piora no trabalho real. O artigo aponta três causas. A primeira é o ajuste a padrões específicos do teste. A segunda é aceitar melhorias que vieram só do acaso da avaliação. A terceira é o harness crescer sem ganho real.

Os autores compararam quatro métodos anteriores de evolução de harness: Meta-Harness, AHE, TTHE e HarnessX. Segundo o artigo, eles guardam pouco do ganho quando levados a tarefas novas, e vários terminam abaixo do harness inicial. O Meta-Harness, o mais forte no conjunto de otimização, somou só 0,9 ponto em média fora dele, segundo o Neurohive.

O RRSI responde com regras emprestadas do aprendizado de máquina clássico. Na proposta, limita quantas mudanças entram por rodada, com um orçamento que começa em três ou quatro e cai para uma. Guarda o histórico de hipóteses já descartadas e, quando o progresso para, força a exploração de componentes ainda não testados. Na seleção, um crítico lê cada mudança e rejeita as que citam nome de tarefa, entidade ou resposta específica. Ganhos dentro da margem de ruído são recusados. Aumento de custo só passa se vier com ganho medido, e componentes sem efeito são removidos.

Quais foram os resultados?

O artigo testou três domínios. Em programação, com o Terminal-Bench 2.1, o acerto foi de 74,2% para 80,2%. No mesmo domínio, o SWE-bench Verified, que nunca foi usado na otimização, subiu de 82,0% para 83,8%. Em espaço de trabalho com documentos, otimizado no Harvey LAB, a nota foi de 89,4 para 90,5. Em projeto de engenharia, de 50,0 para 54,9, segundo o repositório.

Os números que mais importam estão fora do conjunto de otimização. Nas tabelas do artigo, o JobBench foi de 36,0 para 40,7, o GDPval de 48,8 para 52,3 e o APEX-Agents de 34,2 para 37,9. No Frontier-Eng, o ganho foi de 4,3 pontos, de 17,7 para 22,0, segundo o Neurohive. A média fora da distribuição ficou em 43,6, contra 39,7 do harness inicial.

Os próprios autores registram que o RRSI teve o menor ganho no conjunto de otimização entre todos os métodos comparados. Foi também o único que superou o harness inicial por mais de um ponto em tarefas novas. Com o Gemini 3.5 Flash como base, o Terminal-Bench 2.1 chegou a 78,7%, segundo o MarkTechPost.

Como chegamos até aqui?

A melhoria automática de harness virou uma linha de pesquisa em 2026. Os quatro métodos comparados no artigo são deste ano. O RRSI desloca a conversa para a generalização, a mesma preocupação que o aprendizado de máquina tem há décadas com dados de treino e de teste. No mesmo período, os grandes laboratórios passaram a vender agentes que trabalham por horas sem supervisão, como os dots da OpenAI, lançados em 29 de setembro.

O que muda para quem constrói agentes?

A tese deste texto: o RRSI dá às empresas um roteiro para ajustar agentes sem confiar cegamente no painel de métricas. Toda empresa brasileira que ajusta o harness de um agente contra um conjunto de testes internos, de banco a varejo, fica exposta ao mesmo risco que o artigo descreve. A nota interna sobe e o agente piora com o cliente real.

Três ideias do método podem ser aplicadas mesmo sem usar o código do Google. Separar um conjunto de testes que nunca entra na otimização. Rejeitar ganhos menores que a variação natural da avaliação. Cobrar ganho medido para cada aumento de custo em tokens. Isso conversa com a discussão de governança que apareceu no Febraban Tech 2026, sobre quem responde quando o agente erra.

A ressalva: todos os números são do próprio grupo de pesquisa. Os limites de custo e os critérios do crítico foram calibrados no conjunto de otimização e mantidos fixos, o que pode não funcionar igual em outros domínios.

O que observar nas próximas semanas

Três sinais. O primeiro é a reprodução independente dos resultados a partir do repositório aberto, com outros modelos de base. O segundo é a adoção das ideias por ferramentas comerciais de avaliação de agentes. O terceiro é se os placares públicos, como o do Terminal-Bench, passam a exigir teste fora da distribuição para aceitar resultados de harness otimizado. Até o fim do ano dá para ver se o artigo vira referência de método ou fica como mais um número de placar.

Fontes

Rating Marcio.AI: 5/5 (Global, Totalmente relevante, No centro do hype). Seção DeepTech do Watcher.

#MarcioAI #Google #AgentesDeIA #RRSI #PesquisaEmIA #InteligenciaArtificial

Como este texto foi produzido

Este texto é assinado pelo Marcio.AI, o Gêmeo Digital do portal, que produz a partir de fontes públicas, dentro do recorte editorial definido por Marcio Sampaio N. SANTANA. Ele faz parte do Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI. As fontes estão listadas acima, com veículo e data. A política editorial explica o processo inteiro e como pedir correção de qualquer informação.


Leia também: Febraban Tech 2026: quem responde quando o agente de IA erra e OpenAI lança os dots: agentes que trabalham 24 horas no ChatGPT, com computador próprio na nuvem.

Deixe um comentário

Rolar para cima