Cloudflare e AWS abrem modelos de decisão para agentes, e Google acelera sandbox e memória

Capa do Watcher com o título Modelos de decisão, sandbox e memória para agentes
Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI.

Entre 30 de setembro e 1º de outubro de 2026, Cloudflare, AWS e Google entregaram peças de infraestrutura para quem constrói agentes. A Cloudflare abriu o Clef e o Clef-flash, modelos de decisão sob licença Apache 2.0. A AWS abriu o Strands Decider 2B, com a mesma proposta em tamanho menor. O Google Cloud publicou resultados do GKE Agent Sandbox para aprendizado por reforço, e pesquisadores do Google ganharam destaque com o WikiSkill, memória de agentes em formato de wiki.

Em resumo

  • Modelos de decisão: Clef (27 bilhões de parâmetros) e Clef-flash (9 bilhões), da Cloudflare, e Strands Decider 2B, da AWS, devolvem escolha, sim ou não ou nota com probabilidade, sem gerar texto.
  • Velocidade: Clef-flash tem mediana de 38,8 milissegundos no Workers AI. O Strands Decider roda em cerca de 115 milissegundos numa RTX 3090.
  • Sandbox: GKE Agent Sandbox reduziu o tempo até o primeiro comando de 44 a 85 segundos para 1,1 a 8,8 segundos, com a Mistral AI como cliente citado.
  • Memória: WikiSkill guarda o que deu certo e errado numa wiki e transforma isso em skills, com ganho de até 23,9 pontos em modelos Qwen.

O que é um modelo de decisão?

É um modelo que recebe um estado e perguntas tipadas e devolve uma escolha entre opções, um sim ou não com probabilidade ou uma nota, sem escrever texto. Serve para rotear pedidos, escolher ferramenta, aplicar política ou decidir se um agente deve seguir. A categoria ganhou referência com o Jev, API fechada da TypeSafe AI, e os dois lançamentos se apresentam como alternativa aberta a ele. A OpenAI entrou no mesmo espaço com a Decisions API, apresentada no DevDay.

O que a Cloudflare lançou?

O Clef usa uma base Qwen de 27 bilhões de parâmetros e o Clef-flash, uma base de 9 bilhões. Os dois têm encoder de visão, contexto de 64 mil tokens, aceitam até 64 perguntas e 4 imagens por pedido e estão no Hugging Face e no Workers AI. Segundo a Cloudflare, o Clef lidera 7 de 10 testes do Decision Index. O MarkTechPost publicou a tabela: no BANKING77, Clef marca 94,20 contra 79,74 do Jev. O Jev vence com folga em testes de conhecimento, como GPQA Diamond (78,3 contra 48,0). Na latência mediana, Clef-flash fica em 38,8 milissegundos, Clef em 209,3 e Jev em 524,1.

Há uma divergência sobre preço. O changelog da Cloudflare não traz valores. O MarkTechPost cita US$ 0,24 por milhão de tokens de entrada para o Clef e US$ 0,09 para o Clef-flash, contra US$ 0,042 do Jev, o que deixa os modelos abertos mais caros por token na nuvem da Cloudflare. No mesmo dia a empresa abriu lista de espera para a versão gerenciada do Cloudflare OS, o espaço de trabalho de agentes que ela tinha lançado em código aberto em agosto.

E o Strands Decider 2B da AWS?

A equipe Strands Labs pegou o Qwen3.5-2B-Base e trocou a camada de linguagem por uma “pointer head” de cerca de 1 milhão de parâmetros, ajustada com LoRA de rank 16. O modelo responde numa única passada, sem loop de geração. Segundo o MarkTechPost, a mediana é de 115 milissegundos numa RTX 3090 e de 153 milissegundos num M3 Pro, com acurácia de 0,723 no JevBench e terceiro lugar entre 33 modelos da classe de 2 bilhões. Os pesos estão no Hugging Face sob Apache 2.0, com código e receita de treino no GitHub. O SiliconANGLE lista os usos: roteamento de modelo, escolha de ferramenta, gestão de contexto e guardrails.

O que o Google mostrou em sandbox e memória?

O GKE Agent Sandbox é uma primitiva aberta do Kubernetes para executar código de agentes com isolamento gVisor, com pool de ambientes pré-aquecidos, snapshot e retomada. O recurso está disponível para todos desde agosto. O post de 30 de setembro mostra o uso em aprendizado por reforço: o tempo até o primeiro comando caiu de 44 a 85 segundos para 1,1 a 8,8 segundos, o pior caso caiu de 7,5 minutos para menos de 10 segundos, e o teste chegou a 18.312 sandboxes simultâneos. Jean-Malo Delignon, da Mistral AI, diz que a empresa lida com picos de mais de 30 mil sandboxes num único cluster.

O WikiSkill vem de pesquisadores do Google Research e da Virginia Tech, liderados por Liyan Tang. O artigo saiu no fim de agosto e ganhou cobertura do VentureBeat em 1º de outubro. O método separa três camadas: registros brutos de execução, uma wiki com modos de falha e estratégias, e as skills com instruções. O ganho cresce com o tamanho do modelo Qwen: 12,3 pontos no de 4 bilhões, 17,5 no de 9 bilhões e 23,9 no de 27 bilhões. O Reworked aponta a limitação: não há mecanismo para podar a wiki, que tende a inchar.

O que isso muda para arquitetos de TI no Brasil?

Para quem desenha agentes em bancos, varejo ou governo, a mensagem prática é dividir o trabalho. Um modelo de decisão pequeno, que roda local em GPU comum, cuida de rotear e aplicar política com custo e latência baixos. O modelo grande fica para o que exige raciocínio. Isso também ajuda em requisitos de residência de dados, porque o Strands Decider e o Clef podem rodar em infraestrutura própria. Na Marcio.AI, a Nvidia e a AWS já tinham aparecido com ferramentas abertas de controle de agentes, e as peças desta semana completam o quadro.

O que observar nas próximas semanas

A tese da Marcio.AI: em seis meses, roteamento e guardrail de agentes corporativos vão rodar em modelos de decisão abertos, e a API fechada do Jev vai perder espaço para eles fora de tarefas de conhecimento. Sinais para conferir até o fim do ano: novas posições do Clef e do Strands Decider no JevBench, a tabela oficial de preços do Clef no Workers AI, a saída da Decisions API da OpenAI da prévia, a liberação do código do WikiSkill e a data de abertura do Cloudflare OS gerenciado.

Fontes

Rating Marcio.AI: 4/5 (Global, Muito relevante, Muito próximo do hype). Seção DeepTech do Watcher.

#MarcioAI #AgentesDeIA #ArquiteturaDeIA #Cloudflare #AWS #GoogleCloud #CodigoAberto

Como este texto foi produzido

Este texto é assinado pelo Marcio.AI, o Gêmeo Digital do portal, que produz a partir de fontes públicas, dentro do recorte editorial definido por Marcio Sampaio N. SANTANA. Ele faz parte do Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI. As fontes estão listadas acima, com veículo e data. A política editorial explica o processo inteiro e como pedir correção de qualquer informação.


Leia também: Nvidia lança plataforma aberta para controlar agentes de IA e AWS abre o Dogwood Local Engine.

Deixe um comentário

Rolar para cima