
Pesquisadores do MIT, da Carnegie Mellon, da NYU e de Stanford publicaram nesta quarta-feira, 30 de setembro de 2026, na Nature, o Ataraxos, sistema de IA que venceu o holandês Pim Niemeijer, o jogador mais premiado da história do Stratego, por 15 vitórias, 1 derrota e 4 empates. O sistema joga melhor que o DeepNash, do Google DeepMind, e foi treinado com menos de um centésimo dos exemplos e com custo estimado abaixo de US$ 8 mil.
Em resumo
- O que é: uma IA para jogos de informação oculta que combina aprendizado por reforço com planejamento na hora da jogada.
- Resultado: 15 a 1, com 4 empates, numa série de 20 partidas contra Pim Niemeijer, dono de quatro títulos mundiais.
- Eficiência: menos de 1/100 dos exemplos de treino e menos de 1/30 das partidas de autojogo do DeepNash, segundo o MIT.
- Custo: menos de US$ 8 mil em computação, com 16 GPUs H100 por uma semana. O DeepNash teria custado de US$ 3 milhões a US$ 4,5 milhões.
- Além do Stratego: o mesmo método chegou a nível sobre-humano no Barrage Stratego e a resultados de ponta em Hanabi e dou dizhu.
Por que o Stratego era difícil para a IA?
No Stratego, cada jogador esconde a identidade das próprias peças. Ao contrário do xadrez, ninguém vê o tabuleiro inteiro. Blefe e despiste fazem parte do jogo. “No Stratego, há uma explosão de universos possíveis com que você pode ter de lidar”, disse ao MIT News Gabriele Farina, professor do MIT e autor sênior. Segundo ele, as técnicas criadas para o pôquer não escalavam para esse cenário.
Samuel Sokota, da Carnegie Mellon, autor principal, explicou a diferença ao MIT: no xadrez, a melhor jogada continua sendo a melhor jogada, não importa quantas vezes você a use. No Stratego, jogar sempre do mesmo jeito vira fraqueza.
Como o Ataraxos funciona?
São três peças. Uma rede de política e valor, treinada jogando contra si mesma, propõe jogadas e estima resultados. Uma rede de crenças, um modelo generativo, estima quais peças o adversário tem em cada casa. E uma busca na hora da jogada sorteia estados possíveis do tabuleiro e avalia as jogadas candidatas antes de escolher.
O artigo na Nature aponta um ajuste de treino como chave: a força da regularização, que obriga o sistema a variar a estratégia, é forte no começo e vai diminuindo. Segundo a The Decoder, o treino de autojogo levou uma semana em 16 GPUs Nvidia H100, mais quatro dias em quatro GPUs para a rede de crenças, sem nenhuma partida humana.
Os números batem entre as fontes?
O placar contra Niemeijer, 15 a 1 com 4 empates, é o mesmo no MIT, na Nature e na imprensa. A Nature fala em taxa efetiva de vitória de 85%, contando empate como meia vitória.
Há divergência no desempenho contra outros jogadores. O MIT fala em 39 vitórias e 2 derrotas contra jogadores de topo no campeonato mundial. A The Decoder e a Crypto Briefing contam 38 vitórias em 40 jogos. Também há confusão sobre a data da série contra Niemeijer: a The Decoder fala em outubro de 2026, o que é posterior à própria publicação, e a Crypto Briefing cita julho de 2025. Este texto usa o placar principal, em que todas as fontes concordam.
Sobre custo, a comparação de 1/500 da computação e de US$ 3 milhões a US$ 4,5 milhões para o DeepNash aparece na The Decoder e no AI Weekly. O MIT prefere comparar em exemplos de treino e partidas de autojogo.
Como chegamos até aqui?
O DeepMind apresentou o DeepNash em dezembro de 2022, na Science. Ele chegou ao top 3 de todos os tempos na Gravon, a maior plataforma online de Stratego, com 84% de vitórias contra especialistas humanos. Faltava vencer o melhor jogador do mundo de forma clara. O Ataraxos fez isso quase quatro anos depois, com uma fração do orçamento.
Para além dos jogos, os autores dizem que o método pode servir a problemas reais com informação oculta, como negociações e cibersegurança. A The Decoder registra que eles citam ainda mercado financeiro e cenários militares.
O que muda para pesquisa e empresas no Brasil?
O dado mais útil para quem está no Brasil é o custo. Um resultado de ponta publicado na Nature com menos de US$ 8 mil de computação, em 16 GPUs alugáveis por uma semana, fica ao alcance de grupos universitários e startups brasileiras. Isso vale para replicar o trabalho e para testar a técnica em problemas locais de decisão com informação incompleta, como leilões, negociação de contratos e defesa cibernética.
O que observar nas próximas semanas
Nossa leitura: o resultado reforça que, em certos problemas, algoritmo melhor rende mais que computação extra. Isso favorece laboratórios acadêmicos e grupos menores frente a quem aposta só em escala. Sinais para acompanhar até o fim do ano: a liberação de código e pesos do Ataraxos, a reprodução do resultado por outro grupo e a primeira aplicação fora de jogos, em negociação ou segurança, que é onde a promessa ainda não foi testada.
Fontes
- MIT News, Game-playing AI: Stratego has a new champ, 30/09/2026
- Nature, Scalable decision-making for games of imperfect information, 30/09/2026
- The Decoder, AI beats Stratego’s greatest player, ending one of the last human strongholds in board games, 30/09/2026
- Crypto Briefing, Ataraxos AI beats Stratego great Pim Niemeijer 15-1 on just 16 GPUs, 01/10/2026
- AI Weekly, Ataraxos beats top Stratego player on under-$8,000 budget, 01/10/2026
- Google DeepMind, Mastering Stratego, the classic game of imperfect information, 01/12/2022
Rating Marcio.AI: 4/5 (Global, Muito relevante, Muito próximo do hype). Seção DeepTech do Watcher.
#MarcioAI #Ataraxos #Stratego #AprendizadoPorReforco #MIT #IANaCiencia
Como este texto foi produzido
Este texto é assinado pelo Marcio.AI, o Gêmeo Digital do portal, que produz a partir de fontes públicas, dentro do recorte editorial definido por Marcio Sampaio N. SANTANA. Ele faz parte do Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI. As fontes estão listadas acima, com veículo e data. A política editorial explica o processo inteiro e como pedir correção de qualquer informação.
Leia também: Google abre o RRSI.
