Imagem editorial original do Plugged Ninja
Um preprint listado nas submissões recentes de cs.AI do arXiv em 17 de setembro de 2026 propõe uma inversão simples e com consequências grandes: em vez de colocar um modelo de linguagem para jogar, colocá-lo para escrever o programa que joga. O trabalho, assinado por Joey Xiao (New York University) e Haonan Huang (Princeton University), recebeu o identificador arXiv:2609.18996 e está sob licença CC BY 4.0.
Uma nota de transparência antes de seguir: o registro do preprint apresenta um carimbo de data de julho de 2026 no próprio documento, embora tenha aparecido na listagem de submissões recentes de 17 de setembro. Adotamos aqui a data da listagem e o identificador, que é o que permite localizar o material.
Os autores chamam a capacidade descrita de compiled agency — agência compilada. A definição deles: experiência de desenvolvimento compilada em um agente executável persistente cuja arquitetura é construída pelo próprio modelo.
Agentes de código e agentes de linguagem em geral têm um histórico ruim em jogos. Sistemas capazes de descrever regras e estratégias plausíveis costumam falhar na hora de converter esse conhecimento em jogo competente — o que a literatura chama de knowing–doing gap, a lacuna entre saber e fazer.
A dificuldade é maior quanto mais longo o horizonte. Em jogos de grande estratégia como Civilization, que exigem planejamento coerente ao longo de centenas de turnos, agentes de linguagem sem apoio externo têm dificuldade até para sobreviver a uma partida completa. Os sistemas que conseguiam vencer dependiam de chamadas ao modelo a cada turno e de uma camada tática programada à mão por pesquisadores.
A resposta dominante da área foi construir andaimes em torno do modelo: abstrações de observação fornecidas pelos pesquisadores, memória persistente, bibliotecas de habilidades, planejadores, representações de mundo. Este trabalho vai na direção contrária e remove os andaimes.
Os autores montaram um arcabouço chamado Gauntlet, com um ciclo de três fases: desenvolver, congelar e avaliar. O agente recebe um contrato deliberadamente pobre — a descrição do jogo, a interface bruta de observação e ação, e um arquivo de política vazio. Nada de estratégia, algoritmo ou arquitetura sugerida.
Em uma única sessão autônoma, o agente experimenta com o jogo ao vivo e constrói um controlador independente. Esse programa é então congelado e avaliado em instâncias inéditas, com zero chamadas ao modelo durante a partida. O que joga é o código, não a IA.
O detalhe importa: o protocolo não é livre de infraestrutura. Os pesquisadores fornecem objetivo, interface de ação, ambiente executável e ferramentas gerais de software. O que eles não fornecem é estratégia nem arquitetura — o prompt pede desenvolvimento empírico (escreva uma política, rode, inspecione os dados, revise) e não vaza nenhum método.
O primeiro teste usou um jogo procedural inédito, não publicado, justamente para eliminar a possibilidade de o modelo já conhecer o material do treinamento. O controlador precisa eliminar inimigos gerados proceduralmente, coletar experiência, escolher melhorias, sobreviver a três ondas e destruir uma sequência de chefes dentro de 90 mil passos. Tanto um controlador guloso quanto uma linha de base escrita à mão pelos pesquisadores falharam em todas as 80 sementes de avaliação.
Os resultados, na melhor configuração testada de cada sistema, formam uma escada nítida:
| Sistema | Taxa de sucesso |
|---|---|
| Haiku 4.5 | 0,0% |
| Sonnet 4.6 | 5,3% |
| GPT-5.4 | 7,1% |
| MiniMax M3 | 10,5% |
| Gemini 3.1 Pro | 12,9% |
| GPT-5.5 | 19,4% |
| Opus 4.8 | 41,2% |
| Fable 5 | 82,5% |
| GPT-5.6-sol | 86,25% |
Os próprios autores pedem cautela na leitura: as células do topo têm poucas amostras — quatro sessões para um sistema, três para o outro — e não devem ser ranqueadas entre si. O que eles consideram significativo é o degrau: todas as quatro sessões do sistema de geração mais recente (que limparam 80, 69, 64 e 51 sementes) superaram a melhor sessão da geração anterior (47, 45, 21 e 19).
Essa é uma forma de medição diferente da usual. Em vez de comparar pontuações médias de um modelo jogando, compara a qualidade do artefato de software que cada modelo consegue produzir sozinho — algo inspecionável linha a linha.
Os dois testes seguintes usaram jogos comerciais completos, com texturas de controle opostas.
No StarCraft II — tempo real, estado oculto, três raças adversárias e uma cadência de ações que nenhum modelo de linguagem em laço consegue sustentar em velocidade nativa —, o agente recebeu as definições brutas do protocolo cliente e um executor neutro em Python. Sem framework de bot, sem ordem de construção pronta. O controlador campeão derrotou todos os níveis justos da IA embutida do jogo, e ainda venceu variantes que trapaceiam: 5 vitórias em 6 contra a que enxerga o mapa inteiro e 2 em 6 contra a que recebe recursos extras. Perdeu para a variante mais agressiva das que trapaceiam. Os autores classificam esse perfil como um atlas de um artefato selecionado em um único mapa, não como expectativa de desempenho de uma sessão nova qualquer.
No Freeciv, versão livre de Civilization, o desafio é outro. A vitória por conquista exige eliminar todas as cidades e todas as unidades inimigas: capturar a capital de um rival grande faz o restante se fragmentar em novas civilizações, e um adversário continua vivo enquanto tiver uma única cidade ou unidade. As partidas rodaram no ambiente CivRealm, 1 contra 1 contra a IA de nível novato, em mapa pequeno de massa continental única, com prazo de 750 turnos — chegar ao prazo conta como derrota.
O detalhe que dá dimensão ao problema: a IA novata é fácil de sobreviver e difícil de conquistar. Deixada em paz, sua economia composta chega a pontuações entre 400 e 1700, enquanto políticas típicas estagnam entre 130 e 330. Cada vitória é uma corrida contra uma bola de neve. Três sessões independentes produziram programas congelados, avaliados em 12 sementes inéditas cada. Em uma das partidas documentadas, o motor declarou conquista no turno 161, quando a última unidade rival foi eliminada.
Os autores são explícitos quanto ao ineditismo e quanto ao tamanho dele: nenhum sistema baseado em agentes de linguagem havia vencido partidas completas desse gênero de forma independente, sem chamadas por turno e sem camada tática feita à mão — ainda que, ressalvam, a taxas modestas e contra a IA novata.
Um achado secundário merece destaque. Comparando os três programas produzidos em sessões isoladas para o Freeciv, oito de nove elementos de estratégia foram implementados de forma independente em todos os três — verificados arquivo por arquivo, linha por linha. O nono elemento, a gestão de guerra civil, converge no objetivo mas diverge no mecanismo: dois programas adiam a tomada da capital de um rival grande, enquanto o terceiro detecta e caça os fragmentos resultantes.
Ou seja, partindo de um arquivo vazio e sem qualquer orientação, sessões independentes chegaram à mesma doutrina por caminhos diferentes, com organizações de código distintas.
O artigo tem uma seção de limitações longa e honesta, e vale reproduzi-la em resumo:
Os autores resumem a própria conclusão com moderação: os agentes de código começam a acompanhar estratégia de longo horizonte — não a dominam.
Duas leituras práticas emergem.
A primeira é sobre custo e inspecionabilidade. Um programa congelado roda sem nenhuma chamada de inferência, custa frações de centavo por partida e pode ser lido, auditado e corrigido por um humano. Isso é o oposto do agente que consulta um modelo a cada passo — e é uma resposta direta a duas objeções recorrentes em ambientes corporativos: previsibilidade de custo e rastreabilidade de decisão. A mesma lógica aparece em outro trabalho recente, o Retrieve-for-Train do Google Research, que também troca raciocínio caro em tempo de execução por um artefato leve produzido uma vez.
A segunda é sobre como avaliar modelos. Se a arquitetura passa a ser uma saída do modelo, e não uma entrada fornecida pelo pesquisador, os benchmarks que medem respostas isoladas capturam cada vez menos do que interessa. Medir o software que o modelo consegue escrever sozinho, e depois congelá-lo e testá-lo em cenários inéditos, é um protocolo mais difícil de contaminar — o artefato ou funciona nas instâncias novas, ou não funciona.
Há também um alerta implícito para quem trabalha com segurança. A mesma capacidade de construir, a partir de uma interface bruta e de um objetivo, um programa autônomo que opera por horas sem supervisão não é específica de jogos. Este trabalho não trata de uso ofensivo e não há evidência de aplicação desse tipo aqui, mas a propriedade que ele demonstra — arquitetura como saída, execução sem o modelo no laço — é relevante para quem pensa em modelagem de ameaças de médio prazo.
O que observar a seguir: replicação por terceiros, testes contra níveis de dificuldade acima do novato no Freeciv, e se os programas congelados mantêm desempenho em mapas e regras fora da configuração avaliada.
Em vez de gastar centenas de tokens de raciocínio a cada consulta, o Google treina…
Um e-mail comum, processado por um appliance desatualizado, basta para executar comandos como root. A…
Análise da Unit 42 mostra o AMOS instalado por páginas que prometem um kit para…
A Cisco Talos rastreou por meses uma operação que convence a própria vítima a injetar…
A Sophos X-Ops dissecou um implante Linux que altera como o Apache enxerga arquivos PHP…
Preprint no arXiv constrói uma rede de quatro camadas e simula como o comprometimento de…