Em vez de jogar turno a turno, o agente escreve um programa que joga sozinho. Congelado e testado em cenários…
Estudo do IPAI da Universidade Nacional de Seul mede quanto modelos abertos desrespeitam políticas de divulgação declaradas pelo usuário e…
Grok 4.5 chega com foco em código e agentes: 15.954 tokens médios em SWE-Bench Pro contra 67.020 do Opus 4.8,…
Novo benchmark da OpenAI mede research taste em biologia computacional. GPT-5.6 Sol acerta 31,5%; Claude Opus 4.8 fica em 16%.…