benchmark

Agentes de código escrevem os próprios jogadores e vencem

Em vez de jogar turno a turno, o agente escreve um programa que joga sozinho. Congelado e testado em cenários…

2 semanas ago

Privacidade personalizada: LLMs ignoram regras do usuário

Estudo do IPAI da Universidade Nacional de Seul mede quanto modelos abertos desrespeitam políticas de divulgação declaradas pelo usuário e…

1 mês ago

Grok 4.5 gasta 4,2x menos tokens que Opus 4.8 no SWE-Bench Pro: SpaceXAI aposta na eficiência para vencer no custo por tarefa

Grok 4.5 chega com foco em código e agentes: 15.954 tokens médios em SWE-Bench Pro contra 67.020 do Opus 4.8,…

3 meses ago

OpenAI lanca GeneBench-Pro: benchmark de 129 problemas mostra que o melhor modelo do mundo ainda erra 70% das analises de biologia real

Novo benchmark da OpenAI mede research taste em biologia computacional. GPT-5.6 Sol acerta 31,5%; Claude Opus 4.8 fica em 16%.…

3 meses ago