benchmark

Grok 4.5 gasta 4,2x menos tokens que Opus 4.8 no SWE-Bench Pro: SpaceXAI aposta na eficiência para vencer no custo por tarefa

Grok 4.5 chega com foco em código e agentes: 15.954 tokens médios em SWE-Bench Pro contra 67.020 do Opus 4.8,…

1 mês ago

OpenAI lanca GeneBench-Pro: benchmark de 129 problemas mostra que o melhor modelo do mundo ainda erra 70% das analises de biologia real

Novo benchmark da OpenAI mede research taste em biologia computacional. GPT-5.6 Sol acerta 31,5%; Claude Opus 4.8 fica em 16%.…

2 meses ago