swe-bench

CompactionRL treina agentes de IA a resumir o próprio contexto

Pesquisadores da Universidade Tsinghua propõem treinar o resumo de contexto como parte da política do agente, em vez de tratá-lo…

4 semanas ago

GLM-5.2: Z.ai libera modelo open-weights de 744B com licenca MIT e passa GPT-5.5 em codificacao por 1/6 do custo

GLM-5.2 chega com 744B MoE, 1M de contexto, 62,1 no SWE-Bench Pro e licenca MIT - e faz mais barato…

1 mês ago

Grok 4.5 gasta 4,2x menos tokens que Opus 4.8 no SWE-Bench Pro: SpaceXAI aposta na eficiência para vencer no custo por tarefa

Grok 4.5 chega com foco em código e agentes: 15.954 tokens médios em SWE-Bench Pro contra 67.020 do Opus 4.8,…

2 meses ago