Grok 4.5 chega com foco em código e agentes: 15.954 tokens médios em SWE-Bench Pro contra 67.020 do Opus 4.8,…
Novo benchmark da OpenAI mede research taste em biologia computacional. GPT-5.6 Sol acerta 31,5%; Claude Opus 4.8 fica em 16%.…