arxiv

Argus: runtime de agentes de IA atinge 78% no SWE-Bench Pro

Relatório técnico da Microsoft com nove universidades descreve um runtime que mantém estado durável entre missões e só admite aprendizado…

2 meses ago

Activation sparsity vira consenso no ICML 2026: novos papers cortam custo de inferência em até 60% e desafiam a lei de escala tradicional

Papers do ICML 2026 consolidam esparsidade de ativação em LLMs: Sparsing Law, R-Sparse, La RoSA e Amber Pruner cortam custo…

2 meses ago

WorldCupArena avalia 13 LLMs e agentes de deep-research nas 104 partidas da Copa 2026 — só 4 sistemas cravaram Espanha campeã

Benchmark dinâmico WorldCupArena mede 13 modelos de IA em previsões pré-jogo da Copa 2026 em placar, jogadores, estatísticas e campeão…

3 meses ago

SEED: novo metodo de aprendizado por reforco faz agentes de IA melhorarem lendo os proprios erros

SEED, publicado no arXiv em 16 de julho de 2026, ensina agentes de IA a extrair habilidades das proprias trajetorias…

3 meses ago

ROMA: framework open-source para agentes recursivos multi-agente ganha 1,75x com GEPA+ e vira novo padrão de arquitetura

ROMA da Sentient AGI usa decomposição recursiva com Atomizer/Planner/Executor/Aggregator e supera baselines em SEAL-0, FRAMES e EQ-Bench.

3 meses ago

Mamba-3 chega ao ICLR 2026: como o novo modelo de espaco de estados corta pela metade o tamanho do estado e ainda ganha em precisao

Mamba-3 propoe recorrencia mais expressiva, atualizacao complexa e formulacao MIMO. Ganho de 0,6 a 1,2 ponto vs. Gated DeltaNet a…

3 meses ago