arxiv

Agentes de IA podem combinar ações fora do registro público

Pesquisadores do SRI International e do MIT Media Lab descrevem como modelos podem coordenar decisões por estados internos invisíveis na…

2 dias ago

Ranking de LLMs muda conforme o limite de tokens

Pesquisadores da UFSC rodaram 56.476 inferências variando o limite de tokens e mostraram que a ordem de classificação entre modelos…

1 semana ago

IO Factory simula campanhas de influência com agentes de IA

Framework criado por pesquisadores europeus e asiáticos executa ciclos completos de campanha em plataforma simulada, com até 100 mil agentes,…

1 semana ago

Berkeley troca resumo por estados de crença na memória de agentes

O framework ABBEL faz o agente manter uma descrição explícita do que sabe e decidir só a partir dela. O…

2 semanas ago

SkillProx audita e poda skills de agentes de IA sem treinar pesos

Pesquisadores de Hong Kong propõem medir a utilidade de cada instrução acumulada em uma skill e remover o que não…

2 semanas ago

Argus: runtime de agentes de IA atinge 78% no SWE-Bench Pro

Relatório técnico da Microsoft com nove universidades descreve um runtime que mantém estado durável entre missões e só admite aprendizado…

2 semanas ago

Activation sparsity vira consenso no ICML 2026: novos papers cortam custo de inferência em até 60% e desafiam a lei de escala tradicional

Papers do ICML 2026 consolidam esparsidade de ativação em LLMs: Sparsing Law, R-Sparse, La RoSA e Amber Pruner cortam custo…

4 semanas ago

WorldCupArena avalia 13 LLMs e agentes de deep-research nas 104 partidas da Copa 2026 — só 4 sistemas cravaram Espanha campeã

Benchmark dinâmico WorldCupArena mede 13 modelos de IA em previsões pré-jogo da Copa 2026 em placar, jogadores, estatísticas e campeão…

1 mês ago

SEED: novo metodo de aprendizado por reforco faz agentes de IA melhorarem lendo os proprios erros

SEED, publicado no arXiv em 16 de julho de 2026, ensina agentes de IA a extrair habilidades das proprias trajetorias…

1 mês ago

ROMA: framework open-source para agentes recursivos multi-agente ganha 1,75x com GEPA+ e vira novo padrão de arquitetura

ROMA da Sentient AGI usa decomposição recursiva com Atomizer/Planner/Executor/Aggregator e supera baselines em SEAL-0, FRAMES e EQ-Bench.

1 mês ago