Em vez de jogar turno a turno, o agente escreve um programa que joga sozinho. Congelado e testado em cenários…
Preprint no arXiv constrói uma rede de quatro camadas e simula como o comprometimento de um fornecedor compartilhado de IA…
Duas campanhas pré-registradas de pesquisadores britânicos pararam antes da pergunta central: o instrumento de medição não passou na validação. Em…
Pesquisadores do Google Research e da Virginia Tech separam trajetórias brutas, conhecimento consolidado e instruções ativas em três camadas. Nos…
Estudo do IPAI da Universidade Nacional de Seul mede quanto modelos abertos desrespeitam políticas de divulgação declaradas pelo usuário e…
Pesquisadores do SRI International e do MIT Media Lab descrevem como modelos podem coordenar decisões por estados internos invisíveis na…
Pesquisadores da UFSC rodaram 56.476 inferências variando o limite de tokens e mostraram que a ordem de classificação entre modelos…
Framework criado por pesquisadores europeus e asiáticos executa ciclos completos de campanha em plataforma simulada, com até 100 mil agentes,…
O framework ABBEL faz o agente manter uma descrição explícita do que sabe e decidir só a partir dela. O…
Pesquisadores de Hong Kong propõem medir a utilidade de cada instrução acumulada em uma skill e remover o que não…