benchmarks de IA

Juízes LLM reprovam em teste de confiabilidade pré-registrado

Duas campanhas pré-registradas de pesquisadores britânicos pararam antes da pergunta central: o instrumento de medição não passou na validação. Em…

2 semanas ago

WikiSkill: wiki persistente melhora habilidades de agentes de IA

Pesquisadores do Google Research e da Virginia Tech separam trajetórias brutas, conhecimento consolidado e instruções ativas em três camadas. Nos…

3 semanas ago

Ranking de LLMs muda conforme o limite de tokens

Pesquisadores da UFSC rodaram 56.476 inferências variando o limite de tokens e mostraram que a ordem de classificação entre modelos…

1 mês ago

SkillProx audita e poda skills de agentes de IA sem treinar pesos

Pesquisadores de Hong Kong propõem medir a utilidade de cada instrução acumulada em uma skill e remover o que não…

1 mês ago

Qwen3.8-Max: Alibaba promete abrir pesos de modelo de 2,4 tri

Modelo de mistura de especialistas ativa 95 bilhões de parâmetros por token e traz rastros públicos de execuções autônomas de…

2 meses ago