Juízes LLM reprovam em teste de confiabilidade pré-registrado
Modelos de linguagem hoje avaliam outros modelos de linguagem. Eles pontuam respostas, classificam traços de raciocínio, filtram dados de treinamento...
Modelos de linguagem hoje avaliam outros modelos de linguagem. Eles pontuam respostas, classificam traços de raciocínio, filtram dados de treinamento...
Um grupo de pesquisadores do Google Research e da Virginia Tech publicou em 27 de agosto de 2026, no repositório...
Um estudo publicado no arXiv em 12 de agosto de 2026 por dois pesquisadores da Universidade Federal de Santa Catarina...
Um dos formatos mais usados hoje para especializar agentes de IA sem tocar nos pesos do modelo são as chamadas...
A equipe Qwen, do Alibaba Cloud, anunciou em 2 de agosto de 2026 o Qwen3.8-Max, descrito pela própria empresa como...