interpretabilidade

Agentes de IA podem combinar ações fora do registro público

Pesquisadores do SRI International e do MIT Media Lab descrevem como modelos podem coordenar decisões por estados internos invisíveis na…

3 dias ago

Anthropic e o J-lens: Claude teria um workspace silencioso interno que espelha uma das principais teorias da consciencia

Anthropic descreve um workspace silencioso dentro do Claude compativel com a Global Workspace Theory. O que isso significa para seguranca…

2 meses ago