Nova técnica explora "assistant prefill" e burla guardrails de GPT-5.6, Claude Opus 4.8, Gemini 2.5 Pro e Llama 4; ataques…
Anthropic descreve um workspace silencioso dentro do Claude compativel com a Global Workspace Theory. O que isso significa para seguranca…
Chamada 'Scaling AI Safety for a Multi-Agent World' distribui ate US$ 1M por projeto para pesquisa em seguranca de populacoes…
Google Research propõe um teste de kernel com f-divergência regularizada para auditar machine unlearning com poucos milhares de amostras —…
Anthropic retira do Claude Code o ANTI_DISTILLATION_CC — código de esteganografia que rastreava suspeitas de distilação — após ban da…
EUA retiram embargo aos modelos Fable 5 e Mythos 5 após pacto de coordenação de segurança com a Anthropic; acesso…
Llama Guard 4 multimodal, LlamaFirewall com PromptGuard 2 + Agent Alignment + CodeShield, e Prompt Guard 2 em 22M e…
Casa Branca assina ordem executiva sobre IA avançada: acesso prévio de 30 dias a modelos frontier, AI Cybersecurity Clearinghouse e…
Anthropic acusa atores ligados ao Qwen da Alibaba de 28,8 milhoes de consultas com 25 mil contas falsas. O que…
Anthropic separa orquestração de execução: agente pensa na nuvem, age dentro do firewall do cliente. Para bancos, seguradoras e governo…