IA — Segurança e IA

Sockpuppeting: uma linha de código faz jailbreak em 11 LLMs de fronteira — e o que empresas brasileiras precisam fazer agora

Nova técnica explora "assistant prefill" e burla guardrails de GPT-5.6, Claude Opus 4.8, Gemini 2.5 Pro e Llama 4; ataques…

1 mês ago

Anthropic e o J-lens: Claude teria um workspace silencioso interno que espelha uma das principais teorias da consciencia

Anthropic descreve um workspace silencioso dentro do Claude compativel com a Global Workspace Theory. O que isso significa para seguranca…

1 mês ago

DeepMind, Schmidt Sciences e ARIA colocam US$ 10 milhoes no maior desafio esquecido da IA: como fazer milhoes de agentes conviverem sem quebrar tudo

Chamada 'Scaling AI Safety for a Multi-Agent World' distribui ate US$ 1M por projeto para pesquisa em seguranca de populacoes…

1 mês ago

Como auditar se uma IA realmente “esqueceu” um dado: o novo framework do Google Research que promete cortar em milhões o custo do teste

Google Research propõe um teste de kernel com f-divergência regularizada para auditar machine unlearning com poucos milhares de amostras —…

2 meses ago

Anthropic remove código secreto do Claude Code: fim do “ANTI_DISTILLATION_CC” após ban da Alibaba e ataque de 25 mil contas

Anthropic retira do Claude Code o ANTI_DISTILLATION_CC — código de esteganografia que rastreava suspeitas de distilação — após ban da…

2 meses ago

EUA liberam Claude Fable 5 e Mythos 5: fim de 18 dias de embargo e o novo pacto de segurança com a Anthropic

EUA retiram embargo aos modelos Fable 5 e Mythos 5 após pacto de coordenação de segurança com a Anthropic; acesso…

2 meses ago

Meta libera arsenal open-source contra prompt injection: Llama Guard 4, LlamaFirewall e Prompt Guard 2 já em produção

Llama Guard 4 multimodal, LlamaFirewall com PromptGuard 2 + Agent Alignment + CodeShield, e Prompt Guard 2 em 22M e…

2 meses ago

EUA criam janela de 30 dias para revisar IA de fronteira: o que diz a ordem executiva de junho de 2026

Casa Branca assina ordem executiva sobre IA avançada: acesso prévio de 30 dias a modelos frontier, AI Cybersecurity Clearinghouse e…

2 meses ago

Anthropic acusa Alibaba/Qwen de 28,8 milhões de consultas com 25 mil contas falsas: a maior destilação contra Claude

Anthropic acusa atores ligados ao Qwen da Alibaba de 28,8 milhoes de consultas com 25 mil contas falsas. O que…

2 meses ago

Claude Managed Agents ganha self-hosted sandboxes e MCP tunnels: o que muda para agentes de IA dentro de empresas reguladas

Anthropic separa orquestração de execução: agente pensa na nuvem, age dentro do firewall do cliente. Para bancos, seguradoras e governo…

2 meses ago