Activation sparsity vira consenso no ICML 2026: novos papers cortam custo de inferência em até 60% e desafiam a lei de escala tradicional

Resumo: Uma safra de papers apresentada no ICML 2026 consolidou o que virou tema dominante na pesquisa de LLMs este semestre: activation sparsity, a ideia de que a maior parte dos parâmetros de um modelo não precisa acender em cada token. Trabalhos como Sparsing Law, R-Sparse, Amber Pruner e o novo La RoSA mostraram, com metodologias diferentes, que modelos treinados com esparsificação seletiva alcançam desempenho comparável ao de modelos 3× maiores em benchmarks de raciocínio, com redução real de custo de inferência. É uma virada silenciosa: 2026 pode ser o ano em que eficiência deixa de ser sinônimo de “modelo pequeno”.

O que é activation sparsity — em linguagem simples

Um Transformer clássico ativa todos os parâmetros de uma camada para cada token processado — mesmo quando o token é banal. Papers recentes mostraram que, na prática, apenas uma fração desses pesos contribui de forma significativa para a saída em cada passo. Activation sparsity é a família de técnicas que aproveita esse fato de duas formas: (1) escolhendo durante a inferência quais neurônios acender, para poupar computação; (2) treinando o modelo de forma a induzir essa esparsidade, tornando-a previsível e maior.

O caso mais visível dessa lógica é a arquitetura Mixture of Experts (MoE), que só ativa um subconjunto de especialistas por token — e que aparece hoje em Kimi K3, GLM-5.2, DeepSeek V4 e nos modelos de fronteira da Google. O que os papers de 2026 mostram é que a esparsidade útil não se limita à MoE: mesmo dense models exibem “esparsidade funcional” espontânea, que pode ser exposta e explorada sem retreino completo.

Papers que mudaram o consenso este mês

  • Sparsing Law (ICML 2026 oral) — propõe uma “lei de escala” para esparsidade: modelos maiores exibem naturalmente mais esparsidade útil, e há uma relação previsível entre largura, profundidade e fração de neurônios silenciáveis. Implicação: quanto maior o modelo, maior o desconto potencial de inferência.
  • R-Sparse (arXiv 2504.19449) — introduz esparsidade ciente do rank em canais de entrada e componentes SVD; elimina a etapa de prever ativações, funciona para atenção e MLP, e chega a taxas de esparsidade mais altas sem treino adicional.
  • Amber Pruner (arXiv 2508.02128) — aplica esparsidade N:M na fase de prefill, onde o custo é mais alto em janelas longas; corta latência inicial em contextos de 128k+ sem tocar em decode.
  • La RoSA (arXiv 2507.01299) — rotação camada a camada dos pesos antes de esparsificar; ganha 15–20% de eficiência adicional sobre técnicas anteriores em benchmarks de raciocínio.
  • Universal Properties of Activation Sparsity (arXiv 2509.00454) — evidência empírica de que a esparsidade é universal em LLMs modernos, independentemente de escala ou família, sugerindo que a característica é intrínseca à arquitetura Transformer.

Por que importa

Três impactos merecem atenção. Primeiro, custo de inferência: técnicas de esparsidade estão reduzindo em 30% a 60% o preço por token gerado em condições realistas, com queda equivalente em consumo de energia. Isso muda o cálculo de TCO em qualquer aplicação que rode LLM em escala — de chatbots até pipelines de RAG corporativos. Segundo, on-device AI: modelos de 30B a 70B parâmetros esparsificados começam a caber, com performance útil, em GPUs de consumidor (24 GB de VRAM) e em edge (Jetson Orin, Snapdragon X Elite). Terceiro, competição com open-weights: laboratórios chineses (Moonshot, Zhipu/Z.ai, DeepSeek) adotaram MoE + esparsidade agressiva como estratégia central, e agora a base científica dessa aposta virou consenso ocidental.

Status no Brasil

Grupos de pesquisa brasileiros começam a se posicionar. C4AI-USP, Cin-UFPE e o LIS/UFMG têm papers submetidos para NeurIPS 2026 explorando esparsidade em modelos de português (Sabiá, Bode, Cabrita). No mercado, a AWS Bedrock e a Google Cloud Vertex já ofertam versões esparsificadas de alguns modelos com desconto, e a Deep Learning Brasil e a Preditiva vêm colocando esses ganhos em produtos de análise jurídica e clínica sob demanda.

Riscos e limitações

Não é bala de prata. Cinco caveats importantes: (1) hardware — a maior parte dos ganhos teóricos exige suporte explícito da GPU para esparsidade estruturada; H100/H200 e MI300 rodam bem, mas a base instalada de A100 e V100 se beneficia menos; (2) não uniformidade por tarefa — código e matemática toleram mais esparsidade que geração criativa; (3) degradação silenciosa em contextos muito longos (32k+), onde a esparsidade pode “esconder” cabeças de atenção necessárias para needle-in-haystack; (4) dificuldade de fine-tuning — LoRA sobre modelo esparsificado é área ativa de pesquisa; (5) avaliação incompleta — benchmarks tradicionais não capturam bem a queda de qualidade em nichos.

Cenário: o que vem por aí

Duas apostas seguras para o segundo semestre de 2026: (a) todo modelo de fronteira publicado em Q4 usa alguma variante de esparsidade, incluindo os proprietários (GPT-5.7, Claude Fable 5.5, Gemini 3.6 Pro); (b) o próximo salto de custo virá do casamento entre esparsidade e speculative decoding, técnica que já roda em produção na Anthropic e no Google. Aposta menos segura, mas provável: os primeiros modelos treinados from scratch com esparsidade nativa embutida — não só induzida — devem aparecer no NeurIPS de dezembro.

Conclusão prática — o que mudar hoje

Para times de ML que operam LLMs em produção: (1) refazer benchmark de custo — versões esparsificadas de Llama 3.3 70B, Qwen 3, Mistral Large 3 já estão disponíveis em Hugging Face e podem reduzir a fatura em 40%+ sem perder mensurabilidade; (2) testar em domínios reais — não confiar no MMLU: rodar a bateria de avaliação interna do seu produto antes de virar chave; (3) acompanhar suporte de hardware — o próximo TCO de infra pode depender de esperar 90 dias por uma leva de H200 ou de trocar para AMD MI325X. Para pesquisadores e estudantes brasileiros, o momento é raro: esparsidade combina alto impacto prático com barreira de entrada relativamente baixa, e há espaço para contribuição original sem depender de compute de fronteira.

Fonte original: “Universal Properties of Activation Sparsity in Modern Large Language Models” — arXiv (2026). Referências adicionais: Sparsing Law (ICML), La RoSA.

Ninja

Na cena de cybersecurity a mais de 25 anos, Ninja trabalha como evangelizador de segurança da informação no Brasil. Preocupado com a conscientização de segurança cibernética, a ideia inicial é conseguir expor um pouco para o publico Brasileiro do que acontece no mundo.

Recent Posts

Fundo da TIM aporta na Enter e reacende aposta em legal tech de IA no Brasil em meio a captação 76% menor no ano

Fundo ligado à TIM e Upload Ventures aporta na Enter, legal tech de IA brasileira.…

2 horas ago

Claude Opus 5 chega em 24 de julho pelo mesmo preço do Opus 4.8: 43,3% no Frontier-Bench, contexto de 1M e novo modo rápido

Anthropic lançou o Claude Opus 5 em 24 de julho: 43,3% no Frontier-Bench, contexto de…

2 horas ago

Wi-Fi de hotel virou armadilha: DNS poisoning captura credenciais corporativas de executivos em viagem

ReliaQuest expõe campanha global que compromete roteadores de Wi-Fi em hotéis e centros de convenções…

4 dias ago

Laundry Bear: alerta internacional expõe campanha russa que sequestra webmails Zimbra sem clique

CISA, FBI, NSA e agências dos Cinco Olhos alertam para campanha do grupo russo Laundry…

4 dias ago