Resumo: Um grupo formado por MIT CSAIL, Liquid AI, Max Planck Institute for Intelligent Systems, ELLIS e ETH Zurich apresentou no ICLR 2026 uma tecnica batizada de CompreSSM que faz o modelo emagrecer enquanto ele ainda esta sendo treinado, em vez de esperar o fim para podar. Em benchmarks de classificacao de imagem os autores mostram ate 1,5x mais velocidade de treinamento com acuracia praticamente igual a do modelo full-size – um resultado que interessa a quem paga a conta de GPU e a quem quer rodar IA no dispositivo.
O trabalho, liderado por Makram Chahine, doutorando de EECS no CSAIL, mira uma familia especifica de arquiteturas chamada state-space models (SSMs). SSMs viraram alternativa aos Transformers em tarefas com sequencia longa – de linguagem a audio e robotica – porque escalam melhor em memoria. O problema e que treinar SSMs grandes ainda custa caro. A ideia do CompreSSM e olhar constantemente para os parametros do modelo durante o treinamento e identificar quais partes nao estao contribuindo, cortando-as antes que continuem consumindo compute.
Para decidir o que sai, o time importa ferramentas matematicas da teoria de controle. Cada bloco do SSM e visto como um sistema dinamico cuja “contribuicao” pode ser medida: parametros com pouca influencia na saida sao candidatos naturais a poda. Feita a operacao, o modelo continua treinando – so que menor, mais barato e mais rapido a cada iteracao.
Duas frentes se beneficiam de imediato. A primeira e o custo. Corte de 30-50% no tempo de treino se traduz direto em fatura de nuvem menor e permite que grupos com orcamento modesto – que e a maioria dos laboratorios brasileiros – treinem baselines competitivos. A segunda e o edge: SSMs enxutos cabem em celular, sensor industrial e microcontrolador. Para setores brasileiros com pouca conectividade – do agro a mineracao – poder rodar um modelo bom sem depender de datacenter destrava aplicacoes que hoje so existem em piloto.
Vale lembrar que a Liquid AI, coautora, e uma spin-off do proprio CSAIL, e vem defendendo ha dois anos que arquiteturas alternativas ao Transformer serao o padrao do edge. O paper e mais um voto de confianca nessa aposta.
O ganho reportado e em state-space models – nao e uma varinha magica que reduz Transformers pela metade da noite para o dia. Alem disso, os benchmarks divulgados sao de visao computacional, especificamente classificacao de imagem. Estender o metodo a linguagem e audio deve ser possivel (SSMs sao notoriamente bons nessas tarefas), mas ainda depende de replicacao independente. Por fim, a decisao de “o que podar” usa suposicoes da teoria de controle sobre a dinamica interna do modelo; se o objetivo do treinamento mudar drasticamente no meio do caminho, o criterio pode subestimar componentes que so serao uteis mais tarde.
A tendencia e clara: em 2026, a competicao saiu do “quem tem mais parametros” e passou para “quem entrega a mesma capacidade com menos”. CompreSSM entra na mesma familia de trabalhos que a Anthropic, a Google DeepMind e a NVIDIA vem publicando sobre selective activation sparsity, roteamento em MoE e destilacao online. O padrao de mercado nos proximos 12 meses deve incluir alguma forma de poda continua durante o treinamento – nao como pos-processamento opcional, mas como parte do loop.
Se voce trabalha com pesquisa aplicada, vale ler o paper e monitorar o repositorio dos autores; a matematica de controle usada e reaproveitavel em outras arquiteturas. Se voce e engenheiro de plataforma, o take-away e o mesmo do ultimo ciclo: qualquer estimativa de custo de treinamento feita antes de 2026 provavelmente esta superestimada – replaneje. E se voce e gestor tentando decidir entre “treinar do zero” e “afinar um modelo pronto”, este tipo de tecnica encurta o intervalo em que treinar do zero deixa de fazer sentido.
AIVD e MIVD confirmam que servico russo escaneia e invade cameras IP mal configuradas na…
Atacantes exploraram vulnerabilidade sem patch no e-learning da Academia Nacional Diplomatica sul-coreana entre abril de…
Volexity revela cadeia SSRF + injecao de comandos usada por semanas em appliances SonicWall SMA…
A operacao de chips da AWS - Trainium, Graviton e Nitro - chegou a US$…
Nova pesquisa da VentureBeat expoe o evaluation gap: 50% das empresas lancaram agentes de IA…
DeepMind e Isomorphic Labs anunciaram em 16 de julho um programa conjunto de bioresiliencia para…