Gemini 3.6 Flash chega 17% mais eficiente e 17% mais barato — e Google confirma que já iniciou o pre-training do Gemini 4

Resumo: A Google anunciou nesta semana o Gemini 3.6 Flash, uma atualização do modelo workhorse da linha Gemini que promete gastar 17% menos tokens de saída, custar menos por milhão de tokens e estender o corte de conhecimento para março de 2026. No mesmo comunicado, o DeepMind confirmou que já começou o run de pre-training mais ambicioso da história do laboratório, dedicado ao Gemini 4. Para desenvolvedores brasileiros que rodam agentes em produção, o combo eficiência + preço muda o cálculo de custo por tarefa contra Anthropic, OpenAI e Meta.

O que a Google entregou

O anúncio empacotou três modelos: o Gemini 3.6 Flash como principal atualização; o Gemini 3.5 Flash-Lite para tarefas de alto throughput e baixa latência; e o Gemini 3.5 Flash Cyber, uma variante especializada em detectar e corrigir vulnerabilidades de software, liberada em piloto restrito para governos e parceiros de confiança.

Segundo a Google, o Gemini 3.6 Flash produz respostas “mais token-eficientes” — a métrica de referência é o Artificial Analysis Index, em que o modelo consome 17% menos tokens de saída do que a versão 3.5. Isso importa porque, em fluxos com agentes, cada tool call, cada etapa de raciocínio e cada tentativa de retrabalho geram tokens que o cliente paga. Menos tokens no output significa custo real menor por tarefa concluída.

O preço também caiu. O Gemini 3.6 Flash sai por US$ 1,50 por milhão de tokens de input e US$ 7,50 por milhão de tokens de output — antes o output custava US$ 9. Já o Flash-Lite fica em US$ 0,30/US$ 2,50 por milhão de tokens.

Ganhos de qualidade nos benchmarks

Em programação, o novo Flash sobe de 37% para 49% no DeepSWE e de 49,7% para 63,9% no MLE Bench, benchmark voltado a pesquisa de machine learning. Em conhecimento geral, o GDPval-AA passa de 1.349 para 1.421 pontos. Já na capacidade de operar interfaces gráficas, o OSWorld-Verified sobe de 78,4% para 83%. Por fim, o corte de conhecimento avança de janeiro de 2025 para março de 2026 — um salto de 14 meses que reduz a incidência de respostas defasadas em consultas sobre eventos recentes.

Por que importa — e o que muda no Brasil

Bancos, fintechs e escritórios de advocacia brasileiros que estavam operando com Flash 3.5 podem simplesmente atualizar o endpoint e capturar a queda de custo automaticamente. Para operações de alto volume, como classificação de tickets, extração de dados de contratos e triagem de e-mails, o ganho combinado de eficiência de token e preço unitário derruba o custo total por milhão de execuções em torno de 30% a 35% — antes mesmo de qualquer ajuste fino.

O outro efeito relevante é competitivo. Anthropic, OpenAI, Meta e xAI passam a operar sob uma nova âncora de preço na faixa de “Flash de alta qualidade”. Com Fable 5 hoje custando US$ 10/US$ 50 por milhão de tokens e Muse Spark 1.1 na casa de US$ 1,25/US$ 4,25 (input/output), o Flash da Google se posiciona no meio, mas com a vantagem de acesso nativo dentro do ecossistema Antigravity, AI Studio e Android Studio.

Riscos e limitações

Nem tudo é linear. O Gemini 3.5 Pro segue em fase de testes com parceiros — a Google reiterou que o lançamento amplo virá “assim que estiver pronto”, sem data. Times que apostavam no ciclo Pro para atualizar workloads sensíveis vão precisar continuar com o modelo anterior ou avaliar concorrentes. Além disso, o Flash Cyber, que talvez seja o mais interessante em cenários de segurança ofensiva e defensiva, ficou restrito a um piloto de acesso limitado por causa de risco de dupla utilidade. Pequenos SOCs, MSSPs e startups de segurança fora do círculo de parceiros da Google não terão acesso no curto prazo.

Há também um risco menos discutido: modelos mais token-eficientes tendem a ser mais “curtos” nas respostas, o que ajuda em custos, mas pode reduzir a explicabilidade em auditoria. Em setores regulados — saúde, seguros, crédito — vale exigir logs mais detalhados de raciocínio, mesmo que o output final seja enxuto.

SWOT — Google Gemini na disputa por modelos workhorse

Forças
Eficiência de token comprovada em benchmarks públicos; preço agressivo; integração nativa com Android Studio, AI Studio e Antigravity; DeepMind já rodando pre-training do Gemini 4.
Fraquezas
Pro ainda em testes com parceiros; Flash Cyber com acesso restrito; ecossistema de agentes menos maduro que o de OpenAI para uso corporativo direto.
Oportunidades
Consolidação em fluxos de alto volume; ganho de participação em bancos e fintechs LATAM; janela para migrar clientes Fable 5 e Muse Spark.
Ameaças
Modelos abertos (GLM-5.2, Kimi K3) pressionando preço; Anthropic e OpenAI acelerando ciclos com Fable 5 e GPT-5.6 Sol; regulação de IA na UE e no Brasil elevando custo de operação.

O que vem no Gemini 4

A confirmação de que a Google já começou o pre-training do Gemini 4 é o sinal mais claro de que o ciclo de 12 a 18 meses entre gerações se mantém. Sem revelar tamanho de dataset, número de parâmetros ou arquitetura, o DeepMind indicou que este é o run “mais ambicioso” já feito pela equipe — o que sugere volume superior aos usados no Gemini 3 e provavelmente maior participação de dados sintéticos e multimodalidade nativa.

Para clientes empresariais, o recado prático é: a Google não pretende ceder terreno no topo. Quem monta stack de agentes agora precisa considerar não só o custo do Gemini 3.6 Flash hoje, mas a probabilidade de haver um Gemini 4 Pro rodando em produção antes do fim de 2026, o que pode mudar o equilíbrio de preço mais uma vez.

Conclusão prática

Se você já usa Gemini Flash 3.5 em produção, atualize os endpoints — a queda de custo vem sem esforço. Se está avaliando concorrentes, refaça o custo por tarefa com o novo preço e teste especificamente os fluxos com múltiplas tool calls, onde o ganho de token se acumula. E se o seu roadmap depende do Gemini Pro, considere um plano B com Fable 5 ou GPT-5.6 Sol enquanto a versão Pro do Gemini não sai do piloto.

Fonte original: Google — The Keyword blog (21 de julho de 2026).

Ninja

Na cena de cybersecurity a mais de 25 anos, Ninja trabalha como evangelizador de segurança da informação no Brasil. Preocupado com a conscientização de segurança cibernética, a ideia inicial é conseguir expor um pouco para o publico Brasileiro do que acontece no mundo.

Share
Published by
Ninja

Recent Posts

Quarta CVE do SharePoint (CVE-2026-50522) sob ataque: invasores roubam machine keys para acesso persistente

CVE-2026-50522 no SharePoint, corrigida no Patch Tuesday de julho, já está sob ataque: invasores exfiltram…

7 horas ago

Site do presidente do Quênia é desfigurado com pedido de resgate em Bitcoin

Site presidencial queniano é desfigurado com pedido de resgate de 5 BTC (US$ 330 mil).…

7 horas ago

Windmill: falha CVE-2026-29059 sob exploração ativa expõe segredos e permite RCE

Falha crítica de path traversal na Windmill (CVE-2026-29059) está sob exploração ativa: 170 sistemas expostos…

7 horas ago

Nubank e Itaú lideram Evident AI Index 2026 para bancos da LATAM — e Brasil ocupa os quatro primeiros lugares do ranking

Evident Insights publica o Evident AI Index 2026 para bancos LATAM: Nubank e Itaú no…

12 horas ago

WorldCupArena avalia 13 LLMs e agentes de deep-research nas 104 partidas da Copa 2026 — só 4 sistemas cravaram Espanha campeã

Benchmark dinâmico WorldCupArena mede 13 modelos de IA em previsões pré-jogo da Copa 2026 em…

12 horas ago