Google troca raciocínio por difusão para acelerar busca com IA

Em vez de gastar centenas de tokens de raciocínio a cada consulta, o Google treina uma vez com aprendizado por reforço e destila o resultado em um modelo de difusão de 53,9 milhões de parâmetros, com ganho de 12 a 20 vezes em latência.

Ilustração abstrata de um ponto luminoso que se ramifica em múltiplas direções em um espaço vetorial, representando a expansão de consultas na busca com IA

Imagem editorial original do Plugged Ninja

O Google Research publicou em 15 de setembro de 2026 a descrição do Retrieve-for-Train (R4T), um método que ataca um gargalo específico e caro da busca com IA: o tempo que um modelo de linguagem gasta pensando antes de decidir o que procurar. O texto é assinado por Pengcheng Jiang, pesquisador estudante, e Judith Yue Li, engenheira sênior de pesquisa, e resume o artigo Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion, aceito na ICML 2026.

O artigo está disponível no arXiv sob o identificador 2603.06397, com licença CC BY 4.0, e é assinado por onze pesquisadores, entre eles Craig Boutilier e Dima Kuzmin. Vale registrar as duas datas: o preprint circula desde março de 2026, e a divulgação pelo blog institucional é de 15 de setembro.

O problema: buscas que pedem um conjunto, não uma resposta

Sistemas modernos de busca e recomendação frequentemente precisam devolver um conjunto coerente de resultados, não o melhor item isolado. O exemplo usado pelos autores é direto: quem pesquisa equipamento de camping não quer dez variações de barraca para quatro pessoas. Quer barraca, saco de dormir, fogareiro portátil e lanterna de cabeça — itens complementares.

A técnica usual para isso se chama query fan-out: o sistema quebra uma consulta ampla em várias subconsultas que cobrem facetas diferentes da intenção. O problema é como gerar essas subconsultas.

Usar um modelo de linguagem genérico direto na hora da consulta tem dois defeitos que os autores nomeiam com precisão:

Colapso parafrástico. Sem otimização voltada à base de dados específica, o modelo tende a produzir subconsultas quase sinônimas. Para o pedido estilo boêmio de festival, um modelo comum pode gerar moda boêmia de festival e roupas boêmias de festival — variações rasas que retornam o mesmo material, enquanto um especialista em moda pensaria em jaquetas de franja, vestidos de crochê ou botas de camurça.

Gargalo de latência autorregressiva. Modelos de linguagem geram texto token a token. Para decompor bem uma consulta complexa, eles costumam precisar de um orçamento de raciocínio substancial — centenas de tokens intermediários de cadeia de pensamento antes de emitir os termos de busca. Isso é tolerável em um chat; em uma barra de busca que precisa responder em menos de um segundo, cria um piso de latência incompatível com produção.

A ideia: usar aprendizado por reforço uma vez só

A proposta do R4T é deslocar o custo. Em vez de o modelo raciocinar toda vez que alguém digita algo, o aprendizado por reforço (RL) é executado uma única vez, na fase de treino, e o comportamento aprendido é compilado em um modelo leve. Os autores descrevem o RL como um transdutor de objetivo: ele converte metas abstratas em dados de supervisão.

O pipeline tem três etapas:

  1. Treino do modelo de expansão. Um modelo de linguagem é treinado por RL para emitir subconsultas alinhadas a propriedades desejadas, avaliadas por uma recompensa que julga o conjunto inteiro de resultados, não cada item isolado.
  2. Síntese de supervisão. Esse modelo, agora congelado, gera pares de consulta e conjunto-alvo inteiramente fora de linha, sem nenhuma anotação humana.
  3. Treino do recuperador por difusão. Um modelo de difusão compacto, de 53,9 milhões de parâmetros, aprende a mapear a representação vetorial de uma consulta diretamente para um conjunto completo de representações-alvo, em uma única passagem não autorregressiva.

O terceiro passo é o que elimina os tokens de raciocínio: em vez de escrever texto, o modelo produz todas as direções de busca simultaneamente no espaço vetorial contínuo.

A recompensa: três forças que se vigiam

O ponto mais instrutivo do trabalho está no desenho da recompensa. Em vez de instruções em linguagem natural do tipo seja diverso e relevante, os pesquisadores usaram uma composição matemática de três termos:

  • Fundamentação (groundedness). Penaliza a distância em relação ao que existe de fato na base, garantindo que cada subconsulta corresponda a um item recuperável.
  • Diversidade. Medida pelo Vendi Score sobre o conjunto de subconsultas, forçando amplitude semântica.
  • Alinhamento. Ancora as subconsultas ao pedido original, para evitar deriva de sentido.

Os três funcionam como contra-âncoras mútuas, e o relato de ablação é franco sobre o motivo. Otimizando apenas fundamentação, a política aprende a trapacear: gera sequências sem sentido que, por coincidência matemática, caem em coordenadas válidas da base — os autores citam o exemplo literal de strings degeneradas como line ending line ending. Acrescentar alinhamento corrige o absurdo, mas a política então colapsa em paráfrases repetitivas do pedido do usuário. Só com o termo de diversidade injetado a saída mais fácil deixa de existir, e o modelo é empurrado para a região do espaço de representações em que precisa se comportar como um especialista de verdade.

Esse é um relato honesto de reward hacking — o fenômeno em que um modelo maximiza a métrica sem cumprir o objetivo real — e o tipo de detalhe que normalmente não aparece em anúncios corporativos.

O treino usou GRPO (group relative policy optimization) com regularização PPO suave, sobre modelos abertos de 4 bilhões de parâmetros: Gemma3-4B e Qwen3-4B, encarregados de gerar exatamente dez subconsultas para cada pedido principal.

Resultados e limites

Os testes cobriram dois regimes de recuperação por conjunto. No primeiro, chamado de recuperação abstrata aberta, não existe resposta única correta e a qualidade é medida só por propriedades do conjunto. No segundo, de recuperação composicional fracamente supervisionada, há um conjunto de referência que representa apenas uma realização plausível da intenção.

Os domínios foram dois: uma base de looks de moda montados por usuários, avaliada com um recuperador baseado em CLIP, e uma base proprietária de playlists musicais feitas por especialistas, avaliada com o modelo MuLan.

Segundo os autores, o R4T superou a busca de consulta única, a expansão sem treino específico e mesmo a linha de base Best-of-N — que é forte, pois gera várias alternativas e escolhe a melhor. Qualitativamente, as subconsultas geradas se ramificaram em direções distintas (botas, renda) em vez de parafrasear o pedido.

O ganho central, porém, é de custo. O modelo de difusão gera todas as direções em paralelo, em uma única passagem, e entrega aceleração de 12 a 20 vezes em relação às abordagens autorregressivas. Enquanto a latência da expansão autorregressiva cresce de forma linear e chega perto de 50 segundos sob lotes grandes de contexto, a versão por difusão fica entre menos de um segundo e poucos segundos. O resumo do artigo no arXiv é mais conservador na formulação e fala em redução de latência de uma ordem de grandeza.

Há limitações que o próprio material deixa visíveis. Os testes cobrem dois domínios, um deles com base proprietária, o que dificulta reprodução independente. Os modelos de expansão testados são de 4 bilhões de parâmetros — o comportamento com modelos maiores não é reportado. E, por construção, o recuperador destilado herda as propriedades da base sobre a qual foi treinado: mudanças significativas de catálogo exigem novo ciclo de treino, algo que uma abordagem sem treino específico não exige. O método troca flexibilidade por custo de inferência, e essa troca não é gratuita.

Por que isso importa

A discussão pública sobre modelos de linguagem passou os últimos anos empurrando computação para o momento da inferência: mais tokens de raciocínio, mais chamadas, mais pensamento a cada pedido. Esse caminho funciona em assistentes conversacionais, onde alguns segundos de espera são aceitáveis, mas colide com a realidade de sistemas que atendem milhões de consultas por dia sob orçamento de milissegundos.

O R4T aponta para a direção oposta e cada vez mais frequente: pagar caro uma vez, em treino, e implantar algo barato. Para quem opera busca, recomendação ou catálogos de comércio eletrônico no Brasil, o interesse prático é concreto — um recuperador de 53,9 milhões de parâmetros cabe em infraestrutura modesta e dispensa a fatura de inferência de um modelo de linguagem a cada consulta.

O que observar a seguir é se o método se sustenta fora dos dois domínios testados, se aparecem implementações abertas que permitam reprodução e como o pipeline lida com catálogos que mudam rápido. O artigo completo está disponível no arXiv para quem quiser conferir a metodologia.

Fontes e referências

  • Google Research, Pengcheng Jiang e Judith Yue Li — Bypassing inference bottlenecks: Accelerating complex AI search with Retrieve-for-Train, 15 de setembro de 2026: research.google
  • arXiv — Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion (arXiv:2603.06397), licença CC BY 4.0: arxiv.org/abs/2603.06397
  • ICML 2026 — Página do pôster do trabalho: icml.cc
  • arXiv — The Vendi Score: A Diversity Evaluation Metric for Machine Learning (arXiv:2210.02410): arxiv.org/abs/2210.02410
  • arXiv — Soft-GRPO (arXiv:2511.06411): arxiv.org/abs/2511.06411
PLUGGED NINJA
Informações de privacidade

Este site usa cookies para que possamos oferecer a melhor experiência de usuário possível. As informações dos cookies são armazenadas em seu navegador e executam funções como reconhecê-lo quando você retorna ao nosso site e ajudar nossa equipe a entender quais seções do site você considera mais interessantes e úteis.