Imagem editorial original do Plugged Ninja
O Google Research publicou em 15 de setembro de 2026 a descrição do Retrieve-for-Train (R4T), um método que ataca um gargalo específico e caro da busca com IA: o tempo que um modelo de linguagem gasta pensando antes de decidir o que procurar. O texto é assinado por Pengcheng Jiang, pesquisador estudante, e Judith Yue Li, engenheira sênior de pesquisa, e resume o artigo Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion, aceito na ICML 2026.
O artigo está disponível no arXiv sob o identificador 2603.06397, com licença CC BY 4.0, e é assinado por onze pesquisadores, entre eles Craig Boutilier e Dima Kuzmin. Vale registrar as duas datas: o preprint circula desde março de 2026, e a divulgação pelo blog institucional é de 15 de setembro.
Sistemas modernos de busca e recomendação frequentemente precisam devolver um conjunto coerente de resultados, não o melhor item isolado. O exemplo usado pelos autores é direto: quem pesquisa equipamento de camping não quer dez variações de barraca para quatro pessoas. Quer barraca, saco de dormir, fogareiro portátil e lanterna de cabeça — itens complementares.
A técnica usual para isso se chama query fan-out: o sistema quebra uma consulta ampla em várias subconsultas que cobrem facetas diferentes da intenção. O problema é como gerar essas subconsultas.
Usar um modelo de linguagem genérico direto na hora da consulta tem dois defeitos que os autores nomeiam com precisão:
Colapso parafrástico. Sem otimização voltada à base de dados específica, o modelo tende a produzir subconsultas quase sinônimas. Para o pedido estilo boêmio de festival, um modelo comum pode gerar moda boêmia de festival e roupas boêmias de festival — variações rasas que retornam o mesmo material, enquanto um especialista em moda pensaria em jaquetas de franja, vestidos de crochê ou botas de camurça.
Gargalo de latência autorregressiva. Modelos de linguagem geram texto token a token. Para decompor bem uma consulta complexa, eles costumam precisar de um orçamento de raciocínio substancial — centenas de tokens intermediários de cadeia de pensamento antes de emitir os termos de busca. Isso é tolerável em um chat; em uma barra de busca que precisa responder em menos de um segundo, cria um piso de latência incompatível com produção.
A proposta do R4T é deslocar o custo. Em vez de o modelo raciocinar toda vez que alguém digita algo, o aprendizado por reforço (RL) é executado uma única vez, na fase de treino, e o comportamento aprendido é compilado em um modelo leve. Os autores descrevem o RL como um transdutor de objetivo: ele converte metas abstratas em dados de supervisão.
O pipeline tem três etapas:
O terceiro passo é o que elimina os tokens de raciocínio: em vez de escrever texto, o modelo produz todas as direções de busca simultaneamente no espaço vetorial contínuo.
O ponto mais instrutivo do trabalho está no desenho da recompensa. Em vez de instruções em linguagem natural do tipo seja diverso e relevante, os pesquisadores usaram uma composição matemática de três termos:
Os três funcionam como contra-âncoras mútuas, e o relato de ablação é franco sobre o motivo. Otimizando apenas fundamentação, a política aprende a trapacear: gera sequências sem sentido que, por coincidência matemática, caem em coordenadas válidas da base — os autores citam o exemplo literal de strings degeneradas como line ending line ending. Acrescentar alinhamento corrige o absurdo, mas a política então colapsa em paráfrases repetitivas do pedido do usuário. Só com o termo de diversidade injetado a saída mais fácil deixa de existir, e o modelo é empurrado para a região do espaço de representações em que precisa se comportar como um especialista de verdade.
Esse é um relato honesto de reward hacking — o fenômeno em que um modelo maximiza a métrica sem cumprir o objetivo real — e o tipo de detalhe que normalmente não aparece em anúncios corporativos.
O treino usou GRPO (group relative policy optimization) com regularização PPO suave, sobre modelos abertos de 4 bilhões de parâmetros: Gemma3-4B e Qwen3-4B, encarregados de gerar exatamente dez subconsultas para cada pedido principal.
Os testes cobriram dois regimes de recuperação por conjunto. No primeiro, chamado de recuperação abstrata aberta, não existe resposta única correta e a qualidade é medida só por propriedades do conjunto. No segundo, de recuperação composicional fracamente supervisionada, há um conjunto de referência que representa apenas uma realização plausível da intenção.
Os domínios foram dois: uma base de looks de moda montados por usuários, avaliada com um recuperador baseado em CLIP, e uma base proprietária de playlists musicais feitas por especialistas, avaliada com o modelo MuLan.
Segundo os autores, o R4T superou a busca de consulta única, a expansão sem treino específico e mesmo a linha de base Best-of-N — que é forte, pois gera várias alternativas e escolhe a melhor. Qualitativamente, as subconsultas geradas se ramificaram em direções distintas (botas, renda) em vez de parafrasear o pedido.
O ganho central, porém, é de custo. O modelo de difusão gera todas as direções em paralelo, em uma única passagem, e entrega aceleração de 12 a 20 vezes em relação às abordagens autorregressivas. Enquanto a latência da expansão autorregressiva cresce de forma linear e chega perto de 50 segundos sob lotes grandes de contexto, a versão por difusão fica entre menos de um segundo e poucos segundos. O resumo do artigo no arXiv é mais conservador na formulação e fala em redução de latência de uma ordem de grandeza.
Há limitações que o próprio material deixa visíveis. Os testes cobrem dois domínios, um deles com base proprietária, o que dificulta reprodução independente. Os modelos de expansão testados são de 4 bilhões de parâmetros — o comportamento com modelos maiores não é reportado. E, por construção, o recuperador destilado herda as propriedades da base sobre a qual foi treinado: mudanças significativas de catálogo exigem novo ciclo de treino, algo que uma abordagem sem treino específico não exige. O método troca flexibilidade por custo de inferência, e essa troca não é gratuita.
A discussão pública sobre modelos de linguagem passou os últimos anos empurrando computação para o momento da inferência: mais tokens de raciocínio, mais chamadas, mais pensamento a cada pedido. Esse caminho funciona em assistentes conversacionais, onde alguns segundos de espera são aceitáveis, mas colide com a realidade de sistemas que atendem milhões de consultas por dia sob orçamento de milissegundos.
O R4T aponta para a direção oposta e cada vez mais frequente: pagar caro uma vez, em treino, e implantar algo barato. Para quem opera busca, recomendação ou catálogos de comércio eletrônico no Brasil, o interesse prático é concreto — um recuperador de 53,9 milhões de parâmetros cabe em infraestrutura modesta e dispensa a fatura de inferência de um modelo de linguagem a cada consulta.
O que observar a seguir é se o método se sustenta fora dos dois domínios testados, se aparecem implementações abertas que permitam reprodução e como o pipeline lida com catálogos que mudam rápido. O artigo completo está disponível no arXiv para quem quiser conferir a metodologia.
Em vez de jogar turno a turno, o agente escreve um programa que joga sozinho.…
Um e-mail comum, processado por um appliance desatualizado, basta para executar comandos como root. A…
Análise da Unit 42 mostra o AMOS instalado por páginas que prometem um kit para…
A Cisco Talos rastreou por meses uma operação que convence a própria vítima a injetar…
A Sophos X-Ops dissecou um implante Linux que altera como o Apache enxerga arquivos PHP…
Preprint no arXiv constrói uma rede de quatro camadas e simula como o comprometimento de…