Ir para o conteúdo principal
Anúncios

Adaptive Instructed-Retriever: Busca com Qualidade de Fronteira e Latência 2x Menor

por Cindy Wang, Cheng Li, Jialu Liu, Sean Kulinski, Arnav Singhvi, Wen Sun e Michael Bendersky

Agentes de dados empresariais eficazes exigem uma busca que seja precisa e rápida ao mesmo tempo. No início deste ano, lançamos o Instructed-Retriever-1, um modelo de recuperação que pode incorporar esquemas de dados empresariais e instruções personalizadas, usando escalonamento paralelo em tempo de teste para melhorar a precisão da recuperação com baixa latência. Essa abordagem de busca em etapa única funciona bem para grande parte das solicitações dos usuários. No entanto, perguntas mais complexas e de várias etapas (multi-hop) ainda podem se beneficiar da busca sequencial, na qual o modelo reúne evidências de forma iterativa e refina suas consultas ao longo de várias etapas — ao custo de latência adicional.

É por isso que agora estamos apresentando o Adaptive Instructed-Retriever, que combina a velocidade da recuperação paralela com o desempenho da busca sequencial, mantendo garantias rígidas de custo e latência. O objetivo é simples: gastar etapas adicionais de busca apenas quando forem úteis. Esse é o mesmo problema de eficiência de recuperação enfrentado pelo Genie Code, o agente de dados da Databricks: ele precisa encontrar as tabelas, notebooks, dashboards e documentos corretos em um espaço de trabalho grande e dinâmico, sem desperdiçar interações com explorações de força bruta. O Adaptive Instructed-Retriever foi projetado para essa camada de recuperação, retornando rapidamente quando a evidência é clara e usando a busca sequencial apenas quando uma solicitação mais complexa exigir. Como mostramos nesta publicação, o modelo treinado se iguala à qualidade dos principais modelos de terceiros com uma latência duas vezes menor e melhora substancialmente em relação à busca em etapa única em nossos benchmarks de recuperação.

pontuação e latência de ponta a ponta medidas no conjunto de benchmarks de recuperação

Para criar o Adaptive Instructed-Retriever, impomos um limite superior fixo ao número de etapas sequenciais e treinamos o agente para decidir de forma adaptativa quanta computação cada solicitação do usuário exige. Quando evidências suficientes já foram encontradas, o agente para mais cedo e retorna as evidências relevantes; quando uma busca adicional provavelmente melhorará a qualidade da recuperação, ele pode continuar buscando até o limite de etapas.

Figura 1. Arquitetura do Adaptive Instructed-Retriever, que permite busca baseada em agentes de várias etapas com latência limitada.
Figura 1. Arquitetura do Adaptive Instructed-Retriever, que permite busca baseada em agentes de várias etapas com latência limitada.

Treinamento do Adaptive Instructed-Retriever

Para alcançar um melhor equilíbrio entre a qualidade da recuperação e o custo de latência do escalonamento sequencial, treinamos o Adaptive Instructed-Retriever — um modelo personalizado pequeno que suporta tanto a recuperação paralela em etapa única quanto a busca sequencial, operando com uma latência substancialmente menor do que os principais modelos de terceiros. Avaliamos o modelo em uma combinação de benchmarks de recuperação proprietários de empresas e de recuperação pública, incluindo tarefas que se beneficiam do raciocínio de várias etapas (multi-hop). Em todos esses benchmarks, o Adaptive Instructed-Retriever alcança um desempenho comparável ao dos principais modelos de código aberto e de terceiros, oferecendo uma latência duas vezes menor.

Para preparar os dados de treinamento, contamos com ambientes sintéticos de recuperação empresarial e um processo de síntese de dados baseado em agentes semelhante ao Instructed-Retriever-1 e publicado no relatório KARL . Reutilizamos os dados de treinamento existentes do Instructed-Retriever-1 para preservar a capacidade do modelo de realizar buscas rápidas e paralelas em etapa única e, além disso, introduzimos perguntas sintéticas de várias etapas (multi-hop) que se beneficiam mais de várias etapas de busca baseadas em agentes.

A partir do modelo base, usamos o aprendizado por reforço online (ORL) para ensinar o modelo a realizar etapas adicionais de busca apenas quando houver probabilidade de melhorar o desempenho final. Especificamente, otimizamos o modelo de ponta a ponta usando CISPO (Clipped Importance Sampling Policy Optimization), com um design de recompensa que equilibra a qualidade da trajetória com o custo da busca: o modelo é recompensado por trajetórias de alto desempenho, enquanto é penalizado por etapas adicionais de busca que não geram ganhos de desempenho correspondentes.

Treinamos o modelo usando o AI Runtime (AIR). O AIR também está disponível para clientes da Databricks, tornando essa abordagem prática para o desenvolvimento de modelos especializados para seus próprios domínios e cargas de trabalho. A receita de treinamento é intencionalmente leve: começamos com um modelo base pré-treinado e usamos uma quantidade modesta de dados sintéticos para especializar seu comportamento de busca. Como demonstra a Figura 2, nossa abordagem leve se generaliza bem para novas tarefas e domínios de busca.

Figura 2. O Adaptive Instructed-Retriever alcança um desempenho comparável ao Claude Sonnet 5 e ao GPT-5.6 Luna com uma latência significativamente menor. Os resultados são relatados em uma combinação de sete benchmarks internos e externos retidos, cobrindo vários níveis de dificuldade de busca e domínios.
Figura 2. O Adaptive Instructed-Retriever alcança um desempenho comparável ao Claude Sonnet 5 e ao GPT-5.6 Luna com uma latência significativamente menor. Os resultados são relatados em uma combinação de sete benchmarks internos e externos retidos, cobrindo vários níveis de dificuldade de busca e domínios.

A Figura 2 compara o Adaptive Instructed-Retriever com dois dos principais modelos de terceiros (Claude Sonnet 5 e GPT-5.6 Luna) e um modelo de código aberto (DeepSeek-V4-Flash). Plotamos a qualidade da recuperação em relação à latência média de ponta a ponta para cada modelo. A barra de cor clara mostra a pontuação de recuperação de uma única etapa de busca, enquanto a barra de cor escura mostra o resultado da busca em várias etapas, medido em relação ao eixo esquerdo (quanto maior, melhor); a barra hachurada mostra a latência de ponta a ponta em relação ao eixo direito (quanto menor, melhor). O Adaptive Instructed-Retriever se iguala ao desempenho dos principais modelos de terceiros e de código aberto, respondendo em apenas 5,8 segundos, mais de duas vezes mais rápido do que o Claude Sonnet 5, o DeepSeek-V4-Flash ou o GPT-5.6 Luna.

Aprendizado por reforço online para compensações personalizadas entre qualidade e latência

O treinamento do Adaptive Instructed-Retriever nos permite escolher a compensação entre qualidade e latência ajustando a magnitude da penalidade de etapa usada durante o ORL. Portanto, podemos treinar uma família de checkpoints que alimenta o Adaptive Instructed-Retriever e escolher aquele que melhor se adapta à carga de trabalho de produção.

Figura 3. Ao ajustar o peso da penalidade de etapa durante o treinamento de ORL, podemos escolher qualquer ponto operacional ao longo de uma fronteira de Pareto que domina o DeepSeek-V4-Flash, o Claude Sonnet 5 e o GPT-5.6 Luna em toda a faixa de orçamentos de recuperação.
Figura 3. Ao ajustar o peso da penalidade de etapa durante o treinamento de ORL, podemos escolher qualquer ponto operacional ao longo de uma fronteira de Pareto que domina o DeepSeek-V4-Flash, o Claude Sonnet 5 e o GPT-5.6 Luna em toda a faixa de orçamentos de recuperação.

A Figura 3 mostra como, ao variar a magnitude da penalidade durante o treinamento de ORL, obtemos uma família de checkpoints, cada um situado em um ponto diferente no plano de qualidade-latência — pontuação no eixo y (quanto maior, melhor) em relação à latência de ponta a ponta no eixo x (plotada de forma que o mais rápido fique à direita). A curva vermelha conecta esses pontos operacionais em uma fronteira: uma penalidade de etapa mais leve permite que o modelo execute mais etapas e alcance pontuações mais altas, enquanto uma penalidade mais pesada reduz sua latência.

A fronteira completa dos modelos treinados do Adaptive Instructed-Retriever supera as alternativas. Em comparação com o modelo base Instructed-Retriever não treinado, cada checkpoint oferece maior qualidade com latência semelhante ou menor, sugerindo que os ganhos vêm de aprender quando buscar — e quando não buscar. No topo da fronteira, nosso modelo atinge pontuações comparáveis às de outros modelos líderes, sendo mais de duas vezes mais rápido. Como a fronteira treinada inclui checkpoints com diferentes compensações, podemos escolher o que melhor se adapta a cada carga de trabalho e orçamento — priorizando a velocidade para uso interativo ou a qualidade para recuperações offline mais difíceis.

O Adaptive Instructed-Retriever formula buscas mais eficientes e direcionadas

Mostramos alguns exemplos comparando as políticas de busca das alternativas com as do nosso modelo treinado Adaptive Instructed-Retriever. Esses exemplos ilustram como o Adaptive Instructed-Retriever busca de forma eficiente em perguntas simples e, em perguntas mais difíceis, pode usar seu orçamento de busca restante de maneira mais eficaz.

Verificar uma resposta negativa sem busca exaustiva

O Adaptive Instructed-Retriever alcança a mesma recompensa uma etapa antes do Sonnet e duas etapas antes do Luna.

Pergunta: A Empresa X relata explicitamente os custos de reestruturação como uma linha de item na demonstração de resultados do ano fiscal de 2022 (FY2022)?

ModeloRecall@10Esforço de buscaComportamento
GPT-5.6 Luna1.004 etapasBusca por frases especulativas como “Não houve tais custos” e “0 milhão”.
Claude Sonnet 51.003 etapasVerifica a demonstração de resultados, a nota de reestruturação e as conciliações relacionadas.
Adaptive Instructed-Retriever1.002 etapasVerifica o item de linha direto e as categorias de despesas relacionadas, interrompendo o processo assim que a ausência for confirmada.

Use a próxima rodada para mudar de estratégia

O Adaptive Instructed-Retriever aprende a ajustar a estratégia de busca para melhorar o recall: ele passa de uma descoberta ampla para buscas direcionadas em contas. Ele alcança a maior recompensa, empatando com o Sonnet no menor número de etapas.

Pergunta: Quais clientes estão usando ou consideraram usar o LiteLLM Proxy?

ModeloRecall@10Esforço de buscaComportamento
GPT-5.6 Luna0.624 etapasAs rodadas posteriores repetem combinações entre aspas de “LiteLLM”, “Proxy” e “customer”.
Claude Sonnet 50.502 etapasPara de forma eficiente, mas seu acompanhamento genérico perde clientes relevantes.
Adaptive Instructed-Retriever0.752 etapasUsa a segunda rodada para hipóteses concretas de contas, incluindo dois clientes relevantes.

Conclusão

O Adaptive Instructed-Retriever estende o Instructed-Retriever-1 publicado anteriormente, passando da recuperação paralela em uma única etapa para a busca adaptativa em várias etapas, permitindo que o modelo dedique etapas adicionais de busca a consultas complexas, onde o raciocínio iterativo e a coleta de evidências podem melhorar substancialmente a qualidade da recuperação, enquanto retorna mais cedo em consultas mais simples para minimizar a latência. Essa abordagem adaptativa oferece um desempenho de recuperação significativamente mais forte do que a busca em uma única etapa, ao mesmo tempo em que alcança um desempenho comparável ao dos principais modelos de terceiros com uma latência duas vezes menor. Ao variar a penalidade de etapa durante o Aprendizado por Reforço Online, podemos otimizar explicitamente o trade-off entre a qualidade da recuperação e o custo de inferência, gerando checkpoints em diferentes pontos ao longo da fronteira de qualidade-latência e selecionando o ponto de operação que melhor se adapta a uma carga de trabalho de produção.

Nossa contribuição fornece um bloco de construção de recuperação prático para agentes de dados na Databricks que operam em workspaces grandes e em constante mudança. Experiências como o Genie Code, o Genie One e o Genie Agents devem encontrar as tabelas, notebooks, dashboards e documentos corretos sem gastar tempo e esforço excessivos em uma exploração profunda. O Adaptive Instructed-Retriever oferece uma política limitada para esse cenário: ele é rápido em buscas comuns, ao mesmo tempo em que é minucioso em tarefas de descoberta difíceis, além de ser controlável dentro de um orçamento de latência do produto. De forma mais ampla, esses resultados ilustram a competitividade de modelos especializados pequenos\ mesmo para tarefas que exigem raciocínio em várias etapas. O Databricks AIR permite que nossos clientes adaptem modelos especializados para seus próprios domínios e requisitos de desempenho.

(Esta publicação no blog foi traduzida utilizando ferramentas baseadas em inteligência artificial) Publicação original

Receba os posts mais recentes na sua caixa de entrada

Assine nosso blog e receba os posts mais recentes diretamente na sua caixa de entrada.