Ir al contenido principal
Anuncios

Adaptive Instructed-Retriever: búsqueda de calidad de frontera con una latencia 2 veces menor

por Cindy Wang, Cheng Li, Jialu Liu, Sean Kulinski, Arnav Singhvi, Wen Sun y Michael Bendersky

Los agentes de datos empresariales eficaces requieren una búsqueda que sea tanto precisa como rápida. A principios de este año lanzamos Instructed-Retriever-1, un modelo de recuperación que puede incorporar esquemas de datos empresariales e instrucciones personalizadas, al tiempo que utiliza el escalado paralelo en tiempo de prueba para mejorar la precisión de la recuperación con una baja latencia. Este enfoque de búsqueda en un solo paso funciona bien para una gran parte de las solicitudes de los usuarios. Sin embargo, las preguntas más complejas y de varios pasos (multi-hop) aún pueden beneficiarse de la búsqueda secuencial, en la que el modelo recopila evidencia de forma iterativa y refina sus consultas a lo largo de varios pasos, a costa de una latencia adicional.

Por eso ahora presentamos Adaptive Instructed-Retriever, que combina la velocidad de la recuperación paralela con el rendimiento de la búsqueda secuencial, al tiempo que mantiene garantías estrictas de costo y latencia. El objetivo es simple: realizar pasos de búsqueda adicionales solo cuando sean útiles. Este es el mismo problema de eficiencia de recuperación al que se enfrenta Genie Code, el agente de datos de Databricks: debe encontrar las tablas, notebooks, dashboards y documentos adecuados en un espacio de trabajo grande y cambiante sin desperdiciar turnos en exploraciones por fuerza bruta. Adaptive Instructed-Retriever está diseñado para esta capa de recuperación, respondiendo rápidamente cuando la evidencia es clara y utilizando la búsqueda secuencial solo cuando una solicitud más difícil lo requiere. Como mostramos en esta publicación, el modelo entrenado iguala la calidad de los principales modelos de terceros con una latencia dos veces menor y mejora sustancialmente la búsqueda de un solo paso en nuestras pruebas de rendimiento (benchmarks) de recuperación.

puntuación y latencia de extremo a extremo medidas en el conjunto de pruebas de rendimiento (benchmarks) de recuperación

Para crear Adaptive Instructed-Retriever, imponemos un límite superior fijo en el número de pasos secuenciales y entrenamos al agente para que decida de manera adaptativa cuánto cómputo requiere cada solicitud de usuario. Cuando ya se ha encontrado suficiente evidencia, el agente se detiene antes de tiempo y devuelve la evidencia relevante; cuando es probable que una búsqueda adicional mejore la calidad de la recuperación, puede continuar buscando hasta el límite de pasos.

Figura 1. Arquitectura de Adaptive Instructed-Retriever que permite la búsqueda agéntica de varios pasos con latencia acotada.
Figura 1. Arquitectura de Adaptive Instructed-Retriever que permite la búsqueda agéntica de varios pasos con latencia acotada.

Entrenamiento de Adaptive Instructed-Retriever

Para lograr un mejor equilibrio entre la calidad de la recuperación y el costo de latencia del escalado secuencial, entrenamos Adaptive Instructed-Retriever, un modelo personalizado pequeño que admite tanto la recuperación paralela de un solo paso como la búsqueda secuencial, al tiempo que opera con una latencia sustancialmente menor que la de los principales modelos de terceros. Evaluamos el modelo en una combinación de pruebas de rendimiento (benchmarks) de recuperación empresarial propias y públicas, incluidas tareas que se benefician del razonamiento de varios pasos (multi-hop). En todas estas pruebas de rendimiento, Adaptive Instructed-Retriever logra un rendimiento comparable al de los principales modelos de código abierto y de terceros, al tiempo que ofrece una latencia dos veces menor.

Para preparar los datos de entrenamiento, nos basamos en entornos sintéticos de recuperación empresarial y en un proceso de síntesis de datos agéntico similar al de Instructed-Retriever-1 y publicado en el informe KARL . Reutilizamos los datos de entrenamiento existentes de Instructed-Retriever-1 para preservar la capacidad del modelo de realizar búsquedas rápidas en paralelo de un solo paso, y además introducimos preguntas sintéticas de varios pasos (multi-hop) que se benefician más de múltiples pasos de búsqueda agéntica.

A partir del modelo base, utilizamos aprendizaje por refuerzo en línea (ORL) para enseñar al modelo a dar pasos de búsqueda adicionales solo cuando sea probable que mejoren el rendimiento final. Específicamente, optimizamos el modelo de extremo a extremo utilizando CISPO (Clipped Importance Sampling Policy Optimization), con un diseño de recompensa que equilibra la calidad de la trayectoria frente al costo de búsqueda: el modelo es recompensado por trayectorias de alto rendimiento, mientras que es penalizado por pasos de búsqueda adicionales que no producen las ganancias de rendimiento correspondientes.

Entrenamos el modelo utilizando AI Runtime (AIR). AIR también está disponible para los clientes de Databricks, lo que hace que este enfoque sea práctico para desarrollar modelos especializados para sus propios dominios y cargas de trabajo. La receta de entrenamiento es intencionalmente ligera: comenzamos con un modelo base preentrenado y utilizamos una cantidad moderada de datos sintéticos para especializar su comportamiento de búsqueda. Como demuestra la Figura 2, nuestro enfoque ligero se generaliza bien a nuevas tareas y dominios de búsqueda.

Figura 2. Adaptive Instructed-Retriever logra un rendimiento comparable al de Claude Sonnet 5 y GPT-5.6 Luna con una latencia significativamente menor. Los resultados se reportan en una mezcla de siete pruebas de rendimiento (benchmarks) internas y externas reservadas que cubren múltiples niveles de dificultad de búsqueda y dominios.
Figura 2. Adaptive Instructed-Retriever logra un rendimiento comparable al de Claude Sonnet 5 y GPT-5.6 Luna con una latencia significativamente menor. Los resultados se reportan en una mezcla de siete pruebas de rendimiento (benchmarks) internas y externas reservadas que cubren múltiples niveles de dificultad de búsqueda y dominios.

La Figura 2 compara Adaptive Instructed-Retriever con dos de los principales modelos de terceros (Claude Sonnet 5 y GPT-5.6 Luna) y un modelo de código abierto (DeepSeek-V4-Flash). Graficamos la calidad de la recuperación frente a la latencia promedio de extremo a extremo para cada modelo. La barra de color claro muestra la puntuación de recuperación de un solo paso de búsqueda, mientras que la barra de color oscuro muestra el resultado de la búsqueda de varios pasos, medido en el eje izquierdo (cuanto más alto, mejor); la barra con sombreado de líneas muestra la latencia de extremo a extremo en el eje derecho (cuanto más bajo, mejor). Adaptive Instructed-Retriever iguala el rendimiento de los principales modelos de código abierto y de terceros al responder en solo 5.8 segundos, más de dos veces más rápido que Claude Sonnet 5, DeepSeek-V4-Flash o GPT-5.6 Luna.

Aprendizaje por refuerzo en línea para compensaciones personalizadas entre calidad y latencia

El entrenamiento de Adaptive Instructed-Retriever nos permite elegir la relación de compromiso (trade-off) entre calidad y latencia ajustando la magnitud de la penalización por paso utilizada durante el ORL. Por lo tanto, podemos entrenar una familia de puntos de control (checkpoints) que impulse a Adaptive Instructed-Retriever y elegir el que mejor se adapte a la carga de trabajo de producción.

Figura 3. Al ajustar el peso de la penalización por paso durante el entrenamiento de ORL, podemos elegir cualquier punto operativo a lo largo de una frontera de Pareto que domina a DeepSeek-V4-Flash, Claude Sonnet 5 y GPT-5.6 Luna en todo el rango de presupuestos de recuperación.
Figura 3. Al ajustar el peso de la penalización por paso durante el entrenamiento de ORL, podemos elegir cualquier punto operativo a lo largo de una frontera de Pareto que domina a DeepSeek-V4-Flash, Claude Sonnet 5 y GPT-5.6 Luna en todo el rango de presupuestos de recuperación.

La Figura 3 muestra cómo, al variar la magnitud de la penalización durante el entrenamiento de ORL, obtenemos una familia de puntos de control (checkpoints), cada uno ubicado en un punto diferente del plano de calidad-latencia: la puntuación en el eje y (cuanto más alta, mejor) frente a la latencia de extremo a extremo en el eje x (graficada de modo que lo más rápido queda a la derecha). La curva roja conecta estos puntos operativos en una frontera: una penalización por paso más ligera permite al modelo dar más pasos y alcanzar puntuaciones más altas, mientras que una penalización más pesada reduce su latencia.

La frontera completa de los modelos entrenados de Adaptive Instructed-Retriever supera a las alternativas. En comparación con el modelo base Instructed-Retriever no entrenado, cada punto de control ofrece una mayor calidad con una latencia similar o menor, lo que sugiere que las mejoras provienen de aprender cuándo buscar y cuándo no hacerlo. En la parte superior de la frontera, nuestro modelo alcanza puntuaciones comparables a las de otros modelos líderes, siendo más de dos veces más rápido. Debido a que la frontera entrenada incluye puntos de control con diferentes relaciones de compromiso, podemos elegir el que mejor se adapte a cada carga de trabajo y presupuesto, favoreciendo la velocidad para el uso interactivo o la calidad para una recuperación sin conexión (offline) más difícil.

Adaptive Instructed-Retriever formula una búsqueda más eficiente y dirigida

Mostramos algunos ejemplos que comparan las políticas de búsqueda de las alternativas con las de nuestro modelo entrenado Adaptive Instructed-Retriever. Estos ejemplos ilustran cómo Adaptive Instructed-Retriever busca de manera eficiente en preguntas sencillas y, en preguntas más difíciles, puede utilizar su presupuesto de búsqueda restante de manera más eficaz.

Verificar una respuesta negativa sin una búsqueda exhaustiva

Adaptive Instructed-Retriever alcanza la misma recompensa un paso antes que Sonnet y dos pasos antes que Luna.

Pregunta: ¿La Empresa X reporta explícitamente los costos de reestructuración como una partida del estado de resultados del año fiscal 2022 (FY2022)?

ModeloRecall@10Esfuerzo de búsquedaComportamiento
GPT-5.6 Luna1.004 pasosBusca frases especulativas como «There were no such costs» y «0 million».
Claude Sonnet 51.003 pasosVerifica el estado de operaciones, la nota de reestructuración y las conciliaciones relacionadas.
Adaptive Instructed-Retriever1.002 pasosVerifica la partida directa y las categorías de gastos relacionadas, y luego se detiene una vez que se establece la ausencia.

Usa la siguiente ronda para cambiar de estrategia

Adaptive Instructed-Retriever aprende a ajustar la estrategia de búsqueda para mejorar la recuperación (recall): pasa de un descubrimiento amplio a búsquedas de cuentas específicas. Logra la mayor recompensa al tiempo que empata con Sonnet en el menor número de pasos.

Pregunta: ¿Qué clientes están usando o han considerado usar LiteLLM Proxy?

ModeloRecall@10Esfuerzo de búsquedaComportamiento
GPT-5.6 Luna0.624 pasosLas rondas posteriores repiten combinaciones entrecomilladas de «LiteLLM», «Proxy» y «customer».
Claude Sonnet 50.502 pasosSe detiene de manera eficiente, pero su seguimiento genérico pasa por alto a los clientes relevantes.
Adaptive Instructed-Retriever0.752 pasosUtiliza la segunda ronda para hipótesis de cuentas concretas, incluidos dos clientes relevantes.

Conclusión

Adaptive Instructed-Retriever amplía el modelo Instructed-Retriever-1 publicado anteriormente, pasando de la recuperación paralela de un solo paso a la búsqueda adaptativa de varios pasos, lo que permite al modelo dedicar pasos de búsqueda adicionales a consultas complejas en las que el razonamiento iterativo y la recopilación de pruebas pueden mejorar sustancialmente la calidad de la recuperación, al tiempo que finaliza antes en las consultas más sencillas para minimizar la latencia. Este enfoque adaptativo ofrece un rendimiento de recuperación significativamente mayor que la búsqueda de un solo paso, al tiempo que logra un rendimiento comparable al de los principales modelos de terceros con una latencia dos veces menor. Al variar la penalización por paso durante el aprendizaje por refuerzo en línea (Online Reinforcement Learning), podemos optimizar explícitamente la relación de compromiso entre la calidad de la recuperación y el costo de inferencia, generando puntos de control (checkpoints) en diferentes lugares de la frontera de calidad-latencia y seleccionando el punto de operación que mejor se adapte a una carga de trabajo de producción.

Nuestra contribución proporciona un bloque de construcción de recuperación práctico para los agentes de datos en Databricks que operan en espacios de trabajo grandes y en constante cambio. Experiencias como Genie Code, Genie One y Genie Agents deben encontrar las tablas, notebooks, dashboards y documentos adecuados sin dedicar un tiempo ni un esfuerzo excesivos a una exploración profunda. Adaptive Instructed-Retriever ofrece una política acotada para este entorno: es rápido en las búsquedas comunes, a la vez que minucioso en las tareas de descubrimiento difíciles, y controlable dentro del presupuesto de latencia de un producto. En un sentido más amplio, estos resultados ilustran la competitividad de los modelos especializados pequeños\ incluso para tareas que requieren un razonamiento de varios pasos. Databricks AIR permite a nuestros clientes adaptar modelos especializados a sus propios dominios y requisitos de rendimiento.

(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original

Recibe las últimas publicaciones en tu bandeja de entrada

Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.