Evaluamos Genie Code frente a tres de los principales agentes de codificación en más de 400 tareas a partir de sesiones internas reales.
La creencia popular en la AI agéntica dice que las mejores respuestas cuestan más tokens: si dejamos que el agente explore más tiempo, verifique más y vuelva a intentarlo más veces, la precisión siempre aumentará. Cuando evaluamos Genie Code cara a cara frente a tres de los principales agentes de codificación de propósito general en más de 400 tareas de datos reales de nuestro uso interno, descubrimos lo contrario: Genie Code fue tanto el agente más preciso que probamos como el más rentable.

La razón es que los agentes de datos deben trabajar en un nuevo paradigma en el que los agentes de codificación generales tienen dificultades. Como ya compartimos anteriormente, los agentes de datos se enfrentan a desafíos únicos: deben descubrir los activos adecuados en un espacio de trabajo dinámico y en constante evolución con cientos de miles de tablas, notebooks, dashboards y documentos; deben determinar la fuente de verdad a través de metadatos y documentos que pueden estar desactualizados o ser contradictorios; y deben hacerlo todo sin las pruebas verificables en las que se apoyan los agentes de codificación.
Para abordar esos desafíos, dotamos a Genie Code de capacidades que le permiten evitar la exploración de camino aleatorio a la que recurren los agentes de codificación generales: búsqueda semántica en el catálogo y los activos del espacio de trabajo, memoria persistente de las tablas y la lógica de negocio en la que confían los usuarios, y una profunda comprensión semántica del contexto empresarial.
Observamos esta diferencia directamente en las sesiones de esta evaluación. En un ejemplo, Genie Code encuentra de manera eficiente la tabla correcta aprovechando la búsqueda semántica y los metadatos, escribe una consulta SQL y obtiene la respuesta correcta en cinco llamadas a herramientas, mientras que ninguno de los tres agentes de propósito general logra recuperarse de la exploración.

A continuación, profundizamos en cómo evaluamos Genie Code en un amplio espectro de tareas de usuarios del mundo real.
Creamos deliberadamente un conjunto de evaluación para abarcar una amplia distribución de tareas de usuarios reales en Genie Code. Sintetizamos 401 tareas independientes a partir del uso interno real en Databricks, que abarcan desde preguntas cotidianas hasta los problemas más complejos que abordan los usuarios avanzados: tareas de descubrimiento en las que el agente debe encontrar los activos adecuados, creación y modificación de código y consultas, depuración de código, comprensión y explicación de código existente, búsquedas precisas de datos que requieren extraer números exactos de las tablas, y más.

Ejecutamos las mismas tareas en Genie Code y en tres de los principales agentes de codificación de propósito general, a los que llamaremos Agente X, Agente Y y Agente Z, cada uno con el mismo límite de tiempo real de 20 minutos por tarea. Las respuestas fueron calificadas por un juez independiente en función de si eran correctas y útiles. Una tarea que agota el tiempo de espera se considera un fallo. Las cifras en dólares de este análisis son estimaciones de lo que un usuario pagaría por cada agente, y resultan más informativas en términos relativos.
Ejecutamos cada agente en las 401 tareas, utilizando en todos los casos LLM similares de nivel de vanguardia y complementados con Databricks MCP.
Agente | Precisión | Media de $/tarea |
Genie Code | 76.6% | $0.55 |
Agente X | 72.1% | $1.09 |
Agente Y | 55.9% | $0.91 |
Agente Z | 56.1% | $1.16 |

Genie Code es el agente más preciso en esta prueba de rendimiento y el más barato: cuesta aproximadamente la mitad por tarea que el Agente X, y menos de la mitad de su costo por respuesta correcta. Los agentes Y y Z se sitúan en torno al 50 % de precisión, lastrados en gran parte por los tiempos de espera agotados en escaneos de larga duración, a menudo debido a consultas ineficientes y sin límites contra tablas muy grandes.
Para esta prueba de rendimiento en particular, observamos que la tarea mediana cuesta $0.34, el p99 es de $2.72, la tarea más cara cuesta $3.87 y solo el 4 % de las tareas supera los $2. Los otros agentes sitúan entre el 33 % y el 40 % de sus tareas por encima de $1 (frente al 16 % de Genie Code), y las ejecuciones de exploración profunda del Agente X alcanzan un costo máximo significativamente mayor de $9.49. Dado que todos los agentes tienen acceso al mismo nivel de modelos de vanguardia, las variaciones en el costo se reducen a la eficiencia: realizar menos turnos y consumir menos tokens para llegar a una respuesta.

La brecha se debe a la forma en que cada agente encuentra los datos que necesita. Las tareas más difíciles del conjunto no nombran los activos explícitamente, y el agente debe localizar las tablas, notebooks o dashboards adecuados, junto con la lógica de negocio correspondiente, antes de poder responder. En esas tareas, los agentes de propósito general recurren a una exploración ineficiente del espacio de trabajo, lo que se traduce tanto en una menor precisión como en un mayor costo.
La comprensión que tiene Genie Code del contexto del espacio de trabajo (búsqueda semántica en el catálogo y memoria persistente de los datos del espacio de trabajo) le permite evitar la mayor parte de eso, con un promedio de solo 8.3 llamadas a herramientas por tarea, menos que cualquier otro agente que hayamos probado. De eso también se componen las colas de costo mencionadas anteriormente: las ejecuciones costosas de cada agente están dominadas por estas tareas de descubrimiento, y la cola de Genie Code es la más corta. Esperamos que esta ventaja se vea reforzada aún más por la Genie Ontology; desactivamos la Ontology durante esta ejecución, ya que aún no está disponible de forma global para todos nuestros clientes.
Cuando comenzamos nuestra investigación, esperábamos un equilibrio entre precisión y costo. En cambio, en una amplia distribución de tareas de usuarios reales, descubrimos que Genie Code es capaz de utilizar su sólida comprensión semántica de los datos para superar a los agentes de codificación generales, siendo más preciso y más econ ómico.
Genie Code está diseñado como un agente de datos de vanguardia, optimizado para operar en un entorno altamente dinámico y ambiguo como el espacio de trabajo de Databricks. Los agentes de codificación generales tienen dificultades en estos entornos: terminan gastando sus turnos y tokens en redescubrir un contexto que Genie Code ya posee. Esa experiencia se traduce a la vez en precisión, velocidad y costo, sin comprometer la capacidad de propósito general.
Por último, al igual que nuestra prueba de rendimiento de agentes de codificación en la base de código de Databricks, la lección más amplia es que las tablas de clasificación genéricas no pueden medir la experiencia cotidiana de los usuarios. Ampliamos nuestras evaluaciones todos los días en función de tareas del mundo real y seguiremos publicando lo que aprendamos.
(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original
Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.