주요 컨텐츠로 이동
제품

평가 우선 AI 에이전트: Zepto가 Databricks와 MLflow에서 고객 지원을 확장하는 방법

Zepto가 Databricks와 MLflow를 사용하여 지원 티켓의 80% 이상을 처리하고, 지원 비용을 65% 절감하며, 1개월 미만의 투자 회수 기간을 달성하는 평가 우선(evaluation-first) AI 에이전트를 구축하는 방법

작성자: Gireesh Sreedhar KP, Deepak Dhankani , Eash Sharma

  • Zepto가 Databricks 및 MLflow 상에서 추적(traces), 골든 데이터 세트(golden datasets), LLM-as-judge 평가를 LLM 시스템의 핵심 인프라로 사용하여 평가 우선(evaluation-first) AI 에이전트를 구축하는 방법.
  • 엄격한 품질 게이트로 연결된 개발 및 프로덕션의 이중 루프(dual-loop) 아키텍처가 대규모 에이전트의 신뢰성을 확보하고 비용을 제어하며 리스크를 관리하는 구체적인 패턴을 제공하는 방법.
  • 이 프레임워크가 지원 비용을 65% 절감하고 1개월 미만의 투자 회수 기간을 달성하여, AI 빌더에게 고영향력 프로덕션 등급의 에이전트 설계를 위한 재사용 가능한 청사진을 제공하는 방법.

신뢰할 수 있는 실시간 고객 지원을 위한 Zepto의 노력

Zepto는 수천 개 이상의 상품을 보유하고 60개 이상의 도시에서 서비스를 제공하며, 분 단위의 배송 시간을 자랑하는 인도에서 가장 빠르게 성장하는 퀵커머스 플랫폼 중 하나입니다. 속도가 곧 상품인 비즈니스에서 고객 지원 역시 그만큼 빠르게 움직여야 합니다.

이러한 기대에 부응하기 위해 Zepto는 하루 10만 건 이상의 티켓을 처리하는 멀티 에이전트 AI 시스템을 통해 고객 지원을 운영하고 있습니다. 초기에는 팀에서 에이전트를 신속하게 구축하고 배포할 수 있었습니다. 하지만 처리량이 늘어나고 카테고리가 확장되며 고객 행동이 계속 변화함에 따라, 이러한 에이전트의 신뢰성을 어떻게 유지할 것인가가 더 어려운 과제였습니다. Zepto는 더 많은 에이전트를 배포하는 대신 평가(evaluation)를 에이전트 구축, 테스트 및 운영의 핵심 방식으로 삼음으로써 이 문제를 해결하고자 Databricks와 파트너십을 맺었습니다.

이 블로그에서는 시스템 아키텍처, Databricks 및 MLflow 기반의 평가 프레임워크, 실제 프로덕션 적용 사례, 그리고 이를 통해 얻은 결과와 교훈 등 그 여정을 자세히 살펴봅니다.

규모가 커질 때 "일단 에이전트를 배포하고 보자"는 방식이 실패하는 이유

빠르게 변화하는 비즈니스 환경에서 "일단 에이전트를 배포하고 보자"는 방식은 규모가 커져 시스템이 망가지기 전까지만 유효합니다. 하루 10만 건이 넘는 AI 에이전트 티켓을 처리할 때, 단 1%의 오류율만 발생해도 매일 수천 건의 잘못된 결과와 실제 매출 손실로 이어집니다.

이러한 압박은 불규칙한 파도처럼 밀려왔습니다. 기상 이변, 디왈리 축제, 여름 시작 등은 티켓 처리량의 급격한 급증을 유도했습니다. 식료품에서 의류, 전자제품, 뷰티 분야로의 확장은 새로운 환불, 교환, 반품 여정을 만들어 냈습니다. 한편, 더욱 다양해지고 다국어를 사용하는 고객층은 더 광범위한 지원 요청을 가져왔으며, 몇 주마다 새로운 실패 모드(failure mode)가 나타났습니다.

더 근본적인 문제는 보증 공백(assurance gap)입니다. 에이전트 시스템은 의도 분류, 지식 검색, 입력 분석, 의사 결정 추론, 트랜잭션 도구 호출, 응답 생성 등 다단계 워크플로우로 작동하므로, 최종 답변뿐만 아니라 진행 과정의 어느 단계에서든 실패가 발생할 수 있습니다.

이러한 보증 공백은 다음과 같은 구체적인 문제로 이어졌습니다.

  • 고객이 불만을 제기하기 전까지는 실패를 감지할 수 없었습니다.
  • 오류 수정이 느렸습니다.
  • 최종 답변이 내부 오류를 감추고 있었습니다.
  • 에이전트의 비용, 성능, 품질 간의 균형을 맞출 원칙적인 방법이 부족했습니다.
  • 에이전트 설계가 모든 주요 이해관계자의 관점을 반영하지 못했습니다.
  • 에이전트가 빠르게 진화하는 상황에서 신뢰성을 보장하기 어려웠습니다.

목표는 명확해졌습니다. Databricks 및 MLflow를 기반으로 평가 프레임워크를 설계하여, 에이전트가 구축되고 운영되는 핵심 AI 인프라 역할을 하도록 만드는 것이었습니다.

평가 프레임워크의 필요성과 그 성과

강력한 평가 프레임워크는 프로덕션 준비 상태의 5가지 축에 직접적인 영향을 미칩니다.

  • 신뢰성(Reliability): 에이전트가 단순히 “그럴듯하게 답변하는 것”을 넘어 모든 단계에서 올바르게 작동하도록 보장하는 시스템 수준의 보증
  • 속도(Velocity): 변경 사항에 대해 회귀 테스트가 자동으로 수행되므로 프롬프트, 정책, 모델을 더 빠르고 안전하게 반복 개선 가능
  • 비용 vs 품질 vs 성능 제어: 객관적인 평가 데이터를 바탕으로 제약 조건 내에서 최적의 지점을 찾기 위해 최적의 모델, 프롬프트 전략 또는 하이브리드 라우팅 전략을 선택할 수 있는 능력
  • 거버넌스(Governance): 감사 가능한 추적, 버전 관리되는 평가 기준선(baseline), 배포 및 롤백을 위한 명확한 임계값 제공. 직관에 의존한 결정(“이 버전이 더 나은 것 같다”)에서 증거에 기반한 결정(“이 버전이 합의된 지표에서 기준선을 능가한다”)으로 전환
  • 이해관계자 협업: 이해관계자의 관점에서 성공 및 신뢰성 기준을 포착하고, 모든 사람이 트레이드오프(trade-off)를 명확하고 측정 가능하게 파악할 수 있도록 지원

Databricks와 MLflow를 평가의 중추로 삼고 평가 우선 에이전트 아키텍처를 도입함으로써 Zepto는 다음과 같은 성과를 거두었습니다.

비용 및 효율성

  • 사람의 감독 하에 AI 에이전트가 80% 이상의 티켓을 완전히 처리
  • 지원 비용 또는 지원 티켓 65% 감소
  • 투자 회수 기간 1개월 미만

품질 및 평판

  • 고객 만족도(CSAT) 20% 향상
  • 정확도 8% 향상

성능 및 운영

  • 개발 주기 3배 단축
  • 해결 시간 4배 단축

프레임워크 구축: 신뢰와 제어를 위한 이중 루프

이 접근 방식의 핵심은 개발 루프와 프로덕션 루프가 품질 게이트(quality gate)로 연결된 이중 루프 모델입니다. 이 섹션에서는 이러한 루프가 어떻게 함께 작동하는지 설명합니다.

이중 루프 모델
  • 개발 루프(Development loop): 배포 전에 안심하고 구축할 수 있도록 에이전트 버전을 설계, 반복 개선 및 평가하는 단계
  • 프로덕션 루프(Production loop): 에이전트를 안정적으로 운영하기 위해 실제 동작을 모니터링하고 실패를 감지하는 단계
  • 피드백 루프(Feedback loop): 다음 반복 개선을 보완하기 위해 프로덕션 실패 사례를 개발 단계로 다시 전달하는 단계
  • 품질 게이트(Quality gate): 루프 간의 이동을 제어하며, 어떤 버전을 프로덕션에 배포할지, 어떤 버전을 더 나은 개선을 위해 개발 단계로 돌려보낼지 결정하는 단계

이 두 루프는 에이전트가 통제 하에 구축되고 운영되도록 함께 작동합니다. 모든 실패는 자동으로 캡처되고 피드백되어 수정됩니다. 결과적으로 에이전트는 신뢰를 바탕으로 구축되고, 통제 하에 실행되며, 시간이 지남에 따라 프로덕션 실패를 더 잘 처리할 수 있도록 지속적으로 개선됩니다. 이중 루프는 우리 프레임워크의 핵심입니다.

Phase 0: 추적 활성화: 설계부터 투명한 에이전트

모든 에이전트 호출은 프롬프트, 완성(completion), 검색된 문서, 도구 호출, 대기 시간, 의사 결정 경로를 캡처하는 풍부한 실행 추적(trace)을 생성하므로, 단순한 입력과 최종 출력이 아닌 전체 워크플로우를 세부적인 수준에서 관찰할 수 있습니다.

우리는 MLflow를 사용하는 하이브리드 접근 방식으로 이를 활성화했습니다. 단 한 줄의 코드인 mlflow.<library>.autolog()자동 추적을 켜고, @mlflow.trace 데코레이터는 더 자세한 정보가 필요한 곳마다 사용자 정의 스팬을 추가합니다. 추적은 고유한 ID를 가진 OpenTelemetry 스팬으로 실시간 내보내기되어 결합 가능한 상태를 유지하며, MLflow와 Unity Catalog의 통합을 통해 로깅이 Delta 테이블로 중앙 집중화됩니다.

Phase 1: 평가 차원 설정: 핵심 축 및 게이트

추적이 활성화되면 다음 단계는 각 이해관계자의 관점에서 “이 에이전트의 성공은 귀하에게 어떤 의미인가요?”를 파악하는 것입니다. 우리는 이를 구체적인 게이트가 있는 평가 축(evaluation pillars)으로 공식화합니다.

핵심 축 및 게이트

이를 통해 여러 이해관계자 간의 논쟁을 공유되고 측정 가능한 계약으로 전환할 수 있습니다. 에이전트는 각 이해관계자에게 실제로 중요한 차원에 따라 평가됩니다. 일반적인 핵심 축에는 고객 경험, 운영 효율성, 리스크 및 컴플라이언스, 재무적 영향 등이 포함되며, 각 축에는 배포 전에 충족해야 하는 명확한 수치적 임계값이 있습니다.

Phase 2: 골든 데이터셋: 신뢰성의 초석

골든 데이터셋은 개발 루프에서 에이전트의 동작을 평가하기 위한 단일 진실 공급원(single source of truth)입니다. 이 데이터셋은 다음을 충족해야 합니다.

  • 에이전트가 처리해야 하는 정상 케이스, 에지 케이스(edge case) 및 실패 케이스를 포함해야 합니다.
  • 다양한 이해관계자의 기대치를 예시로 캡처하여 포함해야 합니다.
  • 메타데이터(시나리오 유형, 비즈니스 라인, 리스크 수준 등)가 풍부하게 주석으로 추가되어야 합니다.

모든 이해관계자가 모여 데이터셋을 구성합니다. 예를 들어, 보안 팀은 프롬프트 주입(prompt injection), 신원 공격, 데이터 유출 시도와 같은 적대적 패턴에 대한 예시를 제공하여 일반적인 사용 사례뿐만 아니라 모든 실제 시나리오에 대해 신뢰성을 측정할 수 있도록 합니다.

골든 데이터셋

데이터셋은 살아있는 자산이며, 그 품질은 시간이 지남에 따라 복리로 향상됩니다. 개발 환경과 운영 환경 간의 정확도 차이 자체가 데이터셋 품질의 신호입니다. Zepto는 6개월 동안 MLflow 평가 데이터셋에 지속적으로 투자하여, 처음에는 500개의 예시와 8포인트의 개발-운영 정확도 차이에서 시작해, 2,000개의 예시와 2포인트 차이, 그리고 최종적으로 5,247개의 예시와 0.4포인트 차이까지 줄였습니다. 데이터셋 품질에 투자하는 1시간은 운영 환경에서의 디버깅 시간 약 10시간을 절약해 주므로, 골든 데이터셋은 10배의 효율성을 제공하는 승수가 됩니다. 운영 환경에서의 모든 실패는 실패 추적(trace)을 골든 데이터셋에 추가하여 향후 모든 버전의 시스템을 더욱 견고하게 만듭니다.

3단계: 프롬프트 엔지니어링 자동화: 자동 생성 및 자동 최적화

프롬프트를 직접 수동으로 작성하는 대신, 프롬프트 엔지니어링을 데이터 기반의 자동화된 프로세스로 만들었습니다. 프롬프트 디자인은 엔지니어가 가장 많은 시간을 보내는 중요한 단계이며, 프롬프트의 품질은 에이전트 결과물의 품질과 성능에 매우 큰 영향을 미칩니다.

MLflow 프롬프트 최적화를 사용하여 초기 프롬프트를 등록하고, 배포를 결정하는 동일한 평가자(scorer)를 기준으로 변형을 생성 및 최적화하며, A/B 테스트를 자동으로 실행하고 가장 좋은 결과를 배포합니다. 최적화 도구는 강력한 모델을 통해 개선 사항을 반영하고, 운영 환경에서는 더 저렴한 모델로 후보를 평가하므로 탐색 과정 자체의 비용 효율성이 유지됩니다. 이를 통해 수동 프롬프트 실험을 줄이고 정확도를 높였으며, 프롬프트 개선 사항이 운영 환경에 반영되기 전에 항상 골든 데이터셋을 기준으로 측정되도록 보장했습니다.

MLflow 프롬프트 최적화

4단계: 평가자 정의 및 AI 배심원단 구성

운영 루프에 추적 데이터가 유입되면 에이전트 품질에 중요한 차원(평가 차원)에 따라 점수를 매겨야 합니다. 이를 각 평가자(scorer)가 자신의 강점을 발휘하는 AI 배심원단이라고 생각하면 됩니다. MLflow는 평가자를 생성할 수 있는 세 가지 옵션을 제공합니다.

인간과 유사한 판단이 필요한 경우에만 LLM 기반 평가자를 사용하고, 결정론적 로직으로 충분한 경우에는 간단한 규칙에 의존합니다. 인간이 작성한 레이블과 80~90% 일치하도록 평가자를 조정하며, 중요한 결정에는 여러 평가자를 함께 사용합니다.

평가자 및 AI 배심원단 구성

5단계: 모델 선택권 설정

모델 선택권은 Databricks에서 모델 이름만 변경하여 다양한 상용 및 오픈소스 모델 간을 간편하게 전환할 수 있도록 하는 핵심 구성 요소입니다. 즉, 개발 루프에서 비용, 성능, 품질 간의 최적의 절충안을 찾기 위해 더 나은 조합을 지속적으로 탐색할 수 있습니다.

모델 선택권

6단계: 자동 회귀 평가 구축

반복 가능하고 구성 가능하며 확장 가능한 개발 루프를 만들기 위해 회귀 평가를 자동화합니다. 변경 사항이 발생하면 자동 회귀 평가가 트리거되고, 신뢰성이 보장되면 자동 배포가 이루어집니다.

회귀 평가 자동화

이 모든 요소를 종합하면, 일반적인 변경 작업은 다음과 같은 경로를 따릅니다.

  1. 누군가 에이전트의 로직, 프롬프트 또는 모델을 변경합니다.
  2. 새로운 에이전트 버전, 골든 데이터셋, 현재 운영 기준선(baseline)의 세 가지 입력을 가지고 평가 워크플로우가 자동으로 트리거됩니다.
  3. 시스템이 평가를 실행하고 모든 평가자 및 핵심 요소(pillar)에 걸쳐 메트릭을 생성합니다.
  4. 품질 게이트가 다음 사항을 확인합니다.
    • 새 버전이 모든 게이트(비용, 품질, 성능 등)를 충족합니까?
    • 최소한 운영 기준선만큼 또는 그보다 더 나은 성능을 발휘합니까?
  5. 조건을 충족하면 새 버전이 운영 환경으로 승격되고, 그렇지 않으면 거부되어 기존 에이전트가 계속 트래픽을 처리합니다.

7단계: 운영 루프 구축 - 실시간 안전망 설정

전체 트래픽의 100%를 평가하는 것은 비용이 많이 들지만, 단순하게 10%를 균등 샘플링하면 대부분의 예외 상황(edge case)을 놓치게 됩니다. 이에 따라 당사는 우수 고객, 새로운 기능 또는 최근 변경된 흐름, 부정적인 감정 또는 높은 에스컬레이션 위험, 이미지 기반 또는 사기 취약 상호작용에 따라 평가 샘플링 비율을 달리하는 층화 샘플링(stratified sampling)을 구현했습니다. 이를 통해 관리 가능한 수준의 비용으로 실질적으로 18~20%의 평가 샘플(하루 약 14,400개의 추적 데이터)을 확보하는 동시에, 예외 상황의 45~60%를 포착하고 4~6분 이내에 문제를 감지할 수 있게 되었습니다.

재정적 관점에서의 이점도 확실합니다. 균등 샘플링 방식과 비교했을 때, 층화 샘플링 방법론은 발견된 문제당 검토 비용을 86% 절감하는 동시에 예외 상황 감지율을 9배 향상시켜 품질 보증 프로세스의 효율성과 확장성을 크게 높였습니다.

평가 결과는 Delta 테이블에 기록되며 Databricks의 대시보드 및 알림 규칙을 통해 시각화됩니다. 심각(Critical) 알림(5분마다 확인)은 의도 정확도 하락, 근거성(groundedness) 위반, 높은 에스컬레이션 위험, P95 지연 시간 초과 등을 모니터링합니다. 높음/중간(High/Medium) 알림은 공감도 저하, 비용 급증, 도구 실패율, CSAT 추세, 사기 탐지율, 멀티모달 지연 시간 등을 추적합니다. 이를 통해 AI 에이전트에 대해 신속한 감지, 분류 및 완화 조치와 같은 SRE 방식의 운영이 가능해집니다.

구성 가능한 아키텍처 에이전트 스택

훌륭한 평가 프레임워크는 에이전트 아키텍처가 처음부터 관찰 가능하고 분해 가능하도록 설계되었을 때 훨씬 더 효과적으로 작동합니다. Zepto의 지원 스택은 바로 이러한 개념을 중심으로 구축되었습니다.

채팅이나 이미지 형태의 고객 문의는 먼저 에이전트 오케스트레이터 및 라우터를 거칩니다. 라우터는 어느 시점에서든 상담사에게 업무를 이관할 수 있습니다. 그 아래에서 시스템은 두 가지 종류의 에이전트로 나뉩니다.

수직적(Vertical) 에이전트는 전문가로서, 각각 명확하게 정의된 단일 의도 제품군을 담당합니다.

  • WIMO: 주문 추적 및 ETA 관련 문의용
  • Missing: 미배송 또는 일부 누락된 주문용
  • Expiry: 유통기한이 지난 포장 상품용
  • Returns: 환불 상태 및 처리용
  • Quality: 신선하지 않거나 상한 농산물용
  • Unable to Pay: 지갑, 프로모션 및 결제 실패용
  • General: 대체(fallback)용

수평적(Horizontal) 에이전트는 여러 사용 사례에 걸쳐 감독 레이어 역할을 합니다.

  • Image Deduplication: 여러 클레임에서 재사용된 이미지를 포착
  • Item Matching and Image Manipulation Detection: 업로드된 이미지가 카탈로그 상품과 일치하고 편집되지 않았는지 확인

아키텍처 에이전트 스택

이러한 분리는 두 가지 면에서 큰 이점을 제공합니다. WIMO 의도 F1 또는 Expiry OCR 정확도와 같이 버티컬 에이전트별로 메트릭을 계산할 수 있으며, 사기 정밀도, 이미지 재사용, 조작 탐지와 같은 교차 기능적 관심사에 대해 수평적 에이전트를 평가할 수 있습니다. 각 요소를 개별적으로 또는 결합하여 측정할 수 있습니다.

프레임워크의 실제 작동 방식

AI 에이전트를 프로덕션에 처음 출시할 때는 마치 똑똑하지만 예측할 수 없는 인턴에게 회사를 대표하도록 내보내는 것과 같습니다. 지침을 주고 잘되기를 바라지만, 실제로 압박을 받기 전까지는 사실상 아무것도 모르는 상태로 진행하는 셈입니다.

초기에 저희는 기존의 소프트웨어 모니터링이 AI에는 완전히 무용지물이라는 사실을 깨달았습니다. 에이전트는 완벽한 서버 가동 시간과 제로 에러를 유지하면서도, 답답해하는 고객에게 똑같이 틀린 답변을 반복할 수 있습니다. 엔지니어에게는 대시보드가 초록색(정상)으로 보이지만, 고객에게는 재앙입니다.

저희는 희망사항만으로는 AI를 확장할 수 없다는 것을 알고 있었습니다. AI가 단순히 말을 하고 있는지 추적하는 것을 넘어, 실제로 무슨 말을 하고 있고 어디서 실패하고 있는지 이해하는 평가 프레임워크가 필요했습니다. 다음 이야기들은 이 프레임워크가 제값을 톡톡히 해낸 순간들이며, 훌륭한 평가 시스템이 완전히 새로운 제품 기능을 열어준다는 것을 증명합니다.

스토리 1: 절대 바뀌지 않는 ETA

프로덕션 문제로 인해 라이더들이 교통 체증에 갇혀 있는 동안, 에이전트는 캐시된 데이터를 읽고 있었기 때문에 "10분 후 도착"이라는 답변을 계속 반복했습니다. 고객이 주문이 어디에 있는지 물었을 때 똑같은 답변을 받았고, 다시 물었을 때도 똑같은 답변을 받았습니다.

토큰 카운터(토큰 사용량 모니터링)와 경고 스코어러가 5분 이내에 반복 및 높은 에스컬레이션 위험을 감지하여, ETA가 변경되지 않은 채 정지해 있는 라이더의 추적 정보(traces)를 찾아냈습니다. 이를 계기로 규칙이 변경되었습니다. 이제 라이더가 10분 이상 정지해 있으면 에이전트는 무의미한 약속을 반복하는 대신, 솔직한 업데이트를 제공하고 선제적으로 전액 환불과 함께 취소를 제안합니다.

온라인 평가를 통해 포착된 하나의 인사이트는 전체 기능 라인으로 발전했습니다. 지연 시 취소, 라이더 부족 시 선제적인 취소 제안, 설정된 시간 내에 라이더가 배정되지 않을 경우 자동 취소, 우수 고객을 위한 무조건적인 취소 등이 이에 해당합니다.

MLflow 평가

스토리 2: 고객보다 먼저 취소 회귀(Regression) 감지하기

Zepto가 WIMO 에이전트에 취소 처리 기능을 추가했을 때, 모델은 "내 주문이 어디에 있나요", "취소하고 싶어요", "내 주문이 취소되었나요"라는 매우 다른 세 가지 의도(intents)를 혼동하기 시작했습니다.

개발 단계의 MLflow 평가를 통해 이를 즉시 감지했습니다. 전체 의도 정확도가 약 92.1%에서 87.4%로 떨어졌고, 새로운 WIMO_CANCEL 및 WIMO_CANCEL_STATUS 의도에 대한 F1 스코어가 저조했습니다. 골든 데이터셋(golden dataset)을 기준으로 회귀가 나타났기 때문에 고객은 이를 전혀 겪지 않았습니다. 프롬프트 최적화와 데이터셋 업데이트를 통해 전체 정확도를 원래 베이스라인보다 더 나은 약 94.2%로 복구했으며, 취소 API에 대한 툴 콜링(tool-calling) F1 스코어도 거의 완벽해졌습니다. 이 기능은 롤백 없이 성공적으로 배포되었습니다.

스토리 3: 인간의 판단에 맞춰 멀티모달 에이전트 보정하기

농산물 품질은 점수를 매기기가 정말 어려우며, 사람마다 의견이 항상 일치하는 것은 아닙니다. 동일한 버섯 이미지에 대해 어떤 평가자는 5점 만점에 2점을 줄 수 있고, 다른 평가자는 3점을 줄 수 있습니다. 저희는 이러한 불일치를 Cohen's Kappa로 측정하고 이를 신뢰도의 상한선으로 삼았습니다. 어떤 모델도 학습 대상인 인간보다 더 일관성을 가질 수는 없기 때문입니다.

또한 AI가 안전한 선택만 하려는 경향이 있음을 발견했습니다. 그대로 두면 어려운 결정을 피하기 위해 3점에 점수를 몰아주었지만, 인간의 점수는 4점과 5점에 집중되었습니다. 그래서 저희는 단순히 평균 대비 오차를 최소화하는 데 그치지 않고, 인간의 점수 분포 형태와 일치시켰습니다. 온라인 평가를 통해 시스템이 고려하지 못한 사례들도 발견되었습니다. 예를 들어, 포장 제품으로 진열되어 있지만 신선 식품처럼 판단해야 하는 상한 우유나, 사진으로는 도저히 확인할 수 없는 맛이나 냄새에 대한 불만 사항 등은 별도의 경로로 라우팅되었습니다.

이렇게 보정된 베이스라인을 통해 제품 유형별로 어떤 모델을 사용할지 결정하고, 인간의 판단에 맞춰 프롬프트를 반복 개선하는 방법과 실제 에이전트 성능을 기반으로 고객 세그먼트별 환불 정책을 조정하는 방법을 결정할 수 있습니다.

멀티모달 에이전트 보정

스토리 4: 악용 우회로 차단하기

환불 악용 시도에는 카탈로그 이미지, 편집된 사진, 여러 청구 건에 걸쳐 재사용된 이미지 등이 사용되었습니다. 멀티모달 평가 파이프라인은 흐림, 밝기, 해상도에 대한 전처리 검사를 통해 이미지를 실행하고, OCR로 검증한 다음, 합의 규칙이 있는 3개의 비전 모델 배심원단을 사용하여 자동 승인과 인간 검토 중 하나를 결정했습니다. 그 위에는 흐림 탐지, 스크린샷 탐지, 중복 탐지, 이미지 대 SKU 매칭, 이미지 대 진술 사유 대조, 배송 증명 검증 등이 계층화되어 적용되었습니다.

대규모 운영을 통해 배운 점

이 프레임워크를 대규모로 운영하면서 퀵커머스 분야를 넘어 일반화할 수 있는 몇 가지 원칙을 배웠습니다.

  • 단일 메트릭만 최적화하지 마세요. 저희는 한때 의도 정확도만 단독으로 쫓다가 CSAT가 떨어지는 것을 목격했습니다. 의도만 최적화하면 의도 정확도는 5포인트 상승했지만 지연 시간(latency)이 133% 증가하고 CSAT는 0.4포인트 감소했습니다. 복합적인 다중 목적 점수를 적용하자 지연 시간은 17%만 증가하면서 의도 정확도는 3포인트 상승했고 CSAT는 0.2포인트 추가되었습니다. 다각적인 관점, LLM 심사위원(judges), 규칙 기반 검사, 인간 레이블, 프로덕션 메트릭이 함께 진실을 만들어냅니다. 이러한 중복성은 낭비가 아니라 보험입니다.
  • 골든 데이터셋이 기초입니다. 초기에 투자하여 수천 개의 다양하고 고품질인 예시를 확보하세요. 개발 정확도와 프로덕션 정확도 간의 격차를 추적하고 수렴할 때까지 조정하세요. 개발-프로덕션 격차는 미스터리가 아니라 데이터셋 품질의 신호입니다.
  • LLM 심사위원은 보정이 필요합니다. 심사위원을 자체적인 평가가 필요한 모델로 취급하세요. 인간과의 일치도를 측정하고, 중요한 사례에는 앙상블을 사용하며, 기본 모델이 변경됨에 따라 재보정하세요.
  • 샘플링 비율보다 샘플링 전략이 더 중요합니다. 단순한 균등 샘플링은 비용은 적게 들지만 맹점이 있습니다. 고위험 흐름에 집중하는 층화 샘플링(stratified sampling)을 사용하면 비용 대비 훨씬 더 뛰어난 문제 탐지 효과를 얻을 수 있습니다.
  • 첫날부터 피드백 루프를 자동화하세요. 탐지, 레이블링, 재학습, 배포, 모니터링이 모두 자동화되어야 하며, 모든 실패 사례가 다음 학습 라운드를 자동으로 보강해야 합니다. 저희의 경우 이를 통해 한 달에 약 155시간을 절약할 수 있었으며, 이는 정규직 엔지니어 두 명을 기능 개발 업무로 전환한 것과 맞먹는 효과였습니다.
  • 평가를 제품의 한 영역으로 취급하세요. 대시보드와 메트릭은 지원, 제품, 사기 방지, 운영 팀에서 사용합니다. 단순히 기술적으로 정확한 것을 넘어, 해석 가능하고 실행 가능해야 합니다.

에이전트 구축업체를 위한 권장 사항

Databricks에서 에이전트 기반(agentic) 시스템을 구축하는 조직의 경우, Zepto의 경험을 바탕으로 다음과 같은 로드맵을 제안합니다.

  • 모델뿐만 아니라 추적 정보(traces)부터 시작하세요. 공유 추적 스키마를 강제하고 모든 것을 Delta에 기록하세요.
  • MLflow 평가를 CI/CD의 필수 관문으로 만드세요. 합의된 메트릭에서 베이스라인을 넘어서지 못하면 배포할 수 없도록 해야 합니다.
  • 자체적인 KPI(크기, 개발-프로덕션 격차, 예외 케이스 커버리지)를 갖춘 자산으로서 골든 데이터셋을 구축하세요.
  • 현재 인간이 판단하는 영역(품질, 공감, 근거성(groundedness))에 LLM-as-judge를 사용하되, 이를 보정하고 적절한 세그먼트로 제한하세요.
  • 층화 샘플링과 실시간 알림을 가능한 한 빨리 구현하세요. 나중에 운영 가시성을 사후 보완하는 것은 비용이 많이 듭니다.
  • 에이전트를 버티컬(전문 분야) 및 수평적(감독)으로 설계하여 개별적으로 또는 결합하여 평가할 수 있도록 하세요.

결론

실험적인 데모에서 미션 크리티컬한 인프라로 전환하는 과정에서, 주요 제약 조건은 단순한 모델 성능에서 시스템 보증으로 이동했습니다. Zepto의 여정은 평가를 기본 개발 프리미티브(primitive)로 설정함으로써, 조직이 품질, 비용 및 위험 완화에 대한 엄격한 보증을 바탕으로 멀티모달 입력 전반에서 매일 수만 건의 복잡한 상호작용을 관리하도록 에이전트를 안정적으로 확장할 수 있음을 보여줍니다.

Databricks와 MLflow는 이러한 진화의 핵심 기반 역할을 하며, Unity Catalog 및 Delta에서 추적 중심의 데이터 인프라를 제공하는 동시에 확장 가능한 평가, 자동화된 프롬프트 최적화, 원활한 CI/CD 통합을 지원합니다. 이 조합 가능한 스택은 모델 선택권과 결합되어 팀이 모든 특정 작업에 대해 성능과 비용 간의 균형을 미세 조정할 수 있도록 지원합니다.

궁극적으로 경쟁 우위는 평가를 단순한 최종 점검이 아닌 핵심 AI 인프라로 취급하는 전략적 결정에 있습니다. 프로덕션 규모의 에이전트를 운영하기 위한 청사진은 더 이상 미스터리가 아닙니다. Zepto와 Databricks가 그 해답을 제시했습니다. 이제 과제는 도입 속도입니다. 빠르게 진화하는 AI 환경에서 리더는 완벽한 확실성을 기다리는 사람이 아니라, 첫날부터 신뢰성을 고려하여 시스템을 설계하는 사람일 것입니다.

프로덕션 환경에서 신뢰를 얻어야 하는 에이전트를 개발하는 개발자들을 위해, 이러한 동일한 기본 구성 요소가 Databricks 및 MLflow 3에 준비되어 있습니다. 다음 시대를 선도할 조직은 오늘 바로 평가 중심의 여정을 시작하는 조직이 될 것입니다.

Databricks에서 에이전트 빌드하기
MLflow 평가 및 모니터링 시작하기

(이 글은 AI의 도움을 받아 번역되었습니다. 원문이 궁금하시다면 여기를 클릭해 주세요)

최신 게시물을 이메일로 받아보세요

블로그를 구독하고 최신 게시물을 이메일로 받아보세요.