주요 컨텐츠로 이동
KakaoStyle logo

CUSTOMER
STORY

데이터와 AI의 통합을 통한 개인화 쇼핑의 혁신

약 90% 감소

데이터 엔지니어링 팀 기준 배치 실패 알림 감소

약 2.6배 향상

특정 쿼리 기준 기존 대비 실행 속도 개선

수십 분에서 1분으로

쿼리 문법 오류 자동 조치로 대응 시간 단축

Woman selecting clothes from a rack in an office.

현재 패션 커머스 산업은 AI 기반 쇼핑 경험 혁신에 집중하고 있습니다. 특히, 고객 행동 데이터를 기반으로 한 개인화 서비스는 플랫폼 경쟁력을 좌우하는 핵심 요소로 자리 잡고 있습니다. 이러한 변화에 발맞춰, 카카오스타일은 AI를 활용한 고객 경험 혁신과 운영 효율화를 적극적으로 실행하고 있습니다. 패션, 뷰티, 라이프스타일을 아우르는 종합 스타일 커머스 플랫폼인 카카오스타일은 기존 20대 여성 중심의 고객층을 30대까지 확장하고 있습니다. 이를 위해 개인화 추천과 검색 고도화는 물론, AI 리뷰 검수, AI 자동화 기획전 등 다양한 AI 기술을 서비스를 적용하고 있습니다. 하지만 이러한 확장을 뒷받침하기에는 기존 데이터 환경은 데이터 품질 관리, 운영 효율성 등 여러 제약이 존재했습니다. 이에 카카오스타일은 데이터브릭스를 도입하여 분산된 인프라를 하나의 통합 환경으로 전환하였습니다. 그 결과, 시스템 안정성 및 운영 효율성이 대폭 향상되었고, AI 기반 서비스 혁신을 가속화할 수 있는 기반을 마련했습니다.

분산된 기존 시스템의 기술적 한계

카카오스타일에게 데이터 기반 AI  기술 도입은 선택이 아닌 필수였습니다. 개인화 추천과 검색의 정확도를 높이기 위해서는 유저 행동 로그와 상품 카탈로그 데이터를 정교하게 활용해야 했고, 빠르게 변화하는 패션 트렌드에 대응하기 위해서는 데이터 신선도와 모델 재학습 속도를 향상해야 했습니다. 다양한 시도 결과, ‘직잭렌즈’, ‘장바구니 유사상품 비교’ 와 같은 기능을 선보이며 검색 품질을 향상하여 고객들의 쇼핑 편의를 확보하였고, 배송 서비스와 셀렉션을 확대하여 고객 만족도도 향상하였습니다.

하지만 기존의 데이터 인프라는 이러한 AI 활용을 안정적으로 뒷받침하기에 한계가 있었습니다. 데이터 탐색, 모델 학습, 운영이 서로 분리된 환경에서 이루어졌기에 업무 효율성이 떨어졌고, 이는 모델 성능과 서비스 품질에도 부정적인 영향을 미쳤습니다. 특히, 패션 커머스의 특정상, 신상품 입고, 품절, 가격 변경 등 데이터를 실시간에 가깝게 반영해야 했지만, 기존 배치 중심 파이프라인으로는 데이터 신선도를 유지할 수 없었습니다. “복잡한 파이프라인 구조로 인해 품질 이슈가 종종 하위 데이터까지 전파되었고, 통합된 모니터링 통합된 모니터링 체계 부재로 이상 데이터를 사전에 탐지하기 어려웠습니다.”라고 박지윤 데이터 엔지니어가 설명하였습니다.

인프라 및 거버넌스 측면에서도 여러 이슈가 있었습니다. 도구별로 분산된 권한 구조로 인해 데이터 사용 현황과 리니지 파악이 어려웠고, 이는 데이터 신뢰성과 보안 관리 측면에서도 리스크로 작용했습니다. 이러한 한계를 해결하기 위해 카카오 스타일은 데이터 관리, 분석, AI를 하나의 흐름으로 통합할 수 있는 데이터브릭스 인텔리전스 플랫폼 도입을 결정했습니다.

데이터, 분석, 그리고 AI를 단일 플랫폼으로 통합

카카오스타일은 데이터브릭스를 중심으로 분산된 데이터 인프라를 통합하고, 데이터 분석과 AI 활용을 하나의 환경에서 운영하는 체계를 구축했습니다. 데이터 파이프라인, 메타데이터 관리, 대시보드, 모델 서빙까지 단계적으로  데이터브릭스로 이관한 결과, 전사 핵심 데이터의 안정적인 제공이 가능해졌으며, 데이터 지연으로 인한 의사결정 공백도 해소되었습니다. 이를 통해, 조직 전반에서 신뢰할 수 있는 데이터를 기반으로 신속하고 일관된 의사결정을 내릴 수 있는 환경이 마련되었습니다.

또한, 데이터브릭스 Genie 도입을 통해 자연어 기반 분석 환경이 마련되면서, 현업 부서가 데이터팀을 거치지 않고도 직접 데이터를 탐색하고 활용할 수 있게 되었고, 반복적인 분석 요청도 크게 감소했습니다. 동시에, 분석부터 시각화까지 하나의 흐름으로 연결되면서 대시보드 제작과 공유 속도도 향상되었습니다. 이는 고객 행동 분석, 상품 운영 최적화와 같은 핵심 업무의 실행 속도를 높이는 데 기여했습니다. 장애 대응 역시 신속해졌기에, 데이터 엔지니어도 운영 대응보다 핵심 개발에 집중할 수 있는 환경이 마련되었습니다.

AI 및 ML 모델 운영 방식도 크게 간소화되었습니다. 기존에는 인프라 관리와 배포에 많은 시간이 소요되었으나, 데이터브릭스 MLflow 도입 후에는 설정 기반으로 모델을 쉽게 배포하고 운영할 수 있는 체계가 마련되었습니다. ML 엔지니어는 인프라 관리 부담에서 벗어나 모델 성능 개선과 새로운 활용 사례 발굴에 집중할 수 있게 되었습니다. 거버넌스와 협업 측면에서도 개선이 이루어졌습니다. 데이터 접근 권한과 관리 체계가 중앙에서 통합되면서 보안과 신뢰성이 강화되었고, 데이터 흐름을 쉽게 파악할 수 있게 되었습니다. 동시에 데이터 엔지니어, 분석가, 데이터 사이언티스트가 동일한 환경에서 협업하게 되면서 조직 전반의 효율성이 크게 향상되었습니다.

박지윤 데이터 엔지니어는 “AI 에이전트 기반 데이터 민주화를 실현하는 과정에서, Unity Catalog 기반 거버넌스를 통해 보안성과 접근성을 동시에 확보할 수 있는 환경을 구축하고 있습니다.”고 설명했습니다.

안정성 및 효율성 대폭 향상

데이터브릭스 도입 이후 카카오스타일은 운영 안정성을 크게 개선할 수 있었습니다. 기존 환경에서 빈번하게 발생하던 인프라 이슈와 배치 실패는 데이터브릭스 서버리스 환경 이관 이후 크게 감소했으며, 데이터 엔지니어링 팀 기준 배치 실패 알림은 약 90% 감소했습니다. 이러한 안정성 향상은 기존 클러스터 유지 및 관리 비용과 장애 대응에 투입되던 인력 비용의 절감으로 이어지며, 운영 비용 절감에도 기여했습니다.

생산성 측면에서도 의미있는 성과를 얻었습니다. 기존 인프라 관리와 장애 대응에 소모되던 리소스를 데이터 품질 개선과 신규 파이프라인 개발에 투입할 수 있게 되면서 업무 효율이 향상되었습니다. 기존에는 쿼리 문법 오류를 해결하는 데 수 분에서 수십 분이 소요되었으나, 데이터브릭스의 Lakeflow Jobs, 서버리스 SQL, 모델 서빙 등 다양한 자동 조치 기능을 활용해 이를 1~2분 이내로 단축하였습니다. 또한, 향상된 쿼리 응답 속도와 간편한 시각화 환경은 분석 및 개발 생산성을 높이는 데 기여했습니다. 특정 쿼리를 기준으로 측정한 결과 기존 대비 약 2.6배 빠른 실행 속도를 달성했으며, 과거에는 며칠이 소요되던 대시보드 제작도 이제 프롬프트 기반으로 빠르게 구축할 수 있게 되었습니다. 더불어, Genie 기반의 셀프서비스 분석 환경은 현업이 분석가를 거치지 않고도 데이터 기반 의사결정을 내릴 수 있는 토대를 마련하며 전사적인 데이터 중심 문화 정착에 기여하고 있습니다.

이러한 성과를 바탕으로 카카오스타일은 패션 커머스의 핵심 과제인 개인화 추천, 트렌드 예측, 수요 예측과 같은 핵심 비즈니스 경쟁력을 지속적으로 강화하고 있습니다. 특히 실시간에 가까운 데이터 분석 결과를 비즈니스 전략에 신속하게 반영할 수 있는 체계를 구축하는데 집중하고 있습니다.

앞으로 나아가, 카카오스타일은 데이터브릭스를 기반으로 AI 에이전트가 신뢰할 수 있는 데이터를 활용해 안전하게 운영될 수 있는 환경을 고도화해 나갈 계획입니다. 박지윤 데이터 엔지니어는 “직군과 기술 수준에 관계없이 누구나 AI와 함께 데이터를 활용해 신속하게 의사결정을 내릴 수 있는 환경을 만들어가는 데 데이터브릭스가 핵심 기반으로 기여할 것입니다.”고 설명했습니다.

FAQ: 카카오스타일과 Databricks Data Intelligence Platform

카카오스타일은 파편화된 데이터 인프라를 단일 환경으로 통합하고, AI 활용을 제약하던 데이터 품질 관리와 운영 효율성의 한계를 해소하기 위해 Databricks를 도입했습니다.