주요 컨텐츠로 이동

Data Ingestion with Lakeflow Connect - Korean

이 과정은 다양한 소스에서 Databricks로 데이터를 수집하기 위한 확장 가능하고 간소화된 솔루션인 LakeFlow Connect에 대한 포괄적인 입문 내용을 제공합니다. LakeFlow Connect 커넥터의 다양한 유형(Standard 및 Managed)을 탐색하는 것으로 시작하여 배치, 증분 배치, 스트리밍 수집을 포함한 다양한 데이터 수집 기법을 학습합니다. 또한 Delta 테이블과 메달리온 아키텍처 사용의 주요 이점도 살펴봅니다.


다음으로, LakeFlow Connect Standard Connectors를 사용하여 클라우드 오브젝트 스토리지에서 데이터를 수집하는 실용적인 기술을 개발합니다. 여기에는 CREATE TABLE AS SELECT(CTAS), COPY INTO, Auto Loader와 같은 방법을 활용하는 내용이 포함되며, 각 접근 방식의 이점과 고려 사항을 중점적으로 다룹니다. 또한 Databricks Data Intelligence Platform으로 수집하는 과정에서 브론즈 레벨 테이블에 메타데이터 컬럼을 추가하는 방법도 학습합니다. 이어서 rescued data 컬럼을 사용하여 테이블 스키마와 일치하지 않는 레코드를 처리하는 방법과 해당 데이터를 관리 및 분석하는 전략을 다룹니다. 반정형 JSON 데이터를 수집하고 평탄화하는 기법도 살펴봅니다.


그 다음으로, LakeFlow Connect Managed Connectors를 사용하여 데이터베이스 및 SaaS(Software-as-a-Service) 애플리케이션에서 데이터를 가져오는 엔터프라이즈급 데이터 수집을 수행하는 방법을 탐색합니다. 또한 수집 워크로드에 파트너 도구를 통합하기 위한 옵션으로 Partner Connect도 소개합니다.


마지막으로, MERGE INTO 운영 및 Databricks Marketplace 활용을 포함한 대안적 수집 전략으로 과정을 마무리하며, 현대적인 데이터 엔지니어링 사용 사례를 지원하기 위한 탄탄한 기초를 갖출 수 있도록 합니다.


참고: Databricks Academy는 Databricks 환경 내 교실 세션에서 노트북 기반 형식으로 전환하고 있으며, 강의용 슬라이드 덱의 사용을 중단하고 있습니다. Vocareum 실습 환경에서 강의 노트북에 액세스할 수 있습니다.


Languages Available: English | 日本語 | Português BR | 한국어

Skill Level
Associate
Duration
4h
Prerequisites

이 콘텐츠는 다음과 같은 기술/지식/능력을 갖춘 참가자를 대상으로 개발되었습니다:

• Databricks Workspaces, Apache Spark, Delta Lake, 메달리온 아키텍처 및 Unity Catalog를 포함한 Databricks Data Intelligence Platform에 대한 기본적인 이해

• 데이터 수집 워크플로우(배치, 스트리밍, 증분) 및 일반적인 ETL 원칙에 대한 기본적인 이해

• 다양한 파일 형식(예: Parquet, CSV, JSON, TXT) 사용 경험

• SQL 및 Python 활용 능력

• Databricks Notebooks에서 코드 실행에 대한 숙지

Outline

데이터 수집 with Lakeflow Connect

• Databricks의 데이터 엔지니어링

• 데모: 실습 환경 탐색

• 클라우드 스토리지에서의 데이터 수집

• 데모: CREATE TABLE AS 및 COPY INTO를 사용한 데이터 수집

• 데모: SQL을 사용하여 Auto Loader로 스트리밍 테이블 생성

• 수집 시 메타데이터 컬럼 추가

• 데모: 수집 중 메타데이터 열 추가

• Rescued Data Column 다루기

• 데모: Rescued Data Column을 활용한 CSV 수집 처리

• 실습:  CSV 파일에서 브론즈 테이블 생성

• 반정형 데이터 수집: JSON

• 데모: Databricks를 사용한 JSON 파일 수집

• 실습: 브론즈 테이블을 JSON 파일에서 생성하기

• 엔터프라이즈 데이터 수집 개요

• 데모: LakeFlow Connect를 활용한 엔터프라이즈 데이터 수집

• 추가 기능 및 기존 Delta 테이블에 데이터 수집

• 데모: BONUS - MERGE INTO를 활용한 데이터 수집

Upcoming Public Classes

Date
Time
Your Local Time
Language
Price
Nov 04
02 PM - 06 PM (Asia/Seoul)
-
Korean
$750.00

Public Class Registration

If your company has purchased success credits or has a learning subscription, please fill out the Training Request form. Otherwise, you can register below.

Private Class Request

If your company is interested in private training, please submit a request.

See all our registration options

Registration options

Databricks has a delivery method for wherever you are on your learning journey

Runtime

Self-Paced

Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos

지금 등록하세요

Instructors

Instructor-Led

Public and private courses taught by expert instructors across half-day to two-day courses

지금 등록하세요

Learning

Blended Learning

Self-paced and weekly instructor-led sessions for every style of learner to optimize course completion and knowledge retention. Go to Subscriptions Catalog tab to purchase

Purchase now

Scale

Skills@Scale

Comprehensive training offering for large scale customers that includes learning elements for every style of learning. Inquire with your account executive for details

Upcoming Public Classes

Advanced Machine Learning with Databricks - Korean

이 과정은 데이터 과학자와 머신 러닝 실무자를 대상으로 하며, 4시간 모듈 2개로 구성되어 있습니다.

Machine Learning at Scale

이 과정에서는 Apache Spark의 아키텍처와 Databricks 내 머신 러닝 워크로드에 대한 적용에 관한 이론적·실무적 지식을 습득합니다. 데이터 준비, 모델 학습 및 배포에 Spark를 활용하는 시점을 학습하는 동시에, Spark ML 및 Spark 기반 Pandas APIs에 대한 실습 경험을 쌓습니다. 이 과정에서는 하이퍼파라미터 튜닝 및 Spark를 활용한 Optuna 스케일링과 같은 고급 개념을 소개합니다. 또한 포괄적인 모델 패키징 및 거버넌스를 위해 어소시에이트 과정에서 소개된 MLflow 및 Unity Catalog와 같은 기능과 개념을 활용합니다.

Advanced Machine Learning Operations

이 과정에서는 머신 러닝 라이프사이클과 MLOps에 대한 포괄적인 이해를 제공하며, 데이터 및 모델 관리, 테스트, 확장 가능한 아키텍처에 대한 모범 사례를 중점적으로 다룹니다. CI/CD, 파이프라인 관리, 환경 분리를 포함한 주요 MLOps 구성 요소를 다루는 동시에, Declarative Automation Bundles(DABs), Lakeflow Jobs, Model Serving과 같은 자동화 및 인프라 관리를 위한 Databricks 도구를 소개합니다. 모니터링, 사용자 정의 메트릭, 드리프트 감지, 모델 롤아웃 전략, A/B 테스트, 그리고 신뢰할 수 있는 MLOps 시스템의 원칙에 대해 학습하여 Databricks에서 ML 프로젝트를 구현하고 관리하는 방법에 대한 전체적인 뷰를 제공합니다.

참고: Databricks Academy는 Databricks 환경 내의 대면 강의 형식을 노트북 기반 방식으로 전환함에 따라, 강의용 슬라이드 사용이 중단됩니다. Vocareum 랩 환경에서 강의용 노트북에 액세스할 수 있습니다.

Paid
8h
Lab
instructor-led
Professional

Questions?

If you have any questions, please refer to our Frequently Asked Questions page.