メインコンテンツへジャンプ

Advanced Data Engineering with Databricks - Japanese

このコースは、Databricksを使った高度なデータエンジニアリングを学ぶための適切な入り口となります。以下では、このコースに含まれる4つの4時間の各モジュールについて説明します。


注記:Databricks Academyでは、Databricks環境内での教室セッションをノートブック形式に移行し、最初のモジュールにおける講義用スライドデッキの使用を終了します。講義ノートブックはVocareumラボ環境でアクセス可能です。


Advanced Techniques with Apache Spark Declarative Pipelines

このコースでは、本番運用グレードのストリーミングパイプラインを構築するための Databricks の Apache Spark Declarative Pipelines (SDP) について学びます。実際の Lakehouse エンジニアリングに不可欠な高度なデザインパターン、堅牢なデータ品質の適用、およびクロスプラットフォーム統合を習得します。


コース全体を通じて、最新のデータ取り込みおよび処理技術を深く学び、レイアウト最適化のためのリキッドクラスタリングや、混在スキーマイベントに対応するマルチプレックスストリーミングパターンなどのツールを習得します。モジュールの終わりには、スキーマ進化を自信を持って処理し、チェンジデータキャプチャ (CDC) を自動化し、データ完全性を確保する方法を習得できます。


講義とハンズオンデモを通じて、以下のことを学びます。

• 複数ソースのデータを統合されたブロンズテーブルに取り込むマルチフローパイプラインを構築する。

• シルバーおよびゴールドレイヤー全体にリキッドクラスタリングとデータ品質 Expectations を適用する。

• クロスプラットフォームのデータアクセスのために Iceberg UniForm を使用したマルチプレックスパターンを実装する。

• AUTO CDC INTO を使用して SCD Type 2 の履歴トラッキングを自動化する。

• 無効なレコードを監査・管理するためのゼロデータロス隔離パイプラインを設計する。


Databricks Data Privacy

このコンテンツは、Databricks内でのデータプライバシー管理に関する包括的なガイドを提供します。Delta Lakeアーキテクチャ、リージョナルデータ分離、GDPR/CCPAコンプライアンス、チェンジデータフィード(CDF)の使用といった主要トピックを網羅しています。実践的なデモとハンズオンラボを通じて、参加者は機密データの保護とコンプライアンス確保のためのUnity Catalog機能の使用方法を学び、データ整合性を効果的に保護する能力を身につけます。


Databricks Performance Optimization

このコースでは、SparkとDelta Lakeを用いたワークロードと物理レイアウトの最適化手法、およびSpark UIの分析によるパフォーマンス評価とアプリケーションのデバッグ方法を学びます。ストリーミング、流動的クラスタリング、データスキップ、キャッシュ、Photonsなどのトピックを網羅します。


Automated Deployment with Declarative Automation Bundles

このコースでは、DevOps の原則と Databricks プロジェクトへの適用について包括的に学習します。まず、DevOps、DataOps、継続的インテグレーション(CI)、継続的デプロイメント(CD)、およびテストの中核となる概念の概要を説明し、これらの原則をデータエンジニアリングパイプラインに適用する方法を探ります。


次に、CI/CD プロセスにおける継続的デプロイメントに焦点を当て、プロジェクトのデプロイメントに使用する Databricks REST API、SDK、CLI などのツールについて説明します。Declarative Automation Bundles(DABs)の概念と、CI/CD プロセスにおける位置づけを学びます。DABs の主要なコンポーネント、フォルダー構造、および Databricks のさまざまなターゲット環境へのデプロイメントを効率化する方法について詳しく解説します。また、Databricks CLI を使用して、異なる構成を持つ複数の環境向けに Declarative Automation Bundles に変数を追加し、変更、検証、デプロイ、および実行する方法についても学習します。


最後に、Declarative Automation Bundles をローカルで構築、テスト、およびデプロイするためのインタラクティブ開発環境(IDE)として Visual Studio Code を紹介し、開発プロセスの最適化を図ります。コースの締めくくりとして、GitHub Actions を使用してデプロイメントパイプラインを自動化し、Declarative Automation Bundles を活用した CI/CD ワークフローを強化する方法を紹介します。


このコースを修了すると、DevOps プラクティスを通じて効率性を向上させながら、Declarative Automation Bundles を使用して Databricks プロジェクトのデプロイメントを自動化できるようになります。


Languages Available: English | 日本語 | Português BR | 한국어

Skill Level
Professional
Duration
16h
Prerequisites

• Spark Declarative Pipelines — 「Apache Spark Declarative Pipelines を使用したデータパイプラインの構築」コースの修了、または CREATE OR REFRESH STREAMING TABLE、制約(CONSTRAINTS)、および Pipelines UI に関する知識

• Delta Lakeの基礎 — Deltaテーブル、およびDeltaによるデータファイルとトランザクションログの管理方法に関する理解

• ストリーミングの概念 — SDPにおけるマイクロバッチストリーミング、チェックポイント、イベントタイム処理に関する知識

• SQLの習熟度 — SELECT、JOIN、MERGE、CASE WHEN、および一般的な集計関数を含む、SQLの読み書き能力

• Databricks Notebooks での Python — Databricks Notebooks での Python コードの閲覧および実行に慣れていること

• Unity Catalog の基礎 — Unity Catalog におけるカタログ、スキーマ、テーブル、ボリュームに関する理解

• Databricks データエンジニアリングおよびデータサイエンスワークスペースを使用した基本的なコード開発タスクを実行できること(クラスターの作成、ノートブックでのコード実行、基本的なノートブック操作、Git からのリポジトリインポートなど)

• PySpark の中級レベルのプログラミング経験

• さまざまなファイル形式やデータソースからデータを抽出する

• データクレンジングのために、一般的な変換処理を適用する

• 高度な組み込み関数を使用して、複雑なデータを再構成および操作する

• Delta Lake の中級レベルのプログラミング経験(テーブルの作成、完全更新および増分更新の実行、ファイルの圧縮、以前のバージョンの復元など)

• Apache Spark Declarative Pipelines UI を使用したデータパイプラインの設定およびスケジューリングに関する初級レベルの経験

• PySpark を使用した Apache Spark Declarative Pipelines の定義に関する初級レベルの経験

• Auto Loader および PySpark 構文を使用したデータの取り込みと処理

• APPLY CHANGES INTO構文を使用したチェンジデータキャプチャフィードの処理

• パイプラインのイベントログと結果を確認し、Declarative Pipeline構文のトラブルシューティングを行う

• Databricks platformに関する深い知識。これには、Databricks Workspaces、Apache Spark、Delta Lake、メダリオンアーキテクチャ、Unity • Catalog、Apache Declarative Pipelines、およびワークフローの経験が含まれます。特に、ApacheDeclarative Pipelinesにおける "Expectations" の活用に関する知識が必要です。

• データ取り込みおよび変換の経験があり、データ処理およびDataFrame操作におけるPySparkに精通していること。また、データ分析および変換のための中級レベルのSQLクエリの作成経験も必要です。

• 関数およびクラスの設計・実装能力を含む、Pythonプログラミングに関する習熟度を有し、Pythonパッケージの作成、インポート、および活用経験があること。

• DevOpsの実践、特に継続的インテグレーションおよび継続的デリバリー/デプロイメント(CI/CD)の原則に関する知識を有していること。

• Gitによるバージョン管理について、基本的な理解を有していること。

• 前提コース:「データエンジニアリングのためのDevOpsの基本」コース

Outline

Advanced Techniques with Apache Spark Declarative Pipelines

• SDP におけるマルチフロー、エクスペクテーション、およびリキッドクラスタリングの概要

• デモ: リキッドクラスタリングとデータ品質を使用したマルチフロー SDP

• マルチプレックスストリーミング、Delta シンク、および Iceberg リードの概要

• デモ: Delta シンクと Iceberg リードを使用したマルチプレックス ストリーミング SDP

• チェンジデータキャプチャ(CDC)レビュー

• デモ: Apache Spark Declarative Pipelines における AUTO CDC を使用した SCD Type 2 の自動化

• SDP における高度なデータ品質チェックと期待値

• デモ: SDP における高度なデータ品質チェックと期待値

• ラボ: SDPを使用したマルチソースeコマースパイプラインの構築


Databricks Data Privacy

• データを安全に保管する

• Unity Catalog

• PIIデータセキュリティ

• ストリーミングデータおよびCDF


Databricks Performance Optimization

• Spark アーキテクチャ

• 基礎の設計

• コードの最適化

• 微調整:適切なクラスターの選択


Automated Deployment with Declarative Automation Bundles

• DevOps と CI/CD レビュー

• デモ: コースのセットアップと認証

• Databricks Projects のデプロイ

• 宣言型自動化バンドル(DABs)入門

• デモ: シンプルな DAB のデプロイ

• ラボ: シンプルな DAB をデプロイする

• 変数置換(DABs)

• デモ: 複数の環境への DAB のデプロイ

• ラボ: 複数の環境への DAB のデプロイ

• DAB プロジェクトテンプレートの概要

• ラボ: Databricks のデフォルト DAB テンプレートを使用する

• CI/CDプロジェクトの概要(DABs使用)

• デモ: 継続的インテグレーションと継続的デプロイメント(DABs を使用)

• ラボ: 機械学習をエンジニアリングWorkflowsに追加する(DABs使用)

• Visual Studio Code(VSCode)を使用したローカル開発

• デモ: VSCodeをDatabricksで使用する

• CI/CD ベストプラクティスと GitHub Actions を使った次のステップ

Upcoming Public Classes

Date
Time
Your Local Time
Language
Price
Oct 01 - 02
09 AM - 05 PM (Asia/Tokyo)
-
Japanese
$1500.00

Public Class Registration

If your company has purchased success credits or has a learning subscription, please fill out the Training Request form. Otherwise, you can register below.

Private Class Request

If your company is interested in private training, please submit a request.

See all our registration options

Registration options

Databricks has a delivery method for wherever you are on your learning journey

Runtime

Self-Paced

Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos

今すぐ登録

Instructors

Instructor-Led

Public and private courses taught by expert instructors across half-day to two-day courses

今すぐ登録

Learning

Blended Learning

Self-paced and weekly instructor-led sessions for every style of learner to optimize course completion and knowledge retention. Go to Subscriptions Catalog tab to purchase

Purchase now

Scale

Skills@Scale

Comprehensive training offering for large scale customers that includes learning elements for every style of learning. Inquire with your account executive for details

Upcoming Public Classes

Generative AI Engineer

Generative AI Engineering with Databricks - Japanese

本コースは、最新かつ最も普及しているフレームワークとDatabricksの機能を使用して生成AIアプリケーションを構築したいデータサイエンティスト、機械学習エンジニア、その他のデータ実務者を対象としています。

注: Databricks Academyは、Databricks環境内の教室セッションをノートブックベースの形式へ移行しており、講義でのスライドデッキの使用を終了します。講義用ノートブックはVocareumのラボ環境で利用できます。

以下では、本コースに含まれる4つの4時間モジュールについてそれぞれ説明します。

Building RAG Agents with Agent Bricks: 本コースでは、Databricks Agent Bricksを使用して検索エージェントを構築するための実践的なトレーニングを提供します。参加者は、Knowledge Assistantsの探索とクエリ、AI Functionsを使用した非構造化ドキュメントの構造化データへの解析、セマンティック検索のためのテキストのチャンク分割、Vector Searchインデックスの構築、および複数のナレッジソースに支えられた本番運用対応のKnowledge Assistantsの作成方法を学びます。

Building Agentic Applications on Databricks: 本コースでは、Databricks上で本番グレードのエージェントアプリケーションを構築する方法を学びます。受講者は、Unity CatalogとMCPを使用してガバナンスされたエージェントツールを作成し、OpenAI Agents SDKを使用してシングルエージェントおよびマルチエージェントシステムを構築し、スーパーバイザーエージェントによってオーケストレーションされるknowledge assistantのユースケースのためにAgent BricksとGenieを活用する方法を学びます。本コースは、ツールのプロトタイピングから本番環境へのデプロイまでの全過程を扱い、MLflowのトレーシングを使用してエージェントの実行を観察する実践的な経験を提供します。

Agent Evaluation on Databricks: 本コースでは、MLflowの評価フレームワークを使用してAIエージェントを体系的に評価する方法を学び、従来のソフトウェアテストでは対応できない非決定論的なAIシステム特有の課題に取り組みます。受講者は、正確性や安全性などの一般的な基準のための組み込みジャッジ(built-in judges)、ビジネス固有の要件のためのガイドラインジャッジ、専門的なニーズのためのカスタムジャッジなど、さまざまな評価アプローチを実装する方法を学びます。本コースでは、キュレーションされたデータセットを使用したオフライン評価と、オンラインの本番モニタリングの両方を扱い、MLflowのトレーシング機能を使用してエージェントの実行パターンを理解し、さまざまなタイプのステークホルダーから人間のフィードバックを収集する実践的な経験を提供します。実践的なデモとラボを通じて、受講者はAIエージェントの開発ライフサイクル全体にわたって継続的な品質改善を推進する評価ワークフローを作成するスキルを習得します。

Deploying and Monitoring Agent Applications on Databricks: 本コースでは、Databricks上で生成AIエージェントをデプロイおよびモニタリングするためのエンドツーエンドのライフサイクルを扱います。参加者は、Declarative Automation Bundles(DABs)を使用してエージェントをDatabricks Appsとしてデプロイし、Model Context Protocol(MCP)を介してツールを統合し、MLflow Tracingでエージェントを計装し、スコアラー、マルチターンジャッジ、オンライン評価を使用して本番品質を評価する方法を学びます。実践的なデモとラボを通じて、参加者はDatabricksプラットフォーム上で本番グレードのAIエージェントを構築、観察、モニタリングする実践的な経験を得ます。

Languages Available: English | 日本語 | Português BR | 한국어

Paid
16h
Lab
instructor-led
Associate

Questions?

If you have any questions, please refer to our Frequently Asked Questions page.