メインコンテンツへジャンプ

Databricks Labs

Databricks Labsは、顧客がユースケースをより迅速に本番運用させることを支援するために、フィールドチームが作成したプロジェクトです!

Node

dqx

DQX

ストリーミングおよび標準のDataFrame上のPySparkワークロードに対する、大規模なデータ品質チェックを簡素化します。

GitHub ソース →

ドキュメント

Kasal

sdp-meta

Lakeflow Spark Declarative Pipelines向けのメタデータ駆動型フレームワーク。JSONまたはYAMLのオンボーディングファイルでBronzeパイプラインとSilverパイプラインを定義します。単一の汎用パイプラインが実行時にその仕様を読み取って完全な処理グラフを構築するため、データエンジニアは1人で、新しいパイプラインコードを書くことなく何千ものテーブルを管理できます。バンドル、CLI、ブラウザベースのアプリ、AI支援セットアップ用のMCPサーバー経由で利用可能です。

Githubソース →

ドキュメント

著者インタビュー →

Lakebridge

ジオブリックス

GeoBrixは、Databricksのネイティブな空間機能(GEOMETRY/GEOGRAPHY型、ST_*関数、H3)を補完する、高性能な空間処理を提供します。高度なラスタ処理、ベクトルタイルとラスタタイルの生成、強化されたジオメトリツール、そしてQuadbinや英国ナショナルグリッドなどの追加の離散グローバルグリッドでレイクハウスを拡張します。その軽量ティアは、Databricks ServerlessとLakeflow pipelinesでスムーズに実行されます。また、特殊なリーダーとライターのスイートにより、一般的な地理空間ファイルタイプに特化した処理が追加されます。

Githubソース →

ドキュメント

ブログ →

その他のプロジェクト

Kasal

Kasalは、Databricksプラットフォーム上でAIエージェントを構築・デプロイするための、対話型でローコードな方法です。

GitHubソース →
ドキュメント →

Lakebridge

Lakebridgeは Databricks の移行プラットフォームであり、企業がレガシーデータウェアハウスと ETL システムをモダナイズするための包括的なエンドツーエンドソリューションを提供するように設計されています。Lakebridgeは、Teradata、Oracle、Snowflake、SQL Server、DataStageなど、幅広いソースプラットフォームをサポートし、検出と評価からコード変換、データ移動、検証まで、移行プロセスのあらゆる段階を自動化します。これにより、データエステートにおけるイノベーションと効率性の向上を目指す組織にとって、高速で低リスクの移行が保証されます。

GitHubソース →
ドキュメント →
ブログ →

Impulse

Impulse は、大規模な時系列測定データを処理するために設計された Python ベースの**アナリティクス**ライブラリです。Apache Spark と Delta Lake 上に構築されており、自動車のテスト、産業用 IoT、その他の測定集約型ドメインからのペタバイト規模のセンサーデータの分散処理を可能にします。

Github ソース →
ドキュメント →

OntoBricks

OntoBricksは、Databricksテーブルをマテリアライズドグラフビューアに変換するWebアプリケーションです。これにより、オントロジー (OWL) の設計、R2RML を介した Unity Catalog テーブルへのマッピング、トリプルの Delta ベースのトリプルストアおよび Lakebase Postgres グラフエンジンへのマテリアライズ、グラフ上での推論 (OWL 2 RL、SWRL、SHACL)、自動生成された GraphQL API を介したクエリーの実行が可能になります。メタデータのインポートからクエリ可能なグラフビューアまでのパイプライン全体を、LLM を活用した自動化を使用して 4 回のクリックで実行できます。

Githubソース →
ドキュメント →

コーダ

Claude Code、Codex、Gemini CLI、Hermes Agent、OpenCode をブラウザで実行 — セットアップは不要で、お使いの Databricks ワークスペースに接続済みです。

Github ソース →
ドキュメント →

VibeScaler

チームと協力して、優れたエージェントの動作を定義し、その判断を大規模に実行される自動評価機能に変換します。

GitHub ソース →
ドキュメント →

Lakemeter

確認、共有、エクスポートが可能な透明性の高い前提条件を使用して、Databricks ワークロードのコストを数分で見積もります。

Github ソース →
ドキュメント →

Ontos

Ontos は、データメッシュの原則と ODCS (Open Data Contract Standard) や ODPS (Open Data Product Specification) などの業界標準に従って、高品質のデータ製品を整理、管理、提供するためのツールをエンタープライズ チームに提供します。

GitHub ソース →
ドキュメント →
マーケットプレイス →

Databricks MCP

AIエージェントがDatabricksからエンタープライズデータを取得し、Databricks上での一般的な開発者アクションを自動化するのを支援するためのMCPサーバーのコレクションです。

GitHubソース →

会話型エージェント アプリ

Databricks Genie Conversation APIを搭載したチャットインターフェースを備え、Databricksアプリとして実行するために特別に構築されたアプリケーションです。

GitHubソース →

ナレッジアシスタント・チャットボットアプリケーション

サンプル Databricks ナレッジアシスタント チャットボット アプリケーション。

GitHub ソース →

機能レジストリアプリケーション

このアプリは、Unity Catalog の既存の機能を探索するための使いやすいインターフェースを提供します。さらに、ユーザーはコードを生成して、特徴量スペックとトレーニングセットを作成し、機械学習モデルをトレーニングし、特徴量を Feature Serving Endpoint としてデプロイできます。

Githubソース →

Smolder

Smolder は、HL7v2 メッセージ形式から EHR データを読み込むための Apache Spark™ SQL データソースを提供します。さらに、Smolder は、Spark SQL DataFrame で使用して HL7 メッセージテキストを解析し、メッセージからセグメント、フィールド、サブフィールドを抽出できるヘルパー関数を提供します。

GitHubソース →
詳細はこちら →

データジェネレーター

プロジェクトに関連するデータを素早く生成します。Databricksデータジェネレーターは、テスト、POC、その他の用途向けに、大規模なシミュレーション/合成データセットを生成するために使用できます。

Githubソース →
詳細はこちら →

デルタOMS

Lakehouse上のメタデータと運用メトリクス分析のための一元化されたDeltaトランザクションLogs収集。

Githubソース →
詳細はこちら →

Splunk統合

Splunk用アドオンは、Splunk EnterpriseおよびSplunk CloudのユーザーがDatabricksでノートブックやジョブの実行などのクエリーやアクションを実行できるようにするアプリです。

Github ソース →
詳細はこちら →

DiscoverX

DiscoverXは、多数のレイクハウスアセットの調査や操作の適用を必要とする管理タスクを自動化します。

Githubソース →

brickster

{brickster}はDatabricks向けのRツールキットで、以下が含まれます。

  • Databricks APIのラッパー(例:db_cluster_list, db_volume_read)
  • RStudio Connections Pane (open_workspace()) を経由したブラウザワークスペースのアセット
  • {reticulate} (docs) 経由で databricks-sql-connector を公開します
  • インタラクティブなDatabricks REPL

Github ソース →
ドキュメント →
ブログ →

Tempo

このプロジェクトの目的は、Apache Spark™上で時系列を操作するためのAPIを提供することです。ラグ付き時系列値による特徴量化、ローリング統計(平均、合計、カウントなど)、AS OF 結合、ダウンサンプリング、補間などの機能が含まれます。これは、TBスケールのヒストリカルデータでテストされています。

GitHub ソース →
ドキュメント →
ウェビナー →

PyLint プラグイン

このプラグインはPyLintを拡張し、特にDatabricks環境のPythonコードでよくある間違いや問題をチェックします。

GitHubソース →
ドキュメント →

PyTester

PyTester は、Python でテストのセットアップとティアダウンを管理するための強力な方法です。このライブラリは、Databricks の統合テストの作成に役立つ一連のフィクスチャを提供します。

Github ソース →
ドキュメント →

Delta Sharing Javaコネクタ

Javaコネクタは、Delta Sharingプロトコルに従って、Delta Sharingサーバーから共有テーブルを読み取ります。データプロバイダー側のエグレスコストをさらに削減し、制限するために、永続的なキャッシュを実装して不要な読み取りを排除しました。

GitHub ソース →
ドキュメント →

UCX

UCXは、DatabricksワークスペースでUnity Catalog(UC)を有効にするためのツールキットです。UCXは、テーブルとビューをUCに移行するためのコマンドとワークフローを提供します。UCXを使用すると、ダッシュボード、ジョブ、ノートブックを書き換えて、UCに移行されたデータ資産を使用できるようになります。その他にも多くの機能があります。

GitHub ソース →
ドキュメント →
ブログ →

migrate-ip-acls

単一の専用 CLI を介して、Databricks ワークスペースの既存の IP アクセスリストをコンテキストベースのイングレス (CBI) ポリシーとして再作成します。

GitHub ソース →

Firefly

複数の認証戦略と埋め込みDatabricksアプリを備え、Databricks用のカスタマイズされたフロントエンドを提供するNext.jsアプリケーションです。

Github ソース →
ドキュメント →

「https://github.com/databrickslabs」のすべてのプロジェクトは、お客様の調査目的でのみ提供されるアカウントであり、サービス レベル アグリーメント (SLA) に基づいて Databricks が正式にサポートするものではないことにご注意ください。これらは AS IS (現状のまま) で提供され、当社はいかなる種類の保証も行いません。  これらのプロジェクトを使用して見つかった問題は、リポジトリ の GitHub Issues として報告できます。時間のあるときにレビューされますが、GitHub サポートに対する正式な SLA はありません。