メインコンテンツへジャンプ

Apache Spark™

Apache Spark とは、ビッグデータと機械学習のための極めて高速な分散処理フレームワークです。これはもともと、2009 年にカリフォルニア大学バークレー校で開発されました。

Apache Sparkを中心に、PostgreSQL・MySQL・Elastic・Kafka・Redis・MongoDB・Cassandra・Apache HBase・Hadoop HDFSなど多数のデータストアやシステムとの双方向の接続が放射状に示されているシーン

データ処理で最大のオープンソースプロジェクト

ビッグデータ分析に最適なオープンソースの分散処理システムであるApache Sparkはそのリリース以来、さまざまな業種の企業に採用され、急速な拡大を遂げています。Netflix、Yahoo、eBay などのインターネット大手も、Spark を大規模にデプロイし、8000 を超えるノードのクラスターで、複数のペタバイトデータをまとめて処理しています。Apache Spark は現在、250 を超える組織から 1000 名以上が参加する、ビッグデータの最大のオープンソースコミュニティへと急速に成長しています。
 

what is apache spark

Databricks は、カリフォルニア大学バークレー校で Spark の研究プロジェクトを開始したチームによって 2013 年に設立されました。

Apache Spark とのネイティブ統合が最も優れているデータベースとして、Databricks のレイクハウスプラットフォームが挙げられます。Delta Lake をはじめとするオープンフォーマットと組み合わせることで、Spark のパフォーマンスを最大限に引き出すことができます。

Apache Spark は 100% オープンソースで、ベンダーに依存しない Apache Software Foundation によってホストされています。

Apache Sparkとは? - Apache Sparkの利点

速度

はじめから性能のために設計されたSparkは、インメモリコンピューティングやその他の最適化を活用し、大規模データの処理をHadoopより最大100倍迅速にできます。また、データがディスク上に保存されている場合でも迅速で、大規模のディスク基板整列部門で世界記録を保有しています。

簡単な使用

Sparkには、大規模データセットを扱うための使いやすいAPIがあります。 これには、データ変換のための100以上のオペレーター群と、半構造化データを操作するための一般的なデータフレームAPIが含まれます。

統合エンジン

Sparkには、SQL クエリ、ストリーミングデータ、機械学習、グラフ処理をサポートする高レベルのライブラリが標準で含まれています。 これらの標準ライブラリは開発者の生産性を高め、複雑なワークフローを構築するためにシームレスに組み合わせることができます。

Databricks クラウドで Apache Spark を無料でお試しください。

Databricks の統合分析プラットフォームは、分散処理システムの Spark、対話型ノート、統合されたワークフロー、およびエンタープライズセキュリティについて、5 倍のパフォーマンスを提供します。これらは全て、フルマネージド型のクラウドプラットフォームで実行されます。

オープンソースの Apache Spark プロジェクトはこちらからダウンロード可能です。