Un conjunto completo de herramientas de código abierto que incluye HDFS, MapReduce, YARN, Hive y Spark que trabajan juntas para almacenar, procesar y analizar conjuntos de datos masivos.
El ecosistema de Apache Hadoop hace referencia a los diversos componentes de la biblioteca de software Apache Hadoop; incluye proyectos de código abierto, así como una gama completa de herramientas complementarias. Algunas de las herramientas más conocidas del ecosistema de Hadoop son HDFS, Hive, Pig, YARN, MapReduce, Spark, HBase, Oozie, Sqoop, Zookeeper, etc. Estos son los principales componentes del ecosistema de Hadoop que usan con frecuencia los desarrolladores:
Hadoop Distributed File System (HDFS) es uno de los proyectos más grandes de Apache y el sistema de almacenamiento principal de Hadoop. Usa una arquitectura de NameNode y DataNode. Es un sistema de archivos distribuido capaz de almacenar archivos grandes que se ejecuta en un clúster de hardware común.
Hive es una herramienta de ETL y almacenamiento de datos que se usa para consultar o analizar grandes conjuntos de datos almacenados dentro del ecosistema de Hadoop. Hive tiene tres funciones principales: resumen de datos, consulta y análisis de datos no estructurados y semiestructurados en Hadoop. Cuenta con una interfaz similar a SQL, un lenguaje HQL que funciona de forma similar a SQL y traduce automáticamente las consultas en tareas de MapReduce.
Se trata de un lenguaje de scripting de alto nivel que se usa para ejecutar consultas en conjuntos de datos más grandes que se usan en Hadoop. El sencillo lenguaje de scripting de Pig, similar a SQL, se conoce como Pig Latin y su principal objetivo es realizar las operaciones necesarias y organizar el resultado final en el formato deseado.