Un format de fichier de stockage en colonnes open source offrant des performances exceptionnelles en matière de compression et de requêtes pour les charges de travail d'analyse de données massives.
Apache Parquet est un format de fichier de données open source en colonnes, conçu pour stocker et récupérer des données avec une grande efficacité. Il fournit d'excellents schémas de compression et d'encodage des données. Ses performances supérieures lui permettent de traiter des données complexes en vrac. Apache Parquet a pour but d'être un format d'échange commun pour les charges de travail tant interactives que par batch. Il s'apparente à d'autres formats de fichiers de stockage en colonnes disponibles dans Hadoop, comme RCFile et ORC.
Apache Parquet est implémenté à l'aide de l'algorithme de découpage et d'assemblage (« record-shredding and assembly »), compatible avec les structures de données complexes qui peuvent être utilisées pour stocker les données. Optimisé pour les données complexes en vrac, Parquet propose différentes méthodes efficaces de compression des données et plusieurs types d'encodage. Cette approche est particulièrement adaptée aux requêtes qui doivent lire certaines colonnes dans une grande table. Parquet peut se contenter de lire uniquement les colonnes nécessaires, ce qui réduit considérablement les E/S.