L'optimisation systématique des configurations, de l'utilisation de la mémoire et des stratégies d'exécution d'Apache Spark afin de maximiser les performances tout en évitant les goulots d'étranglement des ressources.
Archived. This article has not been updated since the publish date above. The dynamic nature of information means that previously accurate content can become outdated or even obsolete over time. Readers are advised to exercise due diligence and cross-check any information found in this blog post before making decisions or adopting any practices based on said information.
L'ajustement des performances Spark consiste à modifier les paramètres de mémoire, de cœurs et d'instances utilisés par le système. Ce processus permet à Spark d'offrir des performances irréprochables et prévient la formation de goulets d'étranglement dans les ressources de Spark. 
Pour réduire la consommation de mémoire, vous aurez peut-être à stocker les RDD Spark sous forme sérialisée. La sérialisation des données est également gage de bonnes performances réseau. Pour obtenir de bons résultats dans Spark :
Spark prend en charge deux bibliothèques de sérialisation :
Trois aspects dominent l'ajustement de la consommation de la mémoire :