di Ryan Boyd
Leggi Rise of the Data Lakehouse per scoprire perché i lakehouse sono l'architettura dei dati del futuro con il padre del data warehouse, Bill Inmon.
Nota della redazione: questo è il primo di una serie di post in gran parte basato sul paper CIDR Lakehouse: A New Generation of Open Platforms that Unify data warehousing and Advanced analitiche, con il permesso degli autori.
Gli analisti di dati, i data scientist e gli esperti di intelligenza artificiale sono spesso frustrati dalla fondamentale mancanza di dati di alta qualità, affidabili e aggiornati disponibili per il loro lavoro. Alcune di queste frustrazioni sono dovute ai noti svantaggi dell'architettura dei dati a due livelli che oggi vediamo prevalere nella stragrande maggioranza delle aziende Fortune 500. L'architettura open lakehouse e la tecnologia sottostante possono migliorare notevolmente la produttività dei team di dati e quindi l'efficienza delle aziende che li impiegano.
In questa diffusa architettura, i dati provenienti da tutta l'organizzazione vengono estratti dai database operativi e caricati in un data lake grezzo, a volte definito data swamp a causa della scarsa cura nel garantire che questi dati siano utilizzabili e affidabili. Successivamente, un altro processo ETL (Extract Transform Load (ETL)) viene eseguito in base a una pianificazione per spostare importanti sottoinsiemi di dati in un data warehouse per la Business Intelligence e il processo decisionale.

Questa architettura pone gli analisti di dati di fronte a una scelta quasi impossibile: utilizzare dati tempestivi e inaffidabili dal data lake o dati obsoleti e di alta qualità dal data warehouse. A causa dei formati chiusi delle popolari soluzioni di data warehousing, è anche molto difficile utilizzare i principali framework di analisi dei dati open-source su sorgenti di dati di alta qualità senza introdurre un'altra attività operativa ETL e aumentare l'obsolescenza dei dati.
Queste architetture di dati a due livelli, oggi comuni nelle aziende, sono estremamente complesse sia per gli utenti che per i Data Engineer che le creano, indipendentemente dal fatto che siano ospitate on-premise o in cloud.
L'architettura Lakehouse riduce la complessità, i costi e l'overhead operativo fornendo molti dei vantaggi di affidabilità e prestazioni del livello del data warehouse direttamente sopra il data lake, eliminando in definitiva il livello del warehouse.

La consistenza dei dati è una sfida incredibile quando si hanno più copie di dati da mantenere sincronizzate. Esistono molteplici processi ETL, che spostano i dati dai database operazionali al data lake e poi di nuovo dal data lake al data warehouse. Ogni processo aggiuntivo introduce ulteriore complessità, ritardi e modalità di errore.
Eliminando il secondo livello, l'architettura data lakehouse rimuove uno dei processi ETL e aggiunge il supporto per l'applicazione di uno schema e l'evoluzione direttamente sul data lake. Supporta anche funzionalità come il time travel per consentire la convalida storica della pulizia dei dati.
Poiché il data warehouse viene popolato dal data lake, i dati sono spesso obsoleti. Secondo un recente sondaggio di Fivetran, questo costringe l'86% degli analisti a utilizzare dati non aggiornati.
