Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Un framework moderno per i dati e la piattaforma di intelligenza artificiale
Per discutere l'ambito della Databricks Data + AI Platform, è utile definire innanzitutto un quadro di base per la moderna piattaforma dati e IA:
Panoramica della piattaforma Databricks
La Databricks Data + AI Platform copre l'intero framework moderno della piattaforma dati. Si basa sull’architettura lakehouse e basata su un motore di data intelligence che comprende le qualità uniche dei dati. Si tratta di una base aperta e unificata per carichi di lavoro ETL, ML/AI e DWH/BI e ha Unity Catalog come soluzione di governance centralizzata per i dati e l'intelligenza artificiale.
Profili del framework della piattaforma
Il framework illustra i membri primari del team di dati (persona) che lavorano con le applicazioni nel framework:
- I data engineer forniscono a data scientist e business analyst dati accurati e riproducibili per informazioni tempestive sul processo decisionale e in tempo reale. Implementano processi ETL altamente coerenti e affidabili per aumentare la fiducia e la fiducia degli utenti nei dati. Assicurano che i dati siano ben integrati con i vari pilastri dell’azienda e in genere seguano le procedure consigliate per la progettazione del software.
- I data scientist combinano competenze analitiche e comprensione aziendale per trasformare i dati in dati analitici strategici e modelli predittivi. Si tratta di una soluzione efficace per tradurre le sfide aziendali in soluzioni basate sui dati, sia che attraverso informazioni analitiche retrospettive o modellazione predittiva di tipo forward-looking. Sfruttando la modellazione dei dati e le tecniche di Machine Learning, progettano, sviluppano e distribuiscono modelli che svelano modelli, tendenze e previsioni dai dati. Agiscono come ponte, convertendo narrazioni di dati complesse in storie comprensibili, assicurando che gli stakeholder aziendali non solo comprendano, ma possano anche agire sulle raccomandazioni basate sui dati, a sua volta guidando un approccio incentrato sui dati alla risoluzione dei problemi all'interno di un'’organizzazione.
- I tecnici ml (ingegneri di Machine Learning) guidano l’applicazione pratica di data science in prodotti e soluzioni creando, distribuendo e mantenendo modelli di Machine Learning. Il loro obiettivo principale è quello di orientarsi verso l’aspetto tecnico dello sviluppo e della distribuzione dei modelli. I tecnici ML garantiscono solidità, affidabilità e scalabilità dei sistemi di Machine Learning in ambienti live, risolvendo le sfide correlate alla qualità dei dati, all’infrastruttura e alle prestazioni. Integrando i modelli di intelligenza artificiale e Machine Learning nei processi aziendali operativi e nei prodotti rivolti agli utenti, facilitano l'uso della data science nella risoluzione delle sfide aziendali, garantendo che i modelli non rimangano solo nella ricerca, ma favorisce un valore aziendale tangibile.
- analisti aziendali e gli utenti aziendali: gli analisti aziendali forniscono agli stakeholder e ai team aziendali dati utilizzabili. Spesso interpretano i dati e creano report o altre documentazioni per la gestione usando gli strumenti di business intelligence standard. In genere sono il primo punto di contatto per gli utenti aziendali non tecnici e i colleghi operativi per domande di analisi rapida. I dashboard e le app aziendali distribuite nella piattaforma Databricks possono essere usati direttamente dagli utenti aziendali.
- Gli sviluppatori di app creano applicazioni di intelligenza artificiale e dati sicure nella piattaforma dati e condividono tali app con gli utenti aziendali.
- I partner commerciali sono stakeholder importanti in un mondo aziendale sempre più in rete. Sono definiti come società o individui con cui un’azienda ha una relazione formale per raggiungere un obiettivo comune e può includere venditori, fornitori, distributori e altri partner di terze parti. La condivisione dei dati è un aspetto importante delle partnership commerciali, in quanto consente il trasferimento e lo scambio di dati per migliorare la collaborazione e il processo decisionale basato sui dati.
Domini del framework della piattaforma
La piattaforma è costituita da più domini:
- Archiviazione: Nel cloud, i dati vengono archiviati principalmente in archiviazione a oggetti scalabile, efficiente e resiliente presso i provider di servizi cloud.
- Governance: funzionalità relative alla governance dei dati, ad esempio il controllo di accesso, il controllo, la gestione dei metadati, il rilevamento della derivazione e il monitoraggio per tutti i dati e gli asset di intelligenza artificiale.
- Motore di intelligenza artificiale: Il motore di intelligenza artificiale offre funzionalità di intelligenza artificiale per l'intera piattaforma.
- Inserimento e trasformazione: Funzionalità per i carichi di lavoro ETL.
- Analisi avanzata, Machine Learning e intelligenza artificiale: Tutte le funzionalità relative all'apprendimento automatico, all'intelligenza artificiale e all'analisi di streaming.
- Data warehouse: dominio che supporta i casi d’uso di DWH e BI.
- Database operativo: Funzionalità e servizi relativi a database operativi come database OLTP (elaborazione delle transazioni online), archivi chiave-valore e così via.
- Automazione: gestione del flusso di lavoro per l'elaborazione dei dati, l'apprendimento automatico, le pipeline di analisi, tra cui il supporto CI/CD e MLOps.
- Strumenti ETL e data science: Gli strumenti front-end usati principalmente dai data engineer, dai data scientist e dai tecnici ml per il lavoro.
- Strumenti di business intelligence: gli strumenti front-end usati principalmente dagli analisti bi per il lavoro.
- App per dati e intelligenza artificiale Strumenti che creano e ospitano applicazioni che usano i dati gestiti dalla piattaforma sottostante e sfruttano le funzionalità di analisi e intelligenza artificiale in modo sicuro e conforme alla governance.
- Collaborazione: funzionalità per la condivisione dei dati tra due o più parti.
Scopo della piattaforma Databricks
La Databricks Data + AI Platform e i suoi componenti possono essere mappati al framework nel modo seguente:
Scarica: Ambito di Databricks - Componenti di Databricks
Carichi di lavoro di dati in Azure Databricks
Soprattutto, la Databricks Data + AI Platform copre tutti i carichi di lavoro rilevanti per il dominio dati in un'unica piattaforma, con Apache Spark/Photon come motore:
Inserimento e trasformazione
Databricks offre diversi modi di inserimento dati:
- Databricks Lakeflow Connect offre connettori predefiniti per l'inserimento da applicazioni e database aziendali. La pipeline di inserimento risultante è governata da Unity Catalog ed è basata su pipeline di calcolo serverless e Lakeflow.
- Caricatore automatico elabora in modo incrementale ed automaticamente i file che arrivano nello storage cloud in lavori pianificati o continui, senza dover gestire le informazioni di stato. Una volta inseriti, i dati non elaborati devono essere trasformati in modo che siano pronti per BI e ML/I. Databricks offre potenti funzionalità ETL per data engineer, data scientist e analisti.
Le pipeline di Lakeflow consentono di scrivere processi ETL in modo dichiarativo, semplificando l'intero processo di implementazione. La qualità dei dati può essere migliorata definendo le aspettative dei dati.
Analisi avanzata, Machine Learning e intelligenza artificiale
La piattaforma include un set di strumenti di Machine Learning e intelligenza artificiale completamente integrati per machine learning e deep learning tradizionali, nonché modelli di intelligenza artificiale e di linguaggio di grandi dimensioni. Illustra l'intero flusso di lavoro, dalla preparazione dei dati alla creazione di modelli di Machine Learning e Deep Learning , alla gestione dei modelli.
Spark Structured Streaming e le pipeline Lakeflow consentono analisi in tempo reale.
Data warehouse
La piattaforma Databricks Data + AI dispone anche di una soluzione completa di data warehouse con Databricks SQL, governata centralmente da Unity Catalog con un controllo di accesso fine.
funzioni di intelligenza artificiale sono funzioni SQL predefinite che consentono di applicare l'intelligenza artificiale ai dati direttamente da SQL. L'integrazione dell'IA nei processi di analisi fornisce l'accesso alle informazioni precedentemente inaccessibili agli analisti e consente loro di prendere decisioni più informate, gestire i rischi e sostenere un vantaggio competitivo grazie all'innovazione e all'efficienza basata sui dati.
Database operativo
Lakebase è un database di elaborazione delle transazioni online (OLTP) basato su Postgres e completamente integrato con la Databricks Data + AI Platform. Consente di creare un database OLTP in Databricks e di integrare carichi di lavoro OLTP con Lakehouse. Lakebase consente di sincronizzare i dati tra carichi di lavoro OLTP e OLAP (Online Analytical Processing) ed è ben integrato con gestione delle funzionalità, SQL Warehouse e App Databricks.
Struttura delle aree delle funzionalità di Azure Databricks
Questa è una mappatura delle caratteristiche Data + AI Platform di Databricks agli altri livelli del framework, dal basso verso l'alto:
Archiviazione nel cloud
Tutti i dati per il lakehouse vengono archiviati nell'archivio oggetti del provider di servizi cloud. Databricks supporta tre provider di servizi cloud: AWS, Azure e GCP. I file in vari formati strutturati e semistrutturati (ad esempio Parquet, CSV, JSON e Avro), nonché i formati non strutturati (ad esempio immagini e documenti), vengono inseriti e trasformati usando processi batch o di streaming.
Delta Lake è il formato di dati consigliato per il lakehouse (transazioni di file, affidabilità, coerenza, aggiornamenti e così via). È anche possibile leggere le tabelle Delta usando i client Apache Iceberg.
Non vengono utilizzati formati dati proprietari nella Databricks Data + AI Platform: Delta Lake ed Iceberg sono open source per evitare il lock-in del fornitore.
Gestione dei dati e dell'intelligenza artificiale
Oltre al livello di archiviazione, Catalogo Unity offre un'ampia gamma di funzionalità di governance dei dati e dell'intelligenza artificiale, tra cui gestione dei metadati nel metastore, controllo dell'accesso, verifica, individuazione dei datie lineage dei dati.
Il monitoraggio della qualità dei dati fornisce metriche di qualità predefinite per gli asset di dati e intelligenza artificiale e dashboard generati automaticamente per visualizzare queste metriche.
Le origini dati SQL esterne possono essere integrate nel lakehouse e in Unity Catalog tramite Lakehouse Federation.
Motore di intelligenza artificiale
La piattaforma Data + AI è costruita sull'architettura lakehouse e migliorata dalle funzionalità basate sull'IA di Databrick. L'intelligenza artificiale di Databricks combina l'intelligenza artificiale con i vantaggi di unificazione dell'architettura lakehouse per comprendere la semantica univoca dei dati. La ricerca intelligente e il codice Genie sono esempi di servizi basati sull'intelligenza artificiale che semplificano l'uso della piattaforma per ogni utente.
Orchestrazione
I processi Lakeflow consentono di eseguire carichi di lavoro diversi per il ciclo di vita completo dei dati e dell'intelligenza artificiale in qualsiasi cloud. Consentono di orchestrare processi e pipeline Lakeflow per SQL, Spark, notebook, DBT, modelli di machine learning e altro ancora.
La piattaforma supporta anche CI/CD e MLOps
Strumenti ETL & DS
A livello di consumo, i data engineer e i tecnici ml lavorano in genere con la piattaforma usando gli IDE. I data scientist preferiscono spesso notebook e usano i runtime ML e IA e il sistema del flusso di lavoro di Machine Learning MLflow per tenere traccia degli esperimenti e gestire il ciclo di vita del modello.
Strumenti di Business Intelligence
Gli analisti aziendali usano in genere lo strumento di business intelligence preferito per accedere al data warehouse di Databricks. È possibile eseguire query su Databricks SQL tramite diversi strumenti di analisi e BI, consultare BI e visualizzazione
Inoltre, la piattaforma offre strumenti di query e analisi pronti all'uso.
- dashboard di intelligenza artificiale/BI per trascinare le visualizzazioni dei dati e condividere informazioni dettagliate.
- Esperti di dominio, ad esempio analisti di dati, configurano agenti Genie con set di dati, query di esempio e linee guida di testo per aiutare Genie a tradurre le domande aziendali in query analitiche. Dopo la configurazione, gli utenti aziendali possono porre domande e generare visualizzazioni per comprendere i dati operativi.
- Editor SQL per gli analisti per l’analisi dei dati.
App per dati e intelligenza artificiale
Databricks Apps consente agli sviluppatori di creare applicazioni di dati e intelligenza artificiale sicure nella piattaforma Databricks e di condividerle con gli utenti.
Collaborazione
OpenSharing è un protocollo aperto sviluppato da Databricks per la condivisione sicura dei dati con altre organizzazioni indipendentemente dalle piattaforme di elaborazione usate.
Databricks Marketplace è un forum aperto per lo scambio di prodotti dati. Sfrutta OpenSharing per offrire ai provider di dati gli strumenti per condividere i prodotti dati in modo sicuro e i consumer di dati possono esplorare ed espandere l'accesso ai dati e ai servizi dati di cui hanno bisogno.
Clean Rooms usa OpenSharing e il calcolo serverless per fornire un ambiente sicuro e protetto dalla privacy in cui più parti possono collaborare sui dati aziendali sensibili senza accedere direttamente ai dati dell'altro.