Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Databricks-referensarkitekturer ger arkitekturvägledning som omfattar datakällor, inmatning, transformering, frågekörning och bearbetning, servering, analys och lagring.
Varje referensarkitektur har en nedladdningsbar PDF i formatet 11 x 17 (A3).
Även om Databricks är en öppen plattform som integreras med ett stort ekosystem av partnerverktyg, fokuserar referensarkitekturerna bara på Azure tjänster och Databricks-plattformen. De molnleverantörstjänster som visas är valda för att illustrera begreppen och är inte uttömmande.
Ladda ned: Referensarkitektur för Azure Databricks-plattformen
Azure-referensarkitekturen visar följande Azure-specifika tjänster för inmatning, lagring, servering och analys:
- Azure Synapse och SQL Server som källsystem för Lakehouse Federation
- Azure IoT Hub och Azure Event Hubs för strömmande inmatning
- Azure Data Factory för batch-inmatning
- Azure Data Lake Storage Gen 2 (ADLS) som objektlagring för data och AI-tillgångar
- Azure SQL DB och Azure Cosmos DB som driftdatabaser
- Azure Purview som företagskatalog till vilken UC exporterar schema- och ursprungsinformation
- Power BI som BI-verktyg
- Azure OpenAI kan användas av Model Serving som en extern LLM
Organisation av referensarkitekturerna
Referensarkitekturen är strukturerad längs flödesbanorna Källa, Intag, Transformera, Fråga/Bearbeta, Tjäna, Analysoch Lagring:
Source
Det finns tre sätt att integrera extern data i Data + AI-plattformen:
- ETL: Plattformen möjliggör integrering med system som tillhandahåller halvstrukturerade och ostrukturerade data (till exempel sensorer, IoT-enheter, media, filer och loggar) samt strukturerade data från relationsdatabaser eller affärsprogram.
- Lakehouse Federation: SQL-källor, till exempel relationsdatabaser, kan integreras i Databricks och Unity Catalog utan ETL. I det här fallet styrs källsystemdata av Unity Catalog och frågor skickas ned till källsystemet.
- Katalogfederation: Hive Metastore-kataloger kan också integreras i Unity Catalog via katalogfederation, vilket gör att Unity Catalog kan styra tabellerna som lagras i Hive-metaarkivet.
Ingest
Importera data till Databricks i batch eller som strömmande data:
- Databricks Lakeflow Connect erbjuder inbyggda anslutningar för inmatning från företagsprogram och databaser. Den resulterande inmatningspipelinen styrs av Unity Catalog och drivs av serverlös beräkning och pipelines.
- Filer som levereras till molnlagring kan läsas in direkt med Databricks Auto Loader.
- För batchinläsning av data från företagsapplikationer till Delta Lake förlitar sig Databricks-plattformen på partnerverktyg för inläsning med specifika adaptrar för dessa källsystem.
- Direktuppspelningshändelser kan matas in direkt från händelseströmningssystem som Kafka med Databricks Structured Streaming. Strömmande källor kan vara sensorer, IoT- eller ändringsprocesser för datainsamling .
Storage
- Data lagras vanligtvis i molnlagringssystemet där ETL-pipelines använder medallion-arkitekturen för att lagra data på ett kuraterat sätt som Delta-filer/-tabeller eller Apache Iceberg-tabeller.
Transformera och Fråga/bearbeta
Databricks-plattformen använder sina motorer Apache Spark och Photon för alla omvandlingar och frågor.
Pipelines är ett deklarativt ramverk för att förenkla och optimera tillförlitliga, underhållsbara och testbara databearbetningspipelines.
Drivs av Apache Spark och Photon stödjer Databricks Data + AI-plattformen båda typerna av arbetsbelastningar: SQL-frågor via SQL-lager samt SQL-, Python- och Scala-arbetsbelastningar via arbetsytkluster.
För datavetenskap (ML-modellering och AI) tillhandahåller Databricks AI och strojové učenie-plattformen specialiserade ML-körningar för AutoML och för kodning av ML-jobb. Alla arbetsflöden för datavetenskap och MLOps stöds bäst av MLflow.
Serving
För datalagerhantering (DWH) och BI-användningsfall tillhandahåller Databricks-plattformen Databricks SQL, informationslagret som drivs av SQL-lager och serverlösa SQL-lager.
För maskininlärning är Model Serving en skalbar funktion för modellservering i realtid av företagsklass som finns i Databricks kontrollplan. Unity AI Gateway är Databricks lösning för att styra och övervaka åtkomst till AI-modeller som stöds och deras associerade modell som betjänar slutpunkter.
Driftdatabaser:
- Lakebase är en online-databas för transaktionshantering (OLTP) baserad på Postgres och fullt integrerad med Databricks Data + AI-plattformen. Det gör att du kan skapa OLTP-databaser på Databricks och integrera OLTP-arbetsbelastningar med Databricks.
- Externa system, till exempel driftdatabaser, kan användas för att lagra och leverera slutdataprodukter till användarprogram.
Collaboration:
Affärspartner får säker åtkomst till de data de behöver via OpenSharing.
Databricks Marketplace är baserat på OpenSharing och är ett öppet forum för utbyte av dataprodukter.
Clean Rooms är säkra och sekretessskyddande miljöer där flera användare kan arbeta tillsammans med känsliga företagsdata utan direkt åtkomst till varandras data.
Analysis
De sista affärsprogrammen finns i denna simbana. Exempel är anpassade klienter, till exempel AI-program som är anslutna till modellservern för slutsatsdragning i realtid eller program som har åtkomst till data som skickas från Databricks till en driftdatabas.
För BI-användningsfall använder analytiker vanligtvis BI-verktyg för att komma åt informationslagret. SQL-utvecklare kan dessutom använda Databricks SQL-redigeraren (visas inte i diagrammet) för frågor och instrumentpaneler.
Data + AI-plattformen erbjuder också instrumentpaneler för att bygga datavisualiseringar och dela insikter.
Integrate
- Databricks-plattformen integreras med standardidentitetsprovidrar för användarhantering och enkel inloggning (SSO).
Externa AI-tjänster som OpenAI, LangGraph eller HuggingFace kan användas direkt från Databricks Intelligence Platform.
Externa orkestrerare kan använda den omfattande REST-API:n eller alternativt dedikerade anslutningar till externa orkestreringsverktyg som Apache Airflow.
Unity Catalog används för alla data & AI-styrning i Databricks Intelligence Platform och kan integrera andra databaser i dess styrning via Lakehouse Federation.
Dessutom kan Unity Catalog integreras i andra företagskataloger, t.ex. Purview. Kontakta leverantören av företagskatalogen för mer information.
Vanliga funktioner för alla arbetsbelastningar
Dessutom levereras Databricks-plattformen med hanteringsfunktioner som stöder alla arbetsbelastningar:
Data- och AI-styrning
Det centrala data- och AI-styrningssystemet i Databricks Data + AI-plattformen är Unity Catalog. Unity Catalog tillhandahåller en enda plats för att hantera principer för dataåtkomst som gäller för alla arbetsytor och stöder alla tillgångar som skapats eller används i Databricks, till exempel tabeller, volymer, funktioner (funktionsarkiv) och modeller (modellregister). Unity Catalog kan också användas för att samla in datalinje mellan frågor som körs på Databricks.
Med Databricks Data Quality Monitoring kan du övervaka datakvaliteten för alla tabeller i ditt konto. Den identifierar avvikelser i alla tabeller och tillhandahåller en fullständig dataprofil för varje tabell.
För observerbarhet är systemtabeller ett Databricks-värdbaserat analyslager för ditt kontos driftdata. Systemtabeller kan användas för historisk observerbarhet i hela ditt konto.
Dataintelligensplattform
Databricks Data + AI-plattformen gör det möjligt för hela din organisation att använda data och AI, och kombinerar AI med enhetsfördelarna från Databricks för att förstå den unika semantiken i din data. Se Databricks AI-hjälpmedelsfunktioner.
Genie Code är tillgängligt i Databricks Notebooks, SQL-redigeraren, filredigeraren och på andra platser som en kontextmedveten AI-assistent för användare.
Automation och orkestrering
Lakeflow Jobs samordnar databehandling, maskininlärning och analyspipelines på Databricks Data + AI-plattformen. Med Lakeflow-pipelines kan du skapa tillförlitliga och underhållsbara ETL-pipelines med deklarativ syntax. Plattformen stöder även CI/CD- och MLOps
Högnivåanvändningsfall för Data + AI-plattformen på Azure
Inbyggd inmatning från SaaS-appar och databaser med Lakeflow Connect
Ladda ned: Lakeflow Connect-referensarkitektur för Azure Databricks.
Databricks Lakeflow Connect erbjuder inbyggda kontakter för inmatning från företagsprogram och databaser. Den resulterande inmatningspipelinen styrs av Unity Catalog och drivs av serverlösa beräknings- och Lakeflow-pipelines.
Lakeflow Connect utnyttjar effektiva inkrementella läsningar och skrivningar för att göra datainmatningen snabbare, skalbar och mer kostnadseffektiv, medan dina data förblir färska för nedströmsförbrukning.
Batchinmatning och ETL
Ladda ned: Batch ETL-referensarkitektur för Azure Databricks
Inläsningsverktyg använder källspecifika adaptrar för att läsa data från källan och sedan antingen lagra den i molnlagring, därifrån Auto Loader kan läsa den, eller anropa Databricks direkt (till exempel med partnerverktyg för inläsning som är integrerade i Databricks-plattformen). För att läsa in data kör Databricks ETL och bearbetningsmotorn frågorna via Pipelines. Dirigera enkla jobb eller flera jobb med Lakeflow-jobb och styr dem med hjälp av Unity Catalog (åtkomstkontroll, granskning, ursprung och så vidare). Om du vill ge åtkomst till specifika gyllene tabeller för driftsystem med låg svarstid exporterar du tabellerna till en driftdatabas, till exempel ett RDBMS- eller nyckelvärdeslager i slutet av ETL-pipelinen.
Streaming och ändringsdatahantering (CDC)
Ladda ned: Spark-strukturerad strömningsarkitektur för Azure Databricks
Databricks ETL-motorn använder Spark Structured Streaming för att läsa från händelseköer som Apache Kafka eller Azure Event Hub. De underordnade stegen följer metoden för Batch-användningsfallet ovan.
CDC (Real-Time Change Data Capture ) lagrar vanligtvis de extraherade händelserna i en händelsekö. Därifrån följer användningsfallet användningsfallet för direktuppspelning.
Om CDC görs i batch, med de extraherade posterna lagrade i molnlagring först, kan Databricks Auto Loader läsa dem och användningsfallet följer Batch ETL.
Maskininlärning och AI (traditionell)
Ladda ned: Referensarkitektur för maskininlärning och AI för Azure Databricks
För maskininlärning erbjuder Databricks Data + AI Platform toppmoderna maskin- och djupinlärningsbibliotek. Den innehåller funktioner som Funktionslager och Modellregister (både integrerade i Unity Catalog), funktioner med låg kod med AutoML och MLflow-integrering i datavetenskapens livscykel.
Unity Catalog styr alla datavetenskapsrelaterade tillgångar (tabeller, funktioner och modeller) och dataexperter kan använda Lakeflow-jobb för att orkestrera sina jobb.
För att distribuera modeller på ett skalbart och företagsbaserat sätt använder du MLOps-funktionerna för att publicera modellerna i modellservern.
Agentapplikationer
Ladda ned: referensarkitektur för AI-applikationer för Azure Databricks
För att distribuera modeller på ett skalbart och företagsbaserat sätt använder du MLOps-funktionerna för att publicera modellerna i modellservern.
BI- och SQL-analys
Ladda ned: REFERENSarkitektur för BI- och SQL-analys för Azure Databricks
För BI-användningsfall kan affärsanalytiker använda instrumentpaneler, Databricks SQL-redigeraren eller BI-verktyg som Tableau eller Power BI. I samtliga fall är motorn Databricks SQL (serverlös eller icke-serverlös) och Unity Catalog tillhandahåller dataidentifiering, utforskning och åtkomstkontroll.
Affärsappar
Ladda ned: Business Apps for Databricks för Azure Databricks
Med Databricks Apps kan utvecklare skapa och distribuera säkra data- och AI-program direkt på Databricks-plattformen, vilket eliminerar behovet av separat infrastruktur. Appar finns på den serverlösa Databricks-plattformen och integreras med viktiga plattformstjänster. Använd Lakebase om appen behöver OLTP-data som har synkroniserats från Databricks.
Lakehouse-federation
Ladda ner: Referensarkitektur för Lakehouse-federationens Azure Databricks
Lakehouse Federation tillåter att externa DATA SQL-databaser (till exempel MySQL, Postgres, SQL Server eller Azure Synapse) integreras med Databricks.
Alla arbetsbelastningar (AI, DWH och BI) kan ha fördelar av detta utan att först behöva transformera och ladda data till objektlagring. Den externa källkatalogen mappas till Unity-katalogen och detaljerad åtkomstkontroll kan tillämpas på åtkomst via Databricks-plattformen.
Katalogfederation
Ladda ned: Referensarkitektur för katalogfederation för Azure Databricks
Med katalogfederation kan externa Hive-metaarkiv (till exempel MySQL, Postgres, SQL Server eller Azure Synapse) integreras med Databricks.
Alla arbetsbelastningar (AI, DWH och BI) kan ha fördelar av detta utan att först behöva transformera och ladda data till objektlagring. Den externa källkatalogen läggs till i Unity Catalog där detaljerad åtkomstkontroll tillämpas via Databricks-plattformen.
Dela data med verktyg från tredje part
Ladda ned: Dela data med referensarkitektur för verktyg från tredje part för Azure Databricks
Datadelning i företagsklass med tredje part tillhandahålls av OpenSharing. Det ger direkt åtkomst till data i objektlagret som skyddas av Unity Catalog. Den här funktionen används också på Databricks Marketplace, ett öppet forum för utbyte av dataprodukter.
Använda delade data från Databricks
Ladda ned: Använda delade data från Databricks-referensarkitekturen för Azure Databricks
OpenSharing Databricks-to-Databricks-protokollet gör det möjligt för användare att dela data på ett säkert sätt med alla Databricks-användare, oavsett konto eller molnvärd, så länge användaren har åtkomst till en arbetsyta som är aktiverad för Unity Catalog.