Databricks-referensarkitekturer (ladda ned)

Databricks-referensarkitekturer ger arkitekturvägledning som omfattar datakällor, inmatning, transformering, frågekörning och bearbetning, servering, analys och lagring.

Varje referensarkitektur har en nedladdningsbar PDF i formatet 11 x 17 (A3).

Även om Databricks är en öppen plattform som integreras med ett stort ekosystem av partnerverktyg, fokuserar referensarkitekturerna bara på Azure tjänster och Databricks-plattformen. De molnleverantörstjänster som visas är valda för att illustrera begreppen och är inte uttömmande.

Referensarkitektur för Azure Databricks-plattformen.

Ladda ned: Referensarkitektur för Azure Databricks-plattformen

Azure-referensarkitekturen visar följande Azure-specifika tjänster för inmatning, lagring, servering och analys:

  • Azure Synapse och SQL Server som källsystem för Lakehouse Federation
  • Azure IoT Hub och Azure Event Hubs för strömmande inmatning
  • Azure Data Factory för batch-inmatning
  • Azure Data Lake Storage Gen 2 (ADLS) som objektlagring för data och AI-tillgångar
  • Azure SQL DB och Azure Cosmos DB som driftdatabaser
  • Azure Purview som företagskatalog till vilken UC exporterar schema- och ursprungsinformation
  • Power BI som BI-verktyg
  • Azure OpenAI kan användas av Model Serving som en extern LLM

Organisation av referensarkitekturerna

Referensarkitekturen är strukturerad längs flödesbanorna Källa, Intag, Transformera, Fråga/Bearbeta, Tjäna, Analysoch Lagring:

  • Source

    Det finns tre sätt att integrera extern data i Data + AI-plattformen:

    • ETL: Plattformen möjliggör integrering med system som tillhandahåller halvstrukturerade och ostrukturerade data (till exempel sensorer, IoT-enheter, media, filer och loggar) samt strukturerade data från relationsdatabaser eller affärsprogram.
    • Lakehouse Federation: SQL-källor, till exempel relationsdatabaser, kan integreras i Databricks och Unity Catalog utan ETL. I det här fallet styrs källsystemdata av Unity Catalog och frågor skickas ned till källsystemet.
    • Katalogfederation: Hive Metastore-kataloger kan också integreras i Unity Catalog via katalogfederation, vilket gör att Unity Catalog kan styra tabellerna som lagras i Hive-metaarkivet.
  • Ingest

    Importera data till Databricks i batch eller som strömmande data:

  • Storage

  • Transformera och Fråga/bearbeta

    • Databricks-plattformen använder sina motorer Apache Spark och Photon för alla omvandlingar och frågor.

    • Pipelines är ett deklarativt ramverk för att förenkla och optimera tillförlitliga, underhållsbara och testbara databearbetningspipelines.

    • Drivs av Apache Spark och Photon stödjer Databricks Data + AI-plattformen båda typerna av arbetsbelastningar: SQL-frågor via SQL-lager samt SQL-, Python- och Scala-arbetsbelastningar via arbetsytkluster.

    • För datavetenskap (ML-modellering och AI) tillhandahåller Databricks AI och strojové učenie-plattformen specialiserade ML-körningar för AutoML och för kodning av ML-jobb. Alla arbetsflöden för datavetenskap och MLOps stöds bäst av MLflow.

  • Serving

    • För datalagerhantering (DWH) och BI-användningsfall tillhandahåller Databricks-plattformen Databricks SQL, informationslagret som drivs av SQL-lager och serverlösa SQL-lager.

    • För maskininlärning är Model Serving en skalbar funktion för modellservering i realtid av företagsklass som finns i Databricks kontrollplan. Unity AI Gateway är Databricks lösning för att styra och övervaka åtkomst till AI-modeller som stöds och deras associerade modell som betjänar slutpunkter.

    • Driftdatabaser:

      • Lakebase är en online-databas för transaktionshantering (OLTP) baserad på Postgres och fullt integrerad med Databricks Data + AI-plattformen. Det gör att du kan skapa OLTP-databaser på Databricks och integrera OLTP-arbetsbelastningar med Databricks.
      • Externa system, till exempel driftdatabaser, kan användas för att lagra och leverera slutdataprodukter till användarprogram.
  • Collaboration:

    • Affärspartner får säker åtkomst till de data de behöver via OpenSharing.

    • Databricks Marketplace är baserat på OpenSharing och är ett öppet forum för utbyte av dataprodukter.

    • Clean Rooms är säkra och sekretessskyddande miljöer där flera användare kan arbeta tillsammans med känsliga företagsdata utan direkt åtkomst till varandras data.

  • Analysis

  • Integrate

    • Externa AI-tjänster som OpenAI, LangGraph eller HuggingFace kan användas direkt från Databricks Intelligence Platform.

    • Externa orkestrerare kan använda den omfattande REST-API:n eller alternativt dedikerade anslutningar till externa orkestreringsverktyg som Apache Airflow.

    • Unity Catalog används för alla data & AI-styrning i Databricks Intelligence Platform och kan integrera andra databaser i dess styrning via Lakehouse Federation.

      Dessutom kan Unity Catalog integreras i andra företagskataloger, t.ex. Purview. Kontakta leverantören av företagskatalogen för mer information.

Vanliga funktioner för alla arbetsbelastningar

Dessutom levereras Databricks-plattformen med hanteringsfunktioner som stöder alla arbetsbelastningar:

  • Data- och AI-styrning

    Det centrala data- och AI-styrningssystemet i Databricks Data + AI-plattformen är Unity Catalog. Unity Catalog tillhandahåller en enda plats för att hantera principer för dataåtkomst som gäller för alla arbetsytor och stöder alla tillgångar som skapats eller används i Databricks, till exempel tabeller, volymer, funktioner (funktionsarkiv) och modeller (modellregister). Unity Catalog kan också användas för att samla in datalinje mellan frågor som körs på Databricks.

    Med Databricks Data Quality Monitoring kan du övervaka datakvaliteten för alla tabeller i ditt konto. Den identifierar avvikelser i alla tabeller och tillhandahåller en fullständig dataprofil för varje tabell.

    För observerbarhet är systemtabeller ett Databricks-värdbaserat analyslager för ditt kontos driftdata. Systemtabeller kan användas för historisk observerbarhet i hela ditt konto.

  • Dataintelligensplattform

    Databricks Data + AI-plattformen gör det möjligt för hela din organisation att använda data och AI, och kombinerar AI med enhetsfördelarna från Databricks för att förstå den unika semantiken i din data. Se Databricks AI-hjälpmedelsfunktioner.

    Genie Code är tillgängligt i Databricks Notebooks, SQL-redigeraren, filredigeraren och på andra platser som en kontextmedveten AI-assistent för användare.

  • Automation och orkestrering

    Lakeflow Jobs samordnar databehandling, maskininlärning och analyspipelines på Databricks Data + AI-plattformen. Med Lakeflow-pipelines kan du skapa tillförlitliga och underhållsbara ETL-pipelines med deklarativ syntax. Plattformen stöder även CI/CD- och MLOps

Högnivåanvändningsfall för Data + AI-plattformen på Azure

Inbyggd inmatning från SaaS-appar och databaser med Lakeflow Connect

Inmatning med LFC på Azure Databricks.

Ladda ned: Lakeflow Connect-referensarkitektur för Azure Databricks.

Databricks Lakeflow Connect erbjuder inbyggda kontakter för inmatning från företagsprogram och databaser. Den resulterande inmatningspipelinen styrs av Unity Catalog och drivs av serverlösa beräknings- och Lakeflow-pipelines.

Lakeflow Connect utnyttjar effektiva inkrementella läsningar och skrivningar för att göra datainmatningen snabbare, skalbar och mer kostnadseffektiv, medan dina data förblir färska för nedströmsförbrukning.

Batchinmatning och ETL

Referensarkitektur för batch ETL på Azure Databricks.

Ladda ned: Batch ETL-referensarkitektur för Azure Databricks

Inläsningsverktyg använder källspecifika adaptrar för att läsa data från källan och sedan antingen lagra den i molnlagring, därifrån Auto Loader kan läsa den, eller anropa Databricks direkt (till exempel med partnerverktyg för inläsning som är integrerade i Databricks-plattformen). För att läsa in data kör Databricks ETL och bearbetningsmotorn frågorna via Pipelines. Dirigera enkla jobb eller flera jobb med Lakeflow-jobb och styr dem med hjälp av Unity Catalog (åtkomstkontroll, granskning, ursprung och så vidare). Om du vill ge åtkomst till specifika gyllene tabeller för driftsystem med låg svarstid exporterar du tabellerna till en driftdatabas, till exempel ett RDBMS- eller nyckelvärdeslager i slutet av ETL-pipelinen.

Streaming och ändringsdatahantering (CDC)

Spark-strukturerad strömningsarkitektur i Azure Databricks.

Ladda ned: Spark-strukturerad strömningsarkitektur för Azure Databricks

Databricks ETL-motorn använder Spark Structured Streaming för att läsa från händelseköer som Apache Kafka eller Azure Event Hub. De underordnade stegen följer metoden för Batch-användningsfallet ovan.

CDC (Real-Time Change Data Capture ) lagrar vanligtvis de extraherade händelserna i en händelsekö. Därifrån följer användningsfallet användningsfallet för direktuppspelning.

Om CDC görs i batch, med de extraherade posterna lagrade i molnlagring först, kan Databricks Auto Loader läsa dem och användningsfallet följer Batch ETL.

Maskininlärning och AI (traditionell)

Referensarkitektur för maskininlärning och AI för Azure Databricks.

Ladda ned: Referensarkitektur för maskininlärning och AI för Azure Databricks

För maskininlärning erbjuder Databricks Data + AI Platform toppmoderna maskin- och djupinlärningsbibliotek. Den innehåller funktioner som Funktionslager och Modellregister (både integrerade i Unity Catalog), funktioner med låg kod med AutoML och MLflow-integrering i datavetenskapens livscykel.

Unity Catalog styr alla datavetenskapsrelaterade tillgångar (tabeller, funktioner och modeller) och dataexperter kan använda Lakeflow-jobb för att orkestrera sina jobb.

För att distribuera modeller på ett skalbart och företagsbaserat sätt använder du MLOps-funktionerna för att publicera modellerna i modellservern.

Agentapplikationer

Referensarkitektur för AI-program på Azure Databricks.

Ladda ned: referensarkitektur för AI-applikationer för Azure Databricks

För att distribuera modeller på ett skalbart och företagsbaserat sätt använder du MLOps-funktionerna för att publicera modellerna i modellservern.

BI- och SQL-analys

REFERENSarkitektur för BI- och SQL-analys för Azure Databricks.

Ladda ned: REFERENSarkitektur för BI- och SQL-analys för Azure Databricks

För BI-användningsfall kan affärsanalytiker använda instrumentpaneler, Databricks SQL-redigeraren eller BI-verktyg som Tableau eller Power BI. I samtliga fall är motorn Databricks SQL (serverlös eller icke-serverlös) och Unity Catalog tillhandahåller dataidentifiering, utforskning och åtkomstkontroll.

Affärsappar

Verksamhetsappar för Databricks för Azure Databricks.

Ladda ned: Business Apps for Databricks för Azure Databricks

Med Databricks Apps kan utvecklare skapa och distribuera säkra data- och AI-program direkt på Databricks-plattformen, vilket eliminerar behovet av separat infrastruktur. Appar finns på den serverlösa Databricks-plattformen och integreras med viktiga plattformstjänster. Använd Lakebase om appen behöver OLTP-data som har synkroniserats från Databricks.

Lakehouse-federation

Lakehouse federationsreferensarkitektur för Azure Databricks.

Ladda ner: Referensarkitektur för Lakehouse-federationens Azure Databricks

Lakehouse Federation tillåter att externa DATA SQL-databaser (till exempel MySQL, Postgres, SQL Server eller Azure Synapse) integreras med Databricks.

Alla arbetsbelastningar (AI, DWH och BI) kan ha fördelar av detta utan att först behöva transformera och ladda data till objektlagring. Den externa källkatalogen mappas till Unity-katalogen och detaljerad åtkomstkontroll kan tillämpas på åtkomst via Databricks-plattformen.

Katalogfederation

Referensarkitektur för katalogfederation för Azure Databricks.

Ladda ned: Referensarkitektur för katalogfederation för Azure Databricks

Med katalogfederation kan externa Hive-metaarkiv (till exempel MySQL, Postgres, SQL Server eller Azure Synapse) integreras med Databricks.

Alla arbetsbelastningar (AI, DWH och BI) kan ha fördelar av detta utan att först behöva transformera och ladda data till objektlagring. Den externa källkatalogen läggs till i Unity Catalog där detaljerad åtkomstkontroll tillämpas via Databricks-plattformen.

Dela data med verktyg från tredje part

Referensarkitektur för företagsdatadelning för Azure Databricks.

Ladda ned: Dela data med referensarkitektur för verktyg från tredje part för Azure Databricks

Datadelning i företagsklass med tredje part tillhandahålls av OpenSharing. Det ger direkt åtkomst till data i objektlagret som skyddas av Unity Catalog. Den här funktionen används också på Databricks Marketplace, ett öppet forum för utbyte av dataprodukter.

Använda delade data från Databricks

Använda delade data från Databricks för Azure Databricks.

Ladda ned: Använda delade data från Databricks-referensarkitekturen för Azure Databricks

OpenSharing Databricks-to-Databricks-protokollet gör det möjligt för användare att dela data på ett säkert sätt med alla Databricks-användare, oavsett konto eller molnvärd, så länge användaren har åtkomst till en arbetsyta som är aktiverad för Unity Catalog.