Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Het SQL-analytics-eindpunt is een leesgeoptimaliseerd T-SQL-oppervlak over Delta-data in Fabric. Dit artikel legt de Fabric data warehousing-werklast uit met het SQL-analyse-eindpunt van het lakehouse, en scenario's voor het gebruik van het lakehouse in data warehousing.
Wat is een Lakehouse SQL analytics endpoint?
Het SQL-analyse-eindpunt stelt je in staat om data in het lakehouse te bevragen door gebruik te maken van de T-SQL-taal en het TDS-protocol.
- Het SQL-analyse-eindpunt stelt Delta-tabellen uit het lakehouse bloot als SQL-tabellen die je kunt bevragen met T-SQL.
- Elke Delta-tabel van een meerhuis wordt weergegeven als één tafel. Gegevens moeten een delta-indeling hebben.
- Elke lakehouse heeft één SQL-analyse-endpoint, en elke werkruimte kan meer dan één lakehouse hebben. Andere Fabric-items - waaronder warehouses, gespiegelde databases, SQL-databases en Azure Cosmos DB - leveren ook automatisch een SQL-analytics-endpoint aan, zodat een werkruimte meer SQL-analytics-endpoints kan hebben dan lakehouse-items.
Je hoeft geen SQL-analyse-endpoint in Fabric te maken. Er wordt automatisch een SQL-analyse-eindpunt gemaakt voor elke lakehouse-, database- of gespiegelde database. Een SQL-analyse-eindpunt fungeert als een lichtgewicht datawarehousingmogelijkheid voor hun bovenliggende items, die een aanvulling vormen op de lakehouse-architectuur van het magazijn. Met deze architectuur kunnen Spark of Fabric mirroring gegevens aansturen in een mapstructuur in de lakehouse die het SQL Analytics-eindpunt kan inzien.
Note
Achter de schermen gebruikt het SQL-analyse-eindpunt dezelfde engine als het warehouse om SQL-query's met hoge prestaties en lage latentie te leveren.
Automatische detectie van metagegevens
Een naadloos proces leest de Delta-logboeken uit de /Tables map en zorgt ervoor dat SQL-metagegevens voor tabellen, zoals statistieken, altijd up-to-date zijn. Er is geen gebruikersactie nodig en u hoeft geen gegevens te importeren, te kopiëren of een infrastructuur in te stellen. Zie Automatisch gegenereerd schema in het SQL Analytics-eindpunt voor meer informatie.
Scenario's die het lakehouse mogelijk maakt voor data-warehousing
In Fabric bieden we één magazijn aan.
Het lakehouse, met zijn SQL-analyse-endpoint, aangedreven door het warehouse, kan de traditionele beslissingsboom van batch-, streaming- of lambda-architectuurpatronen vereenvoudigen. Samen met een magazijn maakt het lakehouse veel scenario's voor additieve analyse mogelijk. Deze sectie onderzoekt hoe je een meerhuis kunt gebruiken samen met een magazijn voor een best-of-breed analyticsstrategie.
Analyse met de goudlaag van je lakehouse
Een bekende strategie voor lake data-organisatie is medaille-architectuur. Deze strategie organiseert bestanden in onbewerkte (brons), geconsolideerde (zilver) en verfijnde (gouden) lagen. U kunt een SQL-analyse-eindpunt gebruiken om gegevens in de gouden laag van de medaillonarchitectuur te analyseren als de bestanden zijn opgeslagen in Delta Lake-indeling, zelfs als ze buiten Microsoft Fabric OneLake zijn opgeslagen.
Gebruik snelkoppelingen in OneLake om gold-mappen te refereren in externe Azure Data Lake-opslagaccounts die door Azure Synapse Spark of Azure Databricks-engines worden beheerd.
U kunt ook magazijnen toevoegen als onderwerp- of domeingerichte oplossingen voor specifieke onderwerpen die op maat gemaakte analysevereisten kunnen hebben.
Als u ervoor kiest om uw gegevens in Fabric te bewaren, worden deze always geopend en toegankelijk via API's, Delta-indeling en natuurlijk T-SQL.
Vraag als dienst over je Delta-tabellen van lakehouse en andere items van OneLake
Analisten, gegevenswetenschappers en data engineers moeten mogelijk query's uitvoeren op gegevens in een data lake. In Fabric is deze end-to-end-ervaring volledig SaaSified.
OneLake is één, geïntegreerde, logische data lake voor de hele organisatie. OneLake is OneDrive voor gegevens. OneLake kan meerdere werkruimten bevatten, bijvoorbeeld in uw organisatieafdelingen. Elk item in Fabric maakt gegevens toegankelijk via OneLake.
Data in een lakehouse in Fabric wordt fysiek opgeslagen in OneLake met de volgende mappenstructuur:
- De
/Filesmap bevat onbewerkte en niet-geconsolidateerde (bronzen) bestanden die data engineers moeten verwerken voordat ze worden geanalyseerd. De bestanden hebben mogelijk verschillende indelingen, zoals CSV, Parquet, verschillende typen afbeeldingen en meer. - De
/Tablesmap bevat verfijnde en geconsolideerde (gouden) gegevens die gereed zijn voor bedrijfsanalyse. De geconsolideerde gegevens hebben een Delta Lake-indeling.
Een SQL Analytics-eindpunt kan gegevens lezen in de /tables map in OneLake. Analyse is zo eenvoudig als het queryen van het SQL-analyse-eindpunt van het lakehouse. Samen met het warehouse krijg je ook cross-database queries en de mogelijkheid om naadloos over te schakelen van alleen-lezen queries naar het bouwen van extra bedrijfslogica bovenop je OneLake-data met Fabric Data Warehouse.
Data-engineer met Spark en serveren met SQL
Gegevensgestuurde ondernemingen moeten hun back-end- en analysesystemen in bijna realtime synchroniseren met klantgerichte toepassingen. De impact van transacties moet nauwkeurig worden weergegeven via end-to-end processen, gerelateerde toepassingen en OLTP-systemen (Online Transaction Processing).
In Fabric kunt u Spark Streaming of Data-engineer gebruiken om uw gegevens te cureren. Je kunt het lakehouse SQL-analyse-endpoint gebruiken om de datakwaliteit te valideren en voor bestaande T-SQL-processen. Dit kan gebeuren in een medaillonarchitectuur of in meerdere lagen van je meerhuis, waarbij brons, zilver, goud of geënsceneerd, gecureerd en verfijnd materiaal worden geserveerd. U kunt de mappen en tabellen die zijn gemaakt met Spark aanpassen om te voldoen aan uw vereisten voor data engineering en bedrijf. Wanneer het klaar is, kan een warehouse al je downstream business intelligence-toepassingen en andere analytics-toepassingen bedienen, zonder data te kopiëren, Views te gebruiken of data te verfijnen met CREATE TABLE AS SELECT (CTAS), stored procedures en andere DML / DDL-commando's.
Integratie met de goudlaag van je open lakehouse
Een SQL-analytics-endpoint beperkt zich niet tot data-analyse in alleen het meerhuis in Fabric. Door gebruik te maken van een SQL-analytics-endpoint kun je lake-data analyseren in elk lakehouse met Azure Synapse Spark, Azure Databricks of een andere lake-centric data engineering engine. U kunt de gegevens opslaan in Azure Data Lake Storage of Amazon S3.
Je kunt altijd toegang krijgen tot deze nauwe, bidirectionele integratie met het lakehouse in Fabric via elke engine via open API's, het Delta-formaat en natuurlijk T-SQL.
Gegevensvirtualisatie van externe gegevensmeren met snelkoppelingen
Gebruik OneLake-snelkoppelingen om gold-mappen te refereren in externe Azure Data Lake-opslagaccounts die door Azure Synapse Spark of Azure Databricks-engines worden beheerd, evenals in elke Delta-tabel die in Amazon S3 is opgeslagen.
U kunt elke map analyseren waarnaar wordt verwezen door een snelkoppeling van een SQL-analyse-eindpunt en een SQL-tabel maken voor de gegevens waarnaar wordt verwezen. Gebruik de SQL-tabel om gegevens beschikbaar te maken in extern beheerde data lakes en om er analyses op in te schakelen.
Deze snelkoppeling fungeert als een virtueel magazijn dat u vanuit een magazijn kunt gebruiken voor aanvullende downstreamanalysevereisten of rechtstreeks query's kunt uitvoeren.
Als u gegevens in externe Data Lake Storage-accounts wilt analyseren, gebruikt u de volgende stappen:
- Maak een snelkoppeling die verwijst naar een map in Azure Data Lake Storage of Amazon S3-account. Nadat je aansluitingsgegevens en inloggegevens hebt ingevoerd, wordt een snelkoppeling getoond in het huis aan het meer.
- Schakel over naar het SQL-analyse-eindpunt van het lakehouse en zoek een SQL-tabel met een naam die overeenkomt met de snelkoppelingsnaam. Deze SQL-tabel verwijst naar de map in ADLS of S3.
- Voer een query uit op de SQL-tabel die verwijst naar gegevens in ADLS of S3. Gebruik de tabel zoals elke andere tabel in het SQL Analytics-eindpunt. U kunt tabellen samenvoegen die verwijzen naar gegevens in verschillende opslagaccounts.
Note
Als de SQL-tabel niet onmiddellijk wordt weergegeven in het SQL Analytics-eindpunt, wacht u enkele minuten. De SQL-tabel die verwijst naar gegevens in een extern opslagaccount, wordt met een vertraging gemaakt.
Gearchiveerde of historische gegevens analyseren in een data lake
Gegevenspartitionering is een bekende optimalisatietechniek voor gegevenstoegang in Data Lakes. Sla gepartitioneerde gegevenssets op in hiërarchische mapstructuren in de indeling/year=<year>/month=<month>/day=<day>, waarbij yearmonth, en day de partitioneringskolommen zijn. Deze structuur houdt historische gegevens logisch gescheiden en stelt rekenprogramma's in staat om de gegevens zo nodig te lezen met performant filteren, in plaats van de hele map en alle mappen en bestanden in te lezen.
Gepartitioneerde gegevens maken snellere toegang mogelijk als de query's filteren op de predicaten die predicaatkolommen vergelijken met een waarde.
Een SQL Analytics-eindpunt kan dit type gegevens eenvoudig lezen zonder dat hiervoor een configuratie is vereist. U kunt bijvoorbeeld elke toepassing gebruiken om gegevens te archiveren in een data lake, waaronder SQL Server 2022 of Azure SQL Managed Instance. Nadat u gegevens hebt gepartitioneerd en in een lake hebt geplaatst voor archiveringsdoeleinden met behulp van externe tabellen, kan een SQL Analytics-eindpunt gepartitioneerde Delta Lake-tabellen lezen als SQL-tabellen en uw organisatie deze laten analyseren. Deze aanpak vermindert de totale eigendomskosten en gegevensduplicatie en maakt big data-, AI- en andere analysescenario’s mogelijk.
U kunt ook query's voor tijdreizen gebruiken om snel query's uit te voeren op eerdere versies van gegevens. Tijdreizen is een voordelige en efficiënte mogelijkheid om een query uit te voeren op de eerdere statussen van gegevens met T-SQL-query's. Voor een SQL-analyse-endpoint in Lake House wordt tijdreizen beperkt door vacuumretentie-instellingen. Zie Zo doet u dat: query’s uitvoeren met time travel op statementniveau om aan de slag te gaan.
Gegevensvirtualisatie van Fabric-gegevens met snelkoppelingen
In Fabric kunt u met werkruimten gegevens scheiden op basis van complexe zakelijke, geografische of wettelijke vereisten.
Een SQL-analytics-endpoint stelt je in staat de data op hun plaats te laten en toch data te analyseren in het magazijn of het lakehouse, zelfs in andere Fabric-werkruimtes, via een naadloze virtualisatie. Elk meerhuis in Fabric slaat data op in OneLake.
Met snelkoppelingen kunt u verwijzen naar mappen op elke OneLake-locatie.
Elk magazijn in Fabric slaat tabelgegevens op in OneLake. Als een tabel alleen voor toevoegingen is, worden de tabelgegevens weergegeven als Delta Lake-gegevens in OneLake. Snelkoppelingen stellen je in staat om mappen te raadplegen in elke OneLake waar de warehouse-tabellen beschikbaar zijn.
Delen en query's uitvoeren op meerdere werkruimten
Hoewel u met werkruimten gegevens kunt scheiden op basis van complexe zakelijke, geografische of wettelijke vereisten, moet u soms het delen tussen deze afdelingen vergemakkelijken voor specifieke analyses.
Een Lakehouse SQL-analytics-endpoint kan het eenvoudig delen van data tussen afdelingen en gebruikers mogelijk maken, waarbij een gebruiker zijn eigen capaciteit en magazijn kan meenemen. Werkruimten organiseren afdelingen, bedrijfseenheden of analytische domeinen. Door gebruik te maken van snelkoppelingen kunnen gebruikers de data van elk warehouse of lakehouse vinden. Gebruikers kunnen direct hun eigen aangepaste analyses uitvoeren op basis van dezelfde gedeelde gegevens. Deze aanpak helpt niet alleen bij het doorbelasten van kosten aan afdelingen en gebruiksallocatie, maar is ook een zero-copyversie van de data.
Met het SQL Analytics-eindpunt kunt u query's uitvoeren op elke tabel en eenvoudig delen. U kunt besturingselementen toevoegen met behulp van werkruimterollen en beveiligingsrollen om te voldoen aan aanvullende bedrijfsvereisten.
Als u gegevensanalyse tussen werkruimten wilt inschakelen, gebruikt u de volgende stappen:
- Maak een OneLake-snelkoppeling die verwijst naar een tabel of map in een werkruimte waartoe u toegang hebt.
- Kies een lakehouse of warehouse met een tabel of Delta Lake-map die je wilt analyseren. Wanneer je een tabel of map selecteert, verschijnt er een snelkoppeling in het lakehouse.
- Schakel over naar het SQL-analyse-eindpunt van het lakehouse en zoek de SQL-tabel met een naam die overeenkomt met de sneltoetsnaam. Deze SQL-tabel verwijst naar de map in een andere werkruimte.
- Voer een query uit op de SQL-tabel die verwijst naar gegevens in een andere werkruimte. U kunt de tabel gebruiken zoals elke andere tabel in het SQL Analytics-eindpunt. U kunt de tabellen koppelen die verwijzen naar gegevens in verschillende werkruimten.
Voor meer informatie over beveiliging in het SQL Analytics-eindpunt, zie OneLake-beveiliging voor SQL Analytics-eindpunten.
Note
Als de SQL-tabel niet onmiddellijk wordt weergegeven in het SQL Analytics-eindpunt, wacht u enkele minuten. De SQL-tabel die verwijst naar gegevens in een andere werkruimte, wordt met een vertraging gemaakt.
Gepartitioneerde gegevens analyseren
Gegevenspartitionering is een bekende optimalisatietechniek voor gegevenstoegang in Data Lakes. U slaat gepartitioneerde gegevenssets op in hiërarchische mapstructuren in de indeling/year=<year>/month=<month>/day=<day>, waarbij yearmonth, en day zijn de partitioneringskolommen. Gepartitioneerde gegevenssets maken snellere gegevenstoegang mogelijk als de query's gebruikmaken van predicaten die gegevens filteren door predicaatkolommen te vergelijken met een waarde.
Een SQL-analyse-eindpunt kan gepartitioneerde Delta Lake-gegevenssets vertegenwoordigen als SQL-tabellen en u in staat stellen deze te analyseren.
Zie Query's uitvoeren op externe Data Lake-bestanden met behulp van Fabric Data Warehouse of SQL Analytics-eindpunt voor meer informatie en voorbeelden over het uitvoeren van query's op externe gegevens. Zie Gepartitioneerde gegevens opvragen voor een voorbeeld en een gebruikssituatie voor het uitvoeren van query's op gepartitioneerde Parquet-bestanden.
Analyseer gegevens in het meerhuis, magazijn of eventhouse
De hoofdpagina's van Lakehouse en Warehouse bevatten het Eventhouse-eindpunt als onderdeel van het menu Gegevens analyseren . Het Eventhouse-eindpunt biedt een door Eventhouse aangedreven query-ervaring rechtstreeks boven op Lakehouse- en Warehouse-gegevens, zonder gegevensduplicatie of handmatige synchronisatie.
Wanneer u het Eventhouse-eindpunt inschakelt, worden een Eventhouse en een KQL-database automatisch gemaakt als onderliggende items van de bron Lakehouse of Warehouse, waarbij schemasynchronisatie op de achtergrond wordt verwerkt. Het eindpunt weerspiegelt altijd het huidige schema van de brongegevens, waardoor bijna realtime analytische toegang mogelijk is.
Deze integratie maakt Eventhouse een natuurlijke uitbreiding van de gegevensbron, in plaats van een afzonderlijk systeem dat u moet instellen en beheren. Zie Eventhouse-eindpunt inschakelen voor Lakehouse en warehouse voor meer informatie over het Eventhouse-eindpunt.
Verwante inhoud
- Wat is een lakehouse in Fabric?
- Fabric keuzegids: Kies tussen magazijn en lakehouse
- Breng je data naar OneLake met lakehouse
- Power BI semantische modellen in Fabric
- Opties om gegevens in het lakehouse in Fabric op te halen
- Gegevens kopiëren met behulp van kopieeractiviteit
- Verplaats data van Azure SQL DB naar lakehouse via copy assistant
- Connectiviteit met datawarehousing in Fabric
- SQL Analytics-eindpunt van het lakehouse
- Zoek het SQL-analytics-endpoint of warehouse in Fabric