Spejlet Google Lakehouse runtime-katalog

Et spejlet Google Lakehouse runtime-katalog i Fabric integrerer Apache Iceberg-tabellerne, som administreres i din Google Cloud Lakehouse, med resten af dine data i Fabric. Du kan kontinuerligt spejle din Google Lakehouse runtime-katalogstruktur direkte ind i Fabric's OneLake.

For en vejledning i at konfigurere dit Google Cloud-miljø til katalog-spejling til Fabric, se Vejledning: Konfigurér spejlet Google Lakehouse runtime-katalog.

Vigtigt!

Denne funktion er i prøveversion.

Når du spejler et Google Lakehouse runtime-katalog, sker der ingen databevægelse eller duplikation. Kun katalogstrukturen er afspejlet i Fabric. De underliggende Iceberg-tabeldata forbliver i Google Cloud Storage og tilgås via genveje. Ændringer i de underliggende data kan ikke umiddelbart vises i Fabric. Udbredelsen kan tage alt fra få sekunder til flere minutter, som beskrevet i SQL Analytics endpoint performance-dokumentationen.

Hvilke analyseoplevelser er indbygget

Spejlede kataloger er elementer i Fabric, der adskiller sig fra andre elementer som lakehouses og SQL-analyse-endpoints.

Når du spejler et Google Lakehouse runtime-katalog, opretter Fabric disse elementer:

Du kan få adgang til dine spejlede Google Lakehouse runtime-katalogdata på flere måder:

  • Brug T-SQL-kommandoer til at definere og forespørge på dataobjekter fra det skrivebeskyttede SQL-analyseslutpunkt. Hvert spejlet Google Lakehouse runtime-katalogobjekt har et autogenereret SQL-analyse-endpoint, der giver en rig analytisk oplevelse skabt af spejlingsprocessen.
  • Brug Power BI med Direct Lake-tilstand til at oprette rapporter mod det spejlede katalogelement.
  • Brug andre Fabric-arbejdsbelastninger til at forespørge tabeller i det spejlede katalogelement.

Spejlede tabeller kan forespørgsles inden for sekunder efter udvælgelse, og end-to-end metadata-udbredelse sker typisk på sekunder til få minutter.

Forbind og autentificer

Spejling forbinder til Apache Iceberg REST-katalogets endpoint i Google Lakehouse runtime-kataloget. De underliggende tabeldata forbliver i Google Cloud Storage og læses gennem genveje, så forbindelsen skal have tilladelse til at læse både katalogmetadata og tabeldata.

Google Lakehouse runtime katalog-spejling bruger Google Cloud Workload Identity Federation til at autentificere Microsoft Entra-identiteter. Fabric præsenterer et Microsoft Entra OpenID Connect (OIDC)-token til Google Cloud i stedet for at gemme en Google Cloud-tjenestekontonøgle.

Før du opretter Fabric-forbindelsen, skal du konfigurere en Google Cloud Workload Identity Pool med en OIDC-udbyder, der stoler på Microsoft Entra-tokens. Brug disse præcise udbyderværdier:

Udbyderindstilling Værdi
Udbydertype OpenID Connect (OIDC)
URL-adresse til udsteder https://sts.windows.net/{TENANT_ID}/
Tilladt publikum https://analysis.windows.net/powerbi/connector/MirroredGoogleLakehouseRuntimeCatalog
Attributmapping google.subject = assertion.oid

Tilføj hver Microsoft Entra-identitet, der har brug for adgang, som en fødereret IAM-principal, eller autoriser et principal-sæt til poolen. Individuelle identitetsbindinger anbefales for adgang med mindst mulig privilegier. Tildel principalen rollen som BigLake Viewer (roles/biglake.viewer) og rollen som Service Usage Consumer (roles/serviceusage.serviceUsageConsumer) på det snævreste passende ressourceområde.

Indskriv det numeriske Google Cloud-projektnummer, Workload Identity Pool ID og OIDC-udbyder-ID. Du har brug for disse værdier for at skabe Fabric-forbindelsen.

Kildekataloget skal også kunne autorisere adgang til sine Cloud Storage-data. For et katalog, der bruger legitimationssalg, skal katalogets automatisk provisionerede servicekonto få Storage Object User-rollen (roles/storage.objectUser) på alle tilknyttede Cloud Storage-buckets. For et katalog, der bruger slutbrugerlegitimationsoplysninger, giv den fødererede principal den nødvendige læseadgang til de tilknyttede buckets.

For trin-for-trin instruktioner til at konfigurere Workload Identity Federation og forbindelsen, se Vejledning: Konfigurér spejlet Google Lakehouse runtime-katalog.

Synkronisering af metadata

Når du opretter et spejlet Google Lakehouse runtime-katalog i Fabric, er funktionen Automatisk synkroniser fremtidige tabeller aktiveret som standard. Hvis du aktiverer automatisk synkronisering, afspejler dit Google Lakehouse runtime-katalog automatisk følgende metadataændringer i Fabric:

  • Tilføjelse af navnerum til kataloget
  • Sletning af navnerum fra kataloget
  • Tilføjelse af tabeller til et navnerum
  • Sletning af tabeller fra et navnerum
  • Når Automatisk synkroniser fremtidige tabeller er aktiveret, inkluderes nyoprettede Iceberg-tabeller i udvalgte navnerum automatisk i Fabric uden behov for manuel opdatering.
  • Skema- og dataændringer i eksisterende tabeller følger normale udbredelsesintervaller.

Navnerum og tabelvalg fungerer som følger:

  • Du kan vælge, hvilke navnerum der skal inkluderes som skemaer, og du kan udelukke specifikke tabeller.
  • At fjerne fravalget af et navnerum fjerner markeringen af alle tabellerne i navnerummet.
  • Hvis du vælger navnerummet igen, bliver alle tabeller i navnerummet valgt igen.