Vejledning: Konfigurér spejlet Google Lakehouse runtime-katalog

Ved at bruge katalogmirroring til Google Lakehouse runtime-katalog kan du læse Apache Iceberg-data, der administreres i Google Cloud Lakehouse fra Microsoft Fabric-arbejdsbelastninger.

Vigtigt!

Denne funktion er i prøveversion.

Forudsætninger

  • Et Google Cloud-projekt med fakturering aktiveret og BigLake API aktiveret.
  • Et Google Lakehouse runtime-katalog, der indeholder Apache Iceberg V2-tabellerne, du vil spejle. Iceberg V1-tabeller understøttes ikke.
  • Apache Iceberg REST-katalogets endpoint og Google Cloud Storage-lokationerne, der gemmer Iceberg-dataene, kan nås via det offentlige internet. Firewallregler og andre netværksbegrænsninger understøttes ikke i øjeblikket. Se begrænsninger og overvejelser ved denne funktion.
  • Tilladelse til at oprette og administrere en Google Cloud Workload Identity Pool og udbyder samt til at tildele Google Cloud IAM-roller.
  • Dit Microsoft Entra-lejer-id. Hvis du bruger individuelle identitetsbindinger, skal du også få objekt-ID'et for hver Microsoft Entra-identitet, du vil autorisere.
  • Et Fabric-arbejdsområde tilknyttet en Fabric-kapacitet (F SKU eller Trial).
  • Din Fabric lejeradministrator skal aktivere tenant admin-indstillingen med titlen Aktiver nye spejlede katalogposter (Preview).

Konfigurér Google Cloud Workload Identity Federation

Google Lakehouse runtime katalog-spejling bruger Google Cloud Workload Identity Federation til at stole på Microsoft Entra-tokens. Udfyld følgende Google Cloud-konfiguration, før du opretter Fabric-forbindelsen.

Vælg Google Cloud-projektet

  1. I Google Cloud-konsollen vælger du det projekt, der ejer Workload Identity Pool.
  2. Registrer både projekt-ID'et og det numeriske projektnummer. Du kan ikke bruge projekt-ID og projektnummer i flæng.
  3. Aktivér BigLake API'en til projektet.

Opret en arbejdsbelastningsidentitetspulje

  1. I Google Cloud-konsollen skal du gå til IAM & Admin>Workload Identity Federation.
  2. Vælg Opret pulje.
  3. Indtast et poolnavn og pool-ID.
  4. Sørg for, at poolen er aktiveret. Poolens placering er global.
  5. Optag pool-ID'et.

Tilføj en OIDC-udbyder

  1. Åbn Workload Identity Pool, og vælg derefter Add Provider. Du kan også tilføje udbyderen, mens du opretter poolen.

  2. For udbydertypen skal du vælge OpenID Connect (OIDC).

  3. Konfigurér udbyderen med følgende værdier. Erstat {TENANT_ID} med dit Microsoft Entra-lejer-ID.

    Udbyderindstilling Værdi, der skal indsættes Bemærkninger
    Udbyder-id Et udbyder-ID, som du vælger Notér denne værdi for Fabric-forbindelsen.
    URL-adresse til udsteder https://sts.windows.net/{TENANT_ID}/ Værdien, inklusive den efterfølgende skråstreg, skal nøjagtigt matche token-kravet iss .
    Tilladt publikum https://analysis.windows.net/powerbi/connector/MirroredGoogleLakehouseRuntimeCatalog Værdien skal nøjagtigt matche token-kravet aud .
    Attributmapping google.subject = assertion.oid Microsoft Entra-objekt-ID'et bliver Googles fødererede subjekt.
  4. Gem og aktiver udbyderen.

  5. Bekræft, at du har registreret det numeriske projektnummer, Pool ID og Provider ID. Du skal bruge alle tre værdier til Fabric-forbindelsen.

Tilføj Microsoft Entra-identiteter som IAM-principper

Knyt Google Cloud-rollerne til den Microsoft Entra-identitet eller identiteter, som Fabric bruger. For adgang med mindst privilegier, tilføj hver identitet separat med denne hovedidentifikator:

principal://iam.googleapis.com/projects/PROJECT_NUMBER/locations/global/workloadIdentityPools/POOL_ID/subject/ENTRA_OID

Erstat PROJECT_NUMBER, POOL_ID, og ENTRA_OID med dit numeriske Google Cloud-projektnummer, Workload Identity Pool ID og Microsoft Entra objekt-ID.

For at give adgang til alle identiteter, der accepteres af Workload Identity Pool, kan du i stedet bruge dette principal set:

principalSet://iam.googleapis.com/projects/PROJECT_NUMBER/locations/global/workloadIdentityPools/POOL_ID/*

Forsigtighed

Wildcard-principalsættet giver rollen til enhver identitet, der med succes fødererer gennem puljen. Udbyderudstederen, tilladte målgrupper, attributmapping og enhver attributbetingelse kontrollerer stadig, hvilke tokens der accepteres. Hvis puljen indeholder flere udbydere, kan wildcardet inkludere identiteter fra dem alle. Brug individuelle subjektbindinger eller et smallere attributbaseret principal-sæt, når mindst privilegie-adgang er nødvendig.

Giv den valgte principal eller principal disse roller til det snævreste relevante ressourceomfang:

Rolle Rolle-id
BigLake Viewer roles/biglake.viewer
Serviceforbrug Forbruger roles/serviceusage.serviceUsageConsumer

Konfigurér adgang til tabeldataene

Google Lakehouse runtime-kataloget skal kunne autorisere adgang til Cloud Storage-buckets, der indeholder tabeldataene:

  • Hvis kataloget bruger legitimationssalg, skal katalogets automatisk provisionerede servicekonto få Storage Object User-rollen (roles/storage.objectUser) på hver tilknyttet spand. Den fødererede Microsoft Entra-identitet behøver ikke direkte adgang til disse buckets.
  • Hvis kataloget bruger slutbrugerlegitimationsoplysninger, giv den fødererede principal den nødvendige læseadgang til hver tilknyttet spand.

For mere information om kataloglegitimationstilstande og påkrævede roller, se Opsætning af Apache Iceberg REST-katalogendpointet.

Indsaml katalogforbindelsesværdierne

Før du opretter Fabric-forbindelsen, indsaml disse værdier fra Google Cloud:

  • URL - Brug det stabile Google Lakehouse Apache Iceberg REST-katalog endpoint: https://biglake.googleapis.com/iceberg/v1/restcatalog.
  • Lager - Til et katalog med flere spande, brug bl://projects/PROJECT_ID/catalogs/CATALOG_ID. Til en enkelt-spand-katalog, brug gs://CLOUD_STORAGE_BUCKET_NAME.
  • Project ID - Brug Google Cloud-projektet, som faktureres for forespørgsler til Apache Iceberg REST-katalogets endpoint.
  • Project nummer - Brug det numeriske project nummer for det projekt, der ejer Workload Identity Pool.
  • Pool ID - Brug ID'et på Workload Identity Pool, der stoler på Microsoft Entra-tokens.
  • Udbyder-ID - Brug ID'et på den OIDC-udbyder, du har konfigureret i poolen.

For mere information om lagerstier og katalogtyper, se Om Apache Iceberg REST-katalogendepunktet.

Opret et spejlet Google Lakehouse runtime-katalog

Følg disse trin for at oprette et spejlet Google Lakehouse runtime-katalog i Fabric.

  1. Gå til https://powerbi.com.

  2. Vælg + Ny, og vælg derefter Spejlet Google Lakehouse runtime-katalog (forhåndsvisning).

  3. Vælg en eksisterende forbindelse, hvis du har konfigureret en.

    Hvis du ikke har en eksisterende forbindelse, så lav en forbindelse og indtast de nødvendige oplysninger:

    • For URL, indtast https://biglake.googleapis.com/iceberg/v1/restcatalog.
    • For Warehouse skal du indtaste eller gs:// warehouse-stien bl:// for dit katalog.
    • For Project ID indtast Google Cloud-projektet, som faktureres for kataloganmodninger.
    • For indstillingerne for Workload Identity Federation skal du indtaste det numeriske Project-nummer, Pool ID og Provider ID, som du har registreret i Configure Google Cloud Workload Identity Federation.
    • Autentificér med en Microsoft Entra-identitet, som du har tilføjet som IAM-principal.
  4. Efter du har forbundet til Google Lakehouse runtime-kataloget, vælger du på Choose data-siden det katalogomfang , du vil spejle. Derefter vælger du gennem inklusions- og eksklusionslisterne de navnerum og tabeller, du vil tilføje til Fabric.

    • Du kan kun se de navnerum og tabeller, som den fødererede Microsoft Entra-identitet har tilladelse til at få adgang til.
    • Som standard er funktionen Automatisk synkroniser fremtidige tabeller aktiveret. For mere information, se Google Lakehouse runtime katalog-spejling.

    Når du er færdig med at vælge valg, vælg Næste.

  5. På siden Anmeldelse og opret gennemgår du detaljerne og indsætter navnet på den spejlede katalogvare. Navnet skal være unikt i dit arbejdsområde. Vælg Opret.

  6. Et spejlet Google Lakehouse runtime-katalogelement oprettes. For hver tabel oprettes der også automatisk en tilsvarende genvej.

    • Navnerum, der ikke indeholder tabeller, vises ikke.
  7. Forhåndsvis data ved at vælge en tabel eller åbne SQL-analyse-endpointet. Åbn SQL Analytics-slutpunktselementet for at starte siden Stifinder og forespørgselseditor. Du kan forespørge dine spejlede tabeller med T-SQL i SQL Editor.

Opret søhusgenveje til det spejlede katalogelement

Du kan også lave genveje fra et lakehouse til dit spejlede Google Lakehouse runtime-katalogelement, så du kan bruge katalogdata med lakehouse-data og Spark-notebooks.

  1. Opret et lakehouse. Hvis du allerede har et søhus i dette arbejdsområde, kan du bruge det eksisterende.
    1. Vælg dit arbejdsområde i navigationsmenuen.
    2. Vælg + Nyt>søhus.
    3. Indtast et navn til dit søhus, og vælg derefter Create.
  2. I Explorer-visningen af dit søhus, i Hent data i menuen dit søhus , under Indlæs data i dit søhus, vælg Ny genvej.
  3. Vælg Microsoft OneLake. Vælg det spejlede Google Lakehouse runtime-katalogelement, som du har oprettet i de foregående trin, og vælg derefter Næste.
  4. Vælg tabeller i navnerummet, og vælg derefter Næste.
  5. Vælg Opret.
  6. Genvejene er nu tilgængelige i dit sommerhus ved søen. Du kan bruge notebooks og Spark til at behandle Google Lakehouse runtime-katalogdata sammen med dine andre lakehouse-data.