Get data from Azure Storage

I denne artikkelen lærer du hvordan du henter data fra Azure Storage (Azure Data Lake Storage Gen2-containere, blob-containere eller individuelle blobs) til en tabell i en KQL-database. Du kan ta inn data kontinuerlig eller som en engangsinntak. Etter at inntaket er fullført, er dataene tilgjengelige for spørring.

  • Kontinuerlig inntasting (forhåndsvisning): Kontinuerlig inntasting setter opp en inntastingspipeline som lar et eventhouse lytte til Azure Storage-hendelser. Datasamlebåndet varsler hendelseshuset om å hente informasjon når det oppstår abonnementshendelser. Hendelsene er BlobCreated og BlobRenamed.

  • Engangsinntak: Bruk denne metoden for å hente data fra Azure Storage som en engangsoperasjon.

    Note

Prerequisites

Forutsetninger for kontinuerlig inntak

I Azure:

  • Registrer Event Grid-ressursleverandøren med ditt Azure-abonnement.
  • Tilordne rolletillatelser for dataleser for lagringsblob til arbeidsområdeidentiteten.
  • Lag en blob-container for å holde datafilene.
    • Last opp en datafil. Datafilstrukturen brukes til å definere tabellskjemaet. Hvis du vil ha mer informasjon, kan du se Dataformater som støttes av Real-Time Intelligence.

      Note

      Du må laste opp en datafil:

      • Før konfigurasjonen for å definere tabellskjemaet under oppsettet.
      • Etter konfigurasjonen for å utløse kontinuerlig inntak, for å forhåndsvise data og bekrefte tilkoblingen.

      Note

      Kontinuerlig inntasting fra Azure Storage støttes også når lagringskontoen er konfigurert med private endepunkter (Private Link). Sørg for at Fabric-arbeidsområdet kan få tilgang til lagringskontoen via den konfigurerte private nettverksstien.

Legge til rolletilordningen for arbeidsområdeidentitet i lagringskontoen

  1. Fra Workspace-innstillingene i Fabric, kopier arbeidsområdets identitets-ID.

    Skjermbilde av innstillingen for arbeidsområdet, der arbeidsområde-ID-en er uthevet.

  2. I Azure-portalen, bla til din Azure Storage-konto, og velg tilgangskontroll (IAM)>Legg til>Legg til rolletildeling.

  3. Velg Dataleser for lagringsblob.

  4. Velg + Velg medlemmer i dialogboksen Legg til rolletilordning.

  5. Lim inn arbeidsområdets identitets-ID, velg applikasjonen, og velg>deretter Gjennomgang + tilordne.

Lag en blob-beholder og last opp en datafil

  1. Velg Containere i lagringskontoen.

  2. Velg + Beholder, skriv inn et navn på beholderen, og velg Lagre.

  3. Gå inn i beholderen, velg opplasting, og last opp datafilen som var forberedt tidligere.

    For mer informasjon, se støttede formater og støttede komprimeringer.

  4. Fra kontekstmenyen, [...], velg Container-egenskaper, og kopier URL-en til inntasting under konfigurasjonen.

    Skjermbilde av containerlisten med kontekstmenyen åpen og alternativet Container-egenskaper markert.

Select Azure Storage som datakilde

Åpne Get Data-flyten og velg Azure Storage som kilde.

  1. Fra arbeidsområdet ditt, åpne eventhuset og velg databasen.

  2. På KQL-databasebåndet, velg Get Data.

  3. Velg datakilden fra den tilgjengelige listen. I dette eksempelet importerer du data fra Azure Storage.

    Skjermbilde av hent data-flisene med Azure lagringsalternativet markert.

Configure

  1. Velg en måltabell. For å legge inn data i en ny tabell, velg + Ny tabell og skriv inn et tabellnavn.

    Note

    Tabellnavn kan være opptil 1 024 tegn, inkludert mellomrom, alfanumeriske tegn, bindestreker og understreker. Spesialtegn støttes ikke.

  2. I Configure Azure Blob Storage-tilkoblingen, sørg for at kontinuerlig inntasting er aktivert. Den er aktivert som standard.

  3. Konfigurer tilkoblingen ved å opprette en ny tilkobling eller ved å bruke en eksisterende tilkobling.

    Slik oppretter du en ny tilkobling:

    1. Velg Koble til en lagringskonto.

      Skjermbilde av konfigurer-fanen med Kontinuerlig inntak og koble til en valgt konto.

    2. Bruk følgende beskrivelser til å fylle ut feltene.

      Setting Feltbeskrivelse
      Subscription Abonnementet på lagringskontoen.
      Blob-lagringskonto Navn på lagringskonto.
      Container Lagringsbeholderen som inneholder filen du vil innta.
    3. I Tilkoblingsfeltet, åpne nedtrekksmenyen og velg + Ny tilkobling, og velg deretter Lagre>Lukk. Tilkoblingsinnstillingene er forhåndsutfyllet.

    Note

    Når du oppretter en ny tilkobling, oppretter du også en ny hendelsesstrøm. Navnet defineres som <storage_account_name>_eventstream. Ikke fjern den kontinuerlige inntastingshendelsesstrømmen fra arbeidsområdet.

    Slik bruker du en eksisterende tilkobling:

    1. Velg Velg en eksisterende lagringskonto.

      Skjermbilde av konfigurer-fanen med Kontinuerlig inntak og koble til en eksisterende konto valgt.

    2. Bruk følgende beskrivelser til å fylle ut feltene.

      Setting Feltbeskrivelse
      RTAStorageAccount En hendelsesstrøm koblet til lagringskontoen din fra Fabric.
      Container Lagringsbeholderen som inneholder filen du vil innta.
      Connection Dette feltet er forhåndsfylt med tilkoblingsstreng.
    3. I feltet Connection åpner du nedtrekksmenyen og velger den eksisterende tilkoblingsstreng fra listen. Velg deretter Save>Close.

  4. Eventuelt kan du utvide Filfiltre og spesifisere følgende filtre:

    Setting Feltbeskrivelse
    Mappebane Filtrer data for å ta inn filer med en spesifikk mappesti.
    Filtype Filtrer data slik at de kun importerer filer med en spesifikk filendelse.
  5. I Eventstream-innstillingsseksjonen velger du hendelsene som skal overvåkes i Avanserte innstillinger>Hendelsestyper. Som standard er Blob opprettet valgt. Du kan også velge Blob omdøpt.

    Skjermbilde av avanserte innstillinger med utvidet nedtrekksmeny for hendelsestyper.

  6. Velg Neste for å forhåndsvise dataene.

Inspekter forhåndsvisningsdata før inntak

Inspektør-fanen åpnes med en forhåndsvisning av dataene.

Hvis du vil fullføre inntaksprosessen, velger du Fullfør.

Skjermbilde av fanen Inspiser som viser en forhåndsvisning av innspilte data før du velger Fullfør.

Note

For å utløse kontinuerlig inntasting og forhåndsvisningsdata, last opp en ny blob etter at du har fullført konfigurasjonen.

Optionally:

  • Bruk rullegardinlisten for skjemadefinisjonsfilen til å endre filen som skjemaet er utledet fra.

  • Bruk rullegardinlisten for filtype til å utforske avanserte alternativer basert på datatype.

  • Bruk nedtrekksmenyen Table_mapping for å definere en ny kartlegging.

  • Velg </> for å åpne kommandovisningsprogrammet for å vise og kopiere de automatiske kommandoene som genereres fra inndataene. Du kan også åpne kommandoene i et KQL-spørringssett.

  • Velg blyantikonet for å redigere kolonner.

Rediger kolonner

Note

  • For tabellformater (CSV, TSV, PSV) kan du ikke tilordne en kolonne to ganger. Hvis du vil tilordne til en eksisterende kolonne, må du først slette den nye kolonnen.
  • Du kan ikke endre en eksisterende kolonnetype. Hvis du prøver å tilordne til en kolonne med et annet format, kan du ende opp med tomme kolonner.

Endringene du kan gjøre i en tabell, avhenger av følgende parametere:

  • Tabelltype er ny eller eksisterende
  • Tilordningstype er ny eller eksisterende
Tabelltype Tilordningstype Tilgjengelige justeringer
Ny tabell Ny tilordning Gi nytt navn til kolonne, endre datatype, endre datakilde, tilordningstransformasjon, legge til kolonne, slette kolonne
Eksisterende tabell Ny tilordning Legg til kolonne (der du deretter kan endre datatype, gi nytt navn til og oppdatere)
Eksisterende tabell Eksisterende tilordning none

Skjermbilde av kolonneeditoren med tabellkolonner åpne for redigering av navn, datatyper og kartlegginger.

Tilordningstransformasjoner

Noen dataformattilordninger (Parquet, JSON og Avro) støtter enkle inntakstidstransformasjoner. Hvis du vil bruke tilordningstransformasjoner, oppretter eller oppdaterer du en kolonne i vinduet Rediger kolonner.

Tilordningstransformasjoner kan utføres på en kolonne av typen streng eller datetime, der kilden har datatypeint eller lang. Hvis du vil ha mer informasjon, kan du se den fullstendige listen over støttede tilordningstransformasjoner.

Avanserte alternativer basert på datatype

tabell (CSV, TSV, PSV):

  • Hvis du inntar tabellformater i en eksisterende tabell, kan du velge Avansert>behold tabellskjema. Tabelldata inneholder ikke nødvendigvis kolonnenavnene som brukes til å tilordne kildedata til de eksisterende kolonnene. Når dette alternativet er merket av, utføres tilordningen etter rekkefølge, og tabellskjemaet forblir det samme. Hvis dette alternativet ikke er avmerket, opprettes nye kolonner for innkommende data, uavhengig av datastruktur.

    Skjermbilde av avanserte alternativer.

  • Tabelldata inneholder ikke nødvendigvis kolonnenavnene som brukes til å tilordne kildedata til de eksisterende kolonnene. Hvis du vil bruke den første raden som kolonnenavn, velger du Første rad er kolonneoverskrift.

    Skjermbilde av første rad er kolonneoverskriftsbryter.

tabell (CSV, TSV, PSV):

  • Hvis du importerer tabellformat i en eksisterende tabell, velg Table_mapping>Bruk eksisterende skjema. Tabelldata inneholder ikke nødvendigvis kolonnenavnene som brukes til å tilordne kildedata til de eksisterende kolonnene. Når du velger dette alternativet, gjøres kartleggingen i rekkefølge, og tabellskjemaet forblir det samme. Hvis du fjerner dette alternativet, opprettes nye kolonner for innkommende data, uavhengig av datastruktur.

  • Hvis du vil bruke den første raden som kolonnenavn, velger du Første radoverskrift.

    Skjermbilde av avanserte CSV-innstillinger, inkludert kontroller for innstillinger for første rads header og avgrenser.

JSON:

  • For å bestemme kolonneinndeling av JSON-data, velg Nested levels, fra 1 til 100.

    Skjermbilde av avanserte JSON-alternativer, inkludert innstillingen Nested levels som brukes til å dele JSON-kolonner.

Gå gjennom inntakssammendraget

I Oppsummeringsvinduet viser alle stegene grønne haketegn når datainnsamlingen fullføres. Du kan velge et kort for å utforske dataene, slette de inntatte dataene eller opprette et instrumentbord med viktige måledata.

Skjermbilde av sammendragssiden for kontinuerlig inntak med vellykket inntak fullført.

Når du lukker vinduet, kan du se tilkoblingen i Utforsker-fanen, under Datastrømmer. Herfra kan du filtrere datastrømmene og slette en datastrøm.

Skjermbilde av KQL-databaseutforskeren med datastrømmer uthevet.