Get data from Azure Storage

I denne artikel lærer du, hvordan du henter data fra Azure Storage (Azure Data Lake Storage Gen2-containere, blob-containere eller individuelle blobs) til en tabel i en KQL-database. Du kan indlæse data kontinuerligt eller som en engangsindtagelse. Når indlæsningen er fuldført, er dataene tilgængelige for forespørgsel.

  • Kontinuerlig indlæsning (forhåndsvisning): Kontinuerlig indlæsning opsætter en indlæsningspipeline, der tillader et eventhouse at lytte til Azure Storage-begivenheder. Pipelinen giver hændelseshuset besked om at hente oplysninger, når der forekommer hændelser, der abonneres på. Hændelserne er BlobCreated og BlobRenamed.

  • One-time ingestion: Brug denne metode til at hente data fra Azure Storage som en engangsoperation.

    Note

Prerequisites

Forudsætninger for kontinuerlig indtagelse

I Azure:

  • Registrer Event Grid-ressourceudbyderen med dit Azure-abonnement.
  • Tildel rollen Lager-blob-datalæser tilladelser til arbejdsområdets identitet.
  • Opret en blob-objektbeholder til at indeholde datafilerne.
    • Overfør en datafil. Datafilstrukturen bruges til at definere tabelskemaet. Du kan få flere oplysninger under Dataformater, der understøttes af Real-Time Intelligence-.

      Note

      Du skal uploade en datafil:

      • Før konfigurationen for at definere tabelskemaet under konfigurationen.
      • Efter konfigurationen for at udløse den fortløbende indtagelse, for at få vist data og for at bekræfte forbindelsen.

      Note

      Kontinuerlig indlæsning fra Azure Storage understøttes også, når lagringskontoen er konfigureret med private endepunkter (Private Link). Sørg for, at Fabric-arbejdsområdet kan få adgang til lagringskontoen via den konfigurerede private netværkssti.

Føj identitetsrolletildelingen for arbejdsområdet til lagerkontoen

  1. Fra Workspace-indstillingerne i Fabric kopierer du dit workspace-identitets-ID.

    Skærmbillede af indstillingen for arbejdsområdet med arbejdsområde-id'et fremhævet.

  2. I Azure-portalen skal du gå til din Azure Storage-konto og vælge adgangskontrol (IAM)>Add>Tilføj rolletildeling.

  3. Vælg Lagerblobdatalæser.

  4. I dialogboksen Tilføj rolletildeling skal du vælge + Vælg medlemmer.

  5. Indsæt identitets-id'et for arbejdsområdet, vælg programmet, og vælg> derefterGennemse + tildel.

Opret en blob-container og upload en datafil

  1. Vælg Containere på lagerkontoen.

  2. Vælg + Container, indtast et navn for containeren, og vælg Gem.

  3. Angiv containeren, vælg upload, og upload den datafil, der er forberedt tidligere.

    Du kan finde flere oplysninger under Understøttede formater og understøttede komprimeringer.

  4. Fra genvejsmenuen skal du vælge [...], vælge Containeregenskaber og kopiere URL'en til input under konfigurationen.

    Skærmbillede af containerlisten med kontekstmenuen åben og muligheden Container-egenskaber markeret.

Vælg Azure Storage som datakilde

Åbn Get Data-flowet og vælg Azure Storage som kildekoden.

  1. Fra din arbejdsplads åbner du eventhouse, og vælger databasen.

  2. På båndet KQL-database skal du vælge Hent data.

  3. Vælg datakilden på den tilgængelige liste. I dette eksempel indlæser du data fra Azure Storage.

    Skærmbillede af hent datafliserne med muligheden Azure lagring fremhævet.

Configure

  1. Vælg en destinationstabel. For at indlæse data i en ny tabel, vælg + Ny tabel og indtast et tabelnavn.

    Note

    Tabelnavne kan være op til 1.024 tegn, inklusive mellemrum, alfanumeriske tegn, bindestreg og understregninger. Specialtegn understøttes ikke.

  2. I Configure Azure Blob Storage-forbindelsen skal du sikre, at Continuous Ingestion er slået til. Den er som standard slået til.

  3. Konfigurér forbindelsen ved at oprette en ny forbindelse eller ved at bruge en eksisterende forbindelse.

    Sådan opretter du en ny forbindelse:

    1. Vælg Opret forbindelse til en lagerkonto.

      Skærmbillede af fanen Konfigurer med fortløbende indtagelse, og opret forbindelse til en konto valgt.

    2. Brug følgende beskrivelser som en hjælp til at udfylde felterne.

      Setting Beskrivelse af feltet
      Subscription Abonnementet på lagerkontoen.
      Blob Storage-konto Navn på lagerkonto.
      Container Den lagerobjektbeholder, der indeholder den fil, du vil indtage.
    3. I feltet Forbindelse , åbn dropdown-menuen og vælg + Ny forbindelse, og vælg derefter Gem>Luk. Forbindelsesindstillingerne er udfyldt på forhånd.

    Note

    Når du opretter en ny forbindelse, opretter du også en ny eventstream. Navnet defineres som <storage_account_name>_eventstream. Fjern ikke den kontinuerlige indlæsnings-eventstream fra arbejdsområdet.

    Sådan bruger du en eksisterende forbindelse:

    1. Vælg Vælg en eksisterende lagerkonto.

      Skærmbillede af fanen Konfigurer med fortløbende indtagelse, og opret forbindelse til en eksisterende konto valgt.

    2. Brug følgende beskrivelser som en hjælp til at udfylde felterne.

      Setting Beskrivelse af feltet
      RTAStorageAccount En eventstream forbundet til din lagringskonto fra Fabric.
      Container Den lagerobjektbeholder, der indeholder den fil, du vil indtage.
      Connection Dette felt er forudfyldt med forbindelsesstreng.
    3. I feltet Connection åbn du dropdown-menuen og vælg den eksisterende forbindelsesstreng fra listen. Vælg derefter Gem>Luk.

  4. Du kan også udvide Filfiltre og angive følgende filtre:

    Setting Beskrivelse af feltet
    Sti til mappe Filtrer data for at indlæse filer med en specifik mappesti.
    Filtypenavn Filtrer data til kun at indlæse filer med en specifik filendelse.
  5. I afsnittet Eventstream-indstillinger skal du vælge de begivenheder, der skal overvåges i Avancerede indstillinger>.Hændelsestyper. Som standard er Blob oprettet valgt. Du kan også vælge Blob omdøbt.

    Skærmbillede af avancerede indstillinger med udvidet dropdown for hændelsestyper.

  6. Vælg Næste for at få vist dataene.

Inspektér forhåndsvisningsdata før indtagelse

Fanen Undersøg åbnes med en forhåndsvisning af dataene.

Hvis du vil fuldføre indtagelseprocessen, skal du vælge Udfør.

Skærmbillede af fanen Inspektér, der viser en forhåndsvisning af indlæste data, før du vælger Færdig.

Note

For at udløse kontinuerlig indlæsning og forhåndsvisningsdata, upload en ny blob, efter du har gennemført konfigurationen.

Optionally:

  • Brug rullelisten med skemadefinitionsfilen til at ændre den fil, som skemaet udledes fra.

  • Brug rullelisten Filtype til at udforske Avancerede indstillinger baseret på datatype.

  • Brug rullemenuen Table_mapping til at definere en ny tilknytning.

  • Vælg </> for at åbne kommandofremviseren for at få vist og kopiere de automatiske kommandoer, der genereres fra dine input. Du kan også åbne kommandoerne i et KQL-forespørgselssæt.

  • Vælg blyantikonet for at redigere kolonner.

Rediger kolonner

Note

  • I forbindelse med tabelformater (CSV, TSV, PSV) kan du ikke tilknytte en kolonne to gange. Hvis du vil knytte til en eksisterende kolonne, skal du først slette den nye kolonne.
  • Du kan ikke ændre en eksisterende kolonnetype. Hvis du forsøger at knytte til en kolonne med et andet format, kan du ende med at have tomme kolonner.

De ændringer, du kan foretage i en tabel, afhænger af følgende parametre:

  • Tabeltypen er ny eller eksisterende
  • Tilknytningstypen er ny eller eksisterende
Tabeltype Tilknytningstype Tilgængelige justeringer
Ny tabel Ny kortlægning Omdøb kolonne, skift datatype, skift datakilde, tilknytningstransformation, tilføj kolonne, slet kolonne
Eksisterende tabel Ny kortlægning Tilføj kolonne (hvor du derefter kan ændre datatype, omdøbe og opdatere)
Eksisterende tabel Eksisterende kortlægning none

Skærmbillede af kolonneeditoren med tabellkolonner åbne til redigering af navne, datatyper og kortlægninger.

Kortlægning af transformationer

Nogle tilknytninger af dataformater (Parquet, JSON og Avro) understøtter enkle transformationer af indfødningstid. Hvis du vil anvende tilknytningstransformationer, skal du oprette eller opdatere en kolonne i vinduet Rediger kolonner .

Tilknytningstransformationer kan udføres på en kolonne af typen streng eller datetime, hvor kilden har datatypen int eller long. Du kan finde flere oplysninger på den komplette liste over understøttede tilknytningstransformationer.

Avancerede indstillinger baseret på datatype

tabel (CSV, TSV, PSV):

  • Hvis du indtager tabelformater i en eksisterende tabel, kan du vælge Avanceret>tabelskema. Tabeldata indeholder ikke nødvendigvis de kolonnenavne, der bruges til at knytte kildedata til de eksisterende kolonner. Når denne indstilling er markeret, udføres tilknytningen efter rækkefølge, og tabelskemaet forbliver det samme. Hvis denne indstilling ikke er markeret, oprettes der nye kolonner til indgående data, uanset datastruktur.

    Skærmbillede af avancerede indstillinger.

  • Tabeldata indeholder ikke nødvendigvis de kolonnenavne, der bruges til at knytte kildedata til de eksisterende kolonner. Hvis du vil bruge den første række som kolonnenavne, skal du vælge Første række er kolonneoverskrift.

    Skærmbillede af den første række er kolonneoverskriftsparameteren.

tabel (CSV, TSV, PSV):

  • Hvis du importerer tabelformater i en eksisterende tabel, vælg Table_mapping>Brug eksisterende skema. Tabeldata indeholder ikke nødvendigvis de kolonnenavne, der bruges til at knytte kildedata til de eksisterende kolonner. Når du vælger denne mulighed, foregår kortlægningen i rækkefølge, og tabelskemaet forbliver det samme. Hvis du fjerner denne mulighed, oprettes der nye kolonner for indkommende data, uanset datastruktur.

  • Hvis du vil bruge den første række som kolonnenavne, skal du vælge Første rækkeoverskrift.

    Skærmbillede af avancerede CSV-indstillinger, inklusive kontrol for indstillinger for første række i header og afgrænser.

JSON:

  • Hvis du vil bestemme kolonneopdelingen af JSON-data, skal du vælge Indlejrede niveauer fra 1 til 100.

    Skærmbillede af avancerede JSON-muligheder, inklusive indstillingen Nested levels, der bruges til at splitte JSON-kolonner.

Gennemgå indtagelsesoversigten

I Oversigtsvinduet viser alle trin grønne flueben, når dataindlæsningen er færdig med succes. Du kan vælge et kort for at udforske dataene, slette de indtagne data eller oprette et dashboard med vigtige målepunkter.

Skærmbillede af oversigtssiden for fortløbende indtagelse, hvor en vellykket indtagelse er fuldført.

Når du lukker vinduet, kan du se forbindelsen under fanen Stifinder under Datastrømme. Herfra kan du filtrere datastreams og slette en datastream.

Skærmbillede af KQL-databaseoversigten med datastrømme fremhævet.