Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Kommentar
Azure Active Directory har bytt namn till Microsoft Entra ID. Läs mer
Importera data i Dynamics 365 Customer Insights - Data med ditt Azure Data Lake Storage-konto med Common Data Model-tabeller. Datainmatning kan göras fullständig eller vara inkrementell.
Förutsättningar
Azure Data Lake Storage-konton måste ha hierarkiskt namnutrymme aktiverat. Data måste lagras i ett hierarkiskt mappformat som definierar rotmappen och som har undermappar för varje tabell. Undermapparna kan innehålla mappar med fullständiga data eller inkrementella data.
Om du vill autentisera med ett Microsoft Entra-tjänsthuvudnamn måste det konfigureras i din klientorganisation. Mer information finns i Ansluta till ett Azure Data Lake Storage-konto med ett Microsoft Entra tjänsthuvudkonto.
Så här ansluter du till lagring som skyddas av brandväggar, Konfigurera Azure Private Link.
Om datasjön för närvarande har privata länkanslutningar till den måste Customer Insights – Data även ansluta med en privat länk, oavsett inställningen för nätverksåtkomst.
Det Azure Data Lake Storage-konto som du vill ansluta till och importera data från måste finnas i samma Azure-region som Dynamics 365 Customer Insights-miljön, och prenumerationerna måste finnas i samma klientorganisation. Anslutningar till en Common Data Model-mapp från en datasjö i en annan Azure-region stöds inte. För att känna till Azure-regionen i miljön, gå till Inställningar>System>Om i Customer Insights – Data.
Data som lagras i onlinetjänster kan lagras på en annan plats än där data bearbetas eller lagras. Genom att importera eller ansluta till data som lagras på en onlinetjänst, t.ex. godkänner du att data kan överföras. Läs mer i Microsoft Trust Center.
Tjänstens huvudnamn för Customer Insights – Data måste ha någon av följande roller för att få åtkomst till lagringskontot. Mer information finns i Bevilja behörigheter till tjänstens huvudnamn för åtkomst till lagringskontot.
- Storage Blob-dataläsare
- Ägare av Storage Blob-data
- Storage Blob-datamedverkande
När du ansluter till din Azure-lagring med alternativet Azure-prenumeration behöver användaren som konfigurerar datakällans anslutning åtminstone Storage Blob Data deltagarbehörigheterna på lagringskontot.
När du ansluter till din Azure-lagring med alternativet Azure-resurs behöver användaren som konfigurerar datakällans anslutning åtminstone behörighet för åtgärden Microsoft.Storage/storageAccounts/read på lagringskontot. En inbyggd Azure-roll som innehåller den här åtgärden är rollen Reader. För att begränsa åtkomsten till bara den nödvändiga åtgärden skapa en anpassad Azure-roll som endast inkluderar denna åtgärd.
För optimala prestanda bör storleken på en partition vara 1 GB eller mindre och antalet partitionsfiler i en mapp får inte överskrida 1000.
Data i din Data Lake Storage bör följa Common Data Model-standarden för lagring av data och ha Common Data Model-manifestet som representerar schemat för datafilerna (*.csv eller *.parquet). Manifestet måste innehålla information om tabellerna, t.ex. tabellkolumner och datatyper, samt datafilsplatsen och filtypen. Mer information om finns i Common Data Model manifest. Om manifestet inte finns kan administratörsanvändare med Storage Blob Data-ägare eller Storage Blob Data Contributor-åtkomst definiera schemat när data matas in.
Kommentar
Om något av fälten i .parquet-filerna har datatypen Int96 kanske data inte visas på sidan Tabeller . Vi rekommenderar att du använder standarddatatyper, som Unix-tidsstämpelformatet (som representerar tiden som antalet sekunder sedan 1 januari 1970, vid midnatt UTC).
Begränsningar
- Customer Insights – Data stöder inte kolumner av decimaltyp med mer precision än 16.
Ansluta till Azure Data Lake Storage
Namn på dataanslutningar, datasökvägar, till exempel mappar i en container, och tabellnamn måste använda namn som börjar med en bokstav. Namnet får bara innehålla bokstäver, siffror och understreck (_). Specialtecken stöds inte.
Gå till Data>Datakällor.
Välj Lägg till en datakälla.
Ange ett Datakällans namn och en valfri Beskrivning. Namnet refereras till i nedströmsprocesser och det är inte möjligt att ändra det efter att ha skapat datakällan.
Välj ett av följande alternativ för Anslut din lagring med hjälp av. Mer information finns i Ansluta till ett Azure Data Lake Storage-konto med ett Microsoft Entra tjänsthuvudkonto.
- Azure-resurs: Ange Resurs-ID.
- Azure-prenumeration: Välj prenumeration och sedan resursgruppen och lagringskontot.
Kommentar
Du behöver en av följande roller för behållaren för att skapa datakällan:
- Storage Blob Data-läsare räcker för att läsa från ett lagringskonto och mata in datan i Customer Insights – Data.
- Deltagare i eller ägare av Storage Blob Data krävs om du vill redigera manifestfilerna direkt i Customer Insights – Data.
Om du har en roll för lagringskontot har du samma roll på alla containrar i det.
Välj namnet på den behållare som innehåller data och schema (filen model.json eller manifest.json) om du vill importera data från.
Kommentar
Alla model.json eller manifest.json filer som är associerade med en annan datakälla i miljön visas inte i listan. Samma model.json- eller manifest.json-fil kan dock användas för datakällor i flera miljöer.
Om du vill hämta data från ett lagringskonto via en Azure Private Link väljer du Aktivera Private Link. Mer information finns i Private Links.
Om du vill skapa ett nytt schema går du till Skapa en ny schemafil.
Om du vill använda ett befintligt schema navigerar du till mappen som innehåller filen model.json eller manifest.cdm.json. Du kan söka i en katalog för att hitta filen.
Välj json-fil och välj Nästa. En lista över tillgängliga tabeller visas.
Välj vilka tabeller du vill inkludera.
Tips
Om du vill redigera en tabell i ett JSON-redigeringsgränssnitt väljer tabellen och sedan Redigera schemafil. Gör ändringar och välj Spara.
För valda tabeller som kräver inkrementell inhämtning visas Obligatoriskt under Inkrementell uppdatering. För var och en av dessa tabeller se Konfigurera en inkrementell uppdatering för Azure Data Lake datakällor.
För valda tabeller där en primärnyckel inte har definierats visas Obligatoriskt under Primär nyckel. För var och en av dessa tabeller:
- Välj Obligatorisk. Panelen Redigera tabell visas.
- Välj primärnyckel. Den primära nyckeln är ett attribut som är unikt för tabellen. För att ett attribut ska vara en giltig primär nyckel bör det inte innehålla dubblettvärden, saknade värden och null-värden. Sträng-, heltals- och GUID-datatypattribut stöds som primärnycklar.
- Alternativt kan du ändra partitionsmönstret.
- Välj Stäng när du vill spara och stänga panelen.
Välj antalet kolumner för varje inkluderad tabell. Sidan Hantera attribut visas.
- Skapa nya kolumner, redigera eller ta bort befintliga kolumner. Du kan ändra namn, dataformat eller lägga till en semantiktyp.
- Om du vill aktivera analyser och andra funktioner väljer du Dataprofilering för hela tabellen eller för specifika kolumner. Som standard är ingen tabell aktiverad för dataprofilering.
- Välj Klart.
Välj Spara. Sidan Datakällor öppnas där den nya datakälla visas i status uppdateras.
Tips
Välj en status för att öppna fönstret Framstegsdetaljer , där du kan se uppgiftens framsteg eller välja Avbryt jobbet för att stoppa jobbet.
Det kan ta lång tid att läsa in data. Efter en lyckad uppdatering kan hämtade data granskas från sidan tabeller.
Skapa en ny schemafil
Välj Skapa schemafil.
Ange ett namn för filen och välj Spara.
Välj Ny tabell. Panelen Ny tabell visas.
Ange tabellens namn och välj Datafilers sökväg.
- Flera .csv eller .parquet filer: Bläddra till rotmappen, välj mönstertyp och ange uttrycket.
- Enskilda .csv eller .parquet filer: Bläddra till .csv- eller .parquet-filen och välj den.
Välj Spara.
Välj definiera attributen och lägg till attributen manuellt, eller välj generera dem automatiskt. Ange ett namn, välj dataformat och valfri typ av attribut om du vill definiera attributen. För automatiskt genererade attribut:
När attributen har skapats automatiskt väljer du Granska attribut. Sidan Hantera attribut visas.
Kontrollera att dataformatet är korrekt för varje attribut.
Om du vill aktivera analyser och andra funktioner väljer du Dataprofilering för hela tabellen eller för specifika kolumner. Som standard är ingen tabell aktiverad för dataprofilering.
Välj Klart. Sidan Välj tabeller visas.
Fortsätt att lägga till tabeller och kolumner om tillämpligt.
När alla tabeller har lagts till väljer du Inkludera för att inkludera tabellerna i datakällans inmatning.
För valda tabeller som kräver inkrementell inhämtning visas Obligatoriskt under Inkrementell uppdatering. För var och en av dessa tabeller se Konfigurera en inkrementell uppdatering för Azure Data Lake datakällor.
För valda tabeller där en primärnyckel inte har definierats visas Obligatoriskt under Primär nyckel. För var och en av dessa tabeller:
- Välj Obligatorisk. Panelen Redigera tabell visas.
- Välj primärnyckel. Den primära nyckeln är ett attribut som är unikt för tabellen. För att ett attribut ska vara en giltig primär nyckel bör det inte innehålla dubblettvärden, saknade värden och null-värden. Sträng-, heltals- och GUID-datatypattribut stöds som primärnycklar.
- Alternativt kan du ändra partitionsmönstret.
- Välj Stäng när du vill spara och stänga panelen.
Välj Spara. Sidan Datakällor öppnas där den nya datakälla visas i status uppdateras.
Det kan ta lång tid att läsa in data. Efter en lyckad uppdatering kan hämtade data granskas från sidan Data>Tabeller.
Redigera en Azure Data Lake Storage datakälla
Du kan uppdatera alternativet Anslut till ett lagringskonto med. Mer information finns i Ansluta till ett Azure Data Lake Storage-konto med ett Microsoft Entra tjänsthuvudkonto. Om du vill ansluta till en annan behållare från lagringskontot eller ändra kontonamnet måste du skapa en ny datakällaanslutning.
Gå till Data>Datakällor. Välj bredvid datakällan du vill uppdatera Redigera.
Ändra någon av följande information:
Description
Anslut ditt lagringsutrymme med och information om anslutningen. Du kan inte ändra informationen Behållare när anslutningen uppdateras.
Kommentar
En av följande roller måste tilldelas till lagringskontot eller -behållare:
- Storage Blob-dataläsare
- Ägare av Storage Blob-data
- Storage Blob-datamedverkande
Aktivera Private Link Om du vill hämta data från ett lagringskonto via en Azure Private Link. Mer information finns i Private Links.
Klicka på Nästa.
Ändra någon av följande information:
Gå till en annan model.json- eller manifest.json-fil med en annan uppsättning tabeller från behållaren.
Om du vill lägga till fler tabeller att mata in väljer du Ny tabell.
Om du vill ta bort alla markerade tabeller som redan finns utan beroende markerar du tabellen och Ta bort.
Viktigt!
Om det finns beroenden för den befintliga model.json- eller manifest.json-filen och uppsättningen tabeller visas ett felmeddelande och kan inte välja en annan model.json eller manifest.json fil. Ta bort dessa beroenden innan du ändrar filen model.json eller manifest.json, eller skapa en ny datakälla med den model.json- eller manifest.json-fil som du vill använda för att undvika att ta bort beroendena.
Om du vill ändra platsen för datafilen eller den primära nyckeln väljer du Redigera.
Om du vill ändra data för inkrementellt intag läser du Konfigurera en inkrementell uppdatering för Azure Data Lake-datakällor.
Ändra endast tabellnamnet så att det matchar tabellnamnet i .json-filen.
Kommentar
Behåll alltid tabellnamnet på samma sätt som tabellnamnet i filen model.json eller manifest.json efter inmatning. Customer Insights – Data verifierar alla tabellnamn med model.json eller manifest.json vid varje systemuppdatering. Om ett tabellnamn ändras uppstår ett fel eftersom Customer Insights – Data inte kan hitta det nya tabellnamnet i .json-filen. Om ett inmatat tabellnamn ändrades av misstag, redigera tabellnamnet så att det matchar namnet i .json-filen.
Välj kolumner om du vill lägga till eller ändra dem eller för att aktivera dataprofilering. Välj sedan Klar.
Klicka på Spara om du vill tillämpa ändringarna och återgå till sidan Datakällor.
Uppdatera en datakälla när schemat ändras
Om schemat för källdata ändras när datakällan har skapats visas ett felmatchningsfel i schemat eller ett felmatchningsfel för data som ber dig att uppdatera datakällans anslutning. Felet "Kolumnerna i källdata har ändrats" visas i aktivitetsinformationen. Schemaändringar omfattar uppdateringar av kolumner, kolumnnamn och kolumndatatyper.
Gå till Data>Datakällor. Välj Redigera bredvid datakällan med felen. Välj sedan Nästa.
Välj den tabell som innehåller fel.
Välj Generera attributen automatiskt och bekräfta.
När attributgenereringen är klar väljer du Klar.
Välj Inkludera i tabellen och välj sedan Spara för att tillämpa ändringarna och återgå till sidan Datakällor .
Förhindra fragmentering av partitioner vid inläsning i Data Lake
Det är möjligt att din datasjöpartitioneringsstrategi kan skapa hundratusentals små partitioner, till exempel en ny partition för varje entitet varje timme. Följ dessa metodtips för att undvika partitionsfragmentering:
- Undvik överpartitionering: Partitionering bör baseras på kolumner med låg kardinalitet, till exempel datum eller region, i stället för fält med hög kardinalitet som entitets-ID eller timme.
- Måloptimala filstorlekar: För att minska kostnaderna för att öppna och stänga många små filer och förbättra läsprestanda bör du sikta på partitionsfiler mellan 16 MB och 1 GB.
- Använd Delta Lake, som tillhandahåller funktioner för automatisk optimering: Delta Lake stöder autokompaction och optimerar skrivfunktioner som automatiskt hanterar filstorlekar och partitionslayout. På Databricks Runtime 11.3 och senare justerar Delta Lake filstorlekar och partitioner automatiskt i bakgrunden.
- Utvärdera partitioneringsstrategin med jämna mellanrum: Allt eftersom datavolym- och åtkomstmönster utvecklas bör även partitioneringsstrategin göra det. Använd verktyg som data som hoppar över statistik och frågeprofilering för att vägleda justeringar.
Hundratusentals små partitioner kan orsaka följande symptom:
- Prestandaförsämring vid datainmatning och frågekörning.
- Ökade metadatakostnader och svarstider.
- Högre driftskostnader på grund av ineffektiv lagrings- och beräkningsanvändning.
- Fel när antalet partitioner överskrider en tjänsts begränsningar.
- Fel på grund av slut på minne när systemet försöker skapa en graf för varje partition.