Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Per spostare le definizioni di processi Spark (SJD) da Azure Synapse a Fabric, sono disponibili due opzioni:
- Opzione 1: è possibile usare Migration Assistant per eseguire la migrazione di notebook da Azure Synapse a Fabric usando un'esperienza più guidata e semplificata.
- Opzione 2: creare manualmente la definizione di un processo Spark in Fabric.
- Opzione 3: è possibile usare uno script per esportare le definizioni dei processi Spark da Azure Synapse e importarle in Fabric usando l'API.
Per informazioni sulle considerazioni relative alla definizione di processi Spark, vedere differenze tra Azure Synapse Spark e Fabric.
Prerequisiti
Se non ne hai già uno, crea un workspace Fabric nel tuo tenant.
Opzione 1: Usare Assistente migrazione
È possibile usare l'assistente migration per la migrazione da Azure Synapse a Fabric. È progettato per offrire un'esperienza guidata e semplificata per la migrazione di notebook e risorse correlate.
Opzione 2: Creare manualmente la definizione del processo Spark
Per esportare una definizione di un processo Spark da Azure Synapse:
- Aprire Synapse Studio: accedere ad Azure. Passare all'area di lavoro di Azure Synapse e aprire Synapse Studio.
- Individuare il processo Spark Python/Scala/R: trovare e identificare la definizione processo Spark Python/Scala/R di cui eseguire la migrazione.
-
Esporta la configurazione della definizione del processo:
- In Synapse Studio, aprire la definizione di processo Spark.
- Esportare o annotare le impostazioni di configurazione, inclusi percorso del file di script, dipendenze, parametri e altri dettagli pertinenti.
Per creare una nuova definizione di processo Spark (SJD) in base alle informazioni della SJD esportata in Fabric:
- Accedi all'area di lavoro di Fabric: Accedi a Fabric e al tuo spazio di lavoro.
-
Creare una nuova definizione di processo Spark in Fabric:
- In Fabric, vai alla home page di Ingegneria dei dati.
- Selezionare Definizione del processo Spark.
- Configura il processo in base alle informazioni esportate da Synapse, inclusi il percorso dello script, le dipendenze, i parametri e le impostazioni del cluster.
- Adattare e testare: apportare gli adattamenti necessari allo script o alla configurazione in base all'ambiente Fabric. Testare il processo in Fabric per assicurarsi che venga eseguito correttamente.
Dopo aver creato la definizione del processo Spark, convalidare le dipendenze:
- Assicurarsi di usare la stessa versione di Spark.
- Convalidare l'esistenza del file di definizione principale.
- Convalidare l'esistenza dei file, delle dipendenze e delle risorse a cui si fa riferimento.
- Servizi collegati, connessioni alle origini dati e punti di montaggio.
Altre informazioni su come creare una definizione di processo Apache Spark in Fabric.
Opzione 3: Usare l'API Fabric
Seguire questi passaggi chiave per la migrazione:
- Prerequisiti.
- Passaggio 1: Esporta la definizione del processo Spark da Azure Synapse a OneLake (.json).
- Passaggio 2: importare automaticamente la definizione del processo Spark in Fabric usando l'API di Fabric.
Prerequisiti
I prerequisiti comprendono le operazioni da considerare prima di avviare la migrazione delle definizioni di processi Spark a Fabric.
- Un’area di lavoro Fabric.
- Se non ne hai già uno, creare un Fabric lakehouse nell'area di lavoro.
Passaggio 1: Esportare la definizione del processo Spark dall'area di lavoro di Azure Synapse
Il passaggio 1 si concentra sull'esportazione della definizione del processo Spark dall'area di lavoro di Azure Synapse a OneLake in formato JSON. Questo processo avviene come indicato di seguito:
- 1.1) Importare il notebook di migrazione SJD nell'area di lavoro di Fabric. Questo notebook esporta tutte le definizioni dei processi Spark da una specifica area di lavoro di Azure Synapse a una directory intermedia in OneLake. L'API Synapse viene usata per esportare SJD.
- 1.2) Configurare i parametri nel primo comando per esportare la definizione del processo Spark in un archivio intermedio (OneLake). Ciò esporta solo il file di metadati JSON. Il frammento di codice seguente viene usato per configurare i parametri di origine e destinazione. Assicurarsi di sostituirli con i propri valori.
# Azure config
azure_client_id = "<client_id>"
azure_tenant_id = "<tenant_id>"
azure_client_secret = "<client_secret>"
# Azure Synapse workspace config
synapse_workspace_name = "<synapse_workspace_name>"
# Fabric config
workspace_id = "<workspace_id>"
lakehouse_id = "<lakehouse_id>"
export_folder_name = f"export/{synapse_workspace_name}"
prefix = "" # this prefix is used during import {prefix}{sjd_name}
output_folder = f"abfss://{workspace_id}@onelake.dfs.fabric.microsoft.com/{lakehouse_id}/Files/{export_folder_name}"
- 1.3) Eseguire le prime due celle del notebook di esportazione/importazione per esportare in OneLake i metadati della definizione del processo Spark. Una volta completate le celle, viene creata questa struttura di cartelle nella directory di output intermedia.
Passaggio 2: Importare la definizione del processo Spark in Fabric
Nel passaggio 2, le definizioni dei processi Spark vengono importate dall'archiviazione intermedia nell'area di lavoro di Fabric. Questo processo avviene come indicato di seguito:
- 2.1) Convalida le configurazioni al punto 1.2 per assicurarti che siano specificati l’area di lavoro e il prefisso corretti per importare le definizioni dei processi Spark.
- 2.2) Esegui la terza cella del notebook di esportazione/importazione per importare tutte le definizioni dei processi Spark dal percorso intermedio.
Nota
L'opzione di esportazione restituisce un file di metadati JSON. Assicurarsi che i file eseguibili della definizione del processo Spark, i file di riferimento e gli argomenti siano accessibili da Fabric.