Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Note
Le opzioni relative ai dati in fase temporanea descritte in questo articolo sono attualmente disponibili in anteprima.
Quando si attiva staging per una query, Dataflow Gen2 scrive i risultati intermedi in un Lakehouse di staging interno, in modo che il motore possa usare la capacità di calcolo di Fabric per le trasformazioni o per scrivere i dati in una destinazione.
La sezione Gestione temporanea dei dati nelle impostazioni di scalabilità del flusso di dati consente di ottimizzare due aspetti della pipeline:
- Copia ottimizzata in Lakehouse (anteprima) — Usa un percorso più rapido per scrivere dati temporanei in una destinazione dati di Fabric Lakehouse.
- Abilita la compressione V-Order (Anteprima) — Applica la compressione V-Order ai dati scritti nel Lakehouse di staging.
Entrambe le opzioni si applicano a livello di flusso di dati e hanno effetto solo in Dataflow Gen2.
Dove trovare le impostazioni
- Aprire il flusso di dati nell'editor di Power Query.
- Selezionare Opzioni dal menu.
- Passare alla scheda Scala .
- Le due impostazioni sono elencate in Dati in fasi.
Copia ottimizzata in Lakehouse (anteprima)
Quando questa opzione è attivata, Dataflow Gen2 usa un percorso di spostamento dei dati ottimizzato per le query che:
- Disporre dell'abilitazione della gestione temporanea e
- Scrivi in una destinazione dati Fabric Lakehouse.
Nel percorso predefinito, i dati fluiscono dal Warehouse di staging al Lakehouse con ulteriore serializzazione e passaggi di rete. Il percorso ottimizzato riduce questi passaggi, riducendo così in misura significativa il tempo di aggiornamento dei flussi di dati che fanno ampio ricorso allo staging e scrivono in una Lakehouse.
Per un esempio misurato dell'impatto sul tempo di aggiornamento e sul consumo di CU di questa opzione, vedi Scenario 3: Copia ottimizzata su Lakehouse nei benchmark di costo e prestazioni Dataflow Gen2.
Quando usarlo
Attiva questa opzione quando metti in staging le query che alla fine finiscono in una destinazione dati Fabric Lakehouse. La gestione temporanea è più utile quando:
- La query contiene trasformazioni che non possono essere ripiegate sull'origine dati.
- Si desidera fare affidamento sulle risorse di calcolo di staging di Fabric (Lakehouse o Warehouse) per eseguire operazioni onerose, ad esempio join, operazioni GROUP BY o filtri, prima di scrivere nella destinazione.
Per ulteriori informazioni su quando la gestione temporanea è utile, consulta Procedure consigliate per ottenere le migliori prestazioni con Dataflow Gen2.
Comportamento predefinito
L'opzione è disattivata per impostazione predefinita. Per la maggior parte dei flussi di dati che mettono i dati in staging e scrivono in un Fabric Lakehouse, attivare questa opzione è vantaggioso.
Considerazioni
- L'opzione si applica solo alle query in cui è abilitato lo staging e che scrivono in una destinazione dati di Fabric Lakehouse. Per le query che scrivono in altre destinazioni (Fabric Warehouse, Fabric database SQL, Azure SQL, Snowflake, KQL, Azure Data Lake Storage Gen2, destinazioni di file), l'opzione non ha alcun effetto.
- Se si disattiva lo staging per una determinata query, il percorso di copia ottimizzato non si applica a tale query.
- L'opzione si applica a tutte le query idonee nel flusso di dati. Attualmente non esiste alcuna sovrascrittura a livello di query.
Abilitare la compressione V-Order (Anteprima)
V-Order è un'ottimizzazione in fase di scrittura per il formato di file Parquet che migliora le prestazioni di lettura per i motori di Fabric downstream, a costi aggiuntivi della CPU durante la scrittura. Per informazioni di base e indicazioni tra motori, vedere Ottimizzazione delle tabelle Delta Lake e V-Order e Manutenzione e ottimizzazione delle tabelle tra carichi di lavoro.
Quando questa opzione è attivata, Dataflow Gen2 applica la compressione dell'ordine V ai dati scritti in staging Lakehouse. Quando è disattivato, i dati di staging vengono scritti senza V-Order.
Quando attivare o disattivare V-Order per lo staging
Il Lakehouse di staging contiene dati intermedi usati solo da Dataflow Gen2: il dataflow rilegge i dati di staging nel corso dello stesso aggiornamento per applicare ulteriori trasformazioni o per scriverli in una destinazione e il connettore Dataflow legge i dati di staging quando altri elementi interrogano l'output del dataflow. I motori di query per gli utenti finali (Power BI Direct Lake, Fabric Warehouse, endpoint di analisi SQL, Spark) non leggono direttamente l'area di staging del Lakehouse. Questi scenari si applicano invece alla tua destinazione dati Lakehouse. Per indicazioni sulla destinazione, vedere Abilitare la compressione degli ordini V in una destinazione Lakehouse.
Poiché i dati di staging vengono in genere letti un numero limitato di volte durante lo stesso aggiornamento, disattivare l'ordinamento V per lo staging è una buona scelta per la maggior parte dei dataflow. Saltare V-Order riduce l'utilizzo della CPU durante la scrittura e abbrevia la durata dell'aggiornamento, soprattutto per operazioni di scrittura nello staging di grandi dimensioni. Valutare l'attivazione di V-Order per lo staging se l'output di staging del flusso di dati viene usato molte volte tramite il connettore Dataflow e si desidera privilegiare le prestazioni di lettura per tali query a valle rispetto al costo di scrittura nello staging.
Comportamento predefinito
L'opzione è attivata per impostazione predefinita. Usare le indicazioni riportate sopra per decidere cosa è giusto per il flusso di dati.
Dove altro si applica V-Order
Oltre all'impostazione a livello di flusso di dati che controlla la gestione temporanea di Lakehouse, È anche possibile controllare V-Order sulla connessione di destinazione dati Lakehouse stessa, tramite l'opzione Abilita l'uso della compressione dell'ordine V avanzata. Questa impostazione determina se i dati scritti nel Lakehouse di destinazione sono compressi con V-Order. La destinazione è la superficie letta da Direct Lake, Fabric Warehouse, l'endpoint di analisi SQL e Spark, quindi le indicazioni a livello di destinazione sono basate su scenari.
Per informazioni dettagliate sull'opzione a livello di destinazione, vedere Abilitare la compressione dell'ordine V in una destinazione Lakehouse.
Contenuti correlati
- Benchmark di costo e prestazioni di Dataflow Gen2
- Procedure consigliate per ottenere prestazioni ottimali con Dataflow Gen2
- Destinazioni dati e impostazioni gestite di Flusso di dati Gen2
- Ottimizzazione delle tabelle Delta Lake e V-Order
- Manutenzione e ottimizzazione delle tabelle tra carichi di lavoro
- Analizzatore moderno per Dataflow Gen2 con CI/CD
- Usare il calcolo partizionato in Dataflow Gen2 (anteprima)