Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Microsoft Fabric Dataflow Gen2 offre molteplici modi per assumere, trasformare e caricare dati in modo efficiente. Questi metodi consentono di bilanciare le prestazioni, la scalabilità e i costi.
Questo articolo è il riferimento sulle prestazioni e i costi per Dataflow Gen2. Mette a confronto quattro carichi di lavoro comuni - copia in blocco, trasformazione intensiva dei dati, scritture ottimizzate in un lakehouse e combinazione di file partizionati - e riporta il tempo di esecuzione e le unità di capacità (CU) consumate da ciascuno, misurate tramite la telemetria della capacità. Usalo per stimare quanto costano i tuoi refresh e per scegliere la capacità che si adatta a ogni carico di lavoro.
Su larga scala, Dataflow Gen2 supera notevolmente Dataflow Gen1 sia in termini di velocità che di costo - e più grande è il carico di lavoro, più ampio è il divario. Eseguendo lo stesso script M, sugli stessi dati, nella stessa capacità Fabric, Dataflow Gen2 ha completato ogni benchmark in questo articolo da 1,7 a 21 volte più velocemente rispetto alla baseline di Dataflow Gen1. In ogni scenario in cui è stato misurato il consumo di capacità di entrambe le generazioni, Dataflow Gen2 svolgeva tale lavoro più rapidamente consumando dall'82% al 95% in meno di unità di capacità, quindi l'aumento di velocità non avviene a scapito di un maggiore consumo di capacità. Ottieni entrambi i guadagni insieme, senza riscrivere nemmeno una domanda.
Quanto guadagni dipende dal tuo carico di lavoro, e il fattore più importante è quanto durano le tue query. Il Calcolo Standard fattura i primi 10 minuti di ogni query a 12 CU per ogni secondo, poi solo 1,5 CU per ogni secondo aggiuntivo, quindi più a lungo una query procede, più basso sarà il suo costo medio al secondo. Un flusso di dati corto finisce all'interno di quel primo livello e non raggiunge mai il tasso più basso, quindi la differenza tra le due generazioni è piccola. I guadagni crescono con il volume dei dati e il tempo di esecuzione, motivo per cui i benchmark in questo articolo utilizzano grandi dataset ad alto volume e aggiornamenti di lunga durata.
Anche Dataflow Gen2 continua a diventare più economico a modo suo: i prezzi e le capacità attuali riducono il consumo di CU di circa 14% a 84%, a seconda del carico di lavoro, rispetto a quanto avrebbe consumato lo stesso carico prima del 2026.
Note
Nel corso di questo articolo, i costi e la capacità vengono misurati in unità di capacità Fabric (CUs). Per come Dataflow Gen2 consuma le CU e come questo si riflette sulla fatturazione, vedi Dataflow Gen2 pricing. Questi benchmark e dati CU riflettono l'attuale modello di prezzo e le capacità di Dataflow Gen2, inclusi il pricing standard a livelli, Fast Copy e Modern Evaluator. Poiché le prestazioni e l'efficienza dei costi di Dataflow Gen2 sono migliorate nel tempo, i dati pubblicati prima del 2026 potrebbero non riflettere il comportamento attuale.
Le funzionalità seguenti consentono di ottimizzare i flussi di dati:
- Copia Veloce – Accelera il movimento di dati in massa prima della trasformazione.
- Analizzatore Moderno – Accelera la modellazione intensiva dei dati su query non comprimibili.
- Query di gestione temporanea : eseguire il landing dei dati in un livello intermedio prima di applicare trasformazioni, abilitando i modelli ELT.
- Copia ottimizzata nel Lakehouse – Velocizza la scrittura dei dati temporaneamente archiviati in una destinazione Lakehouse nei carichi di lavoro ELT.
- Calcolo Partizionato (Preview) – Trasformazioni su scala su dataset grandi e partizionati.
Questo articolo tratta casi d'uso comuni, esempi reali e risultati di benchmarking per aiutarti a scegliere la capacità giusta per il tuo carico di lavoro.
Dataflow Gen2 fattura ogni motore separatamente, alle seguenti tariffe attuali:
- Calcolo standard (query del motore di mashup) - 12 CU per ogni secondo per i primi 10 minuti di ogni query, poi 1,5 CU per ogni secondo aggiuntivo.
- Fast Copy (movimento dei dati) - 1,5 CU per ogni secondo di attività di copia, misurato su tutti i core utilizzati.
Per il modello completo di tariffe, vedi Dataflow Gen2 priking.
Riferimento rapido
Associare il carico di lavoro alla funzionalità corretta di Dataflow Gen2. Per un esempio di benchmark, vedere lo scenario collegato.
| Capability | Usalo quando... | Vantaggio chiave | Benchmark |
|---|---|---|---|
| Copia rapida | È necessaria una copia diretta ad alta velocità effettiva da un'origine supportata senza trasformazioni. | Inserimento più veloce a costi di calcolo inferiori. | Scenario 1: Copiare i dati |
| Analizzatore moderno | Stai plasmando i dati da connettori non piegabili o parzialmente piegabili (filtri, derivazioni, rimozione degli errori). | Esecuzione più veloce senza modificare la logica. | Scenario 2: Modellazione dei dati intensiva |
| Copia ottimizzata per Lakehouse | Hai attivato lo staging su una query che scrive a una destinazione di casa sul lago. | Massimizza il throughput durante la scrittura dei dati temporaneamente archiviati nel lakehouse. | Scenario 3: Copia ottimizzata per Lakehouse |
| Calcolo Partizionato (Anteprima) | Stai trasformando set di dati che sono grandi, partizionati o multi-file e che possono essere eseguiti in parallelo. Combinare con il valutatore moderno, quando supportato. | Esecuzione parallelizzata tra partizioni. | Scenario 4: Combina file |
Note
Per informazioni generali sulla valutazione delle query e sulla riduzione delle query, vedere Nozioni di base sulla riduzione delle query.
Riepilogo dei risultati del benchmark
La maggior parte degli scenari in questo articolo utilizza il dataset Trip Data – TLC Trip Record Data della New York City Taxi & Limousine Commission (TLC ): miliardi di record di viaggi in taxi memorizzati come file Parquet in ADLS Gen2, coprendo il periodo 2021–2025 (fino ad agosto). Lo scenario 3 utilizza una tabella Fabric lakehouse con circa 113 milioni di record di viaggi in taxi a New York dal 2017 fino a metà 2018. La destinazione è un Fabric lakehouse o magazzino, a seconda dello scenario.
La tabella seguente riepiloga i risultati del benchmark in tutti gli scenari. Ogni scenario include anche una baseline di Dataflow Gen1 per il confronto.
| Scenario | Funzionamento | Funzionalità abilitata | Tempo di esecuzione gen2 | Speedup e Baseline Gen1 | Gen1 CU | Gen2 CU | Riduzione della CU in Gen2 |
|---|---|---|---|---|---|---|---|
| Scenario 1: Copiare i dati | Carica in blocco cinque file Parquet consolidati dall'ADLS Gen2 in una casa sul lago senza trasformazioni. | Copia rapida | 00:09:08 | 11× più veloce | 84,411 | 14,593 | 83% |
| Scenario 2: Modellazione dei dati intensiva | Applicare trasformazioni non piegabili (filtri, derivazioni, pulizia) a un singolo file Parquet di grandi dimensioni caricato in una lakehouse. | Analizzatore moderno | 00:46:29 | 1,7× più veloce | 56,855 | 10,485 | 82% |
| Scenario 3: Copia ottimizzata per Lakehouse | Trasforma una tabella dei taxi di New York con 113 milioni di righe da un lakehouse di Fabric e scrivi il risultato in una tabella lakehouse tramite un percorso di copia accelerato. Questo benchmark utilizza copie ottimizzate su Lakehouse e V-Order. | Copia ottimizzata per Lakehouse | 00:03:34 | 15× più veloce | 50,788 | 2,391 | 95% |
| Scenario 4: Combina file | Combinare e trasformare 56 file Parquet partizionati in parallelo e caricarli in un data warehouse. | Calcolo Partizionato (Anteprima) | 00:04:48 | 21× più veloce | Non misurato | Non misurato | Non misurato |
Il grafico seguente confronta gli stessi scenari in base al consumo di capacità invece che al tempo di esecuzione.
Per informazioni dettagliate, configurazioni dei set di dati e modelli di progettazione per ogni funzionalità, vedere le sezioni dello scenario seguenti.
Note
Tutti gli scenari in questo articolo hanno abilitato Modern Evaluator e V-Order disabilitato, salvo diversa indicazione esplicita. Le colonne Gen1 CU e Gen2 CU riportano i secondi dell'Unità di Capacità. La riduzione CU sulla colonna Gen2 è la diminuzione in secondi di CU dalla base Dataflow Gen1 alla migliore configurazione Dataflow Gen2, calcolata come (Gen1 CU − Gen2 CU) ÷ Gen1 CU.
Come abbiamo misurato questi parametri di riferimento
Ogni scenario esegue lo stesso script M due volte: una volta su Dataflow Gen1 per stabilire una baseline, e una volta su Dataflow Gen2 con la capacità in test attivata.
Ogni esecuzione in questo articolo condivide le stesse condizioni di test:
- Tutti gli scenari e entrambe le generazioni hanno funzionato con la stessa capacità Fabric, quindi nessun risultato riflette una dimensione di capacità o uno SKU diverso.
- Nessun gateway dati è stato coinvolto. Ogni connessione passava direttamente dal servizio Fabric a una fonte di dati cloud.
- Ogni scenario utilizzava gli stessi dati sorgente e lo stesso script M sia per le esecuzioni Dataflow Gen1 che Dataflow Gen2.
I dati riportati significano quanto segue:
- Il tempo di esecuzione è la durata totale di aggiornamento riportata per l'esecuzione del flusso dati.
- Le CU consumate sono i secondi di Capacity Unit addebitati alla capacità per l'esecuzione, letti nell'app Microsoft Fabric Capacity Metrics. Poiché Dataflow Gen2 fattura ogni motore separatamente, il totale di uno scenario è la somma di ogni motore che ha funzionato durante il refresh, e i valori CU sono arrotondati al secondo CU intero più vicino. Per il modello completo di tariffe, vedi Dataflow Gen2 priking.
Quando confronti le due generazioni, tieni a mente queste differenze architettoniche:
- Dataflow Gen1 utilizza un'architettura fondamentalmente diversa da Dataflow Gen2 e non supporta funzionalità come Fast Copy, Modern Evaluator, Optimized copy to Lakehouse o Partitioned Compute.
- Dataflow Gen1 può caricare dati solo come file CSV, mentre Dataflow Gen2 carica dati come file Parquet in questi scenari.
Note
Questi dati sono stati registrati nel nostro ambiente di test nell'agosto 2026 e si applicano solo a queste specifiche sessioni. I tuoi risultati variano in base al volume dei dati, alla dimensione della capacità e alla configurazione. Per misurare i tuoi carichi di lavoro, consulta Calcolare i costi stimati usando l'app Fabric Metrics e la cronologia aggiornamenti del flusso dati.
Scenario 1: Copiare i dati
Il team di analisi di NYC Taxi deve caricare milioni di registri grezzi dei viaggi in Parquet dall'ADLS Gen2 in una casa sul lago Fabric. Il team non necessita di alcuna trasformazione, ma solo una copia diretta per supportare l'analisi downstream.
Challenges
- Trasferisci rapidamente grandi volumi di dati Parquet nel lakehouse.
- Ridurre il tempo di ingestione per gli aggiornamenti giornalieri.
- Ridurre al minimo i costi di calcolo per carichi di lavoro di estrazione (EL) semplici.
Dataset
File Parquet del NYC Yellow Taxi uniti per anno, cinque partizioni consolidate (dal 2021 ad agosto 2025).
Soluzione
Il team abilita la copia rapida in Dataflow Gen2. Fast Copy ottimizza i percorsi di spostamento dei dati e parallelizza le scritture per i connettori supportati.
Design
Questa query combina i file Parquet degli ultimi cinque anni e carica il risultato nella lakehouse.
Considerazioni sulla copia veloce
- Supporta i formati di file.csv e parquet .
- Supporta fino a 1M righe per tabella per ogni esecuzione per il database SQL di Azure.
- Ideale per i flussi di lavoro di estrazione-caricamento (EL) prima delle trasformazioni.
Results
Quando abiliti la copia veloce, Dataflow Gen2 assorbe questo dataset circa l'11× più velocemente rispetto alla base Dataflow Gen1 (00:09:08 vs. 01:38:59) riducendo l'uso dei calcoli. Senza Fast Copy, Dataflow Gen2 è già circa 2,8× più veloce di Gen1 con lo stesso carico di lavoro.
| Configuration | Tempo di esecuzione (hh:mm:ss) | Confronto con Gen1 | CU consumata |
|---|---|---|---|
| Baseline del flusso di dati Gen1 | 01:38:59 | — | 84,411 |
| Flusso di dati Gen2 senza copia rapida | 00:35:25 | 2,8× più veloce | Non misurato |
| Flusso di dati Gen2 con copia rapida | 00:09:08 | 11× più veloce | 14,593 |
Quando si abilita Fast Copy - la configurazione Dataflow Gen2 più ottimale per questo scenario - l'ingestione Fast Copy dello Scenario 1 di cinque file Parquet consolidati in una casa sul lago consuma 14.593 secondi CU. La tabella seguente suddivide quel totale per operazione:
| Funzionamento | Motore (metro) | Secondi CU |
|---|---|---|
| Trasferimento di dati | Copia rapida | 8,280 |
| Esegui le query | Calcolo Standard | 6,313 |
| Totale | 14,593 |
Il trasferimento dati Fast Copy viene fatturato alla tariffa di 1,5 CU per ogni secondo di attività di copia, calcolato come tempo totale su tutti i core su cui la copia viene eseguita. Dataflow Gen2 bilancia automaticamente il numero di core utilizzati da ogni scenario Fast Copy, quindi una copia che si completa rapidamente in termini di tempo effettivo può comunque richiedere molti core-secondi. Qualsiasi tempo di query rimanente viene fatturato su Standard Compute (12 CU per ogni secondo fino a 10 minuti, poi 1,5 CU per ogni secondo aggiuntivo). Per il modello completo di tasso, vedi Dataflow Gen2 pricing.
Punti chiave
- Abilitare Fast Copy ha ridotto un'ingestione di 99 minuti in circa nove minuti, un miglioramento di ordine di grandezza rispetto allo stesso dataset e allo stesso script M.
- Anche Dataflow Gen2 utilizzava 83% capacità in meno rispetto a Dataflow Gen1 per lo stesso lavoro (14.593 contro 84.411 secondi CU), quindi l'aumento di velocità non è avvenuto a costo di calcolo aggiuntivo.
- L'accelerazione deriva da un movimento nativo e parallelizzato dei dati che bypassa il motore mashup, quindi si applica solo ai passaggi di estrazione e caricamento che soddisfano i prerequisiti di Fast Copy. Qualsiasi trasformazione che interrompe il folding si ritorna al motore standard e perde i vantaggi.
- Per le origini supportate, considerare Copia Veloce come predefinita per l'inserimento e riservare motori di trasformazione più complessi (descritti negli scenari successivi) per i passaggi che effettivamente rimodellano i dati.
Scenario 2: Data shaping pesante
Dopo l'ingestione, il team applica il filtraggio, la sostituzione dei valori nulli e la mappatura dei codici prima di caricare i dati nel lakehouse. Queste trasformazioni non si convertono completamente in Parquet e sono lente nell'elaborazione in memoria.
Challenges
- Migliorare la velocità di trasformazione per le query semi-piegabili o non piegabili.
- Mantenere la progettazione di Power Query senza codice.
- Ridurre i costi e i tempi di aggiornamento complessivi.
Dataset
Tutti i file Parquet per il periodo 2021–agosto 2025 sono stati uniti in un unico file consolidato.
Soluzione
Il team abilita Modern Evaluator, un motore di esecuzione ad alte prestazioni progettato per una trasformazione efficiente soprattutto per i connettori come ADLS Gen2 e SharePoint.
Design
Questa query inserisce i dati da un file Parquet consolidato, filtra le trip_distance colonne e fare_amount per mantenere i valori superiori a 0, sostituisce i valori Null in passenger_count con 1 e crea una nuova payment_method colonna eseguendo il mapping dei tipi di pagamento prima di caricare i dati nel lakehouse.
Considerazioni del Valutatore Moderno
- I tempi di aggiornamento previsti potrebbero essere notevolmente più veloci (variano in base al set di dati e alle trasformazioni).
- Ottimizzato per volumi di grandi dimensioni (milioni di righe).
- Utile per le query non ripiegabili.
- Scrive più velocemente verso destinazioni come una casa sul lago.
Results
Quando abiliti Modern Evaluator, Dataflow Gen2 esegue questo carico di lavoro di shaping circa 1,7× più veloce rispetto alla base Dataflow Gen1 (00:46:29 vs. 01:19:56) preservando l'esperienza di Power Query senza codice. Senza Modern Evaluator, lo stesso carico di lavoro è solo circa 1,2× più veloce rispetto a Gen1 (01:08:37 contro 01:19:56).
| Configuration | Tempo di esecuzione (hh:mm:ss) | Confronto con Gen1 | CU consumata |
|---|---|---|---|
| Baseline del flusso di dati Gen1 | 01:19:56 | — | 56,855 |
| Flusso di dati Gen2 senza analizzatore moderno | 01:08:37 | 1.2× più veloce | Non misurato |
| Flusso di dati Gen2 con analizzatore moderno | 00:46:29 | 1,7× più veloce | 10,485 |
Quando si abilita Modern Evaluator, la configurazione di Dataflow Gen2 ottimale per questo scenario, la trasformazione con Modern Evaluator dello Scenario 2 di un singolo file Parquet di grandi dimensioni in un lakehouse richiede 10,485 secondi CU. La tabella seguente suddivide quel totale per operazione:
| Funzionamento | Motore (metro) | Secondi CU |
|---|---|---|
| Esegui le query | Calcolo Standard | 10,485 |
| Totale | 10,485 |
Il lavoro si svolge interamente su Standard Compute, che viene fatturato su due livelli: 12 CU per ogni secondo fino a 10 minuti, poi 1,5 CU per ogni secondo aggiuntivo. La tabella seguente mostra come la durata fatturata e il totale delle CU si suddividono tra questi livelli:
| Livello di fatturazione | Durata fatturata | Rate | Secondi CU |
|---|---|---|---|
| Primi 10 minuti | 00:10:00 (600 secondi) | 12 CU per ogni secondo | 7.200 |
| Oltre i 10 minuti | 00:36:29 (2.189,8 secondi) | 1,5 CU per ogni secondo | 3,284.7 |
| Totale | 00:46:29 (2.789,8 secondi) | 10,484.7 |
Questa tabella mostra il totale misurato a una cifra decimale, in modo che le fasce sommino esattamente; nel resto dell'articolo, il valore viene arrotondato a 10.485 secondi di CU.
La ripartizione mostra quanto il primo livello incida sulla fattura: i primi 10 minuti rappresentano solo circa il 22% dell’esecuzione, ma corrispondono a circa il 69% dei secondi di CU, perché ciascuno di quei secondi costa otto volte di più di un secondo nel secondo livello tariffario. Tutto ciò che supera i 10 minuti - ovvero la parte più consistente di una lunga esecuzione di shaping - viene addebitato alla tariffa molto più bassa di 1,5 CU. Modern Evaluator abbassa ulteriormente la fattura accorciando la durata della fatturazione stessa, non modificando la tariffa. Per il modello completo di tasso, vedi Dataflow Gen2 pricing.
Punti chiave
- Senza Modern Evaluator, Dataflow Gen2 era solo circa 1,2× più veloce della base Dataflow Gen1 su questo carico di lavoro di modellazione. L’abilitazione di Modern Evaluator ha migliorato le prestazioni, rendendole circa 1,7 volte più veloci rispetto a Gen1, con lo stesso script M e lo stesso set di dati.
- Il risparmio di capacità è maggiore del risparmio di tempo: Dataflow Gen2 si è completato 1,7 volte più rapidamente consumando l'82% di capacità in meno rispetto a Dataflow Gen1 (10.485 contro 56.855 secondi CU).
- Questo aumento delle prestazioni deriva da un percorso di esecuzione più efficiente per query non foldabili e semi-foldabili. Power Query tradizionalmente dedica più tempo a queste query, specialmente quando usi connettori come ADLS Gen2 e SharePoint. I benefici aumentano proporzionalmente con il volume delle righe e la complessità della modellazione dei dati.
- Usa Modern Evaluator come predefinito per i flussi che richiedono molto shaping dove le query non tornano completamente alla sorgente. Più grande è il dataset e più trasformazioni applichi nel motore, maggiore è l'impatto che dovresti aspettarti.
Scenario 3: Copia ottimizzata per Lakehouse
Il team di analisi di NYC Taxi trasforma un grande tavolo e scrive il risultato in una casa sul lago Fabric. Scrivere quel volume nella destinazione è la parte più lenta dell'aggiornamento, quindi il team vuole accelerare la scrittura senza cambiare la logica di trasformazione.
Challenges
- Scrivi rapidamente un risultato grande e modificato per una destinazione con un lago.
- Evita che la scrittura nella destinazione diventi il collo di bottiglia del refresh.
- Preservare l'esperienza Power Query senza codice e la logica di trasformazione esistente.
Dataset
Una tabella Fabric lakehouse con circa 113 milioni di viaggi in taxi a New York registra il periodo dal 2017 alla metà del 2018.
Soluzione
Il team attiva Abilita staging e abilita la copia ottimizzata su Lakehouse su una singola query che scrive su una destinazione di lakehouse. La copia ottimizzata nel Lakehouse sposta il risultato temporaneo nel Lakehouse tramite un percorso accelerato.
Design
Il dataflow del benchmark utilizza una singola query con Enable staging attivato e una destinazione lakehouse che utilizza V-Order. La query legge la tabella dei taxi di NYC, composta da circa 113 milioni di righe, da un lakehouse di Fabric, ordina le righe per data e ora di prelievo e aggiunge due colonne derivate: l'inizio del mese di prelievo e la somma della tassa MTA e del supplemento per il miglioramento. Poiché lo staging è attivo, Optimized Copy to Lakehouse scrive il risultato trasformato nella destinazione di lakehouse su un percorso accelerato, che determina il tempo di esecuzione veloce.
Considerazioni sulla copia ottimizzata nel Lakehouse
- Richiede di abilitare lo staging sulla query e una destinazione con la casa sul lago. Per altre informazioni, vedere Opzioni di dati a fasi per Dataflow Gen2.
- Accelera la scrittura nel lakehouse senza modificare la logica di trasformazione.
- Combinalo con V-Order nella destinazione per ottimizzare l'output per le analisi successive.
Results
Quando si abilita la copia ottimizzata su Lakehouse, Dataflow Gen2 completa questo aggiornamento circa 15× più velocemente rispetto alla base Dataflow Gen1 (00:03:34 vs. 00:53:20) senza cambiare la logica di trasformazione. Senza questo, lo stesso flusso di dati a più fasi è circa 3,6× più veloce rispetto a Gen1.
| Configuration | Tempo di esecuzione (hh:mm:ss) | Confronto con Gen1 | CU consumata |
|---|---|---|---|
| Baseline del flusso di dati Gen1 | 00:53:20 | — | 50,788 |
| Dataflow Gen2 con staging + V-Order (nessuna copia ottimizzata su Lakehouse) | 00:14:45 | 3,6× più veloce | Non misurato |
| Dataflow Gen2 con staging + Copia ottimizzata su Lakehouse + V-Order | 00:03:34 | 15× più veloce | 2,391 |
Quando si abilitano lo staging, Copia ottimizzata in Lakehouse e V-Order - la configurazione di Dataflow Gen2 più ottimale per questo scenario - l'aggiornamento dello scenario 3 della tabella taxi di NYC da 113 milioni di righe in una tabella lakehouse viene completato in 00:03:34 e consuma 2.391 secondi CU. La tabella seguente suddivide quel totale per operazione:
| Funzionamento | Motore (metro) | Secondi CU |
|---|---|---|
| Esegui le query | Calcolo Standard | 2,391 |
| Totale | 2,391 |
Il lavoro viene fatturato interamente in Standard Compute (12 CU per ogni secondo fino a 10 minuti, poi 1,5 CU per ogni secondo aggiuntivo). La copia ottimizzata per la casa sul lago passa attraverso il motore mashup, quindi non c'è un indicatore separato. Per il modello completo di tasso, vedi Dataflow Gen2 pricing.
Punti chiave
- La copia ottimizzata nel Lakehouse accelera la scrittura del risultato trasformato nella destinazione Lakehouse, riducendo il tempo di aggiornamento da 00:14:45 (senza questa ottimizzazione) a 00:03:34, ossia circa 4 volte più rapidamente rispetto allo stesso dataflow senza di essa e circa 15 volte più rapidamente rispetto al valore di riferimento di Dataflow Gen1 (00:53:20).
- Questo scenario ha prodotto il maggior risparmio di capacità rispetto al Dataflow Gen1 in questo articolo: il Dataflow Gen2 ha consumato 95% meno di capacità rispetto al Dataflow Gen1 (2.391 contro 50.788 secondi CU).
- Richiede di abilitare lo staging sulla query e una destinazione di lakehouse, e non cambia la logica di trasformazione.
- Questo scenario usa in modo esplicito V-Order nell'output di destinazione.
- Usa Copia ottimizzata per Lakehouse ogni volta che scrivi dati in staging in un Lakehouse di destinazione e il tempo di scrittura costituisce la parte predominante del tempo di aggiornamento.
Scenario 4: Combina file
Note
Partitioned Compute è attualmente in anteprima ed è disponibile solo in Dataflow Gen2 con CI/CD. La capacità sta ancora ricevendo miglioramenti, quindi il suo comportamento, le trasformazioni supportate e le prestazioni possono cambiare prima della disponibilità generale. Considera i risultati in questo scenario come un'istantanea in un dato momento della versione di anteprima.
Il team deve ora aggregare e arricchire i dati di viaggio tra centinaia di file Parquet (partizioni mensili). Le trasformazioni includono percentuali di mancia di calcolo nel set di dati.
Challenges
- È necessario elaborare centinaia di file di grandi dimensioni.
- Le trasformazioni richiedono raggruppamento, aggregazione e arricchimento tra partizioni.
- L'esecuzione sequenziale diventa un collo di bottiglia.
Dataset
Cinquantasei file Parquet (2021–ago 2025).
Soluzione
Il team abilita il Partitioned Compute (Preview), che parallelizza l'elaborazione tra partizioni e fusiona i risultati in modo efficiente.
Design
Questa query combina 56 file Parquet e crea una nuova colonna personalizzata per la percentuale di mancia "Tip Pctg" nel file Transform Sample prima di caricare i dati nel data warehouse.
Considerazioni sul calcolo partizionato
- Attualmente in anteprima e disponibile solo in Dataflow Gen2 con CI/CD; La capacità è ancora in fase di miglioramenti.
- Utilizzalo quando la fonte non supporta il ripiegamento.
- Offre le migliori prestazioni durante il caricamento dei dati nell'area di staging o nel magazzino.
- Usa il file di trasformazione Sample dai file Combine per garantire una logica di trasformazione coerente.
- Supporta un subset di trasformazioni; le prestazioni variano.
Results
Il calcolo partizionato offre prestazioni circa del 21× più veloci rispetto alla base Dataflow Gen1 (00:04:48 vs. 01:40:57) su grandi dataset partizionati e multi-file.
| Configuration | Tempo di esecuzione (hh:mm:ss) | Confronto con Gen1 | CU consumata |
|---|---|---|---|
| Baseline del flusso di dati Gen1 | 01:40:57 | — | Non misurato |
| Flusso di dati Gen2 con calcolo partizionato | 00:04:48 | 21× più veloce | Non misurato |
Il calcolo partizionato punta al tempo di esecuzione effettivo piuttosto che al costo. Esegue partizioni in parallelo così il refresh termina prima, ma quel parallelismo distribuisce il lavoro su più calcolo invece di ridurlo, quindi il costo è tipicamente simile o superiore allo stesso carico di lavoro senza la funzionalità. Il consumo di CU non è stato misurato in questo scenario, quindi questo articolo riporta solo il tempo di esecuzione.
Punti chiave
- Il calcolo partizionato ha fornito una velocità di 21× rispetto alla baseline di Dataflow Gen1 e terminata in meno di cinque minuti. Poiché la funzionalità è in versione di anteprima ed è ancora in fase di miglioramento, è prevedibile che questi numeri si evolvano.
- Considera il calcolo partizionato come un modo per finire prima, non come un modo per spendere meno. Il parallelismo accorcia il tempo di orologio a muro facendo girare partizioni contemporaneamente, quindi il costo è tipicamente simile o superiore rispetto allo stesso carico di lavoro senza di esso.
- Il guadagno deriva dall'elaborazione parallela di ogni partizione e dall'unione dei risultati, quindi è più efficace nelle origini multi-file o partizionate in cui l'aggregazione non è disponibile e l'esecuzione sequenziale è il collo di bottiglia.
- Usa il pattern di file di trasformazione Sample dai file Combine così la logica di trasformazione viene applicata in modo coerente per ogni partizione. Partitioned Compute attualmente supporta un sottoinsieme di trasformazioni, quindi verifica che i tuoi passaggi di shaping siano compatibili prima di affidarti a esso, e ricontrolla man mano che l'anteprima si evolve.
- Per l'inserimento con volumi elevati e partizionati nello staging o in un magazzino, rendere l'elaborazione partizionata l'impostazione predefinita e combinarla con Modern Evaluator ogni volta che è possibile. Poiché è ancora in anteprima, validalo rispetto al tuo carico di lavoro prima di adottarlo per i refresh di produzione.
Costo nel tempo (allora vs. ora)
Dataflow Gen2 è diventato più efficiente dal punto di vista economico da gestire nel tempo. La stessa logica, sugli stessi dati, oggi consuma meno CU rispetto al passato, senza richiedere alcuna modifica alle tue query.
In questo confronto, significa quindi lo stesso carico di lavoro sotto i prezzi e le capacità generalmente disponibili prima del 2026. Ora significa che lo stesso carico di lavoro viene eseguito oggi con le migliori impostazioni generalmente disponibili (come Modern Evaluator e Fast Copy). Entrambe le colonne utilizzano la migliore configurazione generalmente disponibile del loro periodo. I dati attuali sono misurati dalla telemetria di capacità. I dati di allora sono stime di quanto avrebbe consumato lo stesso carico di lavoro all'epoca, perché le condizioni di servizio precedenti oggi non possono essere riprodotte.
| Scenario | Capability | CU stimato prima del 2026 (GA migliore) | CU Now (miglior GA) | Riduzione stimata |
|---|---|---|---|---|
| Scenario 1: Copiare i dati | Copia rapida | 17,055 | 14,593 | 14% |
| Scenario 2: Modellazione dei dati intensiva | Analizzatore moderno | 66,164 | 10,485 | 84% |
| Scenario 3: Copia ottimizzata per Lakehouse | Copia ottimizzata per Lakehouse | 14,173 | 2,391 | 83% |
Ad esempio, il carico di lavoro con modellazione intensiva nello Scenario 2 avrebbe consumato circa 66.164 secondi di CU prima del 2026 e ora consuma 10.485 secondi di CU. Questa modifica è una riduzione di 84% con logica identica e senza modifiche necessarie. Due miglioramenti si combinano per renderlo possibile. Per prima cosa, la tariffazione di Standard Compute è diventata a scaglioni: invece di una tariffa fissa di 16 CU per ogni secondo dell’intera esecuzione, solo i primi 10 minuti vengono fatturati a 12 CU al secondo, mentre ogni secondo successivo viene fatturato a soli 1,5 CU, quindi la coda lunga di un carico di lavoro di shaping ora costa una frazione di quanto costava prima. In secondo luogo, Modern Evaluator, disponibile a livello generale da aprile 2026, riduce la durata fatturabile stessa, quindi ci sono meno secondi da fatturare in entrambe le fasce. Una corsa più breve, confrontata con un tasso a coda lunga molto più bassa, è il motivo per cui il consumo di CU cala così bruscamente, ed è per questo che abbinare Modern Evaluator agli attuali prezzi a livelli è così importante per flussi dati che richiedono molto modellazione.
L'ingestione Fast Copy nello Scenario 1 avrebbe consumato circa 17.055 secondi CU prima del 2026, e ora consuma 14.593 secondi CU. Questa modifica è una riduzione di 14%, dovuta al fatto che il tasso di calcolo standard scende da un fisso 16 CU per ogni secondo a 12 CU per ogni secondo fino a 10 minuti; la parte di movimento dei dati Copia Rapida rimane invariata. La copia ottimizzata per Lakehouse refresh nello Scenario 3 avrebbe consumato circa 14.173 secondi CU prima del 2026, e ora consuma 2.391 secondi CU. Questa modifica è una riduzione di 83%. Ogni confronto utilizza lo stesso carico di lavoro con le migliori impostazioni generalmente disponibili del suo periodo.
Note
Questo confronto allora contro ora esclude il calcolo partizionato, perché il consumo di CU non è stato misurato per quello scenario e la capacità è ancora in anteprima.
Domande frequenti
Come viene fatturato Dataflow Gen2?
Dataflow Gen2 fattura ogni motore separatamente in Fabric Capacity Units (CU). Standard Compute (il motore mashup) fattura 12 CU per ogni secondo fino a 10 minuti per ogni query, poi 1,5 CU per ogni secondo aggiuntivo. Fast Copy (spostamento dei dati) addebita 1,5 CU per ogni secondo di operazione di copia, calcolato su tutti i core su cui viene eseguita l'operazione di copia. Ti viene addebitato solo per il calcolo effettivamente utilizzato da ogni query, senza una tariffa fissa per ogni refresh e senza costi per il tempo inattivo. Per il modello completo di tariffe, vedi Dataflow Gen2 priking.
Il prezzo di Dataflow Gen2 è elastico?
Yes. Dataflow Gen2 addebita solo la capacità di calcolo effettivamente utilizzata da ogni query, misurata in Fabric Capacity Units (CUs). Non c'è una tariffa fissa per ogni refresh, nessun costo per il tempo inattivo e nessun costo diretto durante il tempo di authoring per la funzionalità nativa. Nei benchmark di questo articolo, un aggiornamento completo ha consumato 14.593 secondi CU per un'acquisizione Fast Copy e 10.485 secondi CU per un carico di lavoro con trasformazioni intensive.
Come posso stimare il costo del mio Dataflow Gen2 prima di eseguire l'intero carico di lavoro?
Esegui un piccolo aggiornamento rappresentativo e misura quanto consuma, invece di costruire la soluzione completa e scoprire il costo dopo. Per stimare il costo in questo modo:
- Costruisci il flusso dati su un campione o su una singola partizione della tua sorgente invece che sull'intero dataset.
- Aggiornalo una volta, poi leggi i secondi di CU che ha consumato nell'app Microsoft Fabric Capacity Metrics.
- Controlla la cronologia di aggiornamento del flusso di dati per vedere quali motori sono stati usati, perché Standard Compute e Fast Copy vengono fatturati separatamente.
- Dividi i secondi CU misurati per le righe o GB che hai elaborato per ottenere una velocità per unità, poi moltiplica per il volume totale dei dati.
Note
Dataflow Gen2 è ottimizzato per carichi di lavoro su larga scala, quindi i suoi benefici in prestazioni ed efficienza sono più evidenti su grandi dataset reali. Un campione piccolo o sintetico potrebbe non mostrare i guadagni completi, e una tariffa per unità estrapolata da un campione minuscolo può sovrastimare il costo di una tiratura completa. Valida contro un volume di dati rappresentativo ogni volta che puoi.
Per la procedura completa, vedi Calcolare i costi stimati usando l'app Fabric Metrics e la cronologia di aggiornamento del flusso di dati.
Quanto tempo richiede un aggiornamento di Dataflow Gen2?
Dipende dal volume dei dati e dalle trasformazioni che applichi. Nei benchmark di questo articolo, i tempi di aggiornamento di Dataflow Gen2 andavano da 00:03:34 per una copia ottimizzata di una tabella di 113 milioni di righe in un lakehouse fino a 00:46:29 per un carico di lavoro elevato di trasformazione dei dati su un file Parquet consolidato di grandi dimensioni. Una copia in blocco di cinque file Parquet consolidati completata in 00:09:08 con Copia Veloce, e una combinazione di 56 file partizionati completata in 00:04:48 con Calcolo Partizionato (Anteprima). Per i tempi completi per scenario, consulta il riepilogo dei risultati del benchmark.
Quale capacità Dataflow Gen2 riduce di più i costi?
Dipende dal carico di lavoro, perché ogni capacità mira a un collo di bottiglia diverso: Copia Veloce per l'ingestione senza trasformazioni, Modern Evaluator per la modellatura dati non pieghevole, Copia ottimizzata su Lakehouse per accelerare le scritture verso una destinazione di Lakehouse, e Calcolo Partizionato (Preview) per grandi dataset multi-file. Rispetto alla baseline di Dataflow Gen1, la copia ottimizzata in Lakehouse ha prodotto il risparmio maggiore in questi benchmark, con il 95% in meno di secondi CU. Rispetto alle esecuzioni equivalenti di Dataflow Gen2 prima del 2026, Modern Evaluator ha prodotto la maggiore riduzione stimata, con 84% secondi CU in meno su un carico di lavoro di modellatura pesante. Per abbinare una capacità al tuo carico di lavoro, consulta il riferimento rapido.
Come posso far sì che un Dataflow Gen2 si aggiorni più velocemente?
Associare la capacità al collo di bottiglia: abilitare Fast Copy per le origini extract-load supportate, attivare Modern Evaluator per le trasformazioni che non supportano il folding, abilitare Optimized copy to Lakehouse quando si scrivono dati in staging in una destinazione Lakehouse e usare Partitioned Compute (Preview) per set di dati di grandi dimensioni partizionati o composti da più file. Ogni capacità è valutata in questo articolo con la specifica accelerazione fornita rispetto alla base Dataflow Gen1.
Devo modificare le mie query per ottenere questi miglioramenti?
No. Ogni benchmark in questo articolo eseguiva lo stesso script M attraverso entrambe le generazioni e ogni configurazione. Fast Copy, Modern Evaluator e Optimized copy to Lakehouse sono impostazioni che puoi attivare e che modificano il modo in cui il motore esegue le query, piuttosto che le query stesse. Un'avvertenza: Fast Copy si applica solo ai passaggi che ne soddisfano i prerequisiti, quindi una trasformazione che interrompe il query folding ricade sul motore standard e perde il vantaggio. Per questi prerequisiti, vedi Copia veloce in Dataflow Gen2.
Dataflow Gen2 è più veloce ed economico di Dataflow Gen1?
Per carichi di lavoro ad alto volume come quelli valutati in questo articolo, sì, su entrambi i fronti. Dataflow Gen2 è risultato da 1,7× a 21× più veloce rispetto alla baseline di Dataflow Gen1 con gli stessi dati e lo stesso script M, e ha consumato dall'82% al 95% di unità di capacità in meno negli scenari in cui entrambe le generazioni sono state misurate. Ad esempio, una copia in blocco che richiedeva 01:38:59 in Dataflow Gen1 è finita in 00:09:08 in Dataflow Gen2 con Fast Copy - circa l'11× più veloce. La differenza è minore per flussi dati a breve durata, perché una query che si completa nei primi 10 minuti non raggiunge mai il livello più economico di 1,5 CU, quindi i guadagni aumentano con il volume di dati e il tempo di esecuzione. Per il confronto completo per scenario, consulta il riepilogo dei risultati del benchmark.
Quanta capacità consuma Dataflow Gen1 rispetto a Dataflow Gen2?
Negli scenari in cui entrambe le generazioni venivano misurate, Dataflow Gen1 consumava diverse volte più capacità rispetto a Dataflow Gen2 per lo stesso lavoro ad alto volume. L'ingestione Fast Copy consumava 84.411 secondi CU su Dataflow Gen1 contro 14.593 CU secondi su Dataflow Gen2, una riduzione di 83%. Il carico di lavoro pesante sulla modellatura dei dati consumò 56.855 secondi CU su Dataflow Gen1 contro 10.485 CU secondi su Dataflow Gen2, una riduzione di 82%. Il carico di lavoro Optimized copy to Lakehouse consumava 50.788 secondi CU su Dataflow Gen1 contro 2.391 CU secondi su Dataflow Gen2, una riduzione di 95%. Tutti e tre questi aggiornamenti durano ben oltre 10 minuti, quindi la maggior parte della loro durata di Dataflow Gen2 viene addebitata alla tariffa inferiore di 1,5 CU. Per i dati per scenario, vedi il riepilogo dei risultati del benchmark.
Dovrei spostare i miei flussi Dataflow Gen1 in Dataflow Gen2?
Yes. Dataflow Gen2 è la generazione attuale di dataflow in Microsoft Fabric, quindi prevedi di trasferire qualsiasi dataflow Dataflow Gen1 su di essa. Nei benchmark di questo articolo, Dataflow Gen2 ha completato lo stesso script M da 1,7 a 21 volte più velocemente, consumando dall'82% al 95% in meno di unità di capacità rispetto a Dataflow Gen1: la stessa logica, eseguita più rapidamente e con un minore utilizzo della capacità. Le capacità che portano a questi vantaggi - Fast Copy, Modern Evaluator, Optimized copy to Lakehouse e Partitioned Compute - sono disponibili solo in Dataflow Gen2, quindi il divario continua ad allargarsi man mano che queste capacità migliorano. Aspettatevi i maggiori guadagni con refresh ad alto volume e di lunga durata. Durante la migrazione, testa un carico di lavoro rappresentativo per confermare i miglioramenti sui tuoi dati e sulla tua capacità. Per iniziare, consulta la panoramica di Dataflow Gen2.
Dataflow Gen2 è diventato più efficiente dal punto di vista dei costi nel tempo?
Yes. Il carico di lavoro pesante nello Scenario 2 avrebbe consumato circa 66.164 secondi CU prima del 2026 e ora consuma 10.485 CU secondi con le capacità generalmente disponibili attuali, una riduzione stimata di 84% con logica identica e senza modifiche necessarie. Per i dati per scenario, vedi Costo nel tempo (allora vs. ora).
I dati di costo e prestazioni Dataflow Gen2 più vecchi sono ancora accurati?
Non necessariamente. I dati in questo articolo riflettono l'attuale modello di prezzo Dataflow Gen2 - 12 CU per ogni secondo fino a 10 minuti di Standard Compute, poi 1,5 CU per ogni secondo aggiuntivo - insieme alle capacità attuali come Fast Copy e Modern Evaluator. Poiché la Gen2 di Dataflow è diventata più veloce ed efficiente dal punto di vista dei costi nel tempo, i numeri di riferimento o le stime dei costi pubblicati prima del 2026 potrebbero sovrastimare il costo attuale o sottostimare le prestazioni attuali. Valida i tuoi carichi di lavoro rispetto all'app Microsoft Fabric Capacity Metrics.