適用於:
Azure Data Factory
Azure Synapse Analytics
秘訣
Data Factory in Microsoft Fabric 是下一代的 Azure Data Factory,擁有更簡單的架構、內建 AI 及新功能。 如果你是資料整合新手,建議先從 Fabric Data Factory 開始。 現有的 ADF 工作負載可升級至 Fabric,以存取資料科學、即時分析與報告等新能力。
在這個教學中,你會使用 Azure 入口網站建立資料工廠。 接著,您可使用複製資料工具建立管線,根據時間分割的檔案名稱,以增量方式將新檔案從 Azure Blob 儲存體複製到 Azure Blob 儲存體。
附註
如果你是Azure Data Factory新手,請參考Azure Data Factory導論。
在本教學課程中,您會執行下列步驟:
- 建立資料處理站。
- 使用複製資料工具建立管線。
- 監視管線和活動執行。
先決條件
- Azure 訂閱:如果你沒有Azure訂閱,請在開始前建立一個free帳號。
- Azure 儲存體帳戶:使用 Blob 儲存體作為來源和接收器資料存放區。 如果你沒有Azure儲存帳號,請參考建立儲存帳號中的說明。
在 Blob 儲存體中建立兩個容器
請執行下列步驟,為本教學課程準備 Blob 儲存體。
建立名為 source的容器。 在容器中建立資料夾路徑為 2021/07/15/06 。 建立空的文字檔,並將它命名為 file1.txt。 將 file1.txt 上傳至記憶體帳戶中資料夾路徑 來源/2021/07/15/06 。 你可以使用各種工具來執行這些任務,例如Azure 儲存體總管。
附註
請使用您的 UTC 時間調整資料夾名稱。 例如,如果目前的 UTC 時間是 2021 年 7 月 15 日上午 6:10,您可以依據來源/{Year}/{Month}/{Day}/{Hour}/{Hour}/{Hour}, 的規則,建立資料夾路徑作為 source/2021/07/06/ 。
建立名為 destination 的容器。 你可以使用各種工具來執行這些任務,例如Azure 儲存體總管。
建立 Data Factory
在頂端功能表上,選取 [建立資源>分析>Data Factory ] :
在 [ 新增數據處理站] 頁面上的 [ 名稱] 底下,輸入 ADFTutorialDataFactory。
資料處理站的名稱必須是「全域唯一」的名稱。 您可能會收到下列錯誤訊息:
如果您收到有關名稱值的錯誤訊息,請輸入不同的資料處理站名稱。 例如,使用 您的名稱ADFTutorialDataFactory。 如需 Data Factory 成品的命名規則,請參閱 Data Factory 命名規則。
請選擇 Azure subscription 來建立新的資料工廠。
針對 [資源群組],採取下列其中一個步驟︰
一。 選取 [使用現有的] ,然後從下拉式清單選取現有的資源群組。
b。 選取 [建立新的] ,然後輸入資源群組的名稱。
想了解資源群組,請參見 Use resource groups to manage your Azure resources。
在 [版本] 下,選取 [V2] 作為版本。
在 [位置] 下,選取資料處理站的位置。 只有受到支援的位置會顯示在下拉式清單中。 資料工廠使用的資料儲存(例如 Azure 儲存體 和 SQL Database)和運算工具(例如 Azure HDInsight)可能位於其他地點和區域。
選取 [建立]。
建立完成之後, 就會顯示Data Factory 首頁。
要在獨立分頁啟動Azure Data Factory使用者介面(UI),請在
Open Azure Data Factory Studio 圖塊中選擇 Open 。
使用複製資料工具建立管線
在Azure Data Factory首頁,選擇 Ingest 標題以啟動複製資料工具。
在 [屬性] 頁面上,採取下列步驟:
在 [工作類型] 下方,選擇 [內建複製工作]。
在 [工作步調或工作排程] 下方,選取 [輪轉視窗]。
在 [定期] 下方,輸入 [1 小時]。
選取 [下一步] 。
在 [來源資料存放區] 頁面上,完成下列步驟:
一。 選取 [+ 新增連線] 以新增連線。
b。 從圖庫中選擇 Azure Blob 儲存體,然後選擇 繼續。
c. 在 New connection (Azure Blob 儲存體) 頁面輸入該連線名稱。 選擇您的Azure訂閱,並從儲存帳戶名稱列表中選擇您的儲存帳戶。 測試 [連線],然後選取 [建立]。
d. 在 [來源資料存放區] 頁面上,選取 [連線] 區段中新建立的連線。
e. 在 [檔案或資料夾] 區段中,瀏覽並選取 [來源] 容器,然後選取 [確定]。
f。 在 [檔案載入行為] 下方,選取 [累加載入:時間分割的資料夾/檔案名稱]。
g. 將動態資料夾路徑寫入 為 source/{year}/{month}/{day}/{hour}/,並變更格式,如下列螢幕快照所示。
h. 勾選 [二進位副本],然後選取 [下一步]。
在 [目的地資料存放區] 頁面上,完成下列步驟:
選取與資料來源存放區相同儲存體帳戶的 [AzureBlobStorage]。
瀏覽並選取 [目的地] 資料夾,然後選取 [確定]。
將動態資料夾路徑寫入 目的地/{year}/{month}/{day}/{hour}/,並變更格式,如下列螢幕快照所示。
選取 [下一步] 。
在 [ 設定 ] 頁面上的 [ 工作名稱] 下,輸入 DeltaCopyFromBlobPipeline,然後選取 [ 下一步]。 Data Factory 使用者介面會使用指定的工作名稱建立管線。
在 [摘要] 頁面上檢閱設定,然後選取 [下一步]。
在 [ 部署] 頁面上,選取 [ 監視 ] 以監視管線 (工作)。
請注意,系統會自動選取左側的 [監視] 索引標籤。 當管線觸發時,您需要等待管線執行 (大約一小時後)。 執行時,選取管線名稱連結 DeltaCopyFromBlobPipeline 以檢視活動執行詳細數據或重新執行管線。 選取 [重新整理] 可重新整理清單。
管線中只有一個活動 (複製活動),所以您只會看到一個項目。 調整 來源 和 目的地 數據行的數據行寬度(如有必要),以顯示更多詳細數據,您可以看到來源檔案 (file1.txt) 已從 source/2021/07/15/06/ 複製到 目的地/2021/07/15/06/ 具有相同檔名。
你也可以用 Azure 儲存體總管(https://storageexplorer.com/)掃描檔案來驗證。
建立另一個空白文字檔,使用新名稱為file2.txt。 將 file2.txt 檔案上傳至記憶體帳戶中的資料夾路徑 來源/2021/07/07/15/07 。 你可以使用各種工具來執行這些任務,例如Azure 儲存體總管。
附註
您可能會注意到需要建立新的資料夾路徑。 請使用您的 UTC 時間調整資料夾名稱。 例如,如果目前的 UTC 時間為 2021 年 7 月 15 日上午 7:30, 2021 年 15 日,您可以依據 {Year}/{Month}/{Day}/{Hour}//07/ 的規則,將資料夾路徑建立為 source/2021/07/07/ 。
若要回到 [管線執行] 檢視,請選取 [所有管線執行],然後等待一小時後自動觸發相同的管線。
針對第二個管線執行選取新的 DeltaCopyFromBlobPipeline 連結,然後執行相同的動作以檢閱詳細資料。 您會看到來源檔案 (file2.txt) 已從 source/2021/07/15/07/ 複製到 destination/2021/07/15/07/,並保持相同的檔名。 你也可以用 Azure 儲存體總管(https://storageexplorer.com/)掃描 destination 容器中的檔案來驗證。
相關內容
請繼續閱讀以下教學,了解如何在 Azure 上使用 Spark 叢集轉換資料: