使用 Azure Databricks 部署與維護資料管線與工作負載
速覽
-
層級
-
技能
-
Products
-
角色
-
主旨
掌握 Azure Databricks 中建置、部署及維護生產環境資料管線的完整生命週期——從設計、編排到監控與優化。
在此學習路徑結束時,您將能夠:
- 設計並實作使用筆記本與 Lakeflow 管線的強大資料管線
- 建立並協調 Lakeflow 工作,具備觸發器、排程與錯誤處理功能
- 應用版本控制,並使用 Git 與宣告式自動化套件,部署管線於不同環境
- 監控、排除故障並優化資料工作負載以提升可靠性與效能
必要條件
- 對 Azure Databricks 工作空間有良好理解
- 熟悉資料工程概念與 SQL
- 具備 Python 程式設計與筆記本的使用經驗
- Git 版本控制基礎知識
成就代碼
您要請求成就代碼嗎?
此學習路徑中的課程模組
學習如何在 Azure Databricks 中設計並實作強大的資料管線,使用筆記本與 Lakeflow 管線,涵蓋編排、錯誤處理與任務邏輯。
本模組將引導您了解如何在 Azure Databricks 中實作 Lakeflow Jobs。 你將學習如何建立工作、設定觸發器與排程、設定警示,以及管理自動重啟,以確保資料管線的可靠執行。
Azure Databricks 透過 Git 資料夾整合既有開發實務,用於版本控制,以及宣告式自動化套件(Declarative Automation Bundles)用於基礎設施即程式碼部署。 本模組探討 Git 版本控制最佳實務、分支與拉取請求工作流程、全面測試策略,以及基於 CLI 的套件在各環境間的部署。
監控與優化對於在 Azure Databricks 中運行可靠且具成本效益的資料工作負載至關重要。 本模組探討叢集消耗指標、Lakeflow Jobs 故障排除、Spark 工作診斷、快取效能優化、偏移、溢出與洗牌問題,以及日誌串流至 Azure Log Analytics。