簡介
原始數據很少會以可供分析的格式呈現。 缺失值、重複紀錄、不一致的資料型態以及結構不良的資料集,都是資料工程師必須解決的常見挑戰,才能讓資料產生商業價值。 若缺乏適當的淨化與轉換,分析結果將變得不可靠,下游流程也會失敗。 Azure Databricks 中的 Unity 目錄提供治理基礎,用於管理轉換後的資料資產。
Azure Databricks 提供完整的資料品質與轉換工具包。 資料剖析 產生摘要統計,揭示如空率、意外值分布及資料漂移等問題。 類型選擇 確保欄位使用適當的資料型別以提升儲存效率與查詢效能。 重複與空處理 技術能讓你使用 SQL 或 PySpark 識別並解決常見的資料品質問題。 轉換操作包括篩選、分組、聚合、合併及集合運算子,會重新塑造資料以符合分析需求。
除了基本的變形外,你還會運用進階的重塑技巧。 非正規化 會將相關資料表攤平,以提升查詢效能。 樞軸化 將列值旋轉為欄位以進行交叉表格分析,而 非樞軸 化則是對正規化資料結構的反向處理。 最後,像是附加、覆寫和合併等 載入策略 ,確保轉換後的資料正確地落入目標資料表——無論是新增紀錄、替換現有資料,或透過 upsert 操作同步變更。
完成本模組後,你將了解如何透過剖析評估資料品質、應用清理技術解決常見問題、使用 SQL 與 PySpark 操作轉換資料,並將結果載入 Unity 目錄資料表,並依照每種情境的適當策略。