連接並管理 Microsoft Purview 中的 Azure Databricks

本文說明如何註冊 Azure Databricks,以及如何在 Microsoft Purview 中驗證與互動 Azure Databricks。 欲了解更多關於 Microsoft Purview 的資訊, 請閱讀導言文章。

支援功能

掃描能力

元資料擷取 全掃描 增量掃描 瞄準鏡掃描
是 是 否 是

注意事項

此連接器帶來來自 Azure Databricks 工作空間範圍的 Hive 元儲存庫的元資料。 若要掃描 Azure Databricks Unity Catalog 中的元資料,請參考 Azure Databricks Unity Catalog 連接器。

掃描 Azure Databricks Hive 元儲存庫時,Microsoft Purview 支援:

  • 擷取技術元資料,包括:

    • Azure Databricks workspace
    • 蜂巢伺服器
    • 資料庫
    • 資料表包括欄位、外鍵、唯一限制與儲存描述
    • 視圖,包括欄位與儲存描述
  • 外部資料表與 Azure Data Lake Storage Gen2/Azure Blob 資產 (外部位置之間的擷取關係) 。

  • 根據檢視定義擷取資料表與檢視之間的靜態血緣。

在設定掃描時,你可以選擇掃描整個 Hive 元儲存庫,或是對應部分結構的範圍掃描。

相比之下,如果你之前用 Hive Metastore 連接器掃描 Azure Databricks:

  • 你可以直接設定 Azure Databricks 工作區的掃描,而不需要直接存取 HMS。 它使用 Databricks 的個人存取權杖進行認證,並連接叢集進行掃描。
  • Databricks 工作區資訊會被擷取。
  • 資料表與儲存資產之間的關係被捕捉。

其他功能

關於 分類、 敏感性標籤、 政策、 資料血統及 即時檢視,請參閱 支援功能清單。

已知限制

當你從資料來源刪除物件時,後續掃描不會自動移除 Purview 中對應的資產。

必要條件

  • 你必須有一個 Azure 帳號並且有有效訂閱。 免費註冊帳號。

  • 您必須擁有一個有效的 Microsoft Purview 帳號。

  • 你需要一個Azure 金鑰保存庫,並且要授權 Microsoft Purview 存取機密。

  • 你需要 Data Source Administrator 和 Data Reader 權限,才能在 Microsoft Purview 治理入口網站註冊並管理來源。 欲了解更多權限相關資訊,請參閱 Microsoft Purview 中的存取控制。

  • 設定最新的 自架整合執行時。 欲了解更多資訊,請參閱 建立並配置自架整合執行時。 最低支援的自架化 Integration Runtime 版本為 5.20.8227.2。

    • 確保 JDK 11 安裝在安裝自架整合執行環境的機器上。 在你重新安裝 JDK 後重新啟動機器,這樣它才會生效。

    • 確保C++ 可轉散發套件 (Visual Studio 2012 Update 4 或更新的) 安裝在運行自架整合執行時的機器上。 如果你還沒安裝這個更新,現在就 下載吧。

  • 在您的 Azure Databricks 工作空間中:

    • 產生一個個人存取權杖,並將其存為Azure 金鑰保存庫的秘密。

    • 建立一個群組。 請注意叢集 ID——你可以在 Azure Databricks 工作區找到它 - 計算 - 你的叢集 -> 標籤 -> 自動新增標籤 ->ClusterId 。>>

    • 請確保使用者具備以下權限,以便連接到 Azure Databricks 叢集:

      • 可以連接 到正在執行的叢集。
      • 如果叢集在連線時狀態結束,可以自動觸發重新啟動權限。

登錄

本節說明如何利用Microsoft Purview 治理入口網站Microsoft註冊 Azure Databricks 工作空間。

  1. 請前往您的 Microsoft Purview 帳號。

  2. 在左側窗格選擇 「資料映射 」。

  3. 選取 [登錄]。

  4. 在 Register sources 中,選擇 Azure Databricks>Continue。

  5. 在 Databricks) (Azure 暫存器來源畫面中,請完成以下步驟:

    1. 在「 名稱」中,輸入 Microsoft Purview 列出的資料來源名稱。

    2. 對於 Azure 訂閱和 Databricks 工作區名稱,請從下拉選單選擇你想掃描的訂閱和工作區。 Databricks 工作區的網址會自動被填入。

    3. 從列表中選擇一個收藏。

    註冊 Azure Databricks 來源的截圖。

  6. 選取 [完成]。

掃描

提示

要排除掃描時出現的問題:

  1. 確認你有遵守所有 先修條件。
  2. 請查看掃描故障排除文件。

請使用以下步驟掃描 Azure Databricks,以自動識別資產。 欲了解更多關於掃描的資訊,請參閱 Microsoft Purview 中的掃描與資料擷取。

  1. 在管理中心,選擇整合執行時。 確保有自架整合執行時。 如果還沒設定好,請依照 Create 中的步驟 操作,管理一個自架整合執行環境。

  2. 請參考 資料來源。

  3. 選擇已註冊的 Azure Databricks。

  4. 選擇 + 新掃描。

  5. 提供下列詳細資料:

    1. 姓名:輸入掃描所需的姓名。

    2. 萃取方法: 請指示從 Hive Metastore 或 Unity 目錄擷取元資料。 選擇 Hive Metastore。

    3. 透過整合執行時連接:選擇已設定的自主機化整合執行時。

    4. 憑證:選擇要連接到資料來源的憑證。 務必:

      • 在建立憑證時選擇 存取權杖認證 。
      • 在適當的欄位輸入你在 Prerequisites 中建立的個人存取權杖的秘密名稱。

      欲了解更多資訊,請參閱 Microsoft Purview 中的來源驗證憑證。

    5. 叢集 ID:指定 Microsoft Purview 連接並驅動掃描的叢集 ID。 你可以在 Azure Databricks 工作區找到它 - 計算 - 你的叢集 -> 標籤 -> 自動新增標籤 ->ClusterId 。>>

      1. 掛載點:當您手動掛載外部儲存到 Databricks 時,請提供掛載點和 Azure 儲存來源位置字串。 請使用格式 /mnt/<path>=abfss://<container>@<adls_gen2_storage_account>.dfs.core.windows.net/;/mnt/<path>=wasbs://<container>@<blob_storage_account>.blob.core.windows.net。 它用來捕捉 Microsoft Purview 中資料表與相應儲存資產之間的關係。 此為選用設定。 如果你沒特別說明,關係就不會被檢索。

      你可以在 Databricks 工作空間中執行以下 Python 指令,取得掛載點清單:

      dbutils.fs.mounts()
      

      它會像下面這樣列印所有安裝點:

      [MountInfo(mountPoint='/databricks-datasets', source='databricks-datasets', encryptionType=''),
      MountInfo(mountPoint='/mnt/ADLS2', source='abfss://samplelocation1@azurestorage1.dfs.core.windows.net/', encryptionType=''),
      MountInfo(mountPoint='/databricks/mlflow-tracking', source='databricks/mlflow-tracking', encryptionType=''), 
      MountInfo(mountPoint='/mnt/Blob', source='wasbs://samplelocation2@azurestorage2.blob.core.windows.net', encryptionType=''),
      MountInfo(mountPoint='/databricks-results', source='databricks-results', encryptionType=''),
      MountInfo(mountPoint='/databricks/mlflow-registry', source='databricks/mlflow-registry', encryptionType=''), MountInfo(mountPoint='/', source='DatabricksRoot', encryptionType='')]  
      

      在此範例中,指定以下為安裝點:

      /mnt/ADLS2=abfss://samplelocation1@azurestorage1.dfs.core.windows.net/;/mnt/Blob=wasbs://samplelocation2@azurestorage2.blob.core.windows.net

    6. Schema:需匯入的結構子集,以分號分隔的結構清單表示。 例如,schema1;schema2。 如果該清單是空的,所有使用者結構都會被匯入。 所有系統架構與物件預設都會被忽略。

      可接受的結構名稱模式可以是靜態名稱,也可以包含萬用字百分比。 例如:A%;%B;%C%;D

      • 以 A 或
      • 以 B 或 結尾
      • 包含 C 或
      • 等於D

      使用NOT和特殊字元是不可接受的。

      注意事項

      此結構過濾器支援於自架型 Integration Runtime 版本 5.32.8597.1 及以上版本。

    7. 最大可用記憶體:客戶機器上) 可提供最大記憶體 ((以 GB 計)供掃描程序使用。 此值取決於要掃描的 Azure Databrick 大小。

      注意事項

      作為一個經驗法則,請每 1000 個資料表提供 1GB 記憶體。

    設定 Azure Databricks 掃描的截圖。

  6. 選取 [繼續]。

  7. 對於掃描 觸發,選擇是設定排程還是只執行一次掃描。

  8. 檢視你的掃描結果,選擇 儲存並執行。

掃描成功完成後,請了解如何瀏覽和搜尋 Azure Databricks 資產。

查看您的掃描與掃描跑數

查看現有掃描檔:

  1. 前往 Microsoft Purview 入口網站。 在左側窗格選擇 「資料地圖」。
  2. 選擇資料來源。 你可以在 「最近掃描」頁面查看該資料來源上現有的掃描清單,或在 「掃描」 標籤中查看所有掃描。
  3. 選擇你想查看的掃描結果。 面板會顯示所有之前的掃描紀錄,以及每次掃描的狀態和指標。
  4. 選擇跑道 ID 來檢查 掃描跑的細節。

管理你的掃描

要編輯、取消或刪除掃描件:

  1. 前往 Microsoft Purview 入口網站。 在左側窗格,選擇 資料映射。

  2. 選擇資料來源。 你可以在 「最近掃描」頁面查看該資料來源上現有的掃描清單,或在 「掃描」 標籤中查看所有掃描。

  3. 選擇你想管理的掃描。 然後您可以:

    • 請選擇 「編輯掃描」來編輯掃描。
    • 選擇 取消掃描執行,請取消進行中的掃描。
    • 選擇 刪除掃描後刪除掃描。

注意事項

  • 刪除掃描檔不會刪除之前掃描產生的目錄資產。

瀏覽與搜尋資產

掃描 Azure 資料磚後,您可以瀏覽整合式目錄或搜尋整合式目錄以查看資產詳情。

從 Databricks 工作區資產中,你可以找到相關的 Hive Metastore 和資料表/視圖,反過來也適用。

依來源類型瀏覽資產的截圖。

瀏覽至 Azure Databricks 來源資產細節的截圖。

找到與 Azure Databricks 來源相關的 Hive Metastore 的截圖。

譜系

請參閱支援能力部分,了解支援的 Azure Databricks 情境。 欲了解更多關於血統的一般資訊,請參閱 資料血統 及 血統使用者指南。

到蜂巢表格/檢視資產 -> 血統分頁,你可以在適用時看到資產關係。 關於表格與外部儲存資產之間的關係,你會看到 Hive 表格資產和儲存資產是雙向直接連接的,因為它們彼此影響。 如果你在建立表格陳述式中使用 mount point,你需要在 掃描設定 中提供 mount point 資訊以提取這種關聯。

顯示 Azure Databricks 血統範例的截圖。

後續步驟

現在你已經註冊了來源,請參考以下指南,進一步了解 Microsoft Purview 及你的資料: