Fontes de dados que se conectam ao Mapa de Dados

Este artigo lista as fontes de dados, os tipos de arquivo e os conceitos de verificação com suporte no Mapa de Dados do Microsoft Purview.

Listagem da fonte de dados por tipo

As tabelas abaixo mostram todas as fontes de dados que têm metadados técnicos disponíveis no Mapa de Dados do Microsoft Purview, juntamente com outros recursos com suporte. Selecione um nome de fonte de dados na coluna Fonte de dados para obter instruções sobre como conectar essa fonte ao Mapa de Dados.

Azure

Os recursos do Azure só estão disponíveis no mesmo locatário que sua conta do Microsoft Purview, a menos que seja indicado o contrário na página de cada fonte de dados.

Fonte de dados Pode aplicar classificações automaticamente Pode aplicar rótulos de confidencialidade a ativos do Mapa de Dados Pode aplicar políticas Linhagem de dados Acessível no modo de exibição ao vivo
Selecione o link para obter instruções de conexão e digitalização. Selecione Sim para obter instruções de digitalização. Saiba como as classificações são aplicadas durante a verificação. Saiba mais sobre a rotulagem de confidencialidade (versão prévia). Selecione Sim para ver as políticas com suporte; Por exemplo, proprietário dos dados, acesso de autoatendimento ou proteção. Selecione Sim para obter detalhes. Saiba mais sobre o modo de exibição ao vivo.
Várias fontes Sim Dependente da origem Sim Não Limitado
Azure Storage Blob Sim Sim Sim (versão prévia) Limitado* Sim
API do Azure Cosmos DB for SQL Sim Sim Não Não* Não
Azure Data Explorer Sim Sim Não Não* Não
Azure Data Factory Não Não Não Sim Não
Azure Data Lake Storage Gen2 Sim Sim Sim (versão prévia) Limitado* Sim
Azure Data Share Não Não Não Sim Não
Banco de Dados do Azure para MySQL Sim Sim Não Não* Não
Banco de dados do Azure para PostgreSQL Sim Sim Não Não* Não
Metastore do Hive do Azure Databricks Sim** Não Não Sim Não
Catálogo do Unity no Azure Databricks Sim*** Não Não Sim Não
Pool de SQL Dedicado do Azure (antigo SQL DW) Sim Não Não Não* Não
Arquivos do Azure Sim Sim Não Limitado* Não
Azure Machine Learning Não Não Não Sim Não
Banco de Dados SQL Azure Sim Sim Sim^ Sim (versão prévia) Sim
Instância Gerenciada de SQL do Azure Sim Sim Sim Não* Não
Azure Synapse Analytics (Workspace) Sim Sim Não Sim - Pipelines do Synapse Não

* Além da linhagem em ativos dentro da fonte de dados, a linhagem também terá suporte se o conjunto de dados for usado como uma origem/coletor no pipeline do Data Factory ou do Synapse.

** Suporte de classificação apenas para o Catálogo do Unity na fonte de dados do Azure Databricks.

Não há suporte para a classificação personalizada para a origem do Catálogo do Unity do Azure Databricks.

^ Não há suporte para políticas de proteção no Banco de Dados SQL do Azure.

Banco de dados

Fonte de dados Pode aplicar classificações automaticamente Pode aplicar rótulos de confidencialidade a ativos do Mapa de Dados Pode aplicar políticas Linhagem de dados Acessível no modo de exibição ao vivo
Selecione o link para obter instruções de conexão e digitalização. Selecione Sim para obter instruções de digitalização. Saiba como as classificações são aplicadas durante a verificação. Saiba mais sobre a rotulagem de confidencialidade (versão prévia). Selecione Sim para ver as políticas com suporte; Por exemplo, proprietário dos dados, acesso de autoatendimento ou proteção. Selecione Sim para obter detalhes. Saiba mais sobre o modo de exibição ao vivo.
Amazon RDS Sim Não Não Não Não
Amazon Redshift Não Não Não Não Não
Cassandra Não Não Não Sim Não
DB2 Não Não Não Sim Não
BigQuery do Google Não Não Não Sim Não
Banco de Dados do Metastore do Hive Não Não Não Sim* Não
Mongodb Não Não Não Não Não
MySQL Não Não Não Sim Não
Oracle Sim Não Não Sim* Não
PostgreSQL Não Não Não Sim Não
Warehouse de Negócios do SAP Não Não Não Não Não
SAP HANA Não Não Não Não Não
Snowflake Sim Sim Não Sim* Não
SQL Server Sim Sim Não Não* Não
SQL Server no Azure-Arc Sim Não Sim Não* Não
Teradata Sim Não Não Sim* Não

* Além da linhagem em ativos dentro da fonte de dados, a linhagem também terá suporte se o conjunto de dados for usado como uma origem/coletor no pipeline do Data Factory ou do Synapse.

Arquivo

Fonte de dados Pode aplicar classificações automaticamente Pode aplicar rótulos de confidencialidade a ativos do Mapa de Dados Pode aplicar políticas Linhagem de dados Acessível no modo de exibição ao vivo
Selecione o link para obter instruções de conexão e digitalização. Selecione Sim para obter instruções de digitalização. Saiba como as classificações são aplicadas durante a verificação. Saiba mais sobre a rotulagem de confidencialidade (versão prévia). Selecione Sim para ver as políticas com suporte; Por exemplo, proprietário dos dados, acesso de autoatendimento ou proteção. Selecione Sim para obter detalhes. Saiba mais sobre o modo de exibição ao vivo.
Amazon S3 Sim Não Não Limitado* Não
HDFS (Sistema de Arquivos Distribuído do Hadoop) Sim Não Não Não Não

* Além da linhagem em ativos dentro da fonte de dados, a linhagem também terá suporte se o conjunto de dados for usado como uma origem/coletor no pipeline do Data Factory ou do Synapse.

Serviços e aplicativos

Fonte de dados Pode aplicar classificações automaticamente Pode aplicar rótulos de confidencialidade a ativos do Mapa de Dados Pode aplicar políticas Linhagem de dados Acessível no modo de exibição ao vivo
Selecione o link para obter instruções de conexão e digitalização. Selecione Sim para obter instruções de digitalização. Saiba como as classificações são aplicadas durante a verificação. Saiba mais sobre a rotulagem de confidencialidade (versão prévia). Selecione Sim para ver as políticas com suporte; Por exemplo, proprietário dos dados, acesso de autoatendimento ou proteção. Selecione Sim para obter detalhes. Saiba mais sobre o modo de exibição ao vivo.
Fluxo de ar Não Não Não Sim Não
Dataverse Sim Sim Não Não Não
Erwin Não Não Não Sim Não
Tecido Não Não Não Sim Sim
Looker Não Não Não Sim Não
Power BI Não Não Não Sim Sim**
Qlik Sense Não Não Não Não Não
Salesforce Não Não Não Não Não
SAP ECC Não Não Não Sim* Não
SAP S/4HANA Não Não Não Sim* Não
Tableau Não Não Não Não Não

* Além da linhagem em ativos dentro da fonte de dados, a linhagem também terá suporte se o conjunto de dados for usado como uma origem/coletor no pipeline do Data Factory ou do Synapse.

** Os itens do Power BI em um locatário do Fabric estão disponíveis usando o modo de exibição dinâmico.

Observação

Atualmente, o Mapa de Dados do Microsoft Purview não pode verificar um ativo que tenha /, \, ou # em seu nome. Para definir o escopo da verificação e evitar a verificação de ativos que tenham esses caracteres no nome do ativo, use o exemplo em Registrar e verificar um Banco de Dados SQL do Azure.

Importante

Se você planeja usar um runtime de integração auto-hospedada, a verificação de algumas fontes de dados requer configuração extra no computador de runtime de integração auto-hospedada. Por exemplo, JDK, Microsoft Visual C++ Redistribuível ou driver específico. Para obter a fonte, consulte cada artigo de origem para obter detalhes de pré-requisito. Todos os requisitos estão listados na seção Pré-requisitos .

Regiões do scanner de mapa de dados

A lista a seguir mostra as regiões da fonte de dados do Azure (data center) em que o verificador de Mapa de Dados é executado. Se sua fonte de dados do Azure estiver em uma região fora dessa lista, o verificador será executado na região de sua instância do Microsoft Purview.

  • Leste da Austrália
  • Sudeste da Austrália
  • Sul do Brasil
  • Canadá Central
  • Leste do Canadá
  • Índia Central
  • China Norte 3
  • Leste da Ásia
  • Leste dos EUA
  • Leste 2 dos EUA
  • França Central
  • Centro-Oeste da Alemanha
  • Leste do Japão
  • Coréia Central
  • Centro-Norte dos EUA
  • Norte da Europa
  • Catar Central
  • Norte da África do Sul
  • Centro-Sul dos EUA
  • Sudeste da Ásia
  • Suíça (Norte)
  • Emirados Árabes Unidos Norte
  • Sul do Reino Unido
  • USGov Virgínia
  • Centro-Oeste dos EUA
  • Europa Ocidental
  • Oeste dos EUA
  • Oeste 2 dos EUA
  • West US 3

Tipos de arquivos com suporte para verificação

Os tipos de arquivo listados na seção a seguir dão suporte a verificação, extração de esquema e classificação, quando aplicável. Além disso, o Mapa de Dados dá suporte a extensões de arquivo personalizadas e analisadores personalizados.

Os formatos de arquivo estruturados com suporte pela extensão incluem verificação, extração de esquema e classificação de nível de ativo e coluna:

  • AVRO
  • CSV
  • GZIP
  • JSON
  • ORC
  • PARQUET*
  • PSV
  • CSV
  • TSV
  • TXT
  • XML

*Para arquivos PARQUET não compactados, todos os formatos Parquet são suportados. Para arquivos PARQUET compactados, há suporte apenas para o formato Parquet rápido.

Os formatos de arquivo de documento suportados pela extensão incluem digitalização e classificação no nível do ativo:

  • DOC
  • DOCM
  • DOCX
  • PONTO
  • ODP (em inglês)
  • ODS (em inglês)
  • ODT
  • PDF
  • POTE
  • PPS
  • PPSX
  • PPT
  • PPTM
  • PPTX
  • XLC
  • XLS
  • XLSB
  • Experiência XLSM
  • XLSX
  • XLT

Observação

Limitações conhecidas:

  • O verificador de Mapa de Dados do Microsoft Purview dá suporte apenas à extração de esquema para os tipos de arquivo estruturado listados na seção anterior.
  • Para os tipos de arquivo AVRO, ORC e PARQUET, o verificador não dá suporte à extração de esquema para arquivos que contêm tipos de dados complexos (por exemplo, MAP, LIST, STRUCT).
  • Para arquivos PARQUET não compactados, todos os formatos Parquet são suportados. Para arquivos PARQUET compactados, apenas o formato Parquet rápido é compatível com a extração e classificação de esquema.
  • Para tipos de arquivo GZIP, o GZIP deve ser mapeado para um único arquivo CSV. Os arquivos GZIP estão sujeitos a regras de classificação personalizadas e do sistema. No momento, o verificador não oferece suporte à verificação de um arquivo GZIP mapeado para vários arquivos ou qualquer tipo de arquivo diferente de CSV.
  • Para arquivos Parquet, se você estiver usando um runtime de integração auto-hospedada, precisará instalar o JRE 11 (Java Runtime Environment) de 64 bits ou o OpenJDK em sua máquina de IR. Consulte o guia de instalação do tempo de execução Java.
  • Não há suporte para o formato Delta. Se você estiver digitalizando o formato Delta diretamente de uma fonte de dados de armazenamento como o Microsoft Azure Data Lake Storage Gen2, o conjunto de arquivos Parquet do formato delta será analisado e tratado como conjunto de recursos, conforme descrito em Noções básicas sobre conjuntos de recursos. As colunas usadas para particionamento não são reconhecidas como parte do esquema do conjunto de recursos.
  • Codificações Parquet sem suporte: o Microsoft Purview não dá suporte à extração de esquema para arquivos Parquet que usam RLE (codificação de comprimento de execução) no Microsoft Fabric Lakehouse. Tabelas contendo colunas codificadas em RLE podem falhar ao extrair metadados de esquema, incluindo tabelas, colunas e tipos de dados. O processo ainda descobre metadados no nível do ativo (L1). Para habilitar a extração completa do esquema, recrie as tabelas afetadas usando um formato de codificação compatível, como dicionário ou codificação simples.

Para tipos de arquivo delimitados (CSV, PSV, SSV, TSV, TXT):

  • Arquivos delimitados com apenas uma coluna não podem ser determinados como arquivos CSV e não têm esquema.
  • Não há suporte para a detecção do tipo de dados. O tipo de dados é listado como "cadeia de caracteres" para todas as colunas.
  • Os únicos delimitadores com suporte são vírgula(','), ponto e vírgula(';'), barra vertical('|') e tab('\t').
  • Arquivos delimitados com menos de três linhas não poderão ser determinados como arquivos CSV se estiverem usando um delimitador personalizado. Por exemplo, arquivos com delimitador ~ e menos de três linhas não podem ser determinados como arquivos CSV.
  • Se um campo contiver aspas duplas, estas só poderão aparecer no início e no final do campo e deverão ser correspondentes. Aspas duplas que aparecem no meio do campo ou aparecem no início e no final, mas não são correspondentes, são reconhecidas como dados inválidos e nenhum esquema é analisado do arquivo. As linhas com um número diferente de colunas do que a linha de cabeçalho são julgadas como linhas de erro. O número de linhas de erro dividido pelo número de linhas amostradas deve ser menor que 0,1.

Extração de esquema

Para fontes de dados que dão suporte à extração de esquema durante a verificação, o número de colunas não trunca diretamente o esquema de ativo.

Dados aninhados

Dados aninhados só têm suporte para conteúdo JSON. Para todos os tipos de arquivo compatíveis com o sistema, se houver conteúdo JSON aninhado em uma coluna, o verificador analisará os dados JSON aninhados e os exibirá na guia de esquema do ativo.

Dados aninhados ou análise de esquema aninhado não são compatíveis com o SQL. Uma coluna com dados aninhados será relatada e classificada como está, e os subdados não serão analisados.

Dados de amostragem para classificação

Na terminologia do Mapa de Dados,

  • Varredura L1: extrai informações básicas e metadados, como nome de arquivo, tamanho e nome totalmente qualificado.
  • L2 scan: Extrai o esquema para tipos de arquivos estruturados e tabelas de banco de dados.
  • Verificação L3: Extrai o esquema quando aplicável e sujeita o arquivo amostrado às regras de classificação do sistema e personalizadas.

Saiba mais sobre como personalizar os níveis de verificação.

Para todos os formatos de arquivo estruturados, o verificador de Mapa de Dados do Microsoft Purview exemplos de arquivos da seguinte maneira:

  • Para tipos de arquivos estruturados, ele mostra as 128 primeiras linhas em cada coluna ou o primeiro 1 MB, o que for menor.
  • Para formatos de arquivo de documento, ele mostra os primeiros 20 MB de cada arquivo.
  • Se um arquivo de documento for maior que 20 MB, o scanner não executará uma varredura profunda (sujeito a classificação). Nesse caso, o Microsoft Purview captura apenas metadados básicos, como nome de arquivo e nome totalmente qualificado.
  • Para fontes de dados tabulares (SQL), ele mostra as 128 primeiras linhas.
  • Para o Azure Cosmos DB para NoSQL, até 300 propriedades distintas dos primeiros 10 documentos em um contêiner são coletadas para o esquema. Para cada propriedade, o scanner mostra valores de até 128 documentos ou o primeiro 1 MB.
  • Para formatos de dados não estruturados, como arquivos DOCX, não há exigência de atender a uma condição de oito valores distintos. A presença de uma única palavra-chave relevante é suficiente para a classificação.

Amostragem de arquivo do conjunto de recursos

Se uma pasta ou grupo de arquivos de partição corresponder a uma política de conjunto de recursos do sistema ou a uma política de conjunto de recursos definida pelo cliente, o Mapa de Dados o detectará como um conjunto de recursos. Se o scanner detectar um conjunto de recursos, ele obterá amostras de cada pasta que contém. Para obter mais informações sobre conjuntos de recursos, consulte Conjuntos de recursos no Mapa de Dados do Microsoft Purview.

Amostragem de arquivos para conjuntos de recursos por tipos de arquivo:

  • Arquivos delimitados (CSV, PSV, SSV, TSV): O scanner mostra 1 em cada 100 arquivos (verificação L3) em uma pasta ou grupo de arquivos de partição que são considerados um conjunto de recursos.
  • Tipos de arquivo do Data Lake (Parquet, Avro, Orc): O scanner mostra 1 em 18.446.744.073.709.551.615 (máx. longo) arquivos (verificação L3) em uma pasta ou grupo de arquivos de partição que são considerados como um conjunto de recursos.
  • Outros tipos de arquivos estruturados (JSON, XML, TXT): O scanner mostra 1 em cada 100 arquivos (verificação L3) em uma pasta ou grupo de arquivos de partição que são considerados um conjunto de recursos.
  • Objetos SQL e entidades do Azure Cosmos DB: O scanner L3 verifica cada arquivo.
  • Tipos de arquivo de documento: O scanner L3 verifica cada arquivo. Os padrões de conjunto de recursos não se aplicam a esses tipos de arquivo.

Próximas etapas