Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
A arquitetura do CluedIn fornece às empresas métricas sobre a qualidade dos dados que ingere, detectando de forma inteligente dados sujos e preparando-os para limpeza por engenheiros de dados e administradores de dados. Algoritmos proprietários de aprendizado de máquina de lógica difusa ajudam os usuários de negócios e curadores a rotular dados e ensinam o sistema a identificar, corrigir e evitar problemas de qualidade de dados ao longo do tempo.
Arquitetura
Fluxo de Dados
A solução CluedIn consiste em várias camadas funcionais que são executadas em um cluster Kubernetes no Serviço de Kubernetes do Azure (AKS). Uma combinação de aplicativos de microsserviço .NET Core lida com funções distintas, como ingestão de dados, processamento de dados de streaming, enfileiramento e interface do usuário.
A camada de rastreamento CluedIn ingere dados de fontes de nuvem do cliente, como banco de dados SQL do Azure, Azure Cosmos DB, PostgreSQL e Salesforce por meio de conectores do Azure Data Factory.
O CluedIn também recebe informações de sistemas acessíveis no local, como SAP, Oracle, IBM e Hadoop, ou pode usar agentes locais para rastrear dados não públicos.
O barramento de serviço corporativo se conecta por meio das portas 5672 e 15672 para pontos de extremidade administrativos. Os rastreadores enviam dados para o barramento e a camada de processamento consome dados do barramento, pela porta 5672.
A camada de log de transações obtém resultados da camada de processamento.
Na camada de persistência, os bancos de dados consomem dados do log de transações e os persistem para fornecer consistência eventual entre os diferentes armazenamentos de dados. Todos os repositórios são executados no modo de alta disponibilidade (HA).
Ao contrário da virtualização de dados, a camada de persistência do CluedIn ingere partes dos dados de origem e preserva a versão de mais alta fidelidade dos dados e sua estrutura. Essa alta fidelidade significa que o CluedIn Data Fabric pode atender a solicitações comerciais de dados em qualquer formato ou modelo.
A camada de abstração de dados se conecta aos diferentes armazenamentos de dados por meio das portas de cada armazenamento.
O acesso aos dados é feito por meio de chamadas GraphQL, REST e WebSockets pela porta 443. O GraphQL e o REST usam um modelo de pull e o WebSockets usa um modelo de push.
O CluedIn protege o acesso aos dados por meio de limitação e prevenção de falsificação de solicitação entre sites (CSRF).
O aplicativo Web CluedIn ASP.NET Core se comunica por meio de uma combinação de chamadas REST e GraphQL pela porta 443.
Toda a comunicação do navegador para o aplicativo usa um conjunto de definições de entrada, que exigem apenas um único endereço IP público. Em um ambiente de produção, toda a comunicação é feita por SSL (Secure Socket Layer).
O aplicativo CluedIn fornece dados limpos e processados para serviços de análise como Power BI e Azure Synapse Analytics para geração de insights. O sistema faz backup e armazena todos os dados em bancos de dados SQL ou Redis.
Componentes
O CluedIn é executado no Serviço de Kubernetes do Azure (AKS), um serviço Kubernetes altamente disponível, seguro e totalmente gerenciado para implantar e gerenciar aplicativos em contêineres. O AKS oferece Kubernetes sem servidor, CI/CD integrado e segurança e governança de nível empresarial.
O CluedIn usa e oferece suporte a várias fontes e serviços de banco de dados, incluindo:
- Banco de Dados SQL do Azure, um serviço de banco de dados relacional em nuvem gerenciado que está sempre atualizado e pode dimensionar recursos automaticamente sob demanda.
- Instância Gerenciada de SQL do Azure, para ampla compatibilidade do mecanismo do SQL Server com aplicativos existentes do SQL Server. A Instância Gerenciada de SQL fornece infraestruturas de banco de dados locais com benefícios de nuvem do Azure, como escala elástica, gerenciamento unificado e um modelo de cobrança de nuvem.
- Azure Cosmos DB, um banco de dados NoSQL sem servidor totalmente gerenciado e não relacional para desenvolvimento de aplicativos modernos.
- Azure Data Lake, um serviço escalonável de armazenamento e análise de dados.
- Azure Data Factory, uma solução de integração de dados totalmente gerenciada e sem servidor para ingerir, preparar e transformar dados em escala. O CluedIn usa mais de 90 conectores integrados do Data Factory para adquirir dados de fontes como Amazon Redshift, Google BigQuery, HDFS, Oracle Exadata, Teradata, Salesforce, Marketo, ServiceNow e todos os serviços de dados do Azure.
O CluedIn fornece dados processados e controlados para muitos aplicativos e serviços de análise, incluindo:
- Azure Databricks, um serviço de análise rápido, fácil e colaborativo baseado no Apache Spark.
- Azure Synapse Analytics, um serviço de análise ilimitado que reúne data warehouse corporativo e análise de Big Data.
- O Log Analytics, uma ferramenta do portal do Azure para editar, executar e analisar consultas de dados de log do Azure Monitor.
- Serviços Cognitivos do Azure, uma família abrangente de serviços de IA e APIs cognitivas para a criação de aplicativos inteligentes.
- Power BI, um serviço de análise de negócios da Microsoft que combina visualizações interativas e business intelligence com uma interface de criação de relatório fácil de usar.
Dados do cenário
As empresas modernas baseiam muitos processos e projetos em dados, mas os dados brutos devem ser preparados para consumo. Os casos de uso de dados, desde análises avançadas até aprendizado de máquina, exigem processos e atenção semelhantes de preparação de dados.
- Os projetos de dados começam com a descoberta de dados, para determinar onde os dados estão e quais sistemas eles usam.
- Em seguida, a integração de dados reúne várias fontes de dados em um conjunto de dados unificado ou conectado.
- A próxima etapa é normalizar, padronizar, harmonizar e limpar os dados para que as máquinas possam processá-los de maneira uniforme, consistente e de alta fidelidade.
- Finalmente, os dados devem ser disponibilizados de forma fácil e rápida para as necessidades de negócios.
Durante esses processos, a governança deve garantir o controle de dados e a proteção da privacidade com propriedade clara, rastreabilidade total e uma trilha de auditoria das origens, processamento e uso dos dados.
A plataforma CluedIn encapsula esses processos e pilares de gerenciamento de dados em uma solução de Gerenciamento de Dados Mestre (MDM) coerente, consistente e de ponta a ponta. O CluedIn usa uma técnica de integração de dados chamada conectividade eventual que produz melhores resultados do que os modelos clássicos de extração, transformação, carregamento (ETL) ou extração, carga, transformação (ELT). A conectividade eventual usa consultas do GraphQL para combinar dados perfeitamente de muitas fontes de dados isoladas.
Com a eventual conectividade, os dados não são unidos ou combinados na entrada ou no carregamento em outros sistemas. Em vez disso, o CluedIn carrega os dados como estão e marca os registros usando metadados. Eventualmente, os registros com as mesmas marcas se mesclam ou criam uma relação no gráfico.
Essa técnica sofisticada de mesclagem de dados fornece uma base para soluções baseadas em dados. O CluedIn Data Fabric integra dados em um pipeline que limpa, prepara, modela, governa, enriquece, desduplica e cataloga dados para torná-los facilmente disponíveis e acessíveis para uso comercial.
O CluedIn fornece às empresas métricas sobre a qualidade dos dados que ingere, detectando de forma inteligente dados sujos e preparando-os para limpeza por engenheiros de dados e administradores de dados. Algoritmos proprietários de aprendizado de máquina de lógica difusa ajudam os usuários de negócios e curadores a rotular dados e ensinam o sistema a identificar, corrigir e evitar problemas de qualidade de dados ao longo do tempo.
O CluedIn inclui governança de nível empresarial, para garantir que você possa usar seus dados com segurança e confiança. O CluedIn pode transmitir dados limpos e controlados diretamente para sistemas de análise como Power BI, Azure Databricks, Azure Synapse Analytics ou Serviços Cognitivos do Azure para torná-los facilmente disponíveis para o restante da empresa. O suporte nativo para dimensionamento automático usa o poder do Azure para fornecer um ambiente escalonável para as maiores cargas de trabalho de dados.
Possíveis casos de uso
Criando uma visão única de dados
- Devido à modelagem semântica do CluedIn, ele torna a criação de uma Visualização Única de seus Dados Mestres uma coisa mais fácil de alcançar em comparação com as abordagens tradicionais. Os clientes do CluedIn estão usando o CluedIn para criar uma visão conectada, histórica e de alta qualidade de seus dados de negócios mais críticos. O CluedIn não apenas suporta o domínio de domínios mestres clássicos, como People, Companies, Vendors e Products - ele suporta um número infinito de domínios diferentes, bem como domínios não estruturados, como arquivos, e-mail, eventos e muito mais. Se você precisar de um repositório centralizado de dados master que seja limpo, enriquecido, governado, com qualidade controlada e catalogado, o CluedIn é uma boa opção para seus casos de uso.
Uma malha de dados
- O CluedIn é um Gartner Cool Vendor em 2020, devido à sua capacidade de orquestrar dados de fontes de dados diferentes e complexas em um hub de dados unificado. Se você precisar organizar dados de muitas fontes de dados diferentes com facilidade, o CluedIn pode ser usado como uma malha de dados para conseguir isso. Isso pode fornecer uma infraestrutura de streaming para seus dados que também pode limpar e master proativamente os dados à medida que eles fluem para os consumidores downstream.
Mesclagem e vinculação sofisticadas de dados master
- A abordagem exclusiva de modelagem de dados do CluedIn utiliza um banco de dados gráfico, que permite que dados complexos sejam mesclados e vinculados com simplicidade. Ao contrário das abordagens tradicionais, para resolver esse desafio, o CluedIn adiciona mais aprendizado de máquina e análise gráfica para mesclar, combinar e vincular registros com alta precisão.
Considerações
Essas considerações implementam os pilares do Azure Well-Architected Framework, que é um conjunto de princípios orientadores que podem ser usados para melhorar a qualidade de uma carga de trabalho. Para obter mais informações, consulte Microsoft Azure Well-Architected Framework.
Confiabilidade
A confiabilidade garante que seu aplicativo possa atender aos compromissos assumidos com seus clientes. Para obter mais informações, consulte Visão geral do pilar confiabilidade.
O CluedIn faz backups diários automáticos de bancos de dados e os mantém em armazenamento de longo prazo por 30 dias por padrão. Toda a plataforma é construída em pilhas redundantes e tolerantes a falhas que mantêm backups para todos os subsistemas. Os sistemas de monitoramento 24 horas por dia garantem que os serviços estejam o mais imaculados possível. O CluedIn segue as práticas padrão do setor para redundância de infraestrutura.
O CluedIn exibe e armazena apenas uma representação dos dados, não da versão original. Se o CluedIn detectar uma invasão destrutiva de dados, ele poderá apagar temporariamente os dados do CluedIn de seus servidores. Quando a intrusão diminui, o CluedIn reúne os dados para voltar ao seu estado original.
Todos os armazenamentos de dados são executados no modo de alta disponibilidade.
Escalabilidade
O CluedIn é executado em contêineres do Docker e usa o Kubernetes para hospedar e orquestrar as diferentes partes do aplicativo. Essa arquitetura significa que o CluedIn funciona bem em ambientes elásticos e pode ser dimensionado automaticamente para os tamanhos e infraestrutura necessários.
O suporte nativo para dimensionamento automático aplica o poder do Azure para fornecer um ambiente escalonável para as maiores cargas de trabalho de dados.
A modelagem gráfica sem esquema infere automaticamente um modelo de dados a partir dos dados de origem. Novas fontes de dados se conectam automaticamente a todas as outras fontes de dados, em vez de precisarem ser explicitamente integradas. O número de fontes de dados pode ser dimensionado infinitamente sem aumentar a complexidade da integração.
Segurança
A segurança fornece garantias contra ataques deliberados e o abuso de seus dados e sistemas valiosos. Para obter mais informações, consulte Visão geral do pilar segurança.
A segurança do CluedIn concede permissões e controla o acesso a diferentes serviços por meio de Azure RBAC, com controle de chave de segurança Azure Key Vault e rastreamento e registro em log de acesso do Azure Monitor.
Além de contas de usuário autenticadas, o CluedIn também oferece suporte a SSO (logon único) e estruturas de identidade. As solicitações para o aplicativo CluedIn usam tokens de acesso criptografados que não têm correlação com a identidade do usuário.
O CluedIn gerencia representações de dados armazenados por trás de várias camadas de firewall e proxy e as autentica com um conjunto de chaves exclusivas.
O CluedIn armazena todos os dados de origem com criptografia AES de 256 bits, que é mais forte ou igual ao nível de criptografia das fontes de dados com suporte.
A limitação e a prevenção de CSRF protegem o acesso aos dados.
DevOps
O CluedIn usa pipelines de integração contínua e entrega contínua (CI/CD) do Azure Pipelines para lidar com implantações e atualizações contínuas no ambiente do AKS.
O CluedIn oferece suporte a testes de unidade, integração e funcionais para garantir que os dados sejam transformados conforme o esperado. Os pipelines de processamento virtualizados podem ser executados na memória para testes de área restrita. As declarações de nível de produção podem ajudar a depurar e rastrear problemas de dados.
Para ambientes de teste e produção, o CluedIn fornece um gráfico do gerenciador de pacotes Helm para instalar o CluedIn rapidamente em um cluster Kubernetes. Processos de implantação de dados totalmente com script dão suporte à configuração, teste e implementação.
Otimização de custos
A otimização de custos consiste em procurar maneiras de reduzir despesas desnecessárias e melhorar a eficiência operacional. Para obter mais informações, consulte Visão geral do pilar de otimização de custos.
O preço do CluedIn é aberto e transparente. Você pode ver os preços em seu site.
Dimensionamento do Azure e início de avaliação
Você pode iniciar uma avaliação de 7 dias do CluedIn em seu site, que também pode ajudá-lo a definir o escopo de seus custos de hospedagem do Azure com estimativas do Azure pré-criadas para ambientes de diferentes tamanhos.
Implantar este cenário
Para implantar o CluedIn para fins de desenvolvimento e avaliação usando o Docker, consulte CluedIn com o Docker.
Para instalar o CluedIn rapidamente em um cluster do Kubernetes, consulte CluedIn com o Kubernetes. O gráfico do Helm instala o servidor, o site e outros serviços necessários do CluedIn, como armazenamento e filas.
Próximas etapas
- Para saber mais sobre o CluedIn, consulte o site do CluedIn.
- Para obter a documentação do CluedIn, consulte a documentação do CluedIn.