Replicar e sincronizar dados de mainframe com o Azure

Fábrica de dados do Azure
Azure Databricks
Microsoft Fabric

Ideias de soluções

Este artigo descreve uma ideia de solução. Seu arquiteto de nuvem pode usar essa orientação para ajudar a visualizar os principais componentes para uma implementação típica dessa arquitetura. Use este artigo como ponto de partida para projetar uma solução bem arquitetada que se alinhe aos requisitos específicos da sua carga de trabalho.

Este artigo explica como replicar e sincronizar dados para Azure durante a modernização do mainframe. Ele descreve os aspectos técnicos dessa ideia de solução, como armazenamentos de dados, ferramentas e serviços. Os sistemas de mainframe e midrange atualizam bancos de dados de aplicativos locais em intervalos regulares. Para manter a consistência, essa solução sincroniza os dados mais recentes com os bancos de dados do Azure.

Arquitetura

Diagrama que mostra a arquitetura para replicar e sincronizar dados de mainframe com o Azure.

Baixe um arquivo do Visio dessa arquitetura.

Workflow

O fluxo de dados a seguir corresponde ao diagrama anterior:

  1. Pipelines dinâmicos Azure Data Factory orquestram atividades, incluindo extração e carregamento de dados. Você pode agendar atividades de pipeline, iniciá-las manualmente ou acioná-las automaticamente.

    Pipelines agrupam as atividades que executam tarefas. Para extrair dados, o Azure Data Factory cria dinamicamente um pipeline para cada tabela local. Em seguida, você pode usar uma implementação massivamente paralela ao replicar dados no Azure. Configure o nível de replicação com base em seus requisitos.

    • Replicação completa. Replique todo o banco de dados e modifique os tipos de dados e campos no banco de dados de Azure de destino.

    • Replicação parcial, delta ou incremental. Use colunas de marca d'água em tabelas de origem para sincronizar as linhas atualizadas com bancos de dados Azure. Essas colunas contêm uma chave de incremento contínuo ou um timestamp que indica a última atualização da tabela.

    O Azure Data Factory também usa pipelines para as seguintes tarefas de transformação:

    • Conversão de tipo de dados

    • Manipulação de dados

    • Formatação de dados

    • Derivação de coluna

    • Nivelamento de dados

    • Classificação de dados

    • Filtragem de dados

  2. Bancos de dados locais, como Db2 zOS, Db2 para i e Db2 LUW, armazenam os dados do aplicativo.

  3. Um IR (Integration Runtime) auto-hospedado fornece o ambiente que o Azure Data Factory usa para executar e expedir atividades.

  4. O Azure Data Lake Storage Gen2 e o Armazenamento de Blobs do Azure armazenam temporariamente os dados. Essa etapa pode ser necessária para transformar e mesclar dados de várias fontes.

  5. Para preparação de dados, o Azure Data Factory usa o Azure Databricks, atividades personalizadas e fluxos de dados de pipeline para transformar dados de forma rápida e eficaz.

  6. O Azure Data Factory carrega dados nos seguintes bancos de dados relacionais e não relacionais do Azure:

    • SQL do Azure

    • Banco de Dados do Azure para PostgreSQL

    • Azure Cosmos DB

    • Azure Data Lake Storage

    • Banco de Dados do Azure para MySQL

  7. O SQL Server Integration Services (SSIS) extrai, transforma e carrega dados.

  8. O gateway de dados local é um aplicativo cliente Windows local que atua como uma ponte entre as fontes de dados locais e os serviços de Azure locais.

  9. Um pipeline de dados do Microsoft Fabric é um agrupamento lógico de atividades que executam a ingestão de dados do Db2 para o armazenamento e os bancos de dados do Azure.

  10. Se a solução exigir replicação quase em tempo real, você poderá usar ferramentas não Microsoft.

Se essas ferramentas não puderem acessar os bancos de dados Db2 locais, extraia os dados e crie um processo de migração personalizado para carregar os arquivos extraídos nos bancos de dados de destino.

Componentes

Esta seção descreve outras ferramentas que você pode usar durante a modernização de dados, a sincronização de dados e a integração de dados.

Integradores de dados

  • Azure Data Factory é um serviço de integração de dados híbrido. Você pode usar essa solução totalmente gerenciada e sem servidor para criar, programar e orquestrar fluxos de trabalho de extração, transformação e carregamento (ETL) e fluxos de trabalho de extração, carregamento e transformação (ELT).

  • Fabric é uma plataforma de análise empresarial que acelera o tempo de análise entre engenharia de dados, data warehouse, integração de dados, análise em tempo real e business intelligence. Fabric é uma solução saaS (software como serviço) que usa o armazenamento centralizado no OneLake. Fabric combina as seguintes tecnologias e serviços:

    • As tecnologias SQL para armazenamento de dados corporativos estão disponíveis usando Fabric Data Warehouse, que é um warehouse transacional gerenciado que usa um formato Delta aberto.

    • A engenharia de dados em larga escala e o aprendizado de máquina estão disponíveis usando Fabric Engenharia de Dados, que inclui funcionalidades internas do Apache Spark.

    • Análises quase em tempo real estão disponíveis com o uso da Inteligência em Tempo Real do Fabric, que inclui eventhouses e eventstreams.

    • Os fluxos de trabalho ETL e ELT estão disponíveis usando Fabric Data Factory, que inclui pipelines, Dataflow Gen2 e uma variedade de conectores com suporte híbrido e de gateway local.

    Fabric tem integrações nativas com Power BI e com serviços Azure, como Azure Cosmos DB e Azure Machine Learning.

  • O SSIS é uma plataforma para soluções de transformação e integração de dados de nível empresarial. Use o SSIS para gerenciar, replicar, limpar e minerar dados.

  • Azure Databricks é uma plataforma de análise de dados baseada no sistema de processamento distribuído de software livre do Spark. Azure Databricks é otimizado para a plataforma de nuvem Azure. Em um fluxo de trabalho de análise, o Azure Databricks lê dados de várias fontes e usa o Spark para fornecer insights.

Armazenamento de dados

  • Banco de Dados SQL do Azure é uma PaaS (plataforma como serviço) totalmente gerenciada e baseada em nuvem. O Banco de Dados SQL fornece recursos automatizados alimentados por IA que otimizam o desempenho e a durabilidade. As opções de computação sem servidor e de armazenamento em hiperescala dimensionam automaticamente os recursos conforme necessário.

  • Instância Gerenciada de SQL do Azure é um serviço de banco de dados em nuvem totalmente gerenciado, inteligente e escalonável, com compatibilidade com o mecanismo do SQL Server. Use a Instância Gerenciada de SQL para modernizar aplicativos existentes em escala.

  • SQL Server em Máquinas Virtuais do Azure re-hospeda cargas de trabalho do SQL Server compatíveis com o código na nuvem. SQL Server em Máquinas Virtuais do Azure combina o desempenho, a segurança e a análise de SQL Server com a flexibilidade e a conectividade híbrida de Azure. Para migrar aplicativos existentes ou criar novos aplicativos, use SQL Server em Máquinas Virtuais do Azure.

  • Banco de Dados do Azure para PostgreSQL é um serviço de banco de dados relacional totalmente gerenciado com base na edição da comunidade do mecanismo de banco de dados PostgreSQL de software livre. Banco de Dados do Azure para PostgreSQL fornece recursos escalonáveis de inovação de aplicativo.

  • O Azure Cosmos DB é um banco de dados de vários modelos distribuído globalmente. Use Azure Cosmos DB para garantir que suas soluções possam dimensionar de forma elástica e independente a taxa de transferência e o armazenamento em várias regiões geográficas.

  • Data Lake Storage é um repositório de armazenamento que contém grandes quantidades de dados nativos e brutos. Os repositórios Data lake são otimizados para dimensionamento para terabytes e petabytes de dados. Normalmente, os dados são provenientes de várias fontes heterogêneas e podem ser estruturados, semiestruturados ou não estruturados. O Data Lake Storage Gen2 combina os recursos do Data Lake Storage Gen1 com o Armazenamento de Blobs. Data Lake Storage Gen2 fornece semântica do sistema de arquivos, segurança em nível de arquivo e escala. Ele também fornece os recursos de armazenamento em camadas, alta disponibilidade e recuperação de desastre do Armazenamento de Blobs.

  • Banco de Dados do Azure para MySQL é um serviço de banco de dados relacional totalmente gerenciado com base na edição da comunidade do mecanismo de banco de dados MySQL de software livre.

Outras ferramentas

Alternatives

Esta arquitetura mostra opções e destinos de banco de dados no Azure para replicação e sincronização de dados de mainframe. Você também pode replicar e sincronizar com os seguintes destinos de SQL do Azure:

  • Instância Gerenciada de SQL é um serviço de banco de dados de nuvem totalmente gerenciado. Instância Gerenciada de SQL é compatível com o mecanismo do SQL Server. Use o Instância Gerenciada de SQL para modernizar aplicativos em escala.

  • SQL Server em Máquinas Virtuais do Azure rehospeda cargas de trabalho do SQL Server na nuvem sem alterações de código. SQL Server em Máquinas Virtuais do Azure combina o desempenho, a segurança e a análise de SQL Server com a flexibilidade e a conectividade híbrida de Azure. Para migrar aplicativos existentes ou criar novos aplicativos, use SQL Server em Máquinas Virtuais do Azure.

Detalhes do cenário

A disponibilidade e a integridade dos dados são essenciais para a modernização de mainframe e midrange. Estratégias com foco em dados ajudam a manter os dados intactos e disponíveis durante a migração para o Azure. Para evitar interrupções durante a modernização, talvez seja necessário replicar dados rapidamente ou sincronizar dados locais com bancos de dados Azure.

Esta solução aborda:

  • Extração. Conecte-se e extraia dados de um banco de dados de origem.

  • Transformação, incluindo:

    • Preparo: Armazene temporariamente os dados em seu formato original e prepare-os para a transformação.

    • Preparação. Transforme e manipule dados usando regras de mapeamento que atendam aos requisitos de banco de dados de destino.

  • Carregando. Insira dados em um banco de dados de destino.

Possíveis casos de uso

Use esta solução nos seguintes cenários de replicação e sincronização de dados:

  • Arquiteturas de segregação de responsabilidade de consulta de comando que usam Azure para atender a todos os canais de consulta

  • Ambientes que testam aplicativos locais e aplicativos paralelos hospedados novamente ou reengenhados

  • Sistemas on-premises que usam aplicações fortemente acopladas e que exigem remediação ou modernização em fases

Recommendations

Você pode aplicar as recomendações a seguir à maioria dos cenários. Siga estas recomendações, a menos que você tenha um requisito específico que as substitua.

Se você usar Azure Data Factory para extrair dados, ajuste o desempenho da atividade de cópia. Quando você usa Fabric Data Factory para extrair dados, ajuste o paralelismo, o tamanho do lote e as configurações do conector para otimizar o desempenho do pipeline. Para obter mais informações, consulte a visão geral do pipeline e a visão geral do conector.

Contribuidores

A Microsoft mantém este artigo. Os colaboradores a seguir escreveram este artigo.

Autor principal:

Para ver perfis de LinkedIn não públicos, entre em LinkedIn.

Próximas etapas