Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
idées de solutions
Cet article décrit une idée de solution. Votre architecte cloud peut utiliser ces conseils pour vous aider à visualiser les principaux composants d’une implémentation classique de cette architecture. Utilisez cet article comme point de départ pour concevoir une solution bien conçue qui s’aligne sur les exigences spécifiques de votre charge de travail.
Cet article explique comment les petites et moyennes entreprises (PME) peuvent créer une architecture de plateforme de données moderne en combinant les investissements existants dans Azure Databricks avec une plateforme de données SaaS (Software as a Service) entièrement managée, telle que Microsoft Fabric. Les plateformes de données SaaS sont des solutions d’analytique des données de bout en bout qui s’intègrent à des outils tels que Azure Machine Learning, Foundry Tools, Power Platform, Microsoft Dynamics 365 et d’autres technologies de Microsoft.
Architecture simplifiée
Télécharger un fichier Visio de cette architecture.
L’interopérabilité entre Azure Databricks et Fabric fournit une solution robuste qui réduit la fragmentation des données tout en améliorant les fonctionnalités analytiques.
Fabric fournit un lac de données ouvert et régi, appelé OneLake, comme stockage SaaS sous-jacent. OneLake et Azure Databricks utilisent tous deux le format Delta Parquet. Pour accéder à vos données de Azure Databricks à partir de OneLake, vous pouvez mirror le catalogue Azure Databricks Unity dans Fabric pour intégrer des données sans réplication ni déplacement de données. Avec cette intégration, vous pouvez augmenter vos systèmes d’analytique Azure Databricks avec l’IA générative sur OneLake.
Vous pouvez également utiliser le mode Direct Lake dans Power BI sur vos données de Azure Databricks dans OneLake. Le mode Direct Lake simplifie la couche de service et améliore les performances des rapports. OneLake prend en charge les API pour Azure Data Lake Storage et stocke toutes les données tabulaires au format Delta Parquet.
Par conséquent, les notebooks Azure Databricks peuvent utiliser des points de terminaison OneLake pour accéder aux données stockées. L’expérience est identique à l’accès aux données via un entrepôt Fabric. Avec cette intégration, vous pouvez utiliser Fabric ou Azure Databricks sans remodeler vos données.
Architecture
Télécharger un fichier Visio de cette architecture.
Flux de données
Le flux de données suivant correspond au diagramme précédent :
Utilisez des pipelines de Azure Data Factory existants pour ingérer des données structurées et non structurées à partir de systèmes sources et les placer dans le lac de données existant.
Vous pouvez utiliser les sources de données Microsoft Dynamics 365 pour créer des tableaux de bord décisionnels centralisés à partir de jeux de données enrichis à l’aide d’Azure Synapse Link ou de Microsoft Fabric Link. Ramenez les données fusionnées et traitées dans Microsoft Dynamics 365 et Power BI pour une analyse plus approfondie.
Les données de streaming peuvent être ingérées via Azure Event Hubs ou Azure IoT Hub, en fonction des protocoles qui envoient ces messages.
Dans le chemin froid, vous pouvez utiliser Azure Databricks pour placer les données de streaming dans le lac de données centralisé pour une analyse, un stockage et des rapports supplémentaires. Ces données peuvent ensuite être unifiées avec d’autres sources de données pour l’analyse par lots.
Dans la voie chaude, vous pouvez analyser les données en temps réel et créer des tableaux de bord en temps réel grâce à Microsoft Fabric Real-Time Intelligence.
Vous pouvez utiliser les blocs-notes Azure Databricks existants pour effectuer le nettoyage, l’unification et les analyses des données. Envisagez d’utiliser l’architecture medallion comme suit :
- Bronze, qui contient des données brutes.
- Silver, qui contient des données nettoyées et filtrées.
- Gold, qui stocke les données agrégées utiles pour l’analytique métier.
Pour les données d’or ou un entrepôt de données, continuez à utiliser Azure Databricks SQL ou à créer une mise en miroir du catalogue Unity Azure Databricks dans Fabric. Pour activer la création de rapports et l’analytique sur un Fabric lakehouse, créez un modèle sémantique explicitement et générez des tableaux de bord Power BI à l’aide de Direct Lake ou DirectQuery pour des performances élevées. Pour plus d’informations, consultez les modèles sémantiques dans Fabric.
Les outils suivants sont utilisés pour la gouvernance, la collaboration, la sécurité, les performances et la surveillance des coûts.
Découvrir et gouverner :
Microsoft Purview fournit des services de découverte de données, une classification des données sensibles et des insights de gouvernance dans le patrimoine de données.
Unity Catalog fournit des fonctionnalités de contrôle d’accès, d’audit, de traçabilité et de découverte de données centralisées dans les espaces de travail Azure Databricks.
Ressources de plateforme :
Microsoft Entra ID fournit l’authentification unique (SSO) pour les utilisateurs Azure Databricks. Azure Databricks prend en charge l’approvisionnement automatisé d’utilisateurs avec l’ID Microsoft Entra pour :
- Créez des utilisateurs.
- Affectez à chaque utilisateur un niveau d’accès.
- Supprimez les utilisateurs et refusez leur accès.
Microsoft Cost Management fournit des services de gouvernance financière pour les charges de travail Azure.
Azure Key Vault gère les secrets, les clés et les certificats.
Azure Monitor collecte et analyse les données de télémétrie des ressources Azure. Ce service optimise les performances et la fiabilité en identifiant de manière proactive les problèmes.
Microsoft Defender for Cloud assure la gestion de la posture de sécurité et la protection contre les menaces pour les ressources et charges de travail Azure.
Azure DevOps fournit une intégration continue et un déploiement continu (CI/CD) et d’autres fonctionnalités de contrôle de version intégrées.
GitHub fournit des fonctionnalités de développement collaboratif et de contrôle de version pour la gestion des pipelines de code et de déploiement.
Composants
Data Lake Storage est un service de stockage de données évolutif conçu pour les données structurées et non structurées. Dans cette architecture, Data Lake Storage sert d’infrastructure sous-jacente pour Delta Lake. Il s’agit de la couche de stockage principale pour les données brutes et traitées, ce qui permet une ingestion, un stockage et une récupération de données efficaces pour les charges de travail d’analyse et de Machine Learning.
Data Factory est un service d’intégration de données basé sur le cloud qui orchestre et automatise le déplacement et la transformation des données. Dans cette architecture, Data Factory crée, planifie et orchestre des pipelines de données qui déplacent et transforment des données entre différents magasins de données et services.
Event Hubs est un service d’ingestion de données en temps réel qui peut traiter des millions d’événements par seconde à partir de n’importe quelle source. Dans cette architecture, Event Hubs capture et diffuse en continu de grands volumes de données provenant de différentes sources pour permettre un traitement analytique en temps réel et piloté par les événements.
IoT Hub est un service géré qui améliore la sécurité et la communication fiable entre les appareils IoT (Internet des objets) et le cloud. Dans cette architecture, IoT Hub facilite l’ingestion, le traitement et l’analyse des données de télémétrie à partir d’appareils IoT pour fournir des insights en temps réel et activer la supervision à distance.
Microsoft Dataverse est une plateforme de données évolutive que les organisations peuvent utiliser pour stocker et gérer en toute sécurité les données utilisées par les applications métier. Dans cette architecture, elle sert de source de données qui alimente le pipeline d’analytique via Azure Synapse Link ou Microsoft Fabric Link.
Azure Synapse Link est une fonctionnalité d’intégration de données qui connecte des applications Dynamics avec Azure Synapse Analytics ou Data Lake Storage. Dans cette architecture, elle copie les données en quasi temps réel de Dataverse vers Data Lake Storage.
Microsoft Fabric Link est une fonctionnalité d’intégration de données qui connecte des applications Dynamics à Fabric. Dans cette architecture, elle réplique les données de Dataverse vers Fabric en quasi temps réel.
Azure Databricks est une plateforme d’analytique basée sur Apache Spark pour le traitement big data, le Machine Learning et l’ingénierie des données. Dans cette architecture, elle effectue le nettoyage, la transformation et l’analyse des données à l’aide de couches d’architecture de médaillon.
Delta Lake est une couche de stockage open source qui apporte des transactions ACID (atomicité, cohérence, isolation et durabilité) à Spark et aux charges de travail big data. Dans cette architecture, Delta Lake améliore la fiabilité et les performances des données dans le lac de données.
Azure Databricks SQL est un service d’analytique SQL qui permet aux utilisateurs d’exécuter des requêtes SQL sur des données stockées dans Azure Databricks. Dans cette architecture, Azure Databricks SQL fournit une interface SQL puissante pour interroger et analyser des données, ce qui permet une analytique interactive.
L’IA et le Machine Learning englobent une gamme de technologies et de services qui permettent le développement, le déploiement et la gestion des modèles Machine Learning. Dans cette architecture, les services IA et Machine Learning créent, entraînent et déploient des modèles prédictifs. Cette fonctionnalité permet de prendre des décisions pilotées par les données.
Unity Catalog est une solution de gouvernance des données qui fournit un contrôle d’accès centralisé, un audit, une traçabilité et des fonctionnalités de découverte des données dans Azure Databricks espaces de travail. Dans cette architecture, Unity Catalog permet de garantir la gouvernance et la sécurité des données en fournissant des contrôles d’accès précis, un audit et un suivi de traçabilité des données.
architecture lakehouse de type medallion est un modèle d’architecture de données qui organise les données en couches bronze, argent et or pour un traitement et une analyse efficaces des données. Dans cette architecture, elle structure les flux de travail de traitement des données à l’aide de Data Lake Storage, Delta Lake et Azure Databricks pour prendre en charge l’analytique évolutive.
Fabric est une plateforme de données complète qui intègre différents services et outils de données pour offrir une expérience transparente de gestion et d’analytique des données. Dans cette architecture, Fabric connecte et intègre des données provenant de plusieurs sources, ce qui permet une analyse complète des données et des insights au sein de l’organisation.
Real-Time Intelligence est une fonctionnalité de traitement des données qui permet aux organisations d’ingérer, de traiter et d’analyser les données en temps réel. Real-Time Intelligence traite la diffusion en continu de données provenant de différentes sources. Dans cette architecture, elle fournit des insights en temps réel et active des actions automatisées basées sur des modèles de données.
Les raccourcis OneLake créent un lien sur place entre OneLake et d’autres sources de données. Dans cette architecture, ils simplifient l’accès aux données et la gestion et fournissent une vue unifiée des données au sein de l’organisation.
Fabric Copilot est un assistant alimenté par l’IA intégré dans les charges de travail Fabric. Il utilise des modèles de langage volumineux (LLMs) pour aider les utilisateurs à interagir avec les données à l’aide du langage naturel. Il simplifie les tâches telles que la génération de SQL, DAX et les transformations, et crée des rapports ou des tableaux de bord. Copilot prend en charge le contexte conversationnel, crée des visualisations et aide à créer des pipelines d’analytique. Elle permet aux organisations d’accélérer les insights sur les données et d’optimiser les flux de travail sans nécessiter d’expertise approfondie en matière de codage.
Un agent de données Fabric est un service intelligent basé sur LLM dans Fabric que les organisations utilisent pour interroger et analyser des données sur plusieurs sources, notamment des lakehouses, des entrepôts, des modèles sémantiques, des bases de données KQL et des bases de données mises en miroir, via une seule interface. Il prend en charge des requêtes complexes en plusieurs étapes, applique une logique personnalisée à l’aide d’exemples de requêtes et d’instructions d’agent ou de source de données, et publie sur Microsoft 365 Copilot ou Teams. Il fournit aux utilisateurs professionnels un accès sécurisé et régi aux données d’entreprise en langage naturel.
Power BI est un service d’analytique métier qui fournit des visualisations interactives et des fonctionnalités décisionnels (BI). Dans cette architecture, Power BI visualise les données de Fabric et de Azure Databricks à l’aide du mode Direct Lake pour améliorer les performances.
Microsoft Purview est un service de gouvernance des données unifié qui aide les organisations à gérer et à régir leurs données dans différentes sources. Dans cette architecture, il catalogue les données, effectue le suivi de la traçabilité et applique la conformité dans le patrimoine de données. Vous pouvez intégrer Unity Catalog à Purview pour accéder aux métadonnées du catalogue Unity à partir de Purview.
Microsoft Entra ID est une solution de gestion des identités et des accès basée sur le cloud qui permet de garantir des connexions sécurisées et d’accéder aux ressources telles que Microsoft 365, Azure et d’autres applications SaaS. Dans cette architecture, Microsoft Entra ID fournit une gestion sécurisée des identités et des accès pour les ressources Azure. Cette fonctionnalité permet des connexions sécurisées, gère les identités utilisateur et permet de garantir l’accès autorisé aux données et aux ressources.
Cost Management est une suite d’outils FinOps que les organisations peuvent utiliser pour analyser, surveiller et optimiser les coûts de Microsoft Cloud. Dans cette architecture, ces outils fournissent une gouvernance financière sur les ressources Azure.
Key Vault est un service cloud qui stocke et gère les secrets, tels que les clés API, les mots de passe, les certificats et les clés de chiffrement. Dans cette architecture, Azure Databricks peut récupérer des secrets de Key Vault pour authentifier et accéder à Data Lake Storage, ce qui garantit une intégration sécurisée.
Azure Monitor est un service de supervision qui fournit une observabilité complète pour les applications, l’infrastructure et les réseaux. Azure Monitor permet aux utilisateurs de collecter, d’analyser et d’agir sur les données de télémétrie à partir de leurs environnements Azure et locaux. Dans cette architecture, Azure Monitor garantit les performances et la fiabilité en identifiant de manière proactive les problèmes.
Defender for Cloud est une plateforme de protection des applications native dans le cloud qui fournit la gestion de la posture de sécurité et la protection contre les menaces dans les environnements Azure, hybrides et multiclouds. Dans cette architecture, Defender for Cloud sécurise les plateformes de données et les charges de travail en identifiant les vulnérabilités, en détectant les menaces et en fournissant des recommandations de sécurité sur les ressources Azure.
Azure DevOps est un ensemble d’outils de développement qui prennent en charge une culture collaborative et des processus rationalisés. Ces outils permettent aux développeurs, aux responsables de projet et aux contributeurs de développer des logiciels plus efficacement. Azure DevOps fournit des fonctionnalités intégrées telles qu’Azure Boards, Azure Repos, Azure Pipelines, Azure Test Plans et Azure Artifacts. Vous pouvez accéder à ces fonctionnalités via un navigateur web ou un client d’environnement de développement intégré. Dans cette architecture, Azure DevOps prend en charge le déploiement automatisé et le contrôle de version pour les pipelines de données et les notebooks.
gitHub est un service d’hébergement de référentiel Git basé sur le cloud qui simplifie le contrôle de version et la collaboration pour les développeurs. Les individus et les équipes peuvent stocker et gérer leur code, suivre les modifications et collaborer sur des projets. Dans cette architecture, GitHub s’intègre à Azure DevOps pour appliquer l’automatisation et la conformité dans les flux de travail de développement et les pipelines de déploiement pour Data Factory, Azure Databricks et Fabric.
Alternatives
Pour créer un environnement Fabric indépendant, consultez Greenfield lakehouse sur Fabric.
Pour migrer un environnement d’analytique SQL sur site vers Fabric, consultez Entrepôts de données modernes pour les PME.
Alternatives de service dans cette architecture
Ingestion par lots
- Si vous le souhaitez, utilisez des pipelines data dans Fabric pour l’intégration des données au lieu de pipelines Data Factory. Le choix dépend de plusieurs facteurs. Pour plus d’informations, consultez Différences entre Azure Data Factory et Fabric Data Factory.
Ingestion de Microsoft Dynamics 365
Si vous utilisez Data Lake Storage comme stockage de lac de données et que vous souhaitez ingérer des données Dataverse, utilisez Azure Synapse Link for Dataverse with Data Lake Storage. Pour les applications Dynamics 365 Finance and Operations, consultez Choisir les données Finance and Operations dans Azure Synapse Link pour Dataverse.
Si vous utilisez un lakehouse Fabric comme stockage de votre lac de données, consultez Lier votre environnement Dataverse à Fabric.
Ingestion de données en continu
- La décision entre Azure IoT et Event Hubs dépend de la source des données de streaming, que vous ayez besoin de clonage et de communication bidirectionnelle avec les appareils de création de rapports et les protocoles requis. Pour plus d’informations, consultez Comparer IoT Hub et Event Hubs.
Lakehouse
- Un Fabric lakehouse est une plateforme d’architecture de données unifiée permettant de gérer et d’analyser des données structurées et non structurées dans un format ouvert qui utilise principalement des fichiers Delta Parquet. Il prend en charge deux types de stockage. Ces types de stockage sont des tables managées telles que CSV, Parquet ou Delta et des fichiers non managés. Les tables managées sont automatiquement reconnues. Les fichiers non managés nécessitent la création explicite d’une table. La plateforme active les transformations de données via des points de terminaison Spark ou SQL et s’intègre à d’autres composants Fabric. Cette intégration permet le partage de données sans duplication. Ce concept s’aligne sur l’architecture de médaillon commune utilisée dans les charges de travail analytiques. Pour plus d’informations, consultez Lakehouse in Fabric.
Analyse en temps réel
azure Databricks
- Si vous disposez d’une solution Azure Databricks existante, vous pouvez continuer à utiliser spark structured streaming pour l’analytique en temps réel. Pour plus d’informations, consultez Streaming sur Azure Databricks.
Tissu
Si vous avez déjà utilisé d’autres services Azure pour l’analytique en temps réel ou si vous n’avez pas de solution d’analytique en temps réel existante, consultez Real-time Intelligence par rapport aux solutions de diffusion en continu Azure.
Le streaming structuré de Fabric utilise Structured Streaming de Spark pour traiter et ingérer des flux de données en direct sous forme de tables alimentées en continu. La diffusion en continu structurée prend en charge différentes sources de fichiers, telles que CSV, JSON, ORC, Parquet et les services de messagerie tels que Kafka et Event Hubs. Cette approche garantit un traitement de flux évolutif et tolérant aux pannes, qui optimise les environnements de production à débit élevé. Pour plus d’informations, consultez Streaming de données vers un lakehouse avec Spark.
Ingénierie des données
- Utilisez Fabric ou Azure Databricks pour écrire des notebooks Spark. Pour plus d’informations, consultez Utiliser les carnets Fabric. Pour savoir comment les notebooks Fabric se comparent à ce qu’offre Azure Synapse Spark, consultez Comparer les notebooks Fabric et Azure Synapse Spark. Pour plus d’informations sur les carnets Azure Databricks, consultez Introduction aux carnets Azure Databricks.
Entrepôt de données ou couche or
- Vous pouvez utiliser Fabric ou Azure Databricks pour créer un entrepôt SQL ou une couche gold. Pour obtenir un guide de décision sur la façon de choisir une solution de stockage d’entrepôt de données ou de couche or dans Fabric, consultez Choose un magasin de données. Pour plus d’informations sur les types SQL Warehouse dans Azure Databricks, consultez types SQL Warehouse.
Science des données
Utilisez Fabric ou Azure Databricks pour les fonctionnalités de science des données. Pour plus d’informations sur l’offre Fabric Data Science, consultez Data Science dans Fabric. Pour plus d’informations sur l’offre de Azure Databricks, consultez AI et machine learning sur Azure Databricks.
Fabric Data Science diffère de Machine Learning. Machine Learning fournit une solution complète pour la gestion des flux de travail et le déploiement de modèles Machine Learning. Fabric Data Science est adapté à un scénario d’analyse et de création de rapports.
Power BI
Azure Databricks intégrée à Power BI permet le traitement et la visualisation des données. Pour plus d’informations, consultez Connecter Power BI à Azure Databricks.
En mettant en miroir Azure Databricks catalogue Unity dans Fabric, vous pouvez accéder aux données qui Azure Databricks catalogue Unity gère directement à partir de la charge de travail Fabric. Pour plus d’informations, consultez Mirror Azure Databricks Catalogue Unity. Vous pouvez interroger ces données à partir de Power BI en mode Direct Lake sans copier les données dans le service Power BI.
Détails du scénario
Les PME qui ont un environnement Azure Databricks existant, et éventuellement, une architecture lakehouse, peuvent tirer parti de ce modèle. Ils utilisent actuellement un outil Azure d’extraction, de transformation et de chargement (ETL), comme Data Factory, et publient des rapports dans Power BI. Toutefois, ils peuvent également avoir plusieurs sources de données qui utilisent différents formats de données propriétaires sur le même lac de données, ce qui entraîne la duplication des données et les problèmes de verrouillage du fournisseur. Cette situation peut compliquer la gestion des données et augmenter la dépendance vis-à-vis des fournisseurs spécifiques. Ils peuvent également avoir besoin de rapports à jour et quasi en temps réel pour la prise de décision, et vouloir adopter des outils d’IA à l’échelle de leur environnement.
Fabric est une base SaaS ouverte, unifiée et régie que vous pouvez utiliser pour :
Centraliser les données dans OneLake pour stocker, gérer et analyser des données dans un emplacement unique sans problèmes de verrouillage du fournisseur.
Innover plus rapidement avec les intégrations aux applications Microsoft 365.
Obtenez des insights rapides avec les avantages de Power BI mode Direct Lake.
Bénéficiez de Copilot dans chaque expérience de Fabric.
Accélérez l’analyse en développant des modèles IA sur une base unique.
Conservez les données en place sans déplacement, ce qui réduit le temps nécessaire aux scientifiques des données pour fournir de la valeur.
Optimisation des coûts
L’optimisation des coûts se concentre sur les moyens de réduire les dépenses inutiles et d’améliorer l’efficacité opérationnelle. Pour plus d’informations, consultez la liste de vérification de conception pour l’optimisation des coûts.
Pour estimer le coût de cette solution, utilisez l’estimation preconfigurée dans la calculatrice de prix Azure. L’estimation reflète l’architecture décrite dans cet article avec un dimensionnement représentatif pour une charge de travail SMB. Ajustez les valeurs pour qu’elles correspondent à vos modèles d’utilisation réels, volumes de données et exigences de performances.
Microsoft Fabric tarification dépend du modèle de capacité. L’estimation utilise F2, qui est un point d’entrée économique pour les PME. Envisagez une capacité réservée pour les charges de travail prévisibles afin de réduire les coûts.
Azure Databricks tarification dépend du type de charge de travail, du niveau et des heures de calcul. L’estimation se base sur le calcul polyvalent de niveau Premium pour 200 heures par mois. Utilisez Jobs Compute pour les traitements par lots planifiés afin de réduire les coûts en DBU.
Data Lake Storage tarification dépend du volume de stockage, du niveau d’accès et du nombre de transactions. L’estimation inclut 1 To de stockage de niveau chaud avec un espace de noms hiérarchique activé.
Azure Data Factory tarification dépend du nombre d’exécutions d’activité, des volumes de déplacement de données et des heures d’exécution du pipeline.
La tarification d’Event Hubs dépend du niveau et des unités de débit sélectionnés. L’estimation utilise le niveau Standard avec une unité de débit.
Contributeurs
Microsoft conserve cet article. Les contributeurs suivants ont écrit cet article.
Auteurs principaux :
- Naren Jogendran | Architecture de solution cloud
- Bonita Rui | Architecture de solution cloud
Pour afficher les profils LinkedIn non publics, connectez-vous à LinkedIn.
Étapes suivantes
- parcours d’apprentissage pour les ingénieurs données
- Fabric - Prise en main de Microsoft Learn
- Fabric - modules Microsoft Learn
- Créer un compte de stockage pour data Lake Storage
- démarrage rapide Event Hubs - Créer un hub d’événements à l’aide du portail Azure
- Quelle est l’architecture du lac de médaillon ?
- Qu’est-ce qu’un lakehouse dans Fabric ?