Unifier les données avec des raccourcis OneLake et du miroirement

OneLake vous offre une vue unique des données à travers les clouds, les domaines et les comptes. Unifier les données dans OneLake ne nécessite pas de stocker toutes ces données au même endroit. Les données peuvent rester à leur source ou être répliquées dans OneLake, où les charges de travail Fabric y accèdent via un espace de noms partagé.

Les raccourcis et le miroir sont des fonctionnalités complémentaires d’OneLake pour créer cette vue unifiée sans construire ni exploiter des pipelines de transfert de données. Les raccourcis ajoutent des données sélectionnées à l’espace de noms OneLake. Le miroir ajoute une base de données ou un catalogue externe et détermine si ses données peuvent être consultées sur place ou doivent être répliquées. Cet article explique comment chaque fonctionnalité fonctionne et quand les utiliser. Pour un ensemble plus large de façons d’ingrevoir, transformer ou déplacer des données dans Fabric, voir Introduire des données dans Microsoft Fabric ou Choisir une stratégie de déplacement de données.

Raccourcis et miroirs en un coup d’œil

Les raccourcis et le miroir fonctionnent à différents niveaux de granularité et prennent en charge différents formats sources.

Capacité Qu’est-ce que cela fait ? Formats de source Scénario classique
Raccourcis Ajoutez une référence à des tableaux, dossiers ou fichiers sélectionnés dans OneLake ou un stockage externe. Les données restent à leur source. Formats ouverts uniquement Intégrez une seule table, un dossier ou un schéma dans une maison de lac, ou activez des motifs de maillage de données entre espaces de travail ou locataires.
Miroir Ajoutez une base de données externe ou un catalogue à Fabric. Selon la source, le miroir accède aux données sur place ou les réplique continuellement dans OneLake. Formats ouverts et propriétaires Intégrez une base de données ou un catalogue externe complet, comme Snowflake, Azure Databricks ou Azure SQL Database.

Si votre source stocke les données dans un format propriétaire, la mise en miroir est votre seule option.

Quand utiliser des raccourcis

Utilisez des raccourcis lorsque vous souhaitez inclure des données spécifiques dans votre vue OneLake unifiée sans les copier. Choisissez des raccourcis lorsque vous :

  • Partagez un seul tableau, dossier ou fichier entre espaces de travail ou locataires.
  • Combinez les données de plusieurs lacs ou comptes cloud en une seule vue unifiée.
  • Construisez des motifs de maillage de données où chaque domaine possède ses données et où d’autres domaines les découvrent via OneLake.
  • Rendez les données disponibles en formats ouverts, tels que Delta ou Iceberg, via Azure Data Lake Storage, Amazon S3, Google Cloud Storage ou Dataverse.

Les raccourcis fonctionnent au niveau de la table, du dossier ou du fichier. Vous décidez quelles données mettre à disposition et où elles apparaissent dans OneLake. Pour plus d'informations, consultez les raccourcis OneLake .

Transformez les données au fur et à mesure que vous les unifiez

Les transformations de raccourcis convertissent les données derrière un raccourci en une table Delta interrogable qui reste synchronisée avec la source, sans construire de pipeline ETL. Utilisez-les pour rendre vos données prêtes pour l’analyse :

  • Les transformations de fichiers convertissent des fichiers structurés, tels que CSV, Parquet, JSON ou Excel, en tables Delta. Pour plus d’informations, voir Transformations de raccourci (fichier).
  • Les transformations alimentées par l’IA appliquent le traitement du langage aux .txt fichiers pour résumer le contenu, détecter le sentiment, traduire des langues, expurger les informations personnelles identifiables (PII) ou extraire des entités nommées. Pour plus d’informations, voir Transformations de raccourci (alimentées par l’IA).

Quand utiliser le miroir

Utilisez le miroir lorsque vous souhaitez inclure une base de données externe ou un catalogue, ainsi que les données qui le sous-tendent, dans Fabric en tant qu’unité. Le miroir est le bon choix lorsque vous :

  • Rendez une base de données ou un catalogue externe complet disponible dans Fabric sans concevoir un processus d’ingestion séparé.
  • Conservez une copie prête pour l’analyse d’une base de données opérationnelle (comme Azure SQL Database, PostgreSQL ou Cosmos DB) dans OneLake qui reste synchronisée avec la source.
  • Exposez un lakehouse ou un entrepôt de données externe (tel que Databricks Unity Catalog ou Snowflake) dans Fabric afin de pouvoir l’interroger avec vos données Fabric.

La mise en miroir ajoute toujours à Fabric les métadonnées du catalogue, telles que les bases de données, les schémas et les tables. La manière dont Fabric accède aux données dépend de la source, comme le décrit la section suivante.

Comment le miroirement rend les données accessibles dans OneLake

Le miroir utilise deux mécanismes sous-jacents pour inclure les données externes dans la vue unifiée OneLake. La bonne combinaison dépend de la manière dont la source stocke ses données.

  • Réplication. La mise en miroir copie les données de la source dans OneLake, dans un format Delta prêt pour l’analyse. Le miroir utilise la réplication lorsque la source stocke les données dans un format propriétaire.
  • Raccourcis. Mise en miroir des données de références en place via des raccourcis OneLake. Le miroir utilise des raccourcis lorsque la source stocke les données dans un format ouvert que OneLake peut lire directement.

Différentes sources utilisent ces mécanismes différemment, comme le montre le tableau suivant.

Modèle source Examples Ce que fait le miroir
Mise en miroir de base de données (réplication) Azure Cosmos DB, Azure Database pour PostgreSQL, Azure Database pour MySQL (aperçu), Azure SQL Database, SQL Server, Oracle, SAP Le miroir copie les métadonnées du catalogue et réplique continuellement les données dans OneLake sous forme de tables Delta.
Miroir des métadonnées (raccourcis) Azure Databricks, Snowflake, Dremio (previsualizazio) La mise en miroir ajoute les métadonnées du catalogue à Fabric et s’appuie sur des raccourcis pour accéder aux données sous-jacentes sur place.

Dans tous les cas, le miroir ajoute les métadonnées du catalogue à Fabric. La question de savoir s’il copie également les données dépend de la source.

Utilisez des raccourcis et du miroir ensemble

Les raccourcis et le miroir ne s’excluent pas mutuellement. Vous pouvez les utiliser ensemble dans de nombreux scénarios. Par exemple, utilisez le miroir pour ajouter un système source à Fabric une fois, puis créez des raccourcis pour rendre certaines données de ce système disponibles à travers les espaces de travail, domaines ou locataires. Si le miroir réplique les données sources dans OneLake, les raccourcis vers ces données ne créent pas une autre copie ni n’ajoutent de coût de stockage.

Les modèles courants combinant ces deux capacités incluent :

  • Miroir une fois, consommer partout. Un espace de travail central reflète une base de données ou un catalogue externe, comme une Azure SQL Database ou un compte Snowflake. D’autres espaces de travail du même client disposent de raccourcis vers les tables mises en miroir au lieu de recréer une mise en miroir de la même source. Un élément en miroir représente la source, et chaque consommateur consulte les mêmes données à jour.
  • Miroir de domaine avec consommation de maillage. Les équipes de domaine répliquent leurs propres systèmes source dans leurs espaces de travail de domaine. Les maisons lacustres en aval et les entrepôts dans les espaces de travail des consommateurs utilisent des raccourcis pour n’accéder qu’aux tables dont ils ont besoin depuis la base de données miroir. Chaque domaine possède sa connexion à la source, et les consommateurs restent découplés du système source.
  • Une maison au lac, plusieurs emplacements de données. Un seul lakehouse peut contenir des raccourcis vers des tables mises en miroir ainsi que des raccourcis vers des données au format ouvert dans Azure Data Lake Storage, Amazon S3 ou un autre emplacement OneLake. Les rapports et les carnets interrogent le lakehouse comme un référentiel unifié, que les données sous-jacentes restent dans leur source d’origine ou soient répliquées dans OneLake.
  • Accès entre locataires ou entre clouds. Un locataire reflète une source dans son propre OneLake. Un locataire partenaire crée un raccourci vers les données miroirs au lieu de se voir accorder un accès direct au système source. Les identifiants du système source ne quittent jamais le locataire producteur.

Quelques points à savoir lorsque vous les combinez :

  • Les raccourcis vers les tables mises en miroir héritent du modèle de sécurité de l’élément mis en miroir. Les permissions sur la base de données en miroir, le schéma ou la table s’appliquent également à toute personne qui lit les données via le raccourci. Pour plus d’informations, consultez La sécurité des raccourcis OneLake.
  • Les raccourcis vers les tables mises en miroir sont accessibles en lecture seule. Pour modifier les données, changez le système source et laissez le miroir propager la mise à jour.
  • Si la source miroir est mise en pause, supprimée ou rencontre une erreur de réplication, chaque raccourci qui y pointe affiche le même état. Planifiez la responsabilité et le suivi de l’élément mis en miroir en conséquence.

Quand utiliser le mouvement de données à la place

Les raccourcis et le miroir unifient les données en les rendant accessibles via OneLake, ainsi que les transformations de raccourcis peuvent convertir ces données en tables Delta prêtes à l’analyse. Ils ne remplacent pas l'ensemble complet d'outils d'ingestion et de transfert de données de Fabric. Choisissez un pipeline, un flux de données, un travail de copie ou un flux d’événements lorsque vous devez :

  • Appliquer une logique de transformation complexe ou multi-source (par exemple, joindre des sources, appliquer des règles métier ou remodeler des schémas) qui va au-delà de ce que font les transformations de raccourcis.
  • Planifiez, orchestrez ou déclenchez les mouvements selon votre propre cadence.
  • Déplacez les données vers une destination en dehors de OneLake.
  • Diffusez les événements dans Fabric pour un traitement en temps réel.

Ces scénarios nécessitent les outils de transfert et d'intégration des données de Fabric plutôt que l'unification OneLake seule.