Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Cette page est une architecture de référence de fonctionnalité par fonctionnalité pour la protection contre l’exfiltration de données au niveau du réseau sur Azure. Chaque section décrit un contrôle, comme l’identité, la gouvernance du catalogue Unity, les restrictions de l’espace de travail, la surveillance et l’isolation réseau spécifique au cloud, et des liens vers son guide d’implémentation. Pour connaître les concepts et les priorités de la couche de sécurité derrière ces contrôles, consultez la protection contre l’exfiltration des données.
- Pour déployer l’ensemble complet des contrôles sous la forme d’un bundle unique, utilisez le module Terraform de l’architecture de référence de sécurité Azure Databricks, qui implémente de bout en bout l’architecture Environnement isolé. Consultez le module Terraform de l’architecture de référence de sécurité Azure.
- Pour configurer des contrôles individuellement, utilisez le guide ci-dessous.
Contrôles des identités et des accès
Les contrôles basés sur l’identité constituent la première ligne de défense contre l’exfiltration des données. Sans authentification forte et accès approuvé, l’identité faible sape les contrôles au niveau du réseau.
Connexion unifiée avec l’authentification unique
Appliquez l’authentification unique (SSO) sur tous les espaces de travail du compte Azure Databricks à l’aide de la connexion unifiée. Cela garantit que les utilisateurs s’authentifient auprès du fournisseur d’identité de votre entreprise plutôt que d’utiliser des comptes personnels ou des méthodes sans authentification unique (SSO).
Activez l’authentification multifacteur (MFA) au sein de votre fournisseur d’identité pour une couche supplémentaire de vérification.
Consultez Authentification et contrôle d’accès.
Gestion automatisée des identités
Implémentez le provisionnement SCIM pour automatiser la gestion du cycle de vie des utilisateurs. Cela garantit que les anciens employés sont automatiquement déprovisionnés et ne peuvent pas accéder aux espaces de travail après le départ.
Voir Synchroniser les utilisateurs et groupes de Microsoft Entra ID à l'aide de SCIM.
Contrôles d’accès réseau
Restreindre l’accès à l’espace de travail et à la console de compte aux réseaux approuvés :
- Listes d’accès IP au niveau du compte : contrôlez l’accès à la console de compte. Voir Configurer des listes d’accès IP pour la console de compte.
- Listes d’accès IP au niveau de l’espace de travail : contrôlez l’accès à des espaces de travail individuels. Voir Configurer des listes d’accès IP pour les espaces de travail.
- Connectivité privée : utilisez Private Link entrant pour supprimer complètement l’accès public à l’espace de travail. Voir Configurer le lien Private Link entrant pour les espaces de travail.
Contrôles de gouvernance des données
Les contrôles réseau empêchent les chemins de sortie non autorisés, mais les contrôles de gouvernance des données garantissent que même les ressources de calcul autorisées peuvent uniquement accéder aux destinations de données approuvées. Appliquez ces contrôles, quelle que soit l’architecture de sécurité réseau que vous déployez.
Contrôle d’accès standard
Utilisez des privilèges de catalogue Unity pour restreindre les utilisateurs autorisés à lire, écrire ou modifier chaque catalogue, schéma, table et volume. Accordez les privilèges minimaux requis pour chaque rôle et groupe.
Les privilèges se propagent de manière hiérarchique : une autorisation accordée sur un catalogue s’applique à tous les schémas et à toutes les tables qu’il contient. Utilisez cette option pour appliquer des valeurs par défaut étendues, puis restreindre l’accès à des niveaux inférieurs pour les données sensibles.
Consultez Gérer les privilèges dans Unity Catalog.
Contrôle d’accès basé sur les attributs (ABAC)
ABAC régit l’accès aux données en fonction des étiquettes attachées aux objets de données, et pas seulement de l’identité d’objet. Utilisez ABAC pour appliquer des stratégies telles que « les utilisateurs ne peuvent interroger que les tables étiquetées pii=false» ou « les utilisateurs du groupe UE ne peuvent pas lire les tables étiquetées region=US».
ABAC s’adapte mieux aux GRANTs par objet dans les grands environnements où les conventions de balisage sont déjà en place. Il s’associe également bien aux filtres de lignes et aux masques de colonne (ci-dessous).
Consultez le contrôle d’accès basé sur les attributs dans le catalogue Unity.
Filtres de lignes et masques de colonne
Limitez ce que les utilisateurs voient dans une table :
- Filtres de lignes : appliquez une fonction SQL qui détermine les lignes qu’un utilisateur peut interroger. Par exemple, limitez une table de ventes afin que chaque responsable régional ne voie que les lignes correspondant à sa région.
-
Masques de colonne : appliquez une fonction SQL qui transforme la valeur d’une colonne avant de revenir à l’utilisateur. Par exemple, masquez les numéros de carte bancaire par
XXXX-XXXX-XXXX-1234pour les utilisateurs n’appartenant pas au service financier.
Les filtres de lignes et les masques de colonnes sont évalués lors de l’exécution de la requête, de sorte que les utilisateurs ne puissent pas les contourner avec SELECT *.
Restrictions administratives du catalogue Unity
Limitez la création des éléments sécurisables d’accès aux données aux seuls administrateurs :
- Informations d’identification de stockage : autorisez uniquement les administrateurs à créer des informations d’identification de stockage. Appliquez des stratégies d’accès cloud avec privilège minimum (rôles IAM, identités managées) pour chaque informations d’identification. Consultez Gérer les informations d’identification de stockage.
- Emplacements externes : autorisez uniquement les administrateurs à créer des emplacements externes qui mappent aux chemins de stockage cloud. Consultez Gérer les emplacements externes.
- Connexions de base de données : autorisez uniquement les administrateurs à créer des connexions à des bases de données externes via Lakehouse Federation. Consultez Gérer les connexions pour Lakehouse Federation.
- Informations d’identification du service : autorisez uniquement les administrateurs à créer des informations d’identification de service pour les services cloud externes. Consultez Créer des informations d’identification de service.
Accordez aux utilisateurs des autorisations pour utiliser des éléments sécurisables approuvés plutôt que de les créer. Cela empêche les utilisateurs de pointer le calcul sur un stockage ou des points de terminaison non approuvés.
Liaisons d’espace de travail pour les catalogues
Associez des catalogues Unity Catalog à des espaces de travail spécifiques pour empêcher tout accès aux données entre environnements. Par exemple, empêchez les espaces de travail de développement de lire les données de production.
Consultez la liaison catalogue-espace de travail.
Stratégies de compte de stockage
Implémentez des pare-feu ou des stratégies de compartiment sur des comptes de stockage pour accepter le trafic uniquement à partir de destinations sources approuvées :
- Configurez les pare-feu d’stockage Azure pour autoriser l’accès uniquement depuis des VNets approuvés, des points de terminaison privés ou des points de terminaison de service.
- Utilisez des identités managées avec des attributions de rôles avec privilèges minimum.
Restrictions relatives à l’espace de travail
Les paramètres d’administration de l’espace de travail permettent de gérer les chemins d’accès de téléchargement et d’exportation des données via l’interface utilisateur d’Azure Databricks. Désactivez ces paramètres pour empêcher les utilisateurs d’extraire des données via l’interface de l’espace de travail.
| Réglage | Risque atténué |
|---|---|
| Désactiver le téléchargement des résultats du notebook | Utilisateurs téléchargeant les résultats des requêtes sur des ordinateurs locaux |
| Désactiver le téléchargement des fichiers de volume | Utilisateurs téléchargeant des fichiers de volume sur des ordinateurs locaux |
| Désactiver l’exportation de carnets et de fichiers | Utilisateurs qui exportent des notebooks ou des fichiers à partir de l’espace de travail |
| Désactiver le téléchargement des résultats SQL | Utilisateurs téléchargeant les résultats de requête SQL |
| Désactiver le téléchargement des artefacts d'exécution de flux MLflow | Utilisateurs téléchargeant des artefacts d’expérience MLflow |
| Désactiver le Presse-papiers de table de résultats | Utilisateurs copiant des données tabulaires dans le Presse-papiers |
Configurez ces paramètres dans la console d’administration de l’espace de travail sous paramètres de sécurité. Consultez pour gérer votre espace de travail.
Surveillance et détection
Les contrôles préventifs réduisent le risque d’exfiltration des données, mais la surveillance détecte quand les contrôles échouent ou quand les attaquants les contournent.
Tables système pour la surveillance de l’audit
Utilisez Azure Databricks Surveiller les coûts à l’aide des tables système pour surveiller les schémas d’accès aux données. La référence de la table système du journal d’audit consigne les événements de l’espace de travail, notamment :
- Tentatives d’authentification et d’accès des utilisateurs.
- Opérations de lecture et d’écriture des données.
- Modifications de configuration administrative.
- Utilisation des identifiants et accès aux emplacements externes.
Configurez des alertes pour les activités suspectes, telles que des volumes de données inhabituels, l’accès à partir d’emplacements inattendus ou des tentatives d’accès à des ressources non autorisées.
Intégration des journaux d'activité native du cloud
Ingérer des journaux spécifiques au cloud pour compléter les tables système Azure Databricks :
- Configurez Azure Monitor et le journal d’activité pour capturer les événements d’accès au stockage, l’utilisation des identités managées et les journaux de flux réseau.
Mettre en corrélation les journaux natifs du cloud avec les journaux d’audit Azure Databricks pour une visibilité complète sur les mouvements de données dans votre environnement.
Architecture d'Azure
L’architecture Azure utilise l’injection de réseau virtuel, Private Link et Pare-feu Azure pour créer un périmètre réseau sécurisé autour des charges de travail Azure Databricks.
Prerequisites
| Composant | Détails |
|---|---|
| réseau virtuel | Réseau virtuel (VNet) géré par le client pour le déploiement du plan de données d’Azure Databricks à l’aide de Déployer Azure Databricks dans votre réseau virtuel Azure (injection dans un réseau virtuel). |
| Sous-réseaux | Trois sous-réseaux : hôte (public), conteneur (privé) et sous-réseau de point de terminaison privé. |
| Pare-feu ou appliance réseau virtuelle | Appliance réseau virtuelle (Pare-feu Azure ou une solution tierce) pour l’inspection du trafic sortant et l’application des politiques. |
| Zones DNS privées | Résolution DNS pour les points de terminaison privés au sein du réseau virtuel. |
| Azure Key Vault | Stocke les clés gérées par le client pour le chiffrement DBFS, les disques managés et le chiffrement des services managés. |
| Liste d’autorisation du pare-feu | Points de terminaison Azure Databricks obligatoires. Consultez Configurer les règles de pare-feu de nom de domaine. |
Composants d’architecture
L’architecture comporte quatre domaines principaux : l’isolation réseau, la connectivité privée, le contrôle de sortie et la sécurité serverless.
Isolation du réseau
Déployez Azure Databricks avec Activer la connectivité sécurisée du cluster (SCC) activée dans un réseau virtuel en utilisant Déployer Azure Databricks dans votre réseau virtuel Azure (injection dans un réseau virtuel [VNet]). Vous pouvez déployer à l’aide d’une topologie hub-and-spoke avec un pare-feu centralisé ou une topologie réseau isolée (île) sans hub. Cette configuration :
- Élimine les adresses IP publiques sur les nœuds de cluster.
- Nécessite des paires de sous-réseaux dédiées par espace de travail (un privé, un public).
- Route le trafic du plan de contrôle via des points de terminaison privés.
Tip
Ne stockez pas les données d’application dans le stockage racine DBFS. Désactivez l’accès à la racine DBFS et aux points de montage dans votre espace de travail Azure Databricks existant et utilisez Que sont les volumes d’Unity Catalog ? à la place.
Connectivité privée
Configurez des points de terminaison Private Link pour les comptes de stockage Azure gérés par le client dans un sous-réseau dédié :
- Tous les accès aux données se produisent sur le réseau principal Azure.
- Les points de terminaison privés peuvent être déployés dans le réseau virtuel Azure Databricks ou dans un réseau virtuel jumelé.
- Comme alternative aux comptes de stockage gérés par le client, utilisez Configurer les stratégies de point de terminaison de service du réseau virtuel Azure pour l’accès au stockage depuis les services de calcul classiques (sans coût supplémentaire).
Note
Les points de terminaison privés et les stratégies de point de terminaison de service s’appliquent uniquement aux comptes de stockage gérés par le client Azure. les ressources gérées par Azure Databricks (stockage d’artefacts, stockage des journaux et Event Hubs) ne peuvent pas être placées derrière des points de terminaison privés.
Configurez Configurez le Private Link entrant pour les espaces de travail pour l’accès des utilisateurs et l’authentification par navigateur (SSO).
Contrôle de sortie
Déployez Pare-feu Azure (ou une appliance virtuelle réseau tierce) dans un réseau virtuel hub :
- Règles d’application : définissez les noms de domaine complets accessibles via le pare-feu (plan de contrôle, application web et relais SCC si le plan de calcul classique Private Link n’est pas configuré).
- Règles réseau : définissez l’adresse IP, le port et le protocole pour les points de terminaison qui ne peuvent pas utiliser de noms de domaine complets.
-
Routes définies par l’utilisateur (UDR) : acheminer le trafic non local depuis les sous-réseaux Azure Databricks via le pare-feu à l’aide d’une route par défaut (
0.0.0.0/0).
Note
Lorsque vous utilisez des stratégies de point de terminaison de service, aucune règle réseau de pare-feu n’est nécessaire pour les comptes de stockage de service Azure Databricks (artefacts, journalisation, tables système).
Les points de terminaison de service contournent le pare-feu pour le stockage système d’Azure Databricks, ce qui réduit les coûts de transfert de données et évite la limitation du débit. Le stockage d’artefacts seul peut prendre en compte jusqu’à 11 Go téléchargés par nœud de cluster.
Sécurité serverless
Configurez Qu’est-ce que le contrôle du trafic sortant sans serveur ? pour gérer le trafic sortant. Utilisez la mise en réseau du plan de calcul serverless pour établir des connexions privées entre le plan de calcul serverless et les comptes de stockage Azure Data Lake Storage (ADLS Gen2).
Stratégies d’optimisation :
- Utilisez des points de terminaison de service au lieu de Private Link où les exigences de sécurité autorisent.
- Configurez les stratégies de point de terminaison de service pour contourner le pare-feu pour le stockage système d’Azure Databricks (afin de réduire les coûts de transfert de données et d’éviter la limitation du débit).
- Dimensionnez correctement Pare-feu Azure ou le débit d’une appliance virtuelle réseau (NVA) en fonction des besoins réels.
- Surveillez les coûts de transfert de données par le biais d’appliances de pare-feu.
Pour obtenir des conseils détaillés, consultez Comprendre les coûts de mise en réseau Databricks .
Voir également :
| Ressource | Description |
|---|---|
| Architectures de référence réseau | Architectures de sécurité réseau (gérées, renforcées, isolées). |
| Sécurité et conformité | Contrôles de sécurité et de conformité au-delà de la mise en réseau. |