connecteur GitHub

Important

Cette fonctionnalité est en version bêta. Les administrateurs d’espace de travail peuvent contrôler l’accès à cette fonctionnalité à partir de la page Aperçus . Consultez Gérer les préversions d’Azure Databricks.

Le connecteur de GitHub managé dans Lakeflow Connect vous permet d’ingérer des données de GitHub dans Azure Databricks.

Disponibilité des fonctionnalités

Fonctionnalité Availability
Création de pipelines basés sur l’interface utilisateur cochez oui Soutenu
Création de pipelines basés sur l’API cochez oui Soutenu
Paquets d'Automatisation déclarative cochez oui Soutenu
Ingestion progressive cochez oui Partiellement pris en charge
Certaines tables prennent en charge l’ingestion incrémentielle. D’autres tables nécessitent une actualisation complète. Consultez les données prises en charge.
Gouvernance du catalogue Unity cochez oui Soutenu
Travaux Lakeflow cochez oui Soutenu
Type SCD 2 cochez oui Soutenu
Sélection de colonnes et désélection cochez oui Soutenu
Filtrage de lignes basé sur l’API x mark no Non pris en charge
Évolution du schéma automatisé : colonnes nouvelles et supprimées x mark no Non pris en charge
Évolution automatisée du schéma : modifications du type de données x mark no Non pris en charge
Évolution du schéma automatisé : renommage des colonnes x mark no Non pris en charge
Évolution automatisée du schéma : nouvelles tables x mark no Non pris en charge

Méthodes d’authentification

Méthode d’authentification Availability
OAuth U2M cochez oui Soutenu
OAuth M2M x mark no Non pris en charge
OAuth (jeton d’actualisation manuel) x mark no Non pris en charge
Authentification de base (nom d’utilisateur/mot de passe) x mark no Non pris en charge
Authentification de base (clé API) x mark no Non pris en charge
Authentification de base (clé JSON du compte de service) x mark no Non pris en charge

Que savoir avant de commencer

Sujet Pourquoi cela se produit-il
Persona utilisateur Azure Databricks Le flux de travail dépend de votre persona utilisateur Azure Databricks :
  • Utilisateur unique : un utilisateur administrateur crée une connexion à Unity Catalog et un pipeline d'ingestion.
  • Multi-utilisateur : un utilisateur administrateur crée une connexion avec laquelle les utilisateurs non administrateurs créent des pipelines.
Méthode d’authentification Les étapes de création d’une connexion dépendent de la méthode d’authentification que vous choisissez.
Interface Les étapes de création d’un pipeline dépendent de l’interface.
Fréquence d’ingestion La planification du pipeline dépend de vos besoins en matière de latence et de coût.
Modèles courants Selon vos besoins d’ingestion, le pipeline peut utiliser des configurations telles que le suivi de l’historique, la sélection de colonnes et le filtrage de lignes. Les configurations prises en charge varient selon le connecteur. Consultez Disponibilité des fonctionnalités.

Commencer l’ingestion à partir de GitHub

Le tableau suivant récapitule le flux d’ingestion de bout en bout GitHub, en fonction du type d’utilisateur :

Utilisateur Steps
Admin
Non administrateur Utilisez n’importe quelle interface prise en charge pour créer un pipeline à partir d’une connexion existante. Voir Ingérer des données depuis GitHub.