Tutoriel : Prévoir la demande à l’aide du Machine Learning automatisé sans code dans Azure Machine Learning studio

Découvrez comment créer un modèle de prévision de série chronologique sans écrire une seule ligne de code à l’aide du Machine Learning automatisé dans Azure Machine Learning studio. Ce modèle prédit la demande de location pour un service de partage de vélos.

Vous n’écrivez pas de code dans ce tutoriel. Au lieu de cela, vous utilisez l’interface Studio pour effectuer une formation. Vous apprenez à effectuer les tâches suivantes :

  • Créer et charger un jeu de données
  • Configurer et exécuter une expérience de ML automatisé
  • Indiquez les paramètres de prévision.
  • Explorer les résultats de l’expérience
  • Déployer le meilleur modèle

Pour essayer le Machine Learning automatisé pour d’autres types de modèles, consultez :

Prérequis

Se connecter au Studio

Pour ce tutoriel, vous allez créer votre expérience ML automatisée exécutée dans Azure Machine Learning studio. Azure Machine Learning studio est une interface web consolidée qui inclut des outils Machine Learning pour effectuer des scénarios de science des données pour les praticiens de la science des données de tous les niveaux de compétence.

  1. Connectez-vous au studio Azure Machine Learning.

  2. Sélectionnez votre abonnement et l’espace de travail que vous avez créé.

Créer une expérience

  1. Dans la section Création dans le menu de gauche, sélectionnez Machine Learning automatisé :

    Capture d’écran présentant la page de présentation Création pour AutoML dans Azure Machine Learning studio.

  2. Sélectionnez Nouveau travail AutoML pour démarrer le processus Envoyer un travail AutoML.

    Par défaut, le processus sélectionne l’option Effectuer l’apprentissage automatiquement dans l’onglet Méthode de formation et passe aux paramètres de configuration.

  3. Dans l’onglet Paramètres de base, entrez les valeurs des paramètres requis, y compris le nom du travail et le nom de l’expérience. Pour ce didacticiel, utilisez automl-bikeshare le nom de l’expérience. Vous pouvez également fournir des valeurs pour les paramètres facultatifs comme il vous convient.

  4. Sélectionnez Suivant pour continuer.

Configurer votre type de tâche et votre jeu de données

Sous l’onglet Type de tâche et données , spécifiez la ressource de données de l’expérience et le modèle Machine Learning à utiliser pour entraîner les données. Dans ce tutoriel, utilisez le fichier bike-no.csv . Si vous n’avez pas téléchargé le fichier, téléchargez-le maintenant.

  1. Dans le type de tâche et le formulaire de données , sélectionnez Prévision de série chronologique comme type de tâche.

  2. Sélectionnez Créer pour créer une ressource de données à partir du fichier téléchargé.

  3. Dans la page Type de données , entrez un nom pour votre jeu de données et fournissez une description facultative. Définissez le type de jeu de données sur Tabulaire. Sélectionnez Suivant pour continuer.

  4. Dans la page Source de données, sélectionnez À partir de fichiers locaux.

Des options supplémentaires apparaissent dans le menu de gauche pour configurer la source de données.

  1. Sélectionnez Suivant pour passer à la page Type de stockage de destination, où vous spécifiez l’emplacement de Stockage Azure pour y charger votre ressource de données.

    1. Pour Type de magasin de données, sélectionnez Stockage Blob Azure.
    2. Dans la liste des magasins de données, sélectionnez le magasin de données par défaut que le processus de création de l’espace de travail configure automatiquement : workspaceblobstore.
    3. Sélectionnez Suivant.
  2. Dans la page de sélection de fichiers et de dossiers , utilisez le menu déroulant Charger des fichiers ou des dossiers , puis sélectionnez l’option Charger des fichiers .

    1. Choisissez le fichier bike-no.csv sur votre ordinateur local. Ce fichier est celui que vous avez téléchargé en tant que prérequis.

    2. Une fois les fichiers chargés, sélectionnez Suivant.

  3. Vérifiez la précision de vos données chargées sur la page Paramètres . Les champs de la page sont préremplis en fonction du type de fichier de vos données :

    Champ Descriptif Valeur du didacticiel
    Format de fichier Définit la disposition et le type des données stockées dans un fichier. Delimited
    Délimiteur Un ou plusieurs caractères utilisés pour spécifier la limite entre des régions indépendantes et séparées dans du texte brut ou d’autres flux de données. Virgule
    Encodage Identifie la table de schéma bits/caractères à utiliser pour lire votre jeu de données. UTF-8
    En-têtes de colonne Indique la façon dont les éventuels en-têtes du jeu de données sont traités. Seul le premier fichier comporte des en-têtes
    Ignorer les lignes Indique le nombre éventuel de lignes ignorées dans le jeu de données. Aucun
  4. Sélectionnez Suivant pour passer à la page Schéma. Cette page est également préremplie en fonction de vos sélections Paramètres.

    1. Pour ce tutoriel, choisissez d’ignorer les colonnes casual et registered. Ces colonnes sont une répartition de la colonne cnt . Ne les incluez donc pas.

    2. Pour ce didacticiel, conservez les valeurs par défaut pour les propriétés et le type.

    3. Sélectionnez Suivant pour passer à la page Vérifier + créer .

  5. Passez en revue les paramètres de votre ressource de données. Si tout semble correct, sélectionnez Créer pour créer la ressource de données.

Configurer les paramètres de tâche et de prévision

Lorsque la ressource de données est prête, Machine Learning Studio retourne à l’onglet De type de tâche et de données pour le processus Envoyer un travail ML automatisé. La nouvelle ressource de données apparaît sur la page.

Suivez ces étapes pour terminer la configuration du travail :

  1. Développez le menu déroulant Sélectionner le type de tâche , puis choisissez Prévision de série chronologique.

  2. Après avoir spécifié le modèle d’entraînement, sélectionnez votre jeu de données dans la liste. Sélectionnez Suivant pour passer à l’onglet Paramètres de tâche.

  3. Dans la liste déroulante Colonne cible , sélectionnez la colonne cnt à utiliser pour les prédictions de modèle.

  4. Sélectionnez date comme colonne temporelle et laissez les identifiants de série temporelle vides.

  5. La Fréquence correspond à la fréquence de collecte de vos données historiques. Laissez Détection automatique sélectionné.

  6. L’horizon de prévision est la période dans le futur pour laquelle vous voulez faire des prédictions. Décochez Détection automatique et tapez 14 dans le champ.

  7. Laissez activer l’apprentissage profond désélectionné.

  8. Sélectionnez Afficher des paramètres de configuration supplémentaires et renseignez les champs comme suit. Ces paramètres vous aident à mieux contrôler le travail d’entraînement et à spécifier les paramètres de votre prévision. Sinon, les valeurs par défaut sont appliquées en fonction de la sélection de l’expérience et des données.

    Configurations supplémentaires Descriptif Valeur du didacticiel
    Métrique principale Métrique d’évaluation par laquelle l’algorithme Machine Learning est mesuré. Erreur quadratique moyenne normalisée
    Expliquer le meilleur modèle Affiche automatiquement l’explicabilité pour le meilleur modèle créé par l’apprentissage automatique automatisé. Activer
    Modèles bloqués Algorithmes que vous souhaitez exclure du travail de formation Arbres aléatoires extrêmes
    Paramètres de prévision supplémentaires Ces paramètres contribuent à améliorer la justesse de votre modèle.

    Décalages de cibles de prévision : antériorité avec laquelle vous voulez construire les décalages d’une variable cible
    Fenêtre propagée cible : spécifie la taille de la fenêtre propagée sur laquelle les fonctionnalités, telles que la valeur max, min et sum, sont générées.


    Décalages de cibles de prévision : aucun
    Taille cible de la fenêtre glissante : Aucune
    Limits Si un critère est atteint, le travail de formation s’arrête. Nombre maximal d’essais simultanés : 6
    Seuil du score de métrique : Aucun
    Délai d’expiration de l’expérience (minutes) : 180
  9. Dans le formulaire [Facultatif] Valider et tester :

    1. Sélectionnez la validation croisée k-fold comme type de validation.

    2. Sélectionnez 5 comme nombre de validations croisées.

  10. Sélectionnez Enregistrer.

Configurer la cible de calcul

Après avoir chargé et configuré vos données, configurez votre cible de calcul distante.

  1. Remplissez le formulaire De calcul comme suit :

    1. Utilisez la liste déroulante Sélectionner un type de calcul pour sélectionner le cluster de calcul comme type de calcul.

    2. Sélectionnez +Nouveau pour configurer votre cible de calcul. Le ML automatisé prend uniquement en charge la capacité de calcul Azure Machine Learning.

      1. Remplissez le formulaire Sélectionner une machine virtuelle pour configurer votre calcul :

        Champ Descriptif Valeur du didacticiel
        Niveau de machine virtuelle Sélectionnez la priorité que doit avoir votre expérience Dédié
        Type de machine virtuelle Sélectionnez le type de machine virtuelle pour votre calcul Processeur (CPU)
        Taille de la machine virtuelle Sélectionnez la taille de la machine virtuelle pour votre calcul. La liste des tailles recommandées qui est fournie dépend de vos données et du type de l’expérience. Standard_DS12_V2
      2. Sélectionnez Suivant pour remplir le formulaire Configurer les paramètres :

        Champ Descriptif Valeur du didacticiel
        Nom de la ressource de calcul Nom unique qui identifie votre contexte de calcul. bike-compute
        Nombre minimal/maximal de nœuds Pour profiler des données, vous devez spécifier un ou plusieurs nœuds. Nœuds min. : 1
        Nœuds max. : 6
        Secondes d’inactivité avant le scale-down Durée d’inactivité avant que le cluster ne fasse l’objet d’un scale-down vers le nombre de nœuds minimal. 120 (par défaut)
        Paramètres avancés Paramètres pour configurer et autoriser un réseau virtuel pour votre expérience. Aucun
      3. Sélectionnez Créer pour créer la cible de calcul.

        Cette étape prend quelques minutes.

      4. Après la création, sélectionnez votre nouvelle cible de calcul dans la liste déroulante.

    3. Sélectionnez Suivant pour passer à la page Vérifier. Passez en revue le résumé de vos paramètres de configuration pour le travail.

Exécuter une expérience

Pour exécuter votre expérience, sélectionnez Envoyer un travail de formation. L’écran Détails de la tâche s’ouvre avec État de la tâche en haut à côté du numéro de la tâche. Cet état est mis à jour à mesure que l’expérience progresse. Les notifications apparaissent également dans le coin supérieur droit du studio pour vous informer de l’état de votre expérience.

Important

La préparation nécessaire à la tâche de l’expérience prend 10 à 15 minutes. Une fois que l’exécution a commencé, 2-3 minutes supplémentaires sont nécessaires pour chaque itération.

En production, vous vous éloignerez probablement un moment, car ce processus prend du temps. Pendant que vous attendez, commencez à explorer les algorithmes testés sous l’onglet Modèles à mesure qu’ils se terminent.

Explorer les modèles

Accédez à l’onglet Modèles + travaux enfants pour voir les algorithmes (modèles) testés. Par défaut, les modèles sont classés par score de métrique à mesure qu’ils se terminent. Pour ce tutoriel, le modèle qui note le plus élevé en fonction de la métrique d’erreur carrée moyenne de racine normalisée choisie apparaît en haut de la liste.

En attendant que toutes les modèles d’expérience se terminent, sélectionnez le Nom de l’algorithme d’un modèle terminé pour explorer ses performances en détail.

L’exemple suivant montre comment sélectionner un modèle dans la liste des modèles créés par le travail. Ensuite, vous sélectionnez les onglets Vue d’ensemble et Métriques pour afficher les propriétés, les métriques et les graphiques de performances du modèle sélectionné.

Capture d’écran de la navigation dans l’interface d’exploration de modèle montrant les onglets Vue d’ensemble et Métriques pour afficher les propriétés du modèle et les graphiques de performances.

Déployer le modèle

Le Machine Learning automatisé dans Azure Machine Learning studio vous aide à déployer le meilleur modèle sur un point de terminaison en ligne en temps réel en quelques étapes. Le déploiement consiste à intégrer le modèle pour qu’il puisse prédire de nouvelles données et identifier les domaines potentiels d’opportunités.

Pour cette expérience, le déploiement vers un point de terminaison en temps réel signifie que l’entreprise de partage de vélos dispose désormais d’une solution web évolutive pour la prévision de la demande de location de partage de vélos.

Lorsque vous effectuez un déploiement à partir de la page ML automatisé , vous n’avez pas besoin de préparer un script de scoring ou un environnement. Azure Machine Learning génère automatiquement les deux et héberge le modèle sur un point de terminaison en ligne entièrement géré.

Une fois le travail terminé, sélectionnez Travail 1 en haut de votre écran pour revenir à la page du travail parent.

Dans la section Résumé du meilleur modèle , le meilleur modèle dans le contexte de cette expérience est sélectionné en fonction de la métrique d’erreur carrée moyenne normalisée.

Déployez ce modèle. Le déploiement prend quelques minutes. Le processus de déploiement enregistre le modèle, génère automatiquement le script de calcul de score et l’environnement, et provisionne le point de terminaison en ligne.

  1. Sélectionnez le meilleur modèle pour ouvrir la page propre au modèle.

  2. Sélectionnez Déployer>Point de terminaison en temps réel.

    Azure Machine Learning génère le modèle et l’environnement nécessaires au déploiement.

  3. Dans l’assistant de déploiement, fournissez les valeurs suivantes. Conservez les valeurs par défaut pour tous les champs qui ne sont pas répertoriés.

    Champ Valeur
    Nom du point de terminaison Entrez un nom unique, tel que bikeshare-endpoint.
    Nom du déploiement Entrez un nom, tel que bikeshare-deploy.
    Machine virtuelle Conservez la taille de machine virtuelle par défaut recommandée.
    Nombre d’instances 1
    Type d’authentification Conservez la valeur par défaut (authentification basée sur la clé).
  4. Terminez les étapes restantes dans l’assistant, puis sélectionnez Déployer.

    Une notification confirme que le déploiement a démarré correctement. Suivez la progression dans le volet Résumé du modèle sous État de déploiement.

Une fois le déploiement réussi, vous disposez d’un point de terminaison en temps réel opérationnel qui génère des prédictions.

Pour en savoir plus sur la façon d’utiliser votre nouveau point de terminaison et de tester vos prédictions à l’aide de la prise en charge intégrée d’Azure Machine Learning dans Power BI, consultez Étapes suivantes.

Pour plus d’options de déploiement, notamment les Azure CLI et Python SDK, consultez Déployer un modèle AutoML sur un point de terminaison en ligne.

Nettoyer les ressources

Les fichiers de déploiement sont plus volumineux que les fichiers de données et d’expérimentation. Le coût de leur stockage est donc plus élevé. Supprimez uniquement les fichiers de déploiement pour réduire les coûts associés à votre compte, ou si vous souhaitez conserver vos fichiers d’expérience et d’espace de travail. Sinon, supprimez l’ensemble du groupe de ressources si vous ne prévoyez pas d’utiliser les fichiers.

Supprimer le point de terminaison en temps réel

Si vous souhaitez conserver le groupe de ressources et l’espace de travail pour d’autres didacticiels et exploration, supprimez simplement le point de terminaison en temps réel de Azure Machine Learning studio. La suppression du point de terminaison supprime également son déploiement associé.

  1. Accédez à Azure Machine Learning Studio. Accédez à votre espace de travail et, à gauche dans le volet Ressources, sélectionnez Points de terminaison.

  2. Sélectionnez le point de terminaison à supprimer, puis sélectionnez Supprimer.

  3. Sélectionnez Continuer.

Supprimer le groupe de ressources

Important

Les ressources que vous avez créées peuvent être utilisées comme prérequis pour d’autres tutoriels d’Azure Machine Learning et des articles de procédure.

Si vous n’avez pas l’intention d’utiliser les ressources que vous avez créées, supprimez-les pour éviter des frais :

  1. Dans la zone de recherche du Portail Azure, saisissez Groupes de ressources, puis sélectionnez-le dans les résultats.

  2. Dans la liste, sélectionnez le groupe de ressources créé.

  3. Dans la page Vue d’ensemble, sélectionnez Supprimer le groupe de ressources.

    Capture d’écran des sélections permettant de supprimer un groupe de ressources dans le portail Azure.

  4. Entrez le nom du groupe de ressources. Puis sélectionnez Supprimer.

Étapes suivantes

Dans ce tutoriel, vous avez utilisé le ML automatisé dans Azure Machine Learning Studio pour créer et déployer un modèle de prévision de série chronologique qui prédit la demande de location de vélos en libre-service.

Remarque

Ce jeu de données de partage de vélos est modifié pour ce didacticiel. Ce jeu de données, mis à disposition dans le cadre d’un concours Kaggle, a été initialement proposé par Capital Bikeshare. Vous pouvez également le trouver dans la base de données Machine Learning UCI.

Source : Fanaee-T, Hadi, et Gama, Joao, Étiquetage d’événements combinant des détecteurs d’ensemble et des connaissances de fond, Progress in Artificial Intelligence (2013) : pp. 1-15, Springer Berlin Heidelberg.