Choisir une technologie de traitement et de génération d’images et de vidéos Azure AI

Foundry Tools permet aux développeurs et aux organisations de créer des applications prêtes pour l’IA, avancées et prêtes pour la production qui s’alignent sur les pratiques d’IA responsables en utilisant des API et des modèles prédéfinis et personnalisables.

Cet article décrit les fonctionnalités de traitement vidéo et d’image dans Foundry, telles que l’analyse visuelle et la génération d’images, la détection d’objets, la classification des images et la reconnaissance faciale. La suite comprend les services suivants :

  • Azure OpenAI dans Les modèles Foundry fournit un accès aux modèles de langage OpenAI suivants :

    • La dernière génération de modèles GPT qui ont des fonctionnalités de vision et d’audio

    • DALL-E pour la génération d’images

    • Modèles audio pour les conversations vocales en temps réel, la génération audio, la transcription de reconnaissance vocale (STT), la traduction et la synthèse vocale (TTS)

    Utilisez Azure OpenAI pour la génération d’images à partir d’un langage naturel, d’une analyse d’image large et non spécifique ou de scénarios audio qui ne nécessitent pas de service speech dédié.

  • Azure Vision dans Foundry Tools fournit des algorithmes avancés qui traitent des images et retournent des informations basées sur des fonctionnalités visuelles. Il inclut la reconnaissance optique de caractères (OCR), l’analyse d’images et les fonctionnalités de détection des visages.

  • Azure Machine Learning AutoML pour Vision par ordinateur automatise l’entraînement des modèles et le réglage des hyperparamètres pour la classification d’images, la détection d’objets et la segmentation d’instance. Vous pouvez télécharger le modèle obtenu ou inscrire et déployer le modèle dans Azure Machine Learning.

  • Azure Content Understanding dans Foundry Tools utilise l’IA générative pour extraire des champs structurés à partir d’images et de vidéos. Utilisez Azure Content Understanding lorsque vous avez besoin d’une extraction définie par un schéma, d’une segmentation de scène ou d’une sortie vidéo prête pour la génération augmentée par récupération (RAG).

  • Microsoft Azure AI Video Indexer est une solution IA que les organisations peuvent utiliser pour extraire des insights approfondis à partir de contenu vidéo et audio. Il prend en charge les sources en direct et téléchargées à l'aide de modèles d'intelligence artificielle générative et d'apprentissage automatique avancés.

Azure OpenAI

Azure OpenAI permet d’accéder aux modèles de langage puissants d’OpenAI, notamment la dernière génération de modèles GPT qui ont des fonctionnalités d’image, de vidéo et d’audio. DALL-E et les modèles de génération d’images GPT et audio pour les conversations vocales en temps réel, la génération audio et la transcription, STT, traduction vocale et TTS sont également disponibles.

Utiliser Azure OpenAI pour ces tâches N’utilisez pas Azure OpenAI pour ces tâches
Générez des images à partir de descriptions de langage naturel à l’aide de modèles DALL-E ou GPT-image. Effectuez des tâches de traitement d’images spécifiques, telles que l’extraction de formulaires ou la détection spécialisée dans le domaine. Utilisez Azure Document Intelligence pour ces tâches.
Effectuez une analyse large et non spécifique sur des images à l’aide de modèles compatibles avec la vision comme GPT-4o. Extrayez des champs structurés à partir d’images à l’aide d’un schéma que vous définissez. Pour l’extraction pilotée par le schéma, utilisez Azure Content Understanding.
Transcrivez STT ou traduisez l’audio parlé à l’aide de modèles de transcription Whisper ou GPT-4o. Détecter, reconnaître ou analyser des visages humains. Pour les tâches liées aux visages, utilisez Azure Vision.
Activez les conversations vocales en temps réel à faible latence à l’aide de modèles audio EN temps réel GPT-4o. Effectuez une transcription vocale à volume élevé qui nécessite une personnalisation avancée, une diarisation de l’orateur ou un vocabulaire personnalisé. Pour ces scénarios, utilisez Azure Speech dans Foundry Tools.
Générez des descriptions d’accessibilité pour les images. Utilisez des modèles de génération d’images open source. Pour les modèles open source, utilisez Azure Machine Learning.

Modèles audio

Azure OpenAI fournit des modèles audio via les API suivantes :

  • API Realtime pour les conversations vocales à faible latence

  • API de complétion de conversation avec audio pour la génération et la transcription audio flexibles dans un seul appel de modèle

  • API audio via le point de terminaison pour la transcription STT à partir de fichiers dans les modèles de transcription Whisper et GPT-4o, traduction de la parole et TTS

Azure Vision

Azure Vision est un service dans Tools. Il fournit des algorithmes avancés qui traitent des images et retournent des informations basées sur les fonctionnalités visuelles que vous spécifiez. Azure Vision inclut des fonctionnalités d’OCR, d’analyse d’images et de détection des visages.

Utiliser Azure Vision pour ces tâches N’utilisez pas Azure Vision pour ces tâches
Extrayez du texte imprimé et manuscrit à partir d’images et de documents à l’aide d’OCR. Effectuez une analyse vidéo avancée comme la transcription, la traduction ou la synthèse du contenu. Pour ces tâches, utilisez Video Indexer.
Analysez les images pour extraire des fonctionnalités visuelles telles que des objets, des visages et des descriptions générées automatiquement. Contenu modéré pour la sécurité. Pour la modération du contenu, utilisez la sécurité du contenu dans le plan de contrôle Foundry.
Détecter, reconnaître et analyser des visages humains dans des images. Effectuez l'analyse que les grands modèles de base multimodaux comme GPT-4o soutiennent déjà.

Fonctionnalités Azure Vision disponibles

Le tableau suivant fournit la liste des fonctionnalités disponibles dans Azure Vision.

Fonctionnalité Descriptif
OCR Extrait le texte des images. Vous pouvez utiliser l’API Read pour extraire du texte imprimé et manuscrit à partir de photos et de documents. Il utilise des modèles basés sur l’apprentissage profond et fonctionne avec du texte sur différentes surfaces et arrière-plans, notamment des documents professionnels, des factures, des reçus, des affiches, des cartes de visite, des lettres et des tableaux blancs.
Analyse d’image Extrait de nombreuses fonctionnalités visuelles à partir d’images, telles que des objets, des visages, du contenu adulte et des descriptions de texte générées automatiquement. Vous pouvez créer des modèles d’identificateur d’image personnalisés à l’aide de l’analyse d’image 4.0 basée sur le modèle de base de Florence.
Détection et analyse des visages Identifie les régions d’une image qui contiennent un visage humain, généralement en retournant des coordonnées de boîte englobante qui forment un rectangle autour du visage.
Rechercher des visages similaires Correspond à un visage cible avec un ensemble de visages candidats et identifie un groupe plus petit de visages qui ressemblent étroitement au visage cible. Cette fonctionnalité est utile pour la recherche de visages par image.
Regrouper les visages Divise un ensemble de visages inconnus en plusieurs groupes plus petits en fonction de la similarité.
Identification du visage Effectue une correspondance de type un-à-plusieurs d’un visage dans une image avec un ensemble de visages dans une base de données sécurisée. Les candidats correspondants sont retournés en fonction de la correspondance de leurs données de visage avec le visage faisant l'objet de la requête.
Vérification des visages Réalise une correspondance un-à-un pour confirmer l'identité revendiquée par un utilisateur.
Détection de présence Fonctionnalité anti-usurpation d’identité qui vérifie si un utilisateur est physiquement présent devant la caméra. Empêche les attaques d’usurpation qui utilisent une photo imprimée, une vidéo enregistrée ou un masque 3D du visage de l’utilisateur.

Cas d’usage pour Azure Vision

Le tableau suivant fournit la liste des cas d’usage possibles pour Azure Vision.

Cas d’usage Descriptif
Générer un texte alternatif d’image (texte alternatif) Utilisez des modèles de légendes d'analyse d'images pour générer automatiquement des descriptions de texte alternatif pour les images. Le texte de remplacement améliore l’accessibilité pour les utilisateurs aveugles ou ayant une faible vision, aide à répondre aux exigences de conformité légales et rend votre site web plus détectable par le biais d’un référencement amélioré. Les produits Microsoft tels que PowerPoint, Word et Edge utilisent cette fonctionnalité.
Vérification de l’identité Utilisez Visage Azure pour confirmer que les utilisateurs sont ceux qu’ils prétendent être. La vérification compare une image de sonde à un modèle inscrit, tel qu’un ID émis par le gouvernement, pour les scénarios de contrôle d’accès. Cette approche permet d’améliorer l’expérience utilisateur et la sécurité par rapport aux méthodes basées sur les connaissances.
Réaction des visages Éditer ou flouter les visages détectés de personnes enregistrées dans une vidéo afin de protéger leur confidentialité.
Contrôle d’accès sans contact Utilisez l’identification faciale d’opt-in pour un contrôle d’accès amélioré tout en réduisant les risques de maintenance et de sécurité liés au partage, à la perte ou au vol de supports physiques. La reconnaissance faciale aide le processus d’enregistrement incluant une personne physique pour l’enregistrement dans les aéroports, les stades, les parcs à thème, les bâtiments, les comptoirs d’accueil dans des bureaux, des hôpitaux, des gymnases, des clubs ou des écoles.

Azure Machine Learning AutoML

Azure Machine Learning AutoML pour Vision par ordinateur fournit des fonctionnalités de reconnaissance d’image que vous pouvez utiliser pour générer, déployer et améliorer automatiquement vos modèles d’image. Un identificateur d’image applique des étiquettes aux images en fonction de leurs caractéristiques visuelles. Chaque étiquette représente une classification ou un objet. Utilisez Azure Machine Learning AutoML pour spécifier vos propres étiquettes et entraîner des modèles personnalisés pour les détecter.

Utiliser Azure Machine Learning AutoML pour ces tâches N'utilisez pas Azure Machine Learning AutoML pour ces tâches
Reconnaître les objets inhabituels et les défauts de fabrication que l’analyse d’image standard ne peut pas détecter. Effectuez la détection d’objets de base ou la détection des visages. Utilisez Azure Vision à la place.
Fournissez des classifications personnalisées détaillées pour des exigences métier spécifiques. Effectuez une analyse visuelle de base. Utilisez plutôt des modèles compatibles avec la vision à partir d’Azure OpenAI ou de modèles open source dans Machine Learning.
Entraîner des modèles avec vos propres images étiquetées pour des scénarios spécialisés.

Azure Machine Learning AutoML utilise des algorithmes d’apprentissage automatique pour analyser des images pour des fonctionnalités personnalisées. Les données d’image étiquetées sont fournies en tant qu’annotations. Le schéma d’annotation dépend de la tâche : étiquettes au niveau de l’image pour la classification, zones englobantes pour la détection d’objets et polygones pour la segmentation d’instance. Vous pouvez effectuer ces annotations à l’aide de la fonctionnalité d’étiquetage de données ML intégrée Azure. Les algorithmes AutoML utilisent ensuite les annotations et les images pour entraîner les modèles et en calculer la précision en les testant sur des ensembles d’images de validation. Une fois que AutoML entraîne le modèle optimal, vous pouvez tester, réentraîner et éventuellement utiliser le modèle dans votre application de reconnaissance d’image pour classifier des images ou détecter des objets. Vous pouvez également exporter le modèle pour l’utiliser en mode hors connexion.

Fonctionnalités disponibles d’Azure Machine Learning AutoML

Le tableau suivant fournit la liste des fonctionnalités disponibles.

Fonctionnalité Descriptif
(Étiquettes multiples) Classification d’images Prédire une catégorie, ou une classe, en fonction d’un ensemble d’entrées, qui sont appelées fonctionnalités. Calculez un score de probabilité pour chaque classe possible et retournez une étiquette qui indique la classe à laquelle l’objet appartient probablement. Pour utiliser ce modèle, il vous faut des données constituées de caractéristiques et de leurs étiquettes.
Détection d’objets Obtenir les coordonnées d’un objet dans une image. Pour utiliser ce modèle, il vous faut des données constituées de caractéristiques et de leurs étiquettes.
Segmentation d’instance Identifiez les objets au niveau du pixel et décrivez chaque objet avec un polygone.

Cas d’usage pour Azure Machine Learning AutoML pour Vision par ordinateur

Le tableau suivant fournit la liste des cas d’usage possibles pour Azure Machine Learning AutoML.

Cas d’usage Descriptif
Classifier des images et des objets Analysez les photos et recherchez des logos spécifiques en formant un modèle personnalisé.

Compréhension du contenu Azure

Azure Content Understanding est un service dans Tools. Il utilise l’IA générative pour extraire des champs structurés à partir d’images et de vidéos. Vous définissez un schéma qui spécifie ce qu’il faut extraire, et Azure Content Understanding applique des modèles dégénérateurs pour produire une sortie Markdown structurée compatible JSON ou RAG. Il fournit également des scores de confiance et une base pour chaque valeur extraite, qui prend en charge les flux de travail automatisés avec une révision humaine ciblée.

Utiliser Azure Content Understanding pour ces tâches N’utilisez pas Azure Content Understanding pour ces tâches
Extrayez des champs structurés personnalisés à partir d’images à l’aide d’un schéma que vous définissez, tel que le produit, la marque ou la détection des défauts. Effectuez une analyse d’image standard, telle que la détection d’objets ou l’OCR. Utilisez Azure Vision pour ces tâches.
Générez une sortie prête pour RAG à partir de la vidéo, y compris les descriptions de scène, les transcriptions et les images clés, pour utilisation dans les index de recherche ou les assistants de chat. Extrayez des insights vidéo approfondis, tels que l’identification des célébrités, l’énumération de l’orateur ou l’analyse des sentiments sur le contenu de longue forme. Utilisez Video Indexer pour ces tâches.
Segmentez la vidéo en scènes et extrayez des métadonnées personnalisées pour chaque segment, comme la présence de marque ou la catégorie de publicité.
Générez des descriptions de visages dans des images ou des vidéos, telles que des expressions faciales ou une identification de célébrité. Ces fonctionnalités ont un accès limité.

Fonctionnalités Azure Content Understanding disponibles

Le tableau suivant fournit la liste des fonctionnalités d’image et de vidéo disponibles dans Azure Content Understanding.

Fonctionnalité Descriptif
Extraction de champs d’image Extrait des champs structurés personnalisés à partir d’images basées sur un schéma que vous définissez. Vous pouvez extraire des champs directement, les classifier à partir d’un ensemble de catégories ou les générer à l’aide d’un modèle de génération. Cette fonctionnalité est utile pour l’analyse des rayons de vente au détail, le contrôle de qualité de la fabrication et le décisionnel basé sur des graphiques (BI).
Extraction d'images clés Extrait des images clés représentatives de chaque capture dans une vidéo. Garantit que chaque segment dispose d’un contexte visuel suffisant pour l’extraction de champs en aval.
Détection de tir Identifie les limites de plans dans une vidéo en fonction des signaux visuels. Produit une liste d’horodatages pour une modification précise, un reconditionnement et une segmentation précise.
Segmentation de scène Divise une vidéo en scènes logiques décrites dans le langage naturel. Vous définissez la logique de segmentation, telle que le fractionnement d’une diffusion d’actualités par rubrique d’article, et le modèle génératif crée des segments correspondants.
Extraction de champ vidéo Génère des champs structurés personnalisés pour chaque segment vidéo en fonction d’un schéma, tel que des logos de marque, des catégories publicitaires ou des sentiments de scène, à l’aide d’un modèle génératif.
Description du visage Génère des descriptions textuelles des visages dans des images ou des vidéos, y compris les cheveux du visage, les expressions et l’identification des célébrités. La description du visage est une fonctionnalité d’accès limité qui vous oblige à désactiver le flou du visage dans la configuration de l’analyseur.

Cas d’usage pour Azure Content Understanding

Le tableau suivant fournit la liste des cas d’usage possibles pour Azure Content Understanding appliqué aux images et aux vidéos.

Cas d’usage Descriptif
RAG sur vidéo Générez du Markdown prêt pour RAG à partir de fichiers vidéo, notamment des transcriptions intégrées, des miniatures de trames clés et des descriptions de segments en langage naturel. Placez la sortie directement dans un stockage vectoriel pour permettre les flux de travail des agents ou de recherche sans post-traitement.
Gestion des ressources multimédias Étiquetez des ressources vidéo avec des métadonnées au niveau de la scène, telles que la catégorie de contenu, la présence de marque et les moments clés. Cette approche permet aux éditeurs, aux producteurs et aux équipes marketing d’organiser et de récupérer du contenu à partir de grandes bibliothèques vidéo.
Contrôle de qualité de la fabrication Analysez les images de produit par rapport à un schéma personnalisé pour détecter les défauts, les anomalies ou les erreurs d’alignement dans les lignes de production.
Analyse des rayons de vente au détail Extrayez des données structurées à partir d’images d’étagères pour compter les produits, détecter les mauvais emplacements et surveiller les niveaux de stock.
Analyse de la publicité et de la marque Identifiez les logos de marque et les catégories publicitaires dans les segments vidéo promotionnels pour évaluer l’exposition de la marque et la conformité avec les directives de personnalisation.

Indexeur de Vidéos

Video Indexer est une solution IA que les organisations peuvent utiliser pour extraire des insights approfondis à partir de contenu vidéo et audio en direct et chargé. Il utilise des modèles d’INTELLIGENCE artificielle avancés et d’ia générative et prend en charge un large éventail de fonctionnalités, notamment la transcription, la traduction, la détection d’objets et la synthèse vidéo. Video Indexer est flexible. Vous pouvez l’utiliser dans le cloud ou le déployer sur des emplacements de périphérie via Azure Arc.

Utiliser Video Indexer pour ces tâches N’utilisez pas Video Indexer pour ces tâches
Extrayez des informations à partir de vidéos téléchargées, y compris la transcription, la traduction et l'analyse de contenu. Effectuez des tâches d’analyse vidéo de base telles que le comptage des personnes et la détection de mouvement. Azure Vision est un outil plus économique pour ces tâches.
Analysez les flux vidéo en direct en temps réel pour les scénarios de vente au détail, de fabrication ou de sécurité. Extrayez du texte à partir d’images statiques. Pour ocr sur les images, utilisez Azure Vision.
Exécutez l’analyse vidéo sur des appareils de périphérie qui ont des exigences strictes en matière de résidence des données ou de faible latence à l’aide d’Azure Arc.

Options de déploiement

Video Indexer fournit les options de déploiement suivantes.

Choix Descriptif
Video Indexer basé sur le cloud Application cloud basée sur des outils, notamment Visage Azure, Azure Translator dans Foundry Tools, Azure Vision et Azure Speech. Il analyse le contenu vidéo et audio en exécutant plus de 30 modèles IA pour générer des insights détaillés.
Video Indexer activé par Azure Arc Extension Azure Arc qui exécute l’analyse vidéo et audio et l’IA générative sur les appareils de périphérie. Il prend en charge les flux vidéo chargés et en direct, ce qui permet une analyse en temps réel directement à la source de données. Il convient aux secteurs qui ont des exigences strictes en matière de résidence des données ou des besoins opérationnels à faible latence.

Modèles vidéo

Le tableau suivant fournit une liste des fonctionnalités d’analyse vidéo disponibles dans Video Indexer.

Fonctionnalité Descriptif
Détection des visages Détecte et regroupe les visages qui apparaissent dans une vidéo.
Identification de visage basée sur un compte Effectue l'apprentissage d'un modèle pour un compte spécifique et reconnaît les visages dans des vidéos grâce au modèle entraîné.
Détection des personnes observées Détecte les personnes observées dans des vidéos et fournit des informations d’emplacement à l’aide de zones englobantes, avec des horodatages exacts et des niveaux de confiance. Inclut la personne correspondante, les vêtements détectés et les insights sur les vêtements proposés.
Détection d’objets Détecte et effectue le suivi d’objets uniques afin qu’il puisse les reconnaître s’ils reviennent au frame.
OCR Extrait du texte d’images telles que des images, des panneaux routiers et des produits dans des fichiers multimédias pour créer des insights.
Identification des étiquettes Identifie les objets visuels et les actions affichées.
Segmentation de scène Détermine quand une scène change dans la vidéo en fonction des indications visuelles. Une scène représente un événement unique composé d’une série de tirs consécutifs.
Détection de tir Détermine quand une capture change dans la vidéo en fonction des signaux visuels. Une capture est une série de trames prises à partir de la même caméra d’image de mouvement.
Extraction d'images clés Détecte les images clés stables dans une vidéo.
Détection d’ardoise Identifie les insights de post-production de film, notamment la détection de clap, la détection de motifs numériques et la détection d'ardoises sans texte.

Modèles audio

Le tableau suivant fournit la liste des fonctionnalités d’analyse audio disponibles dans Video Indexer.

Fonctionnalité Descriptif
Transcription audio Convertit STT dans plus de 50 langues et prend en charge les extensions.
Détection automatique de la langue Identifie la langue parlée dominante.
Identification vocale en plusieurs langues Identifie la langue parlée dans différents segments audio, envoie chaque segment à transcrire et les combine en une transcription unifiée.
Sous-titrage Crée des sous-titres fermés dans les formats Web Video Text Tracks (WebVTT), Timed Text Markup Language (TTML) et SubRip Subtitle (SRT).
Traitement de deux canaux Détecte automatiquement les transcriptions distinctes et les fusionne dans une chronologie unique.
Réduction du bruit Améliore la qualité audio des communications téléphoniques ou des enregistrements bruyants grâce aux filtres Skype.
Énumération de l’orateur Identifie et comprend quel orateur a prononcé quels mots et à quel moment. Il peut détecter 16 haut-parleurs dans un seul fichier audio.
Traduction Crée des traductions de la transcription audio dans de nombreuses langues différentes.
Détection des effets audio Détecte les effets audio dans des segments non verbaux, notamment des alarmes ou des sirènes, un chien qui aboie, des réactions de foule, des sons d'impact fort, des rires, du verre qui se casse et du silence.

Modèles audio et vidéo combinés

Les fonctionnalités suivantes analysent le contenu audio et vidéo.

Fonctionnalité Descriptif
Extraction de mots-clés Extrait les mots clés de la parole et du texte visuel
Extraction d’entités nommées Extrait des marques, des lieux et des personnes du discours et du texte visuel grâce au traitement du langage naturel (TLN)
Inférence de thématique Extrait des sujets basés sur différents mots-clés en utilisant l'ontologie des sujets hiérarchiques du Conseil international de la presse et des télécommunications (IPTC), Wikipédia et Video Indexer.
Analyse des sentiments Identifie les sentiments positifs, négatifs et neutres de la parole et du texte visuel

Pour plus d’informations, consultez la vue d’ensemble de Video Indexer.

Cas d’usage pour Video Indexer basé sur le cloud

Le tableau suivant fournit la liste des cas d’usage possibles pour Video Indexer basé sur le cloud.

Cas d’usage Descriptif
Recherche profonde Améliorez l’expérience de recherche dans une bibliothèque vidéo à l’aide des insights extraits par Video Indexer. Par exemple, lorsque vous indexez des mots et des visages parlés, les utilisateurs peuvent trouver des moments dans une vidéo lorsqu’une personne parle des mots spécifiques ou quand deux personnes sont vues ensemble. Ces cas d’usage s’appliquent à tout secteur disposant d’une bibliothèque vidéo dont les utilisateurs ont besoin pour effectuer des recherches, notamment les agences de presse, les instituts d’enseignement, les radiodiffuseurs, les propriétaires de contenu de divertissement et les applications métier d’entreprise.
Création de contenu Créez des bandes-annonces, des reels de moments forts, du contenu pour les médias sociaux ou des clips d'actualités basés sur les informations clés que Video Indexer extrait de votre contenu. Les images clés, les repères de scène, et les horodatages associés aux personnes et à l'apparition des labels simplifient le processus de création.
Accessibilité Rendez votre contenu disponible pour les personnes handicapées ou distribuez du contenu dans des régions qui utilisent différentes langues à l’aide des fonctionnalités de transcription et de traduction que Video Indexer fournit.
Monétisation Augmentez la valeur des vidéos. Les industries qui s’appuient sur les revenus publicitaires, tels que les médias d’actualités et les médias sociaux, peuvent fournir des publicités pertinentes à l’aide des insights extraits en tant que signaux supplémentaires au serveur publicitaire.
Modération du contenu Empêchez vos utilisateurs de ne pas utiliser de contenu inapproprié et vérifiez que le contenu que vous publiez correspond aux valeurs de votre organisation à l’aide de modèles de modération de contenu textuel et visuel.
Recommandations Améliorez l’engagement des utilisateurs en mettant en évidence les moments vidéo pertinents pour les utilisateurs. En étiquetant chaque vidéo avec des métadonnées supplémentaires, vous pouvez recommander les vidéos les plus pertinentes et mettre en évidence les parties qui correspondent aux besoins des utilisateurs.

Cas d’usage pour Video Indexer activé par Azure Arc

Le tableau suivant fournit la liste des cas d’usage possibles pour Video Indexer activé par Azure Arc.

Cas d’usage Descriptif
Commerce de détail Optimisez les dispositions des magasins et améliorez l’expérience client et la sécurité. Surveillez le nombre de clients dans les lignes de caisse en temps réel pour optimiser la dotation et réduire les temps d’attente.
Production industrielle Assurez le contrôle de la qualité et la sécurité des travailleurs par le biais de l’analyse vidéo. Détectez les travailleurs qui ne portent pas d’équipement de protection avec la détection en temps réel des événements critiques.
Sécurité moderne Détectez et identifiez les problèmes de sécurité et de sûreté avant qu’ils ne créent un danger.
Gouvernance des données Apportez l’IA au contenu. Utilisez Video Indexer activé par Arc lorsque vous ne pouvez pas déplacer de contenu indexé d’un emplacement local vers le cloud en raison de réglementations, de décisions d’architecture ou de magasins de données volumineux.
Préindexation Indexez le contenu avant de le charger dans le cloud. Présortez votre archive vidéo ou audio locale, puis chargez-la uniquement pour l’indexation standard ou avancée dans le cloud.