Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
idee di soluzioni
Questo articolo descrive un'idea di soluzione. L'architetto cloud può usare queste linee guida per visualizzare i componenti principali per un'implementazione tipica di questa architettura. Usare questo articolo come punto di partenza per progettare una soluzione ben progettata in linea con i requisiti specifici del carico di lavoro.
Usando Azure servizi come Azure Content Understanding e Funzioni di Azure, è possibile aggiungere la classificazione delle immagini e l'estrazione dei metadati a un'applicazione Web o per dispositivi mobili senza gestire server o eseguire il training dei propri modelli. Questa soluzione è destinata alla classificazione e all'assegnazione di tag alle immagini. Se si hanno altre esigenze di intelligenza artificiale, vedere i cataloghi più ampi Microsoft Foundry and Foundry Tools.
Architettura
Scaricare un file di Visio di questa architettura.
Flusso di dati
Questo scenario illustra i componenti back-end di un'applicazione Web o per dispositivi mobili. Il flusso di dati seguente corrisponde all'immagine precedente:
Un utente carica un'immagine in Archiviazione BLOB di Azure, direttamente o usando un'applicazione Web o per dispositivi mobili. Il caricamento attiva un evento in Griglia di eventi di Azure.
Griglia di eventi invia una notifica a Funzioni di Azure per elaborare l'immagine caricata.
La funzione genera un URL di firma di accesso condivisa a privilegi minimi e validità limitata, limitato al blob di destinazione, e lo passa a Content Understanding. Content Understanding usa questo URL per accedere all'immagine direttamente da gestione rete virtuale di Azure, quindi la analizza usando un analizzatore predefinito.
La funzione archivia l'output strutturato restituito da Content Understanding, insieme ai metadati dell'immagine, in Azure Cosmos DB per NoSQL.
Un'applicazione Web o per dispositivi mobili riceve i risultati. Questo flusso di dati restituisce l'output di classificazione e i metadati, ma non il file di immagine originale.
Componenti
Content Understanding è uno strumento Foundry che usa l'intelligenza artificiale generativa per estrarre l'output strutturato definito dall'utente da documenti, immagini, video e audio. In questa architettura, Content Understanding analizza ogni immagine caricata usando un analizzatore predefinito che definisce le categorie, gli attributi e le etichette che si desidera restituire, ad esempio il tipo di prodotto, il colore o la classe di difetto. L'output è JSON che mappa direttamente al modello di dati dell'applicazione.
Funzioni di Azure è una piattaforma di calcolo serverless. In questa architettura, Funzioni di Azure fornisce l'API back-end e il livello di elaborazione degli eventi per le immagini caricate. La funzione orchestra il flusso di lavoro. Chiama Content Understanding, elabora la risposta e scrive il risultato nel database. Questa architettura usa il piano Flex Consumption per supportare l'integrazione della rete virtuale, la scelta della memoria dell'istanza e il ridimensionamento rapido.
Griglia di eventi di Azure è un servizio di routing eventi gestito che usa un modello di pubblicazione-sottoscrizione. In questa architettura, un argomento di sistema di Griglia di eventi nell'account di archiviazione genera un evento
Microsoft.Storage.BlobCreatedquando viene caricata una nuova immagine e la distribuisce alla funzione.Archiviazione BLOB di Azure è un archivio oggetti per i dati non strutturati. In questa architettura vengono archiviate tutte le immagini caricate e tutti gli asset statici usati dall'applicazione Web. gestione rete virtuale di Azure è la fonte di verità per le immagini in ingresso.
Azure Cosmos DB per NoSQL è un database NoSQL gestito. In questa architettura vengono archiviati i metadati per ogni immagine, incluso l'output strutturato restituito da Content Understanding.
Alternative
AutoML in Azure Machine Learning supporta le attività di visione artificiale. È possibile eseguire il training di modelli personalizzati di classificazione delle immagini e rilevamento oggetti dai dati etichettati usando tecniche classiche di Machine Learning. Scegliere AutoML quando si dispone di un set di dati etichettato ed è necessario un modello deterministico e distribuibile per domini ristretti in cui gli approcci generativi non si adattano. Alcuni esempi includono il rilevamento dei difetti di produzione o l'imaging medico. Microsoft consiglia AutoML per i clienti che eseguono la migrazione da Visione personalizzata di Azure AI che vogliono mantenere un modello di Machine Learning classico.
I modelli con funzionalità di visione in Foundry consentono di richiamare o sottoporre a fine-tuning direttamente i modelli multimodali (GPT-4.1, GPT-4o e Phi-4 Multimodal). Scegliere questo percorso quando è necessario un controllo granulare sulla richiesta e sul modello, si vuole ottimizzare i propri dati o richiedere risposte visive alle domande e chat basate su immagini invece di estrazione strutturata.
Azure AI Search indicizza i metadati in modo che gli utenti possano eseguire query e filtrare le immagini in base a tag, didascalia o altri attributi. Il set di competenze di arricchimento tramite intelligenza artificiale è in grado di utilizzare servizi di visione e generazione di intelligenza artificiale e scrivere i risultati direttamente in un indice di ricerca senza la necessità di una funzione separata.
App per la logica di Azure è una scelta adatta quando non è necessaria una reazione in tempo reale per i caricamenti. Un flusso di lavoro basato su un trigger ricorrente o a finestra mobile può verificare la presenza di nuovi blob e chiamare Content Understanding in modalità batch.
Azure Document Intelligence estrae immagini incorporate nei documenti usando il modello di layout, in modo da poter eseguire la classificazione downstream sulle figure incorporate. Usare modelli di classificazione personalizzati quando i file di input contengono più tipi di documento ed è necessario identificarli prima di ulteriori elaborazioni.
Dettagli dello scenario
Questo scenario si applica alle aziende che elaborano immagini su larga scala e vogliono associare metadati strutturati, ad esempio tag, didascalie o etichette di categoria a ogni immagine senza training e gestire i propri modelli.
Le applicazioni tipiche includono la classificazione delle immagini in un sito di moda, l'analisi delle foto per le attestazioni assicurative e l'estrazione del contesto dagli screenshot del gioco. La creazione di questa funzionalità internamente richiede tradizionalmente competenze in visione artificiale, dati di training e gestione del ciclo di vita del modello. L'architettura descritta in questo articolo sostituisce quel lavoro con servizi gestiti di Azure.
Casi d'uso potenziali
Questa soluzione si applica alla vendita al dettaglio, all'e-commerce, al gioco, alla finanza e all'assicurazione. I casi d'uso comuni includono:
Assegnazione di tag alle immagini in un sito di vendita al dettaglio o moda. I venditori caricano foto del prodotto. Content Understanding restituisce i tag, le didascalie e gli attributi definiti nell'analizzatore. La piattaforma usa i metadati restituiti per riempire automaticamente i campi di elenco, guidare la ricerca visiva e ridurre il lavoro di assegnazione di tag manuali.
Categorizzazione dei prodotti in un catalogo di e-commerce. Un analizzatore Content Understanding assegna metadati di categoria e sottocategoria, ad esempio calzature e scarpe da corsa, e attributi visivi come colore e materiale. Gli acquirenti ottengono ricerche e filtri più accurati e i venditori trascorrono meno tempo a correggere le categorie.
Classificazione dei dati di telemetria dagli screenshot del gioco. Le piattaforme di streaming classificano erroneamente un flusso quando un creatore dimentica di aggiornare il titolo dopo il cambio di giochi. Una funzione che classifica gli screenshot periodici può rilevare la modifica e aggiornare i metadati del flusso. Per i domini ristretti in cui la classificazione generativa non raggiunge le prestazioni ottimali, utilizzare AutoML per Immagini per addestrare un classificatore deterministico.
Instradamento delle foto dell'attestazione assicurativa. Content Understanding identifica i danni ai veicoli, i danni causati da calamità naturali o il tipo di proprietà dalle foto dei sinistri. I metadati instradano la richiesta nella coda corretta dell'aggiustatore e riducono il tempo di smistamento.
Considerazioni
Queste considerazioni implementano i pilastri di Azure Well-Architected Framework, che è un set di principi guida che possono essere usati per migliorare la qualità di un carico di lavoro. Per altre informazioni, vedere Well-Architected Framework.
Security
La sicurezza fornisce protezioni contro attacchi intenzionali e l'uso improprio dei dati e dei sistemi preziosi. Per maggiori informazioni, consultare la sezione Elenco di controllo per la revisione della progettazione per la sicurezza.
Usare identità gestite per consentire all'app delle funzioni di autenticarsi su gestione rete virtuale di Azure, Azure Cosmos DB e sulla risorsa Microsoft Foundry che ospita Content Understanding. Evitare di archiviare stringhe di connessione o chiavi API nelle impostazioni dell'app.
Limitare la risorsa Foundry e Cosmos DB agli endpoint privati e disattivare l'accesso alla rete pubblica quando il carico di lavoro viene eseguito all'interno di una rete virtuale. Il piano Flex Consumption supporta l'integrazione della rete virtuale.
Convalida le immagini caricate prima di richiamare il servizio di visione. Applicare limiti di tipo di contenuto e dimensioni al limite di caricamento, analizzare il malware e archiviare i caricamenti in un contenitore che gli utenti pubblici non possono leggere direttamente.
Questa architettura è adatta solo alle immagini che si decide di essere appropriate per l'elaborazione di una soluzione cloud. L'elaborazione di immagini locali o offline non è supportata.
Ottimizzazione dei costi
L'ottimizzazione dei costi è incentrata sui modi per ridurre le spese non necessarie e migliorare l'efficienza operativa. Per altre informazioni, vedere Elenco di controllo per la revisione della progettazione per l'ottimizzazione dei costi.
Limitare l'analizzatore in Informazioni sul contenuto ai campi effettivamente utilizzati dall'applicazione. Ogni campo aggiuntivo aumenta l'utilizzo dei token e il costo per chiamata. Per le tariffe correnti, vedere Prezzi di Foundry.
Per Funzioni di Azure, usare il piano Flex Consumption per gestire i picchi nei carichi di lavoro basati su eventi. Il piano viene ridimensionato a zero e fattura al secondo nelle istanze attive.
Per Cosmos DB, valutare la velocità effettiva senza server o di scalabilità automatica quando il traffico non è uniforme. Il modello serverless è adatto a carichi di lavoro con traffico ridotto e di sviluppo/test, mentre la scalabilità automatica è più adatta agli ambienti di produzione con carichi variabili.
Eccellenza operativa
L'eccellenza operativa copre i processi operativi che distribuiscono un'applicazione e la mantengono in esecuzione nell'ambiente di produzione. Per ulteriori informazioni, vedere Lista di controllo per la revisione del design per l'Eccellenza Operativa.
Invia Functions, Event Grid e la diagnostica di Foundry a un'area di lavoro Log Analytics condivisa e usa Application Insights per il tracciamento distribuito nell'intero flusso dall'upload al risultato.
Configurare una destinazione di messaggi non recapitabili della Griglia di eventi in modo che gli eventi che la funzione non riesce a elaborare vengano indirizzati in un contenitore BLOB separato per eseguire nuovamente.
Versiona gli schemi degli analizzatori di Content Understanding come codice e distribuiscili tramite lo stesso pipeline che distribuisce la funzione. Considerare le modifiche dello schema come modifiche di rilievo per i consumer downstream.
Contributors
Microsoft gestisce questo articolo. I seguenti collaboratori hanno scritto questo articolo.
Autore principale:
- Ananya Ghosh Chowdhury | Principal Cloud Solution Architect
Altri contributori:
- Delyn Choong | Senior Cloud Solutions Architect - Data & AI
- Abhishek Singh | Tecnico del supporto tecnico
Per visualizzare i profili LinkedIn non pubblici, accedere a LinkedIn.
Passaggi successivi
- Che cos'è Content Understanding?
- Panoramica dei modelli di fonderia Microsoft
- Opzioni di migrazione per l'analisi delle immagini di Azure Vision
- arricchimento dell'intelligenza artificiale in Ricerca AI di Azure
- introduzione a Funzioni di Azure
- Piano di consumo flessibile delle Funzioni di Azure
- Che cos'è Griglia di eventi di Azure?
- Introduzione a Archiviazione BLOB di Azure
- benvenuto in Azure Cosmos DB
Per i percorsi di apprendimento guidato, vedere:
- Sviluppare un'applicazione di intelligenza artificiale generativa abilitata per la visione
- Eseguire il training di modelli di classificazione delle immagini personalizzati con AutoML