Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
L'elaborazione intelligente dei documenti converte contenuti non strutturati, ad esempio pdf, file DOCX, immagini e presentazioni, in dati strutturati e arricchiti che alimentano agenti downstream, applicazioni e analisi.
Azure Databricks ti offre due modi per eseguire IDP, entrambi basati sulle stesse funzioni AI sviluppate dalla ricerca:
- Agent Bricks UI: un'esperienza visiva senza codice per analizzare, estrazione e classificazione dei documenti. Usalo per testare documenti di esempio, perfezionare uno schema o etichette e validare visivamente i risultati prima di scalare.
- Funzioni SQL AI: Esegui funzioni intelligenti di elaborazione documentale direttamente sul Lakehouse. Utilizzali per elaborare documenti su larga scala, comporre insieme le fasi e costruire pipeline di livello produttivo governate nelle pipeline Lakeflow.
Capacità intelligenti di elaborazione documentale
| Capacità | Interfaccia di Agent Bricks | Funzione SQL |
|---|---|---|
| Convertire file PDF, DOCX, immagini e PPT in testo strutturato, tabelle e descrizioni delle figure. | Analisi dei documenti | ai_parse_document |
| Estrarre campi strutturati da documenti o testo semplice utilizzando uno schema definito. | Estrazione di informazioni | ai_extract |
| Assegnare categorie predefinite a documenti o testo, supportando fino a 500 etichette. | Classificazione | ai_classify |
| Trasforma i documenti sottoposti a parsing in segmenti semantici pronti per la generazione aumentata dal recupero (RAG) e per l'indicizzazione in AI Search. |
ai_prep_search (Beta) |
Casi d'uso comuni
IDP in Azure Databricks supporta un'ampia gamma di applicazioni downstream:
- Retrieval-augmented generation (RAG): analizzare e strutturare i documenti per migliorare la suddivisione in blocchi, la qualità del recupero e il fondamento per le applicazioni LLM.
- Estrazione e analisi delle informazioni: estrarre campi chiave e metadati per abilitare la ricerca, la creazione di report e la business intelligence sui dati dei documenti.
- Flussi di lavoro basati su agenti: instradare, classificare e arricchire i documenti per supportare l'esecuzione automatizzata delle decisioni e delle attività.
- Analisi e classificazione dei documenti: organizzare corpora di documenti di grandi dimensioni in base al tipo, all'argomento o al contenuto per l'elaborazione downstream.
Come funziona
Azure Databricks consente l'elaborazione intelligente dei documenti come flusso di lavoro end-to-end unificato in Lakehouse. L'inserimento, l'analisi, l'arricchimento e l'analisi downstream sono basate su una singola piattaforma, quindi ogni fase funziona perfettamente insieme senza richiedere un'integrazione complessa o uno spostamento dei dati.
Inserimento e orchestrazione
Usare le pipeline di Lakeflow per inserire documenti non elaborati(ad esempio PDF, immagini e file DOCX) e orchestrare le pipeline. Poiché l'inserimento e l'orchestrazione sono integrati in modo nativo con Lakehouse, i documenti passano direttamente all'elaborazione downstream senza infrastruttura aggiuntiva.
Analizzare i documenti (livello Bronzo)
Applicare
ai_parse_documentper convertire i file non elaborati in rappresentazioni strutturate. In questo modo viene creato un livello bronzo standardizzato che acquisisce testo, descrizioni di tabelle/immagini e struttura del documento, formando una base coerente per tutti i casi d'uso downstream.Estrarre e classificare
Usare
ai_extracteai_classifyper arricchire i documenti analizzati con campi e metadati strutturati. Queste funzioni operano direttamente sugli output analizzati, consentendo di estrarre informazioni chiave, classificare i documenti e instradarli attraverso flussi di lavoro senza passaggi di trasformazione aggiuntivi.Prepararsi al recupero delle informazioni (RAG)
Applicare
ai_prep_search(Beta) per trasformare i documenti analizzati in blocchi semantici arricchiti con contesto a livello di documento, ad esempio titoli, intestazioni di sezione e riferimenti di pagina. L'output è formattato per l'indicizzazione in AI Search, fornendo una base uniforme per i carichi di lavoro RAG e di recupero delle informazioni.Analizzare e rendere operativi
Sfruttare funzioni di intelligenza artificiale aggiuntive o altri strumenti (dashboard di intelligenza artificiale, app, ricerca di intelligenza artificiale) per l'analisi downstream, il recupero (RAG) e i flussi di lavoro basati su agenti. Poiché tutti i dati rimangono in Lakehouse, i dati dei documenti strutturati possono essere usati immediatamente per la ricerca, i dashboard e le applicazioni.