Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Documentparsering maakt gebruik van geavanceerde onderzoekstechnieken voor het extraheren en visualiseren van gestructureerde gegevens uit een breed scala aan documenttypen, waaronder pdf-bestanden, afbeeldingen, Word-documenten (DOC/DOCX) en PowerPoint-bestanden (PPT/PPTX). Het is ontworpen voor het verwerken van complexe indelingen, zoals tabellen, grafieken en gemengde inhoud van tekstafbeeldingen.
Documentparsing is beschikbaar via de Agent Bricks UI en in SQL.
Maak een document parsing agent aan in de UI
Requirements
- Een werkruimte met het volgende:
- Serverloze rekenkracht ingeschakeld. Zie serverloze rekenvereisten.
- Unity Catalog ingeschakeld. Zie Een werkruimte inschakelen voor Unity Catalog.
- Toegang tot een serverloos gebruiksbeleid met een niet-nulbudget.
- Deze functie is alleen beschikbaar in sommige regio's, zie beschikbaarheid van AI-functies.
- De
ai_parse_documentfunctie is ook beschikbaar voor werkruimten met de invoegtoepassing Verbeterde beveiliging en naleving.
- De
Gebruik documentparsering om uw documenten te parseren en hun structuur te visualiseren.
- Ga naar
Agents in het linkernavigatiedeelvenster van uw werkruimte.
- Klik op Agent maken>Documentparsering.
- Selecteer het brondocument. U kunt ervoor kiezen om een bestand te uploaden of een bestand te selecteren in een bestaande Unity Catalog-catalogus. Ondersteunde indelingen zijn: PDF, afbeeldingen, DOC/DOCX en PPT/PPTX.
- Klik op Document parseren.
Het parseren van uw document kan enkele minuten duren. Wanneer u klaar bent, wordt in documentparsering het brondocument aan de linkerkant en het geparseerde document aan de rechterkant weergegeven. U kunt ervoor kiezen om het geparseerde document weer te geven als opgemaakte tekst of onbewerkte JSON.
Proces- en queryresultaten
Als u de ai_parse_document query wilt weergeven en op meer documenten wilt uitvoeren, klikt u op Agent gebruiken en kiest u ervoor om de query uit te voeren vanuit de SQL Editor of Notebook. U kunt de query bewerken zodat deze verwijst naar het volume of de tabel waarin uw documenten zich bevinden.
Gebruik ai_prep_search (Beta) verderop in de pijplijn om de geparseerde uitvoer voor retrieval (RAG) voor te bereiden.
Documenten parseren in SQL
Roep ai_parse_document SQL aan om documenten op schaal te parsen:
SELECT
ai_parse_document(
content,
map('version', '2.0')
) AS parsed
FROM READ_FILES('/Volumes/my_catalog/my_schema/my_documents', format => 'binaryFile');
Zie de ai_parse_document SQL-referentie.