Document Intelligence-factuurmodel

Deze inhoud is van toepassing op:🟩v4.0 (GA) | Vorige versies:🟦v3.1 (GA)🟥v3.0 (buiten gebruik stellen)🟥v2.1 (buiten gebruik stellen)

Deze inhoud is van toepassing op:🟩v3.1 (GA) | Nieuwste versie:🟪v4.0 (GA) | Vorige versies:🟦v3.0🟦v2.1

Deze inhoud is van toepassing op:🟥v3.0 (buiten gebruik stellen) | Nieuwste versies:🟪v4.0 (GA)🟪v3.1 (GA) | Vorige versie:🟥v2.1 (buiten gebruik stellen)

Deze inhoud is van toepassing op:🟥v2.1 | Nieuwste versie:🟪v4.0 (GA)

Het Document Intelligence-factuurmodel maakt gebruik van krachtige OCR-mogelijkheden (Optical Character Recognition) om belangrijke velden en regelitems te analyseren en te extraheren uit verkoopfacturen, nutsfacturen en inkooporders. Facturen kunnen verschillende indelingen en kwaliteit hebben, waaronder door de telefoon vastgelegde afbeeldingen, gescande documenten en digitale PDF-bestanden. De API analyseert factuurtekst; extraheert belangrijke informatie, zoals klantnaam, factuuradres, vervaldatum en verschuldigd bedrag; en retourneert een gestructureerde JSON-gegevensweergave. Het model ondersteunt momenteel facturen in 27 talen.

Ondersteunde documenttypen:

  • Facturen
  • Nutsrekening
  • Verkooporders
  • Inkooporders

Geautomatiseerde factuurverwerking

Geautomatiseerde factuurverwerking is het proces van het extraheren van sleutelvelden accounts payable uit factureringsrekeningdocumenten. Geëxtraheerde gegevens omvatten regelitems van facturen die zijn geïntegreerd met uw crediteurenwerkstromen (AP) voor beoordelingen en betalingen. In het verleden werd de crediteurenadministratie handmatig uitgevoerd en was dus zeer tijdrovend. Nauwkeurige extractie van sleutelgegevens uit facturen is doorgaans de eerste en een van de meest kritieke stappen in het proces voor factuurautomatisering.

Voorbeeldfactuur verwerkt met Document Intelligence Studio:

Schermopname van een voorbeeldfactuur die wordt geanalyseerd in Document Intelligence Studio.

Voorbeeldfactuur verwerkt met het hulpprogramma Document Intelligence-voorbeeldlabels:

Schermopname van een voorbeeldfactuur.

Ontwikkelopties

Document Intelligence v4.0: 2024-11-30 (GA) ondersteunt de volgende hulpprogramma's, toepassingen en bibliotheken:

Functie Middelen Model-ID
Factuurmodel Document Intelligence Studio
REST API
C#SDK
Python SDK
Java SDK
JavaScript SDK
vooraf samengestelde factuur

Document Intelligence v3.1 ondersteunt de volgende hulpprogramma's, toepassingen en bibliotheken:

Functie Middelen Model-ID
Factuurmodel Document Intelligence Studio
REST API
C#SDK
Python SDK
Java SDK
JavaScript SDK
vooraf samengestelde factuur

Document Intelligence v3.0 ondersteunt de volgende hulpprogramma's, toepassingen en bibliotheken:

Functie Middelen Model-ID
Factuurmodel Document Intelligence Studio
REST API
C#SDK
Python SDK
Java SDK
JavaScript SDK
vooraf samengestelde factuur

Document Intelligence v2.1 ondersteunt de volgende hulpprogramma's, toepassingen en bibliotheken:

Functie Middelen
Factuurmodel Document Intelligence-labelingstool
REST API
Client-library SDK
Document Intelligence Docker-container

Invoervereisten

De volgende bestandsindelingen worden ondersteund.

Model PDF Afbeelding:
JPEG/JPG, PNG, BMP, TIFF, HEIF
Office:
Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML
Lezen
Indeling
Algemeen document
Voorgebouwd
Aangepaste extractie
Aangepaste classificatie
  • Foto's en scans: geef één duidelijke foto of een hoogwaardige scan per document op voor de beste resultaten.
  • PDF's en TIFF's: Voor PDF-bestanden en TIFF's kunnen maximaal 2000 pagina's worden verwerkt. (Met een abonnement op de gratis laag worden alleen de eerste twee pagina's verwerkt.)
  • Bestandsgrootte: de bestandsgrootte voor het analyseren van documenten is 500 MB voor de betaalde laag (S0) en 4 MB voor de gratis laag (F0).
  • Afbeeldingsafmetingen: De afmetingen moeten tussen 50 pixels x 50 pixels en 10.000 pixels x 10.000 pixels zijn.
  • Wachtwoordvergrendelingen: als uw PDF-bestanden zijn vergrendeld met een wachtwoord, moet u de vergrendeling verwijderen voordat u ze inzendt.
  • Teksthoogte: de minimale hoogte van de tekst die moet worden geëxtraheerd, is 12 pixels voor een afbeelding van 1024 x 768 pixels. Deze dimensie komt overeen met ongeveer 8-punts tekst bij 150 punten per inch.
  • Aangepaste modeltraining: Het maximum aantal pagina's voor trainingsgegevens is 500 voor het aangepaste sjabloonmodel en 50.000 voor het aangepaste neurale model.
  • Aangepaste extractiemodeltraining: de totale grootte van trainingsgegevens is 50 MB voor het sjabloonmodel en 1 GB voor het neurale model.
  • Training voor aangepast classificatiemodel: de totale grootte van trainingsgegevens is 1 GB met maximaal 10.000 pagina's. Voor 2024-11-30 (GA) is de totale grootte van trainingsgegevens 2 GB met maximaal 10.000 pagina's.
  • Office-bestandstypen (DOCX, XLSX, PPTX): de maximale tekenreekslengte is 8 miljoen tekens.
  • Ondersteunde bestandsindelingen: JPEG, PNG, PDF en TIFF.
  • Ondersteunde PDF en TIFF, maximaal 2000 pagina's worden verwerkt. Voor abonnees van de gratis laag worden alleen de eerste twee pagina's verwerkt.
  • Ondersteunde bestandsgrootte moet kleiner zijn dan 50 MB en afmetingen ten minste 50 x 50 pixels en maximaal 10.000 x 10.000 pixels.

Gegevensextractie van factuurmodel

Bekijk hoe gegevens, waaronder klantgegevens, details van leveranciers en regelitems, worden geëxtraheerd uit facturen. U hebt de volgende resources nodig:

  • Een Azure-abonnement: u kunt gratis een abonnement maken.

  • Een Document Intelligence-exemplaar in de Azure-portal. U kunt de gratis prijscategorie (F0) gebruiken om de service uit te proberen. Nadat uw resource is geïmplementeerd, selecteert u Ga naar de resource om uw sleutel en eindpunt op te halen.

Schermopname van sleutels en eindpuntlocatie in de Azure portal.

  1. Selecteer Facturen op de startpagina van Document Intelligence Studio.

  2. U kunt de voorbeeldfactuur analyseren of uw eigen bestanden uploaden.

  3. Selecteer de knop Analyse uitvoeren en configureer indien nodig de opties Analyseren :

    Schermopname van de knoppen Analyse uitvoeren en Opties analyseren in Document Intelligence Studio.

Document Intelligence-hulpprogramma voor het labelen van voorbeelden

  1. Navigeer naar het Documentintelligentie Voorbeeldprogramma.

  2. Selecteer op de startpagina van het voorbeeldhulpprogramma de tegel Gebruik vooraf gebouwd model om gegevens op te halen.

    Schermopname van het proces voor het analyseren van resultaten van het indelingsmodel.

  3. Selecteer het formuliertype dat u wilt analyseren in de vervolgkeuzelijst.

  4. Kies een URL voor het bestand dat u wilt analyseren uit de onderstaande opties:

  5. Selecteer in het veld Bron 'URL' in de vervolgkeuzelijst, plak de geselecteerde URL, en klik op de knop Ophalen.

    Schermopname van het vervolgkeuzemenu voor de locatie van de bron.

  6. Plak in het veld Eindpunt van de Document Intelligence-service het eindpunt dat u hebt verkregen met uw Document Intelligence-abonnement.

  7. Plak in het sleutelveld de sleutel die u hebt verkregen uit uw Document Intelligence-resource.

    Schermopname van het vervolgkeuzemenu select-form-type.

  8. Selecteer Analyse uitvoeren. Het Document Intelligence etiketteerhulpmiddel als voorbeeld roept de API voor vooraf samengestelde analyse aan om het document te analyseren.

  9. Bekijk de resultaten: bekijk de sleutel-waardeparen die zijn geëxtraheerd, regelitems, gemarkeerde tekst geëxtraheerd en tabellen gedetecteerd.

    Schermopname van de resultaten van de analyse van het indelingsmodel.

Opmerking

Het hulpprogramma Voorbeeldlabeling biedt geen ondersteuning voor de BMP-bestandsindeling. Dit is een beperking van het hulpprogramma niet van de Document Intelligence-service.

Ondersteunde talen en landinstellingen

Zie onze pagina voor vooraf samengestelde modeltaalondersteuning voor een volledige lijst met ondersteunde talen.

Veldextractie

  • Voor ondersteunde velden voor documentextractie, zie de factuurmodel-schema pagina in onze GitHub voorbeeldenrepository.

  • De factuursleutel-waardeparen en regelitems die zijn geëxtraheerd, bevinden zich in de documentResults sectie van de JSON-uitvoer.

Sleutel-waardeparen

Het vooraf gebouwde factuurmodel ondersteunt de optionele terugkeer van sleutel-waardeparen. Standaard is het retourneren van sleutel-waardeparen uitgeschakeld. Sleutel-waardeparen zijn specifieke spanten binnen de factuur die een label of sleutel en de bijbehorende reactie of waarde identificeren. In een factuur kunnen deze paren het label zijn en de waarde die de gebruiker heeft ingevoerd voor dat veld of telefoonnummer. Het AI-model is getraind om identificeerbare sleutels en waarden te extraheren op basis van een groot aantal documenttypen, indelingen en structuren.

Sleutels kunnen ook geïsoleerd bestaan wanneer het model detecteert dat er een sleutel bestaat, zonder gekoppelde waarde of bij het verwerken van optionele velden. In sommige gevallen kan bijvoorbeeld een veld met een middelste naam leeg blijven in een formulier. Sleutel-waardeparen zijn altijd gedeeltes tekst binnen het document. Voor documenten waarbij dezelfde waarde op verschillende manieren wordt beschreven, bijvoorbeeld klant/gebruiker, is de bijbehorende sleutel klant of gebruiker (op basis van context).

JSON-uitvoer

De JSON-uitvoer heeft drie delen:

  • "readResults" de knoop bevat alle herkende tekst en selectiemarkeringen. Tekst wordt geordend via pagina, vervolgens op regel en vervolgens op afzonderlijke woorden.
  • "pageResults" het knooppunt bevat de tabellen en cellen die zijn geëxtraheerd met hun begrenzingsvakken, betrouwbaarheid en een verwijzing naar de regels en woorden in readResults.
  • "documentResults" het knooppunt bevat de factuurspecifieke waarden en regelitems die door het model zijn gedetecteerd. Hier vindt u alle velden van de factuur, zoals factuur-id, verzenden naar, factureren naar, klant, totaal, regelitems en nog veel meer.

Migratiehandleiding

::: bijnaam-einde

Volgende stappen