Fakturamodell för dokumentinformation

Det här innehållet gäller för:🟩v4.0 (GA) | Tidigare versioner:🟦v3.1 (GA)🟥v3.0 (dras tillbaka)🟥v2.1 (dras tillbaka)

Det här innehållet gäller för:🟩v3.1 (GA) | Senaste versionen:🟪v4.0 (GA) | Tidigare versioner:🟦v3.0🟦v2.1

Det här innehållet gäller för:🟥v3.0 (dras tillbaka) | Senaste versioner:🟪v4.0 (GA)🟪v3.1 (GA) | Tidigare version:🟥v2.1 (dras tillbaka)

Det här innehållet gäller för:🟥v2.1 | Senaste versionen:🟪v4.0 (GA)

Fakturamodellen för dokumentinformation använder kraftfulla OCR-funktioner (Optisk teckenigenkänning) för att analysera och extrahera nyckelfält och radobjekt från försäljningsfakturor, verktygsräkningar och inköpsorder. Fakturor kan ha olika format och kvalitet, inklusive telefonbilder, skannade dokument och digitala PDF-filer. API:t analyserar fakturatext; extraherar viktig information som kundnamn, faktureringsadress, förfallodatum och belopp; och returnerar en strukturerad JSON-datarepresentation. Modellen stöder för närvarande fakturor på 27 språk.

Dokumenttyper som stöds:

  • Fakturor
  • Räkningar för el, vatten och gas
  • Försäljningsorder
  • Inköpsorder

Automatiserad fakturabearbetning

Automatiserad fakturabearbetning är processen för att extrahera nyckelfält accounts payable från faktureringskontodokument. Extraherade data innehåller radobjekt från fakturor som är integrerade med dina arbetsflöden för leverantörsreskontra (AP) för granskningar och betalningar. Tidigare utförs leverantörsreskontraprocessen manuellt och därmed mycket tidskrävande. Korrekt extrahering av viktiga data från fakturor är vanligtvis det första och ett av de mest kritiska stegen i processen för fakturaautomatisering.

Exempelfaktura som bearbetas med Document Intelligence Studio:

Skärmbild av en exempelfaktura som analyserats i Document Intelligence Studio.

Exempelfaktura som behandlats med verktyget för dokumentintelligens provmärkning:

Skärmbild av en exempelfaktura.

Utvecklingsalternativ

Document Intelligence v4.0: 2024-11-30 (GA) stöder följande verktyg, program och bibliotek:

Funktionen Resurser Modell-ID
Fakturamodell Document Intelligence Studio
REST API
C# SDK
Python SDK
Java SDK
JavaScript SDK
fördefinierad faktura

Document Intelligence v3.1 stöder följande verktyg, program och bibliotek:

Funktionen Resurser Modell-ID
Fakturamodell Document Intelligence Studio
REST API
C# SDK
Python SDK
Java SDK
JavaScript SDK
fördefinierad faktura

Document Intelligence v3.0 stöder följande verktyg, program och bibliotek:

Funktionen Resurser Modell-ID
Fakturamodell Document Intelligence Studio
REST API
C# SDK
Python SDK
Java SDK
JavaScript SDK
fördefinierad faktura

Document Intelligence v2.1 stöder följande verktyg, program och bibliotek:

Funktionen Resurser
Fakturamodell Etikettverktyg
för dokumentinformation• REST API
Klientbiblioteks-SDK
Docker-container för dokumentinformation

Indatakrav

Följande filformat stöds.

Modell PDF Bild:
JPEG/JPG, PNG, BMP, TIFF, HEIF
Office:
Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML
Läsa
Upplägg
Allmänt dokument
Förbyggda
Anpassad extrahering
Anpassad klassificering
  • Foton och genomsökningar: För bästa resultat, ge ett tydligt foto eller högkvalitativ genomsökning per dokument.
  • PDF-filer och TIFF:er: För PDF-filer och TIFF:er kan upp till 2 000 sidor bearbetas. (Med en prenumeration på den kostnadsfria nivån bearbetas endast de två första sidorna.)
  • Filstorlek: Filstorleken för att analysera dokument är 500 MB för den betalda nivån (S0) och 4 MB för den kostnadsfria nivån (F0).
  • Bilddimensioner: Dimensionerna måste vara mellan 50 bildpunkter x 50 bildpunkter och 10 000 bildpunkter x 10 000 bildpunkter.
  • Lösenordslås: Om dina PDF-filer är lösenordslåsta måste du ta bort låset innan det skickas in.
  • Texthöjd: Den minsta höjden på texten som ska extraheras är 12 bildpunkter för en bild på 1 024 x 768 bildpunkter. Den här dimensionen motsvarar cirka 8-punktstext vid 150 punkter per tum.
  • Anpassad modellträning: Det maximala antalet sidor för träningsdata är 500 för den anpassade mallmodellen och 50 000 för den anpassade neurala modellen.
  • Anpassad extraheringsmodellträning: Den totala storleken på träningsdata är 50 MB för mallmodellen och 1 GB för den neurala modellen.
  • Anpassad klassificeringsmodellträning: Den totala storleken på träningsdata är 1 GB med högst 10 000 sidor. För 2024-11-30 (GA) är den totala storleken på träningsdata 2 GB med högst 10 000 sidor.
  • Office-filtyper (DOCX, XLSX, PPTX): Den maximala stränglängdsgränsen är 8 miljoner tecken.
  • Filformat som stöds: JPEG, PNG, PDF och TIFF.
  • PDF och TIFF som stöds, upp till 2 000 sidor bearbetas. För prenumeranter på den kostnadsfria nivån bearbetas endast de två första sidorna.
  • Filstorleken som stöds måste vara mindre än 50 MB och dimensionerna minst 50 x 50 bildpunkter och högst 10 000 x 10 000 bildpunkter.

Extrahering av fakturamodelldata

Se hur data, inklusive kundinformation, leverantörsinformation och radobjekt, extraheras från fakturor. Du behöver följande resurser:

  • En Azure prenumeration – du kan skapa en kostnadsfri.

  • En Document Intelligence-instans i Azure-portalen. Du kan använda den kostnadsfria prisnivån (F0) för att prova tjänsten. När resursen har distribuerats väljer du Gå till resurs för att hämta din nyckel och slutpunkt.

Skärmbild av nycklar och slutpunktsplats i Azure portal.

  1. startsidan för Document Intelligence Studio väljer du Fakturor.

  2. Du kan analysera exempelfakturan eller ladda upp dina egna filer.

  3. Välj knappen Kör analys och konfigurera vid behov alternativen Analysera :

    Skärmbild av knapparna Kör analys och Analysera alternativ i Document Intelligence Studio.

Exempeletikettverktyg för dokumentinformation

  1. Gå till Document Intelligence Sample Tool.

  2. På exempelverktygets startsida väljer du panelen Använd fördefinierad modell för att hämta data .

    Skärmbild av layoutmodellen analyserar resultatprocessen.

  3. Välj den formulärtyp som ska analyseras från den nedrullningsbara menyn.

  4. Välj en URL för filen som du vill analysera från alternativen nedan:

  5. I fältet Källa väljer du URL på den nedrullningsbara menyn, klistrar in den valda URL:en och väljer knappen Hämta .

    Skärmbild av listruta för källplats.

  6. I fältet För dokumentinformationstjänstens slutpunkt klistrar du in slutpunkten som du fick med din Document Intelligence-prenumeration.

  7. I nyckelfältet klistrar du in den nyckel som du fick från dokumentinformationsresursen.

    Skärmbild som visar listrutan välj formulärtyp.

  8. Välj Kör analys. Provverktyget för etikettering av dokumentinformation anropar det fördefinierade API:et Analyze och analyserar dokumentet.

  9. Visa resultaten – se nyckel/värde-par extraherade, radobjekt, markerad text som extraherats och tabeller har identifierats.

    Skärmbild av hur layoutmodellen analyserar resultatåtgärden.

Observera

Verktyget Exempeletiketter stöder inte BMP-filformatet. Det här är en begränsning för verktyget, inte dokumentunderrättelsetjänsten.

Språk och nationella inställningar som stöds

En fullständig lista över språk som stöds finns på vårfördefinierade supportsida för modellspråk .

Fältextrahering

  • För extraheringsfält som stöds, se sidan för invoiceschema i vårt GitHub-exempelarkiv.

  • De nyckel/värde-fakturapar och radobjekt som extraheras finns i documentResults avsnittet i JSON-utdata.

Nyckel-värdepar

Den fördefinierade fakturamodellen stöder valfri retur av nyckel/värde-par. Som standard inaktiveras returen av nyckel/värde-par. Nyckel/värde-par är specifika intervall i fakturan som identifierar en etikett eller nyckel och dess associerade svar eller värde. På en faktura kan dessa par vara etiketten och värdet som användaren angav för fältet eller telefonnumret. AI-modellen tränas för att extrahera identifierbara nycklar och värden baserat på en mängd olika dokumenttyper, format och strukturer.

Nycklar kan också finnas isolerat när modellen upptäcker att en nyckel finns, utan associerat värde eller när valfria fält bearbetas. Ett mellannamnsfält kan till exempel lämnas tomt i ett formulär i vissa fall. Nyckel-värdepar är alltid textstycken som finns i dokumentet. För dokument där samma värde beskrivs på olika sätt, till exempel kund/användare, är den associerade nyckeln antingen kund eller användare (baserat på kontext).

JSON-utdata

JSON-utdata har tre delar:

  • "readResults" noden innehåller all identifierad text och alla markeringar. Text ordnas via sida, sedan efter rad och sedan efter enskilda ord.
  • "pageResults" noden innehåller tabeller och celler som extraherats med sina avgränsningsrutor, konfidens och en referens till raderna och orden i readResults.
  • "documentResults" noden innehåller de fakturaspecifika värden och radobjekt som modellen identifierade. Det är här du hittar alla fält från fakturan, till exempel faktura-ID, leverans till, faktura till, kund, summa, radobjekt och mycket mer.

Migreringsguide

sv-SE: ::: moniker-end

Nästa steg