Använda fördefinierade modeller
Tip
Mer information finns på fliken Text och bilder !
Med fördefinierade modeller i Azure Document Intelligence kan du extrahera data från vanliga formulärtyper utan att träna dina egna modeller. Microsoft tränar dessa modeller på ett stort antal exempeldokument, så du kan förvänta dig korrekta och tillförlitliga resultat för standarddokumenttyper.
Modeller för dokumentanalys
Innan du tittar på de domänspecifika fördefinierade modellerna är det viktigt att förstå de dokumentanalysmodeller som ligger till grund för dem.
Läs modell
Läsmodellen extraherar tryckt och handskriven text från dokument och bilder. Den identifierar språket för varje textrad och klassificerar om texten är handskriven eller tryckt. Läsmodellen används som grund för textextrahering i alla andra dokumentinformationsmodeller.
För PDF- eller TIFF-filer med flera sidor kan du använda parametern pages i din begäran för att ange ett sidintervall för analys.
Läsmodellen är idealisk när du vill extrahera ord och rader från dokument utan fast eller förutsägbar struktur.
Layoutmodell
Layoutmodellen utökar läsmodellens textextrahering med identifiering av markeringar, tabeller och dokumentstrukturinformation. Den stöder också en valfri keyValuePairs funktion för att extrahera nyckel/värde-par.
När du digitaliserar ett dokument kan det vara vinklat, eller så kan tabeller ha komplexa strukturer med sammanfogade celler eller ofullständiga rader. Layoutmodellen kan hantera dessa svårigheter. Varje tabellcell extraheras med dess innehåll, avgränsningsrutans position och rad-/kolumnindex.
Markeringsmarkeringar (kryssrutor och alternativknappar) extraheras med sin avgränsningsruta, konfidensnivå och om de är markerade.
Anmärkning
Den allmänna dokumentmodellen var tillgänglig i tidigare versioner av Document Intelligence, men blev inaktuell i versionen 2023-10-31-preview . Dess funktioner för nyckel/värde-par och entitetsextrahering har införlivats i layoutmodellen och andra funktioner.
Fördefinierade modeller för specifika dokumenttyper
Azure Document Intelligence innehåller fördefinierade modeller som tränats på specifika dokumenttyper. Följande fördefinierade modeller är några exempel som är tillgängliga för att extrahera fält från vanliga affärsdokument:
Finansiella och juridiska dokument
| Modell | Beskrivning |
|---|---|
| Faktura | Extraherar kundnamn, leverantörsinformation, inköpsordernummer, faktura och förfallodatum, fakturerings- och leveransadresser, radartiklar och summor. |
| Kvitto | Extraherar information om säljare, transaktionsdatum och tid, radobjekt och summor. Har stöd för bearbetning av hotellkvitton på en sida. |
| Kontoutdrag | Extraherar kontoinformation, saldon för början och slut samt transaktionsinformation. |
| Kontrollera | Extraherar betalningsmottagare, belopp, datum och annan relevant information. |
| Lönebesked | Extraherar löner, timmar, avdrag, nettolön och andra vanliga lönefält. |
| Kreditkort | Extraherar betalkortsinformation. |
| Kontrakt | Extraherar avtals- och partinformation. |
Amerikanska skattedokument
| Modell | Beskrivning |
|---|---|
| Enhetlig amerikansk skatt | En enda modell som extraherar från alla typer av amerikanska skatteformulär som stöds. |
| W-2 | Extraherar information om beskattningsbar kompensation. |
| 1098 och variationer | Extraherar bolåneränta och relaterad information. |
| 1099 och variationer | Extraherar inkomster från olika källor. |
| 1040 och variationer | Extraherar information om individuell inkomstdeklaration. |
Amerikanska inteckningsdokument
| Modell | Beskrivning |
|---|---|
| 1003 (URLA) | Extraherar information om låneansökan. |
| 1004 (URAR) | Extraherar information från fastighetsvärderingar. |
| 1005 | Extraherar information om validering av anställning. |
| 1008 | Extraherar låneöverföringsinformation. |
| Avslutande avslöjande | Extraherar de sista lånevillkoren. |
Dokument för personlig identifiering
| Modell | Beskrivning |
|---|---|
| ID-dokument | Extraherar information från amerikanska körkort, EU-ID och körkort samt internationella pass. Innehåller namn, födelsedatum, dokumentnummer och bekräftelser eller begränsningar. |
| Sjukförsäkringskort | Extraherar vanliga fält från amerikanska sjukförsäkringskort. |
| Vigselbevis | Extraherar certifierad äktenskapsinformation. |
Viktigt!
ID-dokumentmodellen extraherar personlig information som omfattas av dataskyddslagar i de flesta jurisdiktioner. Se till att du har individens behörighet att lagra sina data och att du uppfyller alla tillämpliga juridiska krav.
Funktioner i fördefinierade modeller
Fördefinierade modeller är utformade för att extrahera olika typer av data från dokument. Dessa funktioner omfattar bland annat:
- Extrahering av text: Alla fördefinierade modeller extraherar rader och ord från handskriven och tryckt text.
- Nyckel/värde-par: Textintervall som identifierar en etikett och dess svar. Till exempel Vikt och 31 kg.
- Markeringsmarkeringar: Kryssrutor och alternativknappar, inklusive om de är markerade eller inte.
- Tabeller: Data i celler, inklusive antalet kolumner och rader, kolumn- och radrubriker och sammanfogade celler.
-
Fält: Modeller som tränats för en viss formulärtyp identifierar en fast uppsättning fält. Fakturamodellen extraherar
CustomerNameochInvoiceTotaltill exempel.
När du ska använda fördefinierade eller anpassade modeller
Fördefinierade modeller täcker de vanligaste dokumenttyperna. Om du har en branschspecifik eller unik formulärtyp kan du få mer exakta resultat med en anpassad modell. Anpassade modeller kräver dock tid och provdata för att tränas. Kontrollera alltid om det finns en fördefinierad modell för ditt scenario innan du investerar i utveckling av anpassade modeller.