Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Deze inhoud is van toepassing op:🟩v4.0 (GA) | Vorige versies:🟦v3.1 (GA)🟥v3.0 (buiten gebruik stellen)🟥v2.1 (buiten gebruik stellen)
Deze inhoud is van toepassing op:🟩v3.1 (GA) | Nieuwste versie:🟪v4.0 (GA) | Vorige versies:🟦v3.0🟦v2.1
Deze inhoud is van toepassing op:🟥v3.0 (buiten gebruik stellen) | Nieuwste versies:🟪v4.0 (GA)🟪v3.1 (GA) | Vorige versie:🟥v2.1 (buiten gebruik stellen)
Deze inhoud is van toepassing op:🟥v2.1 | Nieuwste versie:🟪v4.0 (GA)
Azure Document Intelligence in Foundry Tools ondersteunt verschillende modellen die u kunt gebruiken om intelligente documentverwerking toe te voegen aan uw apps en stromen. U kunt een vooraf samengesteld domeinspecifiek model gebruiken of een aangepast model trainen dat is afgestemd op uw specifieke bedrijfsbehoeften en gebruiksvoorbeelden. U kunt Document Intelligence gebruiken met de REST API of Python, C#, Java en JavaScript-clientbibliotheken.
Opmerking
Documentverwerkingsprojecten die betrekking hebben op financiële gegevens, beschermde gezondheidsgegevens, persoonsgegevens of zeer gevoelige gegevens, vereisen zorgvuldige aandacht. Zorg ervoor dat u voldoet aan alle nationale/regionale en branchespecifieke vereisten.
Overzicht van model
In de volgende tabel ziet u de algemeen beschikbare (GA)-modellen voor elke stabiele API.
| Modeltype | Model | 2024-11-30 (GA) | 2023-07-31 (GA) | 2022-08-31 (GA) | v2.1 (GA) |
|---|---|---|---|---|---|
| Modellen voor documentanalyse | Lezen | ✔️ | ✔️ | ✔️ | Niet beschikbaar |
| Modellen voor documentanalyse | Indeling | ✔️ | ✔️ | ✔️ | ✔️ |
| Modellen voor documentanalyse | Algemeen document** | Ondersteund in indelingsmodel |
✔️ | ✔️ | Niet beschikbaar |
| Vooraf gemaakte modellen | Bankcheque | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | Bankoverzicht | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | payStub | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | Contract | ✔️ | ✔️ | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | Ziekteverzekeringskaart | ✔️ | ✔️ | ✔️ | Niet beschikbaar |
| Vooraf gemaakte modellen | ID-document | ✔️ | ✔️ | ✔️ | ✔️ |
| Vooraf gemaakte modellen | Factuur | ✔️ | ✔️ | ✔️ | ✔️ |
| Vooraf gemaakte modellen | Ontvangst | ✔️ | ✔️ | ✔️ | ✔️ |
| Vooraf gemaakte modellen | Verenigde Amerikaanse belasting* | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | Amerikaanse 1040 belasting* (US 1040 tax) | ✔️ | ✔️ | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | Amerikaanse 1095 belasting* (US 1095 tax) | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | VS 1098 belasting* | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | US 1099-belasting* | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | Amerikaanse W2-belasting | ✔️ | ✔️ | ✔️ | Niet beschikbaar |
| Vooraf gemaakte modellen | Amerikaanse W4-belasting | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | VS hypotheek 1003 URLA | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | AMERIKAANSE hypotheek 1004 URAR | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | Amerikaanse hypotheek 1005 | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | Overzicht van Amerikaanse hypotheek 1008 | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | Openbaarmaking van hypotheekafsluiting in de VS | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | Huwelijksakte | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | Creditcard | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Vooraf gemaakte modellen | Visitekaartje | Afgekeurd | ✔️ | ✔️ | ✔️ |
| Aangepast classificatiemodel | Aangepaste classificatie | ✔️ | ✔️ | Niet beschikbaar | Niet beschikbaar |
| Aangepast extractiemodel | Aangepaste neurale | ✔️ | ✔️ | ✔️ | Niet beschikbaar |
| Aangepast extractiemodel | Aangepaste sjabloon | ✔️ | ✔️ | ✔️ | ✔️ |
| Aangepast extractiemodel | Aangepast samengesteld | ✔️ | ✔️ | ✔️ | ✔️ |
| Alle modellen | Mogelijkheden voor invoegtoepassingen | ✔️ | ✔️ | Niet beschikbaar | Niet beschikbaar |
* Bevat submodellen. Zie de modelspecifieke informatie voor ondersteunde variaties en subtypen.
** Alle mogelijkheden voor het algemene documentmodel zijn beschikbaar in het indelingsmodel. Het algemene model wordt niet meer ondersteund.
Latentie
Latentie is de hoeveelheid tijd die een API-server nodig heeft om een binnenkomende aanvraag te verwerken en te verwerken en het uitgaande antwoord aan de client te leveren. De tijd die nodig is om een document te analyseren, is afhankelijk van de grootte (bijvoorbeeld het aantal pagina's) en de bijbehorende inhoud op elke pagina. Document Intelligence is een multitenant asynchrone service waarbij latentie voor vergelijkbare documenten vergelijkbaar is, maar niet altijd identiek is. Incidentele variabiliteit in latentie en prestaties is inherent aan elke op microservice gebaseerde staatloze service die afbeeldingen en grote documenten op schaal verwerkt. Hoewel we voortdurend de hardware- en capaciteits- en schaalmogelijkheden omhoog schalen, zijn er mogelijk nog steeds latentieproblemen tijdens runtime.
Invoegtoepassingsmogelijkheid
De volgende mogelijkheden voor invoegtoepassingen zijn beschikbaar voor Document Intelligence. Voor alle modellen behalve het visitekaartjesmodel biedt Document Intelligence nu ondersteuning voor invoegtoepassingsmogelijkheden om geavanceerdere analyses mogelijk te maken. U kunt deze optionele mogelijkheden in- en uitschakelen, afhankelijk van het scenario van de documentextractie. De volgende invoegtoepassingsmogelijkheden zijn beschikbaar voor de API-versie 2023-07-31 (GA) en hoger:
ocrHighResolutionformulasstyleFontbarcodeslanguageskeyValuePairs-
queryFields(niet beschikbaar met de Amerikaanse belastingmodellen) -
searchablePDF(alleen beschikbaar voor het leesmodel)
| Invoegtoepassingsmogelijkheid | Invoegtoepassing/gratis | 30-11-2024 (GA) | 2023-07-31 (GA) | 2022-08-31 (GA) | v2.1 (GA) |
|---|---|---|---|---|---|
| Extractie van lettertype-eigenschap | Uitbreiding | ✔️ | ✔️ | Niet beschikbaar | Niet beschikbaar |
| Formuleextractie | Uitbreiding | ✔️ | ✔️ | Niet beschikbaar | Niet beschikbaar |
| Extractie met hoge resolutie | Uitbreiding | ✔️ | ✔️ | Niet beschikbaar | Niet beschikbaar |
| Streepjescode-extractie | Gratis | ✔️ | ✔️ | Niet beschikbaar | Niet beschikbaar |
| Taaldetectie | Gratis | ✔️ | ✔️ | Niet beschikbaar | Niet beschikbaar |
| Sleutel-/waardeparen | Gratis | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Queryvelden | Add-on* | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
| Doorzoekbare PDF | Add-on* | ✔️ | Niet beschikbaar | Niet beschikbaar | Niet beschikbaar |
Modelanalysefuncties
| Model-ID | Inhoudsextractie | Queryvelden | Paragrafen | Alinearollen | Selectietekens | Tabellen | Sleutel-/waardeparen | Talen | Barcodes | Documentanalyse | Formules* | Lettertype stijl* | Hoge resolutie* | Doorzoekbare PDF |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
prebuilt-read |
✓ | ✓ | O | O | O | O | O | O | ||||||
prebuilt-layout |
✓ | ✓ | ✓ | ✓ | ✓ | ✓ | O | O | O | O | O | O | ||
prebuilt-contract |
✓ | ✓ | ✓ | ✓ | ✓ | O | O | ✓ | O | O | ||||
prebuilt-healthInsuranceCard.us |
✓ | ✓ | O | O | ✓ | O | O | O | ||||||
prebuilt-idDocument |
✓ | ✓ | O | O | ✓ | O | O | O | ||||||
prebuilt-invoice |
✓ | ✓ | ✓ | ✓ | O | O | O | ✓ | O | O | O | |||
prebuilt-receipt |
✓ | ✓ | O | O | ✓ | O | O | O | ||||||
prebuilt-marriageCertificate.us |
✓ | ✓ | ✓ | O | O | ✓ | O | O | O | |||||
prebuilt-creditCard |
✓ | ✓ | O | O | ✓ | O | O | O | ||||||
prebuilt-check.us |
✓ | ✓ | O | O | ✓ | O | O | O | ||||||
prebuilt-payStub.us |
✓ | ✓ | O | O | ✓ | O | O | O | ||||||
prebuilt-bankStatement |
✓ | ✓ | O | O | ✓ | O | O | O | ||||||
prebuilt-mortgage.us.1003 |
✓ | ✓ | ✓ | O | O | ✓ | O | O | O | |||||
prebuilt-mortgage.us.1004 |
✓ | ✓ | ✓ | O | O | ✓ | O | O | O | |||||
prebuilt-mortgage.us.1005 |
✓ | ✓ | ✓ | O | O | ✓ | O | O | O | |||||
prebuilt-mortgage.us.1008 |
✓ | ✓ | ✓ | O | O | ✓ | O | O | O | |||||
prebuilt-mortgage.us.closingDisclosure |
✓ | ✓ | ✓ | O | O | ✓ | O | O | O | |||||
prebuilt-tax.us |
✓ | ✓ | ✓ | O | O | ✓ | O | O | O | |||||
prebuilt-tax.us.w2 |
✓ | ✓ | ✓ | O | O | ✓ | O | O | O | |||||
prebuilt-tax.us.w4 |
✓ | ✓ | O | O | ✓ | O | O | O | ||||||
prebuilt-tax.us.1040 (diverse) |
✓ | ✓ | ✓ | O | O | ✓ | O | O | O | |||||
prebuilt-tax.us.1095A |
✓ | ✓ | O | O | ✓ | O | O | O | ||||||
prebuilt-tax.us.1095C |
✓ | ✓ | O | O | ✓ | O | O | O | ||||||
prebuilt-tax.us.1098 |
✓ | ✓ | ✓ | O | O | ✓ | O | O | O | |||||
prebuilt-tax.us.1098E |
✓ | ✓ | ✓ | O | O | ✓ | O | O | O | |||||
prebuilt-tax.us.1098T |
✓ | ✓ | ✓ | O | O | ✓ | O | O | O | |||||
prebuilt-tax.us.1099 (diverse) |
✓ | ✓ | ✓ | O | O | ✓ | O | O | O | |||||
prebuilt-tax.us.1099SSA |
✓ | ✓ | O | O | ✓ | O | O | O | ||||||
{ customModelName } |
✓ | ✓ | ✓ | ✓ | ✓ | ✓ | O | O | ✓ | O | O | O |
✓ - Ingeschakeld
O - Optioneel
* - Premium-functies brengen extra kosten met zich mee
Queryvelden worden anders geprijsd dan de andere toevoegfuncties. Zie Prijzen voor meer informatie.
Begrenzingsvak en veelhoekcoördinaten
Een begrenzingsvak (polygon in v3.0 en latere versies) is een abstracte rechthoek die tekstelementen in een document omsluit. Een begrenzingsvak wordt gebruikt als referentiepunt voor objectdetectie:
- Het begrenzingsvak geeft de positie aan met behulp van een x- en y-coördinaatvlak dat wordt weergegeven in een matrix van vier numerieke paren. Elk paar vertegenwoordigt een hoek van het vak in de volgende volgorde: linksboven, rechtsboven, rechtsonder, linksonder.
- Afbeeldingscoördinaten worden weergegeven in pixels. Voor een PDF worden coördinaten weergegeven in inches.
Taalondersteuning
De universele modellen in Document Intelligence die zijn gebaseerd op Deep Learning ondersteunen veel talen. De modellen kunnen meertalige tekst extraheren uit uw afbeeldingen en documenten, inclusief tekstregels met gemengde talen. Taalondersteuning verschilt per functionaliteit van de Document Intelligence-service. Zie de volgende artikelen voor een volledige lijst:
- Taalondersteuning: Documentanalysemodellen
- Taalondersteuning: vooraf samengestelde modellen
- Taalondersteuning: Aangepaste modellen
Regionale beschikbaarheid
Document intelligence is algemeen beschikbaar in veel van de 60+ Azure wereldwijde infrastructuurregio's.
Zie Azure geografische gebieden om u te helpen bij het kiezen van de regio die het meest geschikt is voor u en uw klanten.
Modeldetails
In deze sectie wordt de uitvoer beschreven die u van elk model kunt verwachten. U kunt de uitvoer van de meeste modellen uitbreiden met invoegtoepassingsfuncties.
OCR lezen
De Read-API maakt gebruik van optische tekenherkenning (OCR) om lijnen en woorden, hun locaties, gedetecteerde talen en handschriftstijl te analyseren en te extraheren, indien gedetecteerd.
Dit voorbeelddocument is verwerkt met Behulp van Document Intelligence Studio.
Indelingsanalyse
Het model voor indelingsanalyse analyseert en extraheert tekst, tabellen, selectiemarkeringen en andere structuurelementen, zoals titels, sectiekoppen, paginakoppen en paginavoetteksten.
Dit voorbeelddocument is verwerkt met Behulp van Document Intelligence Studio.
Ziekteverzekeringskaart
Het model van de zorgverzekeringskaart combineert krachtige OCR-mogelijkheden met deep learning-modellen om belangrijke informatie uit amerikaanse gezondheidsverzekeringskaarten te analyseren en te extraheren.
Deze amerikaanse gezondheidsverzekeringskaart is verwerkt met behulp van Document Intelligence Studio.
Amerikaanse belastingdocumenten
De Amerikaanse belastingdocumentmodellen analyseren en extraheren belangrijke velden en regelitems uit een selecte groep belastingdocumenten. De API ondersteunt de analyse van Amerikaanse belastingdocumenten in de Engelse taal van verschillende indelingen en kwaliteit, waaronder door de telefoon vastgelegde afbeeldingen, gescande documenten en digitale PDF-bestanden. De volgende modellen worden momenteel ondersteund:
| Model | Beschrijving | Model-ID |
|---|---|---|
| Amerikaanse belasting W-2 | Belastingplichtige compensatiegegevens extraheren. | prebuilt-tax.us.w2 |
| Amerikaanse belasting W-4 | Belastingplichtige compensatiegegevens extraheren. | prebuilt-tax.us.w4 |
| Amerikaanse belasting 1040 | Haal hypotheekrenteggevens op. |
prebuilt-tax.us.1040 (versies) |
| Amerikaanse belasting 1095 | Zorgverzekeringsgegevens extraheren. |
prebuilt-tax.us.1095 (versies) |
| Amerikaanse belasting 1098 | Haal hypotheekrenteggevens op. |
prebuilt-tax.us.1098 (versies) |
| Amerikaanse belasting 1099 | Haal inkomsten uit bronnen anders dan de werkgever. |
prebuilt-tax.us.1099 (versies) |
Dit W-2-voorbeelddocument is verwerkt met Behulp van Document Intelligence Studio.
Amerikaanse hypotheekdocumenten
In modellen voor Amerikaanse hypotheekdocumenten worden belangrijke velden geanalyseerd en geëxtraheerd, waaronder informatie over de kredietnemer, de lening en het onroerend goed, uit een selecte groep hypotheekdocumenten. De API ondersteunt de analyse van Amerikaanse hypotheekdocumenten in de Engelse taal van verschillende indelingen en kwaliteit, waaronder door de telefoon vastgelegde afbeeldingen, gescande documenten en digitale PDF-bestanden. De volgende modellen worden momenteel ondersteund.
| Model | Beschrijving | Model-ID |
|---|---|---|
| 1003 End-User gebruiksrechtovereenkomst | Extraheer lening, kredietnemer, eigenschapsgegevens. | prebuilt-mortgage.us.1003 |
| 1004 Uniform Woonwaarderapport (URAR) | Extraheer lening, kredietnemer, eigenschapsgegevens. | prebuilt-mortgage.us.1004 |
| 1005 Verificatie van de werkgelegenheid | Extraheer lening, kredietnemer, eigenschapsgegevens. | prebuilt-mortgage.us.1005 |
| 1008 Samenvattingsdocument | Haal kredietnemer-, verkoper-, onroerendgoed-, hypotheek- en onderschrijfgegevens op. | prebuilt-mortgage.us.1008 |
| Openbaarmaking sluiten | Details van afsluiting, transactiekosten en leningsinformatie extraheren. | prebuilt-mortgage.us.closingDisclosure |
Dit voorbeeld van een sluitingsverklaring is verwerkt door gebruik te maken van Document Intelligence Studio.
Contract
Het contractmodel analyseert en extraheert belangrijke velden en regelitems uit contractuele overeenkomsten, waaronder partijen, jurisdicties, contract-id en titel. Het model ondersteunt momenteel engelse contractdocumenten.
Dit voorbeeldcontract is verwerkt met Behulp van Document Intelligence Studio.
Amerikaanse bankcontrole
Het contractmodel analyseert en extraheert belangrijke velden van Amerikaanse bankcontroles, waaronder controlegegevens, rekeninggegevens, bedrag en memo.
Dit bankchequevoorbeeld is verwerkt met behulp van Document Intelligence Studio.
Amerikaanse bankverklaring
Het bankafschriftmodel analyseert en extraheert belangrijke velden en regelitems van het amerikaanse bankrekeningnummer, bankgegevens, afschriftgegevens en transactiegegevens.
Dit voorbeeld van een bankoverzicht is verwerkt met behulp van Document Intelligence Studio.
payStub
Het payStub-model analyseert en extraheert belangrijke velden en regelitems uit documenten en bestanden met informatie over salarisadministraties.
Dit voorbeeld van pay stub is verwerkt met behulp van Document Intelligence Studio.
Factuur
Het factuurmodel automatiseert de verwerking van facturen om de naam van de klant, het factuuradres, de vervaldatum, het verschuldigde bedrag, regelitems en andere sleutelgegevens te extraheren.
Deze voorbeeldfactuur is verwerkt met Behulp van Document Intelligence Studio.
Ontvangst
Gebruik het ontvangstbewijsmodel om verkoopbevestigingen te scannen op de naam van de verkoper, datums, regelitems, hoeveelheden en totalen van afgedrukte en handgeschreven ontvangstbewijzen. Versie v3.0 ondersteunt ook verwerking van hotelbevestigingen met één pagina.
De voorbeeldbon is verwerkt met behulp van Document Intelligence Studio.
Identiteitsdocument
Gebruik het identiteitsdocumentmodel (ID) voor het verwerken van amerikaanse rijbewijslicenties (alle 50 staten en district van Columbia) en biografische pagina's van internationale paspoorten (met uitzondering van visum en andere reisdocumenten) om belangrijke velden te extraheren.
Dit voorbeeld van een amerikaanse rijbewijs is verwerkt met behulp van Document Intelligence Studio.
Huwelijksakte
Gebruik het huwelijkscertificaatmodel om amerikaanse huwelijkscertificaten te verwerken om belangrijke velden te extraheren, waaronder de personen, datum en locatie.
Dit voorbeeld van een Amerikaans huwelijkscertificaat is verwerkt met Behulp van Document Intelligence Studio.
Kredietkaart
Gebruik het creditcardmodel om creditcards en betaalkaarten te verwerken om sleutelvelden te extraheren.
Deze voorbeeld creditcard is verwerkt met behulp van Document Intelligence Studio.
Aangepaste modellen
Aangepaste modellen worden breed ingedeeld in twee typen. Aangepaste classificatiemodellen die ondersteuning bieden voor classificatie van een 'documenttype' en aangepaste extractiemodellen waarmee een gedefinieerd schema uit een specifiek documenttype kan worden geëxtraheerd.
Aangepaste documentmodellen analyseren en extraheren gegevens uit formulieren en documenten die specifiek zijn voor uw bedrijf. Ze herkennen formuliervelden binnen uw afzonderlijke inhoud en extraheren sleutel-waardeparen en tabelgegevens. U hebt slechts één voorbeeld van het formuliertype nodig om aan de slag te gaan.
Versie v3.0 en hoger aangepaste modellen ondersteunen handtekeningdetectie in aangepaste sjabloon (formulier) en tabellen op meerdere pagina's in zowel sjabloon- als neurale modellen. Handtekeningdetectie zoekt naar de aanwezigheid van een handtekening, niet de identiteit van de persoon die het document ondertekent. Als het model niet-ondertekend retourneert voor handtekeningdetectie, heeft het model geen handtekening gevonden in het gedefinieerde veld.
Deze aangepaste voorbeeldsjabloon is verwerkt met Behulp van Document Intelligence Studio.
Aangepaste extractie
Het aangepaste extractiemodel bestaat uit twee typen: aangepaste sjabloon en aangepaste neurale. Als u een aangepast extractiemodel wilt maken, labelt u een gegevensset met documenten met de waarden die u wilt ophalen en traint u het model op de gelabelde gegevensset. U hebt slechts vijf voorbeelden van hetzelfde formulier of documenttype nodig om aan de slag te gaan.
Deze aangepaste voorbeeldextractie is verwerkt met Behulp van Document Intelligence Studio.
Aangepaste classificatie
Met het aangepaste classificatiemodel kunt u het documenttype identificeren voordat u het extractiemodel aanroept. Het classificatiemodel is beschikbaar vanaf de API 2023-07-31 (GA). Voor het trainen van een aangepast classificatiemodel zijn ten minste twee afzonderlijke klassen en minimaal vijf voorbeelden per klasse vereist.
Samengestelde modellen
Er wordt een samengesteld model gemaakt door een verzameling aangepaste modellen te maken en deze toe te wijzen aan één model dat is gebouwd op basis van uw formuliertypen. U kunt meerdere aangepaste modellen toewijzen aan een samengesteld model dat wordt aangeroepen met één model-id. U kunt maximaal 200 getrainde aangepaste modellen toewijzen aan één samengesteld model.
Dit samengestelde voorbeeldmodel bevindt zich in Document Intelligence Studio.
Invoervereisten
De volgende bestandsindelingen worden ondersteund.
| Model | Afbeelding: JPEG/JPG, PNG, BMP, TIFF, HEIF |
Office: Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML |
|
|---|---|---|---|
| Lezen | ✔ | ✔ | ✔ |
| Indeling | ✔ | ✔ | ✔ |
| Algemeen document | ✔ | ✔ | |
| Voorgebouwd | ✔ | ✔ | |
| Aangepaste extractie | ✔ | ✔ | |
| Aangepaste classificatie | ✔ | ✔ | ✔ |
- Foto's en scans: geef één duidelijke foto of een hoogwaardige scan per document op voor de beste resultaten.
- PDF's en TIFF's: Voor PDF-bestanden en TIFF's kunnen maximaal 2000 pagina's worden verwerkt. (Met een abonnement op de gratis laag worden alleen de eerste twee pagina's verwerkt.)
- Bestandsgrootte: de bestandsgrootte voor het analyseren van documenten is 500 MB voor de betaalde laag (S0) en 4 MB voor de gratis laag (F0).
- Afbeeldingsafmetingen: De afmetingen moeten tussen 50 pixels x 50 pixels en 10.000 pixels x 10.000 pixels zijn.
- Wachtwoordvergrendelingen: als uw PDF-bestanden zijn vergrendeld met een wachtwoord, moet u de vergrendeling verwijderen voordat u ze inzendt.
- Teksthoogte: de minimale hoogte van de tekst die moet worden geëxtraheerd, is 12 pixels voor een afbeelding van 1024 x 768 pixels. Deze dimensie komt overeen met ongeveer 8-punts tekst bij 150 punten per inch.
- Aangepaste modeltraining: Het maximum aantal pagina's voor trainingsgegevens is 500 voor het aangepaste sjabloonmodel en 50.000 voor het aangepaste neurale model.
- Aangepaste extractiemodeltraining: de totale grootte van trainingsgegevens is 50 MB voor het sjabloonmodel en 1 GB voor het neurale model.
- Training voor aangepast classificatiemodel: de totale grootte van trainingsgegevens is 1 GB met maximaal 10.000 pagina's. Voor 2024-11-30 (GA) is de totale grootte van trainingsgegevens 2 GB met maximaal 10.000 pagina's.
- Office-bestandstypen (DOCX, XLSX, PPTX): de maximale tekenreekslengte is 8 miljoen tekens.
Opmerking
Het hulpprogramma Voorbeeldlabels biedt geen ondersteuning voor de BMP-bestandsindeling. De beperking is afgeleid van het hulpprogramma niet van de Document Intelligence-service.
Versiemigratie
Meer informatie over het gebruik van Document Intelligence v3.0 in uw toepassingen door de stappen in de migratiehandleiding voor Document Intelligence v3.1 te volgen.
| Model | Beschrijving |
|---|---|
| Documentanalyse | |
| Indeling | Tekst- en indelingsgegevens extraheren uit documenten. |
| Voorgebouwd | |
| Factuur | Belangrijke informatie extraheren uit facturen in het Engels en Spaans. |
| Ontvangst | Belangrijke informatie extraheren uit ontvangstbewijzen in het Engels. |
| ID-document | Haal belangrijke informatie op uit amerikaanse rijbewijs's en internationale paspoorten. |
| Visitekaartje | Belangrijke informatie extraheren uit visitekaartjes in het Engels. |
| Aangepaste | |
| Op maat | Gegevens extraheren uit formulieren en documenten die specifiek zijn voor uw bedrijf. Aangepaste modellen worden getraind voor uw afzonderlijke gegevens en gebruiksvoorbeelden. |
| Samengesteld | Stel een verzameling aangepaste modellen samen en wijs ze toe aan één model dat is gebouwd op basis van uw formuliertypen. |
Indeling
De Layout-API analyseert en extraheert tekst, tabellen en kopteksten, selectiemarkeringen en structuurinformatie uit documenten.
Dit voorbeelddocument is verwerkt met behulp van het hulpprogramma Voorbeeldlabels.
Factuur
Het factuurmodel analyseert en extraheert belangrijke informatie uit verkoopfacturen. De API analyseert facturen in verschillende indelingen en extraheert belangrijke informatie, zoals klantnaam, factuuradres, vervaldatum en verschuldigd bedrag.
Deze voorbeeldfactuur is verwerkt met behulp van het hulpprogramma Voorbeeldlabeling.
Ontvangst
Het ontvangstbewijsmodel analyseert en extraheert belangrijke informatie uit afgedrukte en handgeschreven verkoopbevestigingen.
Deze voorbeeldbon werd verwerkt met behulp van de Sample Labeling tool.
ID-document
Het id-documentmodel analyseert en extraheert belangrijke informatie uit de volgende documenten:
- Amerikaanse rijbewijs (alle 50 staten en district van Columbia)
- Biografische pagina's van internationale paspoorten (met uitzondering van visum en andere reisdocumenten). De API analyseert en extraheert identiteitsdocumenten.
Dit voorbeeld van een amerikaanse rijbewijs is verwerkt met behulp van het hulpprogramma Voorbeeldlabeling.
Visitekaartje
Het visitekaartjesmodel analyseert en extraheert belangrijke informatie uit visitekaartjesafbeeldingen.
Dit voorbeeld visitekaartje is verwerkt met behulp van het hulpprogramma Voorbeeldlabeling.
Aangepaste
Aangepaste modellen analyseren en extraheren gegevens uit formulieren en documenten die specifiek zijn voor uw bedrijf. De API is een machine learning-programma dat is getraind om formuliervelden binnen uw afzonderlijke inhoud te herkennen en sleutel-waardeparen en tabelgegevens te extraheren. U hebt slechts vijf voorbeelden van hetzelfde formuliertype nodig om aan de slag te gaan. U kunt uw aangepaste model trainen met of zonder gelabelde gegevenssets.
Dit aangepaste voorbeeldmodel is verwerkt met behulp van het hulpprogramma Voorbeeldlabeling.
Samengesteld aangepast model
Er wordt een samengesteld model gemaakt door een verzameling aangepaste modellen te maken en deze toe te wijzen aan één model dat is gebouwd op basis van uw formuliertypen. U kunt meerdere aangepaste modellen toewijzen aan een samengesteld model dat wordt aangeroepen met één model-id. U kunt maximaal 100 getrainde aangepaste modellen toewijzen aan één samengesteld model.
Dit samengestelde modelvenster is verwerkt met behulp van het hulpprogramma Voorbeeldlabeling.
Gegevensextractie modelleren
| Model | Tekstextractie | Taaldetectie | Selectietekens | Tabellen | Paragrafen | Alinearollen | Sleutel-/waardeparen | Velden |
|---|---|---|---|---|---|---|---|---|
| Indeling | ✓ | ✓ | ✓ | ✓ | ✓ | |||
| Factuur | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ||
| Ontvangst | ✓ | ✓ | ✓ | |||||
| ID-document | ✓ | ✓ | ✓ | |||||
| Visitekaartje | ✓ | ✓ | ✓ | |||||
| Aangepast formulier | ✓ | ✓ | ✓ | ✓ | ✓ |
Invoervereisten
De volgende bestandsindelingen worden ondersteund.
| Model | Afbeelding: JPEG/JPG, PNG, BMP, TIFF, HEIF |
Office: Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML |
|
|---|---|---|---|
| Lezen | ✔ | ✔ | ✔ |
| Indeling | ✔ | ✔ | ✔ |
| Algemeen document | ✔ | ✔ | |
| Voorgebouwd | ✔ | ✔ | |
| Aangepaste extractie | ✔ | ✔ | |
| Aangepaste classificatie | ✔ | ✔ | ✔ |
- Foto's en scans: geef één duidelijke foto of een hoogwaardige scan per document op voor de beste resultaten.
- PDF's en TIFF's: Voor PDF-bestanden en TIFF's kunnen maximaal 2000 pagina's worden verwerkt. (Met een abonnement op de gratis laag worden alleen de eerste twee pagina's verwerkt.)
- Bestandsgrootte: de bestandsgrootte voor het analyseren van documenten is 500 MB voor de betaalde laag (S0) en 4 MB voor de gratis laag (F0).
- Afbeeldingsafmetingen: De afmetingen moeten tussen 50 pixels x 50 pixels en 10.000 pixels x 10.000 pixels zijn.
- Wachtwoordvergrendelingen: als uw PDF-bestanden zijn vergrendeld met een wachtwoord, moet u de vergrendeling verwijderen voordat u ze inzendt.
- Teksthoogte: de minimale hoogte van de tekst die moet worden geëxtraheerd, is 12 pixels voor een afbeelding van 1024 x 768 pixels. Deze dimensie komt overeen met ongeveer 8-punts tekst bij 150 punten per inch.
- Aangepaste modeltraining: Het maximum aantal pagina's voor trainingsgegevens is 500 voor het aangepaste sjabloonmodel en 50.000 voor het aangepaste neurale model.
- Aangepaste extractiemodeltraining: de totale grootte van trainingsgegevens is 50 MB voor het sjabloonmodel en 1 GB voor het neurale model.
- Training voor aangepast classificatiemodel: de totale grootte van trainingsgegevens is 1 GB met maximaal 10.000 pagina's. Voor 2024-11-30 (GA) is de totale grootte van trainingsgegevens 2 GB met maximaal 10.000 pagina's.
- Office-bestandstypen (DOCX, XLSX, PPTX): de maximale tekenreekslengte is 8 miljoen tekens.
Opmerking
Het hulpprogramma Voorbeeldlabels biedt geen ondersteuning voor de BMP-bestandsindeling. De beperking is afgeleid van het hulpprogramma niet van Document Intelligence.
Versiemigratie
U kunt leren hoe u Document Intelligence v3.0 in uw toepassingen gebruikt door de stappen in de migratiehandleiding voor Document Intelligence v3.1 te volgen
Verwante inhoud
- Uw eigen formulieren en documenten verwerken met Document Intelligence Studio.
- Voltooi een quickstart voor Document Intelligence en maak vervolgens een app voor documentverwerking in de ontwikkeltaal van uw keuze.
- Verwerk uw eigen formulieren en documenten met het Document Intelligence Sample Labeling Tool.
- Voltooi een quickstart voor Document Intelligence en maak vervolgens een app voor documentverwerking in de ontwikkeltaal van uw keuze.