Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Belangrijk
Voor preview-versies van Document Intelligence v4.0 en voor de toekomst wordt het algemene documentmodel (voorgebouwd document) stopgezet. Gebruik de volgende modellen om sleutel-waardeparen, selectiemarkeringen, tekst, tabellen en structuur uit documenten te extraheren:
| Functie | versie | Model-ID |
|---|---|---|
Layout model waarbij de optionele queryreeksparameter features=keyValuePairs is ingeschakeld. |
• v4:2024-11-30 • v3.1:2023-07-31 (GA) |
prebuilt-layout |
| Algemeen documentmodel | • v3.1:2023-07-31 (GA) • v3.0:2022-08-31 (GA) • v2.1 (GA) |
prebuilt-document |
Opmerking: Azure AI documentanalyse v3.0 API (2022-08-31) het einde van de ondersteuning bereikt op 30 maart 2029. Migreer v3.0-workloads naar de algemeen beschikbare v4.0-API (2024-11-30) vóór deze datum. In v4.x wordt de algemene documentmogelijkheid (prebuilt-document) vervangen door het indelingsmodel door features=keyValuePairs. Zie de Document Intelligence-migratiehandleiding voor hulp.
Deze inhoud is van toepassing op:🟩v3.1 (GA) | Vorige versies:🟥v3.0 (buiten gebruik stellen)🟥v2.1 (buiten gebruik stellen)
Het algemene documentmodel combineert krachtige OCR-mogelijkheden (Optical Character Recognition) met deep learning-modellen om sleutel-waardeparen, tabellen en selectiemarkeringen uit documenten te extraheren. Algemeen document is beschikbaar met de v3.1- en v3.0-API's. Zie onze migratiehandleiding voor meer informatie.
Algemene documentfuncties
Het algemene documentmodel is een vooraf getraind model; hiervoor zijn geen labels of training vereist.
Met één API worden sleutel-waardeparen, selectiemarkeringen, tekst, tabellen en structuur uit documenten geëxtraheerd.
Het algemene documentmodel ondersteunt gestructureerde, semi-gestructureerde en ongestructureerde documenten.
Selectiemarkeringen worden aangeduid als velden met een waarde van
:selected:of:unselected:.
Voorbeelddocument dat is verwerkt in Document Intelligence Studio
Extractie van sleutel-waardeparen
De algemene document-API ondersteunt de meeste formuliertypen en analyseert uw documenten en extraheert sleutels en bijbehorende waarden. Het is ideaal voor het extraheren van algemene sleutel-waardeparen uit documenten. U kunt het algemene documentmodel gebruiken als alternatief voor het trainen van een aangepast model zonder labels.
Ontwikkelingsopties
Document Intelligence v3.1 ondersteunt de volgende hulpprogramma's, toepassingen en bibliotheken:
| Functie | Resources | Model-ID |
|---|---|---|
| Algemeen documentmodel | • Document Intelligence Studio • REST API • C# SDK • Python SDK • Java SDK • JavaScript SDK |
vooraf samengesteld document |
Belangrijk
Azure Document Intelligence v3.0 API (2022-08-31) eindigt de ondersteuning op 30 maart 2029. Gebruik Azure Document Intelligence 2024-11-30 v4.0 voor alle nieuwe ontwikkeling en migreer bestaande workloads naar Azure Document Intelligence 2024-11-30 v4.0 vóór deze datum om onderbreking van de productie te voorkomen. Gebruik het indelingsmodel (features=keyValuePairs) voor algemene documentextractie in v4.0. Zie de Document Intelligence-migratiehandleiding voor migratierichtlijnen.
Document Intelligence v3.0 ondersteunt de volgende hulpprogramma's, toepassingen en bibliotheken:
| Functie | Resources | Model-ID |
|---|---|---|
| Algemeen documentmodel | • Document Intelligence Studio • REST API • C# SDK • Python SDK • Java SDK • JavaScript SDK |
vooraf samengesteld document |
Vereisten voor invoer
De volgende bestandsindelingen worden ondersteund.
| Modelleren | Afbeelding: JPEG/JPG, PNG, BMP, TIFF, HEIF |
Office: Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML |
|
|---|---|---|---|
| Lezen | ✔ | ✔ | ✔ |
| Indeling | ✔ | ✔ | ✔ |
| Algemeen document | ✔ | ✔ | |
| Vooraf gebouwd | ✔ | ✔ | |
| Extractie op maat | ✔ | ✔ | |
| Aangepaste classificatie | ✔ | ✔ | ✔ |
- Foto's en scans: geef één duidelijke foto of een hoogwaardige scan per document op voor de beste resultaten.
- PDF's en TIFF's: Voor PDF-bestanden en TIFF's kunnen maximaal 2000 pagina's worden verwerkt. (Met een abonnement op de gratis laag worden alleen de eerste twee pagina's verwerkt.)
- Bestandsgrootte: de bestandsgrootte voor het analyseren van documenten is 500 MB voor de betaalde laag (S0) en 4 MB voor de gratis laag (F0).
- Afbeeldingsafmetingen: De afmetingen moeten tussen 50 pixels x 50 pixels en 10.000 pixels x 10.000 pixels zijn.
- Wachtwoordvergrendelingen: als uw PDF-bestanden zijn vergrendeld met een wachtwoord, moet u de vergrendeling verwijderen voordat u ze inzendt.
- Teksthoogte: de minimale hoogte van de tekst die moet worden geëxtraheerd, is 12 pixels voor een afbeelding van 1024 x 768 pixels. Deze dimensie komt overeen met ongeveer 8-punts tekst bij 150 punten per inch.
- Aangepaste modeltraining: Het maximum aantal pagina's voor trainingsgegevens is 500 voor het aangepaste sjabloonmodel en 50.000 voor het aangepaste neurale model.
- Aangepaste extractiemodeltraining: de totale grootte van trainingsgegevens is 50 MB voor het sjabloonmodel en 1 GB voor het neurale model.
- Training voor aangepast classificatiemodel: de totale grootte van trainingsgegevens is 1 GB met maximaal 10.000 pagina's. Voor 2024-11-30 (GA) is de totale grootte van trainingsgegevens 2 GB met maximaal 10.000 pagina's.
- Office-bestandstypen (DOCX, XLSX, PPTX): de maximale tekenreekslengte is 8 miljoen tekens.
Algemene gegevensextractie van documentmodel
Probeer gegevens uit formulieren en documenten te extraheren met behulp van Document Intelligence Studio.
U hebt de volgende resources nodig:
Een Azure-abonnement: u kunt er gratis een maken.
Een Document Intelligence-exemplaar in Azure Portal. U kunt de gratis prijscategorie (
F0) gebruiken om de service te proberen. Nadat uw resource is geïmplementeerd, selecteert u Ga naar de resource om uw sleutel en eindpunt op te halen.
Notitie
Document Intelligence Studio ondersteunt het algemene document v3.0 en v3.1.
Opmerking: v3.0 wordt op 30 maart 2029 buiten gebruik gesteld. In v4.x wordt de algemene documentmogelijkheid vervangen door het indelingsmodel met features=keyValuePairs.
Selecteer algemene documenten op de startpagina van Document Intelligence Studio.
U kunt het voorbeelddocument analyseren of uw eigen bestanden uploaden.
Selecteer de knop Analyse uitvoeren en configureer indien nodig de opties analyseren:
Sleutel-waardeparen
Sleutel-waardeparen zijn specifieke spanten binnen het document waarmee een label of sleutel en de bijbehorende reactie of waarde worden geïdentificeerd. In een gestructureerd formulier kunnen deze paren het label zijn en de waarde die de gebruiker voor dat veld heeft ingevoerd. In een ongestructureerd document kunnen ze de datum zijn waarop een contract is uitgevoerd op basis van de tekst in een alinea. Het AI-model is getraind om identificeerbare sleutels en waarden te extraheren op basis van een groot aantal documenttypen, indelingen en structuren.
Sleutels kunnen ook geïsoleerd bestaan wanneer het model detecteert dat er een sleutel bestaat, zonder gekoppelde waarde of bij het verwerken van optionele velden. In sommige gevallen kan bijvoorbeeld een veld met een middelste naam leeg blijven in een formulier. Sleutel-waardeparen zijn tekstfragmenten die in het document zijn opgenomen. Voor documenten waarbij dezelfde waarde op verschillende manieren wordt beschreven, bijvoorbeeld klant/gebruiker, is de bijbehorende sleutel klant of gebruiker (op basis van context).
Gegevensextractie
| Model | Tekstextractie | Sleutel-waardeparen | Selectiemarkeringen | Tabellen | Algemene namen |
|---|---|---|---|---|---|
| Algemeen document | ✓ | ✓ | ✓ | ✓ | ✓* |
✓* - Alleen beschikbaar in de API-versies 2023-07-31 (v3.1 GA) en latere versies.
Ondersteunde talen en landinstellingen
Zie onze pagina Taalondersteuning: documentanalysemodellen voor een volledige lijst met ondersteunde talen.
Overwegingen
Omdat sleutels tekstfragmenten zijn die uit het document worden geëxtraheerd, moeten sleutels voor semi-gestructureerde documenten worden gekoppeld aan een bestaande woordenlijst van sleutels.
Je kunt sleutel-waardeparen verwachten waarbij een sleutel wel aanwezig is, maar geen waarde. Als een gebruiker bijvoorbeeld geen e-mailadres opgeeft in het formulier.
Volgende stappen
Volg onze migratiehandleiding voor Document Intelligence v3.1 voor meer informatie over het gebruik van de versie v3.1 in uw toepassingen en werkstromen.
V3.0-workloads migreren naar v4.0 vóór 30 maart 2029. Voor algemene documentextractie in v4.0 gebruikt u
prebuilt-layoutmetfeatures=keyValuePairs. Raadpleeg de Document Intelligence-migratiehandleiding.Verken onze REST API.