Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Het verwerken van ongestructureerde documenten (zoals contracten en werkverklaringen) of gestructureerde documenten (zoals facturen en verzekeringsformulieren) is essentieel voor intelligente IDP-werkstromen (Document Processing) en RAG-scenario's (retrieval-augmented generation). Voor het op schaal extraheren van gegevens is meer nodig dan tekstextractie.
Voor automatisering van hoge kwaliteit moet u vaak weten wat er is geëxtraheerd, waar deze vandaan komt, of deze overeenkomt met uw intentie en hoe betrouwbaar de extractie is.
De meeste ondernemingen ondervinden de volgende uitdagingen bij het afhandelen van verschillende documenten op schaal:
- U moet werkstromen automatiseren, maar alleen wanneer de extractie voldoet aan een drempelwaarde voor nauwkeurigheid die vereist is voor de zakelijke toepassing. U moet weten hoe zeker en nauwkeurig de analyser is in zijn resultaten.
- De bronnen van geëxtraheerde gegevens moeten worden gevalideerd voor echte referentie. Wanneer u lagere dan verwachte betrouwbaarheidsscores ziet, valideert u de resultaten snel door de specifieke locatie in het document te controleren.
- Idealiter zijn manieren nodig om de kwaliteit van de analyseresultaten te verbeteren (door een paar gelabelde voorbeelden op te geven) wanneer er iets misgaat of een nieuwe indeling tegenkomt met lagere dan verwachte betrouwbaarheidsscores.
Azure Content Understanding in Foundry Tools biedt essentiële functies voor het naverwerking van uw geëxtraheerde uitvoer.
| Eigenschap | Purpose | Waarde |
|---|---|---|
| Betrouwbaarheidsscore | Kwantificeert de zekerheid van de analyse in elke voorspelling via betrouwbaarheidsscores. | STP (Straight Through Processing) inschakelen |
| Aarding | Bevat verwijzingen/bronvermeldingen voor elke geëxtraheerde uitvoer naar de oorspronkelijke documentinhoud | Zorgt voor traceerbaarheid, naleving en vertrouwen van gebruikers |
| Gelabelde voorbeelden | Bevat gecorrigeerde voorbeelddocumenten met de analyse van relevante waarden, indelingen, terminologie en domeinconventies. Gelabelde training is beschikbaar in de ALGEMENE beschikbaarheid en preview-API's; geoptimaliseerde training en geen runtime gelabelde gegevens zijn preview-mogelijkheden. | Wordt snel aangepast aan nieuwe indelingen of randcases |
Opmerking
In de 2025-11-01 ALGEMENE beschikbaarheid en 2026-06-01-preview API's zijn betrouwbaarheidsscores en aarding beschikbaar voor alle typen documentvelden (extract, classifyen generate methoden).
Meer informatie over deze functies vindt u hieronder.
Betrouwbaarheidsscore: Automatiseren met beheer
Elk veld kan een betrouwbaarheidsscore tussen 0 en 1 bevatten die aangeeft hoe zeker de analyzer is over het resultaat. Gebruik deze waarde om resultaten met hoge betrouwbaarheid te automatiseren en resultaten met een lage betrouwbaarheid te routeren voor menselijke beoordeling.
Schakel betrouwbaarheidsscores in voor alle velden (of specifieke velden) met behulp van de estimateFieldSourceAndConfidence eigenschap. Meer informatie over het configureren van betrouwbaarheidsscores voor analyses.
Waarom betrouwbaarheidsscores belangrijk zijn
Met betrouwbaarheidsscores kunt u werkstromen ontwerpen, zoals:
- Automatische goedkeuring van extracties wanneer het vertrouwen hoger is dan een gedefinieerde drempelwaarde voor het intelligent automatiseren van documentverwerkingstaken.
- Resourcetoewijzing optimaliseren door operationele kosten te verlagen en de beoordeling door mensen in de lus te gebruiken voor kritieke aspecten.
- Het weigeren of markeren van extracties onder een bepaalde drempelwaarde voor handmatige interventie, waardoor de nauwkeurigheid van besluitvorming wordt verbeterd.
Example
U verwerkt de gescande nutsrekeningen om het factuuradres en het verschuldigde bedrag te extraheren. Voor een document:
- Factuuradres: "1234 Market St., San Francisco, CA" → Betrouwbaarheid: 0,96
- Verschuldigd bedrag: "$ 128,74" → Betrouwbaarheid: 0,52
In dit geval kan uw automatiseringspijplijn het factuuradres rechtstreeks naar uw downstream-toepassing sturen, terwijl het verschuldigde bedrag naar een persoon wordt doorgestuurd voor verificatie. Door betrouwbaarheidsscores te gebruiken, vermindert u handmatige inspanning en behoudt u de nauwkeurigheid.
Verankering: Traceer elk resultaat naar de bron
Met grounding zorgt u ervoor dat elk veld, antwoord of classificatie een verwijzing naar de oorspronkelijke locatie in het document bevat. Dit omvat broninformatie (paginanummer en ruimtelijke coördinaten) en spanten (offset en lengte).
Waarom gronding belangrijk is
In bedrijfswerkstromen is nauwkeurigheid niet voldoende; u hebt ook traceerbaarheid nodig. Wanneer een model een klantnaam of een beëindigingsclausule extraheert, moet u kunnen valideren waar die informatie vandaan komt. Gronding is essentieel voor:
- Behoud van duidelijke traceerbaarheid en lokalisatie voor geëxtraheerde componenten, financiële getallen, tabellen en verzekerings-id's.
- Transparantie met interne nalevingscontroles garanderen.
- Het ondersteunen van efficiënte human-in-the-loop-validatie door de pagina, sectie en inhoud te identificeren die de veldwaarde heeft geleverd.
Example
U wilt de beëindigingsclausule uit een contract extraheren. Het model retourneert:
- Geëxtraheerde tekst: "Beide partijen kunnen deze overeenkomst beëindigen met een kennisgeving van 60 dagen.".
"spans": [
{
"offset": 343,
"length": 102
}
]
-
Bron: pagina 3, coördinaten
({x1},{y1},{x2},{y2},{x3},{y3},{x4},{y4})
Spans geven de logische positie van het element aan met behulp van tekenverschil en lengte. De bron geeft de visuele positie met paginanummer- en begrenzingsvakcoördinaten.
Met deze grondgegevens kan uw juridische team de extractie controleren door rechtstreeks naar de bronalinea in de PDF te springen. Dit elimineert schattingen en bouwt vertrouwen in de uitvoer van de toepassing.
Analysetraining verbeteren met gelabelde voorbeelden
Zowel de 2025-11-01 GA-API als de API ondersteunen het 2026-06-01-preview trainen van aangepaste documentanalyses met gelabelde voorbeelddocumenten. Beide versies gebruiken dezelfde werkstroom voor labelen in Content Understanding Studio.
Important
Training ondersteunt alleen documentanalyses en ondersteunt momenteel geen velden die gebruikmaken van de generate methode.
Als de context voor alle velden duidelijk aanwezig is in het testdocument, kan een zero-shot extractieaanroep voldoende zijn. Volg eerst de aanbevolen procedures voor schemadefinities. Als u nog steeds onjuiste veldwaarden of betrouwbaarheidsscores onder de drempelwaarde voor direct verwerken ziet, gebruikt u gelabelde steekproeven om de analyse te verbeteren.
De gelabelde voorbeelddocumenten bieden de domeincontext. Door veldwaarden in representatieve documenten te corrigeren, toont u de analyse van de relevante indelingen, terminologie, waardepatronen en conventies voor uw scenario.
Gelabelde voorbeelden werken om de extractiekwaliteit te verbeteren:
- Voor gegevenssets met minimale sjabloonvariaties voegt u één gelabeld voorbeeld toe.
- Voor complexere variaties voegt u een representatief voorbeeld toe voor elke sjabloon of indeling.
- Voor documenten die lage betrouwbaarheidsscores genereren, onvolledige extractie of onjuiste waarden.
- Evalueer de extractiekwaliteit voor en na de training om te bevestigen dat de monsters de resultaten verbeteren.
Als u een gelabeld voorbeeld wilt toevoegen, gaat u naar een pagina met documentextractieresultaten in de Foundry-portal en selecteert u het tabblad Labelgegevens . Upload een voorbeeld en selecteer vervolgens Automatisch label. Met automatisch label wordt de bestaande analyse uitgevoerd en worden de resultaten die u kunt bewerken vooraf ingevuld.
Bewerk eventuele onjuiste of ontbrekende veldwaarden. Nadat u het voorbeeld hebt opgeslagen, worden in gecorrigeerde velden de gecorrigeerde tag weergegeven.
Opmerking
U voegt gelabelde voorbeelden toe in Content Understanding Studio. Nadat u voorbeelden hebt toegevoegd, bouwt u de analyse opnieuw, zodat de analyse de voorbeelden kan gebruiken.
Als facturen van een nieuwe leverancier bijvoorbeeld een lage betrouwbaarheidsscore of onjuiste verschuldigde hoeveelheid opleveren, voegt u een representatieve factuur toe en corrigeert u de gelabelde waarden. Het document zelf biedt de context over de indeling en factuurconventies van die leverancier.
De analyse generaliseert vervolgens het patroon om de waarde uit vergelijkbare documentsjablonen te extraheren.
Preview-API-verbeteringen
Important
API-versie 2026-06-01-preview is beschikbaar als openbare preview. Previews worden aangeboden zonder service level agreement en worden niet aanbevolen voor productieworkloads. Zie Aanvullende Gebruiksvoorwaarden voor Microsoft Azure Previews en het Microsoft Gegevensbeschermingsaddendum voor Producten en Diensten ("DPA").
De 2026-06-01-preview API maakt gebruik van dezelfde gelabelde voorbeeldwerkstroom, maar verbetert de wijze waarop de training gebruikmaakt van de documenten. Wanneer u de analyse opnieuw bouwt, worden de relevante patronen en domeincontext afgeleid van de gelabelde steekproeven in de ingebouwde analyse.
De preview-trainingsbenadering:
- Vermindert het tokenverbruik wanneer de analyse wordt uitgevoerd in vergelijking met de GA-trainingsmethode.
- De gelabelde voorbeelddocumenten in de ingebouwde analyse worden niet opgenomen of bewaard.
- Vereist de ingebouwde analyse niet om toegang te krijgen tot de gelabelde voorbeelddocumenten op het moment van analyse.
De gelabelde voorbeelddocumenten blijven alleen voor ontwerpdoeleinden in het opslagaccount dat is gekoppeld aan uw Content Understanding Studio-project. Zie Gegevens, privacy en beveiliging voor Content Understanding voor meer informatie.
Beperkingen
Gelabelde voorbeelden corrigeren geen problemen met tekstherkenning. Als de letter l bijvoorbeeld wordt herkend als het cijfer 1, verbetert het niet de extractiekwaliteit om het als de letter l te labelen.
Een volledige werkstroom
Wanneer u een intelligente pijplijn voor documentautomatisering bouwt, kunt u met deze mogelijkheden gegevens betrouwbaar op schaal extraheren. Als u bijvoorbeeld inkoopcontracten verwerkt, kunt u het volgende extraheren:
- Naam van leverancier
- Begin- en einddatums
- Annuleringsclausule
Kwaliteit en vertrouwen garanderen voor documentbegrip op ondernemingsniveau:
- Grounding biedt uw team volledige traceerbaarheid voor elk veld.
- Betrouwbaarheidsscores helpen u te automatiseren, omdat menselijke beoordeling alleen nodig is wanneer het vertrouwen laag is.
- Gelabelde voorbeelden bieden voorbeelden waarmee de analyse kan worden aangepast aan domeincontext, nieuwe contractsjablonen of edge-cases.