Transparantienotitie en gebruiksvoorbeelden voor optische tekenherkenning

Belangrijk

Niet-Engelse vertalingen zijn alleen voor het gemak beschikbaar. Raadpleeg de EN-US versie van dit document voor de definitieve versie.

Dit artikel bevat informatie over use cases voor optische tekenherkenning (OCR).

Wat is een transparantienotitie?

Een AI-systeem omvat niet alleen de technologie, maar ook de mensen die het gebruiken, de personen die worden beïnvloed door het systeem en de omgeving waarin het wordt geïmplementeerd. Voor het maken van een systeem dat geschikt is voor het beoogde doel, moet u begrijpen hoe de technologie werkt, wat de mogelijkheden en beperkingen zijn en hoe u de beste prestaties kunt behalen.

Microsoft biedt transparency notes om u te helpen begrijpen hoe onze AI-technologie werkt. Dit omvat de keuzes die systeemeigenaren kunnen maken die invloed hebben op de prestaties en het gedrag van het systeem, en het belang van het nadenken over het hele systeem, waaronder de technologie, de mensen en de omgeving. U kunt transparantienotities gebruiken bij het ontwikkelen of implementeren van uw eigen systeem, of deze delen met de personen die uw systeem gebruiken of waarop dit van invloed is.

Transparantienotities maken deel uit van een bredere inspanning op Microsoft om onze AI-principes in de praktijk te brengen. Zie de AI-principes van Microsoft voor meer informatie.

Inleiding tot optische tekenherkenning (OCR)

Bedrijven moeten tegenwoordig vaak tekst converteren van afbeeldingen, gescande papieren documenten en digitale bestanden naar bruikbare inzichten. Deze inzichten geven inzicht in kennisanalyse, automatisering van bedrijfsprocessen en toegankelijkheid van inhoud voor iedereen. Optische tekenherkenning (OCR) is een AI-service die wordt gebruikt om tekst te extraheren uit visuele inhoud, zoals afbeeldingen en documenten. OCR ondersteunt momenteel verschillende talen voor het extraheren van afdruktekst (zie ondersteunde OCR-talen). Handgeschreven OCR wordt momenteel exclusief ondersteund voor Engels.

De basisbeginselen van OCR

De OCR-technologie van Microsoft wordt aangeboden via de Azure Vision in Foundry Tools Read-API. Klanten roepen de Lees-API aan met hun inhoud om de geëxtraheerde tekst, de locatie en andere inzichten in machineleesbare tekstuitvoer op te halen. Ze verwerken de uitvoer binnen hun bedrijfstoepassingen om inhoudsinformatie, automatisering van bedrijfsprocessen en andere scenario's voor hun gebruikers te implementeren.

Termijn Definitie
Asynchrone Asynchroon betekent dat de service niet onmiddellijk de geëxtraheerde tekst retourneert. In plaats daarvan wordt het proces op de achtergrond gestart. De klanttoepassing moet later opnieuw inchecken om de geëxtraheerde tekst te verkrijgen.
Lezen De leesbewerking is een asynchrone aanroep die afbeeldingen en documenten accepteert om te beginnen met analyse en tekstextractie, die wordt geretourneerd via een andere aanroep.
Leesresultaten ophalen Tijdens het analyse- en extractieproces geeft de functie 'Resultaten lezen ophalen' de voortgangsstatus weer. Wanneer het proces is voltooid, voert de bewerking Resultaten ophalen de geëxtraheerde tekst (in de vorm van tekstregels en woorden) en betrouwbaarheidswaarden uit.
Betrouwbaarheidswaarde De bewerking Resultaten ophalen retourneert betrouwbaarheidswaarden in het bereik tussen 0 en 1 voor alle geëxtraheerde woorden. Deze waarde vertegenwoordigt de schatting van de service van hoe vaak het woord correct wordt geëxtraheerd uit een reeks van 100. Een woord dat naar schatting correct wordt geëxtraheerd, resulteert bijvoorbeeld in 82% van de tijd in een betrouwbaarheidswaarde van 0,82.

Voorbeelden van gebruikssituaties

De volgende gebruiksvoorbeelden zijn populaire voorbeelden voor de OCR-technologie.

  • Afbeeldingen en documenten zoeken en archiveren: ongestructureerde documenten zoals juridische contracten, technische documenten en nieuwsinhoud bevatten uitgebreide informatie en metagegevens die niet beschikbaar zijn voor processen zoals geautomatiseerd taggen, categoriseren en zoeken. MET OCR kan de tekst uit deze documenten machineleesbaar zijn voor analyse, zoeken en ophalen.
  • Beheer en lokalisatie van afbeeldingsinhoud: e-commercebedrijven, door de gebruiker gegenereerde inhoudsuitgevers en online gaming- en social media-community's moeten afbeeldingen modereren om te voldoen aan de onlineveiligheidsregels. In bepaalde gevallen moeten ze ook inhoud lokaliseren voor internationale doelgroepen. MET OCR kunt u tekst extraheren uit afbeeldingen om downstreamverwerking toe te passen.
  • Automatisering van bedrijfsprocessen: Automatisering van bedrijfsprocessen vereist het integreren van door de gebruiker ingevoerde gegevens en voorkeuren in documenten en toepassingsschermen met complexe bedrijfsprocessen. OCR ontgrendelt de tekst die is ingesloten in documenten en afbeeldingen en maakt deze beschikbaar voor gebruik in de stappen van de zakelijke werkstromen.
  • Verwerking van financiële en gezondheidszorgdocumenten: Bij gebruik in backoffice verwerking van formulieren voor financiële en verzekeringstoepassingen helpt OCR tijd en moeite te besparen bij het verwerken van documenten. Op dezelfde manier versnelt OCR die is toegepast op terugbetalingen van medische claims en medische informatieformulieren de terugbetalingen en kwalificatie voor diensten en voordelen.

Overwegingen bij het kiezen van andere use cases

Houd rekening met de volgende factoren wanneer u een use-case kiest.

  • Houd zorgvuldig rekening met het gebruik voor het toekennen of weigeren van voordelen: Het gebruik van OCR-uitvoer rechtstreeks voor het toekennen of weigeren van voordelen kan leiden tot fouten als deze zijn gebaseerd op onjuiste of onvolledige informatie. Bij het invullen van medische formulieren kunnen gebruikers bijvoorbeeld fouten maken of belangrijke informatie niet opnemen. Daarnaast kan OCR mogelijk onjuist lezen of delen van het formulier niet detecteren. Om eerlijke en hoogwaardige beslissingen voor consumenten te garanderen, combineert u ocr-gebaseerde automatisering met menselijk toezicht.

  • Vermijd het gebruik voor handtekeningidentificatie: wanneer u handgeschreven tekst extraheert, vermijdt u het gebruik van ocr-resultaten op handtekeningen om personen te identificeren. Handtekeningen zijn moeilijk te lezen voor mensen en machines. Een betere manier om OCR te gebruiken is door deze te gebruiken voor het detecteren van de aanwezigheid van een handtekening voor verdere analyse.

  • Gebruik OCR niet voor beslissingen die ernstige nadelige gevolgen kunnen hebben: voorbeelden van dergelijke use cases zijn het verwerken van medische recepten en het dispenseren van medicatie. De machine learning-modellen die tekst extraheren uit recepten, kunnen leiden tot niet-gedetecteerde of onjuiste tekstuitvoer. Beslissingen op basis van onjuiste uitvoer kunnen ernstige nadelige gevolgen hebben. Daarnaast is het raadzaam om menselijke beoordeling van beslissingen op te nemen die het potentieel voor ernstige gevolgen voor individuen hebben.

  • Overwegingen voor juridische en regelgeving: organisaties moeten potentiële specifieke wettelijke en wettelijke verplichtingen evalueren bij het gebruik van Foundry Tools en oplossingen, die mogelijk niet geschikt zijn voor gebruik in elke branche of scenario. Bovendien zijn Foundry Tools of oplossingen niet ontworpen voor en kunnen niet worden gebruikt op manieren die verboden zijn in toepasselijke servicevoorwaarden en relevante gedragscodes.