Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Note
Azure KI-Suche ist über das Azure Portal, REST-APIs und Azure SDKs verfügbar. Es unterstützt auch Foundry IQ, die verwaltete Wissensschicht, die Unternehmensinhalte in wiederverwendbare, berechtigungsfähige Wissensbasen für Agenten im Microsoft Foundry-Portal transformiert.
Die Dokumentextraktionsfähigkeit extrahiert Inhalte aus einer Datei in der Anreicherungspipeline. Standardmäßig ist die Inhaltsextraktion oder der Abruf in die Anreicherungspipeline integriert. Mithilfe der Dokumentextraktionsfähigkeit können Sie jedoch steuern, wie Parameter festgelegt werden und wie extrahierte Inhalte in der Anreicherungsstruktur benannt werden.
Kombinieren Sie für die Vektor- und multimodale Suche die Dokumentextraktion mit der Fähigkeit "Textteilung ", um einen konfigurierbaren Datenabschnittsansatz zu implementieren. Das Multimodale Lernprogramm veranschaulicht dieses Szenario.
Note
Diese Fertigkeit ist nicht an Foundry Tools gebunden und hat keine Schlüsselanforderung für Foundry Tools.
Dieser Skill extrahiert Text und Bilder. Die Textextraktion ist frei. Die Bildextraktion kann von Azure KI-Suche abgerechnet werden. Bei einem kostenlosen Suchdienst werden die Kosten für 20 Transaktionen pro Indexer am Tag übernommen, sodass Sie Schnellstarts, Tutorials und kleine Projekte kostenlos abschließen können. Für einfache und höhere Ebenen kann die Bildextraktion abgerechnet werden.
@odata.type
Microsoft.Skills.Util.DocumentExtractionSkill
Unterstützte Dokumentformate
DocumentExtractionSkill kann Text aus den folgenden Dokumentformaten extrahieren:
- CSV (siehe Indizierung von CSV-Blobs)
- EML
- EPUB
- GZ
- HTML
- JSON (siehe Indizierung von JSON-Blobs)
- KML (XML für geografische Darstellungen)
- Markdown
- Microsoft Office-Formate: DOCX/DOC/DOCM, XLSX/XLS/XLSM, PPTX/PPT/PPTM, MSG (Outlook-E-Mails), XML (WORD XML 2003 und 2006)
- Öffnen von Dokumentformaten: ODT, ODS, ODP
- Textdateien (Siehe auch Indizierung von Nur-Text)
- RTF
- XML
- ZIP
Qualifikationsparameter
Bei Parametern wird zwischen Groß- und Kleinschreibung unterschieden.
| Eingaben | Zulässige Werte | Description |
|---|---|---|
parsingMode |
defaulttextjson |
Wird für default die Dokumentextraktion aus Dateien festgelegt, die nicht reinen Text oder JSON sind. Verwenden Sie für Quelldateien, die Markup enthalten, z. B. PDF, HTML, RTF und Microsoft Office Dateien, den Standard, um Text ohne Markupsprache oder Tags zu extrahieren. Wenn parsingMode sie nicht explizit definiert ist, lautet defaultder Wert .Legen Sie text fest, wenn als Quelldateien TXT-Dateien verwendet werden. Dieser Analysemodus verbessert die Leistung von Nur-Text-Dateien. Wenn Dateien Markup enthalten, behält dieser Modus die Tags in der endgültigen Ausgabe bei.Legen Sie fest, json dass strukturierte Inhalte aus JSON-Dateien extrahiert werden sollen. |
dataToExtract |
contentAndMetadataallMetadata |
Legen Sie diesen Parameter auf contentAndMetadata fest, um aus jeder Datei alle Metadaten und Textinhalte zu extrahieren. Wenn dataToExtract sie nicht explizit definiert ist, lautet contentAndMetadatader Wert .Legen Sie fest allMetadata , dass nur die Metadateneigenschaften für den Inhaltstyp extrahiert werden sollen, z. B. Metadaten, die für PNG-Dateien eindeutig sind. |
configuration |
Siehe unten. | Ein Wörterbuch mit optionalen Parametern zur Anpassung der Durchführung der Dokumentextrahierung. In der folgenden Tabelle finden Sie Beschreibungen der unterstützten Konfigurationseigenschaften. |
| Konfigurationsparameter | Zulässige Werte | Description |
|---|---|---|
imageAction |
nonegenerateNormalizedImagesgenerateNormalizedImagePerPage |
Legen Sie none fest, wenn eingebettete Bilder oder Bilddateien im Dataset ignoriert werden sollen bzw. wenn die Quelldaten keine Bilddateien enthalten. Dieser Wert ist die Standardeinstellung.Legen Sie diesen Parameter für die OCR- und Bildanalyse auf generateNormalizedImages fest, damit der Skill bei der Dokumententschlüsselung ein Array von normalisierten Bildern erstellt. Für diese Aktion ist parsingMode festgelegt default und dataToExtract auf contentAndMetadata. Ein normalisiertes Bild hat eine einheitliche Ausgabe, die angepasst und gedreht wird, um ein konsistentes Rendering in visuellen Suchergebnissen zu fördern. Die Fähigkeit generiert diese Informationen für jedes Bild.Wenn Sie diese Option generateNormalizedImagePerPagefestlegenimageAction, wird jede PDF-Seite als Bild gerendert und normalisiert, anstatt eingebettete Bilder zu extrahieren. Nicht-PDF-Dateitypen werden genauso behandelt, als ob der Parameter auf generateNormalizedImages festgelegt worden wäre. |
normalizedImageMaxWidth |
Eine beliebige ganze Zahl zwischen 50-10000 | Die maximale Breite (in Pixel) für generierte normalisierte Bilder. Der Standardwert ist „2000“. |
normalizedImageMaxHeight |
Eine beliebige ganze Zahl zwischen 50-10000 | Die maximale Höhe (in Pixel) für generierte normalisierte Bilder. Der Standardwert ist „2000“. |
Note
Der Standardwert von 2.000 Pixeln für die maximale Breite und Höhe der normalisierten Bilder basiert auf der maximal unterstützten Größe der OCR-Qualifikation und der Bildanalysequalifikation. Die OCR-Qualifikation unterstützt eine maximale Breite und Höhe von 4.200 für nicht englische Sprachen und 10.000 für Englisch. Wenn Sie die maximalen Grenzwerte erhöhen, können bei größeren Images je nach Skillsetdefinition und Sprache der Dokumente Fehler bei der Verarbeitung auftreten.
Qualifikationseingaben
| Eingabename | Description |
|---|---|
file_data |
Die Datei, aus der Inhalt extrahiert werden soll. |
Die Eingabe „file_data“ muss ein Objekt sein, das wie folgt definiert wurde:
{
"$type": "file",
"data": "BASE64 encoded string of the file"
}
Alternativ kann es wie folgt definiert werden:
{
"$type": "file",
"url": "URL to download file",
"sasToken": "OPTIONAL: SAS token for authentication if the URL provided is for a file in blob storage"
}
Das Dateiverweisobjekt kann auf eine von drei Arten generiert werden:
Indem Sie den
allowSkillsetToReadFileData-Parameters in Ihrer Indexerdefinition auf „true“ festlegen. Dadurch wird der Pfad/document/file_dataerstellt, bei dem es sich um ein Objekt handelt, das die aus der Blobdatenquelle heruntergeladenen ursprünglichen Dateidaten darstellt. Dieser Parameter gilt nur für Dateien im Blobspeicher.allowSkillsetToReadFileDatastellt die heruntergeladenen Dateidaten für die Fähigkeit zur Verfügung. Die Blobindexer-Dateigröße oder extrahierte Inhaltsbeschränkungen werden nicht erhöht.Indem Sie den
imageAction-Parameters in Ihrer Indexerdefinition auf einen anderen Wert alsnonefestlegen. Dadurch wird ein Array von Bildern erstellt, das die erforderliche Konvention für die Eingaben für diese Qualifikation erfüllt, wenn sie einzeln übermittelt werden (d. h./document/normalized_images/*).Indem Sie eine benutzerdefinierte Qualifikation ein JSON-Objekt zurückgeben lassen, das EXAKT wie oben definiert ist. Der
$typeParameter muss genau auffilefestgelegt werden und derdataParameter muss die Base64-codierten Bytearraydaten des Dateiinhalts sein – oder derurlParameter muss eine ordnungsgemäß formatierte URL mit Zugriff sein, um die Datei an diesem Speicherort herunterzuladen.
Skill-Ergebnisse
| Ausgabename | Description |
|---|---|
content |
Der Textinhalt des Dokuments. |
normalized_images |
Wenn imageAction dieser Wert auf einen anderen Wert festgelegt ist als none, enthält das neue normalized_images Feld ein Array von Bildern. Weitere Informationen zum Ausgabeformat finden Sie unter Extrahieren von Text und Informationen aus Bildern. |
Beispieldefinition
{
"@odata.type": "#Microsoft.Skills.Util.DocumentExtractionSkill",
"parsingMode": "default",
"dataToExtract": "contentAndMetadata",
"configuration": {
"imageAction": "generateNormalizedImages",
"normalizedImageMaxWidth": 2000,
"normalizedImageMaxHeight": 2000
},
"context": "/document",
"inputs": [
{
"name": "file_data",
"source": "/document/file_data"
}
],
"outputs": [
{
"name": "content",
"targetName": "extracted_content"
},
{
"name": "normalized_images",
"targetName": "extracted_normalized_images"
}
]
}
Beispieleingabe
{
"values": [
{
"recordId": "1",
"data":
{
"file_data": {
"$type": "file",
"data": "aGVsbG8="
}
}
}
]
}
Beispielausgabe
{
"values": [
{
"recordId": "1",
"data": {
"content": "hello",
"normalized_images": []
}
}
]
}