Gegevensextractie

Note

Op deze pagina wordt de nieuwe versie van Gegevensextractie beschreven. Zie Information Extraction (verouderd) gebruiken voor meer informatie over de vorige versie

Met gegevensextractie worden ongestructureerde documenten en tekst omgezet in belangrijke, gestructureerde inzichten met behulp van een gedefinieerd schema. Hiermee kunt u gegevens die zijn ingesloten in ongestructureerde tekst, PDF's, afbeeldingen of tabellen rechtstreeks gebruiken voor analyse, rapportage of downstreamagents en toepassingen.

Voorbeelden van gegevensextractie zijn:

  • Juridische partijen en voorwaarden uit contracten extraheren.
  • Regelitems en betalingsvoorwaarden extraheren uit facturen.
  • Belangrijke gegevens ophalen uit medische dossiers en notities.

Gegevensextractie maakt gebruik van standaardopslag om tijdelijke gegevenstransformaties, modelcontrolepunten en interne metagegevens op te slaan die elke agent aandrijven. Wanneer u een agent verwijdert, verwijdert Databricks alle gegevens die zijn gekoppeld aan de agent uit de standaardopslag.

Informatie-extractie is beschikbaar via de Agent Bricks UI en in SQL.

Maak een informatie-extractieagent aan in de gebruikersinterface

Requirements

Ga naar het pictogram Agents.Agents in het linkernavigatiedeelvenster van uw werkruimte. Klik opAgentgegevensextractie>maken.

Stap 1. Selecteer de gegevens waaruit u gegevens wilt extraheren

  1. Selecteer op de pagina Beginnen met uw gegevens de bestanden of gegevens waaruit u gegevens wilt extraheren. U kunt een van de volgende handelingen uitvoeren:

    • Sleep een of meer bestanden naar het uploadgebied of klik om te bladeren naar bestanden die u wilt uploaden.
    • Klik op Volume selecteren om een Unity Catalog-volume met ondersteunde bestandstypen te selecteren.
    • Klik op Tabel selecteren om een Unity Catalog-tabel te selecteren die tekstgegevens bevat.
  2. Als u een tabel selecteert, selecteert u de kolom waaruit de gegevens moeten worden geëxtraheerd. U moet een kolom selecteren met een ondersteund type, zoals STRING of VARIANT, voordat u verder kunt gaan. Als de tabel geen ondersteunde kolommen heeft, selecteert u een andere tabel.

  3. Klik op Agent maken. Deze knop is alleen ingeschakeld nadat u een geldige gegevensbron hebt geselecteerd en, voor een tabel, een ondersteunde kolom.

Stap 2. Uw extractieschema configureren en verfijnen

Nadat gegevensextractie uw gegevens heeft verwerkt, configureert en verfijnt u welke gegevens u uit uw documenten wilt extraheren.

De buildweergave AI Extract met het configuratievenster voor het extractieschema, het geparseerde document en de geëxtraheerde JSON-uitvoer.

  1. Definieer onder Configuratie uw extractieschema. U kunt dit op verschillende manieren doen:

    • Voer natuurlijke taal in waarin de informatie wordt beschreven die u wilt ophalen en klik op Schema genereren. Met gegevensextractie wordt automatisch een JSON-schema gegenereerd met veldnamen en definities voor u. Bewerk deze beschrijvingen indien nodig.
    • U kunt ook op Of, Handmatig definiëren klikken om uw schema handmatig te definiëren:
      1. Klik op Veld toevoegen.
      2. Voer de veldnaam, het type en de beschrijving in.
      3. Klik op Bevestigen.
      4. Herhaal dit voor elk veld dat u wilt extraheren.
      5. Klik op opslaan en voer extractie uit.
    • U kunt ook op JSON klikken om het JSON-schema rechtstreeks te bewerken. Klik op Wijzigingen toepassen wanneer u klaar is.

    Telkens wanneer u het schema bijwerkt en op Opslaan klikt en extractie uitvoert, wordt de extractieagent bijgewerkt, wordt de extractie uitgevoerd en worden de resultaten voor elke invoer weergegeven.

    Om extra opties te configureren, klik op het pictogram Sliders naastOpslaan en extractie uitvoeren, en schakel vervolgens een of meer van de volgende opties in:

    • Precisiemodus: Verbetert de nauwkeurigheid voor genuanceerde velden en lange documenten.
    • Bronvermeldingen: Toont bronreferenties voor geëxtraheerde waarden.
    • Betrouwbaarheidsscores: Toont betrouwbaarheidsniveaus voor geëxtraheerde waarden.
  2. Controleer aan de linkerkant het geparseerde document en de extractie van de agent. Itereer de extractieresultaten op twee manieren. Geef eerst feedback in natuurlijke taal op een of meer invoerwaarden, die uw beschrijvingen automatisch tunesen wanneer u op Opslaan drukt en extractie uitvoert. Ten tweede moet u de schemabeschrijvingen handmatig herzien, die van kracht worden wanneer u op Opslaan drukt en extractie uitvoert.

  3. Gebruik versies om een eerdere configuratie te vergelijken of terug te keren. Klik op Versies en klik vervolgens op Vergelijken om de schemadefinitie van een vorige versie te vergelijken met de huidige versie. Klik op Herstellen om een eerdere versie te herstellen.

Stap 3. Extractiekwaliteit evalueren en verbeteren

Als u wilt meten hoe goed uw agent presteert en deze systematisch wilt verbeteren, evalueert u de agent op basis van een gelabelde gegevensset. Een evaluatie beoordeelt elke extractie op basis van een bekend correct antwoord (grondwaar), zodat u de nauwkeurigheid op veldniveau kunt bijhouden in verschillende versies en de velden kunt targeten die werk nodig hebben.

Een evaluatiegegevensset toevoegen

Voordat u een evaluatie uitvoert, moet u een evaluatiegegevensset in Unity Catalog hebben. De gegevensset moet een Unity Catalog-tabel met twee kolommen zijn:

  • Een invoerkolom met de tekst of het document waaruit moet worden geëxtraheerd. Dit kan STRING tekst zijn of de VARIANT uitvoer van ai_parse_document.
  • Een ground truth-kolom met het verwachte extractieresultaat als JSON-tekenreeks. Elke waarde moet voldoen aan het extractieschema van uw agent, dat overeenkomt met het ai_extract geavanceerde schema.

Een evaluatie uitvoeren

Een evaluatie uitvoeren voor uw extractieagent:

  1. Open in de workbench de vervolgkeuzelijst evaluatie en klik op Evaluatie uitvoeren. Hiermee opent u het dialoogvenster Evaluatieuitvoering maken .
  2. Selecteer in de tabel Evaluatiegegevensset de Unity Catalog-tabel met uw gelabelde voorbeelden.
  3. Selecteer onder Kolomtoewijzing de invoerkolom met de invoer van de agent en de kolom Ground truth die het verwachte antwoord bevat.
  4. Klik op Evaluatie uitvoeren. Gegevensextractie slaat de huidige configuratie op als een nieuwe versie en beoordeelt elke rij tegen de grondwaar.

De evaluatieresultaten beoordelen

Naarmate de uitvoering vordert, worden documenten naar het tabblad Documenten gestreamd en worden eventuele niet-overeenkomende velden per document weergegeven. Wanneer de uitvoering is voltooid, wordt in Informatieextractie het tabblad Overzicht weergegeven, waaronder:

  • Een scorecard met algemene veldnauwkeurigheid en documenten volledig correct. Als er een vorige evaluatieuitvoering bestaat, toont de scorecard de wijziging van die uitvoering.
  • Een tabel met scores per veld . Klik op een willekeurig veld om de drill-down te openen, die accuracy, precision, recall en F1 toont. Klik op Mislukte documenten weergeven om elk document weer te geven dat dat veld en de geëxtraheerde uitvoer niet heeft geëxtraheerd.

Tabblad Evaluatieoverzicht met algemene veldnauwkeurigheid, documenten die volledig correct zijn, Aanbevelingen voor Genie Code en de tabel met scores per veld.

Ga naar het tabblad Documenten om afzonderlijke documenten te controleren. Elke rij toont de verhouding van overeenkomende velden en de velden die niet overeenkomen. Gebruik de vervolgkeuzelijst Velden om te filteren op documenten met een specifiek niet-overeenkomend veld. Klik op een document om het antwoord van de agent te vergelijken met de grondwaar naast elkaar.

Oplossingen voor Genie Code toepassen

Nadat een uitvoering is voltooid, analyseert Gegevensextractie de resultaten en worden problemen in Genie Code-aanbevelingen weergegeven, gerangschikt op het aantal betrokken documenten. Bij elke bevindingen wordt een mogelijk kwaliteitsprobleem beschreven. Klik op Fix with Genie om een interactieve Genie Code-chat te openen die schema- en instructiewijzigingen voorstelt, deze valideert op basis van de betreffende documenten en biedt om een volledige evaluatie opnieuw uit te voeren.

Het paneel Genie Code met voorgestelde schema- en instructiewijzigingen die worden gevalideerd op basis van betrokken documenten.

Stap 4. Uw extractieagent gebruiken

Nadat u tevreden bent met de prestaties van de agent, gebruikt u de agent om informatie te extraheren.

Klik rechtsboven op Agent gebruiken . U kunt een van de volgende opties selecteren:

  • Voer in SQL uit om de agent te gebruiken om informatie uit al uw gegevens te extraheren. Hiermee opent u een SQL-query die wordt gebruikt ai_extract om gegevens uit uw volume of tabel te extraheren met behulp van het gedefinieerde schema. Voor meer informatie over het gebruik van ai_extract in SQL-query's, zie de functie ai_extract.
  • Maak een Lakeflow-pijplijn die volgens geplande intervallen wordt uitgevoerd om uw agent aan te roepen op nieuwe gegevens. Hiermee maakt u een Lakeflow-pijplijn die een streamingtabel bijwerkt met uw geëxtraheerde gegevens. U kunt de planning van de pijplijn zo configureren dat deze wordt uitgevoerd wanneer er nieuwe gegevens binnenkomen. Zie Spark-declaratieve pijplijnen voor meer informatie over Lakeflow-pijplijnen.

Informatie extraheren in SQL

Gebruik ai_extract in SQL om velden op grote schaal te extraheren:

SELECT ai_extract(
  'Invoice #12345 from Acme Corp for $1,250.00 dated 2024-01-15',
  '{
    "invoice_id": {"type": "string", "description": "Unique invoice identifier"},
    "vendor_name": {"type": "string", "description": "Legal business name"},
    "total_amount": {"type": "number", "description": "Total invoice amount"},
    "invoice_date": {"type": "string", "description": "Date in YYYY-MM-DD format"}
  }',
  options => map('version', '2.1')
);

Zie de ai_extract SQL-referentie.

Limitations

  • Agents voor gegevensextractie hebben een maximale contextlengte van 128.000 tokens.
  • Union-schematypen worden niet ondersteund.