Innehållsförståelseklassificering och segmentering

Med Content Understanding kan du implementera klassificering och delning som en del av analysåtgärdsbegäran. Du kan utföra innehållsklassificering och extrahering av innehåll som en del av ett enda API-anrop.

Det globala konceptet analyzer innehåller nu begreppet contentCategories och enableSegment för att klassificera och dela indata som du bearbetar i ditt program. Den här analysfunktionen kan utföra klassificering av en indatafil som helhet. Den kan också identifiera flera dokument eller flera instanser av ett enda dokument i en indatafil.

Från och med ga-versionen är dokumentklassificering och videosegmenteringsdesign enhetliga, vilket möjliggör en enhetlig metod för att bearbeta indata oavsett dess modalitet. I dokumentationen refererar "Content Understanding classification" till de analysåtgärder som krävs för att klassificera och dela indata (contentCategories och enableSegment).

Användningsfall för företag

Med Content Understanding-klassificering kan du bearbeta komplexa dokument och videor i olika format och mallar:

  • Fakturor: Kategorisera fakturor från flera leverantörer för att bearbeta varje kategori med en annan Content Understanding-analysator om det behövs.
  • Skattedokument: Kategorisera flera skattedokument i olika typer av skatteformulär, till exempel 1040 och 1099.
  • Kontrakt: Kategorisera långa, ostrukturerade kontrakt för att effektivisera åtgärder för att förstå olika typer av avtal och deras specifika juridiska konsekvenser.
  • Sportvideo: Segmentera automatiskt scenerna för att dela upp videon i logiska segment som annonser och det faktiska sportinnehållet.

Klassificerings-/segmenteringsfunktioner

Content Understanding kan analysera dokument med en eller flera filer för att identifiera om en indatafil kan klassificeras i en definierad kategori. Följande scenarier stöds:

Dokumentscenarier:

  • Klassificera endast: Klassificerar indatafilen som helhet. Till exempel en enda fil som innehåller en dokumenttyp, till exempel ett låneprogramformulär.
  • Klassificera och analysera: Klassificerar och analyserar indatafilen genom att dirigera indata till önskad extraheringsanalys.
  • Klassificera och segmentera: Klassificerar och segmenterar en enda indatafil som kan ha flera typer eller instanser av dokument sammanfogade. Till exempel ett låneprogrampaket som innehåller ett låneformulär, en lönesedel och ett bankutdrag. Ett annat exempel är en samling skannade fakturor i en enda fil.
  • Klassificera, segmentera och analysera: När segmenten har klassificerats dirigerar du varje segment till önskad extraheringsanalys för ytterligare fältextrahering.
  • Hierarkisk klassificerare: Valfri ytterligare analys beroende på kategori kan också vara en klassificerare.

Videoscenarier:

  • Endast segment: Dela upp video i segment baserat på innehållsegenskaper som definierats i description fältet contentCategories. Till exempel att dela upp en sportsändning i spel, reklamfilmer och kommentarssegment.
  • Segmentera och analysera: Dela upp video i segment och dirigera varje segment till en analysator för extrahering av fält.

Anmärkning

Den minsta enheten för klassificering av dokument är en enda sida. Klassificering på intrasidan stöds inte.

Skapa klassificeringskategorier

Content Understanding-klassificering kräver ingen träningsdatauppsättning. Du kan definiera upp till 200 kategorinamn och beskrivningar i analysåtgärden. Som standard behandlas hela filen som ett enda innehållsobjekt, vilket innebär att filen är associerad med en enda kategori.

Från och med GA-versionen måste du inkludera other kategorin i contentCategories för att säkerställa att innehållet kan förbli omatchat för någon av dina definierade kategorier. other Om kategorin inte ingår klassificeras alla filer i någon av dina definierade kategorier. Var och en av de kategorinamn som du definierar inom contentCategories kan också innehålla en description för att ge ytterligare information om den kategori som du definierar.

Delning av indatafil

När du har fler än ett dokument i en fil kan klassificeraren identifiera de olika dokumenttyper som finns i indatafilen med delningsfunktionen. Klassificerarens svar innehåller sidintervallen för var och en av de identifierade dokumenttyperna som finns i en fil. Det här svaret kan innehålla flera instanser av samma dokumenttyp.

Kör du analyze-operationen, inkluderar den en enableSegment egenskap som ger dig detaljerad kontroll över delningsbeteendet. Du kan också ange sidnumren för att endast analysera vissa sidor i indatadokumentet:

  • Om du vill behandla hela indatafilen som flera dokument som kombinerats för klassificering anger du enableSegment till true. När du gör det returnerar tjänsten kategorier för segmenten i indatafilen automatiskt.
  • Om du vill behandla hela indatafilen som ett enda dokument anger du enableSegment till false.

Som standard börjar segmenten vid sidgränser. 2026-06-01-preview API-versionen lägger till segmentering på sidan, som kan dela upp en enda sida i flera segment när den innehåller innehåll från olika dokumenttyper. Segmentering på sidan styrs av ett separat allowInPageSegments fält, så du kan välja delsidesdelningar utan att ändra befintligt enableSegment beteende. Mer information finns i Klassificeringsförbättringar (förhandsversion 2026-06-01).

Anmärkning

För videor stöds endast segmentering. Du måste definiera en enskild contentCategories med enableSegment värdet true. Använd fältet description för att ange kriterier för att dela upp videon i segment.

Valfri analys

För ett fullständigt flöde från slutpunkt till slutpunkt kan du länka klassificerarkategorier med befintliga anpassade analysverktyg och fördefinierade analysverktyg. För varje innehållsobjekt som klassificeras till kategorier med länkade analysverktyg anropar tjänsten automatiskt analys på innehållsobjektet med hjälp av motsvarande analysverktyg.

Du kan till exempel använda den här länken för att skapa klassificerare som identifierar och analyserar endast fakturor från en PDF som innehåller flera typer av formulär. Ange analyzerId till en fördefinierad analysator eller anpassad analysator för att dirigera och utföra fältextrahering från de klassificerade dokumenten eller sidorna.

Du kan också utelämna att ange någon analyzerId kategorisering, men inte utföra någon innehållsanalys på den kategoriserade filen eller segmentet.

På det översta lagret kan du också ange omitContent till att true utelämna det ursprungliga innehållsobjektet och endast returnera innehållsobjekt från analys som utförts på de klassificerade segmenten eller filerna.

Hierarkisk klassificerare

Analysåtgärden stöder hierarkisk delning och klassificering. I basanalysåtgärden anger du analyzerId för varje innehållskategori till en anpassad analysator som utför ytterligare klassificering eller delning. Den här metoden stöder scenarier som fakturor, kontrakt och kvitton, där varje kategori kan analyzerId peka på en annan analysåtgärd som klassificerar olika dokumentundertyper.

Dokumentindata stöder fem nivåer av kapsling och videoindata stöder två.

Klassificeringsförbättringar (förhandsversion 2026-06-01)

I föregående avsnitt beskrivs ga-beteende. I det här avsnittet beskrivs funktioner som endast är förhandsgranskningar som kräver API-version 2026-06-01-preview.

2026-06-01-preview API-versionen innehåller två förbättringar av dokumentklassificering och delning. Om du vill använda de här förbättringarna ska du rikta in dig på förhandsversionen av API:et när du skickar en analysbegäran.

Important

De här funktionerna finns i offentlig förhandsversion. Förhandsgranskningsfunktioner tillhandahålls utan ett serviceavtal och rekommenderas inte för produktionsarbetsbelastningar.

Layoutbaserad funktionsextrahering (förhandsversion)

I API:et 2026-06-01-preview lägger klassificeraren till omfattande klassificeringssignaler som layoutbaserade dokumentfunktioner – avsnittsmarkörer, tabellrubriker, bildbeskrivningar med mera.

Layoutmedveten sampling förbättrar klassificeringsprecisionen i scenarier där det särskiljande innehållet är mycket ostrukturerat eller utspritt på en sida. Ett exempel:

  • Sidor som är glesa i text, till exempel röntgenbilder eller skannade diagnostikrapporter.
  • Figurtunga sidor, där en bildbeskrivning bär det mesta av klassificeringssignalen.
  • Sidor där nyckelavsnittsrubriker eller tabellrubriker visas mitt på sidan.

Ingen konfigurationsändring krävs. När du anropar förhandsversions-API:et använder klassificeraren automatiskt de layoutbaserade funktionerna.

Segmentering på sidan (förhandsversion)

API:et 2026-06-01-preview lägger till segmentering på sidan , vilket kan dela upp en enda sida i flera segment när sidan innehåller innehåll som tillhör olika dokumenttyper.

Segmentering på sidan är användbart för scenarier som:

  • Medicinska journaler där en enda sida blandar innehållstyper, till exempel ett avsnitt om patientdemografi följt av en hänvisningsordning på samma sida.
  • Skattepaket där flera scheman eller formulär staplas på samma sida, till exempel K-1-scheman.
  • Paket med flera formulär där efterföljande formulär inte alltid börjar på en ny sida.

Om du vill aktivera segmentering på sidan anger allowInPageSegments du till true när du skapar eller uppdaterar en anpassad analysator (du kan inte ange det här fältet i en analysbegäran). Svaret från analysatorn innehåller sidintervall per segment, varje segments kategori, en konfidenspoäng och ett källuttryck som identifierar segmentets avgränsningsposition på sidan.

I följande exempel visas matrisen segments i ett analyssvar, där en enda sida delas upp i ett kreditkortssegment och ett identitetskortsegment:

"segments": [
    {
        "span": {
            "offset": 0,
            "length": 301
        },
        "segmentId": "segment1",
        "startPageNumber": 1,
        "endPageNumber": 1,
        "category": "Credit_card",
        "confidence": 0.98,
        "source": "D(1,1.32,1.49,3.13,1.49,3.13,3.86,1.32,3.86)"
    },
    {
        "span": {
            "offset": 301,
            "length": 798
        },
        "segmentId": "segment2",
        "startPageNumber": 1,
        "endPageNumber": 1,
        "category": "Identity_card",
        "confidence": 0.99,
        "source": "D(1,1.16,4.95,3.82,4.95,3.82,8.52,1.16,8.52)"
    }
]
API-fält

Följande API-fält stöder segmentering på sidan:

Fält Type Beskrivning
ContentAnalyzerConfig.allowInPageSegments boolean Ange när du skapar eller uppdaterar en anpassad analysator. När truekan segment täcka en del av en sida i stället för fullständiga sidor.
DocumentContentSegment.segmentId string Stabil identifierare för segmentet, till exempel segment1.
DocumentContentSegment.span Span offset och length segmentet i den överordnade innehållstexten i Markdown-format.
DocumentContentSegment.confidence float32 Värde i [0–1]. Konfidenspoäng för segmentering och kategoriklassificering.
DocumentContentSegment.source SourceExpression Segmenteringens avgränsningsposition på sidan, som ett polygonuttryck i formuläret D(pageNumber, x1, y1, x2, y2, x3, y3, x4, y4). Skicka det här värdet som en range till en underanalysator.

Klassificeringsgränser

Information om dokumentformat och klassificeringsgränser som stöds finns i Tjänstkvoter och gränser.

Metodtips

För att förbättra klassificerings- och delningskvaliteten använder du ett bra kategorinamn och en beskrivning så att modellen kan förstå kategorierna med viss kontext. Mer information om kategorinamn och beskrivningar finns i Metodtips.

Viktiga fördelar

  • Noggrannhet och tillförlitlighet: Säkerställ exakt dokumentklassificering för att minska fel och öka effektiviteten.
  • Skalbarhet: Skala ut dokumentbearbetning för att uppfylla företagets krav.
  • Anpassningsbar: Anpassa dokumentklassificeraren så att den passar specifika arbetsflöden.

Språk och regioner som stöds

En lista över språk och regioner som stöds finns i Språk- och regionstöd.

Datasekretess och säkerhet

Om du använder Content Understanding granskar du Microsofts principer för kunddata. Mer information finns i Data, skydd och sekretess.