Inhoudszoektocht naar Unity Catalog-volumes

Content search bereidt de documenten voor en indexeert deze in een Unity Catalog-volume. Zoekopdrachten en agentvragen worden vervolgens uitgevoerd tegen de index, zodat gebruikers en agenten sneller en nauwkeuriger de meest relevante informatie ophalen. Omdat de index de inhoud van elk bestand omvat, kan een agent specifieke passages over meerdere bestanden gebruiken in plaats van een handvol hele bestanden terug te halen.

Contentsearch is vooral nuttig voor volumes die aan een Genie Agent zijn gekoppeld. Zie Bestanden analyseren in volumes met een Genie Agent.

Important

Deze functie bevindt zich in de bètaversie. Als u deze wilt gebruiken, moet een werkruimtebeheerder Analyze Files in Volumes met Genie Agents inschakelen vanaf de pagina Previews . Zie Azure Databricks previews beheren.

Requirements

Voordat je inhoudszoekopdracht inschakelt voor een Unity Catalog-volume, bevestig je dat je aan de volgende eisen voldoet:

Regionale beschikbaarheid

Contentzoekopdracht is beschikbaar in de regio's die in deze sectie zijn vermeld. Het is niet beschikbaar in regio's die niet vermeld staan. In sommige regio's werkt het alleen als een accountbeheerder cross-Geo verwerking inschakelt, waardoor Azure Databricks je bestanden buiten je werkruimte Geo kan verwerken. Zie Cross-Geo processing inschakelen.

Regio's die geen cross-Geo verwerking vereisen

Contentsearch draait in uw werkruimteregio voor de volgende regio's:

  • Central US
  • East US
  • Oostelijke Verenigde Staten 2
  • France Central
  • Duitsland West Centraal
  • Noord-Centraal VS
  • Zuid-Centraal Verenigde Staten
  • Sweden Central
  • Switzerland North
  • West US
  • Westelijke Verenigde Staten 2
  • Westelijke VS 3

Regio's die cross-Geo verwerking vereisen

Voor de volgende regio's moet een accountbeheerder cross-Geo verwerking inschakelen voordat je content search kunt inschakelen:

  • Australia Central
  • Australia Central 2
  • Australia East
  • Australia Southeast
  • Brazilië - zuid
  • Canada Central
  • Canada East
  • India - centraal
  • East Asia
  • Oost-Japan
  • Japan West
  • Korea Central
  • Mexico Central
  • North Europe
  • Norway East
  • Qatar Central
  • Zuid-Afrika - noord
  • Zuid-India
  • Southeast Asia
  • Switzerland West
  • UAE North
  • UK South
  • UK West
  • West-Centraal VS
  • West Europe
  • West India

Je schakelt inhoudszoekopdracht in en uit vanaf de pagina van het volume in Catalogusverkenner.

Om content search mogelijk te maken:

  1. Klik in uw Azure Databricks werkruimte op Gegevenspictogram.Catalog.
  2. Zoek of blader door het volume dat de bestanden bevat die je wilt indexeren en selecteer het.
  3. Vind je in het tabblad Overzicht de sectie Inhoudszoekopdracht in de rechterzijbalk.
  4. Klik op Inschakelen.

Nadat je content search hebt ingeschakeld, voert Azure Databricks een initiële synchronisatie uit om de ondersteunde bestanden in het volume te parsen en te indexeren. De sectie Content-zoekopdracht op het tabblad Overzicht toont de invoerstatus, het resultaat van de laatste synchronisatie en de tijd waarin het volume is geïndexeerd.

Content search ontleedt en indexeert niet automatisch wijzigingen in je volume, zoals nieuw toegevoegde bestanden of bewerkingen aan bestaande bestanden. Om de zoekopdracht voor inhoud te verversen zodat deze je wijzigingen weerspiegelt, klik je op Nu synchroniseren in de sectie Inhoudszoeken . Je hebt het volume nodig CAN MANAGE om een synchronisatie te activeren.

Om content search uit te schakelen, klik je op Uitschakelen in de sectie Content search . Het uitschakelen van zoekopdrachten in inhoud verwijdert de gegenereerde index en de verwerkte inhoud. Als je het opnieuw inschakelt, indexeert Azure Databricks het volume opnieuw vanaf nul en maak je opnieuw de invoerkosten.

Databricks raadt aan om content search in te schakelen voor de volumes die je aan een Genie Agent koppelt. Zie Bestanden analyseren in volumes met een Genie Agent.

Hoe content search wordt gefactureerd

Content search heeft twee kostencomponenten:

  • Invoer: Wanneer je contentzoekopdracht inschakelt of een synchronisatie uitvoert, gebruikt Azure Databricks de ai_parse_document AI-functie om de bestanden in het volume te parsen voordat de index wordt gebouwd. Databricks factureert deze verwerking onder AI Functions-prijsstelling.
  • Query serving: Lakebase slaat de resulterende indexen op en bedient ze. Databricks factureert rekenkracht en opslag op basis van de rekenunits (CU's) die Lakebase levert. Query serving schaalt van 2 tot 12 CU's op basis van indexgrootte en querygelijktijdigheid. Na drie dagen zonder verkeer schaalt het eindpunt op tot nul en stopt het met het maken van query-serving computekosten. Zie de prijzenpagina van Lakebase voor actuele tarieven.

Wanneer een Genie Agent een geïndexeerd volume zoekt, kan de query ook kosten voor de Genie Agent met zich meebrengen. Zie je: Hoe wordt deze functie gefactureerd?

Limitations

De volgende beperkingen gelden voor het zoeken naar inhoud tijdens de Bèta:

  • Alleen door de Unity Catalog beheerde volumes ondersteunen inhoudszoeken. Externe volumes, My Files-volumes en volumes in catalogi met workspace-bindings worden niet ondersteund. Zie Bestanden opslaan in Mijn bestanden.
  • Je schakelt contentzoekopdrachten in voor een heel volume. Je kunt geen subset van de mappen of bestanden in een volume indexeren.
  • Elke werkruimte kan tot 100 volumes bevatten met contentzoekfunctie ingeschakeld.
  • Elk geïndexeerd volume kan tot 10.000 bestanden bevatten.
  • Content search slaat bestanden groter dan 50 MB over.
  • Inhoudszoekopdracht ondersteunt PDF-, JPG-, JPEG-, PNG-, TIFF-, TIF-, DOCX-, PPT- of PPTX-bestanden. Het slaat alle andere bestandstypen over.
  • Content search is niet beschikbaar op AWS GovCloud, in Azure Government-regio's of in werkruimtes met FedRAMP-compliance.

Aanvullende bronnen

Zie de volgende bronnen voor gerelateerde informatie: