Brug ai.embed med PySpark

Funktionen ai.embed konverterer tekst til vektorindlejringer, der repræsenterer betydning. Brug embeddings til at søge, gruppere og sammenligne indhold efter betydning i stedet for præcis formulering.

Notat

Oversigt

Funktionen ai.embed er tilgængelig for Spark DataFrames. Du skal angive navnet på en eksisterende inputkolonne som en parameter.

Funktionen returnerer en ny DataFrame, der inkluderer indlejringer for hver række med inputtekst i en outputkolonne.

Syntaks

df.ai.embed(input_col="col1", output_col="embed")

Parametre

Navn Beskrivelse
input_col
Obligatorisk
En streng , der indeholder navnet på en eksisterende kolonne med inputtekstværdier til brug til beregning af embeddings.
output_col
Valgfrit
En streng , der indeholder navnet på en ny kolonne til at gemme beregnede embeddings for hver inputtekstrække. Hvis du ikke angiver denne parameter, genereres der et standardnavn for outputkolonnen.
error_col
Valgfrit
En streng , der indeholder navnet på en ny kolonne, der gemmer eventuelle OpenAI-fejl, der skyldes behandling af hver inputtekstrække. Hvis du ikke angiver denne parameter, genereres der et standardnavn for fejlkolonnen. Hvis der ikke er nogen fejl i en inputrække, har denne kolonne en null værdi.

Returnerer

Funktionen returnerer en Spark DataFrame med en ny kolonne, der indeholder genererede embeddings for hver inputrække. Embeddings er pyspark.ml.linalg.DenseVector værdier. Vektorstørrelsen afhænger af indlejringsmodellens dimensioner, som kan konfigureres i AI-funktioner.

Eksempel

# This code uses AI. Always review output for mistakes. 
# Read terms: https://azure.microsoft.com/support/legal/preview-supplemental-terms/.

df = spark.createDataFrame([
        ("This duvet, lovingly hand-crafted from all-natural fabric, is perfect for a good night's sleep.",), 
        ("Tired of friends judging your baking? With these handy-dandy measuring cups, you'll create culinary delights.",), 
        ("Enjoy this *BRAND NEW CAR!* A compact SUV perfect for the professional commuter!",) 
    ], ["descriptions"])

embed = df.ai.embed(input_col="descriptions", output_col="embed")
display(embed)

Output:

Skærmbillede af en dataframe med kolonnerne 'beskrivelser' og 'indskydning'. Kolonnen 'indlæg' indeholder indlejringer til beskrivelserne.