ai_classify

Klassificerar dokumentinnehåll i en av de angivna etiketterna med hjälp av AI/LLM.

För motsvarande Databricks SQL-funktion, se ai_classify funktion.

Syntax

from pyspark.sql import functions as dbf

dbf.ai_classify(col=<col>, labels=<labels>, options=<options>)

Parameters

Parameter Type Description
col pyspark.sql.Column eller str En kolumn som innehåller dokumentinnehållet som ska klassificeras.
labels list, dict, pyspark.sql.Columneller str Antingen en literal etikettuppsättning (Python lista över etikettsträngar eller diktera mappningsetikettnamn till beskrivningar, serialiserade till en JSON-literal automatiskt) eller ett kolumnuttryck vars värde per rad är en JSON-matris med etikettsträngar eller ett JSON-objekt som mappar etikettnamn till beskrivningar.
options dictvalfri En ordlista med alternativ för att kontrollera klassificeringsbeteendet.

Returns

pyspark.sql.Column: En ny kolumn som innehåller klassificeringsresultatet.

Standardbeteendet är klassificering med en etikett. Om du vill aktivera klassificering med flera etiketter och se den fullständiga uppsättningen alternativ som stöds kan du läsa handboken för SQL-språk.

Examples

# Static labels (same set for every row)
df.select(ai_classify("text", ["positive", "negative", "neutral"]))
df.select(ai_classify("text", {"positive": "Happy tone", "negative": "Unhappy tone"}))

# Per-row labels (a column whose value is a JSON array or JSON object string)
df.select(ai_classify("text", col("labels_json")))