Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
La ai.classify fonction catégorise chaque ligne d’entrée à l’aide des étiquettes que vous fournissez.
Note
- Cet article porte sur
ai.classifyavec PySpark. Pour pandas, consultez Utiliser ai.classify avec pandas. - Pour toutes les fonctions IA et conditions préalables, consultez la vue d’ensemble d’AI Functions.
- Modifiez la configuration par défaut pour AI Functions avec PySpark.
Aperçu
La ai.classify fonction est disponible pour les DataFrames Spark. Vous devez spécifier le nom d’une colonne d’entrée existante en tant que paramètre, ainsi qu’une liste d’étiquettes de classification.
La fonction retourne un nouveau DataFrame avec des étiquettes qui correspondent à chaque ligne de texte d’entrée, stockée dans une colonne de sortie.
Syntaxe
df.ai.classify(labels=["category1", "category2", "category3"], input_col="text", output_col="classification")
Paramètres
| Nom | Descriptif |
|---|---|
labels Obligatoire |
Tableau de chaînes qui représente l’ensemble d’étiquettes de classification à mettre en correspondance avec les valeurs de texte dans la colonne d’entrée. |
input_col Obligatoire |
Chaîne qui contient le nom d’une colonne existante avec des valeurs de texte d’entrée à classifier en fonction des étiquettes personnalisées. |
output_col Optional |
Chaîne qui contient le nom d’une nouvelle colonne dans laquelle vous souhaitez stocker une étiquette de classification pour chaque ligne de texte d’entrée. Si vous ne définissez pas ce paramètre, un nom par défaut est généré pour la colonne de sortie. |
error_col Optional |
Chaîne qui contient le nom d’une nouvelle colonne. La nouvelle colonne stocke toutes les erreurs OpenAI résultant du traitement de chaque ligne de texte d’entrée. Si vous ne définissez pas ce paramètre, un nom par défaut est généré pour la colonne d’erreur. En l’absence d’erreurs pour une ligne d’entrée, la valeur de cette colonne est null. |
Retours
La fonction retourne un DataFrame Spark qui inclut une nouvelle colonne qui contient des étiquettes de classification qui correspondent à chaque ligne de texte d’entrée. Si une valeur de texte ne peut pas être classifiée, l’étiquette correspondante est null.
Example
# This code uses AI. Always review output for mistakes.
df = spark.createDataFrame([
("This duvet, lovingly hand-crafted from all-natural fabric, is perfect for a good night's sleep.",),
("Tired of friends judging your baking? With these handy-dandy measuring cups, you'll create culinary delights.",),
("Enjoy this *BRAND NEW CAR!* A compact SUV perfect for the professional commuter!",)
], ["descriptions"])
categories = df.ai.classify(labels=["kitchen", "bedroom", "garage", "other"], input_col="descriptions", output_col="categories")
display(categories)
Output:
Entrée multimodale
Pour classifier des images, des fichiers PDF ou texte, définissez input_col_type="path". Pour la configuration, consultez Utiliser l’entrée modale avec AI Functions.
# This code uses AI. Always review output for mistakes.
results = custom_df.ai.classify(
labels=["Master", "PhD", "Bachelor", "Other"],
input_col="file_path",
input_col_type="path",
output_col="highest_degree",
)
display(results)
Contenu connexe
- Utilisez ai.classify avec pandas.
- En savoir plus sur ai Functions.
- Utilisez une entrée modale avec AI Functions.
- Modifiez la configuration par défaut pour AI Functions avec PySpark.
- Comprendre la facturation des fonctions IA.