Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
A ai.classify função categoriza cada linha de entrada usando os rótulos que fornece.
Observação
- Este artigo aborda
ai.classifycom PySpark. Relativamente ao pandas, consulte Utilizar ai.classify com o pandas. - Para todas as Funções e pré-requisitos de IA, consulte a visão geral das Funções de IA.
- Alterar a configuração padrão das Funções de IA com o PySpark.
Visão geral
A ai.classify função está disponível para Spark DataFrames. Você deve especificar o nome de uma coluna de entrada existente como um parâmetro, juntamente com uma lista de rótulos de classificação.
A função retorna um novo DataFrame com rótulos que correspondem a cada linha de texto de entrada, armazenado em uma coluna de saída.
Sintaxe
df.ai.classify(labels=["category1", "category2", "category3"], input_col="text", output_col="classification")
Parâmetros
| Nome | Description |
|---|---|
labels Obrigatório |
Uma array de strings que representa o conjunto de rótulos de classificação para corresponder aos valores de texto na coluna de entrada. |
input_col Obrigatório |
Uma cadeia de caracteres que contém o nome de uma coluna existente com valores de texto de entrada para classificar de acordo com os rótulos personalizados. |
output_col Opcional |
Uma cadeia de caracteres que contém o nome de uma nova coluna onde você deseja armazenar um rótulo de classificação para cada linha de texto de entrada. Se você não definir esse parâmetro, um nome padrão será gerado para a coluna de saída. |
error_col Opcional |
Uma cadeia de caracteres que contém o nome de uma nova coluna. A nova coluna armazena quaisquer erros OpenAI resultantes do processamento de cada linha de texto de entrada. Se você não definir esse parâmetro, um nome padrão será gerado para a coluna de erro. Se não houver erros para uma linha de entrada, o valor nesta coluna será null. |
Devoluções
A função retorna um Spark DataFrame que inclui uma nova coluna que contém rótulos de classificação que correspondem a cada linha de texto de entrada. Se um valor de texto não puder ser classificado, o rótulo correspondente será null.
Example
# This code uses AI. Always review output for mistakes.
df = spark.createDataFrame([
("This duvet, lovingly hand-crafted from all-natural fabric, is perfect for a good night's sleep.",),
("Tired of friends judging your baking? With these handy-dandy measuring cups, you'll create culinary delights.",),
("Enjoy this *BRAND NEW CAR!* A compact SUV perfect for the professional commuter!",)
], ["descriptions"])
categories = df.ai.classify(labels=["kitchen", "bedroom", "garage", "other"], input_col="descriptions", output_col="categories")
display(categories)
Saída:
Entrada multimodal
Para classificar imagens, PDFs ou ficheiros de texto, defina input_col_type="path". Para configuração, veja Usar entrada multimodal com Funções de IA.
# This code uses AI. Always review output for mistakes.
results = custom_df.ai.classify(
labels=["Master", "PhD", "Bachelor", "Other"],
input_col="file_path",
input_col_type="path",
output_col="highest_degree",
)
display(results)
Conteúdo relacionado
- Use ai.classify com pandas.
- Saiba mais sobre Funções de IA.
- Utilize entrada multimodal com funções de IA.
- Alterar a configuração padrão das Funções de IA com o PySpark.
- Compreender a faturação das funções de IA.