Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
A ai.classify função categoriza cada linha de entrada usando os rótulos fornecidos.
Observação
- Este artigo aborda
ai.classifycom pandas. Para PySpark, consulte Use ai.classify com PySpark. - Para todas as funções de IA e pré-requisitos, consulte a visão geral do AI Functions.
- Alterar a configuração padrão para AI Functions with pandas.
Visão geral
A função ai.classify estende a classe pandas Series. Para atribuir rótulos fornecidos pelo usuário a cada linha de entrada, chame a função em uma coluna de texto de um DataFrame pandas.
A função retorna uma pandas Series que contém rótulos de classificação, que podem ser armazenados em uma nova coluna do DataFrame.
Dica
É recomendável usar a função ai.classify com pelo menos dois rótulos de entrada.
Sintaxe
df["classification"] = df["input"].ai.classify("category1", "category2", "category3")
Parâmetros
| Nome | Description |
|---|---|
labels Obrigatório |
Uma ou mais cadeias de caracteres que representam o conjunto de rótulos de classificação a serem correspondentes aos valores de texto de entrada. |
Devoluções
A função retorna uma pandas Series que contém um rótulo de classificação para cada linha de texto de entrada. Se um valor de texto não puder ser classificado, o rótulo correspondente será null.
Example
# This code uses AI. Always review output for mistakes.
df = pd.DataFrame([
"This duvet, lovingly hand-crafted from all-natural fabric, is perfect for a good night's sleep.",
"Tired of friends judging your baking? With these handy-dandy measuring cups, you'll create culinary delights.",
"Enjoy this *BRAND NEW CAR!* A compact SUV perfect for the professional commuter!"
], columns=["descriptions"])
df["category"] = df['descriptions'].ai.classify("kitchen", "bedroom", "garage", "other")
display(df)
Saída:
Entrada multimodal
Para classificar imagens, PDFs ou arquivos de texto, defina column_type="path" quando a coluna de entrada contém cadeias de caracteres de caminho de arquivo. Para obter tipos de arquivo e configuração com suporte, consulte Usar entrada multimodal com o AI Functions.
# This code uses AI. Always review output for mistakes.
file_path_series = aifunc.list_file_paths("/lakehouse/default/Files")
custom_df = pd.DataFrame({"file_path": file_path_series})
custom_df["highest_degree"] = custom_df["file_path"].ai.classify(
"Master", "PhD", "Bachelor", "Other",
)
display(custom_df)
Observação
Quando você usa aifunc.list_file_paths() para criar sua coluna de caminho de arquivo, os objetos retornados yarl.URL são detectados automaticamente como caminhos de arquivo. Você só precisa especificar column_type="path" quando sua coluna contém URLs de cadeia de caracteres simples.
Você também pode usar aifunc.load para ingerir arquivos em um DataFrame e classificar a coluna de caminho de arquivo:
# This code uses AI. Always review output for mistakes.
df, schema = aifunc.load("/lakehouse/default/Files")
df["category"] = df["file_path"].ai.classify("Master", "PhD", "Bachelor", "Other")
display(df)
Quando você usa aifunc.load, a coluna de caminho de arquivo contém yarl.URL objetos que são detectados automaticamente. Para URLs de cadeia de caracteres simples, defina column_type="path".
Conteúdo relacionado
- Use ai.classify com PySpark.
- Saiba mais sobre o AI Functions.
- Use entrada multimodal com Funções de IA.
- Alterar a configuração padrão para AI Functions with pandas.
- Entenda a cobrança do AI Functions.