Używanie biblioteki ai.classify z biblioteką pandas

Funkcja ai.classify kategoryzuje każdy wiersz wejściowy przy użyciu wprowadzonych etykiet.

Uwaga / Notatka

Przegląd

Funkcja ai.classify rozszerza klasę serii pandas. Aby przypisać etykiety dostarczone przez użytkownika do każdego wiersza wejściowego, wywołaj funkcję w kolumnie tekstowej ramki danych biblioteki pandas.

Funkcja zwraca serię pandas zawierającą etykiety klasyfikacji, które mogą być przechowywane w nowej kolumnie ramki danych.

Wskazówka

Zalecamy użycie funkcji ai.classify z co najmniej dwiema etykietami wejściowymi.

Składnia

df["classification"] = df["input"].ai.classify("category1", "category2", "category3")

Parametry

Name Description
labels
Required
Co najmniej jeden ciąg reprezentujący zestaw etykiet klasyfikacji do dopasowania do wejściowych wartości tekstowych.

Zwraca

Funkcja zwraca serii pandas, która zawiera etykietę klasyfikacji dla każdego wiersza tekstu wejściowego. Jeśli nie można sklasyfikować wartości tekstowej, odpowiednia etykieta jest null.

Example

# This code uses AI. Always review output for mistakes.

df = pd.DataFrame([
        "This duvet, lovingly hand-crafted from all-natural fabric, is perfect for a good night's sleep.",
        "Tired of friends judging your baking? With these handy-dandy measuring cups, you'll create culinary delights.",
        "Enjoy this *BRAND NEW CAR!* A compact SUV perfect for the professional commuter!"
    ], columns=["descriptions"])

df["category"] = df['descriptions'].ai.classify("kitchen", "bedroom", "garage", "other")
display(df)

Output:

Zrzut ekranu przedstawiający ramkę danych z kolumnami

Dane wejściowe wielomodalne

Aby sklasyfikować obrazy, pliki PDF lub pliki tekstowe, ustaw column_type="path" , gdy kolumna wejściowa zawiera ciągi ścieżki pliku. Aby uzyskać informacje o obsługiwanych typach plików i konfiguracji, zobacz Używanie wielomodalnych danych wejściowych z funkcjami sztucznej inteligencji.

# This code uses AI. Always review output for mistakes.

file_path_series = aifunc.list_file_paths("/lakehouse/default/Files")
custom_df = pd.DataFrame({"file_path": file_path_series})

custom_df["highest_degree"] = custom_df["file_path"].ai.classify(
    "Master", "PhD", "Bachelor", "Other",
)
display(custom_df)

Uwaga / Notatka

Podczas korzystania z aifunc.list_file_paths() do tworzenia kolumny ścieżki pliku, zwracane obiekty yarl.URL są automatycznie rozpoznawane jako ścieżki plików. Musisz określić column_type="path" tylko wtedy, gdy kolumna zawiera zwykłe adresy URL jako ciągi znaków.

Możesz również użyć aifunc.load, aby wczytać pliki do ramki danych DataFrame, a następnie sklasyfikować kolumnę ścieżek plików:

# This code uses AI. Always review output for mistakes.

df, schema = aifunc.load("/lakehouse/default/Files")
df["category"] = df["file_path"].ai.classify("Master", "PhD", "Bachelor", "Other")
display(df)

Gdy używasz aifunc.load, kolumna ścieżki pliku zawiera obiekty yarl.URL, które są automatycznie wykrywane. W przypadku zwykłych adresów URL ustaw wartość column_type="path".