pandas で ai.embed を使用する

ai.embed関数は、テキストを意味を表すベクター埋め込み関数に変換します。 埋め込みを使用して、正確な表現ではなく、意味によってコンテンツを検索、グループ化、比較します。

  • この記事では、pandas の ai.embed について説明します。 PySpark については、「 PySpark で ai.embed を使用する」を参照してください。
  • すべての AI 関数と前提条件については、 AI Functions の概要に関するページを参照してください。
  • Pandas を使用して AI Functions の既定の構成を変更します。

概要

ai.embed 関数は、pandas Series クラスを拡張します。

各入力行のベクター埋め込みを生成するには、 pandas Series または pandas DataFrame のテキスト列で関数を呼び出します。

この関数は、新しい DataFrame 列に格納できる埋め込みを含む pandas Series を返します。

構文

df["embed"] = df["col1"].ai.embed()

パラメーター

なし。

返品ポリシー

この関数は、各入力行に対する埋め込みを float32 値から成る NumPy 配列として含む pandas Series を返します。 配列のサイズは、 AI Functions で構成可能な埋め込みモデルのディメンションによって異なります。

Example

# This code uses AI. Always review output for mistakes.

df = pd.DataFrame([
        "This duvet, lovingly hand-crafted from all-natural fabric, is perfect for a good night's sleep.",
        "Tired of friends judging your baking? With these handy-dandy measuring cups, you'll create culinary delights.",
        "Enjoy this *BRAND NEW CAR!* A compact SUV perfect for the professional commuter!"
    ], columns=["descriptions"])
    
df["embed"] = df["descriptions"].ai.embed()
display(df)

Output: