利用 AI/LLM 從文件欄位中擷取結構化資料。
關於對應的 Databricks SQL 函式,請參見 ai_extract 函數。
語法
from pyspark.sql import functions as dbf
dbf.ai_extract(col=<col>, schema=<schema>, options=<options>)
Parameters
| 參數 | 類型 | Description |
|---|---|---|
col |
pyspark.sql.Column 或 str |
一欄包含可擷取的文件內容。 |
schema |
dict 或 list |
一個 Python dict(欄位名稱到 {"type": ..., "description": ...})或欄位名稱字串的清單。 自動序列化成 JSON 字面值。 |
options |
dict可選的 |
控制擷取行為的選項字典。 |
Returns
pyspark.sql.Column: VariantType 的新欄位,包含擷取的欄位。
Examples
df.select(ai_extract("text", {"name": {"type": "string", "description": "Name"}}))
df.select(ai_extract("text", ["name", "age"]))