Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Extraherar strukturerade data från en dokumentkolumn med AI/LLM.
För motsvarande Databricks SQL-funktion, se ai_extract funktion.
Syntax
from pyspark.sql import functions as dbf
dbf.ai_extract(col=<col>, schema=<schema>, options=<options>)
Parameters
| Parameter | Type | Description |
|---|---|---|
col |
pyspark.sql.Column eller str |
En kolumn som innehåller dokumentinnehållet som ska extraheras från. |
schema |
dict eller list |
En Python diktering (fältnamn till {"type": ..., "description": ...}) eller lista över fältnamnssträngar. Serialiserad till en JSON-literal automatiskt. |
options |
dictvalfri |
En ordlista med alternativ för att styra extraheringsbeteendet. |
Returns
pyspark.sql.Column: En ny kolumn i VariantType som innehåller de extraherade fälten.
Examples
df.select(ai_extract("text", {"name": {"type": "string", "description": "Name"}}))
df.select(ai_extract("text", ["name", "age"]))