Bemærk
Adgang til denne side kræver godkendelse. Du kan prøve at logge på eller ændre mapper.
Adgang til denne side kræver godkendelse. Du kan prøve at ændre mapper.
Vigtigt!
Denne funktion er i prøveversion.
AI-funktioner anvender énlinjede, LLM-drevne transformationer på store pandaer eller PySpark DataFrames med høj samtidighed som standard. Med multimodal input kan du også behandle billeder, PDF'er og tekstfiler for at klassificere dokumenter, opsummere PDF'er, udtrække information fra billeder og mere.
Brug denne tabel til at springe til multimodale eksempler og detaljeret dokumentation.
| Funktion | Beskrivelse | Detaljeret dokumentation |
|---|---|---|
ai.analyze_sentiment |
Opdag følelser i filer. Eksempel. | pandaer, PySpark |
ai.classify |
Klassificer filer ved at bruge dine etiketter. Eksempel. | pandaer, PySpark |
ai.extract |
Udtræk felter fra filer. Eksempel. | pandaer, PySpark |
ai.fix_grammar |
Korrekt stavning, grammatik og tegnsætning i filer. Eksempel. | pandaer, PySpark |
ai.generate_response |
Generer svar, der er baseret på filindhold. Eksempel. | pandaer, PySpark |
ai.summarize |
Opsummer filindholdet. Eksempel. | pandaer, PySpark |
ai.translate |
Oversæt filindholdet. Eksempel. | pandaer, PySpark |
aifunc.load |
Indlæs filer fra en mappe i en struktureret tabel. Eksempel. | Syntaks og parametre |
aifunc.list_file_paths |
Få filstier fra en mappe. Eksempel. | Syntaks og parametre |
ai.infer_schema |
Udled et ekstraktionsskema ud fra filindholdet. Eksempel. | Syntaks og parametre |
Understøttede filtyper
Multimodale AI-funktioner understøtter følgende filtyper:
- Billeder: jpg, jpeg, png, statisk gif, webp
- Dokumenter: pdf
- Tekstfiler: md, txt, csv, tsv, json, xml, py og andre tekstfiler
Bemærkning
- Multimodale kald med filsti-input fungerer med API'et
responses, som er standarden. Sætapi_typeikke til forchat_completionsfilsti-input. - Office-filformater (såsom .docx, .pptxog .xlsx) understøttes ikke i øjeblikket.
- Du kan konvertere .docx og .pptx filer til PDF og .xlsx filer til CSV, før du bruger dem med multimodale AI-funktioner.
- Hver inputfil er begrænset til 50 MB i størrelse.
Understøttede URL-protokoller
Multimodale input er strenge, der bruger en af disse URL-protokoller:
- Lokale filstier
- http(r)
- WASP'er
- ABF(s)
Forudsætninger
Multimodale AI-funktioner deler de samme forudsætninger som tekstbaserede AI-funktioner. For den fulde liste, se Forudsætninger.
Opsæt dine filer
Organiser dine filer i en mappe, der kan refereres til via en sti eller en glob-lignende streng.
Tips
Brug AI Functions Starter Notebooks til end-to-end AI-funktioner, der bruger alle AI-funktioner. Startnotesbøgerne inkluderer én notesbog til pandaer og én til PySpark.
Eksempel
Du kan gemme filer i et Lakehouse, der er tilknyttet din notesbog.
Indlæs dine filer
For at bruge AI-funktioner med multimodal input kan du enten indlæse filens indhold i en struktureret tabel eller referere til filstierne direkte i din DataFrame. Følgende eksempler viser begge tilgange.
Indlæs filer i en tabel
Brug aifunc.load funktionen til at læse filer fra en mappe og generere en struktureret tabel. Funktionen kan selv udlede tabelstrukturen, eller du kan give en prompt til at guide udtrækningen, eller et skema for konsistent struktur. Denne tilgang er nyttig, når du ønsker, at AI'en skal udtrække specifik information fra filerne og præsentere det i et struktureret format.
df, schema = aifunc.load(folder_path)
# or
df, schema = aifunc.load(folder_path, prompt="Give me candidate's name and the most recent company they worked for.")
display(df)
Indlæs filstier i en kolonne
Alternativt kan du bruge aifunc.list_file_paths den til at hente en liste over filstier fra en mappe og indlæse dem i en DataFrame-kolonne. Denne tilgang er nyttig, når du vil køre AI-funktioner på tværs af hver fil.
Bemærkning
De fleste multimodale funktioner accepterer filstier med column_type="path" i pandas eller input_col_type/col_types="path" i PySpark.
file_path_series = aifunc.list_file_paths(folder_path)
df = pd.DataFrame({"file_path": file_path_series}).reset_index(drop=True)
display(df)
Vigtigt!
Når dine filstier gemmes som streng-URL'er i en DataFrame-kolonne, skal du eksplicit fortælle AI-funktionen, at værdierne skal behandles som filstier i stedet for almindelig tekst.
For serie-niveau AI-funktioner (der kører på en enkelt kolonne), sæt parameteren column_type :
df["result"] = df["file_path"].ai.analyze_sentiment(column_type="path")
For DataFrame-niveau AI-funktioner (der opererer på flere kolonner), brug parameteren column_type_dict :
df["result"] = df.ai.generate_response(
prompt="Describe the content.",
column_type_dict={"file_path": "path"},
)
Bemærkning
Hvis du bruger aifunc.list_file_paths() den til at oprette kolonnen for din filsti, bliver de returnerede yarl.URL objekter automatisk registreret som filstier. Du behøver kun at angive, column_type="path" når din kolonne indeholder almindelige streng-URL'er.
Nye multimodale funktioner
aifunc.load: Indlæs filer i en tabel
Funktionen aifunc.load læser alle filer fra en mappesti og genererer en struktureret tabel ud fra deres indhold. Du kan valgfrit give en prompt til at guide udtrækningen eller et skema for konsistent struktur.
Syntaks
Parametre
| Navn | Beskrivelse |
|---|---|
folder_path (påkrævet) |
En strengsti til en mappe eller en glob-lignende mønstermatchningsfil. |
prompt (valgfrit) |
En streng, der styrer tabelgenereringsprocessen. Brug det til at angive, hvilke felter der skal udpakkes fra filerne. |
schema (valgfrit) |
Et skemaobjekt (returneret af et tidligere load kald), der definerer tabelstrukturen. Når funktionen er angivet, bruger den dette skema direkte. |
Returvarer
En tuple af (DataFrame, schema). DataFrame indeholder de strukturerede data, der er udtrukket fra filerne. Skemaet kan genbruges i efterfølgende load kald for konsistente resultater.
Eksempel
# This code uses AI. Always review output for mistakes.
# Basic load – let the AI infer the table structure
df, schema = aifunc.load(folder_path)
display(df)
# This code uses AI. Always review output for mistakes.
# Guided load – provide a prompt to specify what to extract
guided_df, guided_schema = aifunc.load(
folder_path,
prompt="Give me candidate's name and the most recent company they worked for.",
)
display(guided_df)
aifunc.list_file_paths: Listefiler
Funktionen aifunc.list_file_paths henter alle gyldige filstier fra en specificeret mappe. Du kan bruge de returnerede filstier som input til enhver multimodal AI-funktion. Funktionen understøtter også glob-lignende mønstre.
Syntaks
Parametre
| Navn | Beskrivelse |
|---|---|
folder_path (påkrævet) |
En strengsti til en mappe eller en glob-lignende mønstermatchningsfil. |
Returvarer
En pandas-serie af yarl.URL objekter, indekseret efter deres strengrepræsentationer. Disse yarl.URL objekter behandles automatisk som filstier af AI-funktioner, så du behøver ikke specificere column_type="path".
Eksempel
# This code uses AI. Always review output for mistakes.
file_path_series = aifunc.list_file_paths(folder_path)
custom_df = pd.DataFrame({"file_path": file_path_series}).reset_index(drop=True)
display(custom_df)
ai.infer_schema: Udled skema fra filer
Funktionen ai.infer_schema udleder et fælles skema ud fra filindholdet. Det udledte skema repræsenteres som en liste over aifunc.ExtractLabel objekter, som du kan sende direkte til ai.extract for udtrækning af strukturerede data.
Syntaks
Parametre
| Navn | Beskrivelse |
|---|---|
prompt (valgfrit) |
En streng til at styre skema-inferens. Hvis den ikke er angivet, udleder funktionen skemaet alene ud fra filens indhold. |
n_samples (valgfrit) |
Et heltal, der angiver, hvor mange elementer der skal prøvetages for at inferens. Standard er 3. |
column_type (valgfrit) |
Sæt til "path" at behandle kolonneværdier som filstier. |
Returvarer
En liste over aifunc.ExtractLabel objekter, der beskriver det udledte skema. Du kan sende denne liste til ai.extract for at udtrække strukturerede data fra filer.
Eksempel
# This code uses AI. Always review output for mistakes.
# Infer a schema from file contents
schema = df["file_path"].ai.infer_schema(column_type="path")
for label in schema:
print(label)
# Use the inferred schema with ai.extract
extracted_df = df["file_path"].ai.extract(*schema, column_type="path")
display(extracted_df)
Brug multimodal input med eksisterende AI-funktioner
Følgende eksempler viser, hvordan man bruger multimodal input med hver af de understøttede AI-funktioner.
ai.analyze_sentiment: Opdag følelser fra filer
For fulde parametre, se pandas eller PySpark.
# This code uses AI. Always review output for mistakes.
animal_urls = [
"<image-url-golden-retriever>", # Replace with URL to an image of a golden retriever
"<image-url-giant-panda>", # Replace with URL to an image of a giant panda
"<image-url-bald-eagle>", # Replace with URL to an image of a bald eagle
]
animal_df = pd.DataFrame({"file_path": animal_urls})
animal_df["sentiment"] = animal_df["file_path"].ai.analyze_sentiment(column_type="path")
display(animal_df)
ai.classify: Classify files
For fulde parametre, se pandas eller PySpark.
# This code uses AI. Always review output for mistakes.
custom_df["highest_degree"] = custom_df["file_path"].ai.classify(
"Master", "PhD", "Bachelor", "Other",
column_type="path",
)
display(custom_df)
ai.extract: Udtræk enheder fra filer
For fulde parametre, se pandas eller PySpark.
# This code uses AI. Always review output for mistakes.
extracted = custom_df["file_path"].ai.extract(
aifunc.ExtractLabel(
"name",
description="The full name of the candidate, first letter capitalized.",
max_items=1,
),
"companies_worked_for",
aifunc.ExtractLabel(
"year_of_experience",
description="The total years of professional work experience the candidate has, excluding internships.",
type="integer",
max_items=1,
),
column_type="path",
)
display(extracted)
ai.fix_grammar: Ret grammatik i filer
For fulde parametre, se pandas eller PySpark.
# This code uses AI. Always review output for mistakes.
custom_df["corrections"] = custom_df["file_path"].ai.fix_grammar(column_type="path")
display(custom_df)
ai.generate_response: Anvender brugerdefinerede prompts på filer
For fulde parametre, se pandas eller PySpark.
# This code uses AI. Always review output for mistakes.
# Series-level: generate a response from each file
animal_df["animal_name"] = animal_df["file_path"].ai.generate_response(
prompt="What type of animal is in this image? Give me only the animal's common name.",
column_type="path",
)
display(animal_df)
# This code uses AI. Always review output for mistakes.
# DataFrame-level: use all columns as context
animal_df["description"] = animal_df.ai.generate_response(
prompt="Describe this animal's natural habitat and one interesting fact about it.",
column_type_dict={"file_path": "path"},
)
display(animal_df)
ai.summarize: Summarize files
For fulde parametre, se pandas eller PySpark.
# This code uses AI. Always review output for mistakes.
# Summarize file content from a single column
custom_df["summary"] = custom_df["file_path"].ai.summarize(
instructions="Summarize this file in one sentence for a support analyst.",
column_type="path",
)
display(custom_df)
Du kan opsummere værdier på tværs af alle kolonner i en DataFrame ved at udelade inputkolonnen og angive filsti-kolonner med column_type_dict (pandas) eller col_types (PySpark):
# This code uses AI. Always review output for mistakes.
custom_df["summary"] = custom_df.ai.summarize(
column_type_dict={"file_path": "path"},
)
display(custom_df)
ai.translate: Oversæt filer
For fulde parametre, se pandas eller PySpark.
# This code uses AI. Always review output for mistakes.
custom_df["chinese_version"] = custom_df["file_path"].ai.translate(
"Chinese",
column_type="path",
)
display(custom_df)
Evaluer outputkvalitet
Brug AI Functions Evalueringsnotatbøger til strukturerede arbejdsgange, der bruger LLM-as-a-Judge til at vurdere multimodale output og beregne målinger som nøjagtighed, præcision, genkaldelse, F1, sammenhæng, konsistens og relevans. Du kan bruge disse arbejdsgange til at validere kvaliteten af klassificering, udtrækning, opsummering og andre AI-funktionsresultater, før du går i produktion.
Overvåg omkostninger og kapacitetsforbrug
Brug Billing for AI-funktioner til at forstå omkostninger, køretidsforbrug og kapacitetsovervågning.
Relateret indhold
- Lær mere om AI-funktioner.
- Prøv AI Functions Starter Notebooks.
- Evaluer outputkvaliteten med AI Functions Eval Notebooks.
- Tilpas AI-funktioner med pandaer eller PySpark.
- Forstå fakturering for AI-funktioner.