Käytä multimodaalista syötettä tekoälyfunktioiden kanssa (Esikatselu)

Tärkeää

Tämä ominaisuus on esikatselutilassa.

Tekoälyfunktiot soveltavat yksirivisiä, LLM-pohjaisia muunnoksia suuriin pandoihin tai PySpark-datakehyksiin, joilla on oletuksena korkea samanaikaisuus. Multimodaalisella syötteellä voit myös käsitellä kuvia, PDF-tiedostoja ja tekstitiedostoja dokumenttien luokitteluun, PDF-tiedostojen tiivistämiseen, tiedon poimimiseen kuvista ja muuhun.

Käytä tätä taulukkoa siirtyäksesi multimodaalisiin esimerkkeihin ja yksityiskohtaiseen dokumentaatioon.

Toiminto Description Yksityiskohtainen dokumentaatio
ai.analyze_sentiment Tunnista tunne tiedostoissa. Esimerkki. pandas, PySpark
ai.classify Luokittele tiedostot käyttämällä nimityksiäsi. Esimerkki. pandas, PySpark
ai.extract Purkaa kentät tiedostoista. Esimerkki. pandas, PySpark
ai.fix_grammar Oikea oikeinkirjoitus, kielioppi ja välimerkit tiedostoissa. Esimerkki. pandas, PySpark
ai.generate_response Luo vastauksia, jotka perustuvat tiedostosisältöön. Esimerkki. pandas, PySpark
ai.summarize Tiivistäkää tiedoston sisältö. Esimerkki. pandas, PySpark
ai.translate Käännä tiedostosisältö. Esimerkki. pandas, PySpark
aifunc.load Lataa tiedostoja kansiosta jäsenneltyyn taulukkoon. Esimerkki. Syntaksi ja parametrit
aifunc.list_file_paths Hae tiedostopolut kansiosta. Esimerkki. Syntaksi ja parametrit
ai.infer_schema Päättele purkuskeema tiedoston sisällöstä. Esimerkki. Syntaksi ja parametrit

Tuetut tiedostotyypit

Multimodaaliset tekoälytoiminnot tukevat seuraavia tiedostotyyppejä:

  • Kuvat: jpg, jpeg, png, staattinen gif, webp
  • Asiakirjat: pdf
  • Tekstitiedostot: md, txt, csv, tsv, json, xml, py ja muut tekstitiedostot

Muistio

  • Multimodaalikutsut, joissa on tiedostopolun syötteet, toimivat API responses :n kanssa, joka on oletus. Älä aseta api_type tiedostopolun syötteille tilaa chat_completions .
  • Office-tiedostomuodot (kuten .docx, .pptxja .xlsx) eivät tällä hetkellä ole tuettuja.
  • Voit muuntaa .docx- ja .pptx-tiedostot PDF:ksi ja .xlsx tiedostot CSV:ksi ennen kuin käytät niitä multimodaalisten tekoälytoimintojen kanssa.
  • Jokainen syöttötiedosto on rajoitettu 50 MB:n kokoon.

Tuetut URL-protokollat

Multimodaaliset syötteet ovat merkkijonoja, jotka käyttävät jotakin seuraavista URL-protokollista:

  • Paikalliset tiedostopolut
  • http(s)
  • wasbs
  • ABFS(t)

Edellytykset

Multimodaaliset tekoälytoiminnot jakavat samat edellytykset kuin tekstipohjaiset tekoälytoiminnot. Koko lista löytyy kohdasta Ennakkovaatimukset.

Aseta tiedostosi

Järjestä tiedostosi kansioon, johon voi viitata polun tai glob-tyylisen merkkijonon avulla.

Vinkki

Käytä AI Functions Starter Notebooks -esimerkkejä päästä päähän -AI Functions -esimerkkeihin, jotka käyttävät kaikkia tekoälytoimintoja. Aloitusvihkoihin kuuluu yksi muistikirja pandoille ja yksi muistikirja PySparkille.

Esimerkki

Voit tallentaa tiedostoja Lakehouseen, joka on liitetty muistikirjaasi.

folder_path = "/lakehouse/default/Files"

Lataa tiedostosi

Käyttääksesi tekoälyfunktioita multimodaalisella syötteellä, voit joko ladata tiedoston sisällön jäsenneltyyn taulukkoon tai viitata tiedostopolkuihin suoraan DataFramessa. Seuraavat esimerkit osoittavat molemmat lähestymistavat.

Lataa tiedostot taulukkoon

Käytä funktiota aifunc.load tiedostojen lukemiseen kansiosta ja rakenteellisen taulukon luomiseen. Funktio voi päätellä taulukon rakenteen itsenäisesti, tai voit antaa kehotteen poimimisen ohjaamiseksi tai skeeman johdonmukaiselle rakenteelle. Tämä lähestymistapa on hyödyllinen, kun haluat tekoälyn poimivan tiedostoista tiettyä tietoa ja esittävän sen rakenteellisessa muodossa.

df, schema = aifunc.load(folder_path)
# or
df, schema = aifunc.load(folder_path, prompt="Give me candidate's name and the most recent company they worked for.")
display(df)

Lataa tiedostopolut sarakkeeseen.

Vaihtoehtoisesti voit aifunc.list_file_paths hakea kansiosta listan tiedostopoluista ja ladata ne DataFrame-sarakkeeseen. Tämä lähestymistapa on hyödyllinen, kun haluat ajaa tekoälyfunktioita jokaisessa tiedostossa.

Muistio

Useimmat multimodaaliset funktiot hyväksyvät tiedostopolut pandas column_type="path" - tai input_col_type/col_types="path" PySpark-tiedostojen kanssa.

file_path_series = aifunc.list_file_paths(folder_path)
df = pd.DataFrame({"file_path": file_path_series}).reset_index(drop=True)
display(df)

Tärkeää

Kun tiedostopolut tallennetaan merkkijonon URL-osoitteina DataFrame-sarakkeeseen, sinun täytyy nimenomaisesti kertoa tekoälyfunktiolle, että arvot käsitellään tiedostopolkuina eikä pelkkänä tekstinä.

Sarjatason tekoälyfunktioille (jotka toimivat yhdellä sarakkeella) aseta column_type parametri:

df["result"] = df["file_path"].ai.analyze_sentiment(column_type="path")

DataFrame-tason tekoälyfunktioissa (jotka toimivat useilla sarakkeilla) käytä column_type_dict parametria:

df["result"] = df.ai.generate_response(
    prompt="Describe the content.",
    column_type_dict={"file_path": "path"},
)

Muistio

Jos luot tiedostopolkusarakkeen, aifunc.list_file_paths() palautetut yarl.URL objektit tunnistetaan automaattisesti tiedostopoluiksi. Sinun tarvitsee vain määrittää column_type="path" , milloin sarakkeessasi on pelkiä merkkijono-URL-osoitteita.

Uusia multimodaalisia funktioita

aifunc.load: Lataa tiedostot taulukkoon

Funktio aifunc.load lukee kaikki tiedostot kansiopolulta ja luo jäsennellyn taulukon niiden sisällöstä. Voit halutessasi antaa kehotteen ohjaamaan uutinta tai skeeman johdonmukaisen rakenteen varmistamiseksi.

Syntaksi

df, schema = aifunc.load(folder_path, prompt=None, schema=None)

Parametrit

Nimi Description
folder_path (Pakollinen) Merkkijonopolku kansioon tai glob-tyyppinen kuvio, joka vastaa tiedostoja.
prompt (valinnainen) Merkkijono, joka ohjaa taulujen generointiprosessia. Käytä sitä määrittämään, mitkä kentät tiedostoista puretaan.
schema (valinnainen) Skeemaobjekti (palautettu edellisellä load kutsulla), joka määrittelee taulurakenteen. Kun funktio on tarjottu, se käyttää tätä skeemaa suoraan.

Palautukset

Tuple .(DataFrame, schema) DataFrame sisältää tiedostoista poimitun rakenteellisen datan. Skeemaa voidaan käyttää uudelleen myöhemmissä load kutsuissa johdonmukaisten tulosten saavuttamiseksi.

Esimerkki

# This code uses AI. Always review output for mistakes.

# Basic load – let the AI infer the table structure
df, schema = aifunc.load(folder_path)
display(df)
# This code uses AI. Always review output for mistakes.

# Guided load – provide a prompt to specify what to extract
guided_df, guided_schema = aifunc.load(
    folder_path,
    prompt="Give me candidate's name and the most recent company they worked for.",
)
display(guided_df)

aifunc.list_file_paths: Listatiedostot

Funktio aifunc.list_file_paths hakee kaikki kelvolliset tiedostopolut tietystä kansiosta. Voit käyttää palautettuja tiedostopolkuja syötteenä mihin tahansa multimodaaliseen tekoälytoimintoon. Toiminto tukee myös pallomaisia kuvioita.

Syntaksi

file_path_series = aifunc.list_file_paths(folder_path)

Parametrit

Nimi Description
folder_path (Pakollinen) Merkkijonopolku kansioon tai glob-tyyppinen kuvio, joka vastaa tiedostoja.

Palautukset

Pandas-sarja objektejayarl.URL, jotka on indeksoitu niiden merkkijonoesitysten perusteella. Näitä yarl.URL olioita käsitellään automaattisesti tiedostopolkuina tekoälyfunktioiden toimesta, joten sinun ei tarvitse määrittää column_type="path".

Esimerkki

# This code uses AI. Always review output for mistakes.

file_path_series = aifunc.list_file_paths(folder_path)
custom_df = pd.DataFrame({"file_path": file_path_series}).reset_index(drop=True)
display(custom_df)

ai.infer_schema: Päättele skeema tiedostoista

Funktio ai.infer_schema päättelee yhteisen skeeman tiedostojen sisällöstä. Päätelty skeema esitetään objektien listana aifunc.ExtractLabel , joille voi välittää suoraan ai.extract rakenteellista datan poimimista varten.

Syntaksi

schema = df["file_path"].ai.infer_schema(column_type="path")

Parametrit

Nimi Description
prompt (valinnainen) Merkkijono, joka ohjaa skeeman päättelyä. Jos sitä ei tarjota, funktio päättelee skeeman pelkästään tiedoston sisällöstä.
n_samples (valinnainen) Kokonaisluku, joka määrittelee, kuinka monta alkiota näytteistetään päättelyä varten. Oletusarvo on 3.
column_type (valinnainen) Aseta arvo "path" käsittelemään sarakkeiden arvoja tiedostopolkuina.

Palautukset

Luettelo objekteista aifunc.ExtractLabel , jotka kuvaavat pääteltyä skeemaa. Voit välittää tämän listan ai.extract tiedostoista jäsenneltyä dataa poimimiseen.

Esimerkki

# This code uses AI. Always review output for mistakes.

# Infer a schema from file contents
schema = df["file_path"].ai.infer_schema(column_type="path")
for label in schema:
    print(label)

# Use the inferred schema with ai.extract
extracted_df = df["file_path"].ai.extract(*schema, column_type="path")
display(extracted_df)

Käytä multimodaalista syötettä olemassa olevien tekoälytoimintojen kanssa

Seuraavat esimerkit osoittavat, miten multimodaalista syötettä käytetään kunkin tuetun tekoälyfunktion kanssa.

ai.analyze_sentiment: Tunnista tunne tiedostoista

Täydelliset parametrit löytyvät pandasista tai PySparkista.

# This code uses AI. Always review output for mistakes.

animal_urls = [
    "<image-url-golden-retriever>",  # Replace with URL to an image of a golden retriever
    "<image-url-giant-panda>",  # Replace with URL to an image of a giant panda
    "<image-url-bald-eagle>",  # Replace with URL to an image of a bald eagle
]
animal_df = pd.DataFrame({"file_path": animal_urls})

animal_df["sentiment"] = animal_df["file_path"].ai.analyze_sentiment(column_type="path")
display(animal_df)

ai.classify: Luokittele tiedostoja

Täydelliset parametrit löytyvät pandasista tai PySparkista.

# This code uses AI. Always review output for mistakes.

custom_df["highest_degree"] = custom_df["file_path"].ai.classify(
    "Master", "PhD", "Bachelor", "Other",
    column_type="path",
)
display(custom_df)

ai.extract: Purkaa entiteettejä tiedostoista

Täydelliset parametrit löytyvät pandasista tai PySparkista.

# This code uses AI. Always review output for mistakes.

extracted = custom_df["file_path"].ai.extract(
    aifunc.ExtractLabel(
        "name",
        description="The full name of the candidate, first letter capitalized.",
        max_items=1,
    ),
    "companies_worked_for",
    aifunc.ExtractLabel(
        "year_of_experience",
        description="The total years of professional work experience the candidate has, excluding internships.",
        type="integer",
        max_items=1,
    ),
    column_type="path",
)
display(extracted)

ai.fix_grammar: Tiedostojen kieliopin korjaus

Täydelliset parametrit löytyvät pandasista tai PySparkista.

# This code uses AI. Always review output for mistakes.

custom_df["corrections"] = custom_df["file_path"].ai.fix_grammar(column_type="path")
display(custom_df)

ai.generate_response: Sovella tiedostoihin mukautettuja kehotuksia

Täydelliset parametrit löytyvät pandasista tai PySparkista.

# This code uses AI. Always review output for mistakes.

# Series-level: generate a response from each file
animal_df["animal_name"] = animal_df["file_path"].ai.generate_response(
    prompt="What type of animal is in this image? Give me only the animal's common name.",
    column_type="path",
)
display(animal_df)
# This code uses AI. Always review output for mistakes.

# DataFrame-level: use all columns as context
animal_df["description"] = animal_df.ai.generate_response(
    prompt="Describe this animal's natural habitat and one interesting fact about it.",
    column_type_dict={"file_path": "path"},
)
display(animal_df)

ai.summarize: Tiivistele tiedostot

Täydelliset parametrit löytyvät pandasista tai PySparkista.

# This code uses AI. Always review output for mistakes.

# Summarize file content from a single column
custom_df["summary"] = custom_df["file_path"].ai.summarize(
    instructions="Summarize this file in one sentence for a support analyst.",
    column_type="path",
)
display(custom_df)

Voit tiivistää arvot kaikista DataFramen sarakkeista jättämällä syötesarakkeen pois ja määrittämällä tiedostopolun sarakkeet ( column_type_dict pandas) tai col_types (PySpark):

# This code uses AI. Always review output for mistakes.

custom_df["summary"] = custom_df.ai.summarize(
    column_type_dict={"file_path": "path"},
)
display(custom_df)

ai.translate: Käännä tiedostot

Täydelliset parametrit löytyvät pandasista tai PySparkista.

# This code uses AI. Always review output for mistakes.

custom_df["chinese_version"] = custom_df["file_path"].ai.translate(
    "Chinese",
    column_type="path",
)
display(custom_df)

Arvioi tulostuksen laatua

Käytä AI Functions Eval Notebooks -työkaluja rakenteellisiin työnkulkuihin, joissa LLM-as-a-a Judge -menetelmää voidaan arvioida multimodaalisia tuloksia ja laskea mittareita, kuten tarkkuutta, tarkkuutta, palautusta, F1:tä, johdonmukaisuutta, johdonmukaisuutta ja relevanssia. Voit käyttää näitä työnkulkuja varmistaaksesi luokittelun, poiminta, yhteenvedon ja muiden tekoälytoimintojen tulosten laadun ennen siirtymistä tuotantoon.

Seurata kustannuksia ja kapasiteetin käyttöä

Käytä Billing for AI Functions -toimintoa kustannusten, ajonaikaisen käytön ja kapasiteetin seurannan ymmärtämiseen.