Muistiinpano
Tämän sivun käyttö edellyttää valtuutusta. Voit yrittää kirjautua sisään tai vaihtaa hakemistoa.
Tämän sivun käyttö edellyttää valtuutusta. Voit yrittää vaihtaa hakemistoa.
Tekoälyfunktiot soveltavat yksirivisiä, LLM-pohjaisia muunnoksia suuriin pandoihin tai PySpark-datakehyksiin, joilla on oletuksena korkea samanaikaisuus. Multimodaalisella syötteellä voit myös käsitellä kuvia, PDF-tiedostoja ja tekstitiedostoja dokumenttien luokitteluun, PDF-tiedostojen tiivistämiseen, tiedon poimimiseen kuvista ja muuhun.
Käytä tätä taulukkoa siirtyäksesi multimodaalisiin esimerkkeihin ja yksityiskohtaiseen dokumentaatioon.
| Toiminto | Description | Yksityiskohtainen dokumentaatio |
|---|---|---|
ai.analyze_sentiment |
Tunnista tunne tiedostoissa. Esimerkki. | pandas, PySpark |
ai.classify |
Luokittele tiedostot käyttämällä nimityksiäsi. Esimerkki. | pandas, PySpark |
ai.extract |
Purkaa kentät tiedostoista. Esimerkki. | pandas, PySpark |
ai.fix_grammar |
Oikea oikeinkirjoitus, kielioppi ja välimerkit tiedostoissa. Esimerkki. | pandas, PySpark |
ai.generate_response |
Luo vastauksia, jotka perustuvat tiedostosisältöön. Esimerkki. | pandas, PySpark |
ai.summarize |
Tiivistäkää tiedoston sisältö. Esimerkki. | pandas, PySpark |
ai.translate |
Käännä tiedostosisältö. Esimerkki. | pandas, PySpark |
aifunc.load |
Lataa tiedostoja kansiosta jäsenneltyyn taulukkoon. Esimerkki. | Syntaksi ja parametrit |
aifunc.list_file_paths |
Hae tiedostopolut kansiosta. Esimerkki. | Syntaksi ja parametrit |
ai.infer_schema |
Päättele purkuskeema tiedoston sisällöstä. Esimerkki. | Syntaksi ja parametrit |
Tuetut tiedostotyypit
Multimodaaliset tekoälytoiminnot tukevat seuraavia tiedostotyyppejä:
- Kuvat: jpg, jpeg, png, staattinen gif, webp
- Asiakirjat: pdf
- Tekstitiedostot: md, txt, csv, tsv, json, xml, py ja muut tekstitiedostot
Muistio
- Multimodaalikutsut, joissa on tiedostopolun syötteet, toimivat API
responses:n kanssa, joka on oletus. Älä asetaapi_typetiedostopolun syötteille tilaachat_completions. - Office-tiedostomuodot (kuten .docx, .pptxja .xlsx) eivät tällä hetkellä ole tuettuja.
- Voit muuntaa .docx- ja .pptx-tiedostot PDF:ksi ja .xlsx tiedostot CSV:ksi ennen kuin käytät niitä multimodaalisten tekoälytoimintojen kanssa.
- Jokainen syöttötiedosto on rajoitettu 50 MB:n kokoon.
Tuetut URL-protokollat
Multimodaaliset syötteet ovat merkkijonoja, jotka käyttävät jotakin seuraavista URL-protokollista:
- Paikalliset tiedostopolut
- http(s)
- wasbs
- ABFS(t)
Edellytykset
Multimodaaliset tekoälytoiminnot jakavat samat edellytykset kuin tekstipohjaiset tekoälytoiminnot. Koko lista löytyy kohdasta Ennakkovaatimukset.
Aseta tiedostosi
Järjestä tiedostosi kansioon, johon voi viitata polun tai glob-tyylisen merkkijonon avulla.
Vinkki
Käytä AI Functions Starter Notebooks -esimerkkejä päästä päähän -AI Functions -esimerkkeihin, jotka käyttävät kaikkia tekoälytoimintoja. Aloitusvihkoihin kuuluu yksi muistikirja pandoille ja yksi muistikirja PySparkille.
Esimerkki
Voit tallentaa tiedostoja Lakehouseen, joka on liitetty muistikirjaasi.
- pandas
- PySpark
folder_path = "/lakehouse/default/Files"
Lataa tiedostosi
Käyttääksesi tekoälyfunktioita multimodaalisella syötteellä, voit joko ladata tiedoston sisällön jäsenneltyyn taulukkoon tai viitata tiedostopolkuihin suoraan DataFramessa. Seuraavat esimerkit osoittavat molemmat lähestymistavat.
Lataa tiedostot taulukkoon
Käytä funktiota aifunc.load tiedostojen lukemiseen kansiosta ja rakenteellisen taulukon luomiseen. Funktio voi päätellä taulukon rakenteen itsenäisesti, tai voit antaa kehotteen poimimisen ohjaamiseksi tai skeeman johdonmukaiselle rakenteelle. Tämä lähestymistapa on hyödyllinen, kun haluat tekoälyn poimivan tiedostoista tiettyä tietoa ja esittävän sen rakenteellisessa muodossa.
- pandas
- PySpark
df, schema = aifunc.load(folder_path)
# or
df, schema = aifunc.load(folder_path, prompt="Give me candidate's name and the most recent company they worked for.")
display(df)
Lataa tiedostopolut sarakkeeseen.
Vaihtoehtoisesti voit aifunc.list_file_paths hakea kansiosta listan tiedostopoluista ja ladata ne DataFrame-sarakkeeseen. Tämä lähestymistapa on hyödyllinen, kun haluat ajaa tekoälyfunktioita jokaisessa tiedostossa.
Muistio
Useimmat multimodaaliset funktiot hyväksyvät tiedostopolut pandas column_type="path" - tai input_col_type/col_types="path" PySpark-tiedostojen kanssa.
- pandas
- PySpark
file_path_series = aifunc.list_file_paths(folder_path)
df = pd.DataFrame({"file_path": file_path_series}).reset_index(drop=True)
display(df)
Tärkeää
Kun tiedostopolut tallennetaan merkkijonon URL-osoitteina DataFrame-sarakkeeseen, sinun täytyy nimenomaisesti kertoa tekoälyfunktiolle, että arvot käsitellään tiedostopolkuina eikä pelkkänä tekstinä.
- pandas
- PySpark
Sarjatason tekoälyfunktioille (jotka toimivat yhdellä sarakkeella) aseta column_type parametri:
df["result"] = df["file_path"].ai.analyze_sentiment(column_type="path")
DataFrame-tason tekoälyfunktioissa (jotka toimivat useilla sarakkeilla) käytä column_type_dict parametria:
df["result"] = df.ai.generate_response(
prompt="Describe the content.",
column_type_dict={"file_path": "path"},
)
Muistio
Jos luot tiedostopolkusarakkeen, aifunc.list_file_paths() palautetut yarl.URL objektit tunnistetaan automaattisesti tiedostopoluiksi. Sinun tarvitsee vain määrittää column_type="path" , milloin sarakkeessasi on pelkiä merkkijono-URL-osoitteita.
Uusia multimodaalisia funktioita
aifunc.load: Lataa tiedostot taulukkoon
Funktio aifunc.load lukee kaikki tiedostot kansiopolulta ja luo jäsennellyn taulukon niiden sisällöstä. Voit halutessasi antaa kehotteen ohjaamaan uutinta tai skeeman johdonmukaisen rakenteen varmistamiseksi.
Syntaksi
- pandas
- PySpark
df, schema = aifunc.load(folder_path, prompt=None, schema=None)
Parametrit
| Nimi | Description |
|---|---|
folder_path (Pakollinen) |
Merkkijonopolku kansioon tai glob-tyyppinen kuvio, joka vastaa tiedostoja. |
prompt (valinnainen) |
Merkkijono, joka ohjaa taulujen generointiprosessia. Käytä sitä määrittämään, mitkä kentät tiedostoista puretaan. |
schema (valinnainen) |
Skeemaobjekti (palautettu edellisellä load kutsulla), joka määrittelee taulurakenteen. Kun funktio on tarjottu, se käyttää tätä skeemaa suoraan. |
Palautukset
Tuple .(DataFrame, schema) DataFrame sisältää tiedostoista poimitun rakenteellisen datan. Skeemaa voidaan käyttää uudelleen myöhemmissä load kutsuissa johdonmukaisten tulosten saavuttamiseksi.
Esimerkki
- pandas
- PySpark
# This code uses AI. Always review output for mistakes.
# Basic load – let the AI infer the table structure
df, schema = aifunc.load(folder_path)
display(df)
# This code uses AI. Always review output for mistakes.
# Guided load – provide a prompt to specify what to extract
guided_df, guided_schema = aifunc.load(
folder_path,
prompt="Give me candidate's name and the most recent company they worked for.",
)
display(guided_df)
aifunc.list_file_paths: Listatiedostot
Funktio aifunc.list_file_paths hakee kaikki kelvolliset tiedostopolut tietystä kansiosta. Voit käyttää palautettuja tiedostopolkuja syötteenä mihin tahansa multimodaaliseen tekoälytoimintoon. Toiminto tukee myös pallomaisia kuvioita.
Syntaksi
- pandas
- PySpark
file_path_series = aifunc.list_file_paths(folder_path)
Parametrit
| Nimi | Description |
|---|---|
folder_path (Pakollinen) |
Merkkijonopolku kansioon tai glob-tyyppinen kuvio, joka vastaa tiedostoja. |
Palautukset
- pandas
- PySpark
Pandas-sarja objektejayarl.URL, jotka on indeksoitu niiden merkkijonoesitysten perusteella. Näitä yarl.URL olioita käsitellään automaattisesti tiedostopolkuina tekoälyfunktioiden toimesta, joten sinun ei tarvitse määrittää column_type="path".
Esimerkki
- pandas
- PySpark
# This code uses AI. Always review output for mistakes.
file_path_series = aifunc.list_file_paths(folder_path)
custom_df = pd.DataFrame({"file_path": file_path_series}).reset_index(drop=True)
display(custom_df)
ai.infer_schema: Päättele skeema tiedostoista
Funktio ai.infer_schema päättelee yhteisen skeeman tiedostojen sisällöstä. Päätelty skeema esitetään objektien listana aifunc.ExtractLabel , joille voi välittää suoraan ai.extract rakenteellista datan poimimista varten.
Syntaksi
- pandas
- PySpark
schema = df["file_path"].ai.infer_schema(column_type="path")
Parametrit
- pandas
- PySpark
| Nimi | Description |
|---|---|
prompt (valinnainen) |
Merkkijono, joka ohjaa skeeman päättelyä. Jos sitä ei tarjota, funktio päättelee skeeman pelkästään tiedoston sisällöstä. |
n_samples (valinnainen) |
Kokonaisluku, joka määrittelee, kuinka monta alkiota näytteistetään päättelyä varten. Oletusarvo on 3. |
column_type (valinnainen) |
Aseta arvo "path" käsittelemään sarakkeiden arvoja tiedostopolkuina. |
Palautukset
Luettelo objekteista aifunc.ExtractLabel , jotka kuvaavat pääteltyä skeemaa. Voit välittää tämän listan ai.extract tiedostoista jäsenneltyä dataa poimimiseen.
Esimerkki
- pandas
- PySpark
# This code uses AI. Always review output for mistakes.
# Infer a schema from file contents
schema = df["file_path"].ai.infer_schema(column_type="path")
for label in schema:
print(label)
# Use the inferred schema with ai.extract
extracted_df = df["file_path"].ai.extract(*schema, column_type="path")
display(extracted_df)
Käytä multimodaalista syötettä olemassa olevien tekoälytoimintojen kanssa
Seuraavat esimerkit osoittavat, miten multimodaalista syötettä käytetään kunkin tuetun tekoälyfunktion kanssa.
ai.analyze_sentiment: Tunnista tunne tiedostoista
Täydelliset parametrit löytyvät pandasista tai PySparkista.
- pandas
- PySpark
# This code uses AI. Always review output for mistakes.
animal_urls = [
"<image-url-golden-retriever>", # Replace with URL to an image of a golden retriever
"<image-url-giant-panda>", # Replace with URL to an image of a giant panda
"<image-url-bald-eagle>", # Replace with URL to an image of a bald eagle
]
animal_df = pd.DataFrame({"file_path": animal_urls})
animal_df["sentiment"] = animal_df["file_path"].ai.analyze_sentiment(column_type="path")
display(animal_df)
ai.classify: Luokittele tiedostoja
Täydelliset parametrit löytyvät pandasista tai PySparkista.
- pandas
- PySpark
# This code uses AI. Always review output for mistakes.
custom_df["highest_degree"] = custom_df["file_path"].ai.classify(
"Master", "PhD", "Bachelor", "Other",
column_type="path",
)
display(custom_df)
ai.extract: Purkaa entiteettejä tiedostoista
Täydelliset parametrit löytyvät pandasista tai PySparkista.
- pandas
- PySpark
# This code uses AI. Always review output for mistakes.
extracted = custom_df["file_path"].ai.extract(
aifunc.ExtractLabel(
"name",
description="The full name of the candidate, first letter capitalized.",
max_items=1,
),
"companies_worked_for",
aifunc.ExtractLabel(
"year_of_experience",
description="The total years of professional work experience the candidate has, excluding internships.",
type="integer",
max_items=1,
),
column_type="path",
)
display(extracted)
ai.fix_grammar: Tiedostojen kieliopin korjaus
Täydelliset parametrit löytyvät pandasista tai PySparkista.
- pandas
- PySpark
# This code uses AI. Always review output for mistakes.
custom_df["corrections"] = custom_df["file_path"].ai.fix_grammar(column_type="path")
display(custom_df)
ai.generate_response: Sovella tiedostoihin mukautettuja kehotuksia
Täydelliset parametrit löytyvät pandasista tai PySparkista.
- pandas
- PySpark
# This code uses AI. Always review output for mistakes.
# Series-level: generate a response from each file
animal_df["animal_name"] = animal_df["file_path"].ai.generate_response(
prompt="What type of animal is in this image? Give me only the animal's common name.",
column_type="path",
)
display(animal_df)
# This code uses AI. Always review output for mistakes.
# DataFrame-level: use all columns as context
animal_df["description"] = animal_df.ai.generate_response(
prompt="Describe this animal's natural habitat and one interesting fact about it.",
column_type_dict={"file_path": "path"},
)
display(animal_df)
ai.summarize: Tiivistele tiedostot
Täydelliset parametrit löytyvät pandasista tai PySparkista.
- pandas
- PySpark
# This code uses AI. Always review output for mistakes.
# Summarize file content from a single column
custom_df["summary"] = custom_df["file_path"].ai.summarize(
instructions="Summarize this file in one sentence for a support analyst.",
column_type="path",
)
display(custom_df)
Voit tiivistää arvot kaikista DataFramen sarakkeista jättämällä syötesarakkeen pois ja määrittämällä tiedostopolun sarakkeet ( column_type_dict pandas) tai col_types (PySpark):
- pandas
- PySpark
# This code uses AI. Always review output for mistakes.
custom_df["summary"] = custom_df.ai.summarize(
column_type_dict={"file_path": "path"},
)
display(custom_df)
ai.translate: Käännä tiedostot
Täydelliset parametrit löytyvät pandasista tai PySparkista.
- pandas
- PySpark
# This code uses AI. Always review output for mistakes.
custom_df["chinese_version"] = custom_df["file_path"].ai.translate(
"Chinese",
column_type="path",
)
display(custom_df)
Arvioi tulostuksen laatua
Käytä AI Functions Eval Notebooks -työkaluja rakenteellisiin työnkulkuihin, joissa LLM-as-a-a Judge -menetelmää voidaan arvioida multimodaalisia tuloksia ja laskea mittareita, kuten tarkkuutta, tarkkuutta, palautusta, F1:tä, johdonmukaisuutta, johdonmukaisuutta ja relevanssia. Voit käyttää näitä työnkulkuja varmistaaksesi luokittelun, poiminta, yhteenvedon ja muiden tekoälytoimintojen tulosten laadun ennen siirtymistä tuotantoon.
Seurata kustannuksia ja kapasiteetin käyttöä
Käytä Billing for AI Functions -toimintoa kustannusten, ajonaikaisen käytön ja kapasiteetin seurannan ymmärtämiseen.
Liittyvä sisältö
- Lue lisää tekoälytoiminnoista.
- Kokeile tekoälytoimintojen aloitusmuistikirjoja.
- Arvioi tulostuksen laatua AI Functions Eval Notebooks -muistikirjoilla.
- Muokkaa tekoälytoimintoja pandoilla tai PySparkilla.
- Ymmärrä tekoälytoimintojen laskutus.