Tekoälytoiminnot: Muunna dataa laajassa mittakaavassa LLM:illä

Microsoft Fabric -AI-toiminnot soveltavat yhden rivin LLM-pohjaisia muunnoksia suuriin pandoihin, PySpark-datakehyksiin yhdellä koodirivillädf.ai.<function_name>(). Ne toimivat korkealla rinnakkaisnopeudella tekemällä satoja asynkronisia päättelykutsuja samalla kun pitävät rivitason sisällön eristyksen. Tämä lähestymistapa mahdollistaa datan nopean rikastamisen, luokittelun, tiivistämisen ja tiedon nopean poiminnan rakenteettomasta tekstistä ja asiakirjoista suuressa mittakaavassa.

Käytä tätä taulukkoa siirtyäksesi esimerkkeihin tässä yleiskatsauksessa tai yksityiskohtaiseen panda- ja PySpark-dokumentaatioon.

Toiminto Kuvaus Yksityiskohtainen dokumentaatio
ai.analyze_sentiment Tunnista syötetyn tekstin tunnetila. Esimerkki. pandas, PySpark
ai.classify Luokittele syöteteksti tunnisteidesi mukaan. Esimerkki. pandas, PySpark
ai.embed Luo vektoriupotukset syötetekstille. Esimerkki. pandas, PySpark
ai.extract Poimi kenttiä, kuten sijainteja, nimiä tai mukautettuja entiteettejä. Esimerkki. pandas, PySpark
ai.fix_grammar Oikeinkirjoitus, kielioppi ja välimerkit. Esimerkki. pandas, PySpark
ai.generate_response Luo vastauksia ohjeidesi perusteella. Esimerkki. pandas, PySpark
ai.similarity Vertaa tekstin merkitystä yhteen arvoon tai toiseen sarakkeeseen. Esimerkki. pandas, PySpark
ai.summarize Tiivistäkää teksti, tiedostot tai rivitiedot. Esimerkki. pandas, PySpark
ai.translate Käännä syöteteksti toiselle kielelle. Esimerkki. pandas, PySpark

Voit käyttää tekoälyfunktioita muistikirjoissa, joissa on pandas tai PySpark, SQL-kyselyissä ja Dataflow Gen2:ssa. Fabric hoitaa sisäänrakennetun mallin päätepisteiden asetuksen.

Käytä tekoälyfunktioita Fabric-kokemuksissa

AI-toiminnot ovat saatavilla useissa Fabric-kokemuksissa:

Käytä multimodaalisia tekoälytoimintoja

Multimodaaliset tekoälytoiminnot käsittelevät kuvia, PDF-tiedostoja ja tekstitiedostoja tekstiarvojen lisäksi. Käytä niitä PDF-tiedostojen tiivistämiseen, kuvien luokitteluun, dokumenttikenttien poimimiseen tai tiedostosisältöön perustuvien vastausten luomiseen.

Tuettuja tiedostotyyppejä ovat JPG/JPEG, PNG, staattinen GIF, WebP, PDF, MD, TXT, CSV, TSV, JSON, XML, PY ja muut tekstitiedostot. Sijoittuu column_type="path" pandoihin, tai input_col_typecol_types PySparkiin. Esimerkkejä katso Käytä multimodaalista syötettä tekoälyfunktioiden kanssa.

Prerequisites

Note

  • AI-toimintoja tuetaan Fabric Runtime 1.3 ja uudemmissa versioissa.
  • AI-toiminnot [pandas, PySpark, Dataflow Gen2 ja Datawarehouse SQL] oletuksena gpt-5-mini asetuksena reasoning_effortlow. Tässä mallissa on 400 000 tokenin kontekstiikkuna ja 128 000 tokenin maksimilähtö. Mallin rajoituksia ja nopeuksia varten katso kielimallien taulukko.
  • Tekoälytoiminnot eivät kirjaa tai tallenna käyttäjäkehotteita, syötetietoja tai tuloksia.

Mallit ja palveluntarjoajat

AI-toiminnot käyttävät oletuksena sisäänrakennettua Fabric-päätepistettä. Voit myös konfiguroida pandas ja PySpark AI Functions käyttämään mitä tahansa LLM:ää, joka tukee chat_completions OR responses API:a, mukaan lukien:

  • Azure OpenAI -mallit.
  • Microsoft Foundryn mallit kuten Qwen, Kimi, Grok, LLaMA, Mistral ja monet muut.

Konfiguraatiovaihtoehdot löytyvät katsoista Mukauta tekoälytoimintoja pandoilla ja Räätälöi tekoälytoimintoja PySparkilla.

Aseta tekoälytoiminnot

Tekoälyfunktiot tukevat pandoja Python- ja PySpark-ajonasemissa sekä PySparkia PySpark-ajontimessa. Asenna vain ne paketit, joita ajontime-ohjelmasi tarvitsee.

Asenna riippuvuudet

Suorituksenaikainen Riippuvuudet
pandas (Python-ajonaika) Asenna synapseml_internal ja synapseml_core pyörätiedostot. Asenna openai versio 1.99.5 tai uudempi vain, jos tarvitset SDK-natiiviasiakaskäyttäytymistä tai Pydantic-vastausmuotoisia esimerkkejä.
pandas (Fabric Runtime 2.0, PySpark 4.1 ja Python 3.13) Asenna nest_asyncioväliaikaisesti . Asenna openai versio 1.99.5 tai uudempi vain, jos tarvitset SDK-natiiviasiakaskäyttäytymistä tai Pydantic-vastausmuotoisia esimerkkejä.
pandas (muut PySparkin suoritusajat) Useimpiin käyttötarkoituksiin asennusta ei tarvita. Asenna openai versio 1.99.5 tai uudempi vain, jos tarvitset SDK-natiiviasiakaskäyttäytymistä tai Pydantic-vastausmuotoisia esimerkkejä.
PySpark (PySparkin ajonaika) Asennusta ei tarvita.

Note

  • Asennus nest_asyncio on väliaikainen yhteensopivuuskorjaus pandas AI Functionsille Fabric Runtime 2.0:ssa. Tämä vaatimus poistetaan tulevassa päivityksessä.
  • PySpark AI -toiminnot eivät vaadi lisäasennusvaiheita Fabric Sparkin ajonaikaan.

Fabric Runtime 2.0, joka perustuu Python 3.13:een ja PySpark 4.1:een, ei sisällytä pakettia nest_asyncio natiivisti. Pandas AI Functions -toimintojen käyttö tässä ajonaikaisessa käytössä asenna nest_asyncio ne väliaikaisena yhteensopivuuskorjauksena. Tulevissa päivityksissä tämä vaatimus poistetaan, koska pandas AI Functions voi käyttää uudempaa nest_asyncio2 pakettia, joka on esiasennettu Fabric Runtime 2.0:aan.

# Temporary compatibility patch for Fabric Runtime 2.0.
%pip install -q nest_asyncio 2>/dev/null

# Optional: install openai version 1.99.5 or later for SDK-native client behavior.
%pip install -q openai 2>/dev/null

Tarvittavien kirjastojen tuominen

Tuo AI Functions -kirjasto ajonaikaasi varten.

# Required imports
import synapse.ml.aifunc as aifunc
import pandas as pd

Käytä apufunktioita tiedostoille ja skeemoille

AI-toiminnot sisältävät apuvälineitä multimodaalisiin työnkulkuihin:

  • aifunc.load: Tiedostojen vastaanotto kansiosta jäsenneltyyn taulukkoon. Voit antaa kehotteen tai skeeman.
  • aifunc.list_file_paths: Luettele tiedostojen URL-osoitteet ja polut kansiosta käytettäväksi syötteenä mihin tahansa tekoälyfunktioon.
  • ai.infer_schema: Päätellä tiedoston sisällöstä purkuskeema käytettäväksi yhdessä ai.extract.

Esimerkkejä katso Käytä multimodaalista syötettä tekoälyfunktioiden kanssa.

Sovelta tekoälyfunktioita

Seuraavat esimerkit näyttävät pandojen ja PySparkin ydintoiminnot. PySpark AI -toiminnot toimivat hajautettuina Spark-muunnoksina Fabric Spark -klustereiden välillä.

Note

Useimmat tekoälyfunktiot tukevat tiedostopolkuja column_type="path" pandoissa tai input_col_type/col_types="path" PySparkissa. Esimerkkejä katso Käytä multimodaalista syötettä tekoälyfunktioiden kanssa.

Tip

Oletus Python-malli on gpt-5-mini .reasoning_effort="low" Mallien tai asetusten säätöä varten katso pandas-konfiguraatio tai PySpark-konfiguraatio.

ai.analyze_sentiment: Havaitse tunteet

Funktio ai.analyze_sentiment merkitsee jokaisen syötteen positiiviseksi, negatiiviseksi, sekoitetuksi tai neutraaliksi. Voit myös antaa räätälöityjä tarroja.

# This code uses AI. Always review output for mistakes. 

df = pd.DataFrame([
        "The cleaning spray permanently stained my beautiful kitchen counter. Never again!",
        "I used this sunscreen on my vacation to Florida, and I didn't get burned at all. Would recommend.",
        "I'm torn about this speaker system. The sound was high quality, though it didn't connect to my roommate's phone.",
        "The umbrella is OK, I guess."
    ], columns=["reviews"])

df["sentiment"] = df["reviews"].ai.analyze_sentiment()
display(df)

Kuvakaappaus tietokehyksestä, jossa on arvostelut- ja asennesarakkeet. Asennesarakkeessa on

ai.classify: Luokittele teksti

Funktio ai.classify luokittelee syötetekstin käyttämällä antamiasi tunnisteita.

# This code uses AI. Always review output for mistakes. 

df = pd.DataFrame([
        "This duvet, lovingly hand-crafted from all-natural fabric, is perfect for a good night's sleep.",
        "Tired of friends judging your baking? With these handy-dandy measuring cups, you'll create culinary delights.",
        "Enjoy this *BRAND NEW CAR!* A compact SUV perfect for the professional commuter!"
    ], columns=["descriptions"])

df["category"] = df['descriptions'].ai.classify("kitchen", "bedroom", "garage", "other")
display(df)

Kuvakaappaus tietokehyksestä, jossa on

ai.embed: Generoi vektoriupotuksia

Funktio ai.embed muuntaa tekstin numeerisiksi vektoreiksi, jotka vangitsevat semanttisen merkityksen. Käytä upotuksia samankaltaisuushakuun, hakuun ja koneoppimisen työnkulkuihin.

# This code uses AI. Always review output for mistakes. 

df = pd.DataFrame([
        "This duvet, lovingly hand-crafted from all-natural fabric, is perfect for a good night's sleep.",
        "Tired of friends judging your baking? With these handy-dandy measuring cups, you'll create culinary delights.",
        "Enjoy this *BRAND NEW CAR!* A compact SUV perfect for the professional commuter!"
    ], columns=["descriptions"])
    
df["embed"] = df["descriptions"].ai.embed()
display(df)

Kuvakaappaus datakehyksestä, jossa on sarakkeet 'kuvaukset' ja 'embed'. 'Embed'-sarake sisältää embed-vektorit kuvauksia varten.

ai.extract: Ekstrakti entiteettejä

Funktio ai.extract poimii kenttiä, kuten nimiä, sijainteja tai mukautettuja entiteettejä syötetekstistä.

Rakenteelliset nimitykset

Käytä ExtractLabel silloin, kun tarvitset kirjoitetun poiston. Se tukee JSON-skeeman rakenteita, kuten tyypitetyt kentät, enumit, taulukot, sisäkkäiset objektit, nollattavat arvot, vaaditut ominaisuudet ja additionalProperties=false. Esimerkiksi katso pandas tai PySpark.

# This code uses AI. Always review output for mistakes. 

df = pd.DataFrame([
        "MJ Lee lives in Tucson, AZ, and works as a software engineer for Microsoft.",
        "Kris Turner, a nurse at NYU Langone, is a resident of Jersey City, New Jersey."
    ], columns=["descriptions"])

df_entities = df["descriptions"].ai.extract("name", "profession", "city")
display(df_entities)

Näyttökuva, jossa näkyy uusi tietokehys, jossa on sarakkeet

ai.fix_grammar: Korjaa kielioppi

Toiminto ai.fix_grammar korjaa oikeinkirjoituksen, kieliopin ja välimerkit.

# This code uses AI. Always review output for mistakes. 

df = pd.DataFrame([
        "There are an error here.",
        "She and me go weigh back. We used to hang out every weeks.",
        "The big picture are right, but you're details is all wrong."
    ], columns=["text"])

df["corrections"] = df["text"].ai.fix_grammar()
display(df)

Näyttökuva, jossa näkyy tietokehys, jossa on tekstisarake ja korjaukset-sarake, jossa on tekstisarakkeen teksti korjatulla kieliopilla.

ai.generate_response: Käytä mukautettuja käyttäjäkehotuksia

Funktio ai.generate_response luo mukautettua tekstiä kehotteestasi ja rivitiedoistasi.

Valinnaiset parametrit

Käytä response_format silloin, kun tarvitset jäsenneltyä tulosta, mukaan lukien JSON-objektit, JSON-skeema tai Pydantic-mallit. Esimerkiksi katso pandas tai PySpark.

# This code uses AI. Always review output for mistakes. 

df = pd.DataFrame([
        ("Scarves"),
        ("Snow pants"),
        ("Ski goggles")
    ], columns=["product"])

df["response"] = df.ai.generate_response("Write a short, punchy email subject line for a winter sale.")
display(df)

Näyttökuva, jossa on tietokehys, jossa on sarakkeet

ai.samankaltaisuus: Laske samankaltaisuus

Funktio ai.similarity vertaa kutakin syötearvoa yhteen viitearvoon tai toisen sarakkeen arvoon. Pisteet vaihtelevat vastakkaisesta -1 merkityksestä identtiseen 1 merkitykseen.

# This code uses AI. Always review output for mistakes. 

df = pd.DataFrame([ 
        ("Bill Gates", "Technology"), 
        ("Satya Nadella", "Healthcare"), 
        ("Joan of Arc", "Agriculture") 
    ], columns=["names", "industries"])
    
df["similarity"] = df["names"].ai.similarity(df["industries"])
display(df)

Näyttökuva tietokehyksestä, jossa on sarakkeet

ai.yhteenveto: Tiivistää teksti

Funktio ai.summarize tiivistää tekstin, tiedoston sisällön, yhden sarakkeen tai kaikki sarakkeet jokaisella rivillä.

Tiivistelmien räätälöinti ohjeilla

Käytä instructions äänen, pituuden, yleisön tai fokuksen hallintaan. Esimerkiksi katso pandas tai PySpark.

# This code uses AI. Always review output for mistakes.

df= pd.DataFrame([
        ("Microsoft Teams", "2017",
        """
        The ultimate messaging app for your organization—a workspace for real-time 
        collaboration and communication, meetings, file and app sharing, and even the 
        occasional emoji! All in one place, all in the open, all accessible to everyone.
        """),
        ("Microsoft Fabric", "2023",
        """
        An enterprise-ready, end-to-end analytics platform that unifies data movement, 
        data processing, ingestion, transformation, and report building into a seamless, 
        user-friendly SaaS experience. Transform raw data into actionable insights.
        """)
    ], columns=["product", "release_year", "description"])

df["summaries"] = df["description"].ai.summarize()
display(df)

Näyttökuva, jossa näkyy tietokehys. Yhteenveto-sarakkeessa on yhteenveto vain kuvaussarakkeesta vastaavalla rivillä.

ai.translate: Käännä teksti

Funktio ai.translate kääntää tekstin toiselle kielelle.

# This code uses AI. Always review output for mistakes. 

df = pd.DataFrame([
        "Hello! How are you doing today?", 
        "Tell me what you'd like to know, and I'll do my best to help.", 
        "The only thing we have to fear is fear itself."
    ], columns=["text"])

df["translations"] = df["text"].ai.translate("spanish")
display(df)

Kuvakaappaus tietokehyksestä, jossa on sarakkeet

Chain PySpark AI -toiminnot

PySpark AI -toiminnot palauttavat datakehyksiä, jotka pitävät df.ai käyttäjän sidottuna tulosskeemaan. Ketjumuunnokset ilman välimuotoisten datakehysten materialisointia.

# This code uses AI. Always review output for mistakes.

output = (
    df
    .ai.summarize(input_col="review_text", output_col="summary")
    .ai.classify(
        labels=["service", "cleanliness", "location", "other"],
        input_col="summary",
        output_col="category",
    )
)
display(output)

Katso käyttötilastoja ai.statsilla

Käytä ai.stats tekoälyn tuottamassa sarjassa tai DataFramessa käyttö- ja suoritusmittareiden tarkasteluun.

ai.stats palauttaa DataFramen, jossa on tilastoja kuten:

  • num_successful: Rivien määrä, jotka tekoälyfunktio on käsitellyt onnistuneesti.
  • num_exceptions: Niiden rivien määrä, jotka kohtasivat poikkeuksen suorituksen aikana. Nämä rivit esitetään instansseina .aifunc.ExceptionResult
  • num_unevaluated: Niiden rivien määrä, joita ei käsitelty, koska aiempi poikkeus teki arvioinnin jatkamisen mahdottomaksi. Nämä rivit esitetään instansseina .aifunc.NotEvaluatedResult
  • num_harmful: Azure OpenAI:n sisältösuodattimen estämien rivien määrä. Nämä rivit esitetään instansseina .aifunc.FilterResult
  • cached_tokens: Välimuistissa olevien syötetokenien kokonaismäärä.
  • input_tokens: AI-funktiokutsuun käytettyjen syöttötokenien kokonaismäärä.
  • output_tokens: Mallin tuottamien tulostokenien kokonaismäärä.
  • reasoning_tokens: Päättelymallien käyttämien päättelytokenien kokonaismäärä.
  • model: Mallin käyttöönoton nimi, jota käytetään tekoälyfunktiokutsulle.

Tulos voisi näyttää tältä taulukolta:

num_successful num_exceptions num_unevaluated num_harmful cached_tokens input_tokens output_tokens reasoning_tokens client_type input_types malli
2 0 0 0 0 555 4 0 fabric_llm_endpoint {"text": 2} GPT-5-MINI

Tip

Käytä ai.stats käyttöä, virhekuvioita ja tokenien kulutuksen seuraamista.

Rivit, jotka saavuttavat kapasiteetin rajat, esitetään instansseina .aifunc.CapacityExceededResult Pandas-työnkulkujen avulla aifunc.split_results voit erottaa onnistuneet tulokset tuloksettomista ja tuloksettomat, jotta voit tarkastella kapasiteettirajoitettuja rivejä ja yrittää niitä uudelleen, kun kapasiteetti on saatavilla tai raja on korjattu.

Kustannusten läpinäkyvyys

pandas AI Functions voi näyttää tokenien määrää ja kapasiteettiyksikköarvioita suorituksen aikana .progress_bar_mode="stats" PySparkissa käytä df.ai.stats tulostiedostossa DataFramea.

Fabric Capacity Metrics -sovellus raportoi mallikutsujen kulutuksen AI Functions -toimintona. Lisätietoja löytyy kohdasta AI-toimintojen laskutus.

Arvioi ja kiihdytä

Käytä AI Functions Starter Notebooks -muistikirjoja kokonaisvaltaisiin pandoihin ja PySpark-esimerkkeihin. Käytä AI Functions Eval Notebooks -toimintoja arvioidaksesi tulostuksen laadun ennen tuotantoa.