Bemærk
Adgang til denne side kræver godkendelse. Du kan prøve at logge på eller ændre mapper.
Adgang til denne side kræver godkendelse. Du kan prøve at ændre mapper.
Funktionen ai.summarize opsummerer tekst fra én kolonne eller på tværs af alle kolonner i hver række.
Notat
- Denne artikel handler
ai.summarizeom PySpark. For pandaer, se Brug ai.summarize med pandaer. - For alle AI-funktioner og forudsætninger, se AI Functions oversigt.
- Ændr standardkonfigurationen for AI-funktioner med PySpark.
Oversigt
Funktionen ai.summarize er også tilgængelig for Spark DataFrames. Hvis du angiver navnet på en eksisterende inputkolonne som en parameter, opsummerer funktionen hver værdi fra den pågældende kolonne alene. Ellers opsummerer funktionen værdier på tværs af alle kolonner i DataFrame række for række.
Funktionen returnerer en ny DataFrame med opsummeringer for hver inputtekstrække fra en enkelt kolonne eller på tværs af alle kolonner, der er gemt i en outputkolonne.
Syntaks
df.ai.summarize(input_col="text", output_col="summaries")
Parametre
| Navn | Beskrivelse |
|---|---|
input_col Valgfrit |
En streng , der indeholder navnet på en eksisterende kolonne med inputtekstværdier, der skal opsummeres. Hvis du ikke angiver denne parameter, opsummerer funktionen værdier på tværs af alle kolonner i DataFrame i stedet for værdier fra en bestemt kolonne. |
instructions Valgfrit |
En streng , der giver mere kontekst til AI-modellen, såsom outputlængde, tone, publikum eller fokus. Mere præcise instruktioner giver bedre resultater. |
error_col Valgfrit |
En streng , der indeholder navnet på en ny kolonne for at gemme eventuelle OpenAI-fejl, der skyldes behandling af hver inputtekstrække. Hvis du ikke angiver denne parameter, genereres der et standardnavn for fejlkolonnen. Hvis der ikke er nogen fejl i en inputrække, er værdien i denne kolonne null. |
output_col Valgfrit |
En streng , der indeholder navnet på en ny kolonne til at gemme oversigter for hver inputtekstrække. Hvis du ikke angiver denne parameter, genereres der et standardnavn for outputkolonnen. |
Returnerer
Funktionen returnerer en Spark DataFrame , der indeholder en ny kolonne, der indeholder opsummeret tekst for hver inputtekstrække. Hvis inputteksten er null, er resultatet null. Hvis der ikke er angivet nogen inputkolonne, opsummerer funktionen værdier på tværs af alle kolonner i DataFrame.
Eksempel
# This code uses AI. Always review output for mistakes.
df = spark.createDataFrame([
("Microsoft Teams", "2017",
"""
The ultimate messaging app for your organization—a workspace for real-time
collaboration and communication, meetings, file and app sharing, and even the
occasional emoji! All in one place, all in the open, all accessible to everyone.
""",),
("Microsoft Fabric", "2023",
"""
An enterprise-ready, end-to-end analytics platform that unifies data movement,
data processing, ingestion, transformation, and report building into a seamless,
user-friendly SaaS experience. Transform raw data into actionable insights.
""",)
], ["product", "release_year", "description"])
summaries = df.ai.summarize(input_col="description", output_col="summaries")
display(summaries)
Output:
Tilpas resuméer med instruktioner
Brug parameteren instructions til at styre tone, længde, publikum eller fokus på genererede resuméer uden at ændre kildeteksten.
# This code uses AI. Always review output for mistakes.
summaries = df.ai.summarize(
input_col="description",
output_col="executive_summary",
instructions="Write one concise sentence for a business executive. Focus on product value and avoid marketing language.",
)
display(summaries)
Multimodal input
For at opsummere billeder, PDF'er eller tekstfiler, sæt input_col_type="path" til enkeltkolonne-tilstand eller col_types til DataFrame-niveau-tilstand. For opsætning, se Brug multimodal input med AI-funktioner.
# This code uses AI. Always review output for mistakes.
# Summarize file content from a single column
results = custom_df.ai.summarize(
instructions="Summarize this file in one sentence for a support analyst.",
input_col="file_path",
input_col_type="path",
output_col="summary",
)
display(results)
Du kan også opsummere værdier på tværs af alle kolonner i en DataFrame ved at udelade inputkolonnen og bruge col_types:
# This code uses AI. Always review output for mistakes.
results = custom_df.ai.summarize(
col_types={"file_path": "path"},
output_col="summary",
)
display(results)
Relateret indhold
- Brug ai.summarize med pandaer.
- Lær mere om AI-funktioner.
- Brug multimodal input med AI-funktioner.
- Ændr standardkonfigurationen for AI-funktioner med PySpark.
- Forstå fakturering for AI-funktioner.