Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
:::note Efterlevnad
SharePoint-anslutningsappen stöder användning i arbetsytor med Konfigurera förbättrade inställningar för säkerhet och efterlevnad aktiverat.
:::
Du kan mata in strukturerade, halvstrukturerade och ostrukturerade filer från Microsoft SharePoint till Delta-tabeller. SharePoint-anslutningsappen stöder inkrementell inmatning av SharePoint filer med hjälp av batch- och direktuppspelnings-API:er, inklusive Auto Loader, spark.read och COPY INTO, allt med styrning av Unity Catalog.
Välj din SharePoint-anslutning
Lakeflow Connect erbjuder två SharePoint anslutningsappar. Båda kommer åt data i SharePoint, men skiljer sig åt i sin hanteringsnivå.
| Connector | Description |
|---|---|
| Hanterad SharePoint-anslutning | En fullt hanterad anslutning. Enkel anslutning med lågt underhåll för företagsprogram som matar in data i Delta-tabeller och håller dem synkroniserade med källan. |
| Standard SharePoint-koppling | Skapa anpassade datainmatningspipelines med SQL-, PySpark- eller Lakeflow-pipelines med hjälp av batch- och strömnings-API:er som read_files, spark.read, COPY INTO och Auto Loader. Erbjuder flexibiliteten att utföra komplexa omvandlingar under inmatning, samtidigt som du får större ansvar för att hantera och underhålla dina pipelines. |
Tip
Databricks rekommenderar den hanterade SharePoint-anslutningsappen för de flesta användningsfall. Det ger en fullständigt hanterad upplevelse med automatisk inkrementell inmatning, brett formatstöd och flexibel fil- och mappval.
Viktiga funktioner
Standard-SharePoint-anslutningsappen erbjuder:
- Inmatning av strukturerade, halvstrukturerade och ostrukturerade filer
- Detaljerad inmatning: Mata in en specifik webbplats, en underwebbplats, ett dokumentbibliotek, en mapp eller en enda fil
- Import av SharePoint-webbplatssidor (
.aspx) i Databricks Runtime 19 och senare. Se Importera SharePoint-webbplatssidor. - Batch- och strömmande inmatning med
spark.readAuto Loader ochCOPY INTO - Automatisk schemainferens och utveckling för strukturerade och halvstrukturerade format som CSV och Excel
- Skydda lagring av autentiseringsuppgifter med en Anslutning till Unity Catalog
- Filval med mönstermatchning med hjälp av
pathGlobFilter
Kravspecifikation
Om du vill mata in filer från SharePoint måste du ha följande:
- En arbetsyta med Unity Catalog aktiverat.
-
CREATE CONNECTIONbehörigheter för att skapa en SharePoint anslutning eller rätt behörighet att använda en befintlig som baseras på ditt cluster-åtkomstläge:- Dedikerat åtkomstläge:
MANAGE CONNECTION. - Standardåtkomstläge:
USE CONNECTION.
- Dedikerat åtkomstläge:
- Beräkning som använder Databricks Runtime version 17.3 LTS eller högre.
- OAuth-autentisering konfigurerad med behörighetsomfånget
Sites.Read.AllellerSites.Selected. - Valfritt: Aktivera funktionen Excel Beta för att parsa Excel filer. Se Läsa och strömma Excel filer.
Skapa anslutningen
Skapa en Unity Catalog-anslutning för att lagra dina SharePoint autentiseringsuppgifter. Processen för anslutningsinställningar delas av både standard- och hanterade SharePoint-anslutningar.
Fullständiga installationsinstruktioner för anslutningar, inklusive autentiseringsalternativ för OAuth, finns i Översikt över konfiguration av SharePoint inmatning.
Läs filer från SharePoint
Om du vill läsa filer skickar du anslutningen som du skapade med alternativet databricks.connection och en URL som pekar på den SharePoint resurs som du vill komma åt. Url:en som du anger avgör inmatningens omfattning.
Följande sökvägstyper stöds på Databricks Runtime 17.3 LTS och uppåt:
| Sökvägstyp | Description |
|---|---|
| Site | Kopiera webbplats-URL:en från adressfältet.https://mytenant.sharepoint.com/sites/test-site |
| Underwebbplats | Kopiera underwebbplatsens URL från adressfältet.https://mytenant.sharepoint.com/sites/test-site/test-subsite |
| Dokumentbibliotek | Öppna biblioteket från webbplatsinnehållet och kopiera URL:en från adressfältet.https://mytenant.sharepoint.com/sites/test-site/Shared%20Documentshttps://mytenant.sharepoint.com/sites/test-site/custom-drive |
| Folder | Öppna mappen från webbplatsinnehållet och kopiera URL:en från adressfältet. Du kan också öppna mappens fönstret Details i SharePoint och klicka på kopieringsikonen bredvid Path.https://mytenant.sharepoint.com/sites/test-site/Shared%20Documents/Forms/AllItems.aspx?id=%2Fsites...https://mytenant.sharepoint.com/sites/test-site/custom-drive/test-folder |
| File | Välj filen, klicka på spillmenyn (...) och välj Förhandsgranska. Kopiera URL:en från adressfältet. Du kan också öppna filens fönster Details i SharePoint och klicka på kopieringsikonen bredvid Path.https://mytenant.sharepoint.com/sites/test-site/Shared%20Documents/Forms/AllItems.aspx?viewid=1a2b3c...https://mytenant.sharepoint.com/sites/test-site/custom-drive/test-folder/test.csv |
Databricks Runtime 18 LTS och högre lägger till stöd för följande sökvägstyper:
| Sökvägstyp | Description |
|---|---|
| Kapslad underwebbplats | Kopiera underwebbplatsens URL från adressfältet.https://mytenant.sharepoint.com/sites/test-site/subsite/nested-subsite/nested-nested-subsite |
| Dela länk | Välj filen eller mappen, klicka på spillmenyn (...) och välj Kopiera länk. Databricks rekommenderar att du ställer in resurslänken så att den aldrig upphör att gälla.https://mytenant.sharepoint.com/:i:/s/test-site/1A2B3C4D5E6F7G8H9I |
| Microsoft 365 för webben (tidigare Office) | Öppna filen i Microsoft 365 för webben och kopiera URL:en från adressfältet.https://mytenant.sharepoint.com/:x:/r/sites/test-site/_layouts/15/Doc.aspx?sourcedoc=%1A2B... |
Databricks Runtime 19 och nyare lägger till stöd för följande bantyper:
| Sökvägstyp | Description |
|---|---|
| Hyresgäst | Kopiera klientorganisationens rot-URL från adressfältet.https://mytenant.sharepoint.com |
| Webbplatssidor | Importera en webbplats Site Pages-bibliotek (.aspx) som lagras utanför dess dokumentbibliotek. Se Importera SharePoint-webbplatssidor.https://mytenant.sharepoint.com/sites/test-site/SitePages |
Examples
Det finns några sätt att läsa filer med hjälp av standardanslutningsappen SharePoint.
Stream SharePoint-filer med Auto Loader (automatisk inläsare)
Automatisk inläsning är det mest effektiva sättet att stegvis mata in strukturerade filer från SharePoint. Den identifierar automatiskt nya filer och bearbetar dem när de tas emot. Den kan också mata in strukturerade och halvstrukturerade filer som CSV och JSON med automatisk schemainferens och utveckling. Mer information om användning av automatisk inläsning finns i Vanliga datainläsningsmönster.
# Incrementally ingest new PDF files
df = (spark.readStream.format("cloudFiles")
.option("cloudFiles.format", "binaryFile")
.option("databricks.connection", "my_sharepoint_conn")
.option("cloudFiles.schemaLocation", "<path-to-schema-location>")
.option("pathGlobFilter", "*.pdf")
.load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents")
)
# Incrementally ingest CSV files with automatic schema inference and evolution
df = (spark.readStream.format("cloudFiles")
.option("cloudFiles.format", "csv")
.option("databricks.connection", "my_sharepoint_conn")
.option("cloudFiles.schemaLocation", "<path-to-schema-location>")
.option("pathGlobFilter", "*.csv")
.option("cloudFiles.inferColumnTypes", True)
.option("header", True)
.load("https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs")
)
Läs SharePoint filer med Spark batch read
I följande exempel visas hur du matar in SharePoint filer i Python med hjälp av funktionen spark.read. Ställ in alternativet recursiveFileLookup på true för att läsa filer från kapslade strukturer, till exempel dokumentbibliotek på en webbplats, mappar i ett dokumentbibliotek eller underwebbplatser på en webbplats.
# Read unstructured data as binary files
df = (spark.read
.format("binaryFile")
.option("databricks.connection", "my_sharepoint_conn")
.option("recursiveFileLookup", True)
.option("pathGlobFilter", "*.pdf") # optional. Example: only ingest PDFs
.load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents"))
# Read a batch of CSV files, infer the schema, and load the data into a DataFrame
df = (spark.read
.format("csv")
.option("databricks.connection", "my_sharepoint_conn")
.option("pathGlobFilter", "*.csv")
.option("recursiveFileLookup", True)
.option("inferSchema", True)
.option("header", True)
.load("https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs"))
# Read a specific Excel file from SharePoint, infer the schema, and load the data into a DataFrame
df = (spark.read
.format("excel")
.option("databricks.connection", "my_sharepoint_conn")
.option("headerRows", 1) # optional
.option("dataAddress", "Sheet1!A1:M20") # optional
.load("https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx"))
Läs SharePoint filer med Spark SQL
I följande exempel visas hur du matar in SharePoint filer i SQL med hjälp av funktionen read_files tabellvärde. Mer information om read_files användning finns i read_files tabellvärdesfunktionen.
-- Read pdf files
CREATE TABLE my_table AS
SELECT * FROM read_files(
"https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
`databricks.connection` => "my_sharepoint_conn",
format => "binaryFile",
pathGlobFilter => "*.pdf", -- optional. Example: only ingest PDFs
schemaEvolutionMode => "none"
);
-- Read a specific Excel sheet and range
CREATE TABLE my_sheet_table AS
SELECT * FROM read_files(
"https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx",
`databricks.connection` => "my_sharepoint_conn",
format => "excel",
headerRows => 1, -- optional
dataAddress => "Sheet1!A2:D10", -- optional
schemaEvolutionMode => "none"
);
Inkrementell inmatning med COPY INTO
COPY INTO tillhandahåller idempotent inkrementell inläsning av filer i en Delta-tabell. Mer information om COPY INTO användning finns i Vanliga datainläsningsmönster med hjälp av COPY INTO.
CREATE TABLE IF NOT EXISTS sharepoint_pdf_table;
CREATE TABLE IF NOT EXISTS sharepoint_csv_table;
CREATE TABLE IF NOT EXISTS sharepoint_excel_table;
# Incrementally ingest new PDF files
COPY INTO sharepoint_pdf_table
FROM "https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents"
FILEFORMAT = BINARYFILE
PATTERN = '*.pdf'
FORMAT_OPTIONS ('databricks.connection' = 'my_sharepoint_conn')
COPY_OPTIONS ('mergeSchema' = 'true');
# Incrementally ingest CSV files with automatic schema inference and evolution
COPY INTO sharepoint_csv_table
FROM "https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs"
FILEFORMAT = CSV
PATTERN = '*.csv'
FORMAT_OPTIONS ('databricks.connection' = 'my_sharepoint_conn', 'header' = 'true', 'inferSchema' = 'true')
COPY_OPTIONS ('mergeSchema' = 'true');
# Ingest a single Excel file
COPY INTO sharepoint_excel_table
FROM "https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx"
FILEFORMAT = EXCEL
FORMAT_OPTIONS ('databricks.connection' = 'my_sharepoint_conn', 'headerRows' = '1')
COPY_OPTIONS ('mergeSchema' = 'true');
Importera SharePoint-filer i Lakeflow-pipelines
Anmärkning
SharePoint-anslutningen kräver Databricks Runtime 17.3 eller högre.
Följande exempel visar hur du läser SharePoint-filer med Auto Loader i Lakeflow-pipelines.
Python
from pyspark import pipelines as dp
# Incrementally ingest new PDF files
@dp.table
def sharepoint_pdf_table():
return (spark.readStream.format("cloudFiles")
.option("cloudFiles.format", "binaryFile")
.option("databricks.connection", "my_sharepoint_conn")
.option("pathGlobFilter", "*.pdf")
.load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents")
)
# Incrementally ingest CSV files with automatic schema inference and evolution
@dp.table
def sharepoint_csv_table():
return (spark.readStream.format("cloudFiles")
.option("cloudFiles.format", "csv")
.option("databricks.connection", "my_sharepoint_conn")
.option("pathGlobFilter", "*.csv")
.option("cloudFiles.inferColumnTypes", True)
.option("header", True)
.load("https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs")
)
# Read a specific Excel file from SharePoint in a materialized view
@dp.table
def sharepoint_excel_table():
return (spark.read.format("excel")
.option("databricks.connection", "my_sharepoint_conn")
.option("headerRows", 1) # optional
.option("inferColumnTypes", True) # optional
.option("dataAddress", "Sheet1!A1:M20") # optional
.load("https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx")
SQL
-- Incrementally ingest new PDF files
CREATE OR REFRESH STREAMING TABLE sharepoint_pdf_table
AS SELECT * FROM STREAM read_files(
"https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
format => "binaryFile",
`databricks.connection` => "my_sharepoint_conn",
pathGlobFilter => "*.pdf");
-- Incrementally ingest CSV files with automatic schema inference and evolution
CREATE OR REFRESH STREAMING TABLE sharepoint_csv_table
AS SELECT * FROM STREAM read_files(
"https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs",
format => "csv",
`databricks.connection` => "my_sharepoint_conn",
pathGlobFilter => "*.csv",
header => "true");
-- Read a specific Excel file from SharePoint in a materialized view
CREATE OR REFRESH MATERIALIZED VIEW sharepoint_excel_table
AS SELECT * FROM read_files(
"https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx",
`databricks.connection` => "my_sharepoint_conn",
format => "excel",
headerRows => 1, -- optional
dataAddress => "Sheet1!A2:D10", -- optional
`cloudFiles.schemaEvolutionMode` => "none"
);
Parsa ostrukturerade filer
När du matar in ostrukturerade filer från SharePoint (till exempel PDF-filer, Word dokument eller PowerPoint filer) med standard-SharePoint-anslutningsappen med binaryFile format lagras filinnehållet som binära rådata. Om du vill förbereda dessa filer för AI-arbetsbelastningar , till exempel RAG, sökning, klassificering eller dokumenttolkning, kan du parsa det binära innehållet i strukturerade, frågebara utdata med hjälp av ai_parse_document.
I följande exempel visas hur du parsar ostrukturerade dokument som lagras i en deltatabell i brons med namnet documentsoch lägger till en ny kolumn med tolkat innehåll:
CREATE TABLE documents AS
SELECT * FROM read_files(
"https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
`databricks.connection` => "my_sharepoint_conn",
format => "binaryFile",
pathGlobFilter => "*.{pdf,docx}",
schemaEvolutionMode => "none"
);
SELECT *, ai_parse_document(content, map('version', '2.0')) AS parsed_content
FROM documents;
Kolumnen parsed_content innehåller extraherad text, tabeller, layoutinformation och metadata som kan användas direkt för underordnade AI-pipelines.
Stegvis parsning med Lakeflow-pipelines
Du kan också använda ai_parse_document i Lakeflow-pipelines för att aktivera inkrementell parsning. När nya filer strömmas in från SharePoint parsas de automatiskt som dina pipelineuppdateringar.
Till exempel kan du definiera en brons-strömningstabell som tar in de råa binära filerna, sedan en andra strömningstabell som placerar det parsade innehållet i en ny kolumn:
CREATE OR REFRESH STREAMING TABLE sharepoint_documents_table
AS SELECT * FROM STREAM read_files(
"https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
format => "binaryFile",
`databricks.connection` => "my_sharepoint_conn",
pathGlobFilter => "*.{pdf,docx}");
CREATE OR REFRESH STREAMING TABLE documents_parsed
AS SELECT
*,
ai_parse_document(content, map('version', '2.0')) AS parsed_content
FROM STREAM sharepoint_documents_table;
Den här metoden säkerställer att:
- Nyinhämtade SharePoint-filer analyseras automatiskt när pipelinen uppdateras.
- Tolkade utgångar håller sig synkroniserade med inkommande data.
- Efterföljande AI-pipelines arbetar alltid med uppdaterade dokumentrepresentationer.
Se ai_parse_document funktionen för stödda format och avancerade alternativ, inklusive version alternativet som fäster utdataschemat.
SharePoint metadatakolumn
Kolumnen _sharepoint_metadata är en dold metadatakolumn som ger åtkomst till SharePoint specifika egenskaper för inmatade filer som hämtas från resursen Microsoft Graph driveItem. Det kräver Databricks Runtime 18 LTS eller senare och är tillgängligt för alla filformat när du läser från SharePoint. Om du vill inkludera _sharepoint_metadata kolumnen i den returnerade DataFrame måste du uttryckligen välja den i läsfrågan.
Om datakällan innehåller en kolumn med namnet _sharepoint_metadata byts kolumnen SharePoint metadata om till __sharepoint_metadata (med ett extra inledande understreck) för att deduplicera. Ytterligare understreck läggs till tills namnet är unikt.
Vanliga filmetadata som filsökvägen eller storleken kan efterfrågas med hjälp av _metadata kolumnen. Mer information finns i kolumnen Filmetadata.
Schema
Kolumnen _sharepoint_metadata innehåller STRUCT följande fält. Alla fält är nullbara.
| Namn | Type | Description | Exempel |
|---|---|---|---|
| item_id | STRING |
Objektets driveItem-ID. | 01OMQ3MNLH42C5J675CBEI5CRK7SPKQUTZ |
| site_id | STRING |
ID:t för den SharePoint webbplats som innehåller objektet. | mytenant.sharepoint.com,69dc7b12-f92c-498d-9514-596b793a1f77,c6c1db8d-2b8d-48a1-a549-394b63d74725 |
| drive_id | STRING |
ID:t för disken som innehåller objektet. | b!EnvcaSz5jUmVFFlreTofd43bwcaNK6FIpUk5S2PXRyWTvQraaWQkSpwQEgThHDS- |
| enhetstyp | STRING |
Typ av enhet, till exempel documentLibrary för SharePoint bibliotek eller business för OneDrive för företag. |
documentLibrary |
| parent_id | STRING |
ID för föräldrarmappen i DriveItem. | 01OMQ3MNN6Y2GOVW7725BZO354PWSELRRZ |
| parent_name | STRING |
Namnet på den överordnade mappen. | Shared Documents |
| parent_path | STRING |
Den drivrelativa sökvägen för den överordnade mappen. | /drives/b!EnvcaSz5.../root: |
| web_url | STRING |
Webbläsarens URL för objektet på SharePoint. | https://mytenant.sharepoint.com/sites/TestSite/_layouts/15/Doc.aspx?sourcedoc=... |
| MIME-typ | STRING |
MIME-typen för objektet. | application/vnd.ms-excel |
| created_by_email | STRING |
E-postmeddelandet för användaren som skapade objektet. | alice@example.onmicrosoft.com |
| created_by_name | STRING |
Visningsnamnet för den användare som skapade objektet. | Alice Example |
| created_timestamp | TIMESTAMP |
Den tid då objektet skapades. | 2025-12-03 13:33:12 |
| senast_ändrad_av_e-post | STRING |
E-postmeddelandet för den användare som senast ändrade objektet. | alice@example.onmicrosoft.com |
| last_modified_by_name | STRING |
Visningsnamnet för den användare som senast ändrade objektet. | Alice Example |
| etag | STRING |
Objektets ETag. Ändringar när objektet eller någon av dess metadata ändras. | "{D485E667-FDFB-4810-8E8A-2AFC9EA85279},1" |
| ctag | STRING |
Objektets ändringstagg. Ändras endast när objektets innehåll ändras. | "c:{D485E667-FDFB-4810-8E8A-2AFC9EA85279},1" |
| description | STRING |
Objektbeskrivningen, om den har angetts. | Q4 financial report |
| additional_metadata | VARIANT |
Andra fält driveItem som returneras av Microsoft Graph men inte extraheras ovan. | {"shared":{"scope":"users"},...} |
Anmärkning
Fältet additional_metadata returneras som VARIANT. Se VARIANT typ.
Exempel
I följande exempel visas hur du inkluderar _sharepoint_metadata kolumnen i en läsfråga, väljer specifika fält i kolumnen och extraherar värden från fältet additional_metadataVARIANT .
Python
df = (spark.read
.format("binaryFile")
.option("databricks.connection", "my_sharepoint_conn")
.load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents")
.select("*", "_metadata", "_sharepoint_metadata"))
SQL
SELECT *, _sharepoint_metadata
FROM read_files(
"https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
`databricks.connection` => "my_sharepoint_conn",
format => "binaryFile"
);
Välj specifika fält från structen _sharepoint_metadata :
df = (spark.read
.format("binaryFile")
.option("databricks.connection", "my_sharepoint_conn")
.load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents")
.select("_sharepoint_metadata.item_id", "_sharepoint_metadata.etag"))
Extrahera värden från fältet additional_metadataVARIANT med hjälp av castoperatorn :: :
SELECT
*,
_sharepoint_metadata.additional_metadata:shared:scope::STRING AS shared_scope
FROM read_files(
"https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
`databricks.connection` => "my_sharepoint_conn",
format => "binaryFile"
);
Inhämta SharePoint-sidor
SharePoint lagrar Webbplatssidor som .aspx filer i en webbplats Sidor-bibliotek, separat från dess dokumentbibliotek. Att ta in Site Pages kräver Databricks Runtime 19 eller högre. För mer information om webbplatssidor, se SharePoint-sidor och sidmodellen.
Du kan ta in webbplatssidor på följande sätt:
| Sökvägstyp | Description |
|---|---|
| Enskild sida | Öppna sidan i SharePoint och kopiera URL:en från adressfältet.https://mytenant.sharepoint.com/sites/test-site/SitePages/my-news-post.aspx |
| Webbplatssidor-biblioteket | Öppna webbplatssidor från webbplatsinnehåll och kopiera URL:en från adressfältet.https://mytenant.sharepoint.com/sites/test-site/SitePages |
| Webbplats eller underwebbplats | När du inhämtar en webbplats eller undersida inhämtar Azure Databricks Site Pages-biblioteket tillsammans med webbplatsens dokumentbibliotek.https://mytenant.sharepoint.com/sites/test-site |
Importera webbplatsens sidor som vilken annan fil som helst:
Python
# Read a single Site Page
df = (spark.read
.format("binaryFile")
.option("databricks.connection", "my_sharepoint_conn")
.load("https://mytenant.sharepoint.com/sites/test-site/SitePages/my-news-post.aspx"))
# Read a site's Site Pages library
df = (spark.read
.format("binaryFile")
.option("databricks.connection", "my_sharepoint_conn")
.option("pathGlobFilter", "*.aspx") # optional. Example: only ingest Site Page files
.load("https://mytenant.sharepoint.com/sites/test-site/SitePages"))
# Read all Site Pages from a site
df = (spark.read
.format("binaryFile")
.option("databricks.connection", "my_sharepoint_conn")
.option("recursiveFileLookup", True)
.option("pathGlobFilter", "*.aspx") # optional. Example: only ingest Site Page files
.load("https://mytenant.sharepoint.com/sites/test-site"))
SQL
-- Read a single Site Page
CREATE TABLE site_page AS
SELECT * FROM read_files(
"https://mytenant.sharepoint.com/sites/test-site/SitePages/my-news-post.aspx",
`databricks.connection` => "my_sharepoint_conn",
format => "binaryFile"
);
-- Read a site's Site Pages library
CREATE TABLE site_pages AS
SELECT * FROM read_files(
"https://mytenant.sharepoint.com/sites/test-site/SitePages",
`databricks.connection` => "my_sharepoint_conn",
format => "binaryFile",
pathGlobFilter => "*.aspx" -- optional. Example: only ingest Site Page files
);
-- Read all Site Pages from a site
CREATE TABLE site_with_pages AS
SELECT * FROM read_files(
"https://mytenant.sharepoint.com/sites/test-site",
`databricks.connection` => "my_sharepoint_conn",
format => "binaryFile",
recursiveFileLookup => true,
pathGlobFilter => "*.aspx" -- optional. Example: only ingest Site Page files
);
Auto Loader, COPY INTO, och andra gränssnitt fungerar med Site Pages på samma sätt som vilken annan fil som helst. Se exempel för exempel på intag.
Begränsningar
Standard-SharePoint-anslutningsappen har följande begränsningar.
- Du kan inte mata in flera webbplatser med samma fråga. Om du vill mata in från två platser måste du skriva två separata frågor.
- Du kan använda alternativet
pathGlobFilterför att filtrera filer efter namn. Mappsökvägsbaserad filtrering stöds inte. - SharePoint-listor stöds inte.
- Det går inte att skriva tillbaka till en SharePoint server.
- Automatisk inläsare
cleanSource(borttagning eller arkivering av filer vid källan efter inmatning) stöds inte.
Nästa steg
- Lär dig mer om Auto Loader för avancerade strömningsinmatningsmönster
- Utforska COPY INTO för idempotenta inkrementella inläsningar
- Jämför med datainmatningsmönster för molnobjektlagring
- Konfigurera jobbschemaläggning för att automatisera dina inmatningsarbetsflöden
- Använd Lakeflow-pipelines för att skapa kompletta datapipelines med transformationer