Mata in filer från SharePoint

:::note Efterlevnad

SharePoint-anslutningsappen stöder användning i arbetsytor med Konfigurera förbättrade inställningar för säkerhet och efterlevnad aktiverat.

:::

Du kan mata in strukturerade, halvstrukturerade och ostrukturerade filer från Microsoft SharePoint till Delta-tabeller. SharePoint-anslutningsappen stöder inkrementell inmatning av SharePoint filer med hjälp av batch- och direktuppspelnings-API:er, inklusive Auto Loader, spark.read och COPY INTO, allt med styrning av Unity Catalog.

Välj din SharePoint-anslutning

Lakeflow Connect erbjuder två SharePoint anslutningsappar. Båda kommer åt data i SharePoint, men skiljer sig åt i sin hanteringsnivå.

Connector Description
Hanterad SharePoint-anslutning En fullt hanterad anslutning. Enkel anslutning med lågt underhåll för företagsprogram som matar in data i Delta-tabeller och håller dem synkroniserade med källan.
Standard SharePoint-koppling Skapa anpassade datainmatningspipelines med SQL-, PySpark- eller Lakeflow-pipelines med hjälp av batch- och strömnings-API:er som read_files, spark.read, COPY INTO och Auto Loader. Erbjuder flexibiliteten att utföra komplexa omvandlingar under inmatning, samtidigt som du får större ansvar för att hantera och underhålla dina pipelines.

Tip

Databricks rekommenderar den hanterade SharePoint-anslutningsappen för de flesta användningsfall. Det ger en fullständigt hanterad upplevelse med automatisk inkrementell inmatning, brett formatstöd och flexibel fil- och mappval.

Viktiga funktioner

Standard-SharePoint-anslutningsappen erbjuder:

  • Inmatning av strukturerade, halvstrukturerade och ostrukturerade filer
  • Detaljerad inmatning: Mata in en specifik webbplats, en underwebbplats, ett dokumentbibliotek, en mapp eller en enda fil
  • Import av SharePoint-webbplatssidor (.aspx) i Databricks Runtime 19 och senare. Se Importera SharePoint-webbplatssidor.
  • Batch- och strömmande inmatning med spark.read Auto Loader och COPY INTO
  • Automatisk schemainferens och utveckling för strukturerade och halvstrukturerade format som CSV och Excel
  • Skydda lagring av autentiseringsuppgifter med en Anslutning till Unity Catalog
  • Filval med mönstermatchning med hjälp av pathGlobFilter

Kravspecifikation

Om du vill mata in filer från SharePoint måste du ha följande:

  • En arbetsyta med Unity Catalog aktiverat.
  • CREATE CONNECTION behörigheter för att skapa en SharePoint anslutning eller rätt behörighet att använda en befintlig som baseras på ditt cluster-åtkomstläge:
    • Dedikerat åtkomstläge: MANAGE CONNECTION.
    • Standardåtkomstläge: USE CONNECTION.
  • Beräkning som använder Databricks Runtime version 17.3 LTS eller högre.
  • OAuth-autentisering konfigurerad med behörighetsomfånget Sites.Read.All eller Sites.Selected .
  • Valfritt: Aktivera funktionen Excel Beta för att parsa Excel filer. Se Läsa och strömma Excel filer.

Skapa anslutningen

Skapa en Unity Catalog-anslutning för att lagra dina SharePoint autentiseringsuppgifter. Processen för anslutningsinställningar delas av både standard- och hanterade SharePoint-anslutningar.

Fullständiga installationsinstruktioner för anslutningar, inklusive autentiseringsalternativ för OAuth, finns i Översikt över konfiguration av SharePoint inmatning.

Läs filer från SharePoint

Om du vill läsa filer skickar du anslutningen som du skapade med alternativet databricks.connection och en URL som pekar på den SharePoint resurs som du vill komma åt. Url:en som du anger avgör inmatningens omfattning.

Följande sökvägstyper stöds på Databricks Runtime 17.3 LTS och uppåt:

Sökvägstyp Description
Site Kopiera webbplats-URL:en från adressfältet.
https://mytenant.sharepoint.com/sites/test-site
Underwebbplats Kopiera underwebbplatsens URL från adressfältet.
https://mytenant.sharepoint.com/sites/test-site/test-subsite
Dokumentbibliotek Öppna biblioteket från webbplatsinnehållet och kopiera URL:en från adressfältet.
https://mytenant.sharepoint.com/sites/test-site/Shared%20Documents
https://mytenant.sharepoint.com/sites/test-site/custom-drive
Folder Öppna mappen från webbplatsinnehållet och kopiera URL:en från adressfältet. Du kan också öppna mappens fönstret Details i SharePoint och klicka på kopieringsikonen bredvid Path.
https://mytenant.sharepoint.com/sites/test-site/Shared%20Documents/Forms/AllItems.aspx?id=%2Fsites...
https://mytenant.sharepoint.com/sites/test-site/custom-drive/test-folder
File Välj filen, klicka på spillmenyn (...) och välj Förhandsgranska. Kopiera URL:en från adressfältet. Du kan också öppna filens fönster Details i SharePoint och klicka på kopieringsikonen bredvid Path.
https://mytenant.sharepoint.com/sites/test-site/Shared%20Documents/Forms/AllItems.aspx?viewid=1a2b3c...
https://mytenant.sharepoint.com/sites/test-site/custom-drive/test-folder/test.csv

Databricks Runtime 18 LTS och högre lägger till stöd för följande sökvägstyper:

Sökvägstyp Description
Kapslad underwebbplats Kopiera underwebbplatsens URL från adressfältet.
https://mytenant.sharepoint.com/sites/test-site/subsite/nested-subsite/nested-nested-subsite
Dela länk Välj filen eller mappen, klicka på spillmenyn (...) och välj Kopiera länk. Databricks rekommenderar att du ställer in resurslänken så att den aldrig upphör att gälla.
https://mytenant.sharepoint.com/:i:/s/test-site/1A2B3C4D5E6F7G8H9I
Microsoft 365 för webben (tidigare Office) Öppna filen i Microsoft 365 för webben och kopiera URL:en från adressfältet.
https://mytenant.sharepoint.com/:x:/r/sites/test-site/_layouts/15/Doc.aspx?sourcedoc=%1A2B...

Databricks Runtime 19 och nyare lägger till stöd för följande bantyper:

Sökvägstyp Description
Hyresgäst Kopiera klientorganisationens rot-URL från adressfältet.
https://mytenant.sharepoint.com
Webbplatssidor Importera en webbplats Site Pages-bibliotek (.aspx) som lagras utanför dess dokumentbibliotek. Se Importera SharePoint-webbplatssidor.
https://mytenant.sharepoint.com/sites/test-site/SitePages

Examples

Det finns några sätt att läsa filer med hjälp av standardanslutningsappen SharePoint.

Stream SharePoint-filer med Auto Loader (automatisk inläsare)

Automatisk inläsning är det mest effektiva sättet att stegvis mata in strukturerade filer från SharePoint. Den identifierar automatiskt nya filer och bearbetar dem när de tas emot. Den kan också mata in strukturerade och halvstrukturerade filer som CSV och JSON med automatisk schemainferens och utveckling. Mer information om användning av automatisk inläsning finns i Vanliga datainläsningsmönster.

# Incrementally ingest new PDF files
df = (spark.readStream.format("cloudFiles")
    .option("cloudFiles.format", "binaryFile")
    .option("databricks.connection", "my_sharepoint_conn")
    .option("cloudFiles.schemaLocation", "<path-to-schema-location>")
    .option("pathGlobFilter", "*.pdf")
    .load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents")
)

# Incrementally ingest CSV files with automatic schema inference and evolution
df = (spark.readStream.format("cloudFiles")
    .option("cloudFiles.format", "csv")
    .option("databricks.connection", "my_sharepoint_conn")
    .option("cloudFiles.schemaLocation", "<path-to-schema-location>")
    .option("pathGlobFilter", "*.csv")
    .option("cloudFiles.inferColumnTypes", True)
    .option("header", True)
    .load("https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs")
)

Läs SharePoint filer med Spark batch read

I följande exempel visas hur du matar in SharePoint filer i Python med hjälp av funktionen spark.read. Ställ in alternativet recursiveFileLookuptrue för att läsa filer från kapslade strukturer, till exempel dokumentbibliotek på en webbplats, mappar i ett dokumentbibliotek eller underwebbplatser på en webbplats.

# Read unstructured data as binary files
df = (spark.read
        .format("binaryFile")
        .option("databricks.connection", "my_sharepoint_conn")
        .option("recursiveFileLookup", True)
        .option("pathGlobFilter", "*.pdf") # optional. Example: only ingest PDFs
        .load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents"))

# Read a batch of CSV files, infer the schema, and load the data into a DataFrame
df = (spark.read
        .format("csv")
        .option("databricks.connection", "my_sharepoint_conn")
        .option("pathGlobFilter", "*.csv")
        .option("recursiveFileLookup", True)
        .option("inferSchema", True)
        .option("header", True)
        .load("https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs"))

# Read a specific Excel file from SharePoint, infer the schema, and load the data into a DataFrame
df = (spark.read
        .format("excel")
        .option("databricks.connection", "my_sharepoint_conn")
        .option("headerRows", 1)                   # optional
        .option("dataAddress", "Sheet1!A1:M20")  # optional
        .load("https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx"))

Läs SharePoint filer med Spark SQL

I följande exempel visas hur du matar in SharePoint filer i SQL med hjälp av funktionen read_files tabellvärde. Mer information om read_files användning finns i read_files tabellvärdesfunktionen.

-- Read pdf files
CREATE TABLE my_table AS
SELECT * FROM read_files(
  "https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
  `databricks.connection` => "my_sharepoint_conn",
  format => "binaryFile",
  pathGlobFilter => "*.pdf", -- optional. Example: only ingest PDFs
  schemaEvolutionMode => "none"
);

-- Read a specific Excel sheet and range
CREATE TABLE my_sheet_table AS
SELECT * FROM read_files(
  "https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx",
  `databricks.connection` => "my_sharepoint_conn",
  format => "excel",
  headerRows => 1,  -- optional
  dataAddress => "Sheet1!A2:D10", -- optional
  schemaEvolutionMode => "none"
);

Inkrementell inmatning med COPY INTO

COPY INTO tillhandahåller idempotent inkrementell inläsning av filer i en Delta-tabell. Mer information om COPY INTO användning finns i Vanliga datainläsningsmönster med hjälp av COPY INTO.

CREATE TABLE IF NOT EXISTS sharepoint_pdf_table;
CREATE TABLE IF NOT EXISTS sharepoint_csv_table;
CREATE TABLE IF NOT EXISTS sharepoint_excel_table;

# Incrementally ingest new PDF files
COPY INTO sharepoint_pdf_table
  FROM "https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents"
  FILEFORMAT = BINARYFILE
  PATTERN = '*.pdf'
  FORMAT_OPTIONS ('databricks.connection' = 'my_sharepoint_conn')
  COPY_OPTIONS ('mergeSchema' = 'true');

# Incrementally ingest CSV files with automatic schema inference and evolution
COPY INTO sharepoint_csv_table
  FROM "https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs"
  FILEFORMAT = CSV
  PATTERN = '*.csv'
  FORMAT_OPTIONS ('databricks.connection' = 'my_sharepoint_conn', 'header' = 'true', 'inferSchema' = 'true')
  COPY_OPTIONS ('mergeSchema' = 'true');

# Ingest a single Excel file
COPY INTO sharepoint_excel_table
  FROM "https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx"
  FILEFORMAT = EXCEL
  FORMAT_OPTIONS ('databricks.connection' = 'my_sharepoint_conn', 'headerRows' = '1')
  COPY_OPTIONS ('mergeSchema' = 'true');

Importera SharePoint-filer i Lakeflow-pipelines

Anmärkning

SharePoint-anslutningen kräver Databricks Runtime 17.3 eller högre.

Följande exempel visar hur du läser SharePoint-filer med Auto Loader i Lakeflow-pipelines.

Python

from pyspark import pipelines as dp

# Incrementally ingest new PDF files
@dp.table
def sharepoint_pdf_table():
  return (spark.readStream.format("cloudFiles")
    .option("cloudFiles.format", "binaryFile")
    .option("databricks.connection", "my_sharepoint_conn")
    .option("pathGlobFilter", "*.pdf")
    .load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents")
  )

# Incrementally ingest CSV files with automatic schema inference and evolution
@dp.table
def sharepoint_csv_table():
  return (spark.readStream.format("cloudFiles")
      .option("cloudFiles.format", "csv")
      .option("databricks.connection", "my_sharepoint_conn")
      .option("pathGlobFilter", "*.csv")
      .option("cloudFiles.inferColumnTypes", True)
      .option("header", True)
      .load("https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs")
  )

# Read a specific Excel file from SharePoint in a materialized view
@dp.table
def sharepoint_excel_table():
  return (spark.read.format("excel")
    .option("databricks.connection", "my_sharepoint_conn")
    .option("headerRows", 1)                   # optional
    .option("inferColumnTypes", True)            # optional
    .option("dataAddress", "Sheet1!A1:M20")  # optional
    .load("https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx")

SQL

-- Incrementally ingest new PDF files
CREATE OR REFRESH STREAMING TABLE sharepoint_pdf_table
AS SELECT * FROM STREAM read_files(
  "https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
  format => "binaryFile",
  `databricks.connection` => "my_sharepoint_conn",
  pathGlobFilter => "*.pdf");

-- Incrementally ingest CSV files with automatic schema inference and evolution
CREATE OR REFRESH STREAMING TABLE sharepoint_csv_table
AS SELECT * FROM STREAM read_files(
  "https://mytenant.sharepoint.com/sites/Engineering/Data/IoT_Logs",
  format => "csv",
  `databricks.connection` => "my_sharepoint_conn",
  pathGlobFilter => "*.csv",
  header => "true");

-- Read a specific Excel file from SharePoint in a materialized view
CREATE OR REFRESH MATERIALIZED VIEW sharepoint_excel_table
AS SELECT * FROM read_files(
  "https://mytenant.sharepoint.com/sites/Finance/Shared%20Documents/Monthly/Report-Oct.xlsx",
  `databricks.connection` => "my_sharepoint_conn",
  format => "excel",
  headerRows => 1,  -- optional
  dataAddress => "Sheet1!A2:D10", -- optional
  `cloudFiles.schemaEvolutionMode` => "none"
);

Parsa ostrukturerade filer

När du matar in ostrukturerade filer från SharePoint (till exempel PDF-filer, Word dokument eller PowerPoint filer) med standard-SharePoint-anslutningsappen med binaryFile format lagras filinnehållet som binära rådata. Om du vill förbereda dessa filer för AI-arbetsbelastningar , till exempel RAG, sökning, klassificering eller dokumenttolkning, kan du parsa det binära innehållet i strukturerade, frågebara utdata med hjälp av ai_parse_document.

I följande exempel visas hur du parsar ostrukturerade dokument som lagras i en deltatabell i brons med namnet documentsoch lägger till en ny kolumn med tolkat innehåll:

CREATE TABLE documents AS
SELECT * FROM read_files(
  "https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
  `databricks.connection` => "my_sharepoint_conn",
  format => "binaryFile",
  pathGlobFilter => "*.{pdf,docx}",
  schemaEvolutionMode => "none"
);
SELECT *, ai_parse_document(content, map('version', '2.0')) AS parsed_content
FROM documents;

Kolumnen parsed_content innehåller extraherad text, tabeller, layoutinformation och metadata som kan användas direkt för underordnade AI-pipelines.

Stegvis parsning med Lakeflow-pipelines

Du kan också använda ai_parse_document i Lakeflow-pipelines för att aktivera inkrementell parsning. När nya filer strömmas in från SharePoint parsas de automatiskt som dina pipelineuppdateringar.

Till exempel kan du definiera en brons-strömningstabell som tar in de råa binära filerna, sedan en andra strömningstabell som placerar det parsade innehållet i en ny kolumn:

CREATE OR REFRESH STREAMING TABLE sharepoint_documents_table
AS SELECT * FROM STREAM read_files(
  "https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
  format => "binaryFile",
  `databricks.connection` => "my_sharepoint_conn",
  pathGlobFilter => "*.{pdf,docx}");

CREATE OR REFRESH STREAMING TABLE documents_parsed
AS SELECT
  *,
  ai_parse_document(content, map('version', '2.0')) AS parsed_content
FROM STREAM sharepoint_documents_table;

Den här metoden säkerställer att:

  • Nyinhämtade SharePoint-filer analyseras automatiskt när pipelinen uppdateras.
  • Tolkade utgångar håller sig synkroniserade med inkommande data.
  • Efterföljande AI-pipelines arbetar alltid med uppdaterade dokumentrepresentationer.

Se ai_parse_document funktionen för stödda format och avancerade alternativ, inklusive version alternativet som fäster utdataschemat.

SharePoint metadatakolumn

Kolumnen _sharepoint_metadata är en dold metadatakolumn som ger åtkomst till SharePoint specifika egenskaper för inmatade filer som hämtas från resursen Microsoft Graph driveItem. Det kräver Databricks Runtime 18 LTS eller senare och är tillgängligt för alla filformat när du läser från SharePoint. Om du vill inkludera _sharepoint_metadata kolumnen i den returnerade DataFrame måste du uttryckligen välja den i läsfrågan.

Om datakällan innehåller en kolumn med namnet _sharepoint_metadata byts kolumnen SharePoint metadata om till __sharepoint_metadata (med ett extra inledande understreck) för att deduplicera. Ytterligare understreck läggs till tills namnet är unikt.

Vanliga filmetadata som filsökvägen eller storleken kan efterfrågas med hjälp av _metadata kolumnen. Mer information finns i kolumnen Filmetadata.

Schema

Kolumnen _sharepoint_metadata innehåller STRUCT följande fält. Alla fält är nullbara.

Namn Type Description Exempel
item_id STRING Objektets driveItem-ID. 01OMQ3MNLH42C5J675CBEI5CRK7SPKQUTZ
site_id STRING ID:t för den SharePoint webbplats som innehåller objektet. mytenant.sharepoint.com,69dc7b12-f92c-498d-9514-596b793a1f77,c6c1db8d-2b8d-48a1-a549-394b63d74725
drive_id STRING ID:t för disken som innehåller objektet. b!EnvcaSz5jUmVFFlreTofd43bwcaNK6FIpUk5S2PXRyWTvQraaWQkSpwQEgThHDS-
enhetstyp STRING Typ av enhet, till exempel documentLibrary för SharePoint bibliotek eller business för OneDrive för företag. documentLibrary
parent_id STRING ID för föräldrarmappen i DriveItem. 01OMQ3MNN6Y2GOVW7725BZO354PWSELRRZ
parent_name STRING Namnet på den överordnade mappen. Shared Documents
parent_path STRING Den drivrelativa sökvägen för den överordnade mappen. /drives/b!EnvcaSz5.../root:
web_url STRING Webbläsarens URL för objektet på SharePoint. https://mytenant.sharepoint.com/sites/TestSite/_layouts/15/Doc.aspx?sourcedoc=...
MIME-typ STRING MIME-typen för objektet. application/vnd.ms-excel
created_by_email STRING E-postmeddelandet för användaren som skapade objektet. alice@example.onmicrosoft.com
created_by_name STRING Visningsnamnet för den användare som skapade objektet. Alice Example
created_timestamp TIMESTAMP Den tid då objektet skapades. 2025-12-03 13:33:12
senast_ändrad_av_e-post STRING E-postmeddelandet för den användare som senast ändrade objektet. alice@example.onmicrosoft.com
last_modified_by_name STRING Visningsnamnet för den användare som senast ändrade objektet. Alice Example
etag STRING Objektets ETag. Ändringar när objektet eller någon av dess metadata ändras. "{D485E667-FDFB-4810-8E8A-2AFC9EA85279},1"
ctag STRING Objektets ändringstagg. Ändras endast när objektets innehåll ändras. "c:{D485E667-FDFB-4810-8E8A-2AFC9EA85279},1"
description STRING Objektbeskrivningen, om den har angetts. Q4 financial report
additional_metadata VARIANT Andra fält driveItem som returneras av Microsoft Graph men inte extraheras ovan. {"shared":{"scope":"users"},...}

Anmärkning

Fältet additional_metadata returneras som VARIANT. Se VARIANT typ.

Exempel

I följande exempel visas hur du inkluderar _sharepoint_metadata kolumnen i en läsfråga, väljer specifika fält i kolumnen och extraherar värden från fältet additional_metadataVARIANT .

Python

df = (spark.read
        .format("binaryFile")
        .option("databricks.connection", "my_sharepoint_conn")
        .load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents")
        .select("*", "_metadata", "_sharepoint_metadata"))

SQL

SELECT *, _sharepoint_metadata
FROM read_files(
  "https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
  `databricks.connection` => "my_sharepoint_conn",
  format => "binaryFile"
);

Välj specifika fält från structen _sharepoint_metadata :

df = (spark.read
        .format("binaryFile")
        .option("databricks.connection", "my_sharepoint_conn")
        .load("https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents")
        .select("_sharepoint_metadata.item_id", "_sharepoint_metadata.etag"))

Extrahera värden från fältet additional_metadataVARIANT med hjälp av castoperatorn :: :

SELECT
  *,
  _sharepoint_metadata.additional_metadata:shared:scope::STRING AS shared_scope
FROM read_files(
  "https://mytenant.sharepoint.com/sites/Marketing/Shared%20Documents",
  `databricks.connection` => "my_sharepoint_conn",
  format => "binaryFile"
);

Inhämta SharePoint-sidor

SharePoint lagrar Webbplatssidor som .aspx filer i en webbplats Sidor-bibliotek, separat från dess dokumentbibliotek. Att ta in Site Pages kräver Databricks Runtime 19 eller högre. För mer information om webbplatssidor, se SharePoint-sidor och sidmodellen.

Du kan ta in webbplatssidor på följande sätt:

Sökvägstyp Description
Enskild sida Öppna sidan i SharePoint och kopiera URL:en från adressfältet.
https://mytenant.sharepoint.com/sites/test-site/SitePages/my-news-post.aspx
Webbplatssidor-biblioteket Öppna webbplatssidor från webbplatsinnehåll och kopiera URL:en från adressfältet.
https://mytenant.sharepoint.com/sites/test-site/SitePages
Webbplats eller underwebbplats När du inhämtar en webbplats eller undersida inhämtar Azure Databricks Site Pages-biblioteket tillsammans med webbplatsens dokumentbibliotek.
https://mytenant.sharepoint.com/sites/test-site

Importera webbplatsens sidor som vilken annan fil som helst:

Python

# Read a single Site Page
df = (spark.read
        .format("binaryFile")
        .option("databricks.connection", "my_sharepoint_conn")
        .load("https://mytenant.sharepoint.com/sites/test-site/SitePages/my-news-post.aspx"))

# Read a site's Site Pages library
df = (spark.read
        .format("binaryFile")
        .option("databricks.connection", "my_sharepoint_conn")
        .option("pathGlobFilter", "*.aspx") # optional. Example: only ingest Site Page files
        .load("https://mytenant.sharepoint.com/sites/test-site/SitePages"))

# Read all Site Pages from a site
df = (spark.read
        .format("binaryFile")
        .option("databricks.connection", "my_sharepoint_conn")
        .option("recursiveFileLookup", True)
        .option("pathGlobFilter", "*.aspx") # optional. Example: only ingest Site Page files
        .load("https://mytenant.sharepoint.com/sites/test-site"))

SQL

-- Read a single Site Page
CREATE TABLE site_page AS
SELECT * FROM read_files(
  "https://mytenant.sharepoint.com/sites/test-site/SitePages/my-news-post.aspx",
  `databricks.connection` => "my_sharepoint_conn",
  format => "binaryFile"
);

-- Read a site's Site Pages library
CREATE TABLE site_pages AS
SELECT * FROM read_files(
  "https://mytenant.sharepoint.com/sites/test-site/SitePages",
  `databricks.connection` => "my_sharepoint_conn",
  format => "binaryFile",
  pathGlobFilter => "*.aspx" -- optional. Example: only ingest Site Page files
);

-- Read all Site Pages from a site
CREATE TABLE site_with_pages AS
SELECT * FROM read_files(
  "https://mytenant.sharepoint.com/sites/test-site",
  `databricks.connection` => "my_sharepoint_conn",
  format => "binaryFile",
  recursiveFileLookup => true,
  pathGlobFilter => "*.aspx" -- optional. Example: only ingest Site Page files
);

Auto Loader, COPY INTO, och andra gränssnitt fungerar med Site Pages på samma sätt som vilken annan fil som helst. Se exempel för exempel på intag.

Begränsningar

Standard-SharePoint-anslutningsappen har följande begränsningar.

  • Du kan inte mata in flera webbplatser med samma fråga. Om du vill mata in från två platser måste du skriva två separata frågor.
  • Du kan använda alternativet pathGlobFilter för att filtrera filer efter namn. Mappsökvägsbaserad filtrering stöds inte.
  • SharePoint-listor stöds inte.
  • Det går inte att skriva tillbaka till en SharePoint server.
  • Automatisk inläsare cleanSource (borttagning eller arkivering av filer vid källan efter inmatning) stöds inte.

Nästa steg