Informazioni di riferimento sul connettore Microsoft SharePoint

Questa pagina contiene materiale di riferimento per il connettore Microsoft SharePoint in Databricks Lakeflow Connect.

sharepoint_options Parametri

Impostare queste opzioni all'interno del connector_options.sharepoint_options blocco di ogni tabella nella definizione della pipeline.

Parametro Type Obbligatorio Description
entity_type Stringa Tipo di entità da inserire. Valori supportati: FILE (inserire solo i metadati e il contenuto del file), FILE_METADATA (inserire metadati, senza scaricare il contenuto del file).
url Stringa URL del sito SharePoint, del sito secondario, dell'unità o della cartella da cui inserire. Esempi:
  • https://<tenant>.sharepoint.com/sites/<site>
  • https://<tenant>.sharepoint.com/sites/<site>/<folder>

Per informazioni dettagliate sul formato URL, vedere Leggere i file da SharePoint.
file_ingestion_options oggetto Controlla il formato di file e il comportamento di inserimento. Vedere file_ingestion_options i parametri.

parametri file_ingestion_options

Impostare queste opzioni all'interno di sharepoint_options.file_ingestion_options.

Parametro Type Obbligatorio Description
format Stringa Formato di file da inserire. Valori supportati: BINARYFILE, CSV, JSON, XMLEXCEL, PARQUET, , AVRO, ORC. Usare BINARYFILE per l'inserimento non strutturato (PDF, file di Office, immagini). Usare un formato strutturato per analizzare il contenuto del file in righe.
file_filters Matrice di oggetti No Filtri che limitano i file inseriti. Ogni oggetto filtro può contenere una delle chiavi seguenti:
  • path_filter (stringa): modello GLOB corrispondente ai percorsi di file. In base al filtro GLOB del percorso Spark.
  • modified_before (string): timestamp in YYYY-MM-DDTHH:mm:ss formato. Vengono inseriti solo i file modificati prima di questa volta.
  • modified_after (string): timestamp in YYYY-MM-DDTHH:mm:ss formato. Vengono inseriti solo i file modificati dopo questa volta.
schema_evolution_mode Stringa No Controlla la modalità di gestione delle nuove colonne nei file in ingresso. Le modalità corrispondono alle modalità di evoluzione dello schema del caricatore automatico. Valori supportati: ADD_NEW_COLUMNS_WITH_TYPE_WIDENING (impostazione predefinita), ADD_NEW_COLUMNS, RESCUE, FAIL_ON_NEW_COLUMNS, NONE.
schema_hints Stringa No Esegue l'override dei tipi di colonna dedotti. Specificare come elenco delimitato da virgole di column_name TYPE coppie, ad esempio order_id INT, amount DOUBLE. Vedere Eseguire l'override dell'inferenza dello schema con gli hint dello schema.
format_options oggetto No Opzioni di analisi specifiche del formato. Le chiavi sono nomi di opzioni di formato standard del caricatore automatico. Vedere Opzioni di formato.

table_configuration Parametri

Impostare queste opzioni all'interno del table_configuration blocco di ogni tabella nella definizione della pipeline. table_configuration è un elemento di pari livello , connector_optionsnon annidato al suo interno.

Parametro Type Obbligatorio Description
storage_mode Stringa No Modalità di archiviazione per la tabella di destinazione. Valori supportati:
  • SCD_TYPE_1 (impostazione predefinita per BINARYFILE): sovrascrive i record quando i file cambiano o vengono eliminati.
  • APPEND_ONLY (impostazione predefinita per i formati strutturati): aggiunge nuove righe da file nuovi o aggiornati.

Poiché si tratta dei valori predefiniti e degli unici valori supportati, l'impostazione storage_mode esplicita è facoltativa. Non usare il scd_type campo . Genera un errore.

Opzioni di formattazione

Il format_options blocco accetta le chiavi di opzione di formato standard del caricatore automatico, organizzate di seguito in base al formato di file. Per informazioni dettagliate su qualsiasi opzione, vedere Caricamento automatico.

JSON

Key Description
allowBackslashEscapingAnyCharacter Consente alle barre rovesciata di eseguire l'escape di qualsiasi carattere.
allowComments Consente commenti in stile Java e C++ nel contenuto JSON.
allowNonNumericNumbers Consente NaN e Infinity come valori float validi.
allowNumericLeadingZeros Consente zeri iniziali in valori interi.
allowSingleQuotes Consente virgolette singole come delimitatori di stringa oltre alle virgolette doppie.
allowUnquotedControlChars Consente caratteri di controllo senza virgolette nelle stringhe JSON.
allowUnquotedFieldNames Consente nomi di campo non racchiusi tra virgo chiave.
badRecordsPath Percorso per archiviare record danneggiati o non analizzabili invece di avere esito negativo nella pipeline.
charset / encoding Codifica dei caratteri del file , ad esempio UTF-8, ISO-8859-1.
dateFormat Modello per l'analisi delle stringhe di data (ad esempio, yyyy-MM-dd).
dropFieldIfAllNull Ignora le colonne in cui tutti i valori sono null o vuoti durante l'inferenza dello schema.
inferTimestamp TimestampType Deduce per le stringhe che corrispondono a un modello di timestamp.
lineSep Carattere separatore di riga o stringa.
locale Impostazioni locali per l'analisi di date e numeri (ad esempio, en-US).
mode Comportamento per i record in formato non valido: PERMISSIVE (impostazione predefinita), DROPMALFORMEDo FAILFAST.
multiLine Analizza i record che si estendono su più righe.
prefersDecimal DecimalType Deduce invece di FloatType o DoubleType laddove possibile.
primitivesAsString Deduce tutti i valori primitivi come StringType.
readerCaseSensitive Abilita la corrispondenza tra nomi di colonna con distinzione tra maiuscole e minuscole rispetto allo schema.
timestampFormat Modello per l'analisi delle stringhe di timestamp (ad esempio, yyyy-MM-dd'T'HH:mm:ss).
timeZone Fuso orario per l'analisi dei timestamp (ad esempio, UTC, America/New_York).

CSV

Supporta tutte le opzioni JSON precedenti, oltre alle opzioni specifiche di CSV seguenti:

Key Description
charToEscapeQuoteEscaping Carattere di escape utilizzato prima di un carattere virgolette all'interno di un campo tra virgolette.
comment Carattere che contrassegna una riga come commento; le righe che iniziano con questo carattere vengono ignorate.
delimiter / sep Carattere delimitatore di colonna (impostazione predefinita: ,).
emptyValue Stringa da utilizzare per i valori vuoti durante la scrittura.
enforceSchema Applica lo schema dichiarato ai dati CSV, ignorando i nomi di intestazione.
escape Carattere di escape (impostazione predefinita: \).
header Indica se la prima riga contiene nomi di colonna (impostazione predefinita: false).
ignoreLeadingWhiteSpace Taglia gli spazi vuoti iniziali dai valori.
ignoreTrailingWhiteSpace Elimina gli spazi vuoti finali dai valori.
maxCharsPerColumn Numero massimo di caratteri consentiti per ogni valore di colonna.
maxColumns Numero massimo di colonne consentite in un record.
mergeSchema Unisce lo schema tra più file CSV.
nanValue Rappresentazione di stringa di NaN.
negativeInf Rappresentazione di stringa dell'infinito negativo.
nullValue Stringa che rappresenta un valore Null.
parserCaseSensitive Abilita la corrispondenza con distinzione tra maiuscole e minuscole tra nomi di intestazione e nomi dei campi dello schema.
positiveInf Rappresentazione di stringa dell'infinito positivo.
preferDate Deduce le DateType stringhe simili a date anziché TimestampType.
quote Carattere virgolette usato per racchiudere i valori di campo che contengono il delimitatore (impostazione predefinita: ").
skipRows Numero di righe da ignorare all'inizio del file prima dell'intestazione o dei dati.
unescapedQuoteHandling Come gestire i caratteri virgolette senza caratteri di escape all'interno di campi racchiusi tra virgolette.

XML

Key Description
arrayElementName Nome dell'elemento XML che esegue il wrapping di ogni elemento della matrice durante la scrittura.
attributePrefix Prefisso aggiunto ai nomi degli attributi XML per distinguerli dai nomi degli elementi (impostazione predefinita: _).
compression Codec di compressione per la lettura (ad esempio, gzip, bzip2).
declaration Stringa di dichiarazione XML da anteporre durante la scrittura.
encoding Codifica dei caratteri del file XML.
excludeAttribute Esclude gli attributi degli elementi XML dall'analisi.
ignoreSurroundingSpaces Ignora gli spazi vuoti che circondano i valori degli elementi.
ignoreNamespace Ignora i prefissi dello spazio dei nomi XML durante l'analisi.
locale Impostazioni locali per l'analisi di date e numeri.
mode Comportamento per i record in formato non valido: PERMISSIVE, DROPMALFORMEDo FAILFAST.
nullValue Stringa che rappresenta un valore Null.
rootTag Nome del tag dell'elemento radice.
rowTag Tag elemento XML che identifica ogni riga (obbligatorio).
rowValidationXSDPath Percorso di un file di schema XSD per la convalida di ogni elemento di riga.
samplingRatio Frazione di righe campionate per l'inferenza dello schema (impostazione predefinita: 1.0).
timestampFormat Modello per l'analisi delle stringhe di timestamp.
timestampNTZFormat Modello per l'analisi delle stringhe di timestamp senza fuso orario.
timeZone Fuso orario per l'analisi dei timestamp.
validateName Verifica che i nomi degli elementi XML siano conformi alla specifica XML.
valueTag Nome tag usato per i valori di testo negli elementi che hanno anche attributi (impostazione predefinita: _VALUE).

Parquet

Key Description
datetimeRebaseMode Gestione delle date e dei timestamp scritti in formato calendario julian: EXCEPTION, CORRECTEDo LEGACY.
int96RebaseMode Gestione dei timestamp INT96 scritti in formato calendario julian: EXCEPTION, CORRECTEDo LEGACY.
mergeSchema Unisce lo schema tra più file Parquet.

Avro

Key Description
avroSchema Schema Avro in formato stringa JSON. Usare per applicare uno schema specifico durante le letture.
datetimeRebaseMode Gestione delle date e dei timestamp scritti in formato calendario julian: EXCEPTION, CORRECTEDo LEGACY.
mergeSchema Unisce lo schema tra più file Avro.

Formato dati inseriti

Lo schema della tabella di destinazione dipende entity_type da e format da configurare.

Tipo di entità BINARYFILE (FILE)

Quando entity_type è e FILE è formatBINARYFILE , ogni file inserito diventa una riga con le colonne seguenti:

Field Type Description
path string Percorso del file.
modificationTime timestamp Ora dell'ultima modifica del file.
length bigint Le dimensioni del file in byte.
content binary Contenuto del file. Databricks non consiglia di accedere direttamente a questa colonna. È invece possibile accedervi usando le UDF nel Downstream RAG use case.
_file_id string Identificatore univoco di SharePoint del file.
_sharepoint_metadata struct Contiene metadati specifici di SharePoint per il file:
  • id(string): identificatore SharePoint univoco del file.
  • site_id (string): identificatore del sito di SharePoint.
  • drive_id (string): identificatore dell'unità SharePoint.
  • drive_type(string): tipo di unità SharePoint.
  • parent_id (string): identificatore della cartella padre.
  • parent_name (string): nome della cartella padre.
  • parent_path (string): percorso della cartella padre.
  • web_url (string): collegamento al file in SharePoint.
  • mime_type (string): tipo MIME (formato) del file.
  • created_by_email (string): indirizzo di posta elettronica dell'utente che ha creato il file. Potrebbe essere Null se non disponibile.
  • created_by_name (string): nome dell'utente che ha creato il file. Potrebbe essere Null se non disponibile.
  • created_timestamp(timestamp): ora di creazione del file in SharePoint.
  • last_modified_by_email (string): indirizzo di posta elettronica dell'ultimo utente che ha modificato il file. Potrebbe essere Null se non disponibile.
  • last_modified_by_name (string): nome dell'ultimo utente che ha modificato il file. Potrebbe essere Null se non disponibile.
  • etag (string): tag di entità per il file.
  • ctag (string): tag di contenuto per il file.
  • description (string): Descrizione del file.
  • additional_metadata (variant): metadati di file aggiuntivi.
  • permissions (string): autorizzazioni per il file.
_file_metadata struct Metadati di file standard aggiunti da Databricks durante l'inserimento:
  • file_path (string): percorso di origine del file.
  • file_name (string): nome del file.
  • file_size (bigint): dimensioni del file in byte.
  • file_block_start (bigint): offset di byte iniziale del blocco di file.
  • file_block_length (bigint): lunghezza del blocco di file in byte.
  • file_modification_time (timestamp): ora dell'ultima modifica del file.

Tipo di entità strutturata (FILE con formato strutturato)

Quando entity_type è FILE e format è un formato strutturato (CSV, JSON, XML, EXCELPARQUET, , AVROo ORC), lo schema della tabella di destinazione corrisponde allo schema dei file di origine. Le colonne vengono dedotte dal contenuto del file, soggette alle schema_evolution_mode impostazioni e schema_hints .

FILE_METADATA tipo di entità

Quando entity_type è FILE_METADATA, il contenuto del file non viene scaricato. La tabella di destinazione contiene solo le colonne di metadati degli _sharepoint_metadata struct e _file_metadata descritti in precedenza, più _file_id.