Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Questa pagina contiene materiale di riferimento per il connettore Microsoft SharePoint in Databricks Lakeflow Connect.
sharepoint_options Parametri
Impostare queste opzioni all'interno del connector_options.sharepoint_options blocco di ogni tabella nella definizione della pipeline.
| Parametro | Type | Obbligatorio | Description |
|---|---|---|---|
entity_type |
Stringa | Sì | Tipo di entità da inserire. Valori supportati: FILE (inserire solo i metadati e il contenuto del file), FILE_METADATA (inserire metadati, senza scaricare il contenuto del file). |
url |
Stringa | Sì | URL del sito SharePoint, del sito secondario, dell'unità o della cartella da cui inserire. Esempi:
Per informazioni dettagliate sul formato URL, vedere Leggere i file da SharePoint. |
file_ingestion_options |
oggetto | Sì | Controlla il formato di file e il comportamento di inserimento. Vedere file_ingestion_options i parametri. |
parametri file_ingestion_options
Impostare queste opzioni all'interno di sharepoint_options.file_ingestion_options.
| Parametro | Type | Obbligatorio | Description |
|---|---|---|---|
format |
Stringa | Sì | Formato di file da inserire. Valori supportati: BINARYFILE, CSV, JSON, XMLEXCEL, PARQUET, , AVRO, ORC. Usare BINARYFILE per l'inserimento non strutturato (PDF, file di Office, immagini). Usare un formato strutturato per analizzare il contenuto del file in righe. |
file_filters |
Matrice di oggetti | No | Filtri che limitano i file inseriti. Ogni oggetto filtro può contenere una delle chiavi seguenti:
|
schema_evolution_mode |
Stringa | No | Controlla la modalità di gestione delle nuove colonne nei file in ingresso. Le modalità corrispondono alle modalità di evoluzione dello schema del caricatore automatico. Valori supportati: ADD_NEW_COLUMNS_WITH_TYPE_WIDENING (impostazione predefinita), ADD_NEW_COLUMNS, RESCUE, FAIL_ON_NEW_COLUMNS, NONE. |
schema_hints |
Stringa | No | Esegue l'override dei tipi di colonna dedotti. Specificare come elenco delimitato da virgole di column_name TYPE coppie, ad esempio order_id INT, amount DOUBLE. Vedere Eseguire l'override dell'inferenza dello schema con gli hint dello schema. |
format_options |
oggetto | No | Opzioni di analisi specifiche del formato. Le chiavi sono nomi di opzioni di formato standard del caricatore automatico. Vedere Opzioni di formato. |
table_configuration Parametri
Impostare queste opzioni all'interno del table_configuration blocco di ogni tabella nella definizione della pipeline.
table_configuration è un elemento di pari livello , connector_optionsnon annidato al suo interno.
| Parametro | Type | Obbligatorio | Description |
|---|---|---|---|
storage_mode |
Stringa | No | Modalità di archiviazione per la tabella di destinazione. Valori supportati:
Poiché si tratta dei valori predefiniti e degli unici valori supportati, l'impostazione storage_mode esplicita è facoltativa. Non usare il scd_type campo . Genera un errore. |
Opzioni di formattazione
Il format_options blocco accetta le chiavi di opzione di formato standard del caricatore automatico, organizzate di seguito in base al formato di file. Per informazioni dettagliate su qualsiasi opzione, vedere Caricamento automatico.
JSON
| Key | Description |
|---|---|
allowBackslashEscapingAnyCharacter |
Consente alle barre rovesciata di eseguire l'escape di qualsiasi carattere. |
allowComments |
Consente commenti in stile Java e C++ nel contenuto JSON. |
allowNonNumericNumbers |
Consente NaN e Infinity come valori float validi. |
allowNumericLeadingZeros |
Consente zeri iniziali in valori interi. |
allowSingleQuotes |
Consente virgolette singole come delimitatori di stringa oltre alle virgolette doppie. |
allowUnquotedControlChars |
Consente caratteri di controllo senza virgolette nelle stringhe JSON. |
allowUnquotedFieldNames |
Consente nomi di campo non racchiusi tra virgo chiave. |
badRecordsPath |
Percorso per archiviare record danneggiati o non analizzabili invece di avere esito negativo nella pipeline. |
charset / encoding |
Codifica dei caratteri del file , ad esempio UTF-8, ISO-8859-1. |
dateFormat |
Modello per l'analisi delle stringhe di data (ad esempio, yyyy-MM-dd). |
dropFieldIfAllNull |
Ignora le colonne in cui tutti i valori sono null o vuoti durante l'inferenza dello schema. |
inferTimestamp |
TimestampType Deduce per le stringhe che corrispondono a un modello di timestamp. |
lineSep |
Carattere separatore di riga o stringa. |
locale |
Impostazioni locali per l'analisi di date e numeri (ad esempio, en-US). |
mode |
Comportamento per i record in formato non valido: PERMISSIVE (impostazione predefinita), DROPMALFORMEDo FAILFAST. |
multiLine |
Analizza i record che si estendono su più righe. |
prefersDecimal |
DecimalType Deduce invece di FloatType o DoubleType laddove possibile. |
primitivesAsString |
Deduce tutti i valori primitivi come StringType. |
readerCaseSensitive |
Abilita la corrispondenza tra nomi di colonna con distinzione tra maiuscole e minuscole rispetto allo schema. |
timestampFormat |
Modello per l'analisi delle stringhe di timestamp (ad esempio, yyyy-MM-dd'T'HH:mm:ss). |
timeZone |
Fuso orario per l'analisi dei timestamp (ad esempio, UTC, America/New_York). |
CSV
Supporta tutte le opzioni JSON precedenti, oltre alle opzioni specifiche di CSV seguenti:
| Key | Description |
|---|---|
charToEscapeQuoteEscaping |
Carattere di escape utilizzato prima di un carattere virgolette all'interno di un campo tra virgolette. |
comment |
Carattere che contrassegna una riga come commento; le righe che iniziano con questo carattere vengono ignorate. |
delimiter / sep |
Carattere delimitatore di colonna (impostazione predefinita: ,). |
emptyValue |
Stringa da utilizzare per i valori vuoti durante la scrittura. |
enforceSchema |
Applica lo schema dichiarato ai dati CSV, ignorando i nomi di intestazione. |
escape |
Carattere di escape (impostazione predefinita: \). |
header |
Indica se la prima riga contiene nomi di colonna (impostazione predefinita: false). |
ignoreLeadingWhiteSpace |
Taglia gli spazi vuoti iniziali dai valori. |
ignoreTrailingWhiteSpace |
Elimina gli spazi vuoti finali dai valori. |
maxCharsPerColumn |
Numero massimo di caratteri consentiti per ogni valore di colonna. |
maxColumns |
Numero massimo di colonne consentite in un record. |
mergeSchema |
Unisce lo schema tra più file CSV. |
nanValue |
Rappresentazione di stringa di NaN. |
negativeInf |
Rappresentazione di stringa dell'infinito negativo. |
nullValue |
Stringa che rappresenta un valore Null. |
parserCaseSensitive |
Abilita la corrispondenza con distinzione tra maiuscole e minuscole tra nomi di intestazione e nomi dei campi dello schema. |
positiveInf |
Rappresentazione di stringa dell'infinito positivo. |
preferDate |
Deduce le DateType stringhe simili a date anziché TimestampType. |
quote |
Carattere virgolette usato per racchiudere i valori di campo che contengono il delimitatore (impostazione predefinita: "). |
skipRows |
Numero di righe da ignorare all'inizio del file prima dell'intestazione o dei dati. |
unescapedQuoteHandling |
Come gestire i caratteri virgolette senza caratteri di escape all'interno di campi racchiusi tra virgolette. |
XML
| Key | Description |
|---|---|
arrayElementName |
Nome dell'elemento XML che esegue il wrapping di ogni elemento della matrice durante la scrittura. |
attributePrefix |
Prefisso aggiunto ai nomi degli attributi XML per distinguerli dai nomi degli elementi (impostazione predefinita: _). |
compression |
Codec di compressione per la lettura (ad esempio, gzip, bzip2). |
declaration |
Stringa di dichiarazione XML da anteporre durante la scrittura. |
encoding |
Codifica dei caratteri del file XML. |
excludeAttribute |
Esclude gli attributi degli elementi XML dall'analisi. |
ignoreSurroundingSpaces |
Ignora gli spazi vuoti che circondano i valori degli elementi. |
ignoreNamespace |
Ignora i prefissi dello spazio dei nomi XML durante l'analisi. |
locale |
Impostazioni locali per l'analisi di date e numeri. |
mode |
Comportamento per i record in formato non valido: PERMISSIVE, DROPMALFORMEDo FAILFAST. |
nullValue |
Stringa che rappresenta un valore Null. |
rootTag |
Nome del tag dell'elemento radice. |
rowTag |
Tag elemento XML che identifica ogni riga (obbligatorio). |
rowValidationXSDPath |
Percorso di un file di schema XSD per la convalida di ogni elemento di riga. |
samplingRatio |
Frazione di righe campionate per l'inferenza dello schema (impostazione predefinita: 1.0). |
timestampFormat |
Modello per l'analisi delle stringhe di timestamp. |
timestampNTZFormat |
Modello per l'analisi delle stringhe di timestamp senza fuso orario. |
timeZone |
Fuso orario per l'analisi dei timestamp. |
validateName |
Verifica che i nomi degli elementi XML siano conformi alla specifica XML. |
valueTag |
Nome tag usato per i valori di testo negli elementi che hanno anche attributi (impostazione predefinita: _VALUE). |
Parquet
| Key | Description |
|---|---|
datetimeRebaseMode |
Gestione delle date e dei timestamp scritti in formato calendario julian: EXCEPTION, CORRECTEDo LEGACY. |
int96RebaseMode |
Gestione dei timestamp INT96 scritti in formato calendario julian: EXCEPTION, CORRECTEDo LEGACY. |
mergeSchema |
Unisce lo schema tra più file Parquet. |
Avro
| Key | Description |
|---|---|
avroSchema |
Schema Avro in formato stringa JSON. Usare per applicare uno schema specifico durante le letture. |
datetimeRebaseMode |
Gestione delle date e dei timestamp scritti in formato calendario julian: EXCEPTION, CORRECTEDo LEGACY. |
mergeSchema |
Unisce lo schema tra più file Avro. |
Formato dati inseriti
Lo schema della tabella di destinazione dipende entity_type da e format da configurare.
Tipo di entità BINARYFILE (FILE)
Quando entity_type è e FILE è formatBINARYFILE , ogni file inserito diventa una riga con le colonne seguenti:
| Field | Type | Description |
|---|---|---|
path |
string |
Percorso del file. |
modificationTime |
timestamp |
Ora dell'ultima modifica del file. |
length |
bigint |
Le dimensioni del file in byte. |
content |
binary |
Contenuto del file. Databricks non consiglia di accedere direttamente a questa colonna. È invece possibile accedervi usando le UDF nel Downstream RAG use case. |
_file_id |
string |
Identificatore univoco di SharePoint del file. |
_sharepoint_metadata |
struct |
Contiene metadati specifici di SharePoint per il file:
|
_file_metadata |
struct |
Metadati di file standard aggiunti da Databricks durante l'inserimento:
|
Tipo di entità strutturata (FILE con formato strutturato)
Quando entity_type è FILE e format è un formato strutturato (CSV, JSON, XML, EXCELPARQUET, , AVROo ORC), lo schema della tabella di destinazione corrisponde allo schema dei file di origine. Le colonne vengono dedotte dal contenuto del file, soggette alle schema_evolution_mode impostazioni e schema_hints .
FILE_METADATA tipo di entità
Quando entity_type è FILE_METADATA, il contenuto del file non viene scaricato. La tabella di destinazione contiene solo le colonne di metadati degli _sharepoint_metadata struct e _file_metadata descritti in precedenza, più _file_id.