Tillhandahåll lakehouse-data

Synkronisera en Unity Catalog-tabell till Postgres och fråga den tillsammans med dina driftdata.

Steg: (1) Skapa analysdata → (2) Synkronisera med Lakebase → (3) Hitta dina data i Postgres → (4) Fråga i båda världarna

Note

Det här är en snabbstart. Fullständig dokumentation finns i Synkronisera tabeller.

Innan du börjar

  • Kontrollera att du har slutfört Hämta en Postgres-databas. Du behöver ett Lakebase-projekt med exempeldata.
  • Ett SQL-lager eller en notebook-fil för Unity Catalog-frågor.
  • USE_SCHEMA och CREATE_TABLE i schemat där du skapar den synkroniserade tabellen.

Steg 1: Skapa analysdata i Unity Catalog

Anta att ditt datateam har skapat poäng för användarsegmentering i lakehouse-miljön. I produktion är detta en guldtabell, ML-utdata eller berikad datamängd. I den här guiden skapar du ett litet exempel.

I ett SQL-datalager eller en anteckningsbok kör du följande:

CREATE TABLE main.default.user_segments AS
SELECT * FROM VALUES
  (1, 'power_user', 0.92),
  (2, 'casual', 0.35),
  (3, 'power_user', 0.88)
AS segments(user_id, segment, engagement_score);

Observera att värdena i user_id motsvarar kolumnen id i tabellen playing_with_lakebase från Kom igång. Det är avsiktligt. Du ansluter dem i steg 4.

Läs mer: Källtyper som stöds

Steg 2: Synkronisera tabellen till Lakebase

I din Azure Databricks-arbetsyta går du till Katalog i sidofältet. Välj tabellen user_segments för att öppna informationssidan och klicka sedan på Skapa>synkroniserad tabell.

I dialogrutan Skapa synkroniserad tabell väljer du Lakebase-projektets databricks_postgres databas som mål och Ögonblicksbild som synkroniseringsläge. Ögonblicksbilden kopierar data en gång, vilket är det enklaste alternativet för att komma igång.

Synkroniseringen körs automatiskt. När den är klar visas en ny skrivskyddad tabell i din Lakebase-databas. Schemanamnet från Unity Catalog blir schemanamnet i Postgres, och tabellnamnet får suffixet _synced: default.user_segments_synced.

Läs mer: Skapa en synkroniserad tabell (fullständig procedur) | Synkroniseringslägen

Steg 3: Hitta dina data i Postgres

Växla till Lakebase SQL-redigeraren. Analysdata från Unity Catalog är nu frågebara med Standard Postgres SQL. Leta efter användare 1:

SELECT * FROM "default".user_segments_synced WHERE user_id = 1;

Note

default måste anges eftersom det är ett reserverat PostgreSQL-nyckelord. Det synkroniserade tabellschemat ärver schemanamnet för Unity-katalogen, så om schemat heter defaultmåste du alltid citera det i frågor.

Du bör se användaren 1 med segment power_user och en engagemangspoäng på 0.92. Det här är samma rad som du skapade i Unity Catalog, som nu är tillgänglig i Postgres med läsningar med låg svarstid.

Läs mer: Datatypsmappning

Steg 4: Sök i båda världarna

Här är utbetalningen. Din playing_with_lakebase tabell har driftdata. Din user_segments_synced tabell har stöd för lakehouse-analys. Anslut dem:

SELECT
  p.id,
  p.name,
  p.value,
  s.segment,
  s.engagement_score
FROM playing_with_lakebase p
JOIN "default".user_segments_synced s ON p.id = s.user_id;

Ditt program kan nu hantera berikade data. En enskild Postgres-fråga kombinerar vad appen vet (namn, värden) med vad lakehouse beräknade (segment, poäng). Inga API-anrop till lakehouse, inga synkroniseringsskript, ingen svarstidsstraff.

Läs mer: Kapacitetsplanering

Nästa steg