Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Gilt für:✅ Fabric Data Engineering und Data Science
Individuelle Live-Pools sind vorhydrierte Spark-Cluster, die nahezu sofortige Sitzungsstarts für Notebooks in Fabric ermöglichen. In diesem Artikel wird gezeigt, wie Sie benutzerdefinierte Livepools erstellen, konfigurieren und verwalten, um eine optimale Leistung zu erzielen.
Voraussetzungen
Stellen Sie vor dem Einrichten von benutzerdefinierten Livepools folgendes sicher:
- Zugang zu einem Fabric-Arbeitsbereich mit einer bezahlten Fabric-SKU (Fabric-Testkapazitäten werden nicht unterstützt).
- Admin- oder Mitglied-Rolle im Arbeitsbereich.
- Eine aktive Fabric-Kapazität, die Ihrem Arbeitsplatz zugewiesen ist.
- Eine veröffentlichte Fabric-Umgebung , die für die Bibliothekskonfiguration verwendet werden soll.
- Ein bestehender, maßgeschneiderter Spark-Pool. Nur Workspace-Administratoren können eigene Spark-Pools erstellen.
Wenn Sie die Rolle Mitglied haben, muss ein Arbeitsbereichsadministrator die vorhandene Arbeitsbereichseinstellung Computekonfiguration für Elemente anpassen aktivieren.
Von Bedeutung
Starterpools werden für benutzerdefinierte Livepools nicht unterstützt. Wenn Ihr Arbeitsbereich einen Startpool verwendet, müssen Sie einen benutzerdefinierten Spark-Pool erstellen, bevor Sie einen benutzerdefinierten Livepool konfigurieren.
Verwenden Sie die vorhandene Compute-Anpassungseinstellung
Benutzerdefinierte Live-Pools verwenden die vorhandene Arbeitsbereichseinstellung Compute-Konfiguration für Elemente anpassen. Sie haben keine separate Delegationseinstellung. Bevor ein Workspace-Mitglied eine benutzerdefinierte Live-Pool-Konfiguration erstellen oder aktualisieren kann, muss ein Workspace-Administrator die bestehende Einstellung aktivieren:
Navigieren Sie zu Ihrem Fabric-Arbeitsbereich.
Wählen Sie "Arbeitsbereichseinstellungen" im Menüband für den Arbeitsbereich aus.
Erweitern Sie "Data Engineering/Science ", und wählen Sie "Spark"-Einstellungen aus.
Wählen Sie die Registerkarte "Pool " aus.
Aktiviere "Compute-Konfiguration anpassen" für Items.
Wählen Sie Speichern aus.
Wenn diese Einstellung aktiviert ist, können Mitglieder eine Fabric-Umgebung verwenden, um einen bestehenden benutzerdefinierten Spark-Pool auszuwählen, Session-Level-Treiberkerne, Treiberspeicher, Executor-Kerne und Executor-Speicher anzupassen und die Live-Pool-Konfiguration zu erstellen oder zu aktualisieren. Mitglieder können dann die Umgebung speichern und veröffentlichen.
Diese Einstellung erlaubt es Mitgliedern nicht, benutzerdefinierte Spark-Pools in den Arbeitsbereichseinstellungen zu erstellen oder zu verwalten. Ein Workspace-Administrator muss den zugrunde liegenden benutzerdefinierten Spark-Pool erstellen.
Wenn "Compute Configuration for Items anpassen " deaktiviert ist, verwenden die Umgebungen den Workspace-Standardpool und dessen Compute-Konfiguration. Mitglieder können keine benutzerdefinierte Live-Pool-Konfiguration erstellen oder aktualisieren, bis ein Workspace-Admin die Einstellung aktiviert.
Weitere Informationen zu dieser Arbeitsbereichssteuerung finden Sie unter Data Engineering Arbeitsbereichsverwaltungseinstellungen.
Erstellen Sie einen benutzerdefinierten Pool für den Live-Pool (nur für Admin)
Diese Aufgabe erfordert die Arbeitsbereichsrolle Admin. Wenn bereits ein benutzerdefinierter Spark-Pool existiert, können Workspace-Mitglieder diese Aufgabe überspringen und Live-Pool-Berechnung auf dem bestehenden Pool konfigurieren.
- Navigieren Sie zu Ihrem Fabric-Arbeitsbereich.
- Wählen Sie "Arbeitsbereichseinstellungen" im Menüband für den Arbeitsbereich aus.
- Erweitern Sie "Data Engineering/Science ", und wählen Sie "Spark"-Einstellungen aus.
- Wählen Sie die Registerkarte "Pool " aus.
- Wählen Sie im Dropdownmenü "Standardpool für Arbeitsbereich " die Option "Neuer Pool" aus.
- Geben Sie einen Namen für den Pool ein. Dieser Name ist eine eindeutige Kennung für den Pool, wie
dev-team-pooloderprod-daily-analytics. - Wählen Sie eine Knotenfamilie und knotengröße für Ihre Workload aus.
- Aktivieren Sie das Kontrollkästchen "Autoskalieren ", um die automatische Skalierung für den Pool zu aktivieren.
Konfigurieren eines Livepools
Workspace-Administratoren und -Mitglieder können über die Umgebungseinstellungen eine Live-Pool-Konfiguration erstellen oder aktualisieren. Für Mitglieder muss ein Workspace-Administrator zunächst die Anpassung der Compute-Konfiguration für Items aktivieren. Mitglieder müssen einen bestehenden benutzerdefinierten Spark-Pool auswählen, der von einem Workspace-Administrator erstellt wurde.
Öffnen Sie in Ihrem Fabric-Arbeitsbereich die Umgebung, die Sie an einen benutzerdefinierten Livepool anfügen möchten.
Wählen Sie im linken Bereich "Berechnen" aus.
Wählen Sie den Pool aus, den Sie im vorherigen Schritt erstellt haben, aus der Dropdownliste aus.
Wählen Sie unter "Live-Pool" das Optionsfeld aus, um die Berechnung des Livepools für diese Umgebung zu aktivieren.
Wählen Sie unter „Live-Pool-Zeitplan“ das Optionsfeld aus, um es zu aktivieren. Alle benutzerdefinierten Livepools müssen über einen Zeitplan verfügen. Cluster werden nur während des geplanten Fensters hydratisiert.
Geben Sie die Zeitplaneinstellungen an:
- Gibt an, ob der Zeitplan wiederholt wird.
- Start- und Endtag und -uhrzeit
- Zeitzone
- Wann der Pool deaktiviert und reaktiviert werden soll
- Andere Einstellungen wie zutreffend
Von Bedeutung
Fabric verwendet die standardmäßige Spark-Bereitstellung für Aktivitäten außerhalb des geplanten Fensters, die langsamere Startzeiten aufweist. Cluster werden außerhalb des vorgesehenen Zeitfensters nicht warm gehalten.
Tipps zur Planung finden Sie unter "Bewährte Methoden planen".
Speichern Sie die Computeeinstellungen.
Wählen Sie im oberen Menüband die Schaltfläche " Veröffentlichen " aus.
Nach der Veröffentlichung ist der Pool aktiv, und Fabric beginnt mit dem Hydratisieren der Cluster vor der nächsten Zeitplanperiode.
Hinweis
Die Veröffentlichung kann mehrere Minuten dauern.
Alle Änderungen an der Umgebung erfordern eine erneute Veröffentlichung der Umgebung und das Aktualisieren von hydratisierten Clustern.
Verstehen Sie das Zeitplanfenster
Der Zeitplan definiert das Zeitfenster, in dem Fabric Cluster hydratisiert hält und Cluster, die es deaktiviert hat, rehydrieren kann. Es hält den Live-Pool außerhalb des konfigurierten Fensters nicht warm.
Betrachten wir zum Beispiel einen wiederkehrenden Zeitplan, der jeden Tag von 8:00 Uhr bis 17:00 Uhr läuft:
- Um 8:00 Uhr beginnt das Tageszeitfenster und Fabric beginnt oder setzt die Flüssigkeitszufuhr fort.
- Während des Zeitplanfensters kann ein Leerlauf-Cluster nach der konfigurierten Leerlaufzeit deaktiviert werden. Fabric kann einen Ersatz entsprechend dem konfigurierten Reaktivierungsintervall rehydrieren.
- Um 17:00 Uhr endet das Zeitplanfenster. Fabric rehydratisiert Cluster nicht mehr zwischen 17:00 Uhr und 8:00 Uhr am nächsten Tag.
- Ein Notebook, das außerhalb des Zeitplanfensters eingereicht wird, verwendet die Standard-Spark-Bereitstellung und erhält nicht den Live-Pool-Warmstart-Vorteil.
- Das gleiche tägliche Verhalten wiederholt sich bis zum konfigurierten Zeitplan-Enddatum.
Der geplante Startzeitpunkt garantiert nicht, dass ein Cluster genau zu dieser Zeit bereits verfügbar ist. Hydrierung braucht Zeit, besonders nach einem Umgebungsupdate oder wenn Fabric einen neuen Cluster bereitstellen muss. Wenn ein geplantes Notebook um 8:00 Uhr gestartet werden muss, starten Sie den Zeitplan für den Live-Pool 60-90 Minuten früher. Bevor Sie das Notebook ausführen, verwenden Sie den Monitoring hub, um zu überprüfen, dass Available clusters größer als null ist. Ein eingehendes Notebook erhält nur dann eine Warm-Sitzung, wenn ein kompatibler, hydrierter Cluster verfügbar ist.
Überwachen des Poolstatus
So überprüfen Sie den Status Ihres benutzerdefinierten Livepools:
Öffnen Sie im Fabric-Portal den Monitoring Hub.
Suchen Sie die veröffentlichte Umgebung, und wählen Sie die Auslassungspunkte (...) aus, um das Kontextmenü zu öffnen.
Wählen Sie " Details anzeigen" aus.
Erweitern Sie im rechten Bereich den Status des Livepools , um den aktuellen Status des Pools anzuzeigen.
Der Status des Livepools enthält Details wie:
- Poolstatus: Beispielsweise "Aktiv", "Hydrating", "Leerlauf" oder "Beendet"
- Verfügbare Cluster: Anzahl der Cluster, die für Notizbuchsitzungen bereit sind
- Beschäftigter Cluster: Anzahl der derzeit ausgeführten Clustersitzungen
- Nächster Zeitplan: Anstehendes Aktivitätsfenster
Bewährte Methoden
Um benutzerdefinierte Livepools optimal zu verwenden, sollten Sie die folgenden bewährten Methoden für Konfiguration und Verwaltung berücksichtigen:
Optimieren für Kosten und Leistung
- Anzahl der Anforderungen ausrichten: Legen Sie die maximale Clusteranzahl basierend auf erwarteten gleichzeitigen Sitzungen fest. Die Überbereitstellung erhöht die Kosten.
- Überwachen der Auslastung: Überprüfen Sie die Poolmetriken regelmäßig, und passen Sie die Clusteranzahl bei Bedarf an.
- Skalieren Sie Zeitpläne effizient: Vermeiden Sie überlappende Zeitpläne für mehrere Pools, es sei denn, sie sind erforderlich.
- Nutzen Sie Leerlaufzeitlimits: Legen Sie geeignete Leerlaufzeitlimits fest, um ein Gleichgewicht zwischen der Ressourcenverfügbarkeit aufrechtzuerhalten und häufige Clusterneustarts zu vermeiden.
Clustergröße
Berücksichtigen Sie beim Konfigurieren ihres Pools die folgenden Einstellungen und Empfehlungen:
- Clustergröße: Die Anzahl der Executorinstanzen für Notizbuch-Sitzungen (Bereich: 1-16).
- Maximale Clusteranzahl: Die maximale Anzahl von Clustern, die hydratisiert bleiben sollen. Wird basierend auf erwarteten gleichzeitigen Sitzungen festgelegt.
- Leerlauftimeout: Wie lange ein nicht verwendeter Cluster zugeordnet bleibt, bevor Fabric es beendet.
| Workload-Typ | Empfohlene Größe | Beschreibung |
|---|---|---|
| Explorative Analyse | 2-4 Kerne | Leichte Workloads, schnelle Datensuche |
| Mittlere Rechenleistung | 8-12 Kerne | Tägliche Berichterstellung, Datasets mittlerer Größe |
| Schwere Berechnung | 14-16 Kerne | Große Datasets, komplexe Transformationen |
Verwalten von Bibliotheksabhängigkeiten
- Verwenden Sie die Umgebungsgruppierung: Vorabinstallation allgemeiner Bibliotheken in der Umgebung anstelle von "On-the-Fly-Installation".
- Umgebungsversionsverwaltung: Das Aktualisieren einer angefügten Umgebung erfordert eine erneute Veröffentlichung und Aktualisierung von hydratisierten Clustern.
- Aktualisieren Sie die aktualisierten Cluster: Nach Änderungen in der Umgebung aktualisieren Sie den Pool oder warten Sie, bis der nächste geplante Zyklus die Änderungen anwendet.
Anpassen an Arbeitsauslastungsmuster
- Externes Verhalten überwachen: Anpassen von Leerlauftimeouts basierend auf tatsächlichen Verwendungsmustern.
- Gemeinsame Nutzung über Sitzungen hinweg: Erwägen Sie die Gemeinsame Nutzung derselben Umgebung für mehrere Pools, wenn Sie über konsistente Arbeitsauslastungsmuster verfügen, um die Ressourcenauslastung zu verbessern.
Zeitplan für bewährte Praktiken
- Abstimmen auf Arbeitsauslastungsmuster: Planen Sie aktive Phasen, wenn Ihr Team interaktive oder geplante Notizbücher ausführt.
- Pufferzeit: Starte den Zeitplan 60–90 Minuten vor dem ersten erwarteten Notizbuchlauf, damit die Flüssigkeitszufuhr abgeschlossen ist.
- Verfügbarkeit überprüfen: Vor einem latenzsensitiven geplanten Lauf bestätigen Sie, dass der Live-Pool mindestens einen verfügbaren Cluster im Monitoring-Hub hat.
- Berücksichtigen Sie Zeitzonen: Wenn Ihr Team mehrere Zeitzonen umfasst, erweitern Sie den Zeitplan auf die erforderlichen Zeitbereiche.
Problembehandlung
Die Problembehandlung für benutzerdefinierte Livepools umfasst die Überprüfung des Poolstatus, der Umgebungsintegrität und der Zeitplankonfiguration, wie in den folgenden Szenarien beschrieben:
Pool ist weiterhin nicht verfügbar
Wenn der Pool nicht aktiviert wird oder den Status "Nicht verfügbar" anzeigt:
- Überprüfen Sie, ob die Fabric-Kapazität verfügbar ist und aktuell dem Arbeitsbereich zugewiesen ist
- Überprüfen Sie, ob sich die angefügte Umgebung im Zustand "Bereit" befindet.
- Stellen Sie sicher, dass die angefügte Umgebung veröffentlicht wird und keine Fehler vorliegen.
Die Hydratation dauert länger als erwartet
Wenn die Hydratation langsamer als erwartet ist:
- Überprüfen Sie Umgebungsabhängigkeiten und Buildstatus.
- Überprüfen Sie, ob sich die Umgebung im Zustand "Bereit" befindet.
- Prüfen Sie die Pooldetails, um weitere Informationen zu erhalten.
Sitzungen oder Notizbücher können nicht gestartet werden
Wenn Notebook-Sitzungen selbst mit einem aktiven Pool nicht gestartet werden können:
- Überprüfen Sie, ob die Sitzung die richtige Umgebung verwendet.
- Überprüfen Sie, ob sich der Pool im Status "Verfügbar" befindet und vollständig hydratisiert ist.
Live-Pool-Einstellungen sind nicht verfügbar
Wenn du die Live-Pool-Konfiguration nicht erstellen oder aktualisieren kannst:
- Überprüfen Sie, dass Sie die Rolle Admin oder Mitglied im Arbeitsbereich haben.
- Wenn Sie die Rolle Mitglied haben, bitten Sie einen Arbeitsbereichsadministrator, Compute-Konfiguration für Elemente anpassen zu aktivieren.
- Überprüfen Sie, ob ein Workspace-Administrator einen benutzerdefinierten Spark-Pool erstellt hat, den Sie in der Umgebung auswählen können.