Ściągawka planowania zadań produkcyjnych

Ten artykuł ma na celu przedstawienie jasnych i dobrze określonych wskazówek dotyczących planowania zadań produkcyjnych. Zastosowanie najlepszych rozwiązań może pomóc zmniejszyć koszty, poprawić wydajność i zaostrzyć zabezpieczenia.

Najlepsze rozwiązanie Wpływ Dokumenty
Używanie bezserwerowych obliczeń dla zadań Koszt: zadania bezserwerowe nie wymagają konfiguracji klastra. Azure Databricks automatycznie zarządza aprowizowaniem i skalowaniem.
Korzystaj z zadań Lakeflow do orkiestracji, zawsze kiedy to możliwe. Cost: Nie trzeba używać narzędzi zewnętrznych do orkiestracji, jeśli orkiestrujesz tylko obciążenia na Azure Databricks.
Uruchamianie zadań produkcyjnych przy użyciu jednostek usługi zamiast kont użytkowników Zabezpieczenia: jeśli zadania należą do poszczególnych użytkowników, gdy ci użytkownicy opuszczają grupę, te zadania mogą przestać działać.
W przypadku klasycznych obliczeń: użyj klastrów zadań dla zautomatyzowanych przepływów pracy Koszt: klastry zadań są rozliczane według niższych stawek niż klastry interaktywne.
W przypadku klasycznych obliczeń: ponowne uruchamianie długotrwałych klastrów Zabezpieczenia: uruchom ponownie klastry, aby skorzystać z poprawek i poprawek błędów w środowisku Databricks Runtime.
W przypadku obliczeń klasycznych: użyj najnowszej wersji LTS środowiska Databricks Runtime Wydajność i koszt: Azure Databricks zawsze doskonali Runtime Databricks pod kątem użyteczności, wydajności i zabezpieczeń.
W przypadku klasycznych obliczeń: nie przechowuj danych produkcyjnych w katalogu głównym systemu plików DBFS Zabezpieczenia: gdy dane są przechowywane w katalogu głównym systemu plików DBFS, wszyscy użytkownicy mogą uzyskać do niego dostęp.