Platformy danych obsługiwane w Data Science Virtual Machine

Dzięki Data Science Virtual Machine (DSVM) można tworzyć zasoby analityczne na wielu platformach danych. Oprócz interfejsów do zdalnych platform danych, DSVM udostępnia lokalne wystąpienie umożliwiające szybkie tworzenie i opracowywanie prototypów.

Maszyna DSVM obsługuje następujące narzędzia platformy danych:

Edycja deweloperska SQL Server

Kategoria Wartość
Co to jest? Lokalne wystąpienie relacyjnej bazy danych
Obsługiwane edycje DSVM Windows 2019, Linux (SQL Server 2019)
Typowe zastosowania
  • Szybkie programowanie lokalne z mniejszym zestawem danych
  • Uruchomienie R w bazach danych
Linki do przykładów
  • Mały przykład zestawu danych w Nowym Jorku jest ładowany do bazy danych SQL:
    nyctaxi
  • Znajdź przykład programu Jupyter pokazujący Microsoft Machine Learning Server i analizy w bazie danych pod adresem:
    ~notebooks/SQL_R_Services_End_to_End_Tutorial.ipynb
Powiązane narzędzia na maszynie DSVM
  • SQL Server Management Studio
  • Sterowniki ODBC/JDBC
  • pyodbc, RODBC

Uwaga

SQL Server Developer Edition można używać tylko do celów programistycznych i testowych. Potrzebujesz licencji lub jednej z maszyn wirtualnych SQL Server do jej uruchomienia w środowisku produkcyjnym.

Uwaga

Wsparcie dla autonomicznego programu Machine Learning Server zakończyło się 1 lipca 2021 r. Zostały usunięte z obrazów DSVM 30 czerwca 2021 r. Istniejące wdrożenia nadal mają dostęp do oprogramowania, ale wsparcie techniczne zakończyło się po 1 lipca 2021 r.

Uwaga

SQL Server Developer Edition został usunięty z obrazów maszyny DSVM w listopadzie 2021 r. Istniejące wdrożenia nadal mają zainstalowane SQL Server Developer Edition. W nowych wdrożeniach, aby uzyskać dostęp do SQL Server Developer Edition, zainstaluj go i użyj za pośrednictwem obsługi platformy Docker. Aby uzyskać więcej informacji, odwiedź Quickstart: Uruchamianie obrazów kontenerów SQL Server za pomocą platformy Docker.

Windows

Ustawienia

Serwer bazy danych jest już wstępnie skonfigurowany, a usługi Windows związane z SQL Server (na przykład SQL Server (MSSQLSERVER)) są ustawiane na automatyczne uruchamianie. Jedynym krokiem ręcznym jest włączenie analizy w bazie danych za pomocą programu Microsoft Machine Learning Server. Uruchom następujące polecenie, aby włączyć analizę jako jednorazową akcję w programie SQL Server Management Studio (SSMS). Uruchom to polecenie po zalogowaniu się jako administrator maszyny, otwórz nowe zapytanie w programie SSMS i wybierz master bazę danych:

CREATE LOGIN [%COMPUTERNAME%\SQLRUserGroup] FROM WINDOWS 

(Zastąp ciąg %COMPUTERNAME% nazwą maszyny wirtualnej).

Aby uruchomić SQL Server Management Studio, możesz wyszukać ciąg "SQL Server Management Studio" na liście programów lub użyć Windows Wyszukaj, aby go znaleźć i uruchomić. Po wyświetleniu monitu o podanie poświadczeń wybierz pozycję Windows Authentication i użyj nazwy komputera lub localhost w polu Nazwa serwera SQL.

Jak go używać i uruchamiać

Domyślnie serwer bazy danych z domyślnym wystąpieniem bazy danych jest uruchamiany automatycznie. Aby uzyskać dostęp do bazy danych SQL Server lokalnie, możesz użyć narzędzi takich jak SQL Server Management Studio na maszynie wirtualnej. Konta administratorów lokalnych mają dostęp administratora do bazy danych.

Ponadto maszyna DSVM jest dostarczana z sterownikami ODBC i JDBC do komunikacji z

  • SQL Server
  • Azure SQL baz danych
  • Zasoby Azure Synapse Analytics dla aplikacji napisanych w wielu językach, w tym Python i Machine Learning Server.

Jak jest on skonfigurowany i zainstalowany na maszynie DSVM?

SQL Server jest instalowany w standardowy sposób. Można go znaleźć na stronie C:\Program Files\Microsoft SQL Server. Instancję serwera Machine Learning w bazie danych można znaleźć na stronie C:\Program Files\Microsoft SQL Server\MSSQL13.MSSQLSERVER\R_SERVICES. Maszyna DSVM ma również oddzielną, samodzielną instancję serwera uczenia maszynowego zainstalowaną w C:\Program Files\Microsoft\R Server\R_SERVER. Te dwa wystąpienia Serwerów Uczenia Maszynowego nie udostępniają bibliotek.

Ubuntu

Przed użyciem maszyny DSVM z systemem Ubuntu musisz najpierw zainstalować SQL Server Developer Edition. Aby uzyskać więcej informacji, odwiedź Quickstart: Instalowanie SQL Server i tworzenie bazy danych w systemie Ubuntu.

Apache Spark 2.x (autonomiczny)

Kategoria Wartość
Co to jest? Samodzielna instancja (na jednym węźle w procesie) popularnej platformy Apache Spark; system do szybkiego przetwarzania danych na dużą skalę i uczenia maszynowego.
Obsługiwane edycje DSVM Linux
Typowe zastosowania
  • Szybkie tworzenie aplikacji Spark/PySpark lokalnie przy użyciu mniejszego zestawu danych i późniejszego wdrażania w dużych klastrach Spark, takich jak Azure HDInsight
  • Testowanie kontekstu platformy Spark serwera Microsoft Machine Learning
  • Użyj biblioteki SparkML lub open-source'owej biblioteki Microsoft MMLSpark do tworzenia aplikacji ML.
Linki do przykładów Przykład Jupyter:
  • ~/notebooks/SparkML/pySpark
  • ~/notebooks/MMLSpark

Microsoft Machine Learning Server (kontekst Spark): /dsvm/samples/MRSSparkContextSample.R

Powiązane narzędzia na maszynie DSVM
  • PySpark, Scala
  • Jupyter (Kernele Spark/PySpark)
  • Microsoft Machine Learning Server, SparkR, Sparklyr
  • Apache Drill

Korzystanie

Możesz uruchomić polecenie spark-submit lub polecenie pyspark, aby przesłać zadania platformy Spark w wierszu poleceń. Możesz również utworzyć nowy notatnik za pomocą jądra Spark, aby stworzyć notatnik Jupyter.

Aby używać platformy Spark z języka R, należy używać bibliotek, takich jak SparkR, Sparklyr i Microsoft Machine Learning Server, które są dostępne na maszynie DSVM. Zobacz linki do przykładów w poprzedniej tabeli.

Ustawienia

Przed uruchomieniem procesu w środowisku platformy Spark w programie Microsoft Machine Learning Server w wersji DSVM na systemie Ubuntu Linux, należy najpierw wykonać jednorazową konfigurację w celu uruchomienia lokalnego jednosesyjnego węzła Hadoop HDFS i instancji YARN. Domyślnie usługi Hadoop są instalowane, ale wyłączone na maszynie DSVM. Aby je włączyć, uruchom następujące polecenia jako root przy pierwszym użyciu.

echo -e 'y\n' | ssh-keygen -t rsa -P '' -f ~hadoop/.ssh/id_rsa
cat ~hadoop/.ssh/id_rsa.pub >> ~hadoop/.ssh/authorized_keys
chmod 0600 ~hadoop/.ssh/authorized_keys
chown hadoop:hadoop ~hadoop/.ssh/id_rsa
chown hadoop:hadoop ~hadoop/.ssh/id_rsa.pub
chown hadoop:hadoop ~hadoop/.ssh/authorized_keys
systemctl start hadoop-namenode hadoop-datanode hadoop-yarn

Aby zatrzymać usługi związane z platformą Hadoop, gdy nie są już potrzebne, uruchom polecenie systemctl stop hadoop-namenode hadoop-datanode hadoop-yarn.

Przykład demonstrujący, jak opracowywać i testować usługę MRS w zdalnym kontekście platformy Spark (niezależna instancja Spark na maszynie DSVM) jest udostępniony i dostępny w katalogu /dsvm/samples/MRS.

Jak jest on skonfigurowany i zainstalowany na maszynie DSVM?

Platforma Lokalizacja instalacji ($SPARK_HOME)
Linux /dsvm/tools/spark-X.X.X-bin-hadoopX.X

Biblioteki do uzyskiwania dostępu do danych z usługi Azure Blob Storage lub Azure Data Lake Storage przy użyciu bibliotek Microsoft MMLSpark uczenia maszynowego są wstępnie zainstalowane w $SPARK_HOME/jars. Te pliki JAR są ładowane automatycznie po uruchomieniu platformy Spark. Domyślnie platforma Spark używa danych znajdujących się na dysku lokalnym.

Instancja Spark na DSVM może uzyskiwać dostęp do danych przechowywanych w Blob storage lub Azure Data Lake Storage. Najpierw należy utworzyć i skonfigurować core-site.xml plik na podstawie szablonu znajdującego się w pliku $SPARK_HOME/conf/core-site.xml.template. Aby uzyskać dostęp do usługi Blob Storage i Azure Data Lake Storage, musisz również mieć odpowiednie poświadczenia. Pliki szablonów używają elementów zastępczych dla konfiguracji Blob storage i Azure Data Lake Storage.

Aby uzyskać więcej informacji na temat tworzenia poświadczeń usługi Azure Data Lake Storage, odwiedź Uwierzytelnianie w Azure Data Lake Storage Gen1. Po wprowadzeniu poświadczeń dla usługi Blob Storage lub Azure Data Lake Storage w pliku core-site.xml można odwoływać się do danych przechowywanych w tych źródłach za pomocą prefiksu identyfikatora URI wasb:// lub adl://.