イントロダクション
すべての Azure Databricks ワークロードはコンピューティング リソースで実行されますが、間違ったコンピューティングの種類または構成を選択すると、不要なコスト、低パフォーマンス、またはブロックされた機能が発生します。 サーバーレス コンピューティング は秒単位で開始されますが、RDD API はサポートされていません。 クラシック コンピューティング は完全な柔軟性を提供しますが、より多くの管理オーバーヘッドが必要です。 SQL ウェアハウスは 分析クエリに優れていますが、 ジョブ クラスター では自動化されたワークフロー用に最適化されます。 これらの違いを理解することは、コンピューティングとワークロードの要件の一致に役立ちます。
コンピューティングの種類を選択するだけでなく、構成の決定によってワークロードの実行方法が決まります。 ノードの種類 によって、処理能力とメモリの可用性が決まります。 自動スケールは、 コストと応答性のバランスを取ります。 ライブラリのインストール中にコンピューティング リソースを使用できるユーザーは、アクセス許可によって制御され、コードに必要な依存関係が提供されます。 各構成の選択は、パフォーマンス、コスト、セキュリティ、運用の複雑さなど、複数のディメンションに影響します。
コンピューティング構成の適切な取得は、開発ライフサイクル全体を通して重要です。 探索中は、高速な反復サイクルと最小限のセットアップ オーバーヘッドが必要です。 生産では、安定性とコスト効率が優先されます。 Photon アクセラレーション を使用すると、SQL ワークロードのクエリ パフォーマンスが 2 倍になります。 インスタンス プール は起動時間を短縮しますが、アイドル状態の容量に対して料金を支払う必要があります。 専用アクセス モード を使用すると、アクセス許可の境界を適用しながら、セキュリティで保護されたグループコラボレーションが可能になります。
このモジュールでは、コンピューティング オプションを体系的に評価し、ワークロードの特性に一致するリソースを構成する方法について説明します。 サーバーレス コンピューティングが最適なエクスペリエンスを提供するタイミング、さまざまなシナリオのパフォーマンス設定を調整する方法、組織全体のアクセスと依存関係を管理するためのベスト プラクティスについて説明します。