Installer les pilotes GPU NVIDIA sur les machines virtuelles série N exécutant Linux

S’applique à : ✔️ machines virtuelles Linux

Important

Pour s’aligner sur les pratiques linguistiques inclusives, cette documentation remplace le terme « liste noire » par « blocklist ». Ce changement reflète un engagement à éviter la terminologie susceptible de porter des connotations négatives involontaires ou de préjugés raciaux perçus. Toutefois, dans les extraits de code et les références techniques où « liste rouge » fait partie de la syntaxe ou des outils établis (par exemple, les fichiers de configuration, les paramètres de ligne de commande), le terme d’origine est conservé pour préserver la précision fonctionnelle. Cette utilisation est strictement technique et n’implique aucune intention discriminatoire.

Pour tirer parti des fonctionnalités de l’unité de traitement graphique (GPU) d’une machine virtuelle de série N Azure sauvegardée par des GPU NVIDIA, vous devez installer des pilotes GPU NVIDIA. L’extension de pilote GPU NVIDIA installe les pilotes NVIDIA Compute Unified Device Architecture (CUDA) ou GRID appropriés sur une machine virtuelle de série N. Vous pouvez installer et gérer l’extension à l’aide du portail Azure ou des outils tels que Azure PowerShell. Pour connaître les étapes de déploiement et de systèmes d’exploitation pris en charge, consultez la documentation sur l’extension de pilote GPU NVIDIA.

Pour installer manuellement les pilotes GPU NVIDIA, suivez les étapes décrites dans cet article. Les informations de configuration manuelle du pilote sont également disponibles pour les machines virtuelles Windows.

Pour obtenir des spécifications techniques, consultez les tailles de machine virtuelle Linux GPU.

Avertissement

L’installation de pilotes NVIDIA à l’aide de méthodes autres que celles décrites dans cet article peut entraîner l’échec de l’installation du pilote prévu. Microsoft et NVIDIA ne prennent pas en charge cette installation. Pour garantir une fonctionnalité et une prise en charge appropriées, suivez uniquement les étapes d’installation et utilisez les versions de pilote spécifiées dans cet article.


Pilotes CUDA

NVIDIA distribue les pilotes CUDA pour les machines virtuelles NCasT4_v3, NC_A100_v4 et NCads_H100_v5.

Pilotes CUDA pris en charge

Pour connaître les derniers pilotes CUDA et le système d’exploitation pris en charge, visitez le site web NVIDIA. Vérifiez que vous installez ou mettez à niveau vers le dernier pilote CUDA pris en charge pour votre distribution.

Installation du pilote CUDA

Pour l’installation du pilote CUDA, visitez le site web NVIDIA.

Vérifier l’installation du pilote CUDA

Exécutez nvidia-smi. Si le pilote est installé, NVIDIA SMI répertorie le GPU-Util en tant que N/A jusqu’à ce que vous exécutiez une charge de travail GPU sur la machine virtuelle.


Pilotes GRID

Microsoft redistribue les programmes d’installation de pilotes NVIDIA GRID pour les machines virtuelles NVv3, NCasT4_v3, NVadsA10_v5 et NCv6 RTX PRO 6000 BSE utilisées comme stations de travail virtuelles ou pour les applications virtuelles.

Pilotes GRID pris en charge

Installez ces pilotes GRID uniquement sur ces machines virtuelles et uniquement sur les systèmes d’exploitation répertoriés dans le tableau suivant. Ces pilotes incluent la licence du logiciel GRID Virtual GPU (vGPU) dans Azure. Vous n’avez pas besoin de configurer un serveur de licences logicielles NVIDIA vGPU.

Les séries NCasT4_v3 et NCv6 RTX PRO 6000 BSE sont les seules séries de machines virtuelles GPU non NV qui prennent en charge les pilotes GRID.

Avertissement

Les pilotes GRID NVIDIA v17.x (R550) ne sont plus pris en charge pour les machines virtuelles NVadsA10_v5. Si votre tentative de déploiement d’une machine virtuelle qui utilise un pilote invité v17.x se trouve sur un serveur avec le pilote hôte v20.x, cela entraîne l’échec du déploiement de votre machine virtuelle avec un message d’erreur Code 43.

Utilisez plutôt le pilote invité v18.x pour NVadsA10_v5 machines virtuelles répertoriées dans le tableau suivant.

Série de machines virtuelles Unité de traitement graphique (GPU) Pilote GRID Versions de système d’exploitation Linux prises en charge
NCv6 RTX PRO 6000 BSE NVIDIA RTX PRO 6000 Blackwell Server Edition GPU (96 Go) vGPU20.2 • Ubuntu 24.04 LTS
• Ubuntu 22.04 LTS
• Ubuntu 20.04 LTS
• Red Hat Enterprise Linux (RHEL) 9.4, 9.6, 9.7
• Red Hat Enterprise Linux (RHEL) 8.10
• SUSE Linux Enterprise Server 15 SP7
NCasT4_v3 GPU NVIDIA Tesla T4 (16 Go) vGPU20.2 • Ubuntu 24.04 LTS
• Ubuntu 22.04 LTS
• Ubuntu 20.04 LTS
• Red Hat Enterprise Linux (RHEL) 9.4, 9.6, 9.7
• Red Hat Enterprise Linux (RHEL) 8.10
NVadsA10_v5 GPU NVIDIA A10 (24 Go) vGPU18.8 • Ubuntu 24.04 LTS
• Ubuntu 22.04 LTS
• Ubuntu 20.04 LTS
• Red Hat Enterprise Linux (RHEL) 9.4, 9.6, 9.7
• Red Hat Enterprise Linux (RHEL) 8.10
NVv3 (retrait du 30 septembre 2026) GPU NVIDIA Tesla M60 (16 Go) vGPU16 (LTS) • Ubuntu 20.04 LTS
• Red Hat Enterprise Linux (RHEL) 8.6, 8.8, 8.9

Pour plus d’informations sur les versions spécifiques du processeur virtuel et de la branche de pilote, visitez le site web NVIDIA .

Installation du pilote GRID

  1. Vérifiez que le démarrage sécurisé et vTPM sont désactivés.

  2. Installer les prérequis.

    Ubuntu :

    sudo apt update 
    sudo apt install -y build-essential 
    

    RHEL (8.10, 9.4, 9.6, 9.7) :

    sudo yum check-update 
    sudo yum install -y make automake gcc gcc-c++ kernel-devel-$(uname -r) kernel-headers-$(uname -r) 
    
  3. Téléchargez le pilote Linux.

    a. Pour NCv6 RTX PRO 6000 BSE, NCasT4_v3 :

    wget -O ./NVIDIA-Linux-x86_64-595.58.03-grid-azure.run https://download.microsoft.com/download/51239696-ec04-4c02-a6b3-1d9c608fb57c/NVIDIA-Linux-x86_64-595.58.03-grid-azure.run
    

    b. Pour NVadsA10_v5 :

    wget -O ./NVIDIA-Linux-x86_64-570.211.01-grid-azure.run https://download.microsoft.com/download/2a04ca6a-9eec-40d9-9564-9cdea1ab795f/NVIDIA-Linux-x86_64-570.211.01-grid-azure.run
    

    c. Pour NVv3 :

    wget -O ./NVIDIA-Linux-x86_64-535.161.08-grid-azure.run https://download.microsoft.com/download/8/d/a/8da4fb8e-3a9b-4e6a-bc9a-72ff64d7a13c/NVIDIA-Linux-x86_64-535.161.08-grid-azure.run
    
  4. Installez le pilote.

    a. Pour NCv6 RTX PRO 6000 BSE :

    sudo chmod +x ./NVIDIA-Linux-x86_64-595.58.03-grid-azure.run
    sudo ./NVIDIA-Linux-x86_64-595.58.03-grid-azure.run -M open
    

    b. Pour NCasT4_v3 :

    sudo chmod +x ./NVIDIA-Linux-x86_64-595.58.03-grid-azure.run
    sudo ./NVIDIA-Linux-x86_64-595.58.03-grid-azure.run
    

    c. Pour NVadsA10_v5 :

    sudo chmod +x ./NVIDIA-Linux-x86_64-570.211.01-grid-azure.run
    sudo ./NVIDIA-Linux-x86_64-570.211.01-grid-azure.run
    

    d. Pour NVv3 :

    sudo chmod +x ./NVIDIA-Linux-x86_64-535.161.08-grid-azure.run
    sudo ./NVIDIA-Linux-x86_64-535.161.08-grid-azure.run
    

Vérifier l’installation du pilote GRID

Exécutez nvidia-smi. Si le pilote est installé, NVIDIA SMI répertorie le GPU-Util en tant que N/A jusqu’à ce que vous exécutiez une charge de travail GPU sur la machine virtuelle.


Dépannage

  • Vous pouvez définir le mode de persistance à l’aide de nvidia-smi. De cette façon, la sortie de la commande est plus rapide quand vous avez besoin d’effectuer une requête sur les cartes. Pour définir le mode de persistance, exécutez nvidia-smi -pm 1. Si la machine virtuelle est redémarrée, le paramètre de mode disparaît. Vous pouvez toujours scripter le paramètre de mode à exécuter au démarrage.

  • Si les travaux sont interrompus par des erreurs ECC sur le GPU (correctables ou irrécupérables), vérifiez d’abord si le GPU répond à l’un des critères RMA de Nvidia pour les erreurs ECC. Si le GPU est éligible à RMA, contactez le support technique sur l’obtention du service ; sinon, redémarrez votre machine virtuelle pour rattacher le GPU comme décrit ici. Les méthodes moins invasives, telles que nvidia-smi -r, ne fonctionnent pas avec la solution de virtualisation déployée dans Azure.


Étapes suivantes