Écrit par Actu IA

Les besoins en calcul des chercheurs en IA continuent d'augmenter à mesure que la complexité des réseaux d'apprentissage profond (DL) et des données d'entraînement croît de manière exponentielle. Auparavant, l'entraînement était limité à quelques GPU, souvent dans des stations de travail. Aujourd'hui, la formation utilise couramment des dizaines, des centaines, voire des milliers de GPU pour évaluer et optimiser différentes configurations et paramètres de modèles. En outre, les organisations disposent de plusieurs chercheurs en IA qui ont tous besoin d'entraîner de nombreux modèles simultanément. Ces installations sont la marque de fabrique des principaux laboratoires de recherche et universités du monde, alimentant l'innovation qui propulse les efforts scientifiques de toutes sortes.

Concevoir et mettre en œuvre une infrastructure informatique à grande échelle pour l'IA nécessite de comprendre les objectifs de calcul de ces chercheurs afin de construire des systèmes rapides, efficaces et rentables. Pour construire un système flexible capable d'exécuter une multitude d'applications d'apprentissage profond de manière évolutive, les organisations ont besoin d'un système bien équilibré qui comprend, au minimum :

  • Des nœuds puissants et évolutifs dotés de plusieurs GPU, d'une mémoire importante et de connexions rapides entre les GPU pour les calculs afin de prendre en charge la diversité des modèles DL utilisés.
  • Une interconnexion HDR InfiniBand (IB) à large bande passante et à faible latence, conçue avec la capacité et la topologie nécessaires pour minimiser les goulets d'étranglement.
  • Un serveur de stockage capable de fournir des performances maximales pour les différentes structures de données.

Les solutions NVIDIA distribuées par PNY Technologies, les DGX SuperPODS, permettent de répondre à ces exigences, tout en tenant compte des considérations de coût pour maximiser la valeur globale.

NVIDIA-Super-Pod

Le NVIDIA DGX SuperPOD™ avec ses systèmes DGX A100™ délivre des performances exceptionnelles, se déploie en quelques semaines en tant que système entièrement intégré et est conçu pour résoudre les problèmes informatiques les plus difficiles.

Sa conception introduit des blocs de calcul appelés Scalable Units (SU) qui permettent le déploiement modulaire d'un DGX SuperPOD complet de 140 nœuds, qui peut ensuite s'étendre à des centaines de nœuds.

Cette architecture a été exploitée dans l'infrastructure NVIDIA DGX SATURNV qui alimente la recherche et le développement de NVIDIA dans les véhicules autonomes, le traitement du langage naturel, la robotique, le graphisme, le HPC et d'autres domaines. Les entreprises qui souhaitent déployer leur propre infrastructure de supercalcul peuvent s'appuyer sur la solution NVIDIA DGX SuperPOD pour les entreprises, déployée dans une infrastructure clé en main, avec un cycle de vie complet de services avancés, depuis la planification et la conception jusqu'au déploiement et à l'optimisation continue.

Solutions de mise en réseau NVIDIA pour DGX SuperPOD

 

Les solutions NVIDIA Networking, anciennement Mellanox, leader de l'infrastructure réseau InfiniBand et racheté par NVIDIA en 2020, font partie intégrante de l'infrastructure DGX SuperPOD. Sonia Cheriet, responsable des ventes pour l'Europe du Sud chez NVIDIA Networking, nous en dit plus.

Quel rôle joue l'infrastructure de réseau NVIDIA dans l'architecture SuperPODS ?

 

Sonia Cheriet Responsable des ventes au détail - Europe du Sud, Mellanox Networking Solutions :

"Avec la technologie Nvidia Networking, nous redéfinissons le centre de données avec une architecture capable de paralléliser les problèmes les plus complexes et de les résoudre le plus rapidement possible. Le DGX A100 est livré avec les nouveaux adaptateurs réseau Mellanox ConnectX-6 VPI avec 200 Gbit/s HDR Infiniband - jusqu'à neuf interfaces par système. Nous tirons parti de la commutation Mellanox pour faciliter l'interconnexion des systèmes et atteindre l'échelle SuperPOD".

Quels sont les avantages de ces solutions par rapport aux autres acteurs de la mise en réseau ?

 

Sonia Cheriet Responsable des ventes au détail - Europe du Sud, Mellanox Networking Solutions :

"Nos solutions réseau de bout en bout, accélérées par le GPU, InfiniBand et Ethernet permettent aux entreprises de mettre en place une infrastructure réseau capable de prendre en charge des implémentations complètes, du développement au déploiement, avec toutes les charges de travail modernes et divers besoins de stockage, ouvrant ainsi la voie à la nouvelle ère du calcul accéléré pour maximiser votre retour sur investissement dans l'IA."

Les solutions NVIDIA Networking peuvent-elles être utilisées dans d'autres applications ?

 

Les solutions de mise en réseau de NVIDIA répondent à l'augmentation exponentielle des demandes d'efficacité, de gestion et d'évolutivité de la puissance de calcul requises pour les marchés du HPC, du Web 2.0, de la ML, de l'analyse des données et du stockage. Nous sommes le seul fournisseur à proposer des solutions complètes de bout en bout qui prennent en charge les technologies de réseau InfiniBand et Ethernet.

Contribution de Martin Jezequel, Product Manager Data Center Solutions, PNY Technologies & Sonia Cheriet Sr. Channel Sales Manager - Southern Europe, Mellanox Networking Solutions.