Geschrieben von Actu IA
Der Rechenbedarf von KI-Forschern steigt weiter, da die Komplexität von Deep-Learning-Netzwerken (DL) und Trainingsdaten exponentiell zunimmt. Früher beschränkte sich das Training auf einige wenige GPUs, oft in Workstations. Heute werden beim Training routinemäßig Dutzende, Hunderte oder sogar Tausende von GPUs eingesetzt, um verschiedene Modellkonfigurationen und Parameter zu bewerten und zu optimieren. Darüber hinaus haben Unternehmen mehrere KI-Forscher, die alle viele Modelle gleichzeitig trainieren müssen. Diese Einrichtungen sind das Markenzeichen der weltweit führenden Forschungslabors und Universitäten und treiben die Innovationen voran, die wissenschaftliche Bemühungen aller Art vorantreiben.
Die Entwicklung und Implementierung einer groß angelegten Recheninfrastruktur für KI erfordert ein Verständnis der Rechenziele dieser Forscher, um schnelle, effiziente und kostengünstige Systeme zu entwickeln. Um ein flexibles System aufzubauen, das eine Vielzahl von Deep-Learning-Anwendungen auf skalierbare Weise ausführen kann, benötigen Unternehmen ein gut abgerundetes System, das mindestens Folgendes umfasst:
- Skalierbare und leistungsstarke Knoten mit mehreren Grafikprozessoren, großem Speicher und schnellen Verbindungen zwischen den Grafikprozessoren für Berechnungen, um die Vielfalt der verwendeten DL-Modelle zu unterstützen.
- Eine HDR-InfiniBand (IB)-Verbindung mit hoher Bandbreite und niedriger Latenz, deren Kapazität und Topologie Engpässe minimiert.
- Ein Speicherserver, der eine maximale Leistung für die verschiedenen Datenstrukturen bietet.
Diese Anforderungen, die mit Kostenerwägungen zur Maximierung des Gesamtwerts einhergehen, können mit den von PNY Technologies vertriebenen NVIDIA-Lösungen, den DGX SuperPODS, erfüllt werden.
Der NVIDIA DGX SuperPOD™ mit seinen DGX A100™ Systemen liefert bahnbrechende Leistung, ist als voll integriertes System in wenigen Wochen einsatzbereit und wurde entwickelt, um die schwierigsten Rechenprobleme der Welt zu lösen.
Das Design sieht die Einführung von Rechenblöcken vor, die als Scalable Units (SUs) bezeichnet werden und den modularen Einsatz eines vollständigen DGX SuperPOD mit 140 Knoten ermöglichen, der dann auf Hunderte von Knoten skaliert werden kann.
Diese Architektur wurde in der NVIDIA DGX SATURNV Infrastruktur eingesetzt, die NVIDIAs Forschung und Entwicklung in den Bereichen autonome Fahrzeuge, Verarbeitung natürlicher Sprache, Robotik, Grafik, HPC und anderen Bereichen unterstützt. Unternehmen, die eine eigene Supercomputing-Infrastruktur aufbauen möchten, können die NVIDIA DGX SuperPOD-Lösung für Unternehmen nutzen, die als schlüsselfertige Infrastrukturlösung zusammen mit einem kompletten Lebenszyklus fortschrittlicher Dienstleistungen von der Planung und dem Design bis hin zur Bereitstellung und laufenden Optimierung bereitgestellt wird.
NVIDIA Netzwerklösungen für DGX SuperPOD
Die Lösungen von NVIDIA Networking, ehemals Mellanox, dem führenden Anbieter von InfiniBand-Netzwerkinfrastrukturen, der 2020 von NVIDIA übernommen wurde, sind ein wesentlicher Bestandteil der DGX SuperPOD Infrastruktur. Sonia Cheriet, Sales Manager South Europe bei NVIDIA Networking, erzählt uns mehr.
Welche Rolle spielt die NVIDIA Networking-Infrastruktur in der SuperPODS-Architektur?
Sonia Cheriet Sr. Channel Sales Manager - Südeuropa, Mellanox Networking Solutions:
"Mit der Nvidia Networking-Technologie definieren wir das Rechenzentrum neu - mit einer Architektur, die selbst die komplexesten Probleme parallelisieren und so schnell wie möglich lösen kann. Der DGX A100 ist mit neuen Mellanox ConnectX-6 VPI-Netzwerkadaptern mit 200 Gbit/s HDR Infiniband ausgestattet - mit bis zu neun Schnittstellen pro System. Wir nutzen die Vorteile des Mellanox-Switchings, um die Verbindung von Systemen zu erleichtern und eine SuperPOD-Skalierung zu erreichen."
Was sind die Vorteile dieser Lösungen im Vergleich zu anderen Netzbetreibern?
Sonia Cheriet Sr. Channel Sales Manager - Südeuropa, Mellanox Networking Solutions :
"Unsere durchgängigen, GPU-beschleunigten, InfiniBand- und Ethernet-fähigen Netzwerklösungen ermöglichen es Unternehmen, eine Netzwerkinfrastruktur zu implementieren, die komplette Implementierungen von der Entwicklung bis zur Bereitstellung mit allen modernen Workloads und unterschiedlichen Speicheranforderungen unterstützt und so den Weg für die neue Ära des Accelerated Computing ebnet, um den Return on Investment in KI zu maximieren."
Können NVIDIA Networking-Lösungen auch in anderen Anwendungen eingesetzt werden?
Die Netzwerklösungen von NVIDIA erfüllen die exponentiell steigenden Anforderungen an die Effizienz, Verwaltbarkeit und Skalierbarkeit der Rechenleistung, die für die Märkte HPC, Web 2.0, ML, Datenanalyse und Speicherung erforderlich sind. Wir sind der einzige Anbieter, der komplette End-to-End-Lösungen anbietet, die InfiniBand- und Ethernet-Netzwerktechnologien unterstützen.
Beigetragen von Martin Jezequel, Produktmanager Data Center Solutions, PNY Technologies & Sonia Cheriet Sr. Channel Sales Manager - Southern Europe, Mellanox Networking Solutions.



