Scritto da Actu IA
Le esigenze computazionali dei ricercatori di IA continuano ad aumentare con la crescita esponenziale della complessità delle reti di Deep Learning (DL) e dei dati di addestramento. In precedenza, l'addestramento era limitato a poche GPU, spesso in workstation. Oggi, la formazione utilizza abitualmente decine, centinaia o addirittura migliaia di GPU per valutare e ottimizzare diverse configurazioni e parametri del modello. Inoltre, le organizzazioni hanno più ricercatori di IA che hanno bisogno di addestrare molti modelli contemporaneamente. Queste strutture sono il segno distintivo dei laboratori di ricerca e delle università più importanti del mondo e alimentano l'innovazione che spinge gli sforzi scientifici di tutti i tipi.
La progettazione e l'implementazione di un'infrastruttura informatica su larga scala per l'IA richiede la comprensione degli obiettivi computazionali di questi ricercatori, al fine di costruire sistemi veloci, efficienti ed economici. Per costruire un sistema flessibile in grado di eseguire una moltitudine di applicazioni di Deep Learning in modo scalabile, le organizzazioni hanno bisogno di un sistema completo che comprenda, come minimo:
- Nodi scalabili e potenti con più GPU, ampia memoria e connessioni veloci tra le GPU per il calcolo, per supportare la varietà di modelli DL in uso.
- Un'interconnessione HDR InfiniBand (IB) ad alta larghezza di banda e bassa latenza, progettata con capacità e topologia tali da ridurre al minimo i colli di bottiglia.
- Un server di archiviazione in grado di fornire le massime prestazioni per le varie strutture di dati.
Questi requisiti, bilanciati con considerazioni di costo per massimizzare il valore complessivo, possono essere soddisfatti con le soluzioni NVIDIA distribuite da PNY Technologies, i DGX SuperPODS.
NVIDIA DGX SuperPOD™ con i suoi sistemi DGX A100™ offre prestazioni straordinarie, si installa in poche settimane come sistema completamente integrato ed è progettato per risolvere i problemi di computing più difficili del mondo.
Il suo design introduce blocchi di calcolo chiamati Scalable Units (SUs) che consentono l'implementazione modulare di un DGX SuperPOD completo di 140 nodi, che può quindi scalare fino a centinaia di nodi.
Questa architettura è stata sfruttata nell'infrastruttura NVIDIA DGX SATURNV che alimenta la ricerca e lo sviluppo di NVIDIA in veicoli autonomi, elaborazione del linguaggio naturale, robotica, grafica, HPC e altre aree. Le organizzazioni che desiderano implementare la propria infrastruttura di supercomputing possono sfruttare la soluzione NVIDIA DGX SuperPOD per le aziende, distribuita in una soluzione infrastrutturale "chiavi in mano", insieme a un ciclo completo di servizi avanzati che vanno dalla pianificazione e progettazione all'implementazione e all'ottimizzazione continua.
Soluzioni di rete NVIDIA per DGX SuperPOD
Le soluzioni di NVIDIA Networking, ex Mellanox, leader nell'infrastruttura di rete InfiniBand e acquisita da NVIDIA nel 2020, sono parte integrante dell'infrastruttura DGX SuperPOD. Sonia Cheriet, Sales Manager per il Sud Europa di NVIDIA Networking, ci spiega meglio.
Che ruolo svolge l'infrastruttura di networking NVIDIA nell'architettura SuperPODS?
Sonia Cheriet Sr. Channel Sales Manager - Southern Europe, Mellanox Networking Solutions:
""Con la tecnologia Nvidia Networking, stiamo ridefinendo il data center con un'architettura in grado di parallelizzare i problemi più complessi e di risolverli il più rapidamente possibile". Il DGX A100 è dotato di nuovi adattatori di rete Mellanox ConnectX-6 VPI con Infiniband HDR da 200 Gbit/s - fino a nove interfacce per sistema. Stiamo sfruttando lo switching di Mellanox per facilitare l'interconnessione dei sistemi e raggiungere la scala SuperPOD".
Quali sono i vantaggi di queste soluzioni rispetto ad altri operatori di rete?
Sonia Cheriet Sr. Channel Sales Manager - Sud Europa, Mellanox Networking Solutions :
""Le nostre soluzioni di rete end-to-end, accelerate dalle GPU e abilitate a InfiniBand ed Ethernet, consentono alle aziende di implementare un'infrastruttura di rete in grado di supportare implementazioni complete, dallo sviluppo alla distribuzione, con tutti i carichi di lavoro moderni e i diversi requisiti di storage, aprendo la strada alla nuova era dell'elaborazione accelerata per massimizzare il ritorno sugli investimenti nell'IA".
Le soluzioni di NVIDIA Networking possono essere trovate in altre applicazioni?
Le soluzioni di networking di NVIDIA rispondono alle esigenze in crescita esponenziale di maggiore efficienza della potenza di calcolo, gestibilità e scalabilità richieste dai mercati HPC, Web 2.0, ML, data analytics e storage. Siamo l'unico fornitore a offrire soluzioni end-to-end complete che supportano le tecnologie di rete InfiniBand ed Ethernet.
Contributo di Martin Jezequel, Product Manager Data Center Solutions, PNY Technologies e Sonia Cheriet Sr. Channel Sales Manager - Southern Europe, Mellanox Networking Solutions.



