Escrito por Actu IA
Las necesidades computacionales de los investigadores de IA siguen aumentando a medida que la complejidad de las redes de aprendizaje profundo (Deep Learning, DL) y los datos de entrenamiento crecen exponencialmente. Antes, el entrenamiento se limitaba a unas pocas GPU, a menudo en estaciones de trabajo. Hoy en día, el entrenamiento utiliza de forma rutinaria decenas, cientos o incluso miles de GPU para evaluar y optimizar diferentes configuraciones y parámetros del modelo. Además, las organizaciones cuentan con múltiples investigadores de IA que necesitan entrenar muchos modelos simultáneamente. Estas instalaciones son el sello distintivo de los principales laboratorios de investigación y universidades del mundo, y alimentan la innovación que impulsa los esfuerzos científicos de todo tipo.
Diseñar e implementar una infraestructura informática a gran escala para la IA requiere comprender los objetivos computacionales de estos investigadores para construir sistemas rápidos, eficientes y rentables. Para construir un sistema flexible que pueda ejecutar multitud de aplicaciones de aprendizaje profundo de forma escalable, las organizaciones necesitan un sistema completo que incluya, como mínimo:
- Nodos escalables y potentes con varias GPU, gran cantidad de memoria y conexiones rápidas entre GPU para realizar cálculos que admitan la variedad de modelos DL en uso.
- Una interconexión InfiniBand (IB) HDR de gran ancho de banda y baja latencia diseñada con la capacidad y topología necesarias para minimizar los cuellos de botella.
- Un servidor de almacenamiento capaz de ofrecer el máximo rendimiento para las distintas estructuras de datos.
Estos requisitos, equilibrados con consideraciones de coste para maximizar el valor global, pueden satisfacerse con las soluciones NVIDIA distribuidas por PNY Technologies, los DGX SuperPODS.
NVIDIA DGX SuperPOD™ con sus sistemas DGX A100™ ofrece un rendimiento sin precedentes, se despliega en semanas como un sistema totalmente integrado y está diseñado para resolver los problemas de computación más difíciles del mundo.
Su diseño introduce bloques informáticos denominados unidades escalables (SU) que permiten el despliegue modular de un DGX SuperPOD completo de 140 nodos, que luego puede escalarse a cientos de nodos.
Esta arquitectura se ha aprovechado en la infraestructura NVIDIA DGX SATURNV que impulsa la investigación y el desarrollo de NVIDIA en vehículos autónomos, procesamiento del lenguaje natural, robótica, gráficos, HPC y otras áreas. Las organizaciones que deseen implantar su propia infraestructura de supercomputación pueden aprovechar la solución NVIDIA DGX SuperPOD para empresas, desplegada en una solución de infraestructura llave en mano, junto con un ciclo de vida completo de servicios avanzados que abarcan desde la planificación y el diseño hasta la implantación y la optimización continua.
Soluciones de red NVIDIA para DGX SuperPOD
Las soluciones NVIDIA Networking, antes Mellanox, líder en infraestructura de redes InfiniBand y adquirida por NVIDIA en 2020, son parte integrante de la infraestructura DGX SuperPOD. Sonia Cheriet, Sales Manager para el sur de Europa de NVIDIA Networking, nos cuenta más detalles.
¿Qué papel desempeña la infraestructura de red NVIDIA en la arquitectura SuperPODS?
Sonia Cheriet Directora de Ventas de Canal - Sur de Europa, Mellanox Networking Solutions:
"Con la tecnología Nvidia Networking, estamos redefiniendo el centro de datos con una arquitectura capaz de paralelizar los problemas más complejos y resolverlos con la mayor rapidez posible. El DGX A100 viene con los nuevos adaptadores de red Mellanox ConnectX-6 VPI con 200 Gbit/s HDR Infiniband - hasta nueve interfaces por sistema. Estamos aprovechando la conmutación de Mellanox para facilitar la interconexión de sistemas y alcanzar la escala SuperPOD".
¿Cuáles son las ventajas de estas soluciones en comparación con otros agentes de redes?
Sonia Cheriet Directora de Ventas de Canal - Sur de Europa, Mellanox Networking Solutions :
""Nuestras soluciones de red integrales, aceleradas por GPU, habilitadas para InfiniBand y Ethernet permiten a las empresas implementar una infraestructura de red que puede soportar implementaciones completas desde el desarrollo hasta el despliegue con todas las cargas de trabajo modernas y diversos requisitos de almacenamiento, allanando el camino para la nueva era de la computación acelerada para maximizar su retorno de la inversión en IA.""
¿Se pueden encontrar soluciones de red NVIDIA en otras aplicaciones?
Las soluciones de red de NVIDIA responden a la demanda exponencialmente creciente de mayor eficiencia, manejabilidad y escalabilidad de la potencia de cálculo que exigen los mercados de HPC, Web 2.0, ML, análisis de datos y almacenamiento. Somos el único fabricante que ofrece soluciones integrales compatibles con las tecnologías de red InfiniBand y Ethernet.
Contribución de Martin Jezequel, Product Manager Data Center Solutions, PNY Technologies & Sonia Cheriet Sr. Channel Sales Manager - Southern Europe, Mellanox Networking Solutions.



