Alianza tecnológica desarrolla MRC para acelerar entrenamiento de IA en redes GPU

OpenAI, AMD, Broadcom, Intel, Microsoft y Nvidia han unido esfuerzos para desarrollar el protocolo Multipath Reliable Connection (MRC), diseñado para mejorar el rendimiento y la resiliencia de las redes de GPU en grandes clústeres de entrenamiento. Esta iniciativa, que ya está disponible para toda la industria a través del Open Compute Project (OCP), busca acelerar el entrenamiento de inteligencia artificial a gran escala.

El entrenamiento de modelos de IA de vanguardia depende de redes de supercomputadoras confiables que puedan transferir datos rápidamente entre GPU de forma sincronizada. Sin embargo, a medida que los sistemas escalan y los clústeres aumentan, la dependencia de estas redes crece. Deben funcionar con rapidez y eficiencia, coordinar cientos de miles de GPU de manera sincronizada, intercambiar millones de datos y recuperarse rápidamente de interrupciones.

Considerando que la red determina directamente cuánta capacidad de procesamiento se puede aprovechar, las compañías líderes en IA se han unido a OpenAI para desarrollar un protocolo que acelere el entrenamiento al mejorar el rendimiento y la resiliencia de la red de GPU en grandes clústeres.

El protocolo MRC fue desarrollado durante dos años por tecnológicas como AMD, Broadcom, Intel, Microsoft y Nvidia. Ahora, está disponible para toda la industria a través del Open Compute Project (OCP), según detalló OpenAI en un comunicado.

Este protocolo está diseñado específicamente para entornos de entrenamiento de IA a gran escala, ofreciendo comunicación continua y de alta velocidad para evitar interrupciones. En lugar de enviar tráfico por una única ruta, MRC distribuye los paquetes simultáneamente a través de múltiples rutas, según explicó la tecnológica.

Así, el protocolo se integra en las interfaces de red de 800 Gb/s más recientes, permitiendo distribuir una sola transferencia a través de cientos de rutas, sorteando fallos en microsegundos y ejecutando planos de control de red más sencillos.

Esto reduce los puntos críticos de congestión de datos y limita la variación de latencia que puede ralentizar el entrenamiento sincronizado, según explicó AMD en un comunicado. Cuando se producen fallos, el protocolo MRC permite que la red se adapte rápidamente, redirigiendo el tráfico prácticamente en tiempo real.

“En términos prácticos, MRC ayuda a convertir la red en un amortiguador para la infraestructura de IA. En lugar de provocar interrupciones ante cada evento, MRC permite que la red se adapte local y rápidamente para que las cargas de trabajo puedan seguir avanzando”, detalló AMD.

OpenAI también especificó que el protocolo MRC se apoya en el estándar de RDMA sobre Ethernet Convergente (RoCE) de la InfiniBand Trade Association (IBTA), además de basarse en técnicas desarrolladas por el Ultra Ethernet Consortium (UEC).

Con todo ello, MRC ya se ha implementado en todos los superordenadores NVIDIA GB200 más grandes de OpenAI, utilizados para entrenar modelos de vanguardia, así como en los superordenadores Fairwater de Microsoft.

Asimismo, la especificación MRC ya está disponible como contribución al Open Compute Project (OCP) para que la comunidad la utilice y desarrolle.

Fuente: Infobae

COMPARTIR ESTA NOTICIA

Facebook
Twitter

FACEBOOK