Compró los aceleradores y la gráfica de utilización sigue a la mitad. Rara vez son las tarjetas: es un fabric que descarta paquetes durante la comunicación colectiva, y una sola pérdida hace que todo el trabajo espere una retransmisión. Diseñamos redes de clúster de IA según cómo se comporta realmente el trabajo: un fabric spine-leaf sin sobresuscripción, Ethernet sin pérdidas con RoCEv2, PFC y ECN ajustados para su clúster en lugar de copiados de una guía, y un plano de gestión fuera de banda que sigue respondiendo cuando el fabric no. Dimensionada honestamente desde un solo rack de 8 tarjetas hasta un despliegue multisala, y presupuestada para la óptica y las NIC, no solo los switches.
Cuatro problemas que encontramos en casi todos los clústeres que nos llaman:
Un fabric plano y no bloqueante construido en torno a un requisito: no descartar el paquete:
Arquitectura dibujada por AtlasCommTech siguiendo prácticas de diseño de nivel operador. Las etiquetas del diagrama se mantienen en inglés para mayor claridad técnica.
Por qué nosotros: nuestro fundador pasó 13 años dentro del ecosistema de socios de Huawei entregando redes de operador. En el mundo operador se aprende que un fabric se juzga por su peor momento, no por su media, que es exactamente la disciplina que necesita un clúster de IA, porque un trabajo de entrenamiento solo es tan rápido como su operación colectiva más lenta.
La solución se dimensiona primero según sus requisitos y presupuesto: la misma arquitectura puede entregarse sobre las líneas de varios fabricantes. Le ayudamos a elegir según la disponibilidad de suministro en su país de destino, el presupuesto y los hábitos de operación de su equipo.
Seis cosas que hace un fabric de IA y que a una red de centro de datos corriente nunca se le piden:
Díganos el número de tarjetas, la disposición de los nodos y qué pueden alimentar y refrigerar realmente sus racks: el nivel le dice la forma del fabric:
| Nivel de escala | Sitio típico | Qué incluye el diseño |
|---|---|---|
| Rack único, desde 8 tarjetas | Un nodo o unos pocos · un piloto o un clúster de investigación pequeño · una sala | Un par de switches leaf, sin capa spine en absoluto: a este tamaño los leaves se hablan directamente y un spine es una capa comprada para el diagrama. La configuración sin pérdidas y la gestión fuera de banda siguen estando, porque es lo que hace de esto un clúster y no ocho ordenadores caros en un rack. |
| Clúster de GPU mediano | Varios racks en una sala · trabajos de entrenamiento en producción · un planificador delante | Un fabric spine-leaf completo sin sobresuscripción, un par de leaves por rack, RoCEv2 con PFC y ECN ajustados a su tráfico real y no a una plantilla, una ruta de almacenamiento separada para que las escrituras de puntos de control no choquen con el tráfico de entrenamiento, un plano fuera de banda completo y telemetría por cola exportada desde el inicio. |
| Despliegue multisala | Más racks de los que una sala puede alimentar · varias naves o edificios · tramos largos entre ellas | Un fabric por sala con una capa entre salas por encima, las distancias de los tramos determinando la elección de óptica y esa elección determinando gran parte del presupuesto, una conversación sobre ubicación de trabajos con quien opere el planificador para que un trabajo no se reparta entre salas innecesariamente, y una verificación real de potencia y refrigeración antes de dibujar la topología, porque a este tamaño el edificio decide el diseño, y no al revés. |
La solución se construye con estas categorías de equipos; la marca se elige con usted en la fase de diseño. Los modelos exactos dependen del número de tarjetas, la disposición de NIC de los nodos, las velocidades de puerto y el país, así que especificamos modelos después de su lista de requisitos, no antes.
| Rol | Qué hace |
|---|---|
| Switches leaf (acceso de rack) | Un puerto de alta velocidad por acelerador, búferes lo bastante profundos para absorber una ráfaga colectiva, y la configuración sin pérdidas que realmente la sostiene. Se dimensionan según la disposición de NIC de su nodo, no según lo que quepa en un diagrama de rack. |
| Switches spine (núcleo del fabric) | Dan a cada leaf un camino de un salto hacia cualquier otro leaf sin sobresuscripción. La densidad de puertos aquí decide a cuántos racks podrá crecer el clúster, así que se dimensiona para el clúster al que se dirige, no para el que empieza. |
| Óptica y cableado | Cada enlace de alta velocidad necesita dos transceptores y un cable, y la cuenta llega a cientos rápido. El alcance, el tipo de conector y las distancias entre racks deciden la elección, y esta partida suele ser mayor que la de los switches, por eso insistimos en dimensionarla pronto. |
| Switches de gestión fuera de banda | Una red pequeña, barata y aparte que llega a cada puerto de gestión de la sala. Es el equipo menos interesante de esta página y lo primero que agradecerá, porque es el único camino de entrada la noche en que el fabric es el problema. |
| Conmutación de la ruta de almacenamiento | Las escrituras de puntos de control y las lecturas de conjuntos de datos son ráfagas a su manera, y ponerlas en las mismas colas que el tráfico de entrenamiento es como un fabric bien ajustado vuelve a descartar. Se separan por ruta o por clase de prioridad, según su cadencia de puntos de control. |
| Plataforma de telemetría / gestión | Exporta profundidad por cola, recuentos de pausas PFC, marcas ECN y descartes, para que una caída de utilización pueda atribuirse en vez de debatirse. Sin esto, la red es culpable por defecto en cada reunión, y normalmente inocente en realidad. |
Envíenos su número de tarjetas, la disposición de NIC de los nodos, los límites de potencia y refrigeración de sus racks y su cadencia de puntos de control, y la lista de modelos vendrá después. Ese orden mantiene honesto el diseño.
Un ingeniero responde con un diseño de fabric, un recuento de óptica y NIC y la lista de categorías de equipos. Envíe su lista de requisitos: la lista de modelos vendrá después.