Vous avez acheté les accélérateurs et le graphe d'utilisation stagne à la moitié. Ce sont rarement les cartes — c'est un fabric qui perd des paquets en communication collective, et une seule perte fait attendre tout le job pour une retransmission. Nous concevons les réseaux de cluster IA selon le comportement réel du job : un fabric spine-leaf sans surabonnement, un Ethernet sans perte avec RoCEv2, PFC et ECN réglés pour votre cluster plutôt que copiés d'un guide, et un plan de gestion hors bande qui répond encore quand le fabric ne répond plus. Dimensionné honnêtement d'une seule baie de 8 cartes à un déploiement multi-salles — et budgété pour l'optique et les cartes réseau, pas seulement les commutateurs.
Quatre problèmes que nous trouvons dans presque chaque cluster qui nous appelle :
Un fabric plat et non bloquant bâti autour d'une seule exigence — ne pas perdre le paquet :
Architecture dessinée par AtlasCommTech selon les pratiques de conception de niveau opérateur. Les libellés du schéma restent en anglais pour la clarté technique.
Pourquoi nous : notre fondateur a passé 13 ans dans l'écosystème partenaire de Huawei à livrer des réseaux opérateurs. C'est dans l'opérateur qu'on apprend qu'un fabric se juge à son pire moment, pas à sa moyenne — précisément la discipline dont un cluster IA a besoin, car un job d'entraînement ne va pas plus vite que sa plus lente opération collective.
La solution est d'abord dimensionnée selon vos besoins et votre budget — la même architecture peut être livrée sur les gammes de plusieurs fabricants. Nous vous aidons à choisir selon la disponibilité d'approvisionnement dans votre pays, le budget et les habitudes d'exploitation de votre équipe.
Six choses qu'un fabric IA fait et qu'on ne demande jamais à un réseau de centre de données ordinaire :
Dites-nous le nombre de cartes, la configuration des nœuds et ce que vos baies peuvent réellement alimenter et refroidir — le palier vous donne la forme du fabric :
| Palier d'échelle | Site typique | Ce que comprend la conception |
|---|---|---|
| Baie unique, à partir de 8 cartes | Un nœud ou quelques-uns · un pilote ou un petit cluster de recherche · une salle | Une paire de commutateurs leaf, sans aucune couche spine — à cette taille les leaves se parlent directement et un spine est une couche achetée pour le schéma. La configuration sans perte et la gestion hors bande restent, car c'est ce qui en fait un cluster plutôt que huit ordinateurs coûteux dans une baie. |
| Cluster GPU de taille moyenne | Plusieurs baies dans une salle · jobs d'entraînement en production · un ordonnanceur en amont | Un fabric spine-leaf complet sans surabonnement, une paire de leaves par baie, RoCEv2 avec PFC et ECN réglés sur votre trafic réel plutôt qu'un gabarit, un chemin de stockage séparé pour que les écritures de points de contrôle n'entrent pas en collision avec le trafic d'entraînement, un plan hors bande complet, et une télémétrie par file exportée dès le départ. |
| Déploiement multi-salles | Plus de baies qu'une salle ne peut alimenter · plusieurs halls ou bâtiments · longues portées entre eux | Un fabric par salle avec une couche inter-salles au-dessus, les distances dictant le choix optique et le choix optique dictant une grande part du budget, une discussion sur le placement des jobs avec l'exploitant de l'ordonnanceur pour qu'un job ne chevauche pas inutilement deux salles, et une vérification de la réalité électrique et thermique avant de tracer la topologie — car à cette taille, c'est le bâtiment qui décide de la conception, pas l'inverse. |
La solution s'appuie sur ces catégories d'équipement — la marque est choisie avec vous à la conception. Les modèles exacts dépendent du nombre de cartes, de la configuration des cartes réseau, des vitesses de port et du pays — nous les spécifions après votre liste de besoins, pas avant.
| Rôle | Ce qu'il fait |
|---|---|
| Commutateurs leaf (accès baie) | Un port haut débit par accélérateur, des tampons assez profonds pour absorber une rafale collective, et la configuration sans perte qui la soutient réellement. Dimensionnés d'après la configuration des cartes réseau de votre nœud, pas d'après ce qui tient dans un schéma de baie. |
| Commutateurs spine (cœur du fabric) | Donnent à chaque leaf un chemin en un saut vers tout autre leaf, sans surabonnement. La densité de ports décide ici du nombre de baies que le cluster pourra atteindre — elle est donc dimensionnée pour le cluster visé, pas celui de départ. |
| Optique et câblage | Chaque lien haut débit nécessite deux transceivers et un câble, et le compte grimpe vite à des centaines. Portée, type de connecteur et distances entre baies décident du choix — et cette ligne est généralement plus grosse que celle des commutateurs, d'où notre insistance à la chiffrer tôt. |
| Commutateurs de gestion hors bande | Un petit réseau bon marché et séparé, atteignant chaque port de gestion de la salle. C'est l'équipement le moins intéressant de cette page et le premier dont vous serez reconnaissant — car c'est le seul chemin d'entrée la nuit où le fabric est le problème. |
| Commutation du chemin de stockage | Les écritures de points de contrôle et les lectures de jeux de données ont leur propre irrégularité, et les placer sur les mêmes files que le trafic d'entraînement, c'est ainsi qu'un fabric bien réglé se remet à perdre. Séparés par chemin ou par classe de priorité, selon votre cadence de points de contrôle. |
| Plateforme de télémétrie / gestion | Exporte la profondeur par file, le nombre de pauses PFC, les marquages ECN et les rejets, pour qu'un creux d'utilisation soit attribué plutôt que débattu. Sans cela, le réseau est coupable par défaut à chaque réunion — et généralement innocent en fait. |
Envoyez-nous le nombre de cartes, la configuration des cartes réseau, les limites d'alimentation et de refroidissement de vos baies et votre cadence de points de contrôle — la liste des modèles suivra. Cet ordre garde la conception honnête.
Un ingénieur répond avec une conception de fabric, un décompte d'optique et de cartes réseau, et la liste des catégories d'équipement. Envoyez votre liste de besoins — la liste des modèles suivra.