Accueil / Solutions / Réseaux industriels et datacom / Réseau de centre de calcul IA

Réseau de centre de calcul IA : quand les GPU sont au repos, c'est généralement le réseau

Vous avez acheté les accélérateurs et le graphe d'utilisation stagne à la moitié. Ce sont rarement les cartes — c'est un fabric qui perd des paquets en communication collective, et une seule perte fait attendre tout le job pour une retransmission. Nous concevons les réseaux de cluster IA selon le comportement réel du job : un fabric spine-leaf sans surabonnement, un Ethernet sans perte avec RoCEv2, PFC et ECN réglés pour votre cluster plutôt que copiés d'un guide, et un plan de gestion hors bande qui répond encore quand le fabric ne répond plus. Dimensionné honnêtement d'une seule baie de 8 cartes à un déploiement multi-salles — et budgété pour l'optique et les cartes réseau, pas seulement les commutateurs.

Pourquoi les fabrics IA échouent différemment

Quatre problèmes que nous trouvons dans presque chaque cluster qui nous appelle :

Les GPU sont au repos et personne ne sait pourquoiL'utilisation stagne à la moitié et le fournisseur dit que les cartes vont bien. C'est généralement vrai. Les cartes s'attendent les unes les autres, et ce qui les fait attendre, c'est le fabric entre elles — que personne n'a instrumenté, parce qu'on l'a pris pour de la plomberie.
Une perte et le run recommenceUn job d'entraînement n'est pas un serveur web. Il ne se dégrade pas gracieusement — une perte pendant une opération collective bloque tous les rangs jusqu'à la retransmission, et au pire un long run doit repartir du dernier point de contrôle. Des heures de temps accélérateur pour une seule trame perdue.
On n'a jamais demandé cela à l'Ethernet ordinaireLa communication collective envoie tout, à tout le monde, en une rafale. Un fabric conçu pour un trafic bureautique moyen y répond par un tampon plein et un rejet — il se comporte exactement comme prévu, et c'est bien le problème.
Quand le fabric casse, vous ne pouvez plus entrerLa gestion passe par le fabric même qu'elle est censée réparer. La nuit où il congestionne, la console est aussi injoignable, et quelqu'un roule jusqu'au site pour se brancher sur un port console — une leçon que tout le monde apprend exactement une fois.

Architecture : fabric spine-leaf sans perte + gestion hors bande

Un fabric plat et non bloquant bâti autour d'une seule exigence — ne pas perdre le paquet :

SPINE LEAF GPU NODES OOB MGMT Non-blocking spine layer — every leaf is one hop from every other leaf Spine 1 Spine 2 Spine 3 Spine 4 every leaf uplinks to every spine — no oversubscription inside the fabric Leaf · rack 1 Leaf · rack 2 Leaf · rack 3 Leaf · rack 4 GPU nodes · 8 cards each GPU nodes · 8 cards each GPU nodes · 8 cards each GPU nodes · 8 cards each each card has its own high-speed NIC port into the leaf — the collective operation runs at the speed of the slowest one OUT-OF-BAND MANAGEMENT PLANE · separate switches, separate cabling reachable when the fabric is not — you do not debug a broken fabric through the fabric, and you do not want to learn that at 3 a.m. Lossless fabric RoCEv2 transport PFC per priority class ECN marking + tuning 100G / 400G port speeds tuned per cluster, not copied from a guide — the wrong PFC setting is worse than none Where the budget goes optics and NICs usually outweigh the switches one high-speed port needs two transceivers and a cable power and cooling per rack decide how many racks a budget that counts only switches is short before the first job runs we size all of it at design stage

Architecture dessinée par AtlasCommTech selon les pratiques de conception de niveau opérateur. Les libellés du schéma restent en anglais pour la clarté technique.

Pourquoi nous : notre fondateur a passé 13 ans dans l'écosystème partenaire de Huawei à livrer des réseaux opérateurs. C'est dans l'opérateur qu'on apprend qu'un fabric se juge à son pire moment, pas à sa moyenne — précisément la discipline dont un cluster IA a besoin, car un job d'entraînement ne va pas plus vite que sa plus lente opération collective.

Options d'équipement

La solution est d'abord dimensionnée selon vos besoins et votre budget — la même architecture peut être livrée sur les gammes de plusieurs fabricants. Nous vous aidons à choisir selon la disponibilité d'approvisionnement dans votre pays, le budget et les habitudes d'exploitation de votre équipe.

Huawei — gammes campus d'entreprise, WAN et sécuritéÉcosystème mature avec un réseau de service mondial.
ZTE et Wantone — gammes datacom comparablesOrientation rapport qualité-prix ; l'approvisionnement est plus fluide sur certains marchés.
H3C — gammes campus et centre de donnéesPortefeuille campus et centre de données largement déployé.
Commutateurs industriels Atlas — couche d'accès en scénario industrielNotre propre gamme industrielle — compatible avec la couche cœur de n'importe quelle marque.

Ce que la conception apporte

Six choses qu'un fabric IA fait et qu'on ne demande jamais à un réseau de centre de données ordinaire :

Pas de surabonnement dans le fabricChaque leaf remonte vers chaque spine, et la capacité de liaison montante correspond à ce que le leaf peut recevoir. Le multiplexage statistique est une hypothèse sur le trafic moyen — une opération collective est justement la charge qui refuse d'être moyenne.
Transport sans perte, réglé et non copiéRoCEv2 avec PFC par classe de priorité et marquage ECN, seuils réglés pour la taille et le trafic de votre cluster. Une configuration PFC copiée d'un guide n'est pas sans perte — c'est un interblocage qui attend la bonne semaine.
Topologie plate, un saut entre leavesN'importe quel GPU atteint n'importe quel autre via exactement un spine. La latence est uniforme, l'ordonnanceur n'a donc pas à connaître le câblage — et ajouter une baie ne change la distance de personne.
Ports 100G / 400G haute densitéChaque accélérateur dispose de son propre port haut débit vers le leaf, car un port partagé fait déjà s'attendre les cartes avant même que le fabric ne voie le trafic. La vitesse de port est choisie d'après la configuration des cartes réseau de votre nœud, pas d'après un catalogue.
Un plan hors bande qui répond encoreCommutateurs séparés, câblage séparé, adressage séparé — joignable précisément quand le fabric ne l'est pas. On ne débogue pas un fabric congestionné à travers le fabric congestionné, et la nuit où on le découvre n'est pas la bonne nuit pour l'apprendre.
Instrumenté avant d'être accuséCompteurs par file, statistiques PFC et ECN et compteurs de rejets exportés dès le premier jour. Quand la courbe d'utilisation plonge, la question « est-ce le réseau ? » a une réponse au lieu d'une dispute.

Trois tailles, une seule logique de conception

Dites-nous le nombre de cartes, la configuration des nœuds et ce que vos baies peuvent réellement alimenter et refroidir — le palier vous donne la forme du fabric :

Les chiffres autour desquels nous concevons :
Chaque accélérateur a son port haut débit — le collectif va à la vitesse du rang le plus lent
Zéro surabonnement entre leaf et spine — le multiplexage statistique est une hypothèse que cette charge brise
L'optique et les cartes réseau coûtent généralement plus que les commutateurs — un budget qui ne compte que les commutateurs manque avant le premier job
Palier d'échelleSite typiqueCe que comprend la conception
Baie unique, à partir de 8 cartesUn nœud ou quelques-uns · un pilote ou un petit cluster de recherche · une salleUne paire de commutateurs leaf, sans aucune couche spine — à cette taille les leaves se parlent directement et un spine est une couche achetée pour le schéma. La configuration sans perte et la gestion hors bande restent, car c'est ce qui en fait un cluster plutôt que huit ordinateurs coûteux dans une baie.
Cluster GPU de taille moyennePlusieurs baies dans une salle · jobs d'entraînement en production · un ordonnanceur en amontUn fabric spine-leaf complet sans surabonnement, une paire de leaves par baie, RoCEv2 avec PFC et ECN réglés sur votre trafic réel plutôt qu'un gabarit, un chemin de stockage séparé pour que les écritures de points de contrôle n'entrent pas en collision avec le trafic d'entraînement, un plan hors bande complet, et une télémétrie par file exportée dès le départ.
Déploiement multi-sallesPlus de baies qu'une salle ne peut alimenter · plusieurs halls ou bâtiments · longues portées entre euxUn fabric par salle avec une couche inter-salles au-dessus, les distances dictant le choix optique et le choix optique dictant une grande part du budget, une discussion sur le placement des jobs avec l'exploitant de l'ordonnanceur pour qu'un job ne chevauche pas inutilement deux salles, et une vérification de la réalité électrique et thermique avant de tracer la topologie — car à cette taille, c'est le bâtiment qui décide de la conception, pas l'inverse.

Rôles des équipements (catégories, pas modèles)

La solution s'appuie sur ces catégories d'équipement — la marque est choisie avec vous à la conception. Les modèles exacts dépendent du nombre de cartes, de la configuration des cartes réseau, des vitesses de port et du pays — nous les spécifions après votre liste de besoins, pas avant.

RôleCe qu'il fait
Commutateurs leaf (accès baie)Un port haut débit par accélérateur, des tampons assez profonds pour absorber une rafale collective, et la configuration sans perte qui la soutient réellement. Dimensionnés d'après la configuration des cartes réseau de votre nœud, pas d'après ce qui tient dans un schéma de baie.
Commutateurs spine (cœur du fabric)Donnent à chaque leaf un chemin en un saut vers tout autre leaf, sans surabonnement. La densité de ports décide ici du nombre de baies que le cluster pourra atteindre — elle est donc dimensionnée pour le cluster visé, pas celui de départ.
Optique et câblageChaque lien haut débit nécessite deux transceivers et un câble, et le compte grimpe vite à des centaines. Portée, type de connecteur et distances entre baies décident du choix — et cette ligne est généralement plus grosse que celle des commutateurs, d'où notre insistance à la chiffrer tôt.
Commutateurs de gestion hors bandeUn petit réseau bon marché et séparé, atteignant chaque port de gestion de la salle. C'est l'équipement le moins intéressant de cette page et le premier dont vous serez reconnaissant — car c'est le seul chemin d'entrée la nuit où le fabric est le problème.
Commutation du chemin de stockageLes écritures de points de contrôle et les lectures de jeux de données ont leur propre irrégularité, et les placer sur les mêmes files que le trafic d'entraînement, c'est ainsi qu'un fabric bien réglé se remet à perdre. Séparés par chemin ou par classe de priorité, selon votre cadence de points de contrôle.
Plateforme de télémétrie / gestionExporte la profondeur par file, le nombre de pauses PFC, les marquages ECN et les rejets, pour qu'un creux d'utilisation soit attribué plutôt que débattu. Sans cela, le réseau est coupable par défaut à chaque réunion — et généralement innocent en fait.

Envoyez-nous le nombre de cartes, la configuration des cartes réseau, les limites d'alimentation et de refroidissement de vos baies et votre cadence de points de contrôle — la liste des modèles suivra. Cet ordre garde la conception honnête.

Notes de conception et limites assumées

À lire avant de vous engager :
  • Sur ce type de réseau, l'optique et les cartes réseau coûtent généralement plus cher que les commutateurs — ne budgétez pas seulement les commutateurs. Chaque lien haut débit nécessite deux transceivers et un câble, et le compte atteint vite les centaines. Un budget bâti sur un devis de commutateurs manquera avant le premier job, d'un montant que personne n'aura envie d'expliquer. Nous chiffrons l'ensemble à la conception, pour que le nombre arrive dans le plan.
  • Ce sont l'alimentation et le refroidissement qui décident de la topologie, pas l'inverse. À cette densité, la limite électrique et thermique d'une baie fixe le nombre de nœuds qu'elle accueille, donc le nombre de baies, donc le fabric. Si votre site ne peut pas alimenter l'agencement, aucune conception réseau ne le sauve — notre première question porte donc sur votre baie, pas sur votre commutateur.
  • Un fabric sans perte se règle, il ne s'allume pas. Les seuils PFC et ECN dépendent de la taille de votre cluster, de votre profil de trafic et de vos cartes réseau, et une configuration copiée du guide d'un autre peut être pire que rien — elle transforme une perte en un blocage qui se propage. Budgétez du temps d'ingénierie pour le réglage et la validation, pas seulement des jours d'installation.
  • La politique de licence et la disponibilité produit varient selon la marque et le pays de destination, et l'optique haut débit a sa propre réalité d'approvisionnement — les délais sur certaines vitesses de port se comptent en mois, pas en semaines. Nous vérifions et confirmons les deux pour votre pays à la conception, avant tout engagement, car une optique qui arrive après les accélérateurs, c'est une baie de matériel au repos.
  • Si votre problème d'utilisation n'est pas le réseau, nous vous le dirons. Le chargement des données, un ordonnanceur qui empile mal les jobs, un étage de stockage sous-dimensionné ou un modèle qui ne se parallélise tout simplement pas ressemblent tous exactement à un problème réseau sur la courbe d'utilisation. Nous instrumentons d'abord, nous concluons ensuite — et si le fabric s'avère innocent, ce constat est le livrable, pas un devis de commutateurs.

FAQ

En quoi est-ce différent de votre solution de centre de données résilient ?
Vous achetez une protection contre une panne différente. La page centre de données résilient parle de la disponibilité des applications métier : si un lien, un commutateur ou une salle tombe, l'application continue de servir, et une brève reconvergence est un résultat acceptable. Cette page parle d'un job d'entraînement qui ne doit pas perdre de paquets : rien n'est tombé, tout fonctionne, et une seule perte en communication collective bloque quand même tous les rangs et peut coûter des heures. Une conception optimise la survie à une panne ; celle-ci optimise un fabric qui ne perd jamais alors que tout va bien. Si vous hébergez des applications métier, c'est l'autre page qu'il vous faut.
L'Ethernet peut-il vraiment porter le trafic d'entraînement IA ?
Oui, lorsqu'il est configuré pour être sans perte. L'Ethernet simple gère la congestion en rejetant, ce qui convient à un serveur web et est fatal à une opération collective. RoCEv2 avec PFC et ECN change ce comportement : le fabric applique une contre-pression et marque la congestion au lieu de rejeter. Le mot important est « configuré » — ce n'est pas le protocole qui rend le fabric sans perte, c'est le réglage, et il doit correspondre à votre cluster. C'est pourquoi nous traitons la validation comme une partie du chantier, et non comme une tâche laissée au client.
Nous n'avons qu'une baie. Faut-il une couche spine ?
Non, et nous ne vous en vendrons pas. Avec une seule baie, les leaves se parlent directement et un spine ajoute coût, câblage, optique et latence en échange d'un schéma qui ressemble à un vrai cluster. Ce qu'il faut quand même acheter à cette taille, c'est la configuration sans perte, un port haut débit par accélérateur et le plan hors bande — c'est cela qui transforme huit ordinateurs coûteux en cluster. Le spine vaut son prix quand vous avez assez de baies pour que le câblage direct entre leaves cesse de passer à l'échelle, et nous vous dirons quand vous y serez.
Peut-on prouver que c'était le réseau avant d'acheter quoi que ce soit ?
C'est la bonne question à poser en premier, et oui. La profondeur par file, le nombre de pauses PFC, les marquages ECN et les compteurs de rejets sur le fabric existant vous diront si les accélérateurs attendent le réseau ou autre chose — souvent c'est le chargement des données ou un ordonnanceur qui empile mal les jobs, et les deux sont identiques sur une courbe d'utilisation. Nous préférons faire cette mesure avec vous et innocenter le fabric plutôt que de vous vendre une reconstruction qui ne répare rien. Si le réseau va bien, c'est un résultat — et un résultat moins cher que l'alternative.
Peut-on commencer petit et agrandir le cluster plus tard ?
Oui, et c'est ce que la plupart devraient faire — mais la croissance doit être conçue dès maintenant, en exactement deux endroits. La densité de ports du spine décide du nombre de baies que le fabric atteindra jamais, et l'alimentation et le refroidissement de la salle décident du nombre de baies que le bâtiment autorisera jamais. Les deux sont difficiles à changer plus tard et peu coûteux à planifier aujourd'hui. Tout le reste — plus de leaves, de nœuds, d'optique — est de l'ajout, pas de la refonte. Dites-nous le cluster que vous visez, pas seulement celui de départ : nous dimensionnerons ces deux points pour la destination et le reste pour aujourd'hui.

Envoyez-nous votre nombre de cartes et vos limites d'alimentation par baie

Un ingénieur répond avec une conception de fabric, un décompte d'optique et de cartes réseau, et la liste des catégories d'équipement. Envoyez votre liste de besoins — la liste des modèles suivra.

Contacter un ingénieur sur WhatsApp →

Solutions associées

Nous n'utilisons des cookies que pour des statistiques anonymes — pas de publicité, pas de suivi intersites.Politique de confidentialité