Accueil / Notes techniques / Contrôle de santé des commutateurs de datacenter

Contrôle de santé des commutateurs de datacenter : routines quotidiennes, hebdomadaires et mensuelles

Directement tiré du manuel de maintenance des commutateurs Huawei série CloudEngine 16800, 9800, 8800 et 6800 — le contrôle de routine pour les commutateurs cœur et spine de datacenter : environnement, informations de base, état de fonctionnement et contenu des interfaces. Ce qu'il faut regarder à chaque étape, ce qui compte comme réussi, la cadence recommandée, et les commandes display exactes utilisées pour vérifier.

Par Yuwen Zhang (Atlas), fondateur d'AtlasCommTech — 13 ans de déploiements de réseaux opérateurs et d'entreprise · Mis à jour en juillet 2026

Pourquoi la routine d'un cœur de datacenter n'est pas celle d'un commutateur de campus

Le manuel de maintenance des commutateurs Huawei série CloudEngine 16800/9800/8800/6800 organise la maintenance de routine en quatre sections, pas cinq — et le châssis derrière est d'une tout autre nature.

Notre note sur le contrôle de santé de routine des commutateurs d'entreprise s'appuie sur le manuel Huawei pour les commutateurs de campus et de couche d'accès — locaux techniques, étages de bureaux, la panne d'un commutateur affecte un segment. Cette note s'appuie plutôt sur le manuel de la série CloudEngine 16800, 9800, 8800 et 6800 : commutateurs cœur et spine situés dans un datacenter, où une mauvaise lecture derrière un boîtier cœur peut affecter chaque baie en aval, pas seulement une aile d'un bâtiment.

Le manuel, « 例行维护 » (Maintenance de routine), organise tout en quatre sections : contrôle de l'environnement de l'appareil, contrôle des informations de base, contrôle de l'état de fonctionnement, et contrôle du contenu des interfaces. Deux des quatre familles de châssis — CE16800 et CE8800/6800 — disposent même de leurs propres tableaux d'environnement séparés, car leurs tolérances de tension et d'humidité nominales diffèrent réellement. Voici cette routine en quatre étapes, le standard de réussite et la commande display pour chaque élément, une cadence adaptée au datacenter, et une note sur la discipline de sauvegarde de configuration que les éléments de contrôle seuls ne couvrent pas.

Les quatre étapes en un coup d'œil

Même ordre que le manuel source — l'environnement d'abord, les interfaces en dernier.

STEP 1 Environment 3.2 设备环境检查 Day / Week (facility rounds) STEP 2 Basic Information 3.3 设备基本信息检查 Month STEP 3 Running Status 3.4 设备运行检查 Day STEP 4 Interface Content 3.5 接口内容检查 Week The CloudEngine V300 manual doesn't assign a cycle per item the way the campus switch manual does. Cadence above follows standard DC core-switch operational practice, not the manual itself — see Honest Limits below. Diagram labels are kept in English for engineering clarity.

Les légendes du schéma restent en anglais pour la clarté technique.

Étape 1 — Contrôle de l'environnement de l'appareil

Le manuel source fournit deux tableaux distincts pour la série CE16800 et la série CE8800/6800 — leurs tolérances de tension et d'humidité diffèrent réellement, et cette étape ne comporte aucune commande CLI, seulement des contrôles physiques.

Série CE16800
Élément à contrôlerCritère de réussite
Température de la salleTempérature de fonctionnement 0°C à 40°C (0m à 1800m d'altitude) ; au-delà de 1800m jusqu'à 5000m, la spécification baisse de 1°C tous les 220m d'altitude supplémentaire. Température de stockage -40°C à +70°C.
Humidité de la salleHumidité relative de fonctionnement 5%RH à 85%RH, sans condensation. Si l'humidité de la salle reste durablement trop élevée, installez un déshumidificateur ; si trop faible, un humidificateur.
PropretéL'appareil lui-même ne doit présenter aucune accumulation visible de poussière ; surveillez l'état de l'écran anti-poussière et nettoyez ou remplacez le coton anti-poussière rapidement pour ne pas affecter la ventilation et le refroidissement du châssis.
Refroidissement / flux d'airLes ventilateurs doivent fonctionner normalement pendant l'exploitation (sauf pendant le nettoyage) ; l'entrée d'air du châssis ne doit pas être obstruée par un excès de poussière — nettoyez l'écran anti-poussière s'il est très sale, recommandé chaque trimestre.
Cheminement des câblesCâbles d'alimentation acheminés séparément des câbles métier ; câblage d'alimentation et métier tous deux ordonnés.
Étiquetage des câblesÉtiquettes de câbles claires, précises et conformes aux normes.
Système d'alimentationAlimentation stable requise. Tension nominale 110V CA / 220V CA ; plage nominale 100V CA-120V CA / 200V CA-240V CA ; plage maximale 90V CA-290V CA.
Série CE8800, 6800
Élément à contrôlerCritère de réussite
Emplacement de l'appareilPlacé dans un environnement ventilé et sec, posé de façon stable et à plat.
Température de la salleIdentique au CE16800 : fonctionnement 0°C à 40°C (0m-1800m, -1°C tous les 220m au-delà de 1800m jusqu'à 5000m) ; stockage -40°C à +70°C.
Humidité de la salleHumidité relative de fonctionnement 5%RH à 95%RH, sans condensation — une tolérance plus large que le plafond de 85%RH du CE16800.
Climatisation de la salleLa climatisation fonctionne en continu et de façon stable, maintenant la température de la salle dans la tolérance de l'appareil.
Mise à la terre et résistance de terreTerre de service, terre de protection et terre parafoudre du bâtiment séparées si possible (une terre commune est acceptable si les conditions de la salle l'exigent) ; les équipements installés à l'extérieur doivent être mis à la terre — un appareil extérieur non relié à la terre est très vulnérable à la foudre.
Connexion d'alimentationCâble d'alimentation correctement connecté à l'emplacement désigné de l'appareil et bien fixé ; l'indicateur d'alimentation reste vert fixe.
Système d'alimentationAlimentation stable requise. Plage nominale 100V CA-240V CA, 50/60Hz ; plage maximale 90V CA-290V CA, 45Hz-65Hz — une bande nominale plus large que le 110V/220V fixe du CE16800.
Obstruction du flux de refroidissementAucun encombrement autour de l'appareil ; dégagement de refroidissement recommandé entre deux unités d'au moins 1U.
Alignement du refroidissementLe sens du flux de refroidissement du module d'alimentation et du module ventilateur doit être cohérent entre eux, et avec le sens du flux de refroidissement propre à l'armoire.
État du module ventilateurL'indicateur du module ventilateur est normal en clignotement vert lent.
État de fonctionnement de l'appareilL'indicateur SYS de l'appareil est normal en clignotement vert lent.

Étape 2 — Contrôle des informations de base

Vérifie si les informations de base — version logicielle, informations de patch, heure système, configuration, licence — sont correctes. Nous recommandons une fréquence mensuelle, resserrée pour s'aligner sur tout cycle de gestion des changements déjà en place dans votre datacenter.

Élément à contrôlerMéthode de contrôleCritère de réussite
Version logicielle en coursdisplay versionLe numéro de version PCB de la sous-carte et le numéro de version logicielle correspondent aux exigences.
Paquet logiciel utilisédisplay startupLes noms de fichiers du logiciel produit et du fichier de configuration actuellement utilisés, et à charger au prochain démarrage, sont corrects.
Informations de patchdisplay patch-informationLe fichier de patch correspond aux exigences réelles — Huawei recommande de charger le dernier patch publié pour la version du produit en cours.
Heure systèmedisplay clockL'heure correspond à l'heure locale réelle (écart non supérieur à 5 minutes), pour localiser précisément les pannes par horodatage. Sinon, exécutez clock datetime ou configurez NTP pour synchroniser l'heure réseau.
Exactitude de la configurationdisplay current-configurationExaminez les paramètres de configuration actuellement en vigueur pour vérifier que la configuration de l'appareil est correcte.
Informations de licencedisplay licenseExaminez les détails du fichier de licence activé — nom, version, période de validité, éléments de contrôle — pour déterminer si la version doit être mise à niveau pour prendre en charge davantage de fonctionnalités.
<HUAWEI> display version
<HUAWEI> display startup
<HUAWEI> display patch-information
<HUAWEI> display clock
<HUAWEI> display current-configuration
<HUAWEI> display license

Discipline de sauvegarde de configuration

Le contrôle d'informations de base de ce chapitre vérifie uniquement que la configuration en cours est actuellement correcte — il ne dit rien sur le fait que cette configuration survivrait à un redémarrage, une réinitialisation de carte ou un événement d'alimentation. Une fois que display current-configuration réussit, exécutez save pour la rendre persistante dans la configuration de démarrage, et conservez également une copie hors appareil planifiée — un export FTP/SFTP ou une récupération par gestion de configuration conservée quelque part qui survit à l'indisponibilité de l'appareil lui-même. save seul protège contre le prochain rechargement ; il ne protège pas contre le fait que l'appareil, son stockage ou l'opérateur soit le véritable point de défaillance. Certaines étapes de remédiation issues d'un contrôle échoué — un redémarrage, une réinitialisation de carte, un delete sur un stockage plein — comportent leur propre risque réel ; consultez notre liste de commandes dangereuses avant d'en exécuter une.

Étape 3 — Contrôle de l'état de fonctionnement

Vérifie l'état de la carte, l'état des ventilateurs et de l'alimentation, la température, le CPU et la mémoire — les éléments dont l'impact est le plus immédiat sur un commutateur cœur. Nous recommandons une fréquence quotidienne.

Élément à contrôlerMéthode de contrôleCritère de réussite
État de fonctionnement de la carte (CE16800 uniquement)display deviceConcentrez-vous sur la présence et l'état de la carte : normal signifie carte « Online » = « Present », « Power » = « PowerOn », « Register » = « Registered », « Status » = « Normal ».
État des ventilateursdisplay device fan« Status » = « Normal » indique un état normal.
État de l'alimentationdisplay device power« State » = « Supply » indique un état normal.
Température de l'appareildisplay device temperature« Status » = « Normal » indique un état normal.
État du CPUdisplay cpu« Status » = « Non-overload » indique un état normal.
Utilisation de la mémoiredisplay memory« Status » = « Non-overload » indique un état normal.
<HUAWEI> display device
<HUAWEI> display device fan
<HUAWEI> display device power
<HUAWEI> display device temperature
<HUAWEI> display cpu
<HUAWEI> display memory

Étape 4 — Contrôle du contenu des interfaces

Vérifie les paquets d'erreur de port, le mode de négociation et l'état Up/Down. Nous recommandons une fréquence hebdomadaire.

Élément à contrôlerMéthode de contrôleCritère de réussite
Paquets d'erreur de portdisplay interfacePendant le fonctionnement métier, vérifiez les erreurs de port, y compris les erreurs CRC.
Mode de négociation du portdisplay interfaceMode de négociation correct et cohérent aux deux extrémités — le mode semi-duplex n'est pas acceptable.
État du portdisplay interface briefL'état Up/Down du port répond à l'exigence planifiée.
<HUAWEI> display interface 100GE1/0/1
<HUAWEI> display interface brief

« Vérifier les erreurs CRC » n'est qu'un indice d'une ligne, pas l'histoire complète — voir notre note de dépannage de la perte de paquets pour la répartition complète des erreurs d'entrée CRC/Giants/Runts, des erreurs de bits du module optique et de la congestion Discard en sortie, avec les champs exacts et la correction pour chacune.

5 pièges dans lesquels cette routine trébuche

Chaque commande ci-dessus est en lecture seule — display uniquement — mais un boîtier cœur de datacenter présente quelques façons de mal lire le résultat qu'un commutateur de campus n'a pas.

1. « Non-overload » est un état binaire, pas un pourcentage que l'on peut suivre

RISQUEdisplay cpu et display memory rapportent un Status de Non-overload plutôt qu'un pourcentage numérique comme le font les seuils 80%/60% du manuel de campus. Traiter « Non-overload » comme l'image complète manque une montée lente vers la surcharge qui n'a pas encore franchi la ligne.

PRATIQUE PLUS SÛREAssociez le statut Non-overload aux détails numériques disponibles dans la sortie plus complète de display cpu/display memory si vous voulez suivre son évolution dans le temps, et vérifiez-le plus souvent que mensuellement compte tenu du nombre de services derrière un boîtier cœur de datacenter.

2. L'élément de présence de carte réservé au CE16800 est silencieusement ignoré sur 8800/6800

RISQUEL'élément d'état de fonctionnement de présence de carte est explicitement limité à la série CE16800. Sur CE8800/6800, son absence est correcte — mais sur un parc mixte, il est facile pour un technicien de perdre de vue si un élément manquant était une exclusion délibérée liée au modèle ou quelque chose oublié par erreur.

PRATIQUE PLUS SÛREEnregistrez sur quel modèle de châssis chaque contrôle a été exécuté, pas seulement réussi/échoué, afin qu'un parc mixte CE16800 + CE8800/6800 conserve une piste d'audit expliquant chaque élément marqué non applicable.

3. Les tolérances de tension et d'humidité diffèrent selon la famille de châssis — ne copiez pas un tableau sur l'autre

RISQUELa tolérance environnementale du CE16800 autorise 5%RH-85%RH et une alimentation nominale 110V/220V ; le CE8800/6800 autorise jusqu'à 5%RH-95%RH et une plage nominale plus large de 100V-240V. Copier la bande d'humidité plus stricte du CE16800 sur un châssis 8800/6800, ou l'inverse, produit un faux échec ou un faux succès selon le sens de l'erreur.

PRATIQUE PLUS SÛREConfirmez la famille de châssis avant d'appliquer l'un ou l'autre tableau d'environnement, et conservez les deux comme listes de contrôle distinctes plutôt que de les fusionner en une norme d'environnement de commutateur générique.

4. display current-configuration confirme l'exactitude, pas que cela survivra à un redémarrage

RISQUECet élément vérifie uniquement que la configuration en cours est actuellement correcte — il ne dit rien sur le fait qu'elle ait réellement été enregistrée dans la configuration de démarrage qu'un rechargement chargera ensuite. Contrairement à la routine de campus, le contrôle d'informations de base de ce manuel ne comporte pas d'étape compare configuration distincte pour détecter cet écart.

PRATIQUE PLUS SÛREConsidérez save — et une sauvegarde de configuration hors appareil — comme obligatoires chaque fois que ce contrôle réussit, pas comme un extra optionnel ; voir la note de discipline de sauvegarde de configuration ci-dessus, et notre note de contrôle de santé de commutateur de campus pour l'habitude équivalente de compare configuration.

5. « Vérifier les erreurs CRC » ne raconte que la moitié de l'histoire de l'interface

RISQUEL'élément paquets d'erreur de port du contrôle de contenu des interfaces signale les erreurs CRC de façon générique, mais ne distingue pas un problème de couche physique en entrée d'un problème de congestion en sortie, et ne vérifie pas du tout le module optique derrière l'interface — une réussite de routine ici peut encore reposer sur un compteur Discard en hausse ou un module proche de son seuil de puissance.

PRATIQUE PLUS SÛREChaque fois que cet élément signale autre chose qu'un zéro net, poursuivez avec la répartition complète des trois sources — optique, erreurs d'entrée, Discard en sortie — dans notre note de dépannage de la perte de paquets, plutôt que de traiter une mention de CRC comme le diagnostic complet.

Conceptions de solutions associées

Cinq questions qui reviennent constamment

Tirées directement du terrain — celles pour lesquelles il vaut la peine d'avoir une réponse prête.

Cette routine s'applique-t-elle de la même façon au CE16800 et au CE8800/6800 ?

En grande partie, mais pas entièrement — le manuel donne à chaque famille de châssis son propre tableau de contrôle d'environnement, car les tolérances de tension et d'humidité diffèrent, et l'élément de présence de carte est réservé au CE16800. Les contrôles d'informations de base, CPU/mémoire et d'interface s'appliquent de la même façon aux quatre séries.

À quelle fréquence chaque étape doit-elle réellement s'exécuter sur un commutateur cœur de datacenter ?

Le manuel source n'attribue pas de cycle par élément comme le fait le manuel de campus — voir notre note de limites honnêtes ci-dessous. Compte tenu du volume de trafic et du nombre de services derrière un commutateur cœur de datacenter, nous recommandons des contrôles d'environnement et d'état de fonctionnement quotidiens (ou en continu via la supervision), des informations de base mensuelles, et un contenu d'interface hebdomadaire — en resserrant l'un ou l'autre là où vos propres exigences de gestion des changements ou de conformité imposent des preuves plus fréquentes.

Quelle est la différence réelle entre ceci et la note sur le contrôle de santé de routine des commutateurs d'entreprise ?

Cette note s'appuie sur le manuel de Huawei, avec des éléments et des cycles spécifiques aux commutateurs de campus et de couche d'accès. Cette note-ci s'appuie sur le manuel de la série CloudEngine 16800/9800/8800/6800 pour les commutateurs cœur et spine de datacenter — familles de châssis différentes, tolérances environnementales différentes, et — notamment — aucun cycle par élément intégré, que nous compensons par une cadence adaptée au datacenter.

Le contrôle de contenu des interfaces dit juste « vérifier les erreurs CRC » — est-ce toute l'histoire de la perte de paquets ?

Non — c'est un indice d'une ligne vers un diagnostic bien plus long. Voir notre note de dépannage de la perte de paquets pour la répartition complète des erreurs d'entrée CRC/Giants/Runts, des erreurs de bits du module optique et de la congestion Discard en sortie, avec les champs display interface exacts et la correction pour chacune.

Les sauvegardes de configuration doivent-elles être automatisées, ou exécuter save souvent suffit-il ?

save protège uniquement la configuration en cours contre une perte au prochain rechargement — il ne protège pas contre une panne de l'appareil lui-même, un module de stockage corrompu, ou une écrasement par erreur que personne ne remarque avant longtemps. Associez save à une copie hors appareil planifiée — un export FTP/SFTP, ou une récupération par gestion de configuration — conservée quelque part qui survit à l'indisponibilité de l'appareil lui-même.

Limites honnêtes de cette note

Limites honnêtes de cette note

Cette routine est construite à partir du manuel de maintenance des commutateurs Huawei série CloudEngine 16800/9800/8800/6800. Contrairement au manuel derrière notre note sur les commutateurs de campus, ce chapitre V300 n'attribue pas de cycle recommandé par élément de contrôle — la cadence quotidienne/mensuelle/hebdomadaire ci-dessus est notre propre recommandation de pratique opérationnelle pour un rôle de cœur de datacenter, pas un chiffre que le manuel lui-même indique. Le chapitre n'inclut pas non plus d'étape compare-configuration distincte, raison pour laquelle nous avons ajouté ci-dessus la note de discipline de sauvegarde de configuration en complément délibéré. Ceci est un contrôle de santé, pas une procédure de diagnostic de panne — pour la perte de paquets spécifiquement, voir notre note de dépannage de la perte de paquets.

Vous voulez intégrer cette routine dans le contrat de maintenance de votre datacenter ?

Indiquez-nous vos modèles CloudEngine et combien d'appareils sont concernés — nous vous aiderons à transformer cela en une liste de contrôle récurrente avec une cadence adaptée à vos exigences de gestion des changements.

WhatsApp avec un ingénieur →

Lectures connexes

Nous n'utilisons des cookies que pour des statistiques anonymes — pas de publicité, pas de suivi intersites.Politique de confidentialité