Directement tiré du manuel de maintenance des commutateurs Huawei série CloudEngine 16800, 9800, 8800 et 6800 — le contrôle de routine pour les commutateurs cœur et spine de datacenter : environnement, informations de base, état de fonctionnement et contenu des interfaces. Ce qu'il faut regarder à chaque étape, ce qui compte comme réussi, la cadence recommandée, et les commandes display exactes utilisées pour vérifier.
Par Yuwen Zhang (Atlas), fondateur d'AtlasCommTech — 13 ans de déploiements de réseaux opérateurs et d'entreprise · Mis à jour en juillet 2026
Le manuel de maintenance des commutateurs Huawei série CloudEngine 16800/9800/8800/6800 organise la maintenance de routine en quatre sections, pas cinq — et le châssis derrière est d'une tout autre nature.
Notre note sur le contrôle de santé de routine des commutateurs d'entreprise s'appuie sur le manuel Huawei pour les commutateurs de campus et de couche d'accès — locaux techniques, étages de bureaux, la panne d'un commutateur affecte un segment. Cette note s'appuie plutôt sur le manuel de la série CloudEngine 16800, 9800, 8800 et 6800 : commutateurs cœur et spine situés dans un datacenter, où une mauvaise lecture derrière un boîtier cœur peut affecter chaque baie en aval, pas seulement une aile d'un bâtiment.
Le manuel, « 例行维护 » (Maintenance de routine), organise tout en quatre sections : contrôle de l'environnement de l'appareil, contrôle des informations de base, contrôle de l'état de fonctionnement, et contrôle du contenu des interfaces. Deux des quatre familles de châssis — CE16800 et CE8800/6800 — disposent même de leurs propres tableaux d'environnement séparés, car leurs tolérances de tension et d'humidité nominales diffèrent réellement. Voici cette routine en quatre étapes, le standard de réussite et la commande display pour chaque élément, une cadence adaptée au datacenter, et une note sur la discipline de sauvegarde de configuration que les éléments de contrôle seuls ne couvrent pas.
Même ordre que le manuel source — l'environnement d'abord, les interfaces en dernier.
Les légendes du schéma restent en anglais pour la clarté technique.
Le manuel source fournit deux tableaux distincts pour la série CE16800 et la série CE8800/6800 — leurs tolérances de tension et d'humidité diffèrent réellement, et cette étape ne comporte aucune commande CLI, seulement des contrôles physiques.
| Élément à contrôler | Critère de réussite |
|---|---|
| Température de la salle | Température de fonctionnement 0°C à 40°C (0m à 1800m d'altitude) ; au-delà de 1800m jusqu'à 5000m, la spécification baisse de 1°C tous les 220m d'altitude supplémentaire. Température de stockage -40°C à +70°C. |
| Humidité de la salle | Humidité relative de fonctionnement 5%RH à 85%RH, sans condensation. Si l'humidité de la salle reste durablement trop élevée, installez un déshumidificateur ; si trop faible, un humidificateur. |
| Propreté | L'appareil lui-même ne doit présenter aucune accumulation visible de poussière ; surveillez l'état de l'écran anti-poussière et nettoyez ou remplacez le coton anti-poussière rapidement pour ne pas affecter la ventilation et le refroidissement du châssis. |
| Refroidissement / flux d'air | Les ventilateurs doivent fonctionner normalement pendant l'exploitation (sauf pendant le nettoyage) ; l'entrée d'air du châssis ne doit pas être obstruée par un excès de poussière — nettoyez l'écran anti-poussière s'il est très sale, recommandé chaque trimestre. |
| Cheminement des câbles | Câbles d'alimentation acheminés séparément des câbles métier ; câblage d'alimentation et métier tous deux ordonnés. |
| Étiquetage des câbles | Étiquettes de câbles claires, précises et conformes aux normes. |
| Système d'alimentation | Alimentation stable requise. Tension nominale 110V CA / 220V CA ; plage nominale 100V CA-120V CA / 200V CA-240V CA ; plage maximale 90V CA-290V CA. |
| Élément à contrôler | Critère de réussite |
|---|---|
| Emplacement de l'appareil | Placé dans un environnement ventilé et sec, posé de façon stable et à plat. |
| Température de la salle | Identique au CE16800 : fonctionnement 0°C à 40°C (0m-1800m, -1°C tous les 220m au-delà de 1800m jusqu'à 5000m) ; stockage -40°C à +70°C. |
| Humidité de la salle | Humidité relative de fonctionnement 5%RH à 95%RH, sans condensation — une tolérance plus large que le plafond de 85%RH du CE16800. |
| Climatisation de la salle | La climatisation fonctionne en continu et de façon stable, maintenant la température de la salle dans la tolérance de l'appareil. |
| Mise à la terre et résistance de terre | Terre de service, terre de protection et terre parafoudre du bâtiment séparées si possible (une terre commune est acceptable si les conditions de la salle l'exigent) ; les équipements installés à l'extérieur doivent être mis à la terre — un appareil extérieur non relié à la terre est très vulnérable à la foudre. |
| Connexion d'alimentation | Câble d'alimentation correctement connecté à l'emplacement désigné de l'appareil et bien fixé ; l'indicateur d'alimentation reste vert fixe. |
| Système d'alimentation | Alimentation stable requise. Plage nominale 100V CA-240V CA, 50/60Hz ; plage maximale 90V CA-290V CA, 45Hz-65Hz — une bande nominale plus large que le 110V/220V fixe du CE16800. |
| Obstruction du flux de refroidissement | Aucun encombrement autour de l'appareil ; dégagement de refroidissement recommandé entre deux unités d'au moins 1U. |
| Alignement du refroidissement | Le sens du flux de refroidissement du module d'alimentation et du module ventilateur doit être cohérent entre eux, et avec le sens du flux de refroidissement propre à l'armoire. |
| État du module ventilateur | L'indicateur du module ventilateur est normal en clignotement vert lent. |
| État de fonctionnement de l'appareil | L'indicateur SYS de l'appareil est normal en clignotement vert lent. |
Vérifie si les informations de base — version logicielle, informations de patch, heure système, configuration, licence — sont correctes. Nous recommandons une fréquence mensuelle, resserrée pour s'aligner sur tout cycle de gestion des changements déjà en place dans votre datacenter.
| Élément à contrôler | Méthode de contrôle | Critère de réussite |
|---|---|---|
| Version logicielle en cours | display version | Le numéro de version PCB de la sous-carte et le numéro de version logicielle correspondent aux exigences. |
| Paquet logiciel utilisé | display startup | Les noms de fichiers du logiciel produit et du fichier de configuration actuellement utilisés, et à charger au prochain démarrage, sont corrects. |
| Informations de patch | display patch-information | Le fichier de patch correspond aux exigences réelles — Huawei recommande de charger le dernier patch publié pour la version du produit en cours. |
| Heure système | display clock | L'heure correspond à l'heure locale réelle (écart non supérieur à 5 minutes), pour localiser précisément les pannes par horodatage. Sinon, exécutez clock datetime ou configurez NTP pour synchroniser l'heure réseau. |
| Exactitude de la configuration | display current-configuration | Examinez les paramètres de configuration actuellement en vigueur pour vérifier que la configuration de l'appareil est correcte. |
| Informations de licence | display license | Examinez les détails du fichier de licence activé — nom, version, période de validité, éléments de contrôle — pour déterminer si la version doit être mise à niveau pour prendre en charge davantage de fonctionnalités. |
<HUAWEI> display version
<HUAWEI> display startup
<HUAWEI> display patch-information
<HUAWEI> display clock
<HUAWEI> display current-configuration
<HUAWEI> display license
Le contrôle d'informations de base de ce chapitre vérifie uniquement que la configuration en cours est actuellement correcte — il ne dit rien sur le fait que cette configuration survivrait à un redémarrage, une réinitialisation de carte ou un événement d'alimentation. Une fois que display current-configuration réussit, exécutez save pour la rendre persistante dans la configuration de démarrage, et conservez également une copie hors appareil planifiée — un export FTP/SFTP ou une récupération par gestion de configuration conservée quelque part qui survit à l'indisponibilité de l'appareil lui-même. save seul protège contre le prochain rechargement ; il ne protège pas contre le fait que l'appareil, son stockage ou l'opérateur soit le véritable point de défaillance. Certaines étapes de remédiation issues d'un contrôle échoué — un redémarrage, une réinitialisation de carte, un delete sur un stockage plein — comportent leur propre risque réel ; consultez notre liste de commandes dangereuses avant d'en exécuter une.
Vérifie l'état de la carte, l'état des ventilateurs et de l'alimentation, la température, le CPU et la mémoire — les éléments dont l'impact est le plus immédiat sur un commutateur cœur. Nous recommandons une fréquence quotidienne.
| Élément à contrôler | Méthode de contrôle | Critère de réussite |
|---|---|---|
| État de fonctionnement de la carte (CE16800 uniquement) | display device | Concentrez-vous sur la présence et l'état de la carte : normal signifie carte « Online » = « Present », « Power » = « PowerOn », « Register » = « Registered », « Status » = « Normal ». |
| État des ventilateurs | display device fan | « Status » = « Normal » indique un état normal. |
| État de l'alimentation | display device power | « State » = « Supply » indique un état normal. |
| Température de l'appareil | display device temperature | « Status » = « Normal » indique un état normal. |
| État du CPU | display cpu | « Status » = « Non-overload » indique un état normal. |
| Utilisation de la mémoire | display memory | « Status » = « Non-overload » indique un état normal. |
<HUAWEI> display device
<HUAWEI> display device fan
<HUAWEI> display device power
<HUAWEI> display device temperature
<HUAWEI> display cpu
<HUAWEI> display memory
Vérifie les paquets d'erreur de port, le mode de négociation et l'état Up/Down. Nous recommandons une fréquence hebdomadaire.
| Élément à contrôler | Méthode de contrôle | Critère de réussite |
|---|---|---|
| Paquets d'erreur de port | display interface | Pendant le fonctionnement métier, vérifiez les erreurs de port, y compris les erreurs CRC. |
| Mode de négociation du port | display interface | Mode de négociation correct et cohérent aux deux extrémités — le mode semi-duplex n'est pas acceptable. |
| État du port | display interface brief | L'état Up/Down du port répond à l'exigence planifiée. |
<HUAWEI> display interface 100GE1/0/1
<HUAWEI> display interface brief
« Vérifier les erreurs CRC » n'est qu'un indice d'une ligne, pas l'histoire complète — voir notre note de dépannage de la perte de paquets pour la répartition complète des erreurs d'entrée CRC/Giants/Runts, des erreurs de bits du module optique et de la congestion Discard en sortie, avec les champs exacts et la correction pour chacune.
Chaque commande ci-dessus est en lecture seule — display uniquement — mais un boîtier cœur de datacenter présente quelques façons de mal lire le résultat qu'un commutateur de campus n'a pas.
RISQUEdisplay cpu et display memory rapportent un Status de Non-overload plutôt qu'un pourcentage numérique comme le font les seuils 80%/60% du manuel de campus. Traiter « Non-overload » comme l'image complète manque une montée lente vers la surcharge qui n'a pas encore franchi la ligne.
PRATIQUE PLUS SÛREAssociez le statut Non-overload aux détails numériques disponibles dans la sortie plus complète de display cpu/display memory si vous voulez suivre son évolution dans le temps, et vérifiez-le plus souvent que mensuellement compte tenu du nombre de services derrière un boîtier cœur de datacenter.
RISQUEL'élément d'état de fonctionnement de présence de carte est explicitement limité à la série CE16800. Sur CE8800/6800, son absence est correcte — mais sur un parc mixte, il est facile pour un technicien de perdre de vue si un élément manquant était une exclusion délibérée liée au modèle ou quelque chose oublié par erreur.
PRATIQUE PLUS SÛREEnregistrez sur quel modèle de châssis chaque contrôle a été exécuté, pas seulement réussi/échoué, afin qu'un parc mixte CE16800 + CE8800/6800 conserve une piste d'audit expliquant chaque élément marqué non applicable.
RISQUELa tolérance environnementale du CE16800 autorise 5%RH-85%RH et une alimentation nominale 110V/220V ; le CE8800/6800 autorise jusqu'à 5%RH-95%RH et une plage nominale plus large de 100V-240V. Copier la bande d'humidité plus stricte du CE16800 sur un châssis 8800/6800, ou l'inverse, produit un faux échec ou un faux succès selon le sens de l'erreur.
PRATIQUE PLUS SÛREConfirmez la famille de châssis avant d'appliquer l'un ou l'autre tableau d'environnement, et conservez les deux comme listes de contrôle distinctes plutôt que de les fusionner en une norme d'environnement de commutateur générique.
RISQUECet élément vérifie uniquement que la configuration en cours est actuellement correcte — il ne dit rien sur le fait qu'elle ait réellement été enregistrée dans la configuration de démarrage qu'un rechargement chargera ensuite. Contrairement à la routine de campus, le contrôle d'informations de base de ce manuel ne comporte pas d'étape compare configuration distincte pour détecter cet écart.
PRATIQUE PLUS SÛREConsidérez save — et une sauvegarde de configuration hors appareil — comme obligatoires chaque fois que ce contrôle réussit, pas comme un extra optionnel ; voir la note de discipline de sauvegarde de configuration ci-dessus, et notre note de contrôle de santé de commutateur de campus pour l'habitude équivalente de compare configuration.
RISQUEL'élément paquets d'erreur de port du contrôle de contenu des interfaces signale les erreurs CRC de façon générique, mais ne distingue pas un problème de couche physique en entrée d'un problème de congestion en sortie, et ne vérifie pas du tout le module optique derrière l'interface — une réussite de routine ici peut encore reposer sur un compteur Discard en hausse ou un module proche de son seuil de puissance.
PRATIQUE PLUS SÛREChaque fois que cet élément signale autre chose qu'un zéro net, poursuivez avec la répartition complète des trois sources — optique, erreurs d'entrée, Discard en sortie — dans notre note de dépannage de la perte de paquets, plutôt que de traiter une mention de CRC comme le diagnostic complet.
Tirées directement du terrain — celles pour lesquelles il vaut la peine d'avoir une réponse prête.
En grande partie, mais pas entièrement — le manuel donne à chaque famille de châssis son propre tableau de contrôle d'environnement, car les tolérances de tension et d'humidité diffèrent, et l'élément de présence de carte est réservé au CE16800. Les contrôles d'informations de base, CPU/mémoire et d'interface s'appliquent de la même façon aux quatre séries.
Le manuel source n'attribue pas de cycle par élément comme le fait le manuel de campus — voir notre note de limites honnêtes ci-dessous. Compte tenu du volume de trafic et du nombre de services derrière un commutateur cœur de datacenter, nous recommandons des contrôles d'environnement et d'état de fonctionnement quotidiens (ou en continu via la supervision), des informations de base mensuelles, et un contenu d'interface hebdomadaire — en resserrant l'un ou l'autre là où vos propres exigences de gestion des changements ou de conformité imposent des preuves plus fréquentes.
Cette note s'appuie sur le manuel de Huawei, avec des éléments et des cycles spécifiques aux commutateurs de campus et de couche d'accès. Cette note-ci s'appuie sur le manuel de la série CloudEngine 16800/9800/8800/6800 pour les commutateurs cœur et spine de datacenter — familles de châssis différentes, tolérances environnementales différentes, et — notamment — aucun cycle par élément intégré, que nous compensons par une cadence adaptée au datacenter.
Non — c'est un indice d'une ligne vers un diagnostic bien plus long. Voir notre note de dépannage de la perte de paquets pour la répartition complète des erreurs d'entrée CRC/Giants/Runts, des erreurs de bits du module optique et de la congestion Discard en sortie, avec les champs display interface exacts et la correction pour chacune.
save protège uniquement la configuration en cours contre une perte au prochain rechargement — il ne protège pas contre une panne de l'appareil lui-même, un module de stockage corrompu, ou une écrasement par erreur que personne ne remarque avant longtemps. Associez save à une copie hors appareil planifiée — un export FTP/SFTP, ou une récupération par gestion de configuration — conservée quelque part qui survit à l'indisponibilité de l'appareil lui-même.
Cette routine est construite à partir du manuel de maintenance des commutateurs Huawei série CloudEngine 16800/9800/8800/6800. Contrairement au manuel derrière notre note sur les commutateurs de campus, ce chapitre V300 n'attribue pas de cycle recommandé par élément de contrôle — la cadence quotidienne/mensuelle/hebdomadaire ci-dessus est notre propre recommandation de pratique opérationnelle pour un rôle de cœur de datacenter, pas un chiffre que le manuel lui-même indique. Le chapitre n'inclut pas non plus d'étape compare-configuration distincte, raison pour laquelle nous avons ajouté ci-dessus la note de discipline de sauvegarde de configuration en complément délibéré. Ceci est un contrôle de santé, pas une procédure de diagnostic de panne — pour la perte de paquets spécifiquement, voir notre note de dépannage de la perte de paquets.
Indiquez-nous vos modèles CloudEngine et combien d'appareils sont concernés — nous vous aiderons à transformer cela en une liste de contrôle récurrente avec une cadence adaptée à vos exigences de gestion des changements.