Inicio / Notas técnicas / Comandos de diagnóstico de switches de datacenter

Comandos de diagnóstico de switches de centro de datos: la tarjeta de referencia

En cuanto ya sabe qué subsistema revisar en un switch leaf o spine CloudEngine, este es el comando a usar — agrupado tal como un ingeniero realmente lo piensa: hardware, interfaz y pérdida de paquetes, entradas de tabla MAC/ARP, protocolo (OSPF, BGP, VXLAN, M-LAG), y tráfico (espejo, QoS). Cada comando aquí proviene directamente del capítulo de comandos de diagnóstico del propio manual de mantenimiento CloudEngine 16800/9800/8800/6800.

By Yuwen Zhang (Atlas), founder of AtlasCommTech — 13 years of carrier & enterprise network deployments · Updated July 2026

Dos documentos diferentes, un mismo manual

Uno le dice qué recopilar antes de escalar. Este es el diccionario al que recurre mientras todavía intenta encontrarlo usted mismo.

Nuestra Lista de recopilación de información de fallas cubre el orden de recopilación a seguir en cuanto algo falla — la captura de una sola pasada, una lista de verificación básica, el manejo de registros, y una hoja de referencia organizada por tipo de falla (IPSec, OSPF, BGP, DHCP, reinicio, ARP), independiente de la plataforma en routers y switches Huawei. Esta nota es más estrecha y específica: es el propio capítulo del manual de mantenimiento de la serie CloudEngine 16800/9800/8800/6800 sobre recopilación de información común y comandos de diagnóstico, reorganizado en los cinco grupos de escenarios en los que realmente piensa un ingeniero de centro de datos.

Esos cinco grupos son hardware (tarjetas, alimentación, ventiladores, ópticas), interfaz y pérdida de paquetes (estado del enlace, contadores, caídas de CPU-defend), entradas de tabla (MAC y ARP), protocolo (OSPF, BGP, túneles VXLAN, estado del par M-LAG), y tráfico (espejar un puerto para una captura, o leer si una política de tráfico realmente coincidió con algo). Relacione el síntoma con un grupo, y el comando correcto suele estar entre dos o tres.

La captura de una sola pasada, antes de cualquier cosa específica del escenario

El mismo paquete básico aplica aquí como en cualquier otro lugar — captúrelo primero, luego busque el comando específico del escenario.

display diagnostic-information recopila en una sola pasada las tarjetas del equipo, la configuración actual, la información de interfaz, el reloj, la versión de software y más. Déle un nombre de archivo para que la salida caiga en la flash en lugar de desplazarse por la terminal.

<HUAWEI> display diagnostic-information dia-info.txt

100%

Info: The diagnostic information was saved to the device successfully.

A partir de V300R022C10 existe una alternativa más ligera cuando solo se necesitan los registros, los datos KPI y los archivos PADS en lugar del paquete display completo: collect diagnostic information, ejecutado desde la vista de usuario o la vista diagnose, que comprime el directorio de registros actual directamente en diagnostic_information.zip bajo flash.

<HUAWEI> collect diagnostic information

Este comando está documentado como uno que puede aumentar el uso de CPU mientras se ejecuta — evítelo por una consola serie, evite ejecutarlo desde más de una sesión de terminal a la vez, y no lo convierta en mantenimiento rutinario en un equipo sano.

Los cinco grupos de escenarios

Relacione el síntoma, luego ejecute dos o tres comandos — no todo el manual.

Hardware

ComandoQué le indica
display deviceEstado por tarjeta — una tarjeta que reporta Abnormal es lo primero a confirmar.
display device alarm hardwareAlarmas de alimentación, ventilador y temperatura realmente activadas en el equipo.
display device power systemConsumo de energía frente a la capacidad de suministro — la verificación antes de insertar otra tarjeta u óptica.
display device elabelIdentidad del hardware e información de fabricación, necesaria para un RMA.
display device board reset slot-idSe ejecuta desde la vista diagnose — la razón registrada por la que una tarjeta concreta se reinició realmente.

Interfaz y pérdida de paquetes

ComandoQué le indica
display interfaceEstado físico, configuración y contadores de paquetes — la primera parada habitual para un enlace sospechoso.
display interface transceiver verbosePotencia óptica de transmisión/recepción, para un enlace que está up pero no es confiable.
reset counters interface / ping / display interfaceReiniciar, generar tráfico, releer — la única forma de que los contadores reflejen esta ventana, no las últimas semanas.
display cpu-defend statistics packet-type packet-typePaquetes realmente limitados en tasa o descartados por la protección del plano de CPU — una causa de pérdida de paquetes que display interface por sí solo no revela.

Entradas de tabla — MAC y ARP

ComandoQué le indica
display mac-addressMapeo MAC-VLAN-puerto — la primera parada cuando el tráfico se reenvía al lugar equivocado.
display mac-address flappingEl registro en vivo de una dirección MAC moviéndose entre puertos o VLAN, con un contador MoveNum.
display mac-address flapping aged-tableRegistros de flapping que ya han expirado de la tabla en vivo anterior — vea el problema 2 para saber por qué esto importa.
display arpTipo y estado de la entrada ARP para una IP dada — confirma si la tabla de la propia puerta de enlace es el problema.
display arp statisticsContadores de la tabla ARP, para una vista más amplia del recambio de la tabla.

Protocolo — OSPF, BGP, VXLAN, M-LAG

ComandoQué le indica
display ospf peer verboseDetalle del estado por vecino, mucho más allá de un simple up/down.
display bgp peer ipv4-address log-infoEl código de error Down del vecino directamente — la lectura más rápida sobre por qué una sesión osciló.
display vxlan troubleshootingUna verificación automatizada de un clic contra una biblioteca de firmas de fallas VXLAN conocidas — vea el problema 3 para sus límites.
display vxlan tunnelEstado real del túnel y del par VTEP para el overlay.
display dfs-group / display dfs-group consistency-check globalEstado del par M-LAG, y una verificación diseñada específicamente para la deriva de configuración entre los dos equipos pares.
display dfs black-box moduleUna instantánea de estado por módulo (arp, bridge-domain, adjacency y más) — se ejecuta en ambos pares M-LAG, vea el problema 4.
[~Device1] display vxlan troubleshooting
[~Device1] display vxlan tunnel
<HUAWEI> display dfs-group
<HUAWEI> display dfs-group 1 consistency-check global
[~HUAWEI-diagnose] display dfs black-box arp
[~HUAWEI-diagnose] display dfs black-box bridge-domain

Tráfico — Espejo y QoS

ComandoQué le indica
display port-mirroringConfirma que el emparejamiento observe-port y mirror-port coincide realmente con lo configurado.
display interface brief (Input on the mirror port, Output on the observe port)Confirma que el tráfico espejado realmente llega al puerto de observación antes de culpar a la herramienta de captura.
observe-port / mirroring / port-mirroring observe-portLos comandos de configuración en sí — vea el problema 5 sobre el límite de privacidad antes de habilitarlos.
display traffic-policy statistics interface interface inbound/outboundSi una política de tráfico realmente coincide, y qué hace con los paquetes que la alcanzan.
[~HUAWEI] observe-port 1 interface 25GE1/0/1
[*HUAWEI-25GE1/0/2] port-mirroring observe-port 1 inbound
<HUAWEI> display port-mirroring
[~HUAWEI] display traffic-policy statistics interface 100GE 1/0/1 inbound

Leer los contadores de interfaz sin engañarse

Esto aplica a cada grupo anterior que toca un contador — vale la pena hacerlo bien una vez, no por escenario.

display interface y display ip interface reportan estadísticas acumuladas desde que el equipo arrancó o desde el último reinicio de los contadores — no desde que empezó el problema. En un fabric spine-leaf con puertos que llevan meses arriba, ese historial acumulado estorba para leer qué está pasando ahora mismo.

  1. Reinicie los contadores con reset counters interface o reset ip statistics.
  2. Genere tráfico a través del enlace con ping.
  3. Vuelva a leer las mismas estadísticas con display interface o display ip interface — solo lo que se acumuló durante esta ventana está en vivo.
reset counters interface 100GE 1/0/1
ping -c 20 10.0.0.2
display interface 100GE 1/0/1

Un Total Error distinto de cero después de esta secuencia vale la pena investigarlo. Antes del reinicio, solo prueba que algo ocurrió en algún momento desde el último reinicio.

5 problemas en el propio conjunto de comandos

Los comandos anteriores tienen sus propias asperezas — estos son los que sorprenden a los ingenieros de centro de datos.

1. La captura de una sola pasada se comporta distinto según cómo y dónde la ejecute

SÍNTOMAdisplay diagnostic-information ocupa una sesión de consola serie durante mucho tiempo, o el uso de CPU sube notablemente cuando se ejecuta desde dos terminales a la vez.

CAUSAEl comando está explícitamente documentado como uno que aumenta el uso de CPU mientras se ejecuta, y una conexión serie es lo bastante lenta como para que un volcado de diagnóstico largo ocupe toda la sesión — ejecutarlo de forma redundante desde varias sesiones agrava ambos problemas.

SOLUCIÓNUse Telnet o STelnet en lugar de una consola serie para este comando específico, nunca lo ejecute desde dos sesiones a la vez, y desde V300R022C10 en adelante use collect diagnostic information cuando solo se necesiten los registros.

<HUAWEI> display diagnostic-information dia-info.txt

2. El propio contador de flapping MAC puede tocar techo y quedarse quieto

SÍNTOMAdisplay mac-address flapping sigue reportando el mismo valor de MoveNum sin importar cuánto continúe el flapping subyacente, dando la impresión de que los movimientos se detuvieron.

CAUSAMoveNum es un contador acotado que topa en 65535 — una vez saturado, simplemente deja de incrementarse, aunque la dirección MAC siga moviéndose entre puertos o VLAN en segundo plano.

SOLUCIÓNNo interprete un MoveNum estático como prueba de que el flapping se detuvo — verifique display mac-address flapping aged-table para el historial, y confirme el comportamiento actual con las alarmas de trapbuffer en lugar de solo el contador en vivo.

<HUAWEI> display mac-address flapping
<HUAWEI> display mac-address flapping aged-table

3. El diagnóstico VXLAN de un clic solo reconoce patrones conocidos

SÍNTOMAdisplay vxlan troubleshooting vuelve limpio, pero los tenants aún no pueden alcanzarse entre sí a través del fabric.

CAUSAEl comando coincide automáticamente una Event Description con una biblioteca definida de firmas de fallas VXLAN conocidas — una falla genuinamente nueva, o una que reside en un subsistema adyacente como el mapeo de bridge-domain, el IGP subyacente, o el estado del peer-link M-LAG, queda fuera de lo que está diseñado para detectar.

SOLUCIÓNTrate un resultado limpio como un dato más, no como una autorización — combínelo con display vxlan tunnel para el estado real del túnel y del VTEP, y con display mac-address bridge-domain para el bridge-domain específico en cuestión.

[~Device1] display vxlan troubleshooting
[~Device1] display vxlan tunnel

4. Los comandos black-box de M-LAG solo muestran la mitad de la historia de un equipo

SÍNTOMAdisplay dfs black-box arp, o cualquier otra variante de módulo black-box, se ve bien en el equipo investigado, pero el par M-LAG sigue comportándose como si los dos equipos estuvieran en desacuerdo sobre algo.

CAUSACada comando display dfs black-box module solo captura el equipo en el que se ejecuta — un par M-LAG son dos equipos independientes sincronizando su estado a través de un peer-link, y una discrepancia solo se ve comparando ambos lados.

SOLUCIÓNExtraiga la misma salida black-box de ambos equipos pares, o comience con display dfs-group consistency-check global, que existe específicamente para detectar la deriva de configuración entre ambos antes de concluir que el estado es realmente consistente.

[~HUAWEI-diagnose] display dfs black-box arp
<HUAWEI> display dfs-group 1 consistency-check global

5. Espejar un puerto spine-leaf tiene un límite de privacidad, no solo técnico

SÍNTOMAConfigurar observe-port y apuntar una herramienta de captura hacia él para rastrear una falla a nivel de paquete entre leaf y spine parece un paso puramente técnico.

CAUSALa propia documentación del proveedor señala que el espejo puede implicar la captura o el almacenamiento del contenido de comunicaciones reales de alguien, y establece que solo debe habilitarse dentro del alcance que la ley local realmente permita — el hecho de que el puerto esté dentro de un fabric de centro de datos en lugar de una red de campus no cambia ese límite.

SOLUCIÓNConfirme el alcance y la autorización antes de configurar un observe-port y espejar tráfico en vivo hacia él, especialmente antes de apuntar una herramienta de captura al flujo espejado.

[~HUAWEI] observe-port 1 interface 25GE1/0/1
[*HUAWEI-25GE1/0/2] port-mirroring observe-port 1 inbound

Los cinco grupos, de un vistazo

Relacione el síntoma de la izquierda con el grupo de la derecha.

display diagnostic-information — the baseline, first, every timeThen match the symptom below to one of the five groups Hardware — board/power/fan/optics faultdisplay device / display device alarm hardware / display device power systemdisplay device elabel / display device board reset slot-id Interface & Packet Loss — link up but droppingdisplay interface / display interface transceiver verbosereset counters interface + ping + re-read / display cpu-defend statistics Table Entries — forwarding to the wrong placedisplay mac-address / display mac-address flapping (+ aged-table)display arp / display arp statistics Protocol — session or overlay won't formdisplay ospf peer verbose / display bgp peer log-infodisplay vxlan troubleshooting + tunnel / display dfs-group + black-box Traffic — capture or policy-hit questionsdisplay port-mirroring / observe-port config / display traffic-policy statistics

Las etiquetas del diagrama se mantienen en inglés por claridad técnica.

Diseños de soluciones relacionadas

FAQ

Las preguntas que surgen primero en cuanto alguien abre el diccionario de comandos.

¿En qué se diferencia esto de la nota Lista de recopilación de información de fallas?

Esa nota cubre el orden de recopilación a seguir antes de escalar una falla al soporte — captura de una sola pasada, lista de verificación básica, manejo de registros, y una hoja de referencia por tipo de falla, independiente de la plataforma en routers y switches Huawei. Esta es el diccionario de comandos del día a día específicamente para switches de centro de datos CloudEngine, organizado por los cinco grupos de escenarios a los que recurre una vez que ya tiene una teoría de trabajo.

Todavía no sé cuál de los cinco grupos aplica — ¿por dónde empiezo?

Empiece con display diagnostic-information (o collect diagnostic information desde V300R022C10) para la instantánea básica, luego relacione el síntoma: un problema de tarjeta, alimentación o ventilador es Hardware; un enlace que está up pero pierde paquetes es Interfaz y Pérdida de Paquetes; tráfico que se reenvía al lugar equivocado es Entradas de Tabla; una sesión de enrutamiento u overlay que no se forma es Protocolo; cualquier cosa que implique una captura o un conteo de coincidencias de política de tráfico es Tráfico.

¿Cuál es la diferencia entre display mac-address flapping y la variante aged-table?

display mac-address flapping muestra el registro de flapping en vivo y su contador MoveNum; la variante aged-table muestra entradas que ya han expirado de esa tabla en vivo. Esto importa porque MoveNum topa en 65535 y deja de incrementarse una vez saturado, así que el historial expirado puede mostrar flapping que la vista en vivo ya no refleja.

¿display vxlan troubleshooting reemplaza la verificación manual del túnel?

No — es una coincidencia de patrones automatizada contra firmas de fallas VXLAN conocidas, no un diagnóstico completo. Combine un resultado limpio con display vxlan tunnel para el estado real del túnel y del VTEP, y con display mac-address bridge-domain para un tenant específico.

En un par M-LAG, ¿en cuál de los dos equipos ejecuto estos comandos?

Ambos. Cada comando display dfs black-box module solo reporta el equipo en el que se ejecuta, así que una discrepancia entre el par solo se hace visible comparando ambos lados — o ejecutando display dfs-group consistency-check global, diseñado específicamente para revelar ese tipo de deriva en un solo comando.

¿Sigue habiendo un solo comando para todo el switch, a escala de centro de datos?

Sí — display diagnostic-information file-name es el mismo paquete de una sola pasada sin importar la plataforma, y desde V300R022C10 collect diagnostic information añade una opción más ligera que comprime solo los archivos de registro, KPI y PADS en diagnostic_information.zip sin el paquete display completo.

Límites honestos de esta nota

Este es un diccionario de comandos, no una guía de causa raíz. Se basa en el propio capítulo del manual de mantenimiento CloudEngine 16800/9800/8800/6800 sobre recopilación de información común y comandos de diagnóstico, contrastado con los capítulos de manejo de fallas de hardware, MAC, ARP, VXLAN y M-LAG del mismo manual. Para el orden de recopilación a seguir antes de escalar cualquier falla, vea la Lista de recopilación de información de fallas. Una vez que un tipo de falla específico ya está confirmado — un puerto físicamente down, o el uso de CPU atascado alto — el análisis profundo de causa raíz es una nota aparte, no esta.

¿Está mirando la salida de un comando y todavía no está seguro de qué significa?

Envíenos la salida y de qué grupo proviene — hardware, interfaz, entradas de tabla, protocolo o tráfico — y le ayudamos a interpretarla.

WhatsApp con un ingeniero →
Solo usamos cookies para analítica anónima — sin publicidad ni rastreo entre sitios.Política de privacidad