Início / Notas técnicas / Comandos de diagnóstico de switches de data center

Comandos de diagnóstico de switches de data center: o cartão de referência

Assim que você já sabe qual subsistema verificar em um switch leaf ou spine CloudEngine, este é o comando a usar — agrupado da forma como um engenheiro realmente pensa: hardware, interface e perda de pacotes, entradas de tabela MAC/ARP, protocolo (OSPF, BGP, VXLAN, M-LAG), e tráfego (espelhamento, QoS). Cada comando aqui vem diretamente do capítulo de comandos de diagnóstico do próprio manual de manutenção CloudEngine 16800/9800/8800/6800.

By Yuwen Zhang (Atlas), founder of AtlasCommTech — 13 years of carrier & enterprise network deployments · Updated July 2026

Dois documentos diferentes, um mesmo manual

Um diz o que coletar antes de escalar. Este é o dicionário que você consulta enquanto ainda está tentando descobrir sozinho.

Nosso Checklist de coleta de informações de falha cobre a ordem de coleta a seguir assim que algo falha — a captura de uma única passada, uma checklist básica, o tratamento de logs, e uma folha de referência organizada por tipo de falha (IPSec, OSPF, BGP, DHCP, reinício, ARP), independente da plataforma em roteadores e switches Huawei. Esta nota é mais estreita e específica: é o próprio capítulo do manual de manutenção da série CloudEngine 16800/9800/8800/6800 sobre coleta de informações comuns e comandos de diagnóstico, reorganizado nos cinco grupos de cenários em que um engenheiro de data center realmente pensa.

Esses cinco grupos são hardware (placas, alimentação, ventoinhas, ópticas), interface e perda de pacotes (estado do link, contadores, quedas de CPU-defend), entradas de tabela (MAC e ARP), protocolo (OSPF, BGP, túneis VXLAN, estado do par M-LAG), e tráfego (espelhar uma porta para uma captura, ou ler se uma política de tráfego realmente correspondeu a algo). Combine o sintoma com um grupo, e o comando certo geralmente está entre dois ou três.

A captura de uma única passada, antes de qualquer coisa específica do cenário

O mesmo pacote básico se aplica aqui como em qualquer outro lugar — capture-o primeiro, depois procure o comando específico do cenário.

display diagnostic-information coleta em uma única passada as placas do equipamento, a configuração atual, as informações de interface, o relógio, a versão de software e mais. Dê um nome de arquivo para que a saída caia na flash em vez de rolar pelo terminal.

<HUAWEI> display diagnostic-information dia-info.txt

100%

Info: The diagnostic information was saved to the device successfully.

A partir da V300R022C10 existe uma alternativa mais leve quando só são necessários os logs, os dados de KPI e os arquivos PADS em vez do pacote display completo: collect diagnostic information, executado na visão de usuário ou na visão diagnose, que compacta o diretório de logs atual diretamente em diagnostic_information.zip sob a flash.

<HUAWEI> collect diagnostic information

Este comando é documentado como um que pode aumentar o uso de CPU enquanto executa — evite-o pelo console serial, evite executá-lo em mais de uma sessão de terminal ao mesmo tempo, e não o transforme em manutenção de rotina em um equipamento saudável.

Os cinco grupos de cenários

Combine o sintoma, depois execute dois ou três comandos — não o manual inteiro.

Hardware

ComandoO que indica
display deviceEstado por placa — uma placa relatando Abnormal é a primeira coisa a confirmar.
display device alarm hardwareAlarmes de energia, ventoinha e temperatura efetivamente disparados no equipamento.
display device power systemConsumo de energia versus capacidade de fornecimento — a verificação antes de inserir outra placa ou óptica.
display device elabelIdentidade do hardware e informações de fabricação, necessárias para um RMA.
display device board reset slot-idExecutado na visão diagnose — o motivo registrado pelo qual uma placa específica realmente reiniciou.

Interface e perda de pacotes

ComandoO que indica
display interfaceEstado físico, configuração e contadores de pacotes — a primeira parada padrão para um link suspeito.
display interface transceiver verbosePotência óptica de transmissão/recepção, para um link que está up mas não confiável.
reset counters interface / ping / display interfaceZerar, gerar tráfego, reler — a única forma de os contadores refletirem esta janela, não as últimas semanas.
display cpu-defend statistics packet-type packet-typePacotes realmente limitados em taxa ou descartados pela proteção do plano de CPU — uma causa de perda de pacotes que o display interface sozinho não revela.

Entradas de tabela — MAC e ARP

ComandoO que indica
display mac-addressMapeamento MAC-VLAN-porta — a primeira parada quando o tráfego é encaminhado para o lugar errado.
display mac-address flappingO registro ao vivo de um endereço MAC se movendo entre portas ou VLANs, com um contador MoveNum.
display mac-address flapping aged-tableRegistros de flapping que já expiraram da tabela ao vivo acima — veja a Armadilha 2 para saber por que isso importa.
display arpTipo e estado da entrada ARP para um IP dado — confirma se a própria tabela do gateway é o problema.
display arp statisticsContadores da tabela ARP, para uma visão mais ampla da rotatividade da tabela.

Protocolo — OSPF, BGP, VXLAN, M-LAG

ComandoO que indica
display ospf peer verboseDetalhe do estado por vizinho, muito além de um simples up/down.
display bgp peer ipv4-address log-infoO código de erro Down do vizinho diretamente — a leitura mais rápida sobre por que uma sessão oscilou.
display vxlan troubleshootingUma verificação automatizada de um clique contra uma biblioteca de assinaturas de falhas VXLAN conhecidas — veja a Armadilha 3 para seus limites.
display vxlan tunnelEstado real do túnel e do par VTEP para o overlay.
display dfs-group / display dfs-group consistency-check globalEstado do par M-LAG, e uma verificação criada especificamente para a deriva de configuração entre os dois equipamentos pares.
display dfs black-box moduleUm snapshot de estado por módulo (arp, bridge-domain, adjacency e mais) — executado em ambos os pares M-LAG, veja a Armadilha 4.
[~Device1] display vxlan troubleshooting
[~Device1] display vxlan tunnel
<HUAWEI> display dfs-group
<HUAWEI> display dfs-group 1 consistency-check global
[~HUAWEI-diagnose] display dfs black-box arp
[~HUAWEI-diagnose] display dfs black-box bridge-domain

Tráfego — Espelhamento e QoS

ComandoO que indica
display port-mirroringConfirma que o pareamento observe-port e mirror-port realmente corresponde ao que foi configurado.
display interface brief (Input on the mirror port, Output on the observe port)Confirma que o tráfego espelhado realmente chega à porta de observação antes de culpar a ferramenta de captura.
observe-port / mirroring / port-mirroring observe-portOs próprios comandos de configuração — veja a Armadilha 5 sobre o limite de privacidade antes de habilitá-los.
display traffic-policy statistics interface interface inbound/outboundSe uma política de tráfego realmente corresponde, e o que ela faz com os pacotes que a atingem.
[~HUAWEI] observe-port 1 interface 25GE1/0/1
[*HUAWEI-25GE1/0/2] port-mirroring observe-port 1 inbound
<HUAWEI> display port-mirroring
[~HUAWEI] display traffic-policy statistics interface 100GE 1/0/1 inbound

Ler os contadores de interface sem se enganar

Isso se aplica a cada grupo acima que envolve um contador — vale a pena fazer certo uma vez, não por cenário.

display interface e display ip interface reportam estatísticas acumuladas desde que o equipamento inicializou ou desde a última limpeza dos contadores — não desde que o problema começou. Em um fabric spine-leaf com portas que estão up há meses, esse histórico acumulado atrapalha a leitura do que está acontecendo agora.

  1. Zere os contadores com reset counters interface ou reset ip statistics.
  2. Gere tráfego pelo link com ping.
  3. Leia novamente as mesmas estatísticas com display interface ou display ip interface — só o que se acumulou nessa janela está ao vivo.
reset counters interface 100GE 1/0/1
ping -c 20 10.0.0.2
display interface 100GE 1/0/1

Um Total Error diferente de zero após essa sequência vale a pena investigar. Antes do reset, ele só prova que algo aconteceu em algum momento desde a última limpeza.

5 armadilhas no próprio conjunto de comandos

Os comandos acima têm suas próprias arestas — estas são as que pegam os engenheiros de data center de surpresa.

1. A captura de uma única passada se comporta diferente dependendo de como e onde você a executa

SINTOMAdisplay diagnostic-information ocupa uma sessão de console serial por muito tempo, ou o uso de CPU sobe visivelmente quando executado em dois terminais ao mesmo tempo.

CAUSAO comando é explicitamente documentado como um que aumenta o uso de CPU enquanto executa, e uma conexão serial é lenta o suficiente para que um dump de diagnóstico longo ocupe toda a sessão — executá-lo de forma redundante em várias sessões agrava ambos os problemas.

CORREÇÃOUse Telnet ou STelnet em vez de um console serial para este comando específico, nunca o execute em duas sessões ao mesmo tempo, e a partir da V300R022C10 use collect diagnostic information quando só os logs forem realmente necessários.

<HUAWEI> display diagnostic-information dia-info.txt

2. O próprio contador de flapping de MAC pode saturar e ficar quieto

SINTOMAdisplay mac-address flapping continua reportando o mesmo valor de MoveNum independentemente de quanto tempo o flapping subjacente continue, dando a impressão de que os movimentos pararam.

CAUSAMoveNum é um contador limitado que satura em 65535 — uma vez saturado, ele simplesmente para de incrementar, mesmo que o endereço MAC ainda esteja se movendo entre portas ou VLANs em segundo plano.

CORREÇÃONão interprete um MoveNum estático como prova de que o flapping parou — verifique display mac-address flapping aged-table para o histórico, e confirme o comportamento atual com os alarmes do trapbuffer em vez de apenas o contador ao vivo.

<HUAWEI> display mac-address flapping
<HUAWEI> display mac-address flapping aged-table

3. O diagnóstico VXLAN de um clique só reconhece padrões conhecidos

SINTOMAdisplay vxlan troubleshooting volta limpo, mas os tenants ainda não conseguem se alcançar através do fabric.

CAUSAO comando faz correspondência automática de uma Event Description com uma biblioteca definida de assinaturas de falhas VXLAN conhecidas — uma falha genuinamente nova, ou uma que esteja em um subsistema adjacente como o mapeamento de bridge-domain, o IGP subjacente, ou o estado do peer-link M-LAG, fica fora do que ele foi projetado para detectar.

CORREÇÃOTrate um resultado limpo como um dado a mais, não como uma liberação — combine com display vxlan tunnel para o estado real do túnel e do VTEP, e com display mac-address bridge-domain para o bridge-domain específico em questão.

[~Device1] display vxlan troubleshooting
[~Device1] display vxlan tunnel

4. Os comandos black-box do M-LAG mostram apenas a metade da história de um equipamento

SINTOMAdisplay dfs black-box arp, ou qualquer uma das outras variantes de módulo black-box, parece normal no equipamento investigado, mas o par M-LAG continua se comportando como se os dois equipamentos discordassem sobre algo.

CAUSACada comando display dfs black-box module captura apenas o equipamento em que é executado — um par M-LAG são dois equipamentos independentes sincronizando estado por um peer-link, e uma discrepância só aparece comparando os dois lados.

CORREÇÃOExtraia a mesma saída black-box de ambos os equipamentos pares, ou comece com display dfs-group consistency-check global, que existe especificamente para detectar a deriva de configuração entre os dois antes de concluir que o estado é realmente consistente.

[~HUAWEI-diagnose] display dfs black-box arp
<HUAWEI> display dfs-group 1 consistency-check global

5. Espelhar uma porta spine-leaf tem um limite de privacidade, não só técnico

SINTOMAConfigurar observe-port e apontar uma ferramenta de captura para ele para rastrear uma falha em nível de pacote entre leaf e spine parece um passo puramente técnico.

CAUSAA própria documentação do fornecedor sinaliza que o espelhamento pode envolver a captura ou o armazenamento do conteúdo de comunicações reais de alguém, e afirma que só deve ser habilitado dentro do escopo que a lei local realmente permite — o fato de a porta estar dentro de um fabric de data center em vez de uma rede de campus não muda esse limite.

CORREÇÃOConfirme o escopo e a autorização antes de configurar um observe-port e espelhar tráfego ao vivo para ele, especialmente antes de apontar uma ferramenta de captura para o feed espelhado.

[~HUAWEI] observe-port 1 interface 25GE1/0/1
[*HUAWEI-25GE1/0/2] port-mirroring observe-port 1 inbound

Os cinco grupos, em um relance

Combine o sintoma à esquerda com o grupo à direita.

display diagnostic-information — the baseline, first, every timeThen match the symptom below to one of the five groups Hardware — board/power/fan/optics faultdisplay device / display device alarm hardware / display device power systemdisplay device elabel / display device board reset slot-id Interface & Packet Loss — link up but droppingdisplay interface / display interface transceiver verbosereset counters interface + ping + re-read / display cpu-defend statistics Table Entries — forwarding to the wrong placedisplay mac-address / display mac-address flapping (+ aged-table)display arp / display arp statistics Protocol — session or overlay won't formdisplay ospf peer verbose / display bgp peer log-infodisplay vxlan troubleshooting + tunnel / display dfs-group + black-box Traffic — capture or policy-hit questionsdisplay port-mirroring / observe-port config / display traffic-policy statistics

Os rótulos do diagrama permanecem em inglês para clareza técnica.

Projetos de soluções relacionadas

FAQ

As perguntas que surgem primeiro assim que alguém abre o dicionário de comandos.

Em que isso difere da nota Checklist de coleta de informações de falha?

Aquela nota cobre a ordem de coleta a seguir antes de escalar uma falha ao suporte — captura de uma única passada, checklist básica, tratamento de logs, e uma folha de referência por tipo de falha, independente da plataforma em roteadores e switches Huawei. Esta é o dicionário de comandos do dia a dia especificamente para switches de data center CloudEngine, organizado pelos cinco grupos de cenários que você já consulta assim que tem uma teoria de trabalho.

Ainda não sei qual dos cinco grupos se aplica — por onde começo?

Comece com display diagnostic-information (ou collect diagnostic information a partir da V300R022C10) para o snapshot básico, depois combine o sintoma: um problema de placa, energia ou ventoinha é Hardware; um link que está up mas perdendo pacotes é Interface e Perda de Pacotes; tráfego encaminhado para o lugar errado é Entradas de Tabela; uma sessão de roteamento ou overlay que não se forma é Protocolo; qualquer coisa envolvendo uma captura ou uma contagem de correspondência de política de tráfego é Tráfego.

Qual é a diferença entre display mac-address flapping e a variante aged-table?

display mac-address flapping mostra o registro de flapping ao vivo e seu contador MoveNum; a variante aged-table mostra entradas que já expiraram dessa tabela ao vivo. Isso importa porque o MoveNum satura em 65535 e para de incrementar uma vez saturado, então o histórico expirado pode mostrar flapping que a visão ao vivo não reflete mais.

O display vxlan troubleshooting substitui a verificação manual do túnel?

Não — é uma correspondência de padrões automatizada contra assinaturas de falhas VXLAN conhecidas, não um diagnóstico completo. Combine um resultado limpo com display vxlan tunnel para o estado real do túnel e do VTEP, e com display mac-address bridge-domain para um tenant específico.

Em um par M-LAG, em qual dos dois equipamentos executo esses comandos?

Ambos. Cada comando display dfs black-box module só reporta o equipamento em que é executado, então uma discrepância entre o par só se torna visível comparando os dois lados — ou executando display dfs-group consistency-check global, criado especificamente para revelar esse tipo de deriva em um único comando.

Ainda existe apenas um comando para o switch inteiro, em escala de data center?

Sim — display diagnostic-information file-name é o mesmo pacote de uma única passada independente da plataforma, e a partir da V300R022C10 collect diagnostic information adiciona uma opção mais leve que compacta apenas os arquivos de log, KPI e PADS em diagnostic_information.zip sem o pacote display completo.

Limites honestos desta nota

Este é um dicionário de comandos, não um guia de causa raiz. É construído a partir do próprio capítulo do manual de manutenção CloudEngine 16800/9800/8800/6800 sobre coleta de informações comuns e comandos de diagnóstico, cruzado com os capítulos de tratamento de falhas de hardware, MAC, ARP, VXLAN e M-LAG do mesmo manual. Para a ordem de coleta a seguir antes de escalar qualquer falha, veja o Checklist de coleta de informações de falha. Assim que um tipo de falha específico já estiver confirmado — uma porta fisicamente down, ou uso de CPU travado alto — a análise mais profunda de causa raiz é uma nota separada, não esta.

Está olhando para a saída de um comando e ainda não tem certeza do que significa?

Envie-nos a saída e de qual grupo ela veio — hardware, interface, entradas de tabela, protocolo ou tráfego — e ajudamos a interpretar.

WhatsApp com um engenheiro →
Usamos cookies apenas para análises anônimas — sem anúncios, sem rastreamento entre sites.Política de privacidade