Início / Notas técnicas / Verificação de saúde de switches de data center

Verificação de saúde de switches de data center: rotinas diárias, semanais e mensais

Direto do manual de manutenção dos switches Huawei série CloudEngine 16800, 9800, 8800 e 6800 — a verificação de rotina para switches núcleo e spine de data center: ambiente, informações básicas, estado de funcionamento e conteúdo de interfaces. O que observar em cada etapa, o que conta como aprovado, a cadência recomendada, e os comandos display exatos usados para verificar.

Por Yuwen Zhang (Atlas), fundador da AtlasCommTech — 13 anos de implantações de redes de operadoras e empresariais · Atualizado em julho de 2026

Por que a rotina de um núcleo de data center não é a mesma de um switch de campus

O manual de manutenção dos switches Huawei série CloudEngine 16800/9800/8800/6800 organiza a manutenção rotineira em quatro seções, não cinco — e o chassi por trás é de uma natureza completamente diferente.

Nossa nota sobre verificação rotineira de saúde de switches empresariais segue o manual Huawei para switches de campus e camada de acesso — salas de cabeamento, andares de escritório, a falha de um switch afeta um segmento. Esta nota segue em vez disso o manual da série CloudEngine 16800, 9800, 8800 e 6800: switches núcleo e spine dentro de um data center, onde uma leitura ruim atrás de uma caixa núcleo pode afetar cada rack a jusante dela, não apenas uma ala de um prédio.

O manual, '例行维护' (Manutenção rotineira), organiza tudo em quatro seções: verificação do ambiente do equipamento, verificação de informações básicas, verificação do estado de funcionamento e verificação de conteúdo de interfaces. Duas das quatro famílias de chassi — CE16800 e CE8800/6800 — até têm suas próprias tabelas de ambiente separadas, porque suas tolerâncias nominais de tensão e umidade realmente diferem. A seguir está essa rotina de quatro etapas, o padrão de aprovação e o comando display para cada item, uma cadência apropriada para data center, e uma nota sobre disciplina de backup de configuração que os itens de verificação sozinhos não cobrem.

As quatro etapas em um relance

Mesma ordem usada pelo manual de origem — ambiente primeiro, interfaces por último.

STEP 1 Environment 3.2 设备环境检查 Day / Week (facility rounds) STEP 2 Basic Information 3.3 设备基本信息检查 Month STEP 3 Running Status 3.4 设备运行检查 Day STEP 4 Interface Content 3.5 接口内容检查 Week The CloudEngine V300 manual doesn't assign a cycle per item the way the campus switch manual does. Cadence above follows standard DC core-switch operational practice, not the manual itself — see Honest Limits below. Diagram labels are kept in English for engineering clarity.

Os rótulos do diagrama permanecem em inglês para clareza técnica.

Etapa 1 — Verificação do ambiente do equipamento

O manual de origem fornece duas tabelas separadas para a série CE16800 e a série CE8800/6800 — suas tolerâncias de tensão e umidade realmente diferem, e esta etapa não tem comandos CLI, apenas verificações físicas.

Série CE16800
Item a verificarCritério de aprovação
Temperatura da sala de equipamentosTemperatura de operação 0°C a 40°C (0m a 1800m de altitude); acima de 1800m até 5000m, a especificação cai 1°C a cada 220m adicionais de altitude. Temperatura de armazenamento -40°C a +70°C.
Umidade da sala de equipamentosUmidade relativa de operação 5%RH a 85%RH, sem condensação. Se a umidade da sala for consistentemente alta demais, instale desumidificação; se baixa demais, instale umidificação.
LimpezaO próprio equipamento não deve apresentar acúmulo visível de poeira; observe a condição da tela antipoeira e limpe ou substitua o algodão antipoeira prontamente para não afetar a ventilação e o resfriamento do chassi.
Resfriamento / fluxo de arOs ventiladores devem funcionar normalmente durante a operação (exceto durante a limpeza); a entrada de ar do chassi não deve ficar bloqueada por excesso de poeira — limpe a tela antipoeira se estiver muito suja, recomendado trimestralmente.
Roteamento de cabosCabos de energia roteados separadamente dos cabos de negócio; tanto o cabeamento de energia quanto o de negócio organizados.
Etiquetagem de cabosEtiquetas de cabos claras, precisas e conforme o padrão.
Sistema de alimentaçãoFornecimento estável necessário. Tensão nominal 110V CA / 220V CA; faixa nominal 100V CA-120V CA / 200V CA-240V CA; faixa máxima 90V CA-290V CA.
Série CE8800, 6800
Item a verificarCritério de aprovação
Posicionamento do equipamentoColocado em um ambiente ventilado e seco, posicionado firme e nivelado.
Temperatura da sala de equipamentosIgual ao CE16800: operação 0°C a 40°C (0m-1800m, -1°C a cada 220m acima de 1800m até 5000m); armazenamento -40°C a +70°C.
Umidade da sala de equipamentosUmidade relativa de operação 5%RH a 95%RH, sem condensação — uma tolerância mais ampla que o teto de 85%RH do CE16800.
Ar-condicionado da salaO ar-condicionado funciona de forma contínua e estável, mantendo a temperatura da sala dentro da tolerância do equipamento.
Aterramento e resistência de aterramentoTerra de trabalho, terra de proteção e terra de para-raios do prédio mantidos separados quando possível (uma terra compartilhada é aceitável se as condições da sala exigirem); equipamentos instalados ao ar livre devem ser aterrados — uma unidade externa sem aterramento é altamente vulnerável a danos por raios.
Conexão de energiaCabo de energia corretamente conectado à posição designada do equipamento e bem encaixado; o indicador de energia permanece verde fixo.
Sistema de alimentaçãoFornecimento estável necessário. Faixa nominal 100V CA-240V CA, 50/60Hz; faixa máxima 90V CA-290V CA, 45Hz-65Hz — uma banda nominal mais ampla que os 110V/220V fixos do CE16800.
Obstrução do fluxo de resfriamentoSem obstruções ao redor do equipamento; folga de resfriamento recomendada entre duas unidades de pelo menos 1U.
Alinhamento do resfriamentoA direção do fluxo de resfriamento do módulo de energia e do módulo de ventoinha deve ser consistente entre si, e com a direção do fluxo de resfriamento do próprio gabinete.
Estado do módulo de ventoinhaO indicador do módulo de ventoinha é normal quando pisca em verde lento.
Estado de funcionamento do equipamentoO indicador SYS do equipamento é normal quando pisca em verde lento.

Etapa 2 — Verificação de informações básicas

Verifica se as informações básicas — versão de software, informações de patch, hora do sistema, configuração, licença — estão corretas. Recomendamos mensalmente, ajustado para se alinhar com qualquer ciclo de controle de mudanças que seu data center já utilize.

Item a verificarMétodo de verificaçãoCritério de aprovação
Versão de software em execuçãodisplay versionO número de versão de PCB da subplaca e o número de versão de software correspondem ao exigido.
Pacote de software em usodisplay startupOs nomes de arquivo do software do produto e do arquivo de configuração atualmente em uso, e a serem carregados na próxima inicialização, estão corretos.
Informações de patchdisplay patch-informationO arquivo de patch corresponde aos requisitos reais — a Huawei recomenda carregar o patch mais recente publicado para a versão do produto em execução.
Hora do sistemadisplay clockA hora corresponde à hora local real (diferença não superior a 5 minutos), para localizar falhas com precisão por timestamp. Caso contrário, execute clock datetime ou configure NTP para sincronizar a hora de rede.
Correção da configuraçãodisplay current-configurationAnalise os parâmetros de configuração atualmente vigentes para verificar se a configuração do equipamento está correta.
Informações de licençadisplay licenseAnalise os detalhes do arquivo de licença ativado — nome, versão, período de validade, itens de controle — para determinar se a versão precisa ser atualizada para suportar mais recursos.
<HUAWEI> display version
<HUAWEI> display startup
<HUAWEI> display patch-information
<HUAWEI> display clock
<HUAWEI> display current-configuration
<HUAWEI> display license

Disciplina de backup de configuração

A verificação de informações básicas deste capítulo só verifica se a configuração em execução está atualmente correta — não diz nada sobre se essa configuração sobreviveria a uma reinicialização, um reset de placa ou um evento de energia. Uma vez que display current-configuration passa, execute save para persisti-la na configuração de inicialização, e mantenha também uma cópia programada fora do equipamento — uma exportação FTP/SFTP ou uma extração de gerenciamento de configuração guardada em algum lugar que sobreviva à indisponibilidade do próprio equipamento. save sozinho protege contra a próxima recarga; não protege contra o equipamento, seu armazenamento ou o operador sendo o verdadeiro ponto de falha. Algumas etapas de remediação que surgem de uma verificação reprovada — uma reinicialização, um reset de placa, um delete em um armazenamento cheio — carregam seu próprio risco real; veja nossa lista de comandos perigosos antes de executar qualquer uma delas.

Etapa 3 — Verificação do estado de funcionamento

Verifica o estado da placa, o estado de ventoinhas e energia, a temperatura, a CPU e a memória — os itens com o raio de impacto mais imediato em um switch núcleo. Recomendamos diariamente.

Item a verificarMétodo de verificaçãoCritério de aprovação
Estado de funcionamento da placa (somente CE16800)display deviceFoque na presença e no estado da placa: normal significa placa 'Online' = 'Present', 'Power' = 'PowerOn', 'Register' = 'Registered', 'Status' = 'Normal'.
Estado das ventoinhasdisplay device fan'Status' = 'Normal' indica normal.
Estado de energiadisplay device power'State' = 'Supply' indica normal.
Temperatura do equipamentodisplay device temperature'Status' = 'Normal' indica normal.
Estado da CPUdisplay cpu'Status' = 'Non-overload' indica normal.
Uso de memóriadisplay memory'Status' = 'Non-overload' indica normal.
<HUAWEI> display device
<HUAWEI> display device fan
<HUAWEI> display device power
<HUAWEI> display device temperature
<HUAWEI> display cpu
<HUAWEI> display memory

Etapa 4 — Verificação de conteúdo de interfaces

Verifica pacotes com erro da porta, modo de negociação e estado Up/Down. Recomendamos semanalmente.

Item a verificarMétodo de verificaçãoCritério de aprovação
Pacotes com erro de portadisplay interfaceEnquanto o negócio está em funcionamento, verifique erros de porta, incluindo erros de CRC.
Modo de negociação da portadisplay interfaceModo de negociação correto e consistente em ambas as extremidades — o modo half-duplex não é aceitável.
Estado da portadisplay interface briefO estado Up/Down da porta atende ao requisito planejado.
<HUAWEI> display interface 100GE1/0/1
<HUAWEI> display interface brief

'Verificar erros de CRC' é apenas um indicador de uma linha, não a história completa — veja nossa nota de solução de problemas de perda de pacotes para o detalhamento completo de erros de entrada CRC/Giants/Runts, erros de bits do módulo óptico e congestionamento Discard de saída, com os campos exatos e a correção para cada um.

5 armadilhas em que esta rotina tropeça

Cada comando acima é somente leitura — apenas display — mas uma caixa núcleo de data center tem algumas formas de interpretar mal o resultado que um switch de campus não tem.

1. 'Non-overload' é um estado binário, não uma porcentagem que se possa acompanhar em tendência

RISCOdisplay cpu e display memory reportam um Status de Non-overload em vez de uma porcentagem numérica como fazem os limiares 80%/60% do manual de campus. Tratar 'Non-overload' como o quadro completo perde uma subida lenta rumo à sobrecarga que ainda não cruzou a linha.

PRÁTICA MAIS SEGURACombine o status Non-overload com o detalhe numérico disponível dentro da saída mais completa de display cpu/display memory se quiser acompanhar a tendência ao longo do tempo, e verifique com mais frequência que mensalmente dado quantos serviços ficam atrás de uma caixa núcleo de data center.

2. O item de presença de placa exclusivo do CE16800 é silenciosamente ignorado no 8800/6800

RISCOO item de estado de funcionamento de presença de placa se limita explicitamente à série CE16800. No CE8800/6800 sua ausência é correta — mas em uma frota mista é fácil para um técnico perder de vista se um item ausente foi uma exclusão deliberada baseada no modelo ou algo pulado por engano.

PRÁTICA MAIS SEGURARegistre contra qual modelo de chassi cada verificação foi executada, não apenas aprovado/reprovado, para que uma frota mista CE16800 + CE8800/6800 mantenha uma trilha de auditoria explicando cada item marcado como não aplicável.

3. As tolerâncias de tensão e umidade diferem por família de chassi — não copie uma tabela para a outra

RISCOA tolerância ambiental do CE16800 permite 5%RH-85%RH e um fornecimento nominal de 110V/220V; o CE8800/6800 permite até 5%RH-95%RH e uma faixa nominal mais ampla de 100V-240V. Copiar a faixa de umidade mais rígida do CE16800 para um chassi 8800/6800, ou o inverso, produz uma falha falsa ou uma aprovação falsa dependendo da direção do erro.

PRÁTICA MAIS SEGURAConfirme a família de chassi antes de aplicar qualquer uma das tabelas de ambiente, e mantenha as duas como listas de verificação separadas em vez de fundi-las em um padrão genérico de ambiente de switch.

4. display current-configuration confirma a correção, não que sobreviverá a uma reinicialização

RISCOEste item só verifica se a configuração em execução está atualmente correta — não diz nada sobre se ela realmente foi salva na configuração de inicialização que será carregada na próxima recarga. Ao contrário da rotina de campus, a verificação de informações básicas deste manual não tem uma etapa separada de compare configuration para detectar essa lacuna.

PRÁTICA MAIS SEGURATrate save — e um backup de configuração fora do equipamento — como obrigatório sempre que esta verificação passar, não como um extra opcional; veja a nota de disciplina de backup de configuração acima, e nossa nota de verificação de saúde de switch de campus para o hábito equivalente de compare configuration.

5. 'Verificar erros de CRC' só conta metade da história da interface

RISCOO item de pacotes com erro de porta da verificação de conteúdo de interfaces sinaliza erros de CRC de forma genérica, mas não distingue um problema de camada física de entrada de um problema de congestionamento de saída, nem verifica de forma alguma o módulo óptico por trás da interface — uma aprovação rotineira aqui ainda pode estar sobre um contador Discard em ascensão ou um módulo próximo do seu limiar de potência.

PRÁTICA MAIS SEGURASempre que este item sinalizar algo além de um zero limpo, prossiga com o detalhamento completo das três fontes — óptica, erros de entrada, Discard de saída — em nossa nota de solução de problemas de perda de pacotes, em vez de tratar uma menção de CRC como o diagnóstico completo.

Projetos de soluções relacionadas

Cinco perguntas que surgem constantemente

Tiradas diretamente do campo — as que vale a pena ter uma resposta pronta.

Esta rotina se aplica da mesma forma ao CE16800 e ao CE8800/6800?

Em sua maioria, mas não totalmente — o manual dá a cada família de chassi sua própria tabela de verificação de ambiente, já que as tolerâncias de tensão e umidade diferem, e o item de presença de placa é exclusivo do CE16800. As verificações de informações básicas, CPU/memória e interface se aplicam da mesma forma nas quatro séries.

Com que frequência cada etapa deve realmente rodar em um switch núcleo de data center?

O manual original não atribui um ciclo por item como faz o manual de campus — veja nossa nota de limites honestos abaixo. Dado quanto tráfego e quantos serviços ficam atrás de um switch núcleo de data center, recomendamos verificações de ambiente e estado de funcionamento diárias (ou contínuas via monitoramento), informações básicas mensais, e conteúdo de interface semanal — ajustando qualquer uma dessas onde seus próprios requisitos de controle de mudanças ou conformidade exigirem evidências mais frequentes.

Qual é a diferença real entre esta e a nota de verificação rotineira de saúde de switches empresariais?

Aquela nota segue o manual da Huawei, com itens e ciclos específicos para switches de campus e camada de acesso. Esta nota segue o manual da série CloudEngine 16800/9800/8800/6800 para switches núcleo e spine de data center — famílias de chassi diferentes, tolerâncias ambientais diferentes, e — notavelmente — sem ciclo por item embutido, o que abordamos com uma cadência apropriada para data center em vez disso.

A verificação de conteúdo de interfaces só diz 'verificar erros de CRC' — é essa toda a história da perda de pacotes?

Não — é um indicador de uma linha para um diagnóstico muito mais longo. Veja nossa nota de solução de problemas de perda de pacotes para o detalhamento completo de erros de entrada CRC/Giants/Runts, erros de bits do módulo óptico e congestionamento Discard de saída, com os campos exatos de display interface e a correção para cada um.

Os backups de configuração devem ser automatizados, ou executar save com frequência já basta?

save só protege a configuração em execução de ser perdida na próxima recarga — não protege contra o próprio equipamento falhar, um módulo de armazenamento corrompido, ou uma sobrescrita por engano que ninguém percebe até bem depois. Combine save com uma cópia programada fora do equipamento — uma exportação FTP/SFTP, ou uma extração de gerenciamento de configuração — guardada em algum lugar que sobreviva à indisponibilidade do próprio equipamento.

Limites honestos desta nota

Limites honestos desta nota

Esta rotina é construída a partir do manual de manutenção dos switches Huawei série CloudEngine 16800/9800/8800/6800. Ao contrário do manual por trás da nossa nota de switches de campus, este capítulo V300 não atribui um ciclo recomendado por item de verificação — a cadência diária/mensal/semanal acima é nossa própria recomendação de prática operacional para um papel de núcleo de data center, não um número que o próprio manual declare. O capítulo também não inclui uma etapa separada de compare-configuration, razão pela qual adicionamos acima a nota de disciplina de backup de configuração como um complemento deliberado. Esta é uma verificação de saúde, não um procedimento de diagnóstico de falhas — para perda de pacotes especificamente, veja nossa nota de solução de problemas de perda de pacotes.

Quer incorporar esta rotina no contrato de manutenção do seu data center?

Conte-nos seus modelos CloudEngine e quantos equipamentos estão no escopo — ajudamos você a transformar isso em uma lista de verificação recorrente com uma cadência que corresponda aos seus requisitos de controle de mudanças.

WhatsApp com um engenheiro →

Leitura relacionada

Usamos cookies apenas para análises anônimas — sem anúncios, sem rastreamento entre sites.Política de privacidade