Inicio / Notas técnicas / Revisión de salud de switches de centro de datos

Revisión de salud de switches de centro de datos: rutinas diarias, semanales y mensuales

Directamente del manual de mantenimiento de los switches Huawei serie CloudEngine 16800, 9800, 8800 y 6800 — la revisión rutinaria para switches núcleo y spine de centro de datos: entorno, información básica, estado de funcionamiento y contenido de interfaces. Qué revisar en cada paso, qué cuenta como aprobado, la cadencia recomendada, y los comandos display exactos usados para verificarlo.

Por Yuwen Zhang (Atlas), fundador de AtlasCommTech — 13 años de despliegues de redes de operadores y empresariales · Actualizado en julio de 2026

Por qué la rutina de un núcleo de centro de datos no es la misma que la de un switch de campus

El manual de mantenimiento de los switches Huawei serie CloudEngine 16800/9800/8800/6800 organiza el mantenimiento rutinario en cuatro secciones, no cinco — y el chasis detrás es de una naturaleza completamente distinta.

Nuestra nota sobre revisión rutinaria de salud de switches empresariales se basa en el manual Huawei para switches de campus y capa de acceso — cuartos de cableado, pisos de oficina, la falla de un switch afecta un segmento. Esta nota se basa en cambio en el manual de la serie CloudEngine 16800, 9800, 8800 y 6800: switches núcleo y spine ubicados en un centro de datos, donde una mala lectura detrás de una caja núcleo puede afectar cada rack aguas abajo de ella, no solo un ala de un edificio.

El manual, '例行维护' (Mantenimiento rutinario), organiza todo en cuatro secciones: revisión del entorno del dispositivo, revisión de información básica, revisión del estado de funcionamiento y revisión del contenido de interfaces. Dos de las cuatro familias de chasis — CE16800 y CE8800/6800 — incluso tienen sus propias tablas de entorno separadas, porque sus tolerancias nominales de voltaje y humedad realmente difieren. A continuación, esa rutina de cuatro pasos, el estándar de aprobación y el comando display para cada elemento, una cadencia apropiada para centro de datos, y una nota sobre disciplina de respaldo de configuración que los elementos de revisión por sí solos no cubren.

Los cuatro pasos de un vistazo

Mismo orden que usa el manual original — entorno primero, interfaces al final.

STEP 1 Environment 3.2 设备环境检查 Day / Week (facility rounds) STEP 2 Basic Information 3.3 设备基本信息检查 Month STEP 3 Running Status 3.4 设备运行检查 Day STEP 4 Interface Content 3.5 接口内容检查 Week The CloudEngine V300 manual doesn't assign a cycle per item the way the campus switch manual does. Cadence above follows standard DC core-switch operational practice, not the manual itself — see Honest Limits below. Diagram labels are kept in English for engineering clarity.

Las etiquetas del diagrama se mantienen en inglés por claridad técnica.

Paso 1 — Revisión del entorno del dispositivo

El manual original ofrece dos tablas separadas para la serie CE16800 y la serie CE8800/6800 — sus tolerancias de voltaje y humedad realmente difieren, y este paso no tiene comandos CLI, solo revisiones físicas.

Serie CE16800
Elemento a revisarCriterio de aprobación
Temperatura de la sala de equiposTemperatura de funcionamiento 0°C a 40°C (0m a 1800m de altitud); por encima de 1800m hasta 5000m, la especificación baja 1°C por cada 220m adicionales de altitud. Temperatura de almacenamiento -40°C a +70°C.
Humedad de la sala de equiposHumedad relativa de funcionamiento 5%RH a 85%RH, sin condensación. Si la humedad de la sala se mantiene demasiado alta, instale deshumidificación; si demasiado baja, instale humidificación.
LimpiezaEl dispositivo mismo no debe mostrar acumulación visible de polvo; vigile el estado de la malla antipolvo y limpie o reemplace el algodón antipolvo con prontitud para no afectar la ventilación y el enfriamiento del chasis.
Enfriamiento / flujo de aireLos ventiladores deben funcionar normalmente durante la operación (excepto durante la limpieza); la entrada de aire del chasis no debe estar obstruida por exceso de polvo — limpie la malla antipolvo si está muy sucia, recomendado trimestralmente.
Enrutamiento de cablesCables de alimentación enrutados separados de los cables de negocio; tanto el cableado de alimentación como el de negocio ordenados.
Etiquetado de cablesEtiquetas de cables claras, precisas y conformes a la norma.
Sistema de alimentaciónSe requiere suministro estable. Tensión nominal 110V CA / 220V CA; rango nominal 100V CA-120V CA / 200V CA-240V CA; rango máximo 90V CA-290V CA.
Serie CE8800, 6800
Elemento a revisarCriterio de aprobación
Ubicación del dispositivoUbicado en un entorno ventilado y seco, colocado de forma firme y nivelada.
Temperatura de la sala de equiposIgual que el CE16800: funcionamiento 0°C a 40°C (0m-1800m, -1°C por cada 220m por encima de 1800m hasta 5000m); almacenamiento -40°C a +70°C.
Humedad de la sala de equiposHumedad relativa de funcionamiento 5%RH a 95%RH, sin condensación — una tolerancia más amplia que el tope de 85%RH del CE16800.
Aire acondicionado de la salaEl aire acondicionado funciona de forma continua y estable, manteniendo la temperatura de la sala dentro de la tolerancia del dispositivo.
Puesta a tierra y resistencia de tierraTierra de trabajo, tierra de protección y tierra de pararrayos del edificio separadas cuando sea posible (una tierra compartida es aceptable si las condiciones de la sala lo exigen); el equipo instalado en exteriores debe estar conectado a tierra — una unidad exterior sin conexión a tierra es muy vulnerable a daños por rayos.
Conexión de alimentaciónCable de alimentación correctamente conectado a la posición designada del dispositivo y bien asentado; el indicador de alimentación permanece verde fijo.
Sistema de alimentaciónSe requiere suministro estable. Rango nominal 100V CA-240V CA, 50/60Hz; rango máximo 90V CA-290V CA, 45Hz-65Hz — una banda nominal más amplia que los 110V/220V fijos del CE16800.
Obstrucción del flujo de enfriamientoSin obstrucciones alrededor del dispositivo; despeje de enfriamiento recomendado entre dos unidades de al menos 1U.
Alineación del enfriamientoLa dirección del flujo de enfriamiento del módulo de alimentación y del módulo de ventiladores debe ser coherente entre sí, y con la dirección del flujo de enfriamiento propio del gabinete.
Estado del módulo de ventiladoresEl indicador del módulo de ventiladores es normal cuando parpadea en verde lento.
Estado de funcionamiento del dispositivoEl indicador SYS del dispositivo es normal cuando parpadea en verde lento.

Paso 2 — Revisión de información básica

Verifica si la información básica — versión de software, información de parches, hora del sistema, configuración, licencia — es correcta. Recomendamos mensualmente, ajustado para alinearse con cualquier ciclo de control de cambios que su centro de datos ya utilice.

Elemento a revisarMétodo de revisiónCriterio de aprobación
Versión de software en ejecucióndisplay versionEl número de versión de PCB de la subtarjeta y el número de versión de software coinciden con lo requerido.
Paquete de software en usodisplay startupLos nombres de archivo del software del producto y del archivo de configuración actualmente en uso, y a cargar en el próximo arranque, son correctos.
Información de parchesdisplay patch-informationEl archivo de parche coincide con los requisitos reales — Huawei recomienda cargar el último parche publicado para la versión de producto en ejecución.
Hora del sistemadisplay clockLa hora coincide con la hora local real (diferencia no mayor a 5 minutos), para localizar fallas con precisión por marca de tiempo. Si no, ejecute clock datetime o configure NTP para sincronizar la hora de red.
Corrección de la configuracióndisplay current-configurationRevise los parámetros de configuración actualmente vigentes para verificar que la configuración del dispositivo sea correcta.
Información de licenciadisplay licenseRevise los detalles del archivo de licencia activado — nombre, versión, período de validez, elementos de control — para determinar si la versión necesita actualizarse para soportar más funciones.
<HUAWEI> display version
<HUAWEI> display startup
<HUAWEI> display patch-information
<HUAWEI> display clock
<HUAWEI> display current-configuration
<HUAWEI> display license

Disciplina de respaldo de configuración

La revisión de información básica de este capítulo solo verifica que la configuración en ejecución sea actualmente correcta — no dice nada sobre si esa configuración sobreviviría a un reinicio, un reset de tarjeta o un evento de energía. Una vez que display current-configuration aprueba, ejecute save para persistirla en la configuración de arranque, y mantenga también una copia programada fuera del equipo — una exportación FTP/SFTP o una extracción de gestión de configuración guardada en algún lugar que sobreviva a que el propio dispositivo no esté disponible. save por sí solo protege contra la próxima recarga; no protege contra que el dispositivo, su almacenamiento o el operador sean el verdadero punto de falla. Algunos pasos de remediación que surgen de una revisión fallida — un reinicio, un reset de tarjeta, un delete en un almacenamiento lleno — conllevan su propio riesgo real; consulte nuestra lista de comandos peligrosos antes de ejecutar cualquiera de ellos.

Paso 3 — Revisión del estado de funcionamiento

Verifica el estado de la tarjeta, el estado de ventiladores y alimentación, la temperatura, la CPU y la memoria — los elementos con el radio de impacto más inmediato en un switch núcleo. Recomendamos diariamente.

Elemento a revisarMétodo de revisiónCriterio de aprobación
Estado de funcionamiento de la tarjeta (solo CE16800)display deviceCentrarse en la presencia y el estado de la tarjeta: normal significa tarjeta 'Online' = 'Present', 'Power' = 'PowerOn', 'Register' = 'Registered', 'Status' = 'Normal'.
Estado de ventiladoresdisplay device fan'Status' = 'Normal' indica normal.
Estado de alimentacióndisplay device power'State' = 'Supply' indica normal.
Temperatura del dispositivodisplay device temperature'Status' = 'Normal' indica normal.
Estado de la CPUdisplay cpu'Status' = 'Non-overload' indica normal.
Uso de memoriadisplay memory'Status' = 'Non-overload' indica normal.
<HUAWEI> display device
<HUAWEI> display device fan
<HUAWEI> display device power
<HUAWEI> display device temperature
<HUAWEI> display cpu
<HUAWEI> display memory

Paso 4 — Revisión del contenido de interfaces

Verifica paquetes con error del puerto, modo de negociación y estado Up/Down. Recomendamos semanalmente.

Elemento a revisarMétodo de revisiónCriterio de aprobación
Paquetes con error de puertodisplay interfaceMientras el negocio está en funcionamiento, verifique errores de puerto, incluyendo errores CRC.
Modo de negociación del puertodisplay interfaceModo de negociación correcto y consistente en ambos extremos — el modo semidúplex no es aceptable.
Estado del puertodisplay interface briefEl estado Up/Down del puerto cumple con el requisito planificado.
<HUAWEI> display interface 100GE1/0/1
<HUAWEI> display interface brief

«Verificar errores CRC» es solo un indicador de una línea, no la historia completa — vea nuestra nota de resolución de problemas de pérdida de paquetes para el desglose completo de errores de entrada CRC/Giants/Runts, errores de bits del módulo óptico y congestión Discard de salida, con los campos exactos y la corrección para cada uno.

5 trampas en las que tropieza esta rutina

Cada comando anterior es de solo lectura — solo display — pero una caja núcleo de centro de datos tiene algunas formas de malinterpretar el resultado que un switch de campus no tiene.

1. 'Non-overload' es un estado binario, no un porcentaje que se pueda graficar en tendencia

RIESGOdisplay cpu y display memory reportan un Status de Non-overload en lugar de un porcentaje numérico como hacen los umbrales 80%/60% del manual de campus. Tratar 'Non-overload' como el panorama completo pasa por alto un ascenso lento hacia la sobrecarga que aún no ha cruzado la línea.

PRÁCTICA MÁS SEGURACombine el estado Non-overload con el detalle numérico disponible dentro de la salida más completa de display cpu/display memory si quiere graficar su tendencia en el tiempo, y revíselo con más frecuencia que mensualmente dado cuántos servicios hay detrás de una caja núcleo de centro de datos.

2. El elemento de presencia de tarjeta exclusivo de CE16800 se omite silenciosamente en 8800/6800

RIESGOEl elemento de estado de funcionamiento de presencia de tarjeta se limita explícitamente a la serie CE16800. En CE8800/6800 su ausencia es correcta — pero en una flota mixta es fácil para un técnico perder de vista si un elemento faltante fue una exclusión deliberada por modelo o algo omitido por error.

PRÁCTICA MÁS SEGURARegistre contra qué modelo de chasis se ejecutó cada revisión, no solo aprobado/reprobado, para que una flota mixta CE16800 + CE8800/6800 conserve un rastro de auditoría que explique cada elemento marcado como no aplicable.

3. Las tolerancias de voltaje y humedad difieren según la familia de chasis — no copie una tabla sobre la otra

RIESGOLa tolerancia ambiental del CE16800 permite 5%RH-85%RH y un suministro nominal de 110V/220V; el CE8800/6800 permite hasta 5%RH-95%RH y un rango nominal más amplio de 100V-240V. Copiar la banda de humedad más estricta del CE16800 en un chasis 8800/6800, o al revés, produce un fallo falso o un aprobado falso según en qué dirección se cometa el error.

PRÁCTICA MÁS SEGURAConfirme la familia de chasis antes de aplicar cualquiera de las dos tablas de entorno, y mantenga las dos como listas de verificación separadas en lugar de fusionarlas en un estándar genérico de entorno de switch.

4. display current-configuration confirma la corrección, no que sobrevivirá a un reinicio

RIESGOEste elemento solo verifica que la configuración en ejecución sea actualmente correcta — no dice nada sobre si realmente se ha guardado en la configuración de arranque que se cargará en la próxima recarga. A diferencia de la rutina de campus, la revisión de información básica de este manual no tiene un paso separado de compare configuration para detectar esa brecha.

PRÁCTICA MÁS SEGURATrate save — y un respaldo de configuración fuera del equipo — como obligatorio cada vez que esta revisión apruebe, no como un extra opcional; vea la nota de disciplina de respaldo de configuración arriba, y nuestra nota de revisión de salud de switch de campus para el hábito equivalente de compare configuration.

5. 'Verificar errores CRC' solo cuenta la mitad de la historia de la interfaz

RIESGOEl elemento de paquetes con error de puerto de la revisión de contenido de interfaces señala errores CRC de forma genérica, pero no distingue un problema de capa física de entrada de un problema de congestión de salida, ni revisa en absoluto el módulo óptico detrás de la interfaz — una aprobación rutinaria aquí aún puede estar sobre un contador Discard en ascenso o un módulo cerca de su umbral de potencia.

PRÁCTICA MÁS SEGURACada vez que este elemento señale algo más que un cero limpio, continúe con el desglose completo de las tres fuentes — óptica, errores de entrada, Discard de salida — en nuestra nota de resolución de problemas de pérdida de paquetes, en lugar de tratar una mención de CRC como el diagnóstico completo.

Diseños de soluciones relacionadas

Cinco preguntas que surgen constantemente

Sacadas directamente del campo — las que vale la pena tener respondidas de antemano.

¿Esta rutina se aplica de la misma manera a CE16800 y CE8800/6800?

En su mayoría, pero no del todo — el a cada familia de chasis su propia tabla de revisión de entorno, ya que las tolerancias de voltaje y humedad difieren, y el elemento de presencia de tarjeta es exclusivo de CE16800. Las revisiones de información básica, CPU/memoria e interfaz aplican de la misma forma en las cuatro series.

¿Con qué frecuencia debe ejecutarse realmente cada paso en un switch núcleo de centro de datos?

El manual original no asigna un ciclo por elemento como hace el manual de campus — vea nuestra nota de límites honestos más abajo. Dado cuánto tráfico y cuántos servicios hay detrás de un switch núcleo de centro de datos, recomendamos revisiones de entorno y estado de funcionamiento diarias (o continuas mediante monitoreo), información básica mensual, y contenido de interfaz semanal — ajustando cualquiera de estas donde sus propios requisitos de control de cambios o cumplimiento exijan evidencia más frecuente.

¿Cuál es la diferencia real entre esta y la nota de revisión rutinaria de salud de switches empresariales?

Esa nota sigue el manual de Huawei, con elementos y ciclos específicos para switches de campus y capa de acceso. Esta nota sigue el manual de la serie CloudEngine 16800/9800/8800/6800 para switches núcleo y spine de centro de datos — diferentes familias de chasis, diferentes tolerancias ambientales, y — notablemente — sin ciclo por elemento incorporado, lo cual abordamos con una cadencia apropiada para centro de datos en su lugar.

La revisión de contenido de interfaces solo dice 'verificar errores CRC' — ¿es esa toda la historia de la pérdida de paquetes?

No — es un indicador de una línea hacia un diagnóstico mucho más largo. Vea nuestra nota de resolución de problemas de pérdida de paquetes para el desglose completo de errores de entrada CRC/Giants/Runts, errores de bits del módulo óptico y congestión Discard de salida, con los campos exactos de display interface y la corrección para cada uno.

¿Los respaldos de configuración deben automatizarse, o basta con ejecutar save con frecuencia?

save solo protege la configuración en ejecución contra perderse en la próxima recarga — no protege contra que el propio dispositivo falle, un módulo de almacenamiento corrupto, o una sobrescritura por error que nadie nota hasta mucho después. Combine save con una copia programada fuera del equipo — una exportación FTP/SFTP, o una extracción de gestión de configuración — guardada en algún lugar que sobreviva a que el propio dispositivo no esté disponible.

Límites honestos de esta nota

Límites honestos de esta nota

Esta rutina se construye a partir del manual de mantenimiento de los switches Huawei serie CloudEngine 16800/9800/8800/6800. A diferencia del manual detrás de nuestra nota de switches de campus, este capítulo V300 no asigna un ciclo recomendado por elemento de revisión — la cadencia diaria/mensual/semanal anterior es nuestra propia recomendación de práctica operativa para un rol de núcleo de centro de datos, no una cifra que el propio manual indique. El capítulo tampoco incluye un paso separado de compare-configuration, razón por la cual añadimos arriba la nota de disciplina de respaldo de configuración como un complemento deliberado. Esto es una revisión de salud, no un procedimiento de diagnóstico de fallas — para pérdida de paquetes específicamente, vea nuestra nota de resolución de problemas de pérdida de paquetes.

¿Quiere incorporar esta rutina en el contrato de mantenimiento de su centro de datos?

Cuéntenos sus modelos CloudEngine y cuántos dispositivos están en el alcance — le ayudaremos a convertir esto en una lista de verificación recurrente con una cadencia que coincida con sus requisitos de control de cambios.

WhatsApp con un ingeniero →

Lectura relacionada

Solo usamos cookies para analítica anónima — sin publicidad ni rastreo entre sitios.Política de privacidad