Una cabina todo-flash promete latencia en microsegundos y la cumple — hasta que una fábrica Ethernet ordinaria pierde un paquete bajo congestión Incast y convierte esa promesa en una pausa visible para la aplicación. Diseñamos redes de almacenamiento a partir de sus requisitos, con la marca de los equipos como elección abierta en la fase de diseño: una fábrica RoCEv2 dedicada con PFC y ECN ajustados a su tráfico real, acceso NVMe over Fabric (NoF), y almacenamiento activo-activo entre sitios cuando los números realmente lo justifican. Dimensionado honestamente para un solo clúster de almacenamiento, dos centros de datos activo-activo, o recuperación ante desastres multicentro.
Cuatro patrones detrás de casi toda llamada de "nuestra cabina flash se siente lenta" que recibimos:
Una ruta de almacenamiento diseñada para cero pérdida de paquetes, no compartida con — ni esperando no chocar con — todo lo demás en la red:
Diagrama dibujado por AtlasCommTech siguiendo la práctica de diseño de centro de datos de nivel operador. Las etiquetas se mantienen en inglés por claridad técnica.
Por qué nosotros: nuestro fundador pasó 13 años dentro del ecosistema de socios de Huawei entregando redes de operador — donde un paquete perdido era un incidente reportable. En una fábrica de almacenamiento tratamos cada trama perdida de la misma manera, porque eso es exactamente lo que separa una red sin pérdidas sobre el papel de una que realmente lo es.
La solución se dimensiona primero según sus requisitos y presupuesto — la misma arquitectura puede entregarse con las líneas de producto de varios fabricantes. Le ayudamos a elegir según la disponibilidad de suministro en su país de destino, el presupuesto y los hábitos de operación de su equipo.
Seis propiedades de una fábrica de almacenamiento bien ajustada que una red de centro de datos genérica y compartida nunca tendrá:
Díganos su número de cabinas, número de hosts y requisito de replicación — el nivel define la forma de la fábrica:
| Nivel de escala | Sitio típico | Qué incluye el diseño |
|---|---|---|
| Clúster de almacenamiento único | Una sala · un solo clúster todo-flash que sirve a un entorno de cómputo | Un par de leaf de almacenamiento dedicado con RoCEv2, PFC y ECN ajustados al clúster, acceso NVMe-oF desde cada host, gestión fuera de banda y telemetría por cola desde el primer día — dimensionado para probar cero pérdida de paquetes antes de extenderse a un segundo sitio. |
| Dos centros de datos activo-activo | Dos sitios dentro de la distancia de replicación síncrona · negocio sensible al tiempo de caída | Una fábrica de almacenamiento por sitio, una interconexión dedicada de baja latencia que lleva la replicación síncrona, roles activo-activo validados según la tolerancia de latencia real de su plataforma de almacenamiento, y una prueba de conmutación ensayada antes de la puesta en marcha. |
| Recuperación ante desastres multicentro | Sitios más allá de la distancia síncrona · negocio regulado o de nivel archivo | Una fábrica de almacenamiento por sitio más un enlace de replicación asíncrona dimensionado honestamente según la distancia involucrada, roles primario-reserva con un manual de conmutación escrito y ensayado, y objetivos de recuperación acordados sobre papel antes de pedir cualquier hardware. |
La solución se construye con estas categorías de equipos — la marca se elige con usted en la fase de diseño. Los modelos exactos dependen de su número de hosts, número de cabinas y distancia de replicación — los definimos después de recibir su lista de requisitos.
| Rol | Función |
|---|---|
| Switch leaf de almacenamiento | Conecta hosts NVMe-oF y cabinas todo-flash con RoCEv2 ajustado por puerto; dimensionado según el número de hosts y el patrón de lectura/escritura en lugar de un número de puertos genérico. |
| Switch spine de almacenamiento | La capa de alta velocidad dedicada donde se conecta cada leaf de almacenamiento — mantenida no bloqueante para que la congestión Incast tenga adónde ir además de una trama perdida. |
| Router de borde / enlace DCI | Lleva el enlace de replicación síncrona o asíncrona a un segundo sitio — dimensionado según la distancia real y la tolerancia de latencia de su plataforma de almacenamiento. |
| Plataforma de ajuste PFC/ECN y telemetría | Donde el control de congestión se configura y valida por clúster, y donde se vigilan los contadores de pérdida y pausa por cola — esto es tiempo de ingeniería, no una casilla en un asistente. |
| Switch de gestión fuera de banda | Un pequeño switch separado cableado al puerto de gestión de cada equipo — su vía de entrada cuando lo que hay que diagnosticar es la propia fábrica de almacenamiento. |
| Plataforma de gestión | Topología de toda la fábrica, historial de profundidad de cola y copia de configuración — para que un cambio de ajuste quede documentado, no en el conocimiento de una sola persona. |
Envíenos su lista de requisitos — número de hosts, número de cabinas, patrón de lectura/escritura, distancia de replicación — y la lista de modelos llega después. Ese orden mantiene el diseño honesto.
Un ingeniero responde con un diseño de fábrica de almacenamiento y la lista de categorías de equipos. Envíe su lista de requisitos — la lista de modelos llega después.