Por qué el mantenimiento preventivo es crítico
La mayoría de los incidentes críticos en redes empresariales (sitio caído, pérdida de paquetes, fallos de WiFi, cortes de datacenter) tienen una causa común: falta de mantenimiento preventivo. La infraestructura IT envejece, acumula polvo, sufre microcambios por manipulación, y pierde margen eléctrico con el tiempo. Sin mantenimiento preventivo, los márgenes se reducen hasta que un evento menor (un pico de temperatura, una microcorte eléctrico, un cambio de configuración) desencadena el incidente.
El mantenimiento preventivo cuesta 5-10 veces menos que el correctivo. Un incidente crítico en un datacenter puede costar USD 10.000-100.000 por hora de downtime (pérdida de negocio, multas contractuales, costo de recuperación, daño reputacional). Un plan de mantenimiento preventivo anual para una red empresarial mediana cuesta una fracción de eso.
Esta guía detalla un plan estructurado de mantenimiento para infraestructura IT empresarial, organizado por frecuencia (mensual, trimestral, anual) y por componente (cableado, switches, WiFi, datacenter, UPS). Es la base del servicio de soporte IT gestionado que BLGNet ofrece a sus clientes.
Tareas mensuales
Cableado estructurado: (1) verificación visual de patch panels y jacks (buscar cables flojos, etiquetas rotas, parches sin documentar), (2) limpieza de patch panels con aire comprimido, (3) revisión de bandejas de cables (detectar sobrecarga, cables sin organizar), (4) verificación de temperatura en cuartos de telecomunicaciones (debe estar 18-24°C).
Switches y routers: (1) verificación de logs (eventos de error, warnings, caídas de puerto), (2) revisión de utilización de CPU y memoria (alertas si supera 70% sostenido), (3) verificación de estado de puertos (up/down, errores de entrada/salida), (4) revisión de enlaces troncales y LACP, (5) backup de configuración (automático, semanal).
WiFi: (1) revisión de estado de APs (up/down, clientes conectados), (2) verificación de canales y potencias (detectar interferencia nueva), (3) revisión de controladora (eventos, alarma), (4) análisis de capacity por AP (identificar APs sobrecargados), (5) verificación de portales cautivos y autenticación (RADIUS, 802.1X).
Datacenter: (1) verificación de temperatura y humedad por sensor (mínimo 2 sensores por fila), (2) revisión de UPS (estado, baterías, autonomía), (3) verificación de grupo electrógeno (estado, combustible, última prueba), (4) revisión de enfriadoras (estado, setpoint, alarma), (5) verificación de accesos físicos (logs, cámaras CCTV).
UPS: (1) verificación de estado (online, bypass, batería), (2) revisión de autonomía restante (capacidad de batería), (3) verificación de últimas alarmas, (4) prueba de transferencia a bypass (mensual, sin carga crítica).
Tareas trimestrales
Cableado estructurado: (1) re-certificación Fluke de enlaces críticos (10% de la instalación rotativa), (2) limpieza de jacks y patch cords (alcohol isopropílico), (3) reorganización de cables en patch panels (eliminar parches huérfanos), (4) actualización del inventario electrónico.
Switches y routers: (1) actualización de firmware (con ventana de cambio acordada), (2) revisión de reglas de seguridad (ACLs, firewalls), (3) análisis de tráfico (identificar flujos anómalos, cuellos de botella), (4) revisión de VLANs y segmentación, (5) prueba de failover (HSRP, VRRP, stacking).
WiFi: (1) site survey de verificación (medir cobertura real vs proyectada), (2) reasignación de canales (si hay nueva interferencia), (3) actualización de firmware de APs, (4) revisión de SSIDs y políticas (eliminar SSIDs obsoletos), (5) análisis de roaming (identificar zonas de handoff deficiente).
Datacenter: (1) limpieza profunda de sala blanca (superficies, piso técnico, racks), (2) revisión de sellado de pasillos calientes/fríos (hot/cold aisle containment), (3) prueba de grupo electrógeno con carga real (30 min), (4) revisión de baterías de UPS (impedancia, voltaje, temperatura), (5) calibración de sensores ambientales.
UPS: (1) prueba de baterías (impedancia y voltaje por celda), (2) revisión de conexiones (reapretar si es necesario), (3) limpieza de filtros de ventilación, (4) verificación de alarmas históricas (log de los últimos 90 días).
Tareas anuales
Cableado estructurado: (1) re-certificación Fluke completa de la instalación (100% de enlaces), (2) actualización de planos as-built, (3) auditoría de cumplimiento TIA-568/569/606/607, (4) revisión de capacidad (espacio libre en cuartos, puertos disponibles en patch panels).
Switches y routers: (1) auditoría de configuración (cumplimiento de hardening, mejores prácticas), (2) revisión de vida útil (equipos fuera de soporte del fabricante), (3) análisis de capacidad (backbone, uplinks, throughput), (4) revisión de contrato de soporte (SmartNet, support contract), (5) plan de renovación a 3 años.
WiFi: (1) site survey completo con recalibración de canales y potencias, (2) auditoría de seguridad (WPA3, 802.1X, portales cautivos), (3) análisis de capacidad vs demanda proyectada, (4) revisión de vida útil de APs (típicamente 5-7 años).
Datacenter: (1) auditoría TIA-942 completa, (2) revisión de capacidad eléctrica y térmica (PUE, carga por rack), (3) revisión del plan de respuesta a incidentes (simulacro de fallo eléctrico), (4) revisión del plan de continuidad de negocio (DRP), (5) calibración de equipos de medición (analizadores de potencia, sondas de temperatura).
UPS: (1) prueba completa de descarga de baterías (con carga controlada), (2) revisión de vida útil de baterías (reemplazo a los 4-5 años), (3) auditoría del sistema eléctrico completo (tableros, breakers, cables), (4) calibración del UPS (voltaje, frecuencia, transferencia).
Indicadores de un buen plan de mantenimiento
Un plan de mantenimiento preventivo bien ejecuido se mide por cuatro indicadores: (1) disponibilidad (uptime) superior al 99.9% (8.76 horas de downtime máximo por año), (2) tiempo medio entre fallas (MTBF) creciente año a año, (3) tiempo medio de recuperación (MTTR) decreciente, (4) incidentes proactivos detectados (vs reactivos) por encima del 70%.
BLGNet ofrece planes de soporte IT gestionado con SLAs por severidad (S1 sitio caído: respuesta 15 min, resolución 4 h; S2 degradación: respuesta 1 h, resolución 8 h; S3 issue menor: respuesta 4 h, resolución 24 h; S4 consulta: respuesta 1 día hábil). Los planes incluyen monitoreo 24x7, mantenimiento preventivo según esta guía, y guardia técnica para incidentes críticos.
Si tu empresa no tiene un plan de mantenimiento preventivo estructurado, te recomendamos una auditoría inicial para diagnosticar el estado actual de la infraestructura y un plan anual de remediación. Es la inversión de menor costo y mayor retorno en IT.