Un ISP chico con un centenar de abonados normalmente no tiene un equipo de operaciones de red. Quien armó la red es también quien atiende el teléfono, y monitorear significa darse cuenta cuando los clientes se quejan. Eso funciona hasta el día en que se rompen dos cosas a la vez. Lo que ayuda no es una herramienta más grande sino una rutina: una lista corta de cosas para mirar a intervalos regulares, de modo que los problemas aparezcan como una tendencia antes de aparecer como una caída.
Cada día: ¿está todo arriba y hay algo raro?
El chequeo diario debería llevar cinco minutos. Confirmá que cada router de core, cada antena y cada enlace de backhaul responde, y mirá el log por si hay algo crítico:
/log print where topics~"critical|error"
/system resource printEn /system resource print fijate en el uptime (un número inesperadamente bajo indica un reinicio no planeado), la carga de CPU y la memoria libre. Un CPU que se mantiene por encima del 70-80 % fuera de la hora pico, o una memoria que se achica cada día, merece investigarse antes de que se convierta en una caída.
Cada día: mirá el upstream, no solo el router
Que un router responda no significa que Internet ande. Mantené una medición de latencia hacia algo más allá de tu propia red, como el gateway de tu proveedor y una dirección pública. Mirá la pérdida de paquetes y el tiempo de respuesta juntos: un enlace que contesta pero pierde el 3 % de los paquetes ya se siente roto para los abonados, aunque un simple "¿está arriba?" diga que todo está bien.
Cada semana: errores, descartes y tendencias de tráfico
Los contadores de interfaz revelan problemas que nunca disparan una alarma, como un cable malo, un SFP que falla o un duplex mal negociado:
/interface print stats
/interface ethernet monitor ether1 onceCualquier interfaz donde rx-error o tx-drop siga creciendo necesita atención. Compará el tráfico pico con la capacidad de cada enlace: cuando un backhaul pasa regularmente el 70-80 % de su capacidad en hora pico, los abonados van a sentir la congestión antes de que veas una línea saturada, y la conversación sobre ampliar debería empezar ya.
Cada semana: sesiones y energía
Si usás PPPoE, la cantidad de sesiones activas es un indicador de salud rápido. Una caída repentina en un concentrador que nadie tocó es señal de un uplink caído o de un problema de acceso:
/ppp active print count-only
/system health printEl segundo comando muestra voltaje y temperatura en el hardware que lo soporta. Los equipos en una torre o en un gabinete sin ventilación suelen mostrar su problema en los números días antes de fallar.
Cada mes: actualizaciones, backups y mantenimiento
Una vez al mes, hacé el mantenimiento que nadie recuerda en un día ocupado. Buscá versiones nuevas de RouterOS y leé las notas de la versión antes de actualizar algo crítico:
/system package update check-for-updates
/system routerboard printConfirmá que existen backups, que son recientes y que se guardan lejos del propio router. Revisá las cuentas de usuario por si queda alguien que ya no trabaja con vos, y verificá que el firewall siga bloqueando el acceso de administración desde la WAN.
Anotá tu línea base para reconocer lo anormal
Ninguno de los números anteriores significa algo sin una referencia. Anotá cómo se ve lo normal en cada router clave: CPU típico, tráfico pico típico, latencia habitual hacia el upstream, cantidad usual de sesiones PPPoE. Alcanza con una planilla. Cuando algo cambie, vas a saber en segundos si es un problema real o simplemente un viernes a la noche.
Por qué hacerlo así
La mayoría de las caídas en una red chica están precedidas por un síntoma que era visible días o semanas antes: un CPU que sube de a poco, un enlace que se llena en hora pico, una interfaz que acumula errores, un router que se reinicia de noche. Una rutina convierte eso en tareas chicas en vez de emergencias. También te protege del problema opuesto, depender de la memoria de una sola persona. Dejar el checklist por escrito permite que un colega te cubra en las vacaciones, y que tu red no dependa de lo que justo te acordaste de mirar.
Cómo te ayuda MoniTik
Gran parte de este checklist es justo lo que MoniTik automatiza, para que no lo hagas a mano en cada router. Muestra el estado de los dispositivos y manda alertas por mail cuando un router se cae (y cuando se recupera), historial de CPU y memoria, gráficos de latencia y de tráfico por interfaz de cada equipo, y un medidor de cupo de datos para enlaces como Starlink. Un panel resumen lista qué dispositivos están caídos en este momento. La rutina sigue siendo tuya, pero la ronda diaria pasa a ser una mirada a una pantalla en vez de entrar a cada router.