← Voltar ao Blog
isp monitoring maintenance

Checklist de saúde da rede para um provedor pequeno: diário, semanal e mensal

Um provedor pequeno com cerca de cem assinantes normalmente não tem uma equipe de operações de rede. Quem montou a rede é também quem atende o telefone, e monitorar significa perceber quando os clientes reclamam. Isso funciona até o dia em que duas coisas quebram ao mesmo tempo. O que ajuda não é uma ferramenta maior, mas uma rotina: uma lista curta de coisas para olhar em intervalos regulares, de modo que os problemas apareçam como tendência antes de aparecerem como queda.

1

Todo dia: está tudo no ar e há algo estranho?

A verificação diária deve levar cinco minutos. Confirme que cada roteador de core, cada antena e cada link de backhaul responde, e olhe o log em busca de algo crítico:

/log print where topics~"critical|error"
/system resource print

Em /system resource print, observe o uptime (um número inesperadamente baixo indica uma reinicialização não planejada), a carga de CPU e a memória livre. Uma CPU que fica acima de 70-80 % fora do horário de pico, ou uma memória que diminui a cada dia, merece investigação antes de virar uma queda.

2

Todo dia: olhe o upstream, não só o roteador

Um roteador que responde não significa que a Internet funciona. Mantenha uma medição de latência para algo além da sua própria rede, como o gateway do seu provedor e um endereço público. Olhe a perda de pacotes e o tempo de resposta juntos: um link que responde mas perde 3 % dos pacotes já parece quebrado para os assinantes, mesmo que um simples "está no ar?" diga que está tudo bem.

3

Toda semana: erros, descartes e tendências de tráfego

Os contadores de interface revelam problemas que nunca disparam um alarme, como um cabo ruim, um SFP falhando ou um duplex mal negociado:

/interface print stats
/interface ethernet monitor ether1 once

Qualquer interface em que rx-error ou tx-drop continue crescendo precisa de atenção. Compare o tráfego de pico com a capacidade de cada link: quando um backhaul passa regularmente de 70-80 % da capacidade no pico, os assinantes sentem a congestão antes que você veja uma linha saturada, e a conversa sobre ampliação deve começar já.

4

Toda semana: sessões e energia

Se você usa PPPoE, a quantidade de sessões ativas é um indicador rápido de saúde. Uma queda repentina em um concentrador que ninguém mexeu é sinal de um uplink caído ou de um problema de acesso:

/ppp active print count-only
/system health print

O segundo comando mostra tensão e temperatura em hardware que suporta. Equipamentos em uma torre ou em um gabinete sem ventilação costumam mostrar o problema nos números dias antes de falhar.

5

Todo mês: atualizações, backups e manutenção

Uma vez por mês, faça a manutenção de que ninguém se lembra num dia corrido. Procure novas versões do RouterOS e leia as notas da versão antes de atualizar algo crítico:

/system package update check-for-updates
/system routerboard print

Confirme que existem backups, que são recentes e que ficam guardados longe do próprio roteador. Revise as contas de usuário para ver se sobrou alguém que não trabalha mais com você, e verifique se o firewall ainda bloqueia o acesso de administração vindo da WAN.

6

Anote sua linha de base para reconhecer o anormal

Nenhum dos números acima significa algo sem uma referência. Anote como é o normal em cada roteador importante: CPU típica, tráfego de pico típico, latência habitual até o upstream, quantidade usual de sessões PPPoE. Uma planilha basta. Quando algo mudar, você saberá em segundos se é um problema real ou apenas uma sexta à noite.

Por que fazer assim

A maioria das quedas em uma rede pequena é precedida por um sintoma que era visível dias ou semanas antes: uma CPU subindo aos poucos, um link enchendo no pico, uma interface acumulando erros, um roteador reiniciando de madrugada. Uma rotina transforma isso em tarefas pequenas em vez de emergências. Ela também protege do problema oposto, depender da memória de uma única pessoa. Deixar o checklist por escrito permite que um colega cubra você nas férias e que sua rede não dependa do que você por acaso lembrou de olhar.

Como o MoniTik ajuda

Grande parte deste checklist é exatamente o que o MoniTik automatiza, para você não fazer à mão em cada roteador. Ele mostra o estado dos dispositivos e envia alertas por e-mail quando um roteador cai (e quando se recupera), histórico de CPU e memória, gráficos de latência e de tráfego por interface de cada equipamento, e um medidor de limite de dados para links como o Starlink. Um painel resumo lista quais dispositivos estão fora do ar no momento. A rotina continua sendo sua, mas a ronda diária vira uma olhada em uma tela em vez de entrar em cada roteador.

Iniciar Teste Grátis
Santiago Rivas
Santiago Rivas Técnico de Campo

Santiago passa seus dias em telhados e racks, mantendo os links MikroTik de provedores locais online.