Ecosistema Nagios
Todo el ecosistema, no solo la instalación: Core, XI, Log Server, Network Analyzer y Fusion.
Protocolos y fundamentos del monitoreo
El módulo con el que abre el curso, y el que más falta hace. Antes de configurar un chequeo hay que entender qué se está preguntando y en qué capa. Se recorre el modelo OSI casi completo — ver la tabla de abajo — y se practica con captura de tráfico para ver, en vivo, qué responde un equipo cuando Nagios le pregunta.
Nagios Core — el motor
Arquitectura interna, ciclo de ejecución de chequeos, archivos de configuración, plantillas y herencia, macros y variables de entorno. Entender Core es lo que permite depurar XI cuando la interfaz no alcanza.
Nagios XI — operación diaria
Asistentes de configuración, gestión de usuarios y permisos, tableros por área de negocio, reportes de disponibilidad y SLA, API REST, y la relación entre lo que hace la interfaz y lo que escribe en Core.
Chequeos activos, pasivos y agentes
NRPE, NCPA y NSClient++ para chequeos con agente; NSCA y traps SNMP para chequeos pasivos. Cuándo conviene cada uno, y por qué en entornos grandes el monitoreo pasivo deja de ser opcional.
Umbrales, dependencias y ruido
Cómo definir umbrales que no generen alertas inútiles, cómo modelar dependencias entre hosts y servicios para que una falla de origen no dispare cientos de alertas derivadas, y cómo revisar todo esto cuando el entorno crece.
Nagios Log Server
Centralización de syslog y Windows Event Log, índices y retención, búsqueda y correlación, alertamiento desde el log y su integración con XI.
Nagios Network Analyzer
NetFlow, sFlow, J-Flow e IPFIX: qué exporta cada equipo, cómo se colecta y cómo leer el consumo del enlace a nivel de flujo — la vista que los chequeos de XI no dan por sí solos.
Nagios Fusion
Agregación de varias instancias de XI en una sola vista, para operaciones distribuidas en varios sitios o unidades de negocio.
Plugins y Nagios Exchange
Los plugins incluidos, la biblioteca comunitaria, y cómo escribir uno propio que se comporte bien: códigos de salida, datos de rendimiento y tiempos de espera.
Dimensionamiento y afinación
Cuántos recursos pide un entorno según hosts, servicios y frecuencia de chequeo; cuándo hace falta distribuir con workers; y cómo se comporta la plataforma cuando pasa de mil a diez mil servicios.
