Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Duration 14 hours
Course Outline
Introduction to AIOps with Open Source Tools
- Key concepts and benefits of AIOps
- The role of Prometheus and Grafana in the observability stack
- Positioning ML in AIOps: predictive versus reactive analytics
Setting Up Prometheus and Grafana
- Installation and configuration of Prometheus for time series data collection
- Building dashboards in Grafana using real-time metrics
- Exploring exporters, relabeling strategies, and service discovery
Data Preprocessing for ML
- Extracting and transforming metrics from Prometheus
- Preparing datasets optimized for anomaly detection and forecasting
- Utilizing Grafana transformations or Python-based pipelines
Applying Machine Learning for Anomaly Detection
- Implementing basic ML models for outlier detection (e.g., Isolation Forest, One-Class SVM)
- Training and evaluating models on time series data
- Visualizing detected anomalies within Grafana dashboards
Forecasting Metrics with ML
- Developing simple forecasting models (ARIMA, Prophet, LSTM introduction)
- Predicting system load and resource utilization trends
- Leveraging predictions for proactive alerting and scaling decisions
Integrating ML with Alerting and Automation
- Defining alert rules based on ML outputs or dynamic thresholds
- Configuring Alertmanager and notification routing paths
- Triggering scripts or automation workflows upon anomaly detection
Scaling and Operationalizing AIOps
- Integrating with external observability platforms (e.g., ELK stack, Moogsoft, Dynatrace)
- Operationalizing ML models within observability pipelines
- Best practices for deploying AIOps at scale
Summary and Next Steps
Requirements
- A solid understanding of system monitoring and observability principles
- Prior experience working with Grafana or Prometheus
- Familiarity with Python and fundamental machine learning concepts
Target Audience
- Observability engineers
- Infrastructure and DevOps teams
- Monitoring platform architects and Site Reliability Engineers (SREs)