Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Durata 14 ore
Schița de curs
Proiectarea unei arhitecturi AIOps deschise
- Prezentarea generală a componentelor cheie din pipeline-urile AIOps deschise
- Fluxul de date de la ingerare la alertare
- Compararea instrumentelor și strategia de integrare
Colectarea și agregarea datelor
- Ingerarea datelor time-series cu Prometheus
- Capturarea logurilor cu Logstash și Beats
- Normalizarea datelor pentru corelarea între surse
Construirea dashboard-urilor de observabilitate
- Vizualizarea metricilor cu Grafana
- Construirea dashboard-urilor Kibana pentru analiza logurilor
- Folosirea interogărilor Elasticsearch pentru a extrage informații operaționale
Detectarea anomaliilor și predicția incidentelor
- Exportarea datelor de observabilitate către pipeline-uri Python
- Antrenarea modelelor ML pentru detectarea outlierilor și forecasting
- Implementarea modelelor pentru inferență live în pipeline-ul de observabilitate
Alertare și automatizare cu instrumente open
- Crearea regulilor de alertă Prometheus și rutarea cu Alertmanager
- Declanșarea scripturilor sau a fluxurilor API pentru răspuns automat
- Folosirea instrumentelor de orchestrare open-source (de exemplu, Ansible, Rundeck)
Considerații de integrare și scalabilitate
- Gestionarea ingerării de volum mare și a retenției pe termen lung
- Securitate și control al accesului în stack-urile open-source
- Scalarea independentă a fiecărui strat: ingerare, procesare, alertare
Aplicații din lumea reală și extensii
- Studii de caz: optimizarea performanței, prevenirea downtime-ului și optimizarea costurilor
- Extinderea pipeline-urilor cu instrumente de tracing sau grafuri de servicii
- Cele mai bune practici pentru rularea și menținerea AIOps în producție
Rezumat și pașii următori
Cerințe
- Experiență cu instrumente de observabilitate precum Prometheus sau ELK
- Cunoștințe practice de Python și concepte fundamentale de machine learning
- Înțelegerea operațiunilor IT și a fluxurilor de alertare
Audiență
- Site reliability engineers (SRE) avansați
- Data engineers care lucrează în operațiuni
- DevOps platform leads și arhitecți de infrastructură