Intrati in legatura

Schița de curs

Peisajul observabilității bazate pe AI

  • De la panouri de control (dashboards) la conversații: trecerea către o observabilitate augmentată de AI
  • Capacitățile LLM relevante pentru observabilitate: rezumare, raționament, potrivire de tipare (pattern matching)
  • Modele arhitecturale: integrarea AI în stivele existente de observabilitate

Interogarea telemetriei în limbaj natural

  • Text-to-PromQL: traducerea limbajului natural în interogări de monitorizare
  • Interogări în limbaj natural pentru Elasticsearch, OpenSearch și stocările de jurnale Loki
  • Generarea SQL din limbajul natural pentru telemetrie structurată
  • Construcția unui agent asistent pentru interogări, cu utilizare de instrumente și conștientizare a contextului

Analiza jurnalelor alimentată de LLM

  • Parsarea și structurarea automată a jurnalelor cu LLM
  • Detectarea anomaliilor în fluxurile de jurnale folosind similitudinea prin embedding-uri
  • Clusterizarea jurnalelor și descoperirea de tipare la scară largă
  • Generarea de explicații ușor de citit pentru om, din secvențele brute de jurnale

Alertare inteligentă și îmbogățirea incidentelor

  • Corelarea alertelor și deduplicarea lor cu înțelegere semantică
  • Strângerea automată a contextului incidentului din runbooks, incidente anterioare și documentație
  • Rutarea inteligentă a alertelor bazată pe înțelegerea conținutului și expertiza echipei
  • Reducerea oboselii prin alertare (alert fatigue) cu reducerea zgomotului alimentat de AI

Analiza cauzei rădăcină asistată de AI

  • Generarea de ipoteze din corelarea telemetriei multi-sursă
  • Lanțuri de dovezi: conectarea simptomelor între metrici, jurnale și trace-uri
  • Diagnosticul ghidat prin sesiuni interactive de diagnosticare AI
  • Construcția unui agent de analiză a cauzei rădăcină cu investigație progresivă

Răspuns automat la incidente și comunicare

  • Generarea de rezumate ale incidentelor și actualizări de status din telemetrie
  • Redactarea automată a post-mortem cu reconstrucția timeline-ului
  • Comunicarea către părțile interesate, adaptată pentru audiențe tehnice și executive
  • Sugestii de runbook și recomandări automate de remediere

ML pentru observabilitate

  • Predictia seriilor de timp pentru planificarea capacității și predicția anomaliilor
  • Modele fundamentale pentru detecția zero-shot a anomaliilor asupra metricilor
  • Mapearea dependențelor serviciilor și descoperirea topologiei bazate pe embedding-uri
  • Antrenarea și rularea unor modele ML ușoare alături de pipelines de observabilitate

Rulare în producție și etică

  • Considerații privind latența și costurile pentru observabilitatea AI în timp real
  • Confidențialitatea datelor: asigurarea că LLM nu scurg telemetrie sensibilă
  • Supervizare umană: când diagnosticul AI necesită validare din partea operatorului
  • Măsurarea impactului: MTTD, MTTR și metricile experienței on-call

Cerințe

  • Experiență cu instrumente de observabilitate precum Prometheus, Grafana, Datadog sau OpenTelemetry.
  • Familiaritate cu conceptele de gestionare a jurnalelor (log management) și metrici.
  • Cunoștințe de bază de scriptare Python pentru prelucrarea datelor.

Public țintă

  • Ingineri SRE și de observabilitate care adoptă instrumente îmbunătățite cu AI.
  • Ingineri de platformă care construiesc pipelines de monitorizare de nouă generație.
  • Coordinatori DevOps care evaluează integrarea LLM în fluxurile de lucru pentru incidente.
 14 Ore

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite