Intrati in legatura
 Durata 21 ore

Schița de curs

Introducere în scalarea Ollama

  • Arhitectura Ollama și considerații de scalare
  • Blocaje comune în implementările multi-utilizator
  • Bune practici pentru pregătirea infrastructurii

Alocarea resurselor și optimizarea GPU

  • Strategii eficiente de utilizare CPU/GPU
  • Considerații privind memoria și lățimea de bandă
  • Constrângeri de resurse la nivel de container

Deployment cu containere și Kubernetes

  • Containerizarea Ollama cu Docker
  • Rularea Ollama în clustere Kubernetes
  • Load balancing și descoperirea serviciilor

Autoscaling și batching

  • Proiectarea politicilor de autoscaling pentru Ollama
  • Tehnici de inferență în loturi pentru optimizarea randamentului
  • Compromisuri între latență și randament

Optimizarea latenței

  • Profilarea performanței inferenței
  • Strategii de caching și warm-up al modelelor
  • Reducerea overhead-ului de I/O și comunicare

Monitorizare și observabilitate

  • Integrarea Prometheus pentru metrici
  • Construirea dashboard-urilor cu Grafana
  • Alerte și răspuns la incidente pentru infrastructura Ollama

Managementul costurilor și strategii de scalare

  • Alocarea GPU conștientă de costuri
  • Considerații privind deployment-ul în cloud vs. on-prem
  • Strategii pentru scalare sustenabilă

Rezumat și pașii următori

Cerințe

  • Experiență în administrarea sistemelor Linux
  • Înțelegerea containerizării și orchestrației
  • Familiaritate cu deployment-ul modelelor de machine learning

Public țintă

  • Ingineri DevOps
  • Echipe de infrastructură ML
  • Ingineri de fiabilitate a site-ului (SRE)

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite