Intrati in legatura

Schița de curs

Infrastructura EXO ca Cod

  • Prezentare generală a modelelor de implementare EXO: clusteruri single-node, multi-node și RDMA
  • Automatizarea instalării dependențelor (Xcode, uv, Node.js, Rust) cu gestionarea configurației
  • Utilizarea Nix flakes pentru build-uri EXO reproducibile și medii de dezvoltare
  • Scrierea playbook-uri Ansible sau scripturi shell pentru furnizarea neîntreruptă a clusterelor

Build-uri Reproducibile și Integrare CI

  • Fixarea dependențelor și construirea tabloului de bord în pipeline-uri CI
  • Rularea testelor de fum EXO în GitHub Actions sau GitLab CI runners
  • Crearea de imagini de aur și fluxuri de lucru bazate pe snapshot-uri pentru VM-uri macOS și Linux
  • Versionarea cardurilor de modele personalizate alături de codul aplicației

Descoperirea Clusterelor și Automatizarea Rețelei

  • Configurarea mDNS și DNS static pentru descoperirea fiabilă a nodurilor libp2p
  • Automatizarea creării profilurilor de rețea și gestionarea podurilor Thunderbolt pe macOS
  • Utilizarea namespace-urilor personalizate (EXO_LIBP2P_NAMESPACE) pentru separarea clusterelor dev, staging și prod
  • Reguli de firewall și segmentarea rețelei pentru medii multi-tenant

Gestionarea Stocării și Ciclului de Viață al Modelelor

  • Proiectarea strategiilor EXO_MODELS_DIRS și EXO_MODELS_READ_ONLY_DIRS
  • Montarea partajărilor NFS sau SAN ca depozite de modele doar pentru citire pentru furnizare rapidă
  • Colectarea gunoiului din cache-uri învechite și politici de păstrare a greutăților versionate
  • Automatizarea descărcării prealabile a modelelor și verificărilor de sănătate înainte de actualizări

Monitorizare și Alertare

  • Trimiterea jurnalelor EXO către jurnalizarea centralizată (ELK, Loki sau Splunk)
  • Construirea de tablouri de bord Grafana din ieșirea EXO_TRACING_ENABLED
  • Alertare la schimbări de membri ai clusterului, evenimente OOM și creșteri ale latenței de inferență
  • Corelarea telemetriei hardware macmon cu regresiile de performanță ale modelelor

Actualizare, Revenire și Recuperare la Dezastre

  • Testarea actualizărilor binare EXO într-un nod canar înainte de implementarea pe întreaga flotă
  • Revenire la nivel de model: comutarea între versiunile cuantificate fără re-descărcare
  • Backup și restaurarea stării clusterului, namespace-urilor personalizate și greutăților cache
  • Documentarea runbook-urilor de recuperare pentru scenarii de reconstrucție totală a clusterului

Întărirea Securității și Conformitatea

  • Aplicarea TLS la nivelul proxy-ului invers (nginx, traefik) pentru tabloul de bord și API
  • Implementarea limitării ratei API și a listei albe de IP-uri pentru endpoint-urile EXO
  • Izolarea clusterelor cu VLAN-uri și politici de rețea zero-trust
  • Auditarea accesului și menținerea unui inventar al modelelor și versiunilor implementate

Cerințe

  • Experiență în practici DevOps (CI/CD, IaC, orchestratie de containere)
  • Cunoștințe de administrare a sistemelor macOS sau Linux și gestionare de pachete
  • Înțelegere a conceptelor de rețea, DNS și stocare

Publicul țintă

  • Ingineri DevOps
  • Arhitecți de infrastructură
  • SRE responsabili de sarcini de AI on-premise
 21 Ore

Numărul de participanți


Pret per participant

Mărturii (2)

Cursuri viitoare

Categorii înrudite