Intrati in legatura

Schița de curs

Elemente Fundamentale pentru Implementarea Tencent Hunyuan în Producție

  • Panoramic al scenariilor de servire a modelelor Tencent Hunyuan
  • Caracteristicile producției modelului pentru modelele mari și MoE
  • Guleri frecvente de latency, throughput și cost
  • Definirea obiectivelor de nivel al serviciului pentru sarcinile de lucru de inferență

Arhitectura Implementării și Fluxul de Serviere

  • Componentele esențiale ale stivei de inferență în producție
  • Alegerea între modelele de implementare containerizate, on-premise și cloud
  • Încărcarea modelului, routarea cererilor și alocarea GPU-urilor - noțiuni de bază
  • Proiectarea pentru fiabilitate și simplitate operațională

Optimizarea Latency în Practică

  • Folosirea motoarelor de inferență optimizate, precum TensorRT, unde este cazul
  • Noțiuni despre KV-cache și ajustarea practică a cache-ului
  • Reducerea overhead-ului de startup, warmup și răspuns
  • Măsurarea timpului până la primul token și vitezei de generare a token-urilor

Throughput, Batching și Eficiența GPU

  • Strategii de continuous batching și request batching
  • Gestionarea concurenței și a comportamentului cozilor
  • Îmbunătățirea utilizării GPU-urilor fără a afecta experiența utilizatorului
  • Tratarea cererilor cu context lung și sarcini de lucru mixte

Cantizarea și Controlul Costurilor

  • De ce este importantă cantizarea pentru servirea în producție
  • Echilibruri practice ale opțiunilor comune de precizie, cum ar fi FP16, INT8 etc.
  • Găsirea echilibrului între calitatea modelului, latency și costul infrastructurii
  • Crearea unei liste de verificare simple pentru optimizarea costurilor

Operațiuni, Monitorizare și Evaluarea Pregătirii

  • Trigger-ele de autoscaling pentru serviciile de inferență
  • Monitorizarea latency-ului, throughput-ului, utilizării cache-ului și stării GPU-urilor
  • Noțiuni despre logging, alertare și răspuns la incidente
  • Evaluarea unei implementări de referință și crearea unui plan de îmbunătățire

Cerințe

  • Înțelegerea de bază a implementării fluxurilor de lucru ale modelelor mari de limbaj (LLM) și a inferenței
  • Experiență cu containere, infrastructură cloud sau on-premise și servicii bazate pe API
  • Cunoștințe practice de Python sau sarcini de inginerie sistem

Audiența Țintă

  • Ingineri ML care implementează LLM-uri în producție
  • Ingineri de platformă responsabili pentru serviciile de inferență bazate pe GPU
  • Arhitecți de soluții care proiectează platforme scalabile de serviere AI
 14 Ore

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite