Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Durata 14 ore
Schița de curs
Elemente Fundamentale pentru Implementarea Tencent Hunyuan în Producție
- Panoramic al scenariilor de servire a modelelor Tencent Hunyuan
- Caracteristicile producției modelului pentru modelele mari și MoE
- Guleri frecvente de latency, throughput și cost
- Definirea obiectivelor de nivel al serviciului pentru sarcinile de lucru de inferență
Arhitectura Implementării și Fluxul de Serviere
- Componentele esențiale ale stivei de inferență în producție
- Alegerea între modelele de implementare containerizate, on-premise și cloud
- Încărcarea modelului, routarea cererilor și alocarea GPU-urilor - noțiuni de bază
- Proiectarea pentru fiabilitate și simplitate operațională
Optimizarea Latency în Practică
- Folosirea motoarelor de inferență optimizate, precum TensorRT, unde este cazul
- Noțiuni despre KV-cache și ajustarea practică a cache-ului
- Reducerea overhead-ului de startup, warmup și răspuns
- Măsurarea timpului până la primul token și vitezei de generare a token-urilor
Throughput, Batching și Eficiența GPU
- Strategii de continuous batching și request batching
- Gestionarea concurenței și a comportamentului cozilor
- Îmbunătățirea utilizării GPU-urilor fără a afecta experiența utilizatorului
- Tratarea cererilor cu context lung și sarcini de lucru mixte
Cantizarea și Controlul Costurilor
- De ce este importantă cantizarea pentru servirea în producție
- Echilibruri practice ale opțiunilor comune de precizie, cum ar fi FP16, INT8 etc.
- Găsirea echilibrului între calitatea modelului, latency și costul infrastructurii
- Crearea unei liste de verificare simple pentru optimizarea costurilor
Operațiuni, Monitorizare și Evaluarea Pregătirii
- Trigger-ele de autoscaling pentru serviciile de inferență
- Monitorizarea latency-ului, throughput-ului, utilizării cache-ului și stării GPU-urilor
- Noțiuni despre logging, alertare și răspuns la incidente
- Evaluarea unei implementări de referință și crearea unui plan de îmbunătățire
Cerințe
- Înțelegerea de bază a implementării fluxurilor de lucru ale modelelor mari de limbaj (LLM) și a inferenței
- Experiență cu containere, infrastructură cloud sau on-premise și servicii bazate pe API
- Cunoștințe practice de Python sau sarcini de inginerie sistem
Audiența Țintă
- Ingineri ML care implementează LLM-uri în producție
- Ingineri de platformă responsabili pentru serviciile de inferență bazate pe GPU
- Arhitecți de soluții care proiectează platforme scalabile de serviere AI