Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Schița de curs
Suveranitate AI și Implementare Locală a LLM
- Riscurile modelelor LLM din cloud: păstrarea datelor, antrenarea pe intrări, jurisdicție străină.
- Arhitectura Ollama: server de modele, registru și API compatibil OpenAI.
- Comparație cu vLLM, llama.cpp și Text Generation Inference.
- Licențierea modelelor: termeni Llama, Mistral, Qwen și Gemma.
Instalare și Configurare Hardware
- Instalarea Ollama pe Linux cu suport CUDA și ROCm.
- Rezervă doar cu CPU și optimizare AVX/AVX2.
- Implementare Docker și mapare volume persistente.
- Configurare multi-GPU și strategii de alocare VRAM.
Gestionarea Modelelor
- Descărcarea modelelor din registrul Ollama: ollama pull llama3.
- Importul modelelor GGUF din HuggingFace și TheBloke.
- Niveluri de cuantizare: compromisuri Q4_K_M, Q5_K_M, Q8_0.
- Schimbarea modelelor și limite de încărcare concurentă a modelelor.
Fișiere Modelfile Personalizate
- Scrierea sintaxei Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
- Ajustarea temperaturii, top_p și repeat_penalty.
- Ingineria prompturilor de sistem pentru comportament specific rolului.
- Crearea și publicarea modelelor personalizate în registrul local.
Integrare API
- Punctul final OpenAI-compatibil /v1/chat/completions.
- Răspunsuri în flux și mod JSON.
- Integrare cu LangChain, LlamaIndex și aplicații personalizate.
- Autentificare și limitare a ratei cu proxy invers.
Optimizare Performanță
- Dimensionarea ferestrei de context și gestionarea cache KV.
- Inferență în lot și gestionarea cererilor paralele.
- Alocarea firelor CPU și conștientizare NUMA.
- Monitorizarea utilizării GPU și presiunii memoriei.
Securitate și Conformitate
- Izolarea rețelei pentru punctele finale de servire a modelelor.
- Filtrarea intrărilor și conducte de moderare a ieșirilor.
- Jurnalizarea auditării prompturilor și completărilor.
- Proveniența modelelor și verificarea hash.
Cerințe
- Cunoștințe intermediare de administrare Linux și containere.
- Înțelegere de nivel înalt a modelelor de învățare automată și transformer.
- Familiaritate cu API-uri REST și JSON.
Publicul Țintă
- Ingineri și dezvoltatori AI care înlocuiesc API-uri LLM din cloud.
- Organizații cu sensibilitate a datelor care împiedică utilizarea modelelor din cloud.
- Echipe guvernamentale și de apărare care necesită modele lingvistice izolate.
14 Ore