Intrati in legatura

Schița de curs

Suveranitate AI și Implementare Locală a LLM

  • Riscurile modelelor LLM din cloud: păstrarea datelor, antrenarea pe intrări, jurisdicție străină.
  • Arhitectura Ollama: server de modele, registru și API compatibil OpenAI.
  • Comparație cu vLLM, llama.cpp și Text Generation Inference.
  • Licențierea modelelor: termeni Llama, Mistral, Qwen și Gemma.

Instalare și Configurare Hardware

  • Instalarea Ollama pe Linux cu suport CUDA și ROCm.
  • Rezervă doar cu CPU și optimizare AVX/AVX2.
  • Implementare Docker și mapare volume persistente.
  • Configurare multi-GPU și strategii de alocare VRAM.

Gestionarea Modelelor

  • Descărcarea modelelor din registrul Ollama: ollama pull llama3.
  • Importul modelelor GGUF din HuggingFace și TheBloke.
  • Niveluri de cuantizare: compromisuri Q4_K_M, Q5_K_M, Q8_0.
  • Schimbarea modelelor și limite de încărcare concurentă a modelelor.

Fișiere Modelfile Personalizate

  • Scrierea sintaxei Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
  • Ajustarea temperaturii, top_p și repeat_penalty.
  • Ingineria prompturilor de sistem pentru comportament specific rolului.
  • Crearea și publicarea modelelor personalizate în registrul local.

Integrare API

  • Punctul final OpenAI-compatibil /v1/chat/completions.
  • Răspunsuri în flux și mod JSON.
  • Integrare cu LangChain, LlamaIndex și aplicații personalizate.
  • Autentificare și limitare a ratei cu proxy invers.

Optimizare Performanță

  • Dimensionarea ferestrei de context și gestionarea cache KV.
  • Inferență în lot și gestionarea cererilor paralele.
  • Alocarea firelor CPU și conștientizare NUMA.
  • Monitorizarea utilizării GPU și presiunii memoriei.

Securitate și Conformitate

  • Izolarea rețelei pentru punctele finale de servire a modelelor.
  • Filtrarea intrărilor și conducte de moderare a ieșirilor.
  • Jurnalizarea auditării prompturilor și completărilor.
  • Proveniența modelelor și verificarea hash.

Cerințe

  • Cunoștințe intermediare de administrare Linux și containere.
  • Înțelegere de nivel înalt a modelelor de învățare automată și transformer.
  • Familiaritate cu API-uri REST și JSON.

Publicul Țintă

  • Ingineri și dezvoltatori AI care înlocuiesc API-uri LLM din cloud.
  • Organizații cu sensibilitate a datelor care împiedică utilizarea modelelor din cloud.
  • Echipe guvernamentale și de apărare care necesită modele lingvistice izolate.
 14 Ore

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite