Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Durata 21 ore
Schița de curs
Introducere în AI Multimodal și Ollama
- Prezentare generală a învățării multimodale
- Provocări cheie în integrarea viziune-limbaj
- Capabilitățile și arhitectura Ollama
Configurarea Mediului Ollama
- Instalarea și configurarea Ollama
- Lucrul cu implementarea locală a modelelor
- Integrarea Ollama cu Python și Jupyter
Lucrul cu Intrări Multimodale
- Integrarea textului și a imaginilor
- Încorporarea audio și a datelor structurate
- Proiectarea pipeline-urilor de preprocesare
Aplicații de Înțelegere a Documentelor
- Extragerea informațiilor structurate din PDF-uri și imagini
- Combinarea OCR cu modelele de limbaj
- Construirea de fluxuri de lucru inteligente pentru analiza documentelor
Visual Question Answering (VQA)
- Configurarea seturilor de date și a benchmark-urilor VQA
- Antrenarea și evaluarea modelelor multimodale
- Construirea de aplicații VQA interactive
Proiectarea Agenților Multimodali
- Principii de design al agenților cu raționament multimodal
- Combinarea percepției, limbajului și acțiunii
- Implementarea agenților pentru cazuri de utilizare din lumea reală
Integrare Avansată și Optimizare
- Ajustarea fină a modelelor multimodale cu Ollama
- Optimizarea performanței de inferență
- Considerații privind scalabilitatea și implementarea
Rezumat și Pașii Următori
Cerințe
- Înțelegere solidă a conceptelor de machine learning
- Experiență cu framework-uri de deep learning precum PyTorch sau TensorFlow
- Familiaritate cu procesarea limbajului natural și vederea computerizată
Public țintă
- Ingineri de machine learning
- Cercetători AI
- Dezvoltatori de produse care integrează fluxuri de lucru vizuale și textuale