Intrati in legatura
 Durata 21 ore

Schița de curs

Introducere în AI Multimodal și Ollama

  • Prezentare generală a învățării multimodale
  • Provocări cheie în integrarea viziune-limbaj
  • Capabilitățile și arhitectura Ollama

Configurarea Mediului Ollama

  • Instalarea și configurarea Ollama
  • Lucrul cu implementarea locală a modelelor
  • Integrarea Ollama cu Python și Jupyter

Lucrul cu Intrări Multimodale

  • Integrarea textului și a imaginilor
  • Încorporarea audio și a datelor structurate
  • Proiectarea pipeline-urilor de preprocesare

Aplicații de Înțelegere a Documentelor

  • Extragerea informațiilor structurate din PDF-uri și imagini
  • Combinarea OCR cu modelele de limbaj
  • Construirea de fluxuri de lucru inteligente pentru analiza documentelor

Visual Question Answering (VQA)

  • Configurarea seturilor de date și a benchmark-urilor VQA
  • Antrenarea și evaluarea modelelor multimodale
  • Construirea de aplicații VQA interactive

Proiectarea Agenților Multimodali

  • Principii de design al agenților cu raționament multimodal
  • Combinarea percepției, limbajului și acțiunii
  • Implementarea agenților pentru cazuri de utilizare din lumea reală

Integrare Avansată și Optimizare

  • Ajustarea fină a modelelor multimodale cu Ollama
  • Optimizarea performanței de inferență
  • Considerații privind scalabilitatea și implementarea

Rezumat și Pașii Următori

Cerințe

  • Înțelegere solidă a conceptelor de machine learning
  • Experiență cu framework-uri de deep learning precum PyTorch sau TensorFlow
  • Familiaritate cu procesarea limbajului natural și vederea computerizată

Public țintă

  • Ingineri de machine learning
  • Cercetători AI
  • Dezvoltatori de produse care integrează fluxuri de lucru vizuale și textuale

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite