Intrati in legatura

Schița de curs

Introducere în modelele multimodale Mistral

  • Prezentare generală a modelului Mistral Medium și a capabilităților multimodale
  • Modele OCR/document și cazuri de utilizare
  • Integrarea cu ecosisteme open-source

Pipeline-uri de OCR și viziune computerizată

  • Fundamente OCR cu modele Mistral
  • Preprocesarea imaginilor și a documentelor scanate
  • Extragerea textului structurat din imagini

Înțelegerea documentelor

  • Proiectarea pipeline-urilor NLP pentru documente
  • Recunoașterea entităților, rezumarea și clasificarea
  • Conectarea cross-modală a datelor text și vizuale

Aplicații de căutare și knowledge

  • Sisteme de căutare viziune-text
  • Construirea căutării semantice cu output-uri OCR
  • Repozitorii enterprise de documente

Aplicații asistive și interactive

  • Design UI pentru asistenți multimodali
  • Aplicații de accesibilitate (de exemplu, viziune-to-text)
  • Instrumente de productivitate din lumea reală

Performanță și optimizare

  • Scalarea pipeline-urilor multimodale
  • Optimizarea performanței de inferență
  • Evaluarea compromisurilor dintre acuratețe și eficiență

Studii de caz și direcții viitoare

  • Aplicații industriale ale AI multimodale
  • Tendințe de cercetare în OCR și document AI
  • Considerații de AI responsabil în sarcinile viziune-text

Rezumat și pașii următori

Cerințe

  • Înțelegerea conceptelor de procesare a limbajului natural
  • Experiență cu Python și framework-uri ML
  • Familiaritate cu noțiunile de bază de computer vision

Public țintă

  • Echipe de produs
  • Cercetători ML
  • Ingineri ML aplicați
 14 Ore

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite