Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Schița de curs
Introducere în modelele multimodale Mistral
- Prezentare generală a modelului Mistral Medium și a capabilităților multimodale
- Modele OCR/document și cazuri de utilizare
- Integrarea cu ecosisteme open-source
Pipeline-uri de OCR și viziune computerizată
- Fundamente OCR cu modele Mistral
- Preprocesarea imaginilor și a documentelor scanate
- Extragerea textului structurat din imagini
Înțelegerea documentelor
- Proiectarea pipeline-urilor NLP pentru documente
- Recunoașterea entităților, rezumarea și clasificarea
- Conectarea cross-modală a datelor text și vizuale
Aplicații de căutare și knowledge
- Sisteme de căutare viziune-text
- Construirea căutării semantice cu output-uri OCR
- Repozitorii enterprise de documente
Aplicații asistive și interactive
- Design UI pentru asistenți multimodali
- Aplicații de accesibilitate (de exemplu, viziune-to-text)
- Instrumente de productivitate din lumea reală
Performanță și optimizare
- Scalarea pipeline-urilor multimodale
- Optimizarea performanței de inferență
- Evaluarea compromisurilor dintre acuratețe și eficiență
Studii de caz și direcții viitoare
- Aplicații industriale ale AI multimodale
- Tendințe de cercetare în OCR și document AI
- Considerații de AI responsabil în sarcinile viziune-text
Rezumat și pașii următori
Cerințe
- Înțelegerea conceptelor de procesare a limbajului natural
- Experiență cu Python și framework-uri ML
- Familiaritate cu noțiunile de bază de computer vision
Public țintă
- Echipe de produs
- Cercetători ML
- Ingineri ML aplicați
14 Ore