Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Durata 14 ore (2 zile)
Schița de curs
Prezentare generală a tehnologiilor de recunoaștere a vorbirii
- Istoria și evoluția recunoașterii vorbirii
- Modele acustice, modele de limbaj și decodare
- Arhitecturi moderne: RNN-uri, transformere și Whisper
Preprocesarea audio și elementele de bază ale transcrierii
- Gestionarea formatelor audio și a ratelor de eșantionare
- Curățarea, decuparea și segmentarea audio
- Generarea textului din audio: real-time vs batch
Lucru hands-on cu Whisper și alte API-uri
- Instalarea și utilizarea OpenAI Whisper
- Apelarea API-urilor cloud (Google, Azure) pentru transcriere
- Compararea performanței, latenței și costurilor
Limbi, accente și adaptare la domeniu
- Lucrul cu mai multe limbi și accente
- Vocabulare personalizate și toleranță la zgomot
- Gestionarea limbajului juridic, medical sau tehnic
Formatarea ieșirii și integrarea
- Adăugarea de marcaje temporale, punctuație și etichete pentru vorbitori
- Exportul în formate text, SRT sau JSON
- Integrarea transcrierilor în aplicații sau baze de date
Laboratoare de implementare pentru scenarii de utilizare
- Transcrierea întâlnirilor, interviurilor sau podcasturilor
- Sisteme de comandă voice-to-text
- Subtitrări în timp real pentru streamuri video/audio
Evaluare, limitări și etică
- Metrici de acuratețe și benchmarking al modelelor
- Bias și corectitudine în modelele de vorbire
- Considerații privind confidențialitatea și conformitatea
Rezumat și pașii următori
Cerințe
- Înțelegerea conceptelor generale de AI și machine learning
- Familiaritate cu formatele și instrumentele pentru fișiere audio sau media
Public țintă
- Data scientists și ingineri AI care lucrează cu date vocale
- Dezvoltatori software care construiesc aplicații bazate pe transcriere
- Organizații care explorează recunoașterea vorbirii pentru automatizare