Intrati in legatura
 Durata 14 ore (2 zile)

Schița de curs

Prezentare generală a tehnologiilor de recunoaștere a vorbirii

  • Istoria și evoluția recunoașterii vorbirii
  • Modele acustice, modele de limbaj și decodare
  • Arhitecturi moderne: RNN-uri, transformere și Whisper

Preprocesarea audio și elementele de bază ale transcrierii

  • Gestionarea formatelor audio și a ratelor de eșantionare
  • Curățarea, decuparea și segmentarea audio
  • Generarea textului din audio: real-time vs batch

Lucru hands-on cu Whisper și alte API-uri

  • Instalarea și utilizarea OpenAI Whisper
  • Apelarea API-urilor cloud (Google, Azure) pentru transcriere
  • Compararea performanței, latenței și costurilor

Limbi, accente și adaptare la domeniu

  • Lucrul cu mai multe limbi și accente
  • Vocabulare personalizate și toleranță la zgomot
  • Gestionarea limbajului juridic, medical sau tehnic

Formatarea ieșirii și integrarea

  • Adăugarea de marcaje temporale, punctuație și etichete pentru vorbitori
  • Exportul în formate text, SRT sau JSON
  • Integrarea transcrierilor în aplicații sau baze de date

Laboratoare de implementare pentru scenarii de utilizare

  • Transcrierea întâlnirilor, interviurilor sau podcasturilor
  • Sisteme de comandă voice-to-text
  • Subtitrări în timp real pentru streamuri video/audio

Evaluare, limitări și etică

  • Metrici de acuratețe și benchmarking al modelelor
  • Bias și corectitudine în modelele de vorbire
  • Considerații privind confidențialitatea și conformitatea

Rezumat și pașii următori

Cerințe

  • Înțelegerea conceptelor generale de AI și machine learning
  • Familiaritate cu formatele și instrumentele pentru fișiere audio sau media

Public țintă

  • Data scientists și ingineri AI care lucrează cu date vocale
  • Dezvoltatori software care construiesc aplicații bazate pe transcriere
  • Organizații care explorează recunoașterea vorbirii pentru automatizare

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite