Intrati in legatura
 Durata 14 ore (2 zile)

Schița de curs

Introducere în sinteza vorbirii și clonarea vocii

  • Prezentare generală a text-to-speech (TTS) și a sintezei neurale a vocii
  • Clonarea vocii vs. generarea vorbirii: cazuri de utilizare și limite
  • Modele cheie: Tacotron, WaveNet, FastSpeech, VITS

Lucrul cu platforme comerciale

  • Utilizarea ElevenLabs și Resemble AI
  • Crearea, clonarea și editarea vocii
  • Acces API și fluxuri de lucru text-to-speech

Construirea cu instrumente open-source

  • Instalarea și configurarea Coqui TTS
  • Antrenarea vocilor personalizate și gestionarea seturilor de date
  • Generarea vorbirii cu control fin (tonalitate, viteză, emoție)

Pregătirea datelor și gestionarea setului de date pentru voce

  • Colectarea și curățarea eșantioanelor de voce
  • Segmentarea, etichetarea și alinierea transcrierilor
  • Aprovizionarea etică și consimțământul pentru voce

Integrarea aplicațiilor

  • Încorporarea TTS în site-uri web și aplicații
  • Crearea de sisteme IVR și boți interactivi
  • Generarea de dialoguri sintetice pentru video și jocuri

Evaluarea calității și a realismului

  • MOS (Mean Opinion Score) și teste de inteligibilitate
  • Controlul expresivității și al prozodiei
  • Compararea latenței, fidelității și realismului

Considerații etice, legale și de guvernanță

  • Riscuri deepfake și utilizare responsabilă
  • Consimțământ, atribuire și implicații legate de drepturile de autor
  • Reglementări și politici organizaționale

Rezumat și pașii următori

Cerințe

  • Înțelegerea noțiunilor fundamentale de machine learning
  • Familiaritate cu formatele de fișiere audio și cu instrumentele de editare
  • Cunoștințe de bază de programare Python

Public țintă

  • Dezvoltatori și ingineri AI interesați de sinteza vorbirii
  • Creatori de conținut și tehnologi media care explorează generarea vocii
  • Echipe de R&D care construiesc sisteme audio personalizate sau dinamice

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite