Intrati in legatura

Schița de curs

Structura detaliată a trainingului

  1. Introducere în NLP
    • Înțelegerea NLP
    • Framework-uri NLP
    • Aplicații comerciale ale NLP
    • Extragerea datelor de pe web
    • Lucrul cu diverse API-uri pentru a prelua date text
    • Lucrul și stocarea corpusurilor de text, salvarea conținutului și a metadatelor relevante
    • Avantajele utilizării Python și curs intensiv de NLTK
  2. Înțelegerea practică a unui Corpus și a unui Set de Date
    • De ce avem nevoie de un corpus?
    • Analiza corpusului
    • Tipuri de atribute ale datelor
    • Diferite formate de fișiere pentru corpusuri
    • Pregătirea unui set de date pentru aplicații NLP
  3. Înțelegerea structurii unei propoziții
    • Componentele NLP
    • Înțelegerea limbajului natural
    • Analiza morfologică - rădăcină, cuvânt, token, etichete de vorbire
    • Analiza sintactică
    • Analiza semantică
    • Gestionarea ambiguității
  4. Preprocesarea datelor text
    • Corpus - text brut
      • Tokenizarea propozițiilor
      • Stemming pentru text brut
      • Lematizarea textului brut
      • Eliminarea cuvintelor de umplutură
    • Corpus - propoziții brute
      • Tokenizarea cuvintelor
      • Lematizarea cuvintelor
    • Lucrul cu matrice Termen-Document/Document-Termen
    • Tokenizarea textului în n-grame și propoziții
    • Preprocesare practică și personalizată
  5. Analiza datelor text
    • Caracteristici de bază ale NLP
      • Parsere și parsare
      • Etichetarea părților de vorbire și etichetatoare
      • Recunoașterea entităților numite
      • N-grame
      • Bag of words
    • Caracteristici statistice ale NLP
      • Concepte de algebră liniară pentru NLP
      • Teoria probabilistică pentru NLP
      • TF-IDF
      • Vectorizare
      • Encodere și Decodere
      • Normalizare
      • Modele probabilistice
    • Feature engineering avansat și NLP
      • Bazele word2vec
      • Componentele modelului word2vec
      • Logica modelului word2vec
      • Extinderea conceptului word2vec
      • Aplicarea modelului word2vec
    • Studiu de caz: Aplicarea bag of words: rezumarea automată a textului folosind algoritmii simplificați și adevărați ai lui Luhn
  6. Clustering de documente, Clasificare și Modelare de subiecte
    • Clustering de documente și pattern mining (clustering ierarhic, k-means, clustering etc.)
    • Compararea și clasificarea documentelor folosind măsurile de distanță TFIDF, Jaccard și cosinus
    • Clasificarea documentelor folosind Naïve Bayes și Entropia Maximă
  7. Identificarea elementelor importante din text
    • Reducerea dimensionalității: Analiza Componentelor Principale, Descompunerea Valorilor Singulare, factorizarea matricială non-negativă
    • Modelarea de subiecte și regăsirea informațiilor folosind Analiza Semantică Latentă
  8. Extragerea entităților, Analiza sentimentelor și Modelarea avansată de subiecte
    • Pozitiv vs. negativ: gradul de sentiment
    • Teoria Răspunsului la Item
    • Etichetarea părților de vorbire și aplicarea sa: găsirea persoanelor, locurilor și organizațiilor menționate în text
    • Modelarea avansată de subiecte: Latent Dirichlet Allocation
  9. Studii de caz
    • Minarea recenziilor nestructurate ale utilizatorilor
    • Clasificarea sentimentelor și vizualizarea datelor de recenzii ale produselor
    • Minarea jurnalelor de căutare pentru tipare de utilizare
    • Clasificarea textului
    • Modelarea de subiecte

Cerințe

Cunoștințe și înțelegere a principiilor NLP și o apreciere a aplicării AI în afaceri

 21 Ore

Numărul de participanți


Pret per participant

Mărturii (1)

Cursuri viitoare

Categorii înrudite