Intrati in legatura

Schița de curs

Introducere

Această secțiune oferă o introducere generală despre când să folosești „machine learning”, ce ar trebui luat în considerare și ce înseamnă totul, inclusiv avantajele și dezavantajele. Tipuri de date (structurate/nestructurate/statice/streaming), validitatea/volumul datelor, analiză bazată pe date vs. analiză bazată pe utilizator, modele statistice vs. modele de machine learning, provocările învățării nesupervizate, compromisul bias-varianță, iterație/evaluare, abordări de validare încrucișată, învățare supervizată/nesupervizată/prin recompensă.

SUBIECTE PRINCIPALE

1. Înțelegerea algoritmului naive Bayes

  • Concepte de bază ale metodelor bayesiene
  • Probabilitate
  • Probabilitate comună
  • Probabilitate condiționată cu teorema lui Bayes
  • Algoritmul naive Bayes
  • Clasificarea naive Bayes
  • Estimatorul Laplace
  • Utilizarea caracteristicilor numerice cu naive Bayes

2. Înțelegerea arborilor de decizie

  • Divide și cucerește
  • Algoritmul de arbore de decizie C5.0
  • Alegerea celei mai bune diviziuni
  • Reducerea arborelui de decizie (pruning)

3. Înțelegerea rețelelor neuronale

  • De la neuronii biologici la cei artificiali
  • Funcții de activare
  • Topologia rețelei
  • Numărul de straturi
  • Direcția de circulație a informației
  • Numărul de noduri din fiecare strat
  • Antrenarea rețelelor neuronale cu backpropagation
  • Deep Learning

4. Înțelegerea Support Vector Machines

  • Clasificare cu hiperplane
  • Găsirea marjei maxime
  • Cazul datelor separabile liniar
  • Cazul datelor neseparabile liniar
  • Utilizarea kernel-urilor pentru spații neliniare

5. Înțelegerea clustering-ului

  • Clustering-ul ca sarcină de machine learning
  • Algoritmul k-means pentru clustering
  • Utilizarea distanței pentru alocarea și actualizarea clusterelor
  • Alegerea numărului potrivit de clustere

6. Măsurarea performanței pentru clasificare

  • Lucrul cu datele de predicție pentru clasificare
  • O privire mai atentă asupra matricelor de confuzie
  • Utilizarea matricelor de confuzie pentru a măsura performanța
  • Dincolo de acuratețe – alte măsuri de performanță
  • Statistica kappa
  • Sensibilitate și specificitate
  • Precizie și recall
  • Măsura F
  • Vizualizarea compromisurilor de performanță
  • Curbe ROC
  • Estimarea performanței viitoare
  • Metoda holdout
  • Validare încrucișată
  • Eșantionare bootstrap

7. Reglarea modelelor standard pentru performanțe mai bune

  • Utilizarea caret pentru reglarea automată a parametrilor
  • Crearea unui model simplu optimizat
  • Personalizarea procesului de reglare
  • Îmbunătățirea performanței modelului cu meta-learning
  • Înțelegerea ansamblurilor de modele (ensembles)
  • Bagging
  • Boosting
  • Random forests
  • Antrenarea random forests
  • Evaluarea performanței random forests

SUBIECTE SECUNDARE

8. Înțelegerea clasificării folosind cei mai apropiați vecini

  • Algoritmul kNN
  • Calcularea distanței
  • Alegerea unui k potrivit
  • Pregătirea datelor pentru utilizarea cu kNN
  • De ce este algoritmul kNN „leneș”?

9. Înțelegerea regulilor de clasificare

  • Separă și cucerește
  • Algoritmul One Rule
  • Algoritmul RIPPER
  • Reguli derivate din arborii de decizie

10. Înțelegerea regresiei

  • Regresie liniară simplă
  • Estimarea prin metoda celor mai mici pătrate
  • Corelații
  • Regresie liniară multiplă

11. Înțelegerea arborilor de regresie și a arborilor de modele

  • Adăugarea regresiei la arbori

12. Înțelegerea regulilor de asociere

  • Algoritmul Apriori pentru învățarea regulilor de asociere
  • Măsurarea interesului regulilor – suport și încredere
  • Construirea unui set de reguli cu principiul Apriori

Extra

  • Spark/PySpark/MLlib și multi-armed bandits

Cerințe

Cunoștințe de Python

 21 Ore

Numărul de participanți


Pret per participant

Mărturii (7)

Cursuri viitoare

Categorii înrudite