Intrati in legatura

Schița de curs

Platforma Databricks și Fundamentele Lakehouse

  • Arhitectura și componentele Databricks Lakehouse
  • Organizarea spațiilor de lucru și catalogelor

Spațiul de lucru Databricks și Jurnalele (Notebooks)

  • Navigarea în spațiul de lucru și dezvoltarea bazată pe jurnale (notebook-based)
  • Structurarea codului în jurnale reutilizabile

Arhitectura Apache Spark și Execuția

  • Arhitectura runtime-ului Spark și modelul de execuție
  • Evaluarea leneșă (lazy evaluation) și DAG-ul job-urilor

DataFrame-uri PySpark și API-ul DataFrame

  • Abstracțiile DataFrame și schemele de date
  • Operațiile fundamentale ale DataFrame-ului și expresiile de coloane

Traducerea SQL în DataFrames PySpark

  • Traducerea claselor SQL fundamentale în operațiuni DataFrame
  • Funcțiile window și agregările în PySpark

Citirea și Scrierea datelor în Databricks

  • Citirea din surse comune de fișiere și baze de date
  • Scrierea și partajarea (partitioning) datelor în Lakehouse

Delta Lake și Gestionarea Tabelelor

  • Tabele Delta și tranzacții ACID
  • Vizualizarea istorică (time travel) și evoluția schemei

Șabloane de Curățare și Transformare a Datelor

  • Curățarea datelor și conversia tipurilor
  • Construirea logicii reutilizabile de transformare

Funcții Definite de Utilizator (UDF) și Cod Modular

  • Python UDF-uri și pandas UDF-uri
  • Modularizarea logicii procedurale în funcții

Tuning de Performanță și Optimizare

  • Strategii de partajare (partitioning) și caching
  • Diagnosticarea coltoanelor cu Spark UI

Fundamentele Structured Streaming

  • Modele de procesare batch versus streaming
  • DataFrame-uri streaming și agregări de bază

Job-urile Databricks și Orchestarea Fluxurilor de Lucru

  • Programarea jurnalelor ca job-uri și sarcini
  • Construirea fluxurilor de lucru multi-pas cu dependențe

Unity Catalog și Guvernanța Datelor

  • Arhitectura Unity Catalog și spațiile de nume (namespaces)
  • Controlul accesului și linia de date (data lineage)

Testare, Depanare și Practici în Producție

  • Testarea unitară a logicii PySpark
  • Depanarea și standardele de calitate a codului

Cazuri de Utilizare End-to-End în Serviciile Financiare

  • Construirea unui pipeline ETL bancar end-to-end
  • Traducerea proceselor legacy SQL în PySpark

Migrarea Sarcinilor de Lucru SQL în PySpark

  • Strategii de migrare și șabloane de planificare
  • Convertirea incrementală a fluxurilor de lucru SQL în PySpark

Cerințe

  • Experiență cu programarea în Python, inclusiv funcții și tipuri de date
  • Înțelegerea SQL, incluzând joins, agregări și subinterogări
  • Nu sunt necesare cunoștințe anterioare despre Databricks sau PySpark

Audiență

  • Ingineri de date, analiști de date și profesioniști din domeniul datelor
  • Echipe care migrează fluxuri de lucru SQL existente către Databricks și PySpark
 35 Ore

Numărul de participanți


Pret per participant

Mărturii (1)

Cursuri viitoare

Categorii înrudite