Schița de curs
Platforma Databricks și Fundamentele Lakehouse
- Arhitectura și componentele Databricks Lakehouse
- Organizarea spațiilor de lucru și catalogelor
Spațiul de lucru Databricks și Jurnalele (Notebooks)
- Navigarea în spațiul de lucru și dezvoltarea bazată pe jurnale (notebook-based)
- Structurarea codului în jurnale reutilizabile
Arhitectura Apache Spark și Execuția
- Arhitectura runtime-ului Spark și modelul de execuție
- Evaluarea leneșă (lazy evaluation) și DAG-ul job-urilor
DataFrame-uri PySpark și API-ul DataFrame
- Abstracțiile DataFrame și schemele de date
- Operațiile fundamentale ale DataFrame-ului și expresiile de coloane
Traducerea SQL în DataFrames PySpark
- Traducerea claselor SQL fundamentale în operațiuni DataFrame
- Funcțiile window și agregările în PySpark
Citirea și Scrierea datelor în Databricks
- Citirea din surse comune de fișiere și baze de date
- Scrierea și partajarea (partitioning) datelor în Lakehouse
Delta Lake și Gestionarea Tabelelor
- Tabele Delta și tranzacții ACID
- Vizualizarea istorică (time travel) și evoluția schemei
Șabloane de Curățare și Transformare a Datelor
- Curățarea datelor și conversia tipurilor
- Construirea logicii reutilizabile de transformare
Funcții Definite de Utilizator (UDF) și Cod Modular
- Python UDF-uri și pandas UDF-uri
- Modularizarea logicii procedurale în funcții
Tuning de Performanță și Optimizare
- Strategii de partajare (partitioning) și caching
- Diagnosticarea coltoanelor cu Spark UI
Fundamentele Structured Streaming
- Modele de procesare batch versus streaming
- DataFrame-uri streaming și agregări de bază
Job-urile Databricks și Orchestarea Fluxurilor de Lucru
- Programarea jurnalelor ca job-uri și sarcini
- Construirea fluxurilor de lucru multi-pas cu dependențe
Unity Catalog și Guvernanța Datelor
- Arhitectura Unity Catalog și spațiile de nume (namespaces)
- Controlul accesului și linia de date (data lineage)
Testare, Depanare și Practici în Producție
- Testarea unitară a logicii PySpark
- Depanarea și standardele de calitate a codului
Cazuri de Utilizare End-to-End în Serviciile Financiare
- Construirea unui pipeline ETL bancar end-to-end
- Traducerea proceselor legacy SQL în PySpark
Migrarea Sarcinilor de Lucru SQL în PySpark
- Strategii de migrare și șabloane de planificare
- Convertirea incrementală a fluxurilor de lucru SQL în PySpark
Cerințe
- Experiență cu programarea în Python, inclusiv funcții și tipuri de date
- Înțelegerea SQL, incluzând joins, agregări și subinterogări
- Nu sunt necesare cunoștințe anterioare despre Databricks sau PySpark
Audiență
- Ingineri de date, analiști de date și profesioniști din domeniul datelor
- Echipe care migrează fluxuri de lucru SQL existente către Databricks și PySpark
Mărturii (1)
Mi-a plăcut că a fost practic. Am adorat să aplic cunoștințele teoretice cu exemple practice.
Aurelia-Adriana - Allianz Services Romania
Curs - Python and Spark for Big Data (PySpark)
Tradus de catre o masina