Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Schița de curs
Introducere, obiective și strategie de migrare
- Obiectivele cursului, alinierea profilului participanților și criteriile de succes
- Aproacheri de migrare la nivel general și aspecte legate de riscuri
- Configurarea workspaces, a repository-urilor și a seturilor de date pentru laborator
Ziua 1 — Fundamentele migrării și arhitectura
- Concepte Lakehouse, prezentare generală a Delta Lake și arhitectura Databricks
- Diferențe între SMP și MPP și implicații pentru migrare
- Design-ul Medallion (Bronze→Silver→Gold) și prezentare generală Unity Catalog
Laborator Ziua 1 — Traducerea unei proceduri stocate
- Migrare hands-on a unei proceduri stocate exemplu într-un notebook
- Maparea tabelelor temporare și a cursorilor către transformări DataFrame
- Validare și compararea cu output-ul original
Ziua 2 — Delta Lake avansat & încărcare incrementală
- Transacții ACID, jurnal de commit, versioning și time travel
- Auto Loader, pattern-uri MERGE INTO, upserts și evoluția schema
- OPTIMIZE, VACUUM, Z-ORDER, partitioning și ajustarea storage-ului
Laborator Ziua 2 — Ingestie & optimizare incrementală
- Implementarea ingestiei cu Auto Loader și workflow-urilor MERGE
- Aplicarea OPTIMIZE, Z-ORDER și VACUUM; validarea rezultatelor
- Măsurarea îmbunătățirilor de performanță la citire/scriere
Ziua 3 — SQL în Databricks, performanță & debugging
- Funcționalități analitice SQL: funcții de fereastră, funcții de ordin superior, procesare JSON/array
- Interpretarea Spark UI, DAG-uri, shuffles, stagi, task-uri și diagnosticarea gâurilor de stârc
- Pattern-uri de ajustare a interogărilor: broadcast joins, hints, caching și reducerea spill-ului
Laborator Ziua 3 — Refactorizarea SQL & ajustare performanță
- Refactorizarea unui proces SQL intens într-un Spark SQL optimizat
- Folosirea traselor din Spark UI pentru a identifica și rezolva problemele de skew și shuffle
- Benchmark înainte/după și documentarea pașilor de tuning
Ziua 4 — PySpark tactic: înlocuirea logicii procedurale
- Modelul de execuție Spark: driver, executors, evaluare lentă și strategii de partitioning
- Transformarea buclelor și cursorilor în operații vectorizate DataFrame
- Modularizare, UDFs/pandas UDFs, widgets și biblioteci reutilizabile
Laborator Ziua 4 — Refactorizarea scripturilor procedurale
- Refactorizarea unui script ETL procedural în notebook-uri PySpark modulare
- Introducerea parametrizării, teste de tip unit și funcții reutilizabile
- Recenzie de cod și aplicarea checklist-ului de bune practici
Ziua 5 — Orchestare, pipeline end-to-end & bune practici
- Databricks Workflows: design job-uri, dependențe între task-uri, trigger-e și gestionarea erorilor
- Design de pipeline-uri Medallion incrementale cu reguli de calitate și validarea schema
- Integrare cu Git (GitHub/Azure DevOps), CI și strategii de testing pentru logica PySpark
Laborator Ziua 5 — Construirea unui pipeline complet end-to-end
- Asamblarea pipeline-ului Bronze→Silver→Gold orchestrat cu Workflows
- Implementarea logării, auditării, retry-urilor și validărilor automate
- Rulare pipeline complet, validarea output-urilor și pregătirea notelor de deployment
Operaționalizare, governance și pregătire pentru producție
- Best practices pentru governance Unity Catalog, liniaj și controlul accesului
- Costuri, dimensiunea cluster-ului, autoscaling și pattern-uri de concurență a job-urilor
- Checklist-uri de deployment, strategii de rollback și crearea runbook-ului
Revizuire finală, transfer de cunoștințe și pași următori
- Prezentări ale participanților privind munca de migrare și lecțiile învățate
- Analiza golurilor, activități recomandate de urmat și preluarea materialelor de training
- Referințe, căi de învățare ulterioare și opțiuni de suport
Cerințe
- Înțelegerea conceptelor de data engineering
- Experiență cu SQL și proceduri stocate (Synapse / SQL Server)
- Familiaritate cu conceptele de orchestrare ETL (ADF sau similar)
Publicul țintă
- Manageri de tehnologie cu background în data engineering
- Data engineers care migrează logica procedurală OLAP către pattern-uri Lakehouse
- Engineeri de platformă responsabili de adoptarea Databricks
35 Ore