Intrati in legatura

Schița de curs

Introducere, obiective și strategie de migrare

  • Obiectivele cursului, alinierea profilului participanților și criteriile de succes
  • Aproacheri de migrare la nivel general și aspecte legate de riscuri
  • Configurarea workspaces, a repository-urilor și a seturilor de date pentru laborator

Ziua 1 — Fundamentele migrării și arhitectura

  • Concepte Lakehouse, prezentare generală a Delta Lake și arhitectura Databricks
  • Diferențe între SMP și MPP și implicații pentru migrare
  • Design-ul Medallion (Bronze→Silver→Gold) și prezentare generală Unity Catalog

Laborator Ziua 1 — Traducerea unei proceduri stocate

  • Migrare hands-on a unei proceduri stocate exemplu într-un notebook
  • Maparea tabelelor temporare și a cursorilor către transformări DataFrame
  • Validare și compararea cu output-ul original

Ziua 2 — Delta Lake avansat & încărcare incrementală

  • Transacții ACID, jurnal de commit, versioning și time travel
  • Auto Loader, pattern-uri MERGE INTO, upserts și evoluția schema
  • OPTIMIZE, VACUUM, Z-ORDER, partitioning și ajustarea storage-ului

Laborator Ziua 2 — Ingestie & optimizare incrementală

  • Implementarea ingestiei cu Auto Loader și workflow-urilor MERGE
  • Aplicarea OPTIMIZE, Z-ORDER și VACUUM; validarea rezultatelor
  • Măsurarea îmbunătățirilor de performanță la citire/scriere

Ziua 3 — SQL în Databricks, performanță & debugging

  • Funcționalități analitice SQL: funcții de fereastră, funcții de ordin superior, procesare JSON/array
  • Interpretarea Spark UI, DAG-uri, shuffles, stagi, task-uri și diagnosticarea gâurilor de stârc
  • Pattern-uri de ajustare a interogărilor: broadcast joins, hints, caching și reducerea spill-ului

Laborator Ziua 3 — Refactorizarea SQL & ajustare performanță

  • Refactorizarea unui proces SQL intens într-un Spark SQL optimizat
  • Folosirea traselor din Spark UI pentru a identifica și rezolva problemele de skew și shuffle
  • Benchmark înainte/după și documentarea pașilor de tuning

Ziua 4 — PySpark tactic: înlocuirea logicii procedurale

  • Modelul de execuție Spark: driver, executors, evaluare lentă și strategii de partitioning
  • Transformarea buclelor și cursorilor în operații vectorizate DataFrame
  • Modularizare, UDFs/pandas UDFs, widgets și biblioteci reutilizabile

Laborator Ziua 4 — Refactorizarea scripturilor procedurale

  • Refactorizarea unui script ETL procedural în notebook-uri PySpark modulare
  • Introducerea parametrizării, teste de tip unit și funcții reutilizabile
  • Recenzie de cod și aplicarea checklist-ului de bune practici

Ziua 5 — Orchestare, pipeline end-to-end & bune practici

  • Databricks Workflows: design job-uri, dependențe între task-uri, trigger-e și gestionarea erorilor
  • Design de pipeline-uri Medallion incrementale cu reguli de calitate și validarea schema
  • Integrare cu Git (GitHub/Azure DevOps), CI și strategii de testing pentru logica PySpark

Laborator Ziua 5 — Construirea unui pipeline complet end-to-end

  • Asamblarea pipeline-ului Bronze→Silver→Gold orchestrat cu Workflows
  • Implementarea logării, auditării, retry-urilor și validărilor automate
  • Rulare pipeline complet, validarea output-urilor și pregătirea notelor de deployment

Operaționalizare, governance și pregătire pentru producție

  • Best practices pentru governance Unity Catalog, liniaj și controlul accesului
  • Costuri, dimensiunea cluster-ului, autoscaling și pattern-uri de concurență a job-urilor
  • Checklist-uri de deployment, strategii de rollback și crearea runbook-ului

Revizuire finală, transfer de cunoștințe și pași următori

  • Prezentări ale participanților privind munca de migrare și lecțiile învățate
  • Analiza golurilor, activități recomandate de urmat și preluarea materialelor de training
  • Referințe, căi de învățare ulterioare și opțiuni de suport

Cerințe

  • Înțelegerea conceptelor de data engineering
  • Experiență cu SQL și proceduri stocate (Synapse / SQL Server)
  • Familiaritate cu conceptele de orchestrare ETL (ADF sau similar)

Publicul țintă

  • Manageri de tehnologie cu background în data engineering
  • Data engineers care migrează logica procedurală OLAP către pattern-uri Lakehouse
  • Engineeri de platformă responsabili de adoptarea Databricks
 35 Ore

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite