Intrati in legatura

Schița de curs

Fundamentele NiFi și ale fluxului de date

  • Date în mișcare vs date în repaus: concepte și provocări
  • Arhitectura NiFi: nuclee, flow controller, provenance și bulletin
  • Componente cheie: procesoare, conexiuni, controllere și provenance

Contextul Big Data și integrarea

  • Rolul NiFi în ecosistemele Big Data (Hadoop, Kafka, cloud storage)
  • Prezentare generală a HDFS, MapReduce și alternative moderne
  • Cazuri de utilizare: ingestie de fluxuri, log shipping, pipeline-uri de evenimente

Instalare, configurare și configurarea clusterului

  • Instalarea NiFi pe un singur nod și în mod cluster
  • Configurarea clusterului: roluri de noduri, Zookeeper și load balancing
  • Orchestrarea implementărilor NiFi: folosind Ansible, Docker sau Helm

Proiectarea și gestionarea fluxurilor de date

  • Rutarea, filtrarea, divizarea și fuzionarea fluxurilor
  • Configurarea procesoarelor (InvokeHTTP, QueryRecord, PutDatabaseRecord etc.)
  • Gestionarea operațiunilor de schemă, îmbogățire și transformare
  • Gestionarea erorilor, relațiile de reîncercare și backpressure

Scenarii de integrare

  • Conectarea la baze de date, sisteme de mesagerie, API-uri REST
  • Streaming către sisteme de analiză: Kafka, Elasticsearch sau cloud storage
  • Integrarea cu Splunk, Prometheus sau pipeline-uri de logging

Monitorizare, recuperare și provenance

  • Utilizarea interfeței NiFi, a metricilor și a vizualizatorului de provenance
  • Proiectarea recuperării autonome și a gestionării elegante a eșecurilor
  • Backup, versionarea fluxurilor și managementul schimbărilor

Tuning de performanță și optimizare

  • Reglarea JVM, a heap-ului, a pool-urilor de thread-uri și a parametrilor de clustering
  • Optimizarea designului fluxurilor pentru a reduce blocajele
  • Izolarea resurselor, prioritizarea fluxurilor și controlul throughput-ului

Cele mai bune practici și guvernanță

  • Documentarea fluxurilor, standarde de denumire, design modular
  • Securitate: TLS, autentificare, controlul accesului, criptarea datelor
  • Controlul schimbărilor, versionare, acces bazat pe roluri, piste de audit

Depanare și răspuns la incidente

  • Probleme comune: deadlock-uri, memory leaks, erori ale procesoarelor
  • Analiza logurilor, diagnosticarea erorilor și investigarea cauzei principale
  • Strategii de recuperare și rollback al fluxurilor

Laborator practic: implementarea unui pipeline de date realist

  • Construirea unui flux end-to-end: ingestie, transformare, livrare
  • Implementarea gestionării erorilor, a backpressure-ului și a scalării
  • Testarea performanței și reglarea pipeline-ului

Rezumat și pașii următori

Cerințe

  • Experiență cu linia de comandă Linux
  • Înțelegere de bază a rețelelor și a sistemelor de date
  • Expunere la concepte de data streaming sau ETL

Public țintă

  • Administratori de sistem
  • Ingineri de date
  • Dezvoltatori
  • Profesioniști DevOps
 21 Ore

Numărul de participanți


Pret per participant

Mărturii (7)

Cursuri viitoare

Categorii înrudite