Zum Hauptinhalt springen

Überblick

In OctoMesh sind Datenpipelines integraler Bestandteil der Extract-, Transform-, Load-Prozesse (ETL), die eine effiziente Datenverarbeitung über verteilte Umgebungen hinweg sicherstellen. Pipelines werden von Adaptern ausgeführt, die entweder am Edge (nahe an den Datenquellen) oder zentral in der Cloud bereitgestellt werden können.

Pipelines

Pipelines werden von Adaptern ausgeführt. Am Edge bereitgestellte Adapter verwalten die anfänglichen Phasen des Datenlebenszyklus, einschließlich Datenerfassung, Vorverarbeitung und vorläufiger Transformationen. Zentral in Cloud-Umgebungen bereitgestellte Adapter übernehmen umfangreiche Datentransformations-, Integrations- und Aggregationsaufgaben.

Wesentliche Merkmale von Pipelines:

  • Flexibles Deployment: Pipelines können je nach Anforderung auf Edge- oder Cloud-Adaptern laufen.
  • Geringe Latenz: Am Edge bereitgestellte Adapter gewährleisten eine schnelle Datenverarbeitung nahe an den Datenquellen.
  • Skalierbare Architektur: Zentral in der Cloud bereitgestellte Adapter sind in der Lage, erhöhte Datenflüsse und komplexe Verarbeitungsanforderungen zu bewältigen.
  • Fortgeschrittenes Datenmanagement: Stellt Datenkonsistenz sicher und ermöglicht umfassende Analysen.

Das folgende Diagramm zeigt die Ausführungsrollen von Adaptern im ETL-Prozess:

Jede Pipeline läuft unter einer Identität

Eine Pipeline ist nicht allmächtig. Jede läuft als klar definierte Identität – standardmäßig als das Service Account ihres Adapters oder, bei benutzerorientierten Abläufen, im Namen des aufrufenden Benutzers. Die Rollen dieser Identität entscheiden, welche Daten die Pipeline lesen und schreiben darf. Dies ändert nichts daran, wie Sie Pipelines erstellen; siehe Pipeline-Identität für Details.

DataFlow

Ein DataFlow ist eine logische Gruppierung verwandter Pipelines, die als Teil eines einzelnen Datenverarbeitungs-Workflows zusammenarbeiten. Im Construction-Kit-Modell dient die DataFlow-Entität (früher DataPipeline in Communication-2 genannt) als übergeordneter Container für eine oder mehrere Pipeline-Instanzen. Ein PipelineTrigger ist ein Kind eines DataFlow und löst die Pipeline-Ausführung nach einem Zeitplan (über Cron-Ausdrücke) aus.

DataFlows richten außerdem einen gemeinsamen Topic Exchange im Event Hub ein und ermöglichen so die Kommunikation zwischen Pipelines. Pipelines innerhalb desselben DataFlow können mithilfe der Nodes ToPipelineDataEvent und FromPipelineDataEvent Daten aneinander senden, wobei die Routing Keys auf der Runtime-Entitäts-ID der Ziel-Pipeline basieren.

Construction-Kit-Modell

Der Construction Kit der Modelldatenbank verwaltet die Daten von Adaptern und Pipelines, einschließlich Beschreibungen, Status und Beziehungen.