A reference architecture of a data lakehouse platform for industrial systems

DSpace Repository

A- A A+

A reference architecture of a data lakehouse platform for industrial systems

Show full item record

Title: A reference architecture of a data lakehouse platform for industrial systems
Author: Kretzer, Arthur Raulino
Abstract: A transformação digital impulsionada pela Indústria 4.0 ampliou a demanda por arquiteturas de Big Data Analytics (BDA) capazes de processar grandes volumes de dados heterogêneos com baixa latência. Sensores de Internet das Coisas (IoT), sistemas de controle, robôs industriais e bases corporativas produzem fluxos contínuos de dados estruturados e não estruturados que exigem soluções escaláveis, interoperáveis e alinhadas às particularidades dos ambientes industriais. Apesar da evolução de tecnologias consolidadas, como Apache Kafka, Apache Spark e arquiteturas de Data Lakes, a literatura apresenta um cenário fragmentado, com carência de arquiteturas padronizadas, baixa maturidade em governança e monitoramento, e escassez de validações empíricas em cenários reais de manufatura. Diante desse problema, esta dissertação investiga como arquiteturas data lakehouse podem apoiar análises de dados industriais em quase tempo real. O trabalho conduz um mapeamento sistemático da literatura, seguindo o protocolo ProKnow-C, que analisou 56 estudos primários dedicados exclusivamente a arquiteturas de Big Data para manufatura, identificando padrões tecnológicos, lacunas e desafios persistentes, a subexploração de dados não estruturados e a ausência de benchmarks consistentes. Em seguida, seguindo o paradigma de Design Science Research, propõe, implementa e avalia uma arquitetura de referência e uma plataforma completa baseada em tecnologias abertas, incluindo Kafka, Spark Structured Streaming, Delta Lake, MinIO, Kubernetes e práticas de GitOps. A plataforma desenvolvida integra pipelines de ingestão, transformação e armazenamento para dados estruturados e telemetria de sensores robóticos em quase tempo real. A avaliação empírica compreende quatro experimentos controlados (Smoke, Stress, Breakpoint e Soak) conduzidos em ambientes edge (LABFABER, Brasil) e cloud (Digital Ocean, Nova York), utilizando o dataset RoAD de sensores robóticos. Os resultados demonstram que arquiteturas data lakehouse são tecnicamente viáveis para aplicações industriais, com latência mediana de ingestão de aproximadamente 3?11 ms no ambiente edge e 150?350 ms no ambiente cloud. A persistência via Spark apresentou latências na ordem de 2?8 segundos, adequadas para monitoramento e manutenção preditiva, porém insuficientes para controle em tempo real estrito.Abstract: This thesis investigates the design, implementation, and empirical evaluation of a data lakehouse architecture for Big Data Analytics in Industry 4.0 environments. The work addresses two complementary dimensions. First, a systematic mapping study following the ProKnow-C protocol analyzed 56 primary studies focused exclusively on Big Data architectures for manufacturing, identifying dominant technological patterns, architectural gaps, and persistent limitations in areas such as real-time processing, monitoring, governance, and empirical validation. Second, guided by the Design Science Research paradigm, the study proposes and develops an eight-layer reference architecture and a complete open-source platform based on Kafka, Spark Structured Streaming, Delta Lake, MinIO, Kubernetes, Airflow, and GitOps practices. The research follows a structured DSR process consisting of problem identification, requirement derivation, artifact design, implementation, and evaluation. The resulting platform integrates ingestion, transformation, and storage pipelines supporting structured industrial data and near-real-time robotic telemetry. Four controlled experiments (Smoke, Stress, Breakpoint, and Soak tests) were conducted across edge (LABFABER, Brazil) and cloud (Digital Ocean, New York) deployments using the RoAD robotic dataset from a KUKA LBR iiwa robot. The experiments quantify ingestion latency, persistence overhead, resource consumption, and long-term stability under sustained workloads of up to 15,000 messages per second. The results demonstrate that open-source data lakehouse architectures are viable for industrial analytics applications such as monitoring, anomaly detection, and predictive maintenance. Ingestion latencies remained below 11 ms (median) in edge deployments and between 150?350 ms in cloud deployments. Persistence latencies ranged from 2?8 seconds, dominated by Spark?s micro-batch interval. However, the findings also reveal that cloud deployments experience orchestration instability under memory pressure, while edge clusters degrade gracefully at capacity limits. The central hypothesis was partially confirmed: lakehouse architectures support bounded responsiveness compatible with Industry 4.0 supervisory applications, but remain insufficient for strict real-time control loops. The study concludes with a discussion of implications for industrial adoption and outlines future research opportunities related to hybrid edge?cloud deployments, digital twin integration, continuous streaming engines such as Apache Flink, and alignment with Industrial Data Spaces for federated industrial ecosystems.
Description: Dissertação (mestrado) - Universidade Federal de Santa Catarina, Centro Tecnológico, Programa de Pós-Graduação em Ciência da Computação, Florianópolis, 2026.
URI: https://repositorio.ufsc.br/handle/123456789/275182
Date: 2026


Files in this item

Files Size Format View
PGCC1336-D.pdf 36.36Mb PDF View/Open

This item appears in the following Collection(s)

Show full item record

Search DSpace


Browse

My Account

Statistics

Compartilhar