Logo do repositório
 
Publicação

Big data lakehouse architecture: practical case study of the Nexus project

dc.contributor.advisorMendes, Ana
dc.contributor.advisorCosta, Maria da Graça
dc.contributor.authorVieira, Klysman Rezende Alves
dc.date.accessioned2026-09-28T11:32:21Z
dc.date.available2026-09-28T11:32:21Z
dc.date.issued2026-04
dc.description.abstractThis master's thesis presents the design and implementation of a scalable Big Data Lakehouse architecture, using the Nexus project at the Port of Sines as a case study. The study begins with a literature review, tracing the evolution of data architecture and highlighting the advantages of the Lakehouse paradigm, which integrates the flexibility of data lakes with the governance of data warehouses. To validate this approach, initial experiments were conducted, confirming the potential of the proposed architecture and demonstrating the feasibility of using machine learning to predict vessel berthing times. The core of this work is the construction of a Lakehouse architecture using open-source technologies such as Apache Spark, Delta Lake, and MLflow, orchestrated on the Databricks platform. A data engineering workflow was developed to ingest and process real-world operational data from the Port of Sines' Open Data Platform. This process follows the Medallion architecture (Bronze, Silver, and Gold layers) to ensure data quality and prepare it for analytics and machine learning applications. All project code was systematically documented and maintained using a structured Gitflow to facilitate future evolution and reuse, following good software engineering practices. A thorough exploratory data analysis (EDA) revealed key insights into vessel operational patterns and the characteristics of the data. Based on this, a Random Forest Regression model was successfully implemented to predict the time vessels spend at berth. To ensure transparency, the model's predictions were interpreted using SHAP (SHapley Additive exPlanations), identifying the most influential variables, such as the reason for the call and travel duration. This thesis presents a comprehensive and replicable data solution, from data ingestion and processing to advanced analytics and machine learning, providing a framework for data-driven decision making in port management.eng
dc.description.abstractEsta dissertação de mestrado apresenta o desenho e a implementação de uma arquitetura Lakehouse de Big Data escalável, utilizando o projeto Nexus no Porto de Sines como estudo de caso. O trabalho inicia-se com uma revisão da literatura, traçando a evolução das arquiteturas de dados e destacando as vantagens do paradigma Lakehouse, que integra a flexibilidade dos data lakes (lagos de dados) com a governança dos data warehouses (armazéns de dados). Para validar esta abordagem, foram realizadas experiências iniciais que confirmaram o potencial da arquitetura proposta e demonstraram a viabilidade da utilização de aprendizagem automática (Machine Learning) para prever os tempos de atracação dos navios. O objetivo deste trabalho é a construção de uma arquitetura Lakehouse com recurso a tecnologias de código aberto (open-source) como Apache Spark, Delta Lake e MLflow, orquestrada na plataforma Databricks. Foi desenvolvido um fluxo de trabalho de engenharia de dados para ingerir e processar dados operacionais reais da Plataforma de Dados Abertos do Porto de Sines. Este processo segue a arquitetura Medallion (camadas Bronze, Prata e Ouro) para garantir a qualidade dos dados e prepará-los para aplicações de análise e de Machine Learning. Todo o código do projeto foi sistematicamente documentado e mantido utilizando um Gitflow estruturado para facilitar a sua evolução e reutilização futuras, seguindo as boas práticas de engenharia de software. Uma análise exploratória de dados (AED) aprofundada revelou informações chave sobre os padrões operacionais dos navios e as características dos dados. Com base nesta análise, foi implementado com sucesso um modelo de Regressão de Floresta Aleatória (Random Forest Regression) para prever o tempo de permanência dos navios atracados. Para garantir a transparência, as previsões do modelo foram interpretadas utilizando SHAP (SHapley Additive exPlanations), identificando as variáveis mais influentes, como o motivo da escala e a duração da viagem. Esta dissertação demonstra uma solução de dados completa e replicável, desde a ingestão e processamento de dados até à análise avançada e Machine Learning, fornecendo uma estrutura para a tomada de decisão baseada em dados na gestão portuária.por
dc.identifier.tid204326265
dc.identifier.urihttp://hdl.handle.net/10400.26/64728
dc.language.isoeng
dc.rights.urihttp://creativecommons.org/licenses/by/4.0/
dc.titleBig data lakehouse architecture: practical case study of the Nexus projecteng
dc.typemaster thesis
dspace.entity.typePublication
thesis.degree.grantorInstituto Politécnico de Setúbal
thesis.degree.nameMestrado em Ciência de Dados para Empresas

Ficheiros

Principais
A mostrar 1 - 1 de 1
Miniatura indisponível
Nome:
Dissertacao_Klysman_Vieira.pdf
Tamanho:
5.06 MB
Formato:
Adobe Portable Document Format
Licença
A mostrar 1 - 1 de 1
Miniatura indisponível
Nome:
license.txt
Tamanho:
1.85 KB
Formato:
Item-specific license agreed upon to submission
Descrição: