Logo do repositĂłrio
 
Publicação

Experimental evaluation of big data querying tools

dc.contributor.advisorBernardino, Jorge Fernandes Rodrigues
dc.contributor.authorRodrigues, MĂĄrio Miguel Lucas
dc.date.accessioned2018-12-13T16:28:27Z
dc.date.available2018-12-13T16:28:27Z
dc.date.issued2018-07-16
dc.date.submitted2017
dc.description.abstractNos Ășltimos anos, o termo Big Data tornou-se um tĂłpico bastanta debatido em vĂĄrias ĂĄreas de negĂłcio. Um dos principais desafios relacionados com este conceito Ă© como lidar com o enorme volume e variedade de dados de forma eficiente. Devido Ă  notĂłria complexidade e volume de dados associados ao conceito de Big Data, sĂŁo necessĂĄrios mecanismos de consulta eficientes para fins de anĂĄlise de dados. Motivado pelo rĂĄpido desenvolvimento de ferramentas e frameworks para Big Data, hĂĄ muita discussĂŁo sobre ferramentas de consulta e, mais especificamente, quais sĂŁo as mais apropriadas para necessidades analĂ­ticas especĂ­fica. Esta dissertação descreve e compara as principais caracterĂ­sticas e arquiteturas das seguintes conhecidas ferramentas analĂ­ticas para Big Data: Drill, HAWQ, Hive, Impala, Presto e Spark. Para testar o desempenho dessas ferramentas analĂ­ticas para Big Data, descrevemos tambĂ©m o processo de preparação, configuração e administração de um Cluster Hadoop para que possamos instalar e utilizar essas ferramentas, tendo um ambiente capaz de avaliar seu desempenho e identificar quais cenĂĄrios mais adequados Ă  sua utilização. Para realizar esta avaliação, utilizamos os benchmarks TPC-H e TPC-DS, onde os resultados mostraram que as ferramentas de processamento em memĂłria como HAWQ, Impala e Presto apresentam melhores resultados e desempenho em datasets de dimensĂŁo baixa e mĂ©dia. No entanto, as ferramentas que apresentaram tempos de execuçÔes mais lentas, especialmente o Hive, parecem apanhar as ferramentas de melhor desempenho quando aumentamos os datasets de referĂȘncia.pt_PT
dc.identifier.tid202242943
dc.identifier.urihttp://hdl.handle.net/10400.26/25338
dc.language.isoengpt_PT
dc.subjectBig Datapt_PT
dc.subjectHadooppt_PT
dc.subjectSQL-on-Hadooppt_PT
dc.subjectQuery processingpt_PT
dc.subjectBig data analyticspt_PT
dc.titleExperimental evaluation of big data querying toolspt_PT
dc.typemaster thesis
dspace.entity.typePublication
rcaap.rightsopenAccesspt_PT
rcaap.typemasterThesispt_PT

Ficheiros

Principais
A mostrar 1 - 1 de 1
A carregar...
Miniatura
Nome:
Mario-Miguel-Lucas-Rodrigues.pdf
Tamanho:
3.7 MB
Formato:
Adobe Portable Document Format
Licença
A mostrar 1 - 1 de 1
Miniatura indisponĂ­vel
Nome:
license.txt
Tamanho:
1.85 KB
Formato:
Item-specific license agreed upon to submission
Descrição: