Publicação
Experimental evaluation of big data querying tools
| dc.contributor.advisor | Bernardino, Jorge Fernandes Rodrigues | |
| dc.contributor.author | Rodrigues, MĂĄrio Miguel Lucas | |
| dc.date.accessioned | 2018-12-13T16:28:27Z | |
| dc.date.available | 2018-12-13T16:28:27Z | |
| dc.date.issued | 2018-07-16 | |
| dc.date.submitted | 2017 | |
| dc.description.abstract | Nos Ășltimos anos, o termo Big Data tornou-se um tĂłpico bastanta debatido em vĂĄrias ĂĄreas de negĂłcio. Um dos principais desafios relacionados com este conceito Ă© como lidar com o enorme volume e variedade de dados de forma eficiente. Devido Ă notĂłria complexidade e volume de dados associados ao conceito de Big Data, sĂŁo necessĂĄrios mecanismos de consulta eficientes para fins de anĂĄlise de dados. Motivado pelo rĂĄpido desenvolvimento de ferramentas e frameworks para Big Data, hĂĄ muita discussĂŁo sobre ferramentas de consulta e, mais especificamente, quais sĂŁo as mais apropriadas para necessidades analĂticas especĂfica. Esta dissertação descreve e compara as principais caracterĂsticas e arquiteturas das seguintes conhecidas ferramentas analĂticas para Big Data: Drill, HAWQ, Hive, Impala, Presto e Spark. Para testar o desempenho dessas ferramentas analĂticas para Big Data, descrevemos tambĂ©m o processo de preparação, configuração e administração de um Cluster Hadoop para que possamos instalar e utilizar essas ferramentas, tendo um ambiente capaz de avaliar seu desempenho e identificar quais cenĂĄrios mais adequados Ă sua utilização. Para realizar esta avaliação, utilizamos os benchmarks TPC-H e TPC-DS, onde os resultados mostraram que as ferramentas de processamento em memĂłria como HAWQ, Impala e Presto apresentam melhores resultados e desempenho em datasets de dimensĂŁo baixa e mĂ©dia. No entanto, as ferramentas que apresentaram tempos de execuçÔes mais lentas, especialmente o Hive, parecem apanhar as ferramentas de melhor desempenho quando aumentamos os datasets de referĂȘncia. | pt_PT |
| dc.identifier.tid | 202242943 | |
| dc.identifier.uri | http://hdl.handle.net/10400.26/25338 | |
| dc.language.iso | eng | pt_PT |
| dc.subject | Big Data | pt_PT |
| dc.subject | Hadoop | pt_PT |
| dc.subject | SQL-on-Hadoop | pt_PT |
| dc.subject | Query processing | pt_PT |
| dc.subject | Big data analytics | pt_PT |
| dc.title | Experimental evaluation of big data querying tools | pt_PT |
| dc.type | master thesis | |
| dspace.entity.type | Publication | |
| rcaap.rights | openAccess | pt_PT |
| rcaap.type | masterThesis | pt_PT |
