Evaluación del Rendimiento y la Escalabilidad de un Clúster Apache Spark y Hadoop en un Entorno de Bajo Costo

Descripción del Articulo

Este artículo presenta el diseño, configuración e implementación de un clúster de cómputo distribuido utilizando Apache Spark y Hadoop sobre Ubuntu Server 24.04.1 LTS. La arquitectura consta de un nodo maestro y múltiples nodos esclavos conectados en red local mediante Ethernet. Se detalla el proces...

Descripción completa

Detalles Bibliográficos
Autores: Cruz Tumba, Natalie, Lancho Ramos, Alex, Leon Hurtado, Henry, Quispe Merma, Rafael Ricardo, Luque Ochoa, Evelyn Naida
Formato: artículo
Fecha de Publicación:2025
Institución:Universidad Nacional Micaela Bastidas de Apurímac
Repositorio:UNMB-Riqchary
Lenguaje:español
OAI Identifier:oai:revistas.unamba.edu.pe:article/218
Enlace del recurso:https://revistas.unamba.edu.pe/index.php/riqchary/article/view/218
Nivel de acceso:acceso abierto
Materia:Apache Spark
data processing
Hadoop
distributed cluster
distributed computing
low-cost cluster
apache spark
procesamiento de datos
hadoop
clúster distribuido
computación distribuida
clúster de bajo costo
Descripción
Sumario:Este artículo presenta el diseño, configuración e implementación de un clúster de cómputo distribuido utilizando Apache Spark y Hadoop sobre Ubuntu Server 24.04.1 LTS. La arquitectura consta de un nodo maestro y múltiples nodos esclavos conectados en red local mediante Ethernet. Se detalla el proceso de instalación, configuración y pruebas de rendimiento con PySpark. Los resultados demuestran que, si bien una configuración local es más eficiente para datasets pequeños (<100 MB), el clúster distribuido ofrece mejoras significativas para volúmenes de datos superiores a 1 GB, validando su escalabilidad y viabilidad para entornos educativos y de investigación con recursos limitados.
Nota importante:
La información contenida en este registro es de entera responsabilidad de la institución que gestiona el repositorio institucional donde esta contenido este documento o set de datos. El CONCYTEC no se hace responsable por los contenidos (publicaciones y/o datos) accesibles a través del Repositorio Nacional Digital de Ciencia, Tecnología e Innovación de Acceso Abierto (ALICIA).