Preprocesamiento de datos mediante herramientas de Big Data

Descripción del Articulo

El preprocesamiento de datos en entornos de Big Data es una etapa crucial para garantizar la calidad y la utilidad de los datos antes de que sean utilizados en análisis o aplicaciones. En este proceso existen desafíos por resolver, como, por ejemplo, campos sin formato, fechas con diferentes formato...

Descripción completa

Detalles Bibliográficos
Autor: Loayza Blanco, Cady Indira
Formato: tesis de grado
Fecha de Publicación:2023
Institución:Universidad Nacional de San Antonio Abad del Cusco
Repositorio:UNSAAC-Institucional
Lenguaje:español
OAI Identifier:oai:repositorio.unsaac.edu.pe:20.500.12918/7930
Enlace del recurso:http://hdl.handle.net/20.500.12918/7930
Nivel de acceso:acceso abierto
Materia:Big Data
Apache spark
Preprocesamiento
Aprendizaje automático
http://purl.org/pe-repo/ocde/ford#2.02.04
id RUNS_fb2c10e0861ec08a228489512d01efde
oai_identifier_str oai:repositorio.unsaac.edu.pe:20.500.12918/7930
network_acronym_str RUNS
network_name_str UNSAAC-Institucional
repository_id_str 4815
spelling Ormeño Ayala, Yeshica IselaLoayza Blanco, Cady Indira2023-11-20T20:59:36Z2023-11-20T20:59:36Z2023253T20230503http://hdl.handle.net/20.500.12918/7930El preprocesamiento de datos en entornos de Big Data es una etapa crucial para garantizar la calidad y la utilidad de los datos antes de que sean utilizados en análisis o aplicaciones. En este proceso existen desafíos por resolver, como, por ejemplo, campos sin formato, fechas con diferentes formatos, valores nulos, ruido, identificación de características relevantes. Superar estos problemas es fundamental para aprovechar al máximo el potencial de los datos y lograr análisis precisos y significativos. El objetivo principal de este trabajo es obtener conjuntos de datos limpios, libre de ruido que puedan considerarse correctos y útiles para el procesamiento de datos. Dado un dataset y eligiendo una herramienta como Apache Spark para el preprocesamiento de Big Data en un caso de uso, mediante los algoritmos existentes en esta librería se procede a limpiar, transformar, seleccionar características, manejo de valores atípicos, manejo de valores faltantes, normalización y estandarización, conversión de tipos de datos, reducción de ruido, muestreo de datos, para finalmente obtener como resultado datos preprocesados. También fueron aplicadas pruebas unitarias e integrales para cuantificar la calidad de datos de forma automática, preprocesando los datos en cada etapa. Se realizó casos de uso con datasets; COVID-19, sismos y diabetes, para demostrar la generación de datos de limpios mediante técnicas de preprocesamiento específicamente en Apache Spark. Como resultado ilustramos tareas de análisis y visualización.CONCYTECapplication/pdfspaUniversidad Nacional de San Antonio Abad del CuscoPEinfo:eu-repo/semantics/openAccesshttp://creativecommons.org/licenses/by-nc-nd/4.0/Big DataApache sparkPreprocesamientoAprendizaje automáticohttp://purl.org/pe-repo/ocde/ford#2.02.04Preprocesamiento de datos mediante herramientas de Big Datainfo:eu-repo/semantics/bachelorThesisreponame:UNSAAC-Institucionalinstname:Universidad Nacional de San Antonio Abad del Cuscoinstacron:UNSAACSUNEDUIngeniero Informático y de SistemasUniversidad Nacional de San Antonio Abad del Cusco. Facultad de Ingeniería Eléctrica, Electrónica, Informática y MecánicaIngeniería Informática y de Sistemas43120865https://orcid.org/0000-0002-5497-692825002834http://purl.org/pe-repo/renati/type#tesishttp://purl.org/pe-repo/renati/nivel#tituloProfesional612296Carbajal Luna, Julio CesarBaca Cardenas, Lino AquilesMedrano Valencia, Ivan CesarPalma Ttito, Luis BeltranORIGINAL253T20230503_TC.pdfapplication/pdf2482438http://repositorio.unsaac.edu.pe/bitstream/20.500.12918/7930/1/253T20230503_TC.pdf9c1c8a208841dc637b45340393588019MD5120.500.12918/7930oai:repositorio.unsaac.edu.pe:20.500.12918/79302023-11-20 16:14:54.081DSpace de la UNSAACsoporte.repositorio@unsaac.edu.pe
dc.title.es_PE.fl_str_mv Preprocesamiento de datos mediante herramientas de Big Data
title Preprocesamiento de datos mediante herramientas de Big Data
spellingShingle Preprocesamiento de datos mediante herramientas de Big Data
Loayza Blanco, Cady Indira
Big Data
Apache spark
Preprocesamiento
Aprendizaje automático
http://purl.org/pe-repo/ocde/ford#2.02.04
title_short Preprocesamiento de datos mediante herramientas de Big Data
title_full Preprocesamiento de datos mediante herramientas de Big Data
title_fullStr Preprocesamiento de datos mediante herramientas de Big Data
title_full_unstemmed Preprocesamiento de datos mediante herramientas de Big Data
title_sort Preprocesamiento de datos mediante herramientas de Big Data
author Loayza Blanco, Cady Indira
author_facet Loayza Blanco, Cady Indira
author_role author
dc.contributor.advisor.fl_str_mv Ormeño Ayala, Yeshica Isela
dc.contributor.author.fl_str_mv Loayza Blanco, Cady Indira
dc.subject.es_PE.fl_str_mv Big Data
Apache spark
Preprocesamiento
Aprendizaje automático
topic Big Data
Apache spark
Preprocesamiento
Aprendizaje automático
http://purl.org/pe-repo/ocde/ford#2.02.04
dc.subject.ocde.none.fl_str_mv http://purl.org/pe-repo/ocde/ford#2.02.04
description El preprocesamiento de datos en entornos de Big Data es una etapa crucial para garantizar la calidad y la utilidad de los datos antes de que sean utilizados en análisis o aplicaciones. En este proceso existen desafíos por resolver, como, por ejemplo, campos sin formato, fechas con diferentes formatos, valores nulos, ruido, identificación de características relevantes. Superar estos problemas es fundamental para aprovechar al máximo el potencial de los datos y lograr análisis precisos y significativos. El objetivo principal de este trabajo es obtener conjuntos de datos limpios, libre de ruido que puedan considerarse correctos y útiles para el procesamiento de datos. Dado un dataset y eligiendo una herramienta como Apache Spark para el preprocesamiento de Big Data en un caso de uso, mediante los algoritmos existentes en esta librería se procede a limpiar, transformar, seleccionar características, manejo de valores atípicos, manejo de valores faltantes, normalización y estandarización, conversión de tipos de datos, reducción de ruido, muestreo de datos, para finalmente obtener como resultado datos preprocesados. También fueron aplicadas pruebas unitarias e integrales para cuantificar la calidad de datos de forma automática, preprocesando los datos en cada etapa. Se realizó casos de uso con datasets; COVID-19, sismos y diabetes, para demostrar la generación de datos de limpios mediante técnicas de preprocesamiento específicamente en Apache Spark. Como resultado ilustramos tareas de análisis y visualización.
publishDate 2023
dc.date.accessioned.none.fl_str_mv 2023-11-20T20:59:36Z
dc.date.available.none.fl_str_mv 2023-11-20T20:59:36Z
dc.date.issued.fl_str_mv 2023
dc.type.none.fl_str_mv info:eu-repo/semantics/bachelorThesis
format bachelorThesis
dc.identifier.other.none.fl_str_mv 253T20230503
dc.identifier.uri.none.fl_str_mv http://hdl.handle.net/20.500.12918/7930
identifier_str_mv 253T20230503
url http://hdl.handle.net/20.500.12918/7930
dc.language.iso.es_PE.fl_str_mv spa
language spa
dc.relation.ispartof.fl_str_mv SUNEDU
dc.rights.en_US.fl_str_mv info:eu-repo/semantics/openAccess
dc.rights.uri.*.fl_str_mv http://creativecommons.org/licenses/by-nc-nd/4.0/
eu_rights_str_mv openAccess
rights_invalid_str_mv http://creativecommons.org/licenses/by-nc-nd/4.0/
dc.format.en_US.fl_str_mv application/pdf
dc.publisher.es_PE.fl_str_mv Universidad Nacional de San Antonio Abad del Cusco
dc.publisher.country.none.fl_str_mv PE
dc.source.none.fl_str_mv reponame:UNSAAC-Institucional
instname:Universidad Nacional de San Antonio Abad del Cusco
instacron:UNSAAC
instname_str Universidad Nacional de San Antonio Abad del Cusco
instacron_str UNSAAC
institution UNSAAC
reponame_str UNSAAC-Institucional
collection UNSAAC-Institucional
bitstream.url.fl_str_mv http://repositorio.unsaac.edu.pe/bitstream/20.500.12918/7930/1/253T20230503_TC.pdf
bitstream.checksum.fl_str_mv 9c1c8a208841dc637b45340393588019
bitstream.checksumAlgorithm.fl_str_mv MD5
repository.name.fl_str_mv DSpace de la UNSAAC
repository.mail.fl_str_mv soporte.repositorio@unsaac.edu.pe
_version_ 1868449026211315712
score 13.411838
Nota importante:
La información contenida en este registro es de entera responsabilidad de la institución que gestiona el repositorio institucional donde esta contenido este documento o set de datos. El CONCYTEC no se hace responsable por los contenidos (publicaciones y/o datos) accesibles a través del Repositorio Nacional Digital de Ciencia, Tecnología e Innovación de Acceso Abierto (ALICIA).