Preprocesamiento de datos mediante herramientas de Big Data
Descripción del Articulo
El preprocesamiento de datos en entornos de Big Data es una etapa crucial para garantizar la calidad y la utilidad de los datos antes de que sean utilizados en análisis o aplicaciones. En este proceso existen desafíos por resolver, como, por ejemplo, campos sin formato, fechas con diferentes formato...
| Autor: | |
|---|---|
| Formato: | tesis de grado |
| Fecha de Publicación: | 2023 |
| Institución: | Universidad Nacional de San Antonio Abad del Cusco |
| Repositorio: | UNSAAC-Institucional |
| Lenguaje: | español |
| OAI Identifier: | oai:repositorio.unsaac.edu.pe:20.500.12918/7930 |
| Enlace del recurso: | http://hdl.handle.net/20.500.12918/7930 |
| Nivel de acceso: | acceso abierto |
| Materia: | Big Data Apache spark Preprocesamiento Aprendizaje automático http://purl.org/pe-repo/ocde/ford#2.02.04 |
| id |
RUNS_fb2c10e0861ec08a228489512d01efde |
|---|---|
| oai_identifier_str |
oai:repositorio.unsaac.edu.pe:20.500.12918/7930 |
| network_acronym_str |
RUNS |
| network_name_str |
UNSAAC-Institucional |
| repository_id_str |
4815 |
| spelling |
Ormeño Ayala, Yeshica IselaLoayza Blanco, Cady Indira2023-11-20T20:59:36Z2023-11-20T20:59:36Z2023253T20230503http://hdl.handle.net/20.500.12918/7930El preprocesamiento de datos en entornos de Big Data es una etapa crucial para garantizar la calidad y la utilidad de los datos antes de que sean utilizados en análisis o aplicaciones. En este proceso existen desafíos por resolver, como, por ejemplo, campos sin formato, fechas con diferentes formatos, valores nulos, ruido, identificación de características relevantes. Superar estos problemas es fundamental para aprovechar al máximo el potencial de los datos y lograr análisis precisos y significativos. El objetivo principal de este trabajo es obtener conjuntos de datos limpios, libre de ruido que puedan considerarse correctos y útiles para el procesamiento de datos. Dado un dataset y eligiendo una herramienta como Apache Spark para el preprocesamiento de Big Data en un caso de uso, mediante los algoritmos existentes en esta librería se procede a limpiar, transformar, seleccionar características, manejo de valores atípicos, manejo de valores faltantes, normalización y estandarización, conversión de tipos de datos, reducción de ruido, muestreo de datos, para finalmente obtener como resultado datos preprocesados. También fueron aplicadas pruebas unitarias e integrales para cuantificar la calidad de datos de forma automática, preprocesando los datos en cada etapa. Se realizó casos de uso con datasets; COVID-19, sismos y diabetes, para demostrar la generación de datos de limpios mediante técnicas de preprocesamiento específicamente en Apache Spark. Como resultado ilustramos tareas de análisis y visualización.CONCYTECapplication/pdfspaUniversidad Nacional de San Antonio Abad del CuscoPEinfo:eu-repo/semantics/openAccesshttp://creativecommons.org/licenses/by-nc-nd/4.0/Big DataApache sparkPreprocesamientoAprendizaje automáticohttp://purl.org/pe-repo/ocde/ford#2.02.04Preprocesamiento de datos mediante herramientas de Big Datainfo:eu-repo/semantics/bachelorThesisreponame:UNSAAC-Institucionalinstname:Universidad Nacional de San Antonio Abad del Cuscoinstacron:UNSAACSUNEDUIngeniero Informático y de SistemasUniversidad Nacional de San Antonio Abad del Cusco. Facultad de Ingeniería Eléctrica, Electrónica, Informática y MecánicaIngeniería Informática y de Sistemas43120865https://orcid.org/0000-0002-5497-692825002834http://purl.org/pe-repo/renati/type#tesishttp://purl.org/pe-repo/renati/nivel#tituloProfesional612296Carbajal Luna, Julio CesarBaca Cardenas, Lino AquilesMedrano Valencia, Ivan CesarPalma Ttito, Luis BeltranORIGINAL253T20230503_TC.pdfapplication/pdf2482438http://repositorio.unsaac.edu.pe/bitstream/20.500.12918/7930/1/253T20230503_TC.pdf9c1c8a208841dc637b45340393588019MD5120.500.12918/7930oai:repositorio.unsaac.edu.pe:20.500.12918/79302023-11-20 16:14:54.081DSpace de la UNSAACsoporte.repositorio@unsaac.edu.pe |
| dc.title.es_PE.fl_str_mv |
Preprocesamiento de datos mediante herramientas de Big Data |
| title |
Preprocesamiento de datos mediante herramientas de Big Data |
| spellingShingle |
Preprocesamiento de datos mediante herramientas de Big Data Loayza Blanco, Cady Indira Big Data Apache spark Preprocesamiento Aprendizaje automático http://purl.org/pe-repo/ocde/ford#2.02.04 |
| title_short |
Preprocesamiento de datos mediante herramientas de Big Data |
| title_full |
Preprocesamiento de datos mediante herramientas de Big Data |
| title_fullStr |
Preprocesamiento de datos mediante herramientas de Big Data |
| title_full_unstemmed |
Preprocesamiento de datos mediante herramientas de Big Data |
| title_sort |
Preprocesamiento de datos mediante herramientas de Big Data |
| author |
Loayza Blanco, Cady Indira |
| author_facet |
Loayza Blanco, Cady Indira |
| author_role |
author |
| dc.contributor.advisor.fl_str_mv |
Ormeño Ayala, Yeshica Isela |
| dc.contributor.author.fl_str_mv |
Loayza Blanco, Cady Indira |
| dc.subject.es_PE.fl_str_mv |
Big Data Apache spark Preprocesamiento Aprendizaje automático |
| topic |
Big Data Apache spark Preprocesamiento Aprendizaje automático http://purl.org/pe-repo/ocde/ford#2.02.04 |
| dc.subject.ocde.none.fl_str_mv |
http://purl.org/pe-repo/ocde/ford#2.02.04 |
| description |
El preprocesamiento de datos en entornos de Big Data es una etapa crucial para garantizar la calidad y la utilidad de los datos antes de que sean utilizados en análisis o aplicaciones. En este proceso existen desafíos por resolver, como, por ejemplo, campos sin formato, fechas con diferentes formatos, valores nulos, ruido, identificación de características relevantes. Superar estos problemas es fundamental para aprovechar al máximo el potencial de los datos y lograr análisis precisos y significativos. El objetivo principal de este trabajo es obtener conjuntos de datos limpios, libre de ruido que puedan considerarse correctos y útiles para el procesamiento de datos. Dado un dataset y eligiendo una herramienta como Apache Spark para el preprocesamiento de Big Data en un caso de uso, mediante los algoritmos existentes en esta librería se procede a limpiar, transformar, seleccionar características, manejo de valores atípicos, manejo de valores faltantes, normalización y estandarización, conversión de tipos de datos, reducción de ruido, muestreo de datos, para finalmente obtener como resultado datos preprocesados. También fueron aplicadas pruebas unitarias e integrales para cuantificar la calidad de datos de forma automática, preprocesando los datos en cada etapa. Se realizó casos de uso con datasets; COVID-19, sismos y diabetes, para demostrar la generación de datos de limpios mediante técnicas de preprocesamiento específicamente en Apache Spark. Como resultado ilustramos tareas de análisis y visualización. |
| publishDate |
2023 |
| dc.date.accessioned.none.fl_str_mv |
2023-11-20T20:59:36Z |
| dc.date.available.none.fl_str_mv |
2023-11-20T20:59:36Z |
| dc.date.issued.fl_str_mv |
2023 |
| dc.type.none.fl_str_mv |
info:eu-repo/semantics/bachelorThesis |
| format |
bachelorThesis |
| dc.identifier.other.none.fl_str_mv |
253T20230503 |
| dc.identifier.uri.none.fl_str_mv |
http://hdl.handle.net/20.500.12918/7930 |
| identifier_str_mv |
253T20230503 |
| url |
http://hdl.handle.net/20.500.12918/7930 |
| dc.language.iso.es_PE.fl_str_mv |
spa |
| language |
spa |
| dc.relation.ispartof.fl_str_mv |
SUNEDU |
| dc.rights.en_US.fl_str_mv |
info:eu-repo/semantics/openAccess |
| dc.rights.uri.*.fl_str_mv |
http://creativecommons.org/licenses/by-nc-nd/4.0/ |
| eu_rights_str_mv |
openAccess |
| rights_invalid_str_mv |
http://creativecommons.org/licenses/by-nc-nd/4.0/ |
| dc.format.en_US.fl_str_mv |
application/pdf |
| dc.publisher.es_PE.fl_str_mv |
Universidad Nacional de San Antonio Abad del Cusco |
| dc.publisher.country.none.fl_str_mv |
PE |
| dc.source.none.fl_str_mv |
reponame:UNSAAC-Institucional instname:Universidad Nacional de San Antonio Abad del Cusco instacron:UNSAAC |
| instname_str |
Universidad Nacional de San Antonio Abad del Cusco |
| instacron_str |
UNSAAC |
| institution |
UNSAAC |
| reponame_str |
UNSAAC-Institucional |
| collection |
UNSAAC-Institucional |
| bitstream.url.fl_str_mv |
http://repositorio.unsaac.edu.pe/bitstream/20.500.12918/7930/1/253T20230503_TC.pdf |
| bitstream.checksum.fl_str_mv |
9c1c8a208841dc637b45340393588019 |
| bitstream.checksumAlgorithm.fl_str_mv |
MD5 |
| repository.name.fl_str_mv |
DSpace de la UNSAAC |
| repository.mail.fl_str_mv |
soporte.repositorio@unsaac.edu.pe |
| _version_ |
1868449026211315712 |
| score |
13.411838 |
Nota importante:
La información contenida en este registro es de entera responsabilidad de la institución que gestiona el repositorio institucional donde esta contenido este documento o set de datos. El CONCYTEC no se hace responsable por los contenidos (publicaciones y/o datos) accesibles a través del Repositorio Nacional Digital de Ciencia, Tecnología e Innovación de Acceso Abierto (ALICIA).
La información contenida en este registro es de entera responsabilidad de la institución que gestiona el repositorio institucional donde esta contenido este documento o set de datos. El CONCYTEC no se hace responsable por los contenidos (publicaciones y/o datos) accesibles a través del Repositorio Nacional Digital de Ciencia, Tecnología e Innovación de Acceso Abierto (ALICIA).