Algoritmo TF-IDF y PageRank para la generación automática de resumen de textos en español

Descripción del Articulo

Esta investigación abordo´ el resumen automático de texto extractivo para artículos de noticias en español. Ante el crecimiento exponencial de usuarios de Internet, la sobre- carga de información en línea y la migración del aprendizaje y el acceso al conocimiento desde los libros hacia la nube, surg...

Descripción completa

Detalles Bibliográficos
Autor: Yauri Orihuela, Irwin Lizandro
Formato: tesis de maestría
Fecha de Publicación:2026
Institución:Universidad Nacional de San Agustín
Repositorio:UNSA-Institucional
Lenguaje:español
OAI Identifier:oai:repositorio.unsa.edu.pe:20.500.12773/22438
Enlace del recurso:https://hdl.handle.net/20.500.12773/22438
Nivel de acceso:acceso abierto
Materia:TF-IDF
Pagerank
Resumen automático
NLP
https://purl.org/pe-repo/ocde/ford#1.02.01
id UNSA_44eb9153d7bd0a18a744d9989d74613e
oai_identifier_str oai:repositorio.unsa.edu.pe:20.500.12773/22438
network_acronym_str UNSA
network_name_str UNSA-Institucional
repository_id_str 4847
spelling Hinojosa Cardenas, EdwardYauri Orihuela, Irwin Lizandro2026-04-21T17:09:52Z2026-04-21T17:09:52Z2026Esta investigación abordo´ el resumen automático de texto extractivo para artículos de noticias en español. Ante el crecimiento exponencial de usuarios de Internet, la sobre- carga de información en línea y la migración del aprendizaje y el acceso al conocimiento desde los libros hacia la nube, surgió la necesidad de desarrollar herramientas automatizadas que procesen estos volúmenes de datos, condensando y resaltando los fragmentos más importantes para facilitar su acceso y comprensión. El problema principal fue la dificultad de procesar y resumir textos específicamente en español, dado que la mayoría de las investigaciones y herramientas existentes se orientan al idioma inglés. Para enfrentar este desafío, se propuso una combinación de dos algoritmos: TF-IDF y PageRank. Se construyo´ una base de datos con artículos de noticias extraídos del dataset ML SUM, se recopilaron resúmenes elaborados por personas mediante una aplicación web diseñada para este fin y, finalmente, se evalúo la calidad de los resúmenes generados por los algoritmos en comparación con los realizados por humanos. La investigación se limitó a la generación de resúmenes extractivos (selección de fragmentos del texto original) para textos en español. La elección de este idioma se debe a su importancia y a la relativa escasez de recursos en el ámbito del Procesamiento del Lenguaje Natural (PLN). Con este trabajo se pretende contribuir al campo del PLN, ofreciendo una solución automatizada que facilite el acceso y el tratamiento eficiente de textos en español.application/pdfhttps://hdl.handle.net/20.500.12773/22438spaUniversidad Nacional de San Agustín de ArequipaPEinfo:eu-repo/semantics/openAccesshttp://creativecommons.org/licenses/by-nc-nd/4.0/Universidad Nacional de San Agustín de ArequipaRepositorio Institucional - UNSAreponame:UNSA-Institucionalinstname:Universidad Nacional de San Agustíninstacron:UNSATF-IDFPagerankResumen automáticoNLPhttps://purl.org/pe-repo/ocde/ford#1.02.01Algoritmo TF-IDF y PageRank para la generación automática de resumen de textos en españolinfo:eu-repo/semantics/masterThesisSUNEDU43185022https://orcid.org/0000-0003-0307-756746153858611017Maldonado Quispe, PercyHinojosa Cardenas, EdwardZevallos Quispe, Jesamin Melissahttps://purl.org/pe-repo/renati/level#maestrohttps://purl.org/pe-repo/renati/type#tesisMaestría en Ciencias de la ComputaciónUniversidad Nacional de San Agustín de Arequipa.Unidad de Posgrado.Facultad de Ingeniería de Producción y ServiciosMaestro en Ciencias de la ComputaciónORIGINALTesis.pdfapplication/pdf4007237https://repositorio.unsa.edu.pe/bitstreams/87ac59e8-85cd-4137-a074-2f0145acd496/download036fbd9db776fdee0a187b7cebdccc45MD51Reporte de Similitud.pdfapplication/pdf4863821https://repositorio.unsa.edu.pe/bitstreams/1016cab5-d2a6-4def-aaa4-5d2de8082cdd/download4674988568fea47b019c3add5980e778MD52Autorización de Publicación Digital.pdfapplication/pdf940893https://repositorio.unsa.edu.pe/bitstreams/3a2c887f-e3d1-4ba8-acae-0d9c3a6921b0/download5561f9322fcf5131c66fb84175840ad0MD5320.500.12773/22438oai:repositorio.unsa.edu.pe:20.500.12773/224382026-04-21 12:10:11.719http://creativecommons.org/licenses/by-nc-nd/4.0/info:eu-repo/semantics/openAccesshttps://repositorio.unsa.edu.peRepositorio Institucional UNSAvridi.gestioninformacion@unsa.edu.pe
dc.title.es.fl_str_mv Algoritmo TF-IDF y PageRank para la generación automática de resumen de textos en español
title Algoritmo TF-IDF y PageRank para la generación automática de resumen de textos en español
spellingShingle Algoritmo TF-IDF y PageRank para la generación automática de resumen de textos en español
Yauri Orihuela, Irwin Lizandro
TF-IDF
Pagerank
Resumen automático
NLP
https://purl.org/pe-repo/ocde/ford#1.02.01
title_short Algoritmo TF-IDF y PageRank para la generación automática de resumen de textos en español
title_full Algoritmo TF-IDF y PageRank para la generación automática de resumen de textos en español
title_fullStr Algoritmo TF-IDF y PageRank para la generación automática de resumen de textos en español
title_full_unstemmed Algoritmo TF-IDF y PageRank para la generación automática de resumen de textos en español
title_sort Algoritmo TF-IDF y PageRank para la generación automática de resumen de textos en español
author Yauri Orihuela, Irwin Lizandro
author_facet Yauri Orihuela, Irwin Lizandro
author_role author
dc.contributor.advisor.fl_str_mv Hinojosa Cardenas, Edward
dc.contributor.author.fl_str_mv Yauri Orihuela, Irwin Lizandro
dc.subject.es.fl_str_mv TF-IDF
Pagerank
Resumen automático
NLP
topic TF-IDF
Pagerank
Resumen automático
NLP
https://purl.org/pe-repo/ocde/ford#1.02.01
dc.subject.ocde.none.fl_str_mv https://purl.org/pe-repo/ocde/ford#1.02.01
description Esta investigación abordo´ el resumen automático de texto extractivo para artículos de noticias en español. Ante el crecimiento exponencial de usuarios de Internet, la sobre- carga de información en línea y la migración del aprendizaje y el acceso al conocimiento desde los libros hacia la nube, surgió la necesidad de desarrollar herramientas automatizadas que procesen estos volúmenes de datos, condensando y resaltando los fragmentos más importantes para facilitar su acceso y comprensión. El problema principal fue la dificultad de procesar y resumir textos específicamente en español, dado que la mayoría de las investigaciones y herramientas existentes se orientan al idioma inglés. Para enfrentar este desafío, se propuso una combinación de dos algoritmos: TF-IDF y PageRank. Se construyo´ una base de datos con artículos de noticias extraídos del dataset ML SUM, se recopilaron resúmenes elaborados por personas mediante una aplicación web diseñada para este fin y, finalmente, se evalúo la calidad de los resúmenes generados por los algoritmos en comparación con los realizados por humanos. La investigación se limitó a la generación de resúmenes extractivos (selección de fragmentos del texto original) para textos en español. La elección de este idioma se debe a su importancia y a la relativa escasez de recursos en el ámbito del Procesamiento del Lenguaje Natural (PLN). Con este trabajo se pretende contribuir al campo del PLN, ofreciendo una solución automatizada que facilite el acceso y el tratamiento eficiente de textos en español.
publishDate 2026
dc.date.accessioned.none.fl_str_mv 2026-04-21T17:09:52Z
dc.date.available.none.fl_str_mv 2026-04-21T17:09:52Z
dc.date.issued.fl_str_mv 2026
dc.type.none.fl_str_mv info:eu-repo/semantics/masterThesis
format masterThesis
dc.identifier.uri.none.fl_str_mv https://hdl.handle.net/20.500.12773/22438
url https://hdl.handle.net/20.500.12773/22438
dc.language.iso.none.fl_str_mv spa
language spa
dc.relation.ispartof.fl_str_mv SUNEDU
dc.rights.none.fl_str_mv info:eu-repo/semantics/openAccess
dc.rights.uri.none.fl_str_mv http://creativecommons.org/licenses/by-nc-nd/4.0/
eu_rights_str_mv openAccess
rights_invalid_str_mv http://creativecommons.org/licenses/by-nc-nd/4.0/
dc.format.none.fl_str_mv application/pdf
dc.publisher.es.fl_str_mv Universidad Nacional de San Agustín de Arequipa
dc.publisher.country.none.fl_str_mv PE
dc.source.es.fl_str_mv Universidad Nacional de San Agustín de Arequipa
Repositorio Institucional - UNSA
dc.source.none.fl_str_mv reponame:UNSA-Institucional
instname:Universidad Nacional de San Agustín
instacron:UNSA
instname_str Universidad Nacional de San Agustín
instacron_str UNSA
institution UNSA
reponame_str UNSA-Institucional
collection UNSA-Institucional
bitstream.url.fl_str_mv https://repositorio.unsa.edu.pe/bitstreams/87ac59e8-85cd-4137-a074-2f0145acd496/download
https://repositorio.unsa.edu.pe/bitstreams/1016cab5-d2a6-4def-aaa4-5d2de8082cdd/download
https://repositorio.unsa.edu.pe/bitstreams/3a2c887f-e3d1-4ba8-acae-0d9c3a6921b0/download
bitstream.checksum.fl_str_mv 036fbd9db776fdee0a187b7cebdccc45
4674988568fea47b019c3add5980e778
5561f9322fcf5131c66fb84175840ad0
bitstream.checksumAlgorithm.fl_str_mv MD5
MD5
MD5
repository.name.fl_str_mv Repositorio Institucional UNSA
repository.mail.fl_str_mv vridi.gestioninformacion@unsa.edu.pe
_version_ 1864911311450669056
score 13.922664
Nota importante:
La información contenida en este registro es de entera responsabilidad de la institución que gestiona el repositorio institucional donde esta contenido este documento o set de datos. El CONCYTEC no se hace responsable por los contenidos (publicaciones y/o datos) accesibles a través del Repositorio Nacional Digital de Ciencia, Tecnología e Innovación de Acceso Abierto (ALICIA).