Publicación:
Desarrollo de modelos de procesamiento de lenguaje natural mediante técnicas de aprendizaje automático para el análisis de sentimientos en las PQRS de clientes industriales de Vanti S.A. ESP

dc.contributor.advisorCobo Campo, Luis Armando
dc.contributor.authorLozano Forero, Juan Sebastián
dc.creator.id1136883310
dc.date.accessioned2026-08-03T23:36:14Z
dc.date.issued2026-07-13
dc.description.abstractEl presente trabajo de grado aborda el análisis de sentimientos en las PQRS de clientes industriales de Vanti S.A. E.S.P., ante la necesidad de transformar información textual no estructurada en insumos útiles para la toma de decisiones. Como punto de partida, se identifica que la gestión de estas comunicaciones se realiza de forma manual, lo que dificulta su análisis oportuno y limita la generación de valor a partir de los datos. El objetivo del estudio fue desarrollar un modelo de procesamiento de lenguaje natural capaz de clasificar los textos en categorías de sentimiento (positivo, negativo y neutro). Para ello, se implementó una metodología cuantitativa que incluyó exploración de datos, limpieza y preprocesamiento, construcción de la variable objetivo mediante un enfoque híbrido (VADER, diccionarios y reglas heurísticas), vectorización TF-IDF y entrenamiento de modelos de machine learning. Los resultados evidenciaron que el modelo Linear SVM presentó el mejor desempeño, destacándose en métricas como F1-score macro y estabilidad en validación cruzada. En conclusión, el modelo desarrollado constituye una herramienta viable para la clasificación de PQRS, aportando valor en la identificación de casos críticos y en la generación de información estratégica para la organización.spa
dc.description.abstractThis undergraduate thesis addresses sentiment analysis in the complaints, claims, and requests (PQRS) of industrial clients of Vanti S.A. E.S.P., given the need to transform unstructured textual information into useful inputs for decision-making. As a starting point, it was identified that the management of these communications is carried out manually, which hinders timely analysis and limits the generation of value from the data. The objective of the study was to develop a natural language processing model capable of classifying texts into sentiment categories (positive, negative, and neutral). To this end, a quantitative methodology was implemented that included data exploration, cleaning and preprocessing, construction of the target variable using a hybrid approach (VADER, dictionaries, and heuristic rules), TF-IDF vectorization, and machine learning model training. The results showed that the Linear SVM model exhibited the best performance, standing out in metrics such as F1-score macro and stability in cross-validation. In conclusion, the developed model constitutes a viable tool for the classification of complaints, claims, and requests (PQRS), adding value in the identification of critical cases and in the generation of strategic information for the organization.eng
dc.description.degreelevelMaestríaspa
dc.description.degreenameMagíster en Ciencias de Datosspa
dc.description.tableofcontentsContenido Pág. Introducción 16 Objetivos 20 Objetivo general 20 Objetivos específicos 20 Justificación 21 Marco Institucional 27 Marco de Referencia 33 Análisis bibliométrico 33 Fundamentación teórica 38 Métricas de evaluación de modelos 44 Diseño Metodológico 46 Población y muestra 47 Análisis interno y externo 49 Fases metodológicas 51 Herramientas utilizadas 55 Consideraciones éticas 56 Diagnóstico Organizacional 58 Resultados del diagnóstico interno 67 Análisis DOFA 68 Aporte del diagnóstico organizacional 69 Plan de Intervención 71 Procesamiento estadístico de datos 71 Selección del modelo 97 Implementación del modelo 107 Operación del modelo 112 Plan de intervención 113 Cronograma de implementación 115 Recursos requeridos 118 Parámetros para evaluar el éxito del modelo en producción 119 Análisis de Riesgos y medidas de mitigación 121 Análisis DOFA de la solución propuesta 124 Roles, responsabilidades y gobernanza del sistema 126 Conclusiones y Recomendaciones 129 Conclusiones 129 Recomendaciones 131 Referencias 134 A. Anexo. Encuesta sobre manejo de PQRS 139
dc.formatpdf
dc.format.extent141 páginas, 1 anexo
dc.format.mediumRecurso electrónicospa
dc.format.mimetypeapplication/pdf
dc.identifier.instnameinstname:Universidad Eanspa
dc.identifier.localBDM-MGP
dc.identifier.reponamereponame:Repositorio Institucional Biblioteca Digital Minervaspa
dc.identifier.repourlrepourl:https://repository.ean.edu.co/
dc.identifier.urihttps://hdl.handle.net/10882/19456
dc.language.isospa
dc.publisher.facultyFacultad de Ingenieríaspa
dc.publisher.programMaestría en Ciencias de Datosspa
dc.relation.referencesBernal Torres, C. (2022). Metodología de la investigación: Administración, economía, humanidades y ciencias sociales (1ª ed. colombiana). Pearson Educación. Bottou, L. (2010). Large-scale machine learning with stochastic gradient descent. COMPSTAT. Breiman, L. (2001). Random Forests. Machine Learning, 45(1), 5–32. Chen, T., & Guestrin, C. (2016). XGBoost: A scalable tree boosting system. In Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (pp. 785–794). Association for Computing Machinery. Congreso de la República de Colombia. (2012). Ley 1581 de 2012. Por la cual se dictan disposiciones generales para la protección de datos personales. https://www.funcionpublica.gov.co/ Congreso de la República de Colombia. (2015). Ley 1755 de 2015. Por medio de la cual se regula el derecho fundamental de petición y se sustituye un título del Código de Procedimiento Administrativo y de lo Contencioso Administrativo. https://www.funcionpublica.gov.co/. Cortes, C., & Vapnik, V. (1995). Support-vector networks. Machine Learning, 20(3), 273–297. DataCamp. (2024). Cross-validation in machine learning. https://www.datacamp.com/tutorial/cross-validation-machine-learning. e-Contact. (2025). Cómo el análisis de sentimiento optimiza la experiencia del cliente. Recuperado de https://www.e-contact.cl/analisis-sentimiento-centros-experiencia/. Elsevier. (2026). Scopus. https://www.scopus.com. Géron, A. (2023). Aprende machine learning con Scikit-Learn, Keras y TensorFlow (3.ª ed.). Anaya Multimedia. Grupo Vanti. (s.f.). Quiénes somos. https://www.grupovanti.com/conocenos/quienes-somos. Hutto, C. J., & Gilbert, E. (2014). VADER: A parsimonious rule-based model for sentiment analysis of social media text. Proceedings of the International AAAI Conference on Web and Social Media, 8(1), 216–225. IBM. (s.f.). ¿Qué es el procesamiento del lenguaje natural (NLP)? https://www.ibm.com/mx-es/think/topics/natural-language-processing Instituto Nacional de Estadística (Uruguay). (s. f.). ¿Qué es un censo? Preguntas frecuentes. https://www.gub.uy/instituto-nacional-estadistica/comunicacion/publicaciones/preguntas-frecuentes/preguntas-frecuentes/es-censo. International Organization for Standardization. (2023). ISO/IEC 42001:2023 information technology — Artificial intelligence — Management system. ISO official page for ISO/IEC 42001 James, G., Witten, D., Hastie, T., & Tibshirani, R. (2021). An Introduction to Statistical Learning. Springer. Jurafsky, D., & Martin, J. H. (2023). Speech and language processing (3rd ed. draft). Stanford University. Kuhn, M., & Silge, J. (2022). Tidy modeling with R. O’Reilly Media. Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to information retrieval. Cambridge University Press. Monje Álvarez, C. A. (2011). Metodología de la investigación cuantitativa y cualitativa: Guía didáctica. Universidad Surcolombiana. https://www.uv.mx/rmipe/files/2017/02/Guia-didactica-metodologia-de-la-investigacion.pdf Pineda, C. M. (2021). Aprendizaje automático y profundo en Python: Una mirada hacia la inteligencia artificial. Ediciones de la U. Powers, D. M. W. (2011). Evaluation: From precision, recall and F-measure to ROC, informedness, markedness and correlation. Journal of Machine Learning Technologies, 2(1), 37–63. Project Management Institute. (2021). A guide to the project management body of knowledge (PMBOK® Guide) (7th ed.). PMI. Ramos, J. (2003). Using TF-IDF to determine word relevance in document queries. Proceedings of the First Instructional Conference on Machine Learning. http://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.121.1424&rep=rep1&type=pdf Raschka, S., Liu, Y. (Hayden), & Mirjalili, V. (2022). Machine learning with PyTorch and Scikit-Learn: Develop machine learning and deep learning models with Python. Packt Publishing. Stryker, C., & Holdsworth, J. (2024, agosto 11). ¿Qué es el PLN (procesamiento del lenguaje natural)? IBM. https://www.ibm.com/es-es/think/topics/natural-language-processing Talking with Data. (2023). Validación cruzada con R y Python: Asegura el éxito de tus modelos de machine learning. Medium. https://talkingwithdata.medium.com/asegura-el-%C3%A9xito-de-tus-modelos-de-machine-learning-el-poder-de-la-validaci%C3%B3n-cruzada-701e7635e299 Uribe González, A. (2023). Análisis de sentimientos en tiempo real para intervenciones de chat en videoconferencias por streaming [Trabajo de grado, Universidad de Antioquia]. Repositorio Institucional Universidad de Antioquia. https://bibliotecadigital.udea.edu.co/ Vanti S.A. E.S.P. (2022). Presentación unidad de dirección grandes clientes [Archivo PDF]. Documento interno no publicado. Verhoef, P. C., Kannan, P. K., & Inman, J. J. (2021). From multi-channel retailing to omni-channel customer experience management. Journal of Retailing, 97(2), 174–181.
dc.rights.accessrightsinfo:eu-repo/semantics/openAccess
dc.rights.coarhttp://purl.org/coar/access_right/c_abf2
dc.rights.creativecommonsAtribución-NoComercial-CompartirIgual 4.0 Internacional (CC BY-NC-SA 4.0)|
dc.rights.licenseAtribución-NoComercial-CompartirIgual 4.0 Internacional (CC BY-NC-SA 4.0)
dc.rights.localAbierto (Texto Completo)
dc.rights.urihttps://creativecommons.org/licenses/by-nc-sa/4.0/
dc.subject.armarcAprendizaje automático (Inteligencia artificial)spa
dc.subject.armarcServicio al clientespa
dc.subject.armarcAnalítica de negociosspa
dc.subject.armarcProcesamiento electrónico de datosspa
dc.subject.armarcSistemas de autoorganizaciónspa
dc.subject.armarcProcesamiento de lenguaje natural (Computadores)spa
dc.subject.proposalMachine learningspa
dc.subject.proposalAnálisis de sentimientosspa
dc.subject.proposalServicio al clientespa
dc.titleDesarrollo de modelos de procesamiento de lenguaje natural mediante técnicas de aprendizaje automático para el análisis de sentimientos en las PQRS de clientes industriales de Vanti S.A. ESPspa
dc.titleDevelopment of natural language processing models using machine learning techniques for sentiment analysis in the complaints, claims, and requests (PQRS) of industrial clients of Vanti S.A. ESPeng
dc.typeTrabajo de grado - Maestría
dc.type.coarhttp://purl.org/coar/resource_type/c_bdcc
dc.type.coarversionhttp://purl.org/coar/version/c_ab4af688f83e57aa
dc.type.contentText
dc.type.driverinfo:eu-repo/semantics/masterThesis
dc.type.otherTrabajo de grado - Maestría
dc.type.redcolhttp://purl.org/redcol/resource_type/TM
dc.type.versioninfo:eu-repo/semantics/acceptedVersion
dspace.entity.typePublication
person.affiliation.nameMaestría en Ciencias de Datos
relation.isDirectorOfPublication2d729b5e-1f86-4a5a-b460-b0c8b11e8b58
relation.isDirectorOfPublication.latestForDiscovery2d729b5e-1f86-4a5a-b460-b0c8b11e8b58

Archivos

Bloque original

Mostrando 1 - 2 de 2
Cargando...
Miniatura
Nombre:
LozanoJuan2026.pdf
Tamaño:
3.1 MB
Formato:
Adobe Portable Document Format
Descripción:
Tesis de Maestría
Cargando...
Miniatura
Nombre:
LozanoJuan2026_Anexo.pdf
Tamaño:
324.64 KB
Formato:
Adobe Portable Document Format
Descripción:
Autorización Publicación

Bloque de licencias

Mostrando 1 - 1 de 1
Cargando...
Miniatura
Nombre:
license.txt
Tamaño:
1.92 KB
Formato:
Item-specific license agreed upon to submission
Descripción: