Calviño-Padín, Pablo-AlejandroVillegas Duque, AdriánGuerra Rodríguez, MartaUniversidade da Coruña. Facultade de Informática2026-09-292026-09-292026-09https://hdl.handle.net/2183/49498[Resumen] Este trabajo de fin de grado presenta el diseño, desarrollo e implementación de un sistema completo y multimodal para el Reconocimiento Automático de Emociones en la Voz. El proyecto abarca todo el ciclo de desarrollo, desde la investigación del núcleo de inteligencia artificial hasta su despliegue práctico a través de una API y una aplicación web interactiva. A nivel de modelado, el sistema combina dos fuentes de información complementarias: la dimensión acústica (procesada mediante descriptores espectrales y modelos de clasificación) y el contenido semántico del mensaje (mediante transcripción automática y análisis de lenguaje natural). Ambas ramas convergen en una estrategia de fusión tardía para integrar ambas perspectivas. El rendimiento de esta arquitectura se evalúa empíricamente, identificando sus fortalezas y limitaciones antes de integrarla en un prototipo web funcional.[Abstract] This bachelor’s thesis presents the design, development, and implementation of a comprehensive, multimodal system for Automatic Speech Emotion Recognition. The project covers the entire development lifecycle, from the research of the artificial intelligence core to its practical deployment via an API and an interactive web application. At the modeling level, the system combines two complementary sources of information: the acoustic dimension (processed using spectral descriptors and classification models) and the semantic content of the message (via automatic transcription and natural language analysis). Both branches converge in a late fusion strategy to integrate both perspectives. The performance of this architecture is empirically evaluated to identify its strengths and limitations before its integration into a functional web prototype.spaOs titulares dos dereitos de autor autorizan a visualización do contido desta obra a través de Internet, así como a súa reprodución, gravación en soporte informático ou impresión para uso privado ou con fins de investigación. En ningún caso se permite o uso lucrativo deste documento. Estes dereitos afectan tanto ao resumo da obra como ao seu contido. Los titulares de los derechos de propiedad intelectual autorizan la visualización del contenido de este trabajo a través de Internet, así como su reproducción, grabación en soporte informático o impresión para su uso privado o con fines de investigación. En ningún caso se permite el uso lucrativo de este documento. Estos derechos afectan tanto al resumen del trabajo como a su contenido.Reconocimiento Automático de Emociones en la VozTranscripción AutomáticaProcesamiento de Lenguaje NaturalSistemas multimodalesFusión tardíaInterfaz de programación (API)Aplicación webAutomatic Speech Emotion RecognitionAutomatic Speech RecognitionNatural Language ProcessingMultimodal SystemsLate FusionApplication Programming Interface (API)Web ApplicationDesarrollo de un asistente de voz con reconocimiento de emocionesbachelor thesisopen access