Encoding, Representation, and Interpretation of Linguistic Structure Across NLP Paradigms

UDC.coleccionTeses
UDC.titulacionPrograma Oficial de Doutoramento en Computación
dc.contributor.advisorGómez-Rodríguez, Carlos
dc.contributor.advisorVilares, David
dc.contributor.authorMuñoz-Ortiz, Alberto
dc.date.accessioned2026-08-06T11:37:56Z
dc.date.available2026-08-06T11:37:56Z
dc.date.issued2026
dc.description.abstract[Abstract]:This doctoral thesis investigates the role of linguistic structure in improving the performance, interpretability, and efficiency of Natural Language Processing (NLP) systems, spanning from traditional neural architectures to modern large language models. It explores linguistic representations across the full processing pipeline, from input formats and task formulations to model outputs. Specifically, this work examines the utility of linguistic structure and representations from two complementary perspectives. First, we focus on how to employ better representations to improve the efficiency and robustness of natural language processing models. These studies cover the role of morphological information (with varying granularity and accuracy) in three different dependency parsing paradigms, the linearization of nested named entity recognition in terms of a sequence labeling task for improved efficiency, and the use of visual language representations to enhance the robustness and transfer-learning abilities of masked language models. Second, we use linguistic structure as a tool to investigate the language models themselves. Specifically, the first study in this part applies a probing framework to evaluate the syntactic knowledge that masked language models acquire during pretraining. The second study in this part analyzes the linguistic and semantic characteristics of output generated by large language models of different types and sizes, comparing these characteristics to those of human-generated text. Overall, the results presented in this thesis serve not only as a way to improve the robustness and efficiency of NLP models, but also as an interpretability tool to deepen our understanding of them.
dc.description.abstract[Resumen]:Esta tesis doctoral investiga el papel de la estructura lingüística en la mejora del rendimiento, la interpretabilidad y la eficiencia de los sistemas de Procesamiento de Lenguaje Natural (PLN) desde las arquitecturas neuronales tradicionales hasta los modernos grandes modelos de lenguaje. Se exploran representaciones lingüísticas en múltiples dimensiones, desde los formatos de entrada y las formulaciones de tareas hasta los resultados generados por el modelo. Este trabajo aborda la utilidad de la estructura y las representaciones lingüísticas desde dos perspectivas complementarias. En primer lugar, la tesis se centra en cómo emplear representaciones más adecuadas para mejorar la eficiencia y la robustez de los modelos de PLN. En particular, estos estudios abarcan el papel de la información morfológica (de diferente granularidad y precisión) en tres paradigmas distintos de análisis sintáctico de dependencias, la linealización del reconocimiento de entidades nombradas anidadas como etiquetado de secuencias simple para mejorar su eficiencia y el uso de la representación visual del lenguaje para mejorar la robustez y las capacidades de aprendizaje por transferencia de los modelos de lenguaje enmascarados. En segundo lugar, se utiliza la estructura lingüística como herramienta para investigar los propios modelos de lenguaje. En concreto, el primer estudio de esta parte utiliza una metodología de sondeo (probing framework) para evaluar el conocimiento sintáctico adquirido por los modelos de lenguaje enmascarados durante el preentrenamiento. El segundo estudio analiza las características lingüísticas y semánticas de los textos generados por grandes modelos de lenguaje de diferentes familias y tamaños, comparando sus características con textos escritos por humanos. En conjunto, los resultados presentados en esta tesis sirven no solo como un medio para mejorar la robustez y la eficiencia de los modelos de PLN, sino también como una herramienta de interpretabilidad para profundizar en nuestra comprensión sobre ellos.
dc.description.abstract[Resumo]: Esta tese doutoral investiga o papel da estrutura lingüística na mellora do rendemento, a interpretabilidade e a eficiencia dos sistemas de Procesamento da Linguaxe Natural (PLN) dende as arquitecturas neuronais tradicionais ata os modernos grandes modelos de linguaxe. Explóranse representacións lingüísticas en múltiples dimensións, desde os formatos de entrada e as formulacións de tarefas ata os resultados xerados polo modelo. Este traballo aborda a utilidade da estrutura e as representacións lingüísticas dende dúas perspectivas complementarias. En primeiro lugar, a tese céntrase en como empregar representacións máis adecuadas para mellorar a eficiencia e a robustez dos modelos de PLN. En particular, estes estudos abranguen o papel da información morfolóxica de diferente granularidade e precisión en tres paradigmas distintos de análise sintáctica de dependencias, a linealización do recoñecemento de entidades nomeadas aniñadas como etiquetado de secuencias simple para mellorar a eficiencia, e o uso da representación visual da linguaxe para mellorar a robustez e as capacidades de aprendizaxe por transferencia dos modelos de linguaxe enmascarados. En segundo lugar, utilízase a estrutura lingüística como ferramenta para investigar os propios modelos de linguaxe. Especificamente, o primeiro estudo desta parte utiliza unha metodoloxía de sondaxe (probing framework) para avaliar o coñecemento sintáctico adquirido polos modelos de linguaxe enmascarados durante o preadestramento. O segundo estudo analiza as características lingüísticas e semánticas dos textos xerados por grandes modelos de linguaxe de diferentes familias e tamaños, comparando as súas características coas dos textos escritos por humanos. En conxunto, os resultados presentados nesta tese serven non só como un medio para mellorar a robustez e a eficiencia dos modelos de PLN, senón tamén como unha ferramenta de interpretabilidade para profundar na nosa comprensión sobre eles.
dc.description.sponsorshipThis work was funded by SCANNER-UDC (PID2020-113230RB-C21) funded by MICIU/AEI/10.13039/501100011033; Xunta de Galicia (ED431C 2024/02); GAP (PID2022-139308OA-I00) funded by MICIU/AEI/10.13039/501100011033/ and by ERDF, EU; Grant PRE2021-097001 funded by MICIU/AEI/10.13039/501100011033 and by ESF+ (predoctoral training grant associated to project PID2020-113230RB-C21); LATCHING (PID2023-147129OB-C21) funded by MICIU/AEI/10.13039/501100011033 and ERDF; TSI-100925-2023-1 funded by Ministry for Digital Transformation and Civil Service and “NextGenerationEU” PRTR; and Centro de Investigación de Galicia “CITIC”, funded by the Xunta de Galicia through the collaboration agreement between the Consellería de Cultura, Educación, Formación Profesional e Universidades and the Galician universities for the reinforcement of the research centres of the Galician University System (CIGUS). This research project was made possible through the access granted by the Galician Supercomputing Center (CESGA) to its supercomputing infrastructure. The supercomputer FinisTerrae III and its permanent data storage system have been funded by the NextGeneration EU 2021 Recovery, Transformation and Resilience Plan, ICT2021- 006904, and also from the Pluriregional Operational Programme of Spain 2014-2020 of the European Regional Development Fund (ERDF), ICTS-2019-02-CESGA-3, and from the State Programme for the Promotion of Scientific and Technical Research of Excellence of the State Plan for Scientific and Technical Research and Innovation 2013- 2016 State subprogramme for scientific and technical infrastructures and equipment of ERDF, CESG15-DE-3114.
dc.description.sponsorshipMinisterio de Ciencia e Innovación; PID2020-113230RB-C21
dc.description.sponsorshipMinisterio de Ciencia e Innovación; PID2022-139308OA-I00
dc.description.sponsorshipMinisterio de Ciencia e Innovación; PID2023-147129OB-C21
dc.description.sponsorshipXunta de Galicia; ED431C 2024/02
dc.description.sponsorshipMinisterio para la Transformación Digital y de la Función Pública; TSI-100925-2023-1
dc.identifier.urihttps://hdl.handle.net/2183/49006
dc.language.isoeng
dc.relation.projectIDMinisterio de Ciencia e Innovación; PID2020-113230RB-C21
dc.relation.projectIDXunta de Galicia; ED431C 2024/02
dc.relation.projectIDMinisterio de Ciencia e Innovación; PID2022-139308OA-I00
dc.relation.projectIDMinisterio de Ciencia e Innovación; PID2023-147129OB-C21)
dc.rightsOs titulares dos dereitos de propiedade intelectual autorizan a visualización do contido desta tese a través de Internet, así como a súa reprodución, gravación en soporte informático ou impresión para o seu uso privado e/ou con fins de estudo e de investigación. En ningún caso se permite o uso lucrativo deste documento. Estes dereitos afectan tanto ao resumo da tese como ao seu contido Los titulares de los derechos de propiedad intelectual autorizan la visualización del contenido de esta tesis a través de Internet, así como su reproducción, grabación en soporte informático o impresión para su uso privado o con fines de investigación. En ningún caso se permite el uso lucrativo de este documento. Estos derechos afectan tanto al resumen de la tesis como a su contenido
dc.rightsAttribution 4.0 Internationalen
dc.rights.accessRightsopen access
dc.rights.urihttp://creativecommons.org/licenses/by/4.0/
dc.subjectNatural language processing
dc.subjectLinguistic structure
dc.subjectKnowledge representation
dc.subjectModel interpretability
dc.subjectLanguage models
dc.subjectProbing analysis
dc.titleEncoding, Representation, and Interpretation of Linguistic Structure Across NLP Paradigms
dc.typedoctoral thesis
dspace.entity.typePublication
relation.isAdvisorOfPublicatione70a3969-39f6-4458-9339-3b71756fa56e
relation.isAdvisorOfPublication37dabbe9-f54f-43bb-960e-0bf3ac7e54eb
relation.isAdvisorOfPublication.latestForDiscoverye70a3969-39f6-4458-9339-3b71756fa56e
relation.isAuthorOfPublicationedf1cde8-d272-4a73-bdd3-9be2361b7651
relation.isAuthorOfPublication.latestForDiscoveryedf1cde8-d272-4a73-bdd3-9be2361b7651

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
MuñozOrtiz_Alberto_TD_2026.pdf
Size:
1.61 MB
Format:
Adobe Portable Document Format