Encoding, Representation, and Interpretation of Linguistic Structure Across NLP Paradigms
| UDC.coleccion | Teses | |
| UDC.titulacion | Programa Oficial de Doutoramento en Computación | |
| dc.contributor.advisor | Gómez-Rodríguez, Carlos | |
| dc.contributor.advisor | Vilares, David | |
| dc.contributor.author | Muñoz-Ortiz, Alberto | |
| dc.date.accessioned | 2026-08-06T11:37:56Z | |
| dc.date.available | 2026-08-06T11:37:56Z | |
| dc.date.issued | 2026 | |
| dc.description.abstract | [Abstract]:This doctoral thesis investigates the role of linguistic structure in improving the performance, interpretability, and efficiency of Natural Language Processing (NLP) systems, spanning from traditional neural architectures to modern large language models. It explores linguistic representations across the full processing pipeline, from input formats and task formulations to model outputs. Specifically, this work examines the utility of linguistic structure and representations from two complementary perspectives. First, we focus on how to employ better representations to improve the efficiency and robustness of natural language processing models. These studies cover the role of morphological information (with varying granularity and accuracy) in three different dependency parsing paradigms, the linearization of nested named entity recognition in terms of a sequence labeling task for improved efficiency, and the use of visual language representations to enhance the robustness and transfer-learning abilities of masked language models. Second, we use linguistic structure as a tool to investigate the language models themselves. Specifically, the first study in this part applies a probing framework to evaluate the syntactic knowledge that masked language models acquire during pretraining. The second study in this part analyzes the linguistic and semantic characteristics of output generated by large language models of different types and sizes, comparing these characteristics to those of human-generated text. Overall, the results presented in this thesis serve not only as a way to improve the robustness and efficiency of NLP models, but also as an interpretability tool to deepen our understanding of them. | |
| dc.description.abstract | [Resumen]:Esta tesis doctoral investiga el papel de la estructura lingüística en la mejora del rendimiento, la interpretabilidad y la eficiencia de los sistemas de Procesamiento de Lenguaje Natural (PLN) desde las arquitecturas neuronales tradicionales hasta los modernos grandes modelos de lenguaje. Se exploran representaciones lingüísticas en múltiples dimensiones, desde los formatos de entrada y las formulaciones de tareas hasta los resultados generados por el modelo. Este trabajo aborda la utilidad de la estructura y las representaciones lingüísticas desde dos perspectivas complementarias. En primer lugar, la tesis se centra en cómo emplear representaciones más adecuadas para mejorar la eficiencia y la robustez de los modelos de PLN. En particular, estos estudios abarcan el papel de la información morfológica (de diferente granularidad y precisión) en tres paradigmas distintos de análisis sintáctico de dependencias, la linealización del reconocimiento de entidades nombradas anidadas como etiquetado de secuencias simple para mejorar su eficiencia y el uso de la representación visual del lenguaje para mejorar la robustez y las capacidades de aprendizaje por transferencia de los modelos de lenguaje enmascarados. En segundo lugar, se utiliza la estructura lingüística como herramienta para investigar los propios modelos de lenguaje. En concreto, el primer estudio de esta parte utiliza una metodología de sondeo (probing framework) para evaluar el conocimiento sintáctico adquirido por los modelos de lenguaje enmascarados durante el preentrenamiento. El segundo estudio analiza las características lingüísticas y semánticas de los textos generados por grandes modelos de lenguaje de diferentes familias y tamaños, comparando sus características con textos escritos por humanos. En conjunto, los resultados presentados en esta tesis sirven no solo como un medio para mejorar la robustez y la eficiencia de los modelos de PLN, sino también como una herramienta de interpretabilidad para profundizar en nuestra comprensión sobre ellos. | |
| dc.description.abstract | [Resumo]: Esta tese doutoral investiga o papel da estrutura lingüística na mellora do rendemento, a interpretabilidade e a eficiencia dos sistemas de Procesamento da Linguaxe Natural (PLN) dende as arquitecturas neuronais tradicionais ata os modernos grandes modelos de linguaxe. Explóranse representacións lingüísticas en múltiples dimensións, desde os formatos de entrada e as formulacións de tarefas ata os resultados xerados polo modelo. Este traballo aborda a utilidade da estrutura e as representacións lingüísticas dende dúas perspectivas complementarias. En primeiro lugar, a tese céntrase en como empregar representacións máis adecuadas para mellorar a eficiencia e a robustez dos modelos de PLN. En particular, estes estudos abranguen o papel da información morfolóxica de diferente granularidade e precisión en tres paradigmas distintos de análise sintáctica de dependencias, a linealización do recoñecemento de entidades nomeadas aniñadas como etiquetado de secuencias simple para mellorar a eficiencia, e o uso da representación visual da linguaxe para mellorar a robustez e as capacidades de aprendizaxe por transferencia dos modelos de linguaxe enmascarados. En segundo lugar, utilízase a estrutura lingüística como ferramenta para investigar os propios modelos de linguaxe. Especificamente, o primeiro estudo desta parte utiliza unha metodoloxía de sondaxe (probing framework) para avaliar o coñecemento sintáctico adquirido polos modelos de linguaxe enmascarados durante o preadestramento. O segundo estudo analiza as características lingüísticas e semánticas dos textos xerados por grandes modelos de linguaxe de diferentes familias e tamaños, comparando as súas características coas dos textos escritos por humanos. En conxunto, os resultados presentados nesta tese serven non só como un medio para mellorar a robustez e a eficiencia dos modelos de PLN, senón tamén como unha ferramenta de interpretabilidade para profundar na nosa comprensión sobre eles. | |
| dc.description.sponsorship | This work was funded by SCANNER-UDC (PID2020-113230RB-C21) funded by MICIU/AEI/10.13039/501100011033; Xunta de Galicia (ED431C 2024/02); GAP (PID2022-139308OA-I00) funded by MICIU/AEI/10.13039/501100011033/ and by ERDF, EU; Grant PRE2021-097001 funded by MICIU/AEI/10.13039/501100011033 and by ESF+ (predoctoral training grant associated to project PID2020-113230RB-C21); LATCHING (PID2023-147129OB-C21) funded by MICIU/AEI/10.13039/501100011033 and ERDF; TSI-100925-2023-1 funded by Ministry for Digital Transformation and Civil Service and “NextGenerationEU” PRTR; and Centro de Investigación de Galicia “CITIC”, funded by the Xunta de Galicia through the collaboration agreement between the Consellería de Cultura, Educación, Formación Profesional e Universidades and the Galician universities for the reinforcement of the research centres of the Galician University System (CIGUS). This research project was made possible through the access granted by the Galician Supercomputing Center (CESGA) to its supercomputing infrastructure. The supercomputer FinisTerrae III and its permanent data storage system have been funded by the NextGeneration EU 2021 Recovery, Transformation and Resilience Plan, ICT2021- 006904, and also from the Pluriregional Operational Programme of Spain 2014-2020 of the European Regional Development Fund (ERDF), ICTS-2019-02-CESGA-3, and from the State Programme for the Promotion of Scientific and Technical Research of Excellence of the State Plan for Scientific and Technical Research and Innovation 2013- 2016 State subprogramme for scientific and technical infrastructures and equipment of ERDF, CESG15-DE-3114. | |
| dc.description.sponsorship | Ministerio de Ciencia e Innovación; PID2020-113230RB-C21 | |
| dc.description.sponsorship | Ministerio de Ciencia e Innovación; PID2022-139308OA-I00 | |
| dc.description.sponsorship | Ministerio de Ciencia e Innovación; PID2023-147129OB-C21 | |
| dc.description.sponsorship | Xunta de Galicia; ED431C 2024/02 | |
| dc.description.sponsorship | Ministerio para la Transformación Digital y de la Función Pública; TSI-100925-2023-1 | |
| dc.identifier.uri | https://hdl.handle.net/2183/49006 | |
| dc.language.iso | eng | |
| dc.relation.projectID | Ministerio de Ciencia e Innovación; PID2020-113230RB-C21 | |
| dc.relation.projectID | Xunta de Galicia; ED431C 2024/02 | |
| dc.relation.projectID | Ministerio de Ciencia e Innovación; PID2022-139308OA-I00 | |
| dc.relation.projectID | Ministerio de Ciencia e Innovación; PID2023-147129OB-C21) | |
| dc.rights | Os titulares dos dereitos de propiedade intelectual autorizan a visualización do contido desta tese a través de Internet, así como a súa reprodución, gravación en soporte informático ou impresión para o seu uso privado e/ou con fins de estudo e de investigación. En ningún caso se permite o uso lucrativo deste documento. Estes dereitos afectan tanto ao resumo da tese como ao seu contido Los titulares de los derechos de propiedad intelectual autorizan la visualización del contenido de esta tesis a través de Internet, así como su reproducción, grabación en soporte informático o impresión para su uso privado o con fines de investigación. En ningún caso se permite el uso lucrativo de este documento. Estos derechos afectan tanto al resumen de la tesis como a su contenido | |
| dc.rights | Attribution 4.0 International | en |
| dc.rights.accessRights | open access | |
| dc.rights.uri | http://creativecommons.org/licenses/by/4.0/ | |
| dc.subject | Natural language processing | |
| dc.subject | Linguistic structure | |
| dc.subject | Knowledge representation | |
| dc.subject | Model interpretability | |
| dc.subject | Language models | |
| dc.subject | Probing analysis | |
| dc.title | Encoding, Representation, and Interpretation of Linguistic Structure Across NLP Paradigms | |
| dc.type | doctoral thesis | |
| dspace.entity.type | Publication | |
| relation.isAdvisorOfPublication | e70a3969-39f6-4458-9339-3b71756fa56e | |
| relation.isAdvisorOfPublication | 37dabbe9-f54f-43bb-960e-0bf3ac7e54eb | |
| relation.isAdvisorOfPublication.latestForDiscovery | e70a3969-39f6-4458-9339-3b71756fa56e | |
| relation.isAuthorOfPublication | edf1cde8-d272-4a73-bdd3-9be2361b7651 | |
| relation.isAuthorOfPublication.latestForDiscovery | edf1cde8-d272-4a73-bdd3-9be2361b7651 |
Files
Original bundle
1 - 1 of 1
Loading...
- Name:
- MuñozOrtiz_Alberto_TD_2026.pdf
- Size:
- 1.61 MB
- Format:
- Adobe Portable Document Format

