Machine Learning Strategies for Predictive Modelling in Chemical and Biotechnological Research

UDC.coleccionTeses
UDC.titulacionPrograma Oficial de Doutoramento en Tecnoloxías da Información e as Comunicacións
dc.contributor.advisorPazos, A.
dc.contributor.advisorBediaga-Bañeres, Harbil
dc.contributor.authorRuiz-Escudero, Andrea
dc.date.accessioned2026-08-05T08:10:04Z
dc.date.available2026-08-05T08:10:04Z
dc.date.issued2026
dc.description.abstract[Abstract]: Artificial Intelligence (AI) has become essential in modern research, particularly in experimental sciences, including chemistry and biotechnology. Using Machine Learning (ML) to créate predictive models allows to guide experimental workflows strategically, optimizing the candidate and condition selection beyond exhaustive trial-and-error. Integrating ML accelerates discovery,clarifies complex relationships in large datasets, and reduces laboratory resource consumption,improving efficiency and sustainability. This doctoral thesis applies ML two major areas: predicting yields in synthetic cross-coupling reactions and predicting functional mutations in E. coli DNA sequences to design L-arabinose and L-rhamnose promoters. These studies demonstrate AI’s versatility in addressing diverse research problems and reveal challenges in building reliable, interpretable models. The analysis involves typical Big Data issues, summarized by the “5V + C” framework (Volume,Velocity, Veracity, Variability, Value, and Complexity), including missing or inconsistent data,experimental uncertainty, correlated variables, multi-scale relationships, and unbalanced datasets. To overcome these, the thesis employs the Perturbation-Theory ML method, enabling multi-output predictive models for chemical systems, and deep learning in the bioengineering to capture nonlinear relationships in genetic sequence-function data. Finally, it emphasizes adopting FAIR data principles and open science to ensure reproducibility and accelerate AI-driven research.
dc.description.abstract[Resumen]: La Inteligencia Artificial (IA) se ha vuelto esencial en la investigación moderna, en particular en diversas ciencias experimentales, como la química y la biotecnología. El uso del Aprendizaje Automático (AA) para construir modelos predictivos permite guiar estratégicamente los flujos de trabajo experimentales, optimizando la selección de candidatos y condiciones más allá del ensayo y error exhaustivo. La integración del AA acelera el descubrimiento, aclara relaciones complejas en grandes conjuntos de datos y reduce el consumo de recursos del laboratorio, mejorando la eficiencia y la sostenibilidad. Esta tesis doctoral aplica la AA en dos áreas principales: la predicción del rendimiento en reacciones sintéticas de acoplamiento cruzado y la predicción de mutaciones funcionales en secuencias de ADN de E. coli para diseñar promotores de L-arabinosa y L-ramnosa. Estos estudios demuestran la versatilidad de la IA para abordar diversos problemas de investigación y revelan los desafíos en la construcción de modelos fiables e interpretables. El análisis aborda problemas típicos del Big Data, resumidos en el marco "5V + C" (Volumen, Velocidad, Veracidad, Variabilidad, Valor y Complejidad), incluyendo datos faltantes o inconsistentes, incertidumbre experimental, variables correlacionadas, relaciones multiescala y conjuntos de datos desequilibrados. Para superar estos problemas, la tesis emplea el método de AA de la teoría de perturbaciones, que permite modelos predictivos multisalida para sistemas químicos, y el aprendizaje profundo en bioingeniería para capturar relaciones no lineales en datos de secuencias genéticas y funciones. Finalmente, se enfatiza la adopción de los principios de datos FAIR y la ciencia abierta para garantizar la reproducibilidad y acelerar la investigación con AA.
dc.description.abstract[Resumo]: A intelixencia artificial (IA) converteuse en esencial na investigación moderna, especialmente nas ciencias experimentais, incluíndo a química e a biotecnoloxía. O uso da aprendizaxe automática (AA) para construír modelos preditivos permite guiar os fluxos de traballo experimentais de forma estratéxica, optimizando a selección de candidatos e condicións máis alá do exhaustivo ensaio e erro. A integración da AA acelera o descubrimento, clarifica as relacións complexas en grandes conxuntos de datos e reduce o consumo de recursos de laboratorio, mellorando a eficiencia e a sustentabilidade. Esta tese doutoral aplica a AA en dúas áreas principais: a predición de rendementos en reacción de acoplamento cruzado sintético e a predición de mutacións funcionais nas secuencias de ADN de E. coli para deseñar promotores de L-arabinosa e L-ramnosa. Estes estudos demostran a versatilidade da IA para abordar diversos problemas de investigación e revelan desafíos na construción de modelos fiables e interpretables. A análise inclúe cuestións típicas de Big Data, resumidas polo marco "5V + C" (Volume,Velocidade, Veracidade, Variabilidade, Valor e Complexidade), incluíndo datos ausentes ou inconsistentes, incerteza experimental, variables correlacionadas, relacións multiescala e conxuntos de datos desequilibrados. Para superar isto, a tese emprega o método de aprendizaxe automática da teoría das perturbacións, que permite modelos preditivos de saída múltiple para sistemas químicos, e a aprendizaxe profunda na bioenxeñaría para capturar relacións non lineais nos datos de función de secuencia xenética. Finalmente, fai fincapé na adopción dos principios de datos FAIR e na ciencia aberta para garantir a reproducibilidade e acelerar a investigación impulsada pola IA.
dc.identifier.urihttps://hdl.handle.net/2183/48984
dc.language.isoeng
dc.rightsOs titulares dos dereitos de propiedade intelectual autorizan a visualización do contido desta tese a través de Internet, así como a súa reprodución, gravación en soporte informático ou impresión para o seu uso privado e/ou con fins de estudo e de investigación. En ningún caso se permite o uso lucrativo deste documento. Estes dereitos afectan tanto ao resumo da tese como ao seu contido Los titulares de los derechos de propiedad intelectual autorizan la visualización del contenido de esta tesis a través de Internet, así como su reproducción, grabación en soporte informático o impresión para su uso privado o con fines de investigación. En ningún caso se permite el uso lucrativo de este documento. Estos derechos afectan tanto al resumen de la tesis como a su contenido
dc.rightsAttribution 4.0 Internationalen
dc.rights.accessRightsopen access
dc.rights.urihttp://creativecommons.org/licenses/by/4.0/
dc.subjectMachine learning
dc.subjectPredictive modelling
dc.subjectChemoinformatics
dc.subjectBioinformatics
dc.subjectDeep learning
dc.titleMachine Learning Strategies for Predictive Modelling in Chemical and Biotechnological Research
dc.typedoctoral thesis
dspace.entity.typePublication
relation.isAdvisorOfPublicationfa192a4c-bffd-4b23-87ae-e68c29350cdc
relation.isAdvisorOfPublication.latestForDiscoveryfa192a4c-bffd-4b23-87ae-e68c29350cdc

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
RuizEscudero_Andrea_TD_2026.pdf
Size:
12.74 MB
Format:
Adobe Portable Document Format