Use this link to cite:
https://hdl.handle.net/2183/49078 Advanced Techniques for Efficient and Robust Classification in Imbalanced Datasets
Identifiers
Publication date
Authors
Other responsabilities
Journal Title
Bibliographic citation
Type of academic work
Academic degree
Abstract
[Resumen]: La clasificación en conjuntos de datos desbalanceados continúa siendo uno de los problemas abiertos más relevantes del aprendizaje automático, especialmente en aplicaciones reales donde la clase minoritaria suele representar los casos de mayor interés o criticidad, como el diagnóstico médico, la detección de fraude, el mantenimiento predictivo o la identificación de fallos. Tradicionalmente, este problema se ha abordado desde una perspectiva centrada en las proporciones de clase, mediante técnicas de remuestreo o enfoques sensibles al coste. Sin embargo, existe una creciente evidencia de que la efectividad de estas soluciones depende no solo del grado de desbalanceo, sino también de las propiedades estructurales de los datos, de la representación del espacio de características y del contexto computacional en el que se desarrolla el proceso de aprendizaje. Esta tesis adopta una visión integradora de la clasificación desbalanceada, en la que la robustez y la eficiencia se interpretan como el resultado de la interacción entre estrategias de muestreo, selección de características, complejidad de los datos y restricciones computacionales. En una primera etapa, se realiza un análisis experimental exhaustivo para estudiar cómo distintas técnicas de preprocesamiento se comportan bajo diferentes características de los conjuntos de datos y tipos de clasificadores. Los resultados muestran que no existe una estrategia universalmente ´optima y que el rendimiento depende en gran medida de factores como el solapamiento entre clases, la dimensionalidad, el ruido o el modelo de clasificación utilizado. A partir de este diagnóstico, se proponen nuevas estrategias de sobremuestreo orientadas por la estructura global del problema. En particular, se desarrollan métodos que reformulan la generación de muestras sintéticas incorporando medidas de complejidad de los datos y criterios geométricos de separabilidad. Asimismo, se introduce la distinción entre muestras sintéticas en función de la distancia dónde se generan, lo que permite interpretar cómo diferentes tipos de muestras sintéticas pueden reforzar regiones internas de una clase o modificar las fronteras de decisión. En conjunto, estas propuestas muestran que el sobremuestreo puede entenderse como una transformación estructural del espacio de datos y no únicamente como un mecanismo para equilibrar frecuencias. Posteriormente, el estudio se extiende a entornos distribuidos y heterogéneos. En la actualidad, los datos ya no se encuentran mayoritariamente centralizados en un único sistema, sino que, cada vez con mayor frecuencia, se generan, almacenan y procesan de forma distribuida a través de múltiples nodos, dispositivos o fuentes. Este cambio responde tanto al crecimiento del volumen de datos como a la proliferación de arquitecturas descentralizadas, como sistemas distribuidos, edge computing o entornos federados. En este contexto, los datos se encuentran fragmentados en múltiples nodos con distintos niveles de desbalanceo y distribuciones de características. Esto introduce nuevos desafíos, ya que muchas de las técnicas tradicionales de aprendizaje automático han sido diseñadas bajo supuestos centralizados. Por ello, resulta necesario analizar hasta qué punto los métodos de preprocesamiento pueden adaptarse a este escenario. En este sentido, se estudian estrategias distribuidas de selección de características y muestreo, demostrando que es posible alcanzar un rendimiento comparable al de enfoques centralizados cuando la heterogeneidad local y la calidad de las particiones se tienen en cuenta de forma explícita. Estos resultados refuerzan la viabilidad de soluciones escalables para escenarios con grandes volúmenes de datos o infraestructuras descentralizadas. Finalmente, la tesis investiga la robustez de los métodos de sobremuestreo bajo representaciones numéricas de precisión reducida, motivado por el creciente despliegue de sistemas de aprendizaje automático en entornos con recursos limitados, como el Edge computing, dispositivos embebidos e infraestructuras IoT. Los resultados muestran que el proceso de generación de muestras sintéticas mediante técnicas de sobremuestreo puede mantenerse estable bajo reducciones moderadas de precisión numérica, preservando el rendimiento de clasificación mientras se reducen significativamente los requisitos de memoria, lo que favorece el diseño de pipelines de aprendizaje más eficientes y sostenibles. En conjunto, los resultados demuestran que la clasificación en escenarios desbalanceados no debe entenderse únicamente como un problema de proporciones de clase, sino como un desafío multidimensional en el que intervienen simultáneamente la distribución de clases, la estructura geométrica de los datos, la representación numérica y las condiciones computacionales del sistema. Al abordar conjuntamente estos factores, esta tesis contribuye al desarrollo de estrategias de clasificación más robustas, eficientes, escalables y sostenibles para escenarios reales de aprendizaje automático con datos desbalanceados.
{Abstract]: Classification in imbalanced datasets remains one of the most relevant open problems in Machine Learning, particularly in real world applications where the minority class often represents the most important or critical cases, such as medical diagnosis, fraud detection, predictive maintenance, or fault identification. Traditionally, this problem has been approached from a class-proportion perspective, mainly through resampling techniques or cost sensitive learning methods. However, there is growing evidence that the effectiveness of these solutions depends not only on the degree of imbalance, but also on the structural properties of the data, the representation of the feature space, and the computational context in which the learning process is carried out. This thesis adopts an integrated view of imbalanced classification, in which robustness and efficiency are interpreted as the result of the interaction between sampling strategies, feature selection, data complexity, and computational constraints. In a first stage, an extensive experimental analysis is conducted to study how different preprocessing techniques behave under varying dataset characteristics and classifier types. The results show that there is no universally optimal strategy and that performance depends strongly on factors such as class overlap, dimensionality, noise, and the classification model employed. Based on this diagnosis, new oversampling strategies guided by the global structure of the problem are proposed. In particular, methods are developed that reformulate the generation of synthetic samples by incorporating data complexity measures and geometric separability criteria. In addition, a distinction between synthetic samples based on the regions in which they are generated is introduced, allowing for an interpretation of how different types of synthetic samples may reinforce internal class regions or modify decision boundaries. Overall, these contributions show that oversampling can be understood as a structural transformation of the data space, rather than solely as a mechanism for balancing class frequencies Subsequently, the study is extended to distributed and heterogeneous environments. Nowadays, data are no longer predominantly centralised within a single system, but are increasingly generated, stored, and processed in a distributed manner across multiple nodes, devices, or sources. This shift is driven both by the growth in data volume and by the proliferation of decentralised architectures, such as distributed systems, edge computing, and federated environments. In this context, data are fragmented across multiple nodes with different imbalance levels and feature distributions. This introduces new challenges, as many traditional machine learning techniques have been designed under centralised assumptions. It is therefore necessary to analyse the extent to which preprocessing methods can be adapted to such scenarios. In this regard, distributed strategies for feature selection and sampling are studied, demonstrating that performance comparable to centralised approaches can be achieved when local heterogeneity and partition quality are explicitly taken into account. These results support the feasibility of scalable solutions for scenarios involving large data volumes or decentralised infrastructures. Finally, the thesis investigates the robustness of oversampling methods under reduced precision numerical representations, motivated by the increasing deployment of Machine Learning systems in resource constrained environments such as edge computing, embedded devices, and IoT infrastructures. The results show that the process of synthetic sample generation through oversampling techniques can remain stable under moderate reductions in numerical precision, preserving classification performance while significantly reducing memory requirements. This enables the design of more efficient and sustainable learning pipelines. Overall, the results demonstrate that classification in imbalanced scenarios should not be understood solely as a problem of class proportions, but as a multidimensional challenge in which class distribution, data geometry, numerical representation, and computational conditions interact simultaneously. By addressing these factors jointly, this tesis contributes to the development of more robust, efficient, scalable, and sustainable classification strategies for real-world imbalanced learning scenarios.
Description
Editor version
Rights
Attribution-NonCommercial-ShareAlike 4.0 International
Collections

Except where otherwise noted, this item's license is described as Os titulares dos dereitos de propiedade intelectual autorizan a visualización do contido desta tese a través de Internet, así como a súa reprodución, gravación en soporte informático ou impresión para o seu uso privado e/ou con fins de estudo e de investigación. En ningún caso se permite o uso lucrativo deste documento. Estes dereitos afectan tanto ao resumo da tese como ao seu contido Los titulares de los derechos de propiedad intelectual autorizan la visualización del contenido de esta tesis a través de Internet, así como su reproducción, grabación en soporte informático o impresión para su uso privado o con fines de investigación. En ningún caso se permite el uso lucrativo de este documento. Estos derechos afectan tanto al resumen de la tesis como a su contenido







