Advanced Techniques for Efficient and Robust Classification in Imbalanced Datasets

Loading...
Thumbnail Image

Identifiers

Publication date

Authors

Morillo-Salas, José Luis

Other responsabilities

Journal Title

Bibliographic citation

Type of academic work

Abstract

[Resumo]: A clasificación en conxuntos de datos desbalanceados continúa sendo un dos problemas abertos máis relevantes da aprendizaxe automática, especialmente en aplicación reais onde a clase minoritaria adoita representar os casos de maior interese ou criticidad, como o diagnóstico médico, a detección de fraude, o mantemento preditivo ou a identificación de fallos. Tradicionalmente, este problema abordouse desde unha perspectiva centrada nas proporcións de clase, mediante técnicas de remuestreo ou enfoques sensibles ao custo. Con todo, existe unha crecente evidencia de que a efectividade destas solución depende non só do grao de desbalanceo, senón tamén das propiedades estruturais dos datos, da representación do espazo de características e do contexto computacional no que se desenvolve o proceso de aprendizaxe. Esta tese adopta unha visión integradora da clasificación desbalanceada, na que a robustez e a eficiencia interprétanse como o resultado da interacción entre estratexias de mostraxe, selección de características, complexidade dos datos e restriccións computacionais. Nunha primeira etapa, realízase unha análise experimental exhaustiva para estudar como distintas t´ecnicas de preprocesamiento compórtanse baixo diferentes características dos conxuntos de datos e tipos de clasificadores. Os resultados mostran que non existe unha estratexia universalmente óptima e que o rendemento depende en gran medida de factores como o solapamento entre clases, a dimensionalidad, o ruído ou o modelo de clasificación utilizado. A partir deste diagnóstico, propóñense novas estratexias de sobremostraxe orientadas pola estrutura global do problema. En particular, desenvólvense métodos que reformulan a xeración de mostras sintéticas incorporando medidas de complexidade dos datos e criterios xeométricos de separabilidad. Así mesmo, introdúcese a distinción entre mostras sintéticas en función da distancia onde se xeran, o que permite interpretar como diferentes tipos de mostras sintéticas poden reforzar rexións internas dunha clase ou modificar as fronteiras de decisión. En conxunto, estas propostas mostran que o sobremostraxe pode entenderse como unha transformación estrutural do espazo de datos e non únicamente como un mecanismo para equilibrar frecuencias. Posteriormente, o estudo esténdese a contornas distribuídas e heteroxéneas. Na actualidade, os datos xa non se atopan maioritariamente centralizados nun único sistema, senón que, cada vez con maior frecuencia, xéranse, almacenan e procesan de forma distribuída a través de múltiples nodos, dispositivos ou fontes. Este cambio responde tanto o crecemento do volume de datos como a proliferación de arquitecturas descentralizadas, como sistemas distribuídos, edge computing ou contornas federadas. Neste contexto, os datos atópanse fragmentados en múltiples nodos con distintos niveis de desbalanceo e distribucións de características. Isto introduce novos desafíos, xa que moitas das técnicas tradicionais de aprendizaxe automática foron deseñadas baixo supostos centralizados. Por iso, resulta necesario analizar ata que punto os métodos de preprocesamiento poden adaptarse a este escenario. Neste sentido, estúdanse estratexias distribuídas de selección de características e mostraxe, demostrando que é posible alcanzar un rendemento comparable ao de enfoques centralizados cando a heteroxeneidade local e a calidade das particións téñense en conta de forma explícita. Estes resultados reforzan a viabilidade de solucións escalables para escenarios con grandes volumes de datos ou infraestruturas descentralizadas. Finalmente, a tese investiga a robustez dos m´etodos de sobremostraxe baixo representacións numéricas de precisión reducida, motivado polo crecente despregamento de sistemas de aprendizaxe automática en contornas con recursos limitados, como o Edge computing, dispositivos embebidos e infraestruturas IoT. Os resultados mostran que o proceso de xeración de mostras sintéticas mediante técnicas de sobremostraxe pode manterse estable baixo reducións moderadas de precisión numérica, preservando o rendemento de clasificación mentres se reducen significativamente os requisitos de memoria, o que favorece o deseño de pipelines de aprendizaxe máis eficientes e sostibles. En conxunto, os resultados demostran que a clasificación en escenarios desbalanceados non debe entenderse unicamente como un problema de proporcións de clase, senón como un desafío multidimensional no que interveñen simultaneamente a distribución de clases, a estrutura xeométrica dos datos, a representación numérica e as condición computacionais do sistema. Ao abordar conxuntamente estes factores, esta tese contribúe ao desenvolvemento de estratexias de clasificación máis robustas, eficientes, escalables e sostibles para escenarios reais de aprendizaxe automática con datos desbalanceados.
[Resumen]: La clasificación en conjuntos de datos desbalanceados continúa siendo uno de los problemas abiertos más relevantes del aprendizaje automático, especialmente en aplicaciones reales donde la clase minoritaria suele representar los casos de mayor interés o criticidad, como el diagnóstico médico, la detección de fraude, el mantenimiento predictivo o la identificación de fallos. Tradicionalmente, este problema se ha abordado desde una perspectiva centrada en las proporciones de clase, mediante técnicas de remuestreo o enfoques sensibles al coste. Sin embargo, existe una creciente evidencia de que la efectividad de estas soluciones depende no solo del grado de desbalanceo, sino también de las propiedades estructurales de los datos, de la representación del espacio de características y del contexto computacional en el que se desarrolla el proceso de aprendizaje. Esta tesis adopta una visión integradora de la clasificación desbalanceada, en la que la robustez y la eficiencia se interpretan como el resultado de la interacción entre estrategias de muestreo, selección de características, complejidad de los datos y restricciones computacionales. En una primera etapa, se realiza un análisis experimental exhaustivo para estudiar cómo distintas técnicas de preprocesamiento se comportan bajo diferentes características de los conjuntos de datos y tipos de clasificadores. Los resultados muestran que no existe una estrategia universalmente ´optima y que el rendimiento depende en gran medida de factores como el solapamiento entre clases, la dimensionalidad, el ruido o el modelo de clasificación utilizado. A partir de este diagnóstico, se proponen nuevas estrategias de sobremuestreo orientadas por la estructura global del problema. En particular, se desarrollan métodos que reformulan la generación de muestras sintéticas incorporando medidas de complejidad de los datos y criterios geométricos de separabilidad. Asimismo, se introduce la distinción entre muestras sintéticas en función de la distancia dónde se generan, lo que permite interpretar cómo diferentes tipos de muestras sintéticas pueden reforzar regiones internas de una clase o modificar las fronteras de decisión. En conjunto, estas propuestas muestran que el sobremuestreo puede entenderse como una transformación estructural del espacio de datos y no únicamente como un mecanismo para equilibrar frecuencias. Posteriormente, el estudio se extiende a entornos distribuidos y heterogéneos. En la actualidad, los datos ya no se encuentran mayoritariamente centralizados en un único sistema, sino que, cada vez con mayor frecuencia, se generan, almacenan y procesan de forma distribuida a través de múltiples nodos, dispositivos o fuentes. Este cambio responde tanto al crecimiento del volumen de datos como a la proliferación de arquitecturas descentralizadas, como sistemas distribuidos, edge computing o entornos federados. En este contexto, los datos se encuentran fragmentados en múltiples nodos con distintos niveles de desbalanceo y distribuciones de características. Esto introduce nuevos desafíos, ya que muchas de las técnicas tradicionales de aprendizaje automático han sido diseñadas bajo supuestos centralizados. Por ello, resulta necesario analizar hasta qué punto los métodos de preprocesamiento pueden adaptarse a este escenario. En este sentido, se estudian estrategias distribuidas de selección de características y muestreo, demostrando que es posible alcanzar un rendimiento comparable al de enfoques centralizados cuando la heterogeneidad local y la calidad de las particiones se tienen en cuenta de forma explícita. Estos resultados refuerzan la viabilidad de soluciones escalables para escenarios con grandes volúmenes de datos o infraestructuras descentralizadas. Finalmente, la tesis investiga la robustez de los métodos de sobremuestreo bajo representaciones numéricas de precisión reducida, motivado por el creciente despliegue de sistemas de aprendizaje automático en entornos con recursos limitados, como el Edge computing, dispositivos embebidos e infraestructuras IoT. Los resultados muestran que el proceso de generación de muestras sintéticas mediante técnicas de sobremuestreo puede mantenerse estable bajo reducciones moderadas de precisión numérica, preservando el rendimiento de clasificación mientras se reducen significativamente los requisitos de memoria, lo que favorece el diseño de pipelines de aprendizaje más eficientes y sostenibles. En conjunto, los resultados demuestran que la clasificación en escenarios desbalanceados no debe entenderse únicamente como un problema de proporciones de clase, sino como un desafío multidimensional en el que intervienen simultáneamente la distribución de clases, la estructura geométrica de los datos, la representación numérica y las condiciones computacionales del sistema. Al abordar conjuntamente estos factores, esta tesis contribuye al desarrollo de estrategias de clasificación más robustas, eficientes, escalables y sostenibles para escenarios reales de aprendizaje automático con datos desbalanceados.
{Abstract]: Classification in imbalanced datasets remains one of the most relevant open problems in Machine Learning, particularly in real world applications where the minority class often represents the most important or critical cases, such as medical diagnosis, fraud detection, predictive maintenance, or fault identification. Traditionally, this problem has been approached from a class-proportion perspective, mainly through resampling techniques or cost sensitive learning methods. However, there is growing evidence that the effectiveness of these solutions depends not only on the degree of imbalance, but also on the structural properties of the data, the representation of the feature space, and the computational context in which the learning process is carried out. This thesis adopts an integrated view of imbalanced classification, in which robustness and efficiency are interpreted as the result of the interaction between sampling strategies, feature selection, data complexity, and computational constraints. In a first stage, an extensive experimental analysis is conducted to study how different preprocessing techniques behave under varying dataset characteristics and classifier types. The results show that there is no universally optimal strategy and that performance depends strongly on factors such as class overlap, dimensionality, noise, and the classification model employed. Based on this diagnosis, new oversampling strategies guided by the global structure of the problem are proposed. In particular, methods are developed that reformulate the generation of synthetic samples by incorporating data complexity measures and geometric separability criteria. In addition, a distinction between synthetic samples based on the regions in which they are generated is introduced, allowing for an interpretation of how different types of synthetic samples may reinforce internal class regions or modify decision boundaries. Overall, these contributions show that oversampling can be understood as a structural transformation of the data space, rather than solely as a mechanism for balancing class frequencies Subsequently, the study is extended to distributed and heterogeneous environments. Nowadays, data are no longer predominantly centralised within a single system, but are increasingly generated, stored, and processed in a distributed manner across multiple nodes, devices, or sources. This shift is driven both by the growth in data volume and by the proliferation of decentralised architectures, such as distributed systems, edge computing, and federated environments. In this context, data are fragmented across multiple nodes with different imbalance levels and feature distributions. This introduces new challenges, as many traditional machine learning techniques have been designed under centralised assumptions. It is therefore necessary to analyse the extent to which preprocessing methods can be adapted to such scenarios. In this regard, distributed strategies for feature selection and sampling are studied, demonstrating that performance comparable to centralised approaches can be achieved when local heterogeneity and partition quality are explicitly taken into account. These results support the feasibility of scalable solutions for scenarios involving large data volumes or decentralised infrastructures. Finally, the thesis investigates the robustness of oversampling methods under reduced precision numerical representations, motivated by the increasing deployment of Machine Learning systems in resource constrained environments such as edge computing, embedded devices, and IoT infrastructures. The results show that the process of synthetic sample generation through oversampling techniques can remain stable under moderate reductions in numerical precision, preserving classification performance while significantly reducing memory requirements. This enables the design of more efficient and sustainable learning pipelines. Overall, the results demonstrate that classification in imbalanced scenarios should not be understood solely as a problem of class proportions, but as a multidimensional challenge in which class distribution, data geometry, numerical representation, and computational conditions interact simultaneously. By addressing these factors jointly, this tesis contributes to the development of more robust, efficient, scalable, and sustainable classification strategies for real-world imbalanced learning scenarios.

Description

Editor version

Rights

Os titulares dos dereitos de propiedade intelectual autorizan a visualización do contido desta tese a través de Internet, así como a súa reprodución, gravación en soporte informático ou impresión para o seu uso privado e/ou con fins de estudo e de investigación. En ningún caso se permite o uso lucrativo deste documento. Estes dereitos afectan tanto ao resumo da tese como ao seu contido Los titulares de los derechos de propiedad intelectual autorizan la visualización del contenido de esta tesis a través de Internet, así como su reproducción, grabación en soporte informático o impresión para su uso privado o con fines de investigación. En ningún caso se permite el uso lucrativo de este documento. Estos derechos afectan tanto al resumen de la tesis como a su contenido
Attribution-NonCommercial-ShareAlike 4.0 International
Os titulares dos dereitos de propiedade intelectual autorizan a visualización do contido desta tese a través de Internet, así como a súa reprodución, gravación en soporte informático ou impresión para o seu uso privado e/ou con fins de estudo e de investigación. En ningún caso se permite o uso lucrativo deste documento. Estes dereitos afectan tanto ao resumo da tese como ao seu contido Los titulares de los derechos de propiedad intelectual autorizan la visualización del contenido de esta tesis a través de Internet, así como su reproducción, grabación en soporte informático o impresión para su uso privado o con fines de investigación. En ningún caso se permite el uso lucrativo de este documento. Estos derechos afectan tanto al resumen de la tesis como a su contenido

Except where otherwise noted, this item's license is described as Os titulares dos dereitos de propiedade intelectual autorizan a visualización do contido desta tese a través de Internet, así como a súa reprodución, gravación en soporte informático ou impresión para o seu uso privado e/ou con fins de estudo e de investigación. En ningún caso se permite o uso lucrativo deste documento. Estes dereitos afectan tanto ao resumo da tese como ao seu contido Los titulares de los derechos de propiedad intelectual autorizan la visualización del contenido de esta tesis a través de Internet, así como su reproducción, grabación en soporte informático o impresión para su uso privado o con fines de investigación. En ningún caso se permite el uso lucrativo de este documento. Estos derechos afectan tanto al resumen de la tesis como a su contenido