Selección de características basada en información mutua para datos positive-unlabeled

UDC.coleccionTraballos académicos
UDC.tipotrabTFG
UDC.titulacionGrao en Ciencia e Enxeñaria de datos
dc.contributor.advisorBolón-Canedo, Verónica
dc.contributor.advisorMorán-Fernández, Laura
dc.contributor.authorVila Vivero, Verónica
dc.contributor.otherUniversidade da Coruña. Facultade de Informática
dc.date.accessioned2026-09-23T10:59:03Z
dc.date.available2026-09-23T10:59:03Z
dc.date.issued2026-06
dc.description.abstract[Resumen] En muchos problemas reales de aprendizaje automático, obtener etiquetas para todos los ejemplos resulta inviable. El escenario Positive-Unlabeled (PU) modela esta situación: solo se dispone de positivos etiquetados, mientras que el resto permanece sin etiquetar, pudiendo contener tanto negativos reales como positivos ocultos. Tratar directamente los ejemplos no etiquetados como negativos introduce un sesgo sistemático que afecta a la selección de características. Este trabajo propone un método de selección de características basado en información mutua adaptado al escenario PU, que corrige dicho sesgo estimando la probabilidad real de pertenencia a la clase positiva mediante el marco probabilístico de Elkan y Noto. La propuesta se evalúa experimentalmente sobre nueve conjuntos de datos de distinta naturaleza y dimensionalidad, comparando los rankings obtenidos frente a enfoques alternativos y analizando su impacto en el rendimiento de clasificación.
dc.description.abstract[Abstract] In many real-world machine learning problems, obtaining labels for all instances is infeasible. The Positive-Unlabeled (PU) learning scenario models this situation: only a subset of positive examples is labeled, while the remaining instances are unlabeled and may contain both true negatives and hidden positives. Treating unlabeled examples directly as negatives introduces a systematic bias that affects feature selection. This work proposes a mutual information-based feature selection method adapted to the PU setting, which corrects this bias by estimating the true probability of belonging to the positive class using the probabilistic framework of Elkan and Noto. The proposal is experimentally evaluated on nine datasets of varying nature and dimensionality, comparing the obtained rankings against alternative approaches and analyzing their impact on classification performance.
dc.description.traballosTraballo fin de grao (UDC.FIC). Ciencia e enxeñaría de datos. Curso 2025/2026
dc.identifier.urihttps://hdl.handle.net/2183/49397
dc.language.isospa
dc.rightsAttribution-NonCommercial-NoDerivatives 4.0 Internationalen
dc.rights.accessRightsembargoed access
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/4.0/
dc.subjectAprendizaje Positive-Unlabeled
dc.subjectSelección de características
dc.subjectInformación mutua
dc.subjectEstimación de α
dc.subjectHipótesis SCAR
dc.subjectCorrelación de Spearman
dc.subjectAlta dimensionalidad
dc.subjectSesgo de etiquetado
dc.subjectPositive-Unlabeled learning
dc.subjectFeature selection
dc.subjectMutual information
dc.subjectα estimation
dc.subjectSCAR assumption
dc.subjectSpearman correlation
dc.subjectHigh dimensionality
dc.subjectLabeling bias
dc.titleSelección de características basada en información mutua para datos positive-unlabeled
dc.typebachelor thesis
dspace.entity.typePublication
relation.isAdvisorOfPublicationc114dccd-76e4-4959-ba6b-7c7c055289b1
relation.isAdvisorOfPublicationdfd64126-0d31-4365-b205-4d44ed5fa9c0
relation.isAdvisorOfPublication.latestForDiscoveryc114dccd-76e4-4959-ba6b-7c7c055289b1

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
VilaVivero_Veronica_TFG_2026.pdf
Size:
2.56 MB
Format:
Adobe Portable Document Format