Estudio comparativo de técnicas de cuantización extrema aplicadas a sistemas de recomendación basados en factorización de matrices
| UDC.coleccion | Traballos académicos | |
| UDC.tipotrab | TFG | |
| UDC.titulacion | Grao en Ciencia e Enxeñaria de datos | |
| dc.contributor.advisor | Eiras-Franco, Carlos | |
| dc.contributor.advisor | Paz Ruza, Jorge | |
| dc.contributor.author | Armenteros Lobato, Pablo | |
| dc.contributor.other | Universidade da Coruña. Facultade de Informática | |
| dc.date.accessioned | 2026-09-21T08:40:54Z | |
| dc.date.available | 2026-09-21T08:40:54Z | |
| dc.date.issued | 2026-06 | |
| dc.description.abstract | [Resumen] Los sistemas de recomendación basados en factorización de matrices concentran la mayor parte de su tamaño en las matrices de embeddings de usuarios e ítems, lo que penaliza su almacenamiento, su latencia de inferencia y su consumo energético. La comunidad de modelos de lenguaje ha desarrollado técnicas de cuantización extrema (BitNet, BitNet b1.58, BitLinear, TurboQuant) capaces de reducir la representación a uno o dos bits por parámetro sin apenas perder calidad, sobre todo cuando se combinan con entrenamiento consciente de la cuantización. Su traslación al ámbito de la recomendación, sin embargo, está poco estudiada. Este Trabajo de Fin de Grado implementa y compara, bajo un marco común, diez variantes de cuantización sobre un modelo de factorización de matrices: dos baselines congeladas, siete con entrenamiento consciente de la cuantización y una post-entrenamiento. Los hiperparámetros se ajustan con Optuna y cada modelo se evalúa por RMSE, tamaño, tiempo de entrenamiento, latencia de inferencia y emisiones de CO2, sobre tres conjuntos de MovieLens y sobre Netflix Prize, promediando los resultados sobre varias particiones aleatorias de cada conjunto (tres en MovieLens, dos en Netflix por su coste). Un experimento adicional aísla el efecto de la cuantización del de la dimensión del embedding. La cuantización extrema resulta viable siempre que el entrenamiento sea consciente de ella. BitNet b1.58 se sitúa en el óptimo de Pareto en compresión: en MovieLens-1M reduce el tamaño unas nueve veces con una degradación de RMSE de poco más de medio punto porcentual, mientras que la rotación aleatoria de TurboQuant iguala al modelo en plena precisión con la mayor fidelidad. Cuantizar un modelo ya entrenado, en cambio, degrada la calidad hasta equipararse a una baseline sin aprendizaje, lo que confirma que entrenar teniendo en cuenta la cuantización es imprescindible. En la práctica, estas técnicas recortan la huella de memoria y el consumo energético del recomendador y facilitan su despliegue en hardware con recursos limitados, a cambio de integrar la cuantización en el flujo de entrenamiento desde el principio. | |
| dc.description.abstract | [Abstract] Matrix-factorization-based recommender systems concentrate most of their storage cost in user and item embedding matrices, which penalizes storage, inference latency and energy consumption. The language-model community has developed extreme-quantization techniques (BitNet, BitNet b1.58, BitLinear, TurboQuant) able to compress weights down to one or two bits per parameter while retaining most of the model’s quality, especially when combined with quantization-aware training. Their transfer to recommender systems, however, remains largely unexplored. This Bachelor’s Thesis implements and compares, under a common framework, ten quantization variants applied to a matrix-factorization model: two frozen baselines, seven quantization-aware variants and one post-training variant. The hyperparameters of each variant are tuned with Optuna and every model is evaluated under RMSE, model size, training time, inference latency and CO2 emissions, over three MovieLens datasets and the Netflix Prize dataset, averaging the results across several random splits of each dataset (three for MovieLens, two for Netflix due to its cost). An additional experiment isolates the effect of quantization from that of the embedding dimension. The results show that extreme quantization is viable in matrix factorization as long as training is quantization-aware. BitNet b1.58 emerges as the Pareto optimum for compression: on MovieLens-1M it shrinks the model roughly ninefold with just over half a percent of RMSE degradation, while TurboQuant’s random rotation matches the full-precision model with the highest fidelity among all variants. Quantizing an already-trained model, by contrast, degrades quality down to the level of a baseline without learning, confirming that quantization-aware training is essential in this regime. In practical terms, these techniques cut the recommender’s memory footprint and energy consumption and ease its deployment on resource-constrained hardware, at the cost of integrating quantization into the training pipeline from the outset. | |
| dc.description.traballos | Traballo fin de grao (UDC.FIC). Ciencia e enxeñaría de datos. Curso 2025/2026 | |
| dc.identifier.uri | https://hdl.handle.net/2183/49328 | |
| dc.language.iso | spa | |
| dc.rights | Attribution-NonCommercial-ShareAlike 4.0 International | en |
| dc.rights.accessRights | open access | |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc-sa/4.0/ | |
| dc.subject | Sistemas de recomendación | |
| dc.subject | Factorización de matrices | |
| dc.subject | Cuantización extrema | |
| dc.subject | BitNet b1.58 | |
| dc.subject | TurboQuant | |
| dc.subject | Entrenamiento consciente de la cuantización | |
| dc.subject | MovieLens | |
| dc.subject | Netflix Prize | |
| dc.subject | Quantization-aware training | |
| dc.subject | Recommender systems | |
| dc.subject | Matrix factorization | |
| dc.subject | Extreme quantization | |
| dc.title | Estudio comparativo de técnicas de cuantización extrema aplicadas a sistemas de recomendación basados en factorización de matrices | |
| dc.type | bachelor thesis | |
| dspace.entity.type | Publication | |
| relation.isAdvisorOfPublication | ca60a4d3-b38f-4d91-bfa6-f855a8e171ab | |
| relation.isAdvisorOfPublication | c91f7d18-38fb-42b8-8be2-b402a40b10c5 | |
| relation.isAdvisorOfPublication.latestForDiscovery | ca60a4d3-b38f-4d91-bfa6-f855a8e171ab |
Files
Original bundle
1 - 1 of 1
Loading...
- Name:
- ArmenterosLobato_Pablo_TFG_2026.pdf
- Size:
- 2.08 MB
- Format:
- Adobe Portable Document Format

