Use this link to cite:
https://hdl.handle.net/2183/45543 Neural network compression through sparse formats
Loading...
Identifiers
Publication date
Authors
Seco Anderson, Marcos
Advisors
Other responsabilities
Universidade da Coruña. Facultade de Informática
Journal Title
Bibliographic citation
Type of academic work
Academic degree
Abstract
[Abstract]: As the scale and complexity of artificial neural networks continues to grow, deploying them efficiently in constrained environments becomes increasingly challenging. This thesis explores neural network pruning as a technique for reducing model size and computational cost without significantly compromising predictive accuracy. Pruning removes unimportant weights or structures from a model, inducing sparsity that can be used to accelerate inference and reduce memory usage. The study begins with a survey of existing pruning strategies and considers their theoretical motivations and practical considerations. A selection of these techniques is then implemented and evaluated on publicly available neural network architectures using the ShrinkBench benchmarking framework. The evaluation not only measures the compression and performance impact of pruning, but also assesses the effectiveness of the selected strategies, determining whether they meet practical standards for accuracy retention and efficiency. Beyond pruning itself, the thesis examines the role of sparse matrix formats in representing pruned networks efficiently. Several formats are theoretically analyzed with respect to their compression ratios, memory footprint and computational performance. A comparative evaluation is conducted to determine how the choice of a pruning strategy influences the efficiency and inference speedup. The results demonstrate that combining pruning with appropriate sparse representations yields substantial reductions in storage and computation.
[Resumo]: A medida que a escala e a complexidade das redes neuronais artificiais seguen crecendo, o seu despregue de xeito eficiente en contornas con recursos limitados convértese nun reto crecente. Esta tese explora a poda de redes neuronais como unha técnica para reducir o tamaño do modelo e o custo computacional sen comprometer significativamente a precisión preditiva. A poda elimina pesos ou estruturas irrelevantes dun modelo, introducindo formatos dispersos, os cales se poden aproveitar para a aceleración da inferenza e reducir o uso da memoria. O estudo comeza cunha análise dalgunhas estratexias de poda existentes, teñendo en conta os seus fundamentos teóricos e consideracións prácticas. Posteriormente, impleméntanse dúas técnicas en arquitecturas de redes neuoronais dispoñibles publicamente utilizando o marco de referencia (framework) ShrinkBench. A avaliación non só mide o impacto da poda na compresión e o rendemento, senón que tamén avalía a eficacia das estratexias seleccionadas. Ademáis, a tese examina o papel dos formatos de matriz dispersos para a representación eficiente de redes podadas. Analízanse diversos formatos a nivel teórico en relación cos niveis de consumo de memoria e o seu rendemento computacional. Os resultados demostran que a combinación da poda e a súa respectiva representación en formatos disperos produce reducións substanciais no almacenamento e o cómputo, o que facilita a implementación de modelos de apredizaxe profunda en plataformas con recursos limitados.
[Resumo]: A medida que a escala e a complexidade das redes neuronais artificiais seguen crecendo, o seu despregue de xeito eficiente en contornas con recursos limitados convértese nun reto crecente. Esta tese explora a poda de redes neuronais como unha técnica para reducir o tamaño do modelo e o custo computacional sen comprometer significativamente a precisión preditiva. A poda elimina pesos ou estruturas irrelevantes dun modelo, introducindo formatos dispersos, os cales se poden aproveitar para a aceleración da inferenza e reducir o uso da memoria. O estudo comeza cunha análise dalgunhas estratexias de poda existentes, teñendo en conta os seus fundamentos teóricos e consideracións prácticas. Posteriormente, impleméntanse dúas técnicas en arquitecturas de redes neuoronais dispoñibles publicamente utilizando o marco de referencia (framework) ShrinkBench. A avaliación non só mide o impacto da poda na compresión e o rendemento, senón que tamén avalía a eficacia das estratexias seleccionadas. Ademáis, a tese examina o papel dos formatos de matriz dispersos para a representación eficiente de redes podadas. Analízanse diversos formatos a nivel teórico en relación cos niveis de consumo de memoria e o seu rendemento computacional. Os resultados demostran que a combinación da poda e a súa respectiva representación en formatos disperos produce reducións substanciais no almacenamento e o cómputo, o que facilita a implementación de modelos de apredizaxe profunda en plataformas con recursos limitados.
Description
Editor version
Rights
Attribution 4.0 International







