Flich Cardo, JoséHernández Luz, CarlesCatalán-Gallach, Izan2026-04-022026-04-022026-02-102026-03-25https://riunet.upv.es/handle/10251/233643[ES] Las redes neuronales se emplean ampliamente en entornos críticos como la sanidad, los vehículos autónomos o la videovigilancia. Para garantizar la seguridad de los sistemas que dependen de su funcionamiento, es esencial validar y garantizar su comportamiento correcto en presencia de fallos. Esta tesis investiga, en primer lugar, la redundancia a nivel de bit presente en modelos de última generación, en concreto modelos convolucionales, organizando los pesos en grupos estructurados y determinando las posiciones de bit invariantes dentro de dichos grupos. A partir de este análisis, se desarrollan dos mecanismos de protección ligeros y agnósticos al modelo. Estos mecanismos explotan dicha redundancia (sin requerir reentrenar al modelo ni duplicar la arquitectura): Fixed Protection (FP), que protege bits consecutivos, y Variable Protection (VP), que amplía la cobertura a bits invariantes no consecutivos. Se han llevado a cabo experimentos extensivos de inyección de fallos, consistentes en cambios aleatorios de bits en los pesos, con el fin de cuantificar la sensibilidad del modelo y su impacto en la precisión de la inferencia. Los modelos sin protección presentan, por lo general, una degradación de precisión comprendida entre 1.3% y más del 3%. Con FP y VP, sin embargo, el impacto de los bit flips se mitiga de forma sustancial, hasta valores entre el 0.0001% y el 0.4%, lo que supone una mejora de varios órdenes de magnitud. Ambos mecanismos están diseñados para ser computacionalmente eficientes y portables, y pueden aplicarse tanto a modelos convolucionales como no convolucionales. Por último, implementamos nuestros mecanismos en GPUs y en un acelerador basado en FPGA, validando el uso de los mecanismos de protección en entornos de ejecución reales. La implementación en GPU aprovecha NVIDIA CUTLASS y PyTorch, mientras que la implementación en FPGA incorpora módulos dedicados de enmascaramiento en un acelerador en flujo sin alterar la tubería de cómputo principal. En conjunto, los resultados muestran que aprovechar la redundancia a nivel de bit constituye un enfoque eficaz, eficiente y general para aumentar la tolerancia a fallos de las redes neuronales modernas.[CA] Les xarxes neuronals s'utilitzen àmpliament en entorns crítics com la sanitat, els vehicles autònoms o la videovigilància. Per garantir la seguretat dels sistemes que depenen del seu funcionament, és essencial validar i garantir el seu comportament correcte en presència de fallades. Aquesta tesi investiga, en primer lloc, la redundància a nivell de bit present en models d'última generació, en concret models convolucionals, organitzant els pesos en grups estructurats i determinant les posicions de bit invariants dins d'aquests grups. A partir d'aquest anàlisi, es desenvolupen dos mecanismes de protecció lleugers i agnòstics al model. Aquests mecanismes exploten aquesta redundància sense requerir reentrenament dels models ni duplicació arquitectònica: Fixed Protection (FP), que protegeix bits consecutius, i Variable Protection (VP), que amplia la cobertura a bits invariants no consecutius. S'han dut a terme experiments extensius d'injecció de fallades, consistents en canvis aleatoris de bits als pesos, amb l'objectiu de quantificar la sensibilitat del model i el seu impacte en la precisió de la inferència. Els models sense protecció presenten, en general, una degradació de la precisió compresa entre l'1,3% i més del 3%. Amb FP i VP, tanmateix, les fallades de tipus bit flip es mitiguen de manera substancial, fins a valors entre el 0,0001% i el 0,4%, la qual cosa suposa una millora de diversos ordres de magnitud. Ambdós mecanismes estan dissenyats per ser computacionalment eficients i portables, i es poden aplicar tant a models convolucionals com a models no convolucionals. Finalment, s'implementa la integració pràctica dels nostres mecanismes en GPUs i en un accelerador basat en FPGA, validant l'ús dels mecanismes de protecció en entorns d'execució reals. La implementació en GPU aprofita NVIDIA CUTLASS i PyTorch, mentre que la implementació en FPGA incorpora mòduls dedicats d'emmascarament en un accelerador en flux sense alterar el pipeline de càlcul principal. En conjunt, els resultats mostren que aprofitar la redundància a nivell de bit constitueix un enfocament eficaç, eficient i general per augmentar la tolerància a fallades de les xarxes neuronals modernes.[EN] Neural networks are widely used in critical environments such as healthcare, autonomous vehicles, and video surveillance. To ensure the safety of systems that rely on their operation, it is essential to validate and guarantee correct behaviour in the presence of faults. This thesis first investigates bit-level redundancy in state-of-the-art convolutional neural network models by organising weights into structured groups and identifying invariant bit positions within those groups. Building on this analysis, two lightweight, model-agnostic protection mechanisms are developed. These mechanisms exploit such redundancy without requiring network retraining or architectural duplication: Fixed Protection (FP), which safeguards consecutive bits in each weight element, and Variable Protection (VP), which extends coverage to non-consecutive invariant bits. To validate the effectiveness of the proposed fault-protection mechanisms, extensive fault-injection experiments involving random bit flips in weights are conducted to quantify model sensitivity and the impact on inference accuracy. Unprotected models typically exhibit an accuracy degradation ranging from 1.3% to over 3%. With FP and VP, however, the impact of bit flips is substantially mitigated, down to between 0.0001% and 0.4%, representing an improvement of several orders of magnitude. These mechanisms are designed to be computationally efficient and portable, and can be applied to both convolutional and non-convolutional models. Finally, we implement support for our mechanisms on both GPUs and an FPGA-based accelerator, validating their use in real execution environments. The GPU implementation leverages NVIDIA CUTLASS and PyTorch, while the FPGA implementation incorporates dedicated masking modules in a streaming accelerator without altering the core compute pipeline. Collectively, these results show that exploiting bit-level redundancy provides an effective, efficient, and general approach to enhancing the fault tolerance of modern neural networks.153Reserva de todos los derechosFault toleranceNeural NetworksGPUConvolutionFault Tolerance Based on Bit-Level Redundancy for Neural Network ModelsTesis doctoral10.4995/Thesis/10251/233643Abierto08.- Fomentar el crecimiento económico sostenido, inclusivo y sostenible, el empleo pleno y productivo, y el trabajo decente para todos09.- Desarrollar infraestructuras resilientes, promover la industrialización inclusiva y sostenible, y fomentar la innovación