| Title: | Defesa de backdoors em aprendizado de máquina: uma análise do estado da arte, benchmarks e aplicações |
| Author: | Dick, Mariana dos Santos |
| Abstract: |
Apesar dos avanços e da ampla adoção, o aprendizado de máquina permanece vulnerável a ataques adversariais, sendo os ataques de backdoor uma ameaça significativa à integridade dos modelos. Este estudo integra à plataforma de benchmark BackdoorBench o NFT (Augmented Neural Fine-Tuning), uma técnica recente de defesa de pós-treinamento que a ferramenta ainda não contemplava, e a avalia comparativamente sob um protocolo padronizado. Para fundamentar essa escolha, foi realizada uma Revisão Sistemática da Literatura (RSL) que categorizou as defesas conforme o estágio do ciclo de vida do modelo: pré-treinamento, treinamento, pós-treinamento e tempo de inferência. O NFT foi implementado como um novo módulo na plataforma, seguindo suas convenções, e avaliado em comparação com defesas existentes diante de uma variedade de ataques de backdoor no conjunto de dados CIFAR-10. Os resultados indicam que o NFT remove de forma eficaz backdoors de gatilho localizado, geométrico e dinâmico (BadNets, WaNet e InputAware), preservando a acurácia em dados limpos, equiparando-se às defesas de melhor desempenho e apresentando maior estabilidade entre execuções. Nesses casos, a avaliação independente em ambiente padronizado confirma o desempenho relatado pelos autores originais do método. Em contrapartida, sua eficácia contra gatilhos aditivos e de mesclagem é limitada, com mitigação apenas parcial do sinal aditivo do SIG e falha diante dos gatilhos de mesclagem (Blended) e de baixa frequência (LF), situações em que defesas baseadas em poda e desaprendizado se mostram superiores. Uma investigação controlada da discrepância entre esses resultados e os relatados na avaliação original do NFT atribuiu tal diferença a fatores do protocolo de avaliação, e não a falhas do método: a receita de treino do ataque, que altera a removibilidade do gatilho para toda a família de ajuste fino, e o orçamento de purificação, sob o qual o NFT reproduz o desempenho originalmente relatado. A análise demonstra que nenhuma defesa é dominante contra todos os tipos de ataque, evidenciando o compromisso entre a eficácia de mitigação e a preservação da utilidade do modelo. Despite its advances and widespread adoption, machine learning remains vulnerable to adversarial attacks, including backdoor attacks, which pose a significant threat to model integrity. This study integrates into the BackdoorBench benchmark platform a recent post-training defense technique that the tool did not yet include, NFT (Augmented Neural Fine-Tuning), and evaluates it comparatively under a standardized protocol. To support this choice, a Systematic Literature Review (SLR) was conducted, categorizing defenses by model lifecycle stage: pre-training, training, post-training, and inference time. NFT was implemented as a new module on the platform, following its conventions, and evaluated against existing defenses and a variety of backdoor attacks on the CIFAR-10 dataset. The results indicate that NFT effectively removes backdoors with localized, geometric, and dynamic triggers (BadNets, WaNet, and InputAware), preserving clean accuracy, matching the best-performing defenses, and exhibiting greater stability across runs. In these cases, the independent evaluation in a standardized environment confirms the performance reported by the method's original authors. In contrast, its effectiveness against additive and blending triggers is limited, with only partial mitigation of the additive SIG signal and failure against the blending (Blended) and low-frequency (LF) triggers, situations in which pruning- and unlearning-based defenses prove superior. A controlled investigation of the discrepancy between these results and those reported in NFT's original evaluation attributed the difference to factors of the evaluation protocol rather than to flaws in the method: the attack's training recipe, which changes the trigger's removability for the entire fine-tuning family, and the purification budget, under which NFT reproduces its originally reported performance. The analysis demonstrates that no defense is dominant against all attack types, highlighting a trade-off between mitigation effectiveness and model utility. |
| Description: | TCC (graduação) - Universidade Federal de Santa Catarina, Centro Tecnológico, Ciências da Computação. |
| URI: | https://repositorio.ufsc.br/handle/123456789/274085 |
| Date: | 2026-07-03 |
| Files | Size | Format | View | Description |
|---|---|---|---|---|
| TCC.pdf | 5.282Mb |
View/ |
TCC |