빠른 적대적 학습에서 발생하는 치명적인 과적합 뒤에 숨겨진 백도어 메커니즘 분석
Unveiling the Backdoor Mechanism Hidden Behind Catastrophic Overfitting in Fast Adversarial Training
빠른 적대적 학습(FAT)은 신경망의 적대적 공격에 대한 강건성을 향상시키는 효율성으로 인해 상당한 관심을 받고 있습니다. 그러나 FAT는 치명적인 과적합(CO) 현상에 취약하며, 이는 모델이 훈련 중에 사용된 특정 공격에 과도하게 적응하여 다른 공격에 대한 일반화 능력을 저하시키는 현상입니다. 기존 연구에서는 다양한 가설을 제시하고 CO를 완화하기 위한 여러 전략을 제안했지만, CO에 대한 체계적이고 직관적인 설명은 부족했습니다. 본 연구에서는 백도어라는 관점에서 CO를 혁신적으로 해석합니다. 경로 분할, 다양한 특징 예측, 그리고 CO에서 나타나는 보편적인 클래스 구별 트리거를 통해 CO를 학습 불가능한 작업의 일종인 약한 트리거 변형으로 개념화하며, 이를 통해 CO, 백도어 공격, 그리고 학습 불가능한 작업을 하나의 이론적 프레임워크 하에 통합합니다. 이러한 이해를 바탕으로, 우리는 다음과 같은 백도어에서 영감을 받은 전략들을 사용하여 CO를 완화합니다. (i) 일반적인 미세 조정, 선형 탐색, 또는 재초기화 기반 기술을 사용하여 CO에 영향을 받은 모델 파라미터를 재조정합니다. (ii) 모델 가중치의 비정상적인 편차를 조절하기 위해 가중치 이상 억제 제약을 도입합니다. 광범위한 실험을 통해 CO에 대한 우리의 해석을 뒷받침하고 제안된 완화 전략의 효과를 입증합니다.
Fast Adversarial Training (FAT) has attracted significant attention due to its efficiency in enhancing neural network robustness against adversarial attacks. However, FAT is prone to catastrophic overfitting (CO), wherein models overfit to the specific attack used during training and fail to generalize to others. While existing methods introduce diverse hypotheses and propose various strategies to mitigate CO, a systematic and intuitive explanation of CO remains absent. In this work, we innovatively interpret CO through the lens of backdoor. Through validations on pathway division, diverse feature predictions, and universal class distinguishable triggers in CO, we conceptualize CO as a weak trigger variant of unlearnable tasks, unifying CO, backdoor attacks, and unlearnable tasks under a common theoretical framework. Guided by this, we leverage several backdoor inspired strategies to mitigate CO: (i) Recalibrate CO affected model parameters using vanilla fine tuning, linear probing, or reinitialization-based techniques; (ii) Introduce a weight outlier suppression constraint to regulate abnormal deviations in model weights. Extensive experiments support our interpretation of CO and show the efficacy of the proposed mitigation strategies.
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.