2608.04322v1 Aug 05, 2026 cs.CL

DataRx: 누락된 정보에 대한 인식을 갖춘 샘플링을 통한 안전한 대규모 언어 모델의 작업별 미세 조정

DataRx: Missingness-Aware Sampling for Safer Large Language Model Task-Specific Fine-Tuning

Qianli Zhou
Qianli Zhou
Citations: 9
h-index: 1
Xinyang Deng
Xinyang Deng
Citations: 42
h-index: 3
Wen Jiang
Wen Jiang
Citations: 112
h-index: 7
Junbo Zhang
Junbo Zhang
Citations: 1,948
h-index: 17

작업별 미세 조정을 통해 대규모 언어 모델(LLM)의 성능을 향상시킬 수 있지만, 본 연구에서는 작업별 미세 조정이 정렬된 LLM의 안전 장치를 약화시킬 수 있다는 점을 밝혀냅니다. 미세 조정 과정에서 안전성을 유지하기 위한 널리 사용되는 전략은 안전 데이터를 포함하는 것입니다. 이전 연구에서는 무작위로 안전 데이터를 혼합하면 안전성 저하를 완화할 수 있지만, 어떤 안전 예제가 다른 예제보다 더 효과적인지에 대한 근본 원리는 여전히 불분명합니다. 본 논문에서는 안전 데이터 선택에 있어 누락된 정보에 대한 인식을 갖춘 샘플링 방법인 DataRx를 제안합니다. DataRx는 안전 샘플이 LLM의 안전 기능에서 누락된 부분을 채우는 안전 신호를 제공할 때 더 효과적이라는 가설을 기반으로 합니다. DataRx의 핵심 아이디어는 목표 모델의 기본 응답과 안전 참조 응답 간의 안전성 격차를 정량화하기 위해 이산적인 토큰이 아닌 고차원 숨겨진 표현을 활용하는 것입니다. 실험 결과, BeaverTails에서 추출한 1%의 추가적인 안전 샘플만을 사용하여 DataRx는 Llama3-8B-Instruct 모델의 평균 공격 성공률을 무작위 샘플링 시 59.23%에서 13.70%로 감소시켰습니다. 또한, DataRx는 기존의 안전 데이터 합성 방법을 함께 사용하여 미세 조정 과정에서의 안전 방어를 더욱 강화할 수 있습니다. 본 연구가 데이터 중심의 안전 연구에 영감을 주기를 바랍니다.

Original Abstract

Task-specific fine-tuning can improve the performance of large language models (LLMs) on downstream tasks. However, our study reveals that task-specific fine-tuning can also weaken the safety guardrails of aligned LLMs. A widely adopted strategy for preserving safety during fine-tuning is to incorporate safety data. Although previous studies have shown that randomly mixing safety data can alleviate safety degradation, the underlying principle determining why some safety examples are more effective than others still remains unclear. In this paper, we propose DataRx, a missingness-aware sampling method for selecting safety-critical examples. DataRx is based on the hypothesis that a safety sample is more effective when the selected examples provide safety signals that fill the missing parts of LLMs' safety capabilities. DataRx's key insight is leveraging high-dimensional hidden representations rather than discrete tokens to quantify the safety signal gap between the target model's native response and the safety reference response. The results show that, with only 1% additional safety samples from BeaverTails, DataRx reduces the average attack success rate of Llama3-8B-Instruct across seven downstream tasks from 59.23% under random sampling to 13.70%. In addition, DataRx can be combined with the existing safety data synthesis method to further enhance safety defenses during fine-tuning. We hope that DataRx will inspire more data-centric defense research.

0 Citations
0 Influential
8.5 Altmetric
42.5 Score
Original PDF

No Analysis Report Yet

This paper hasn't been analyzed by Gemini yet.

Log in to request an AI analysis.

댓글

댓글을 작성하려면 로그인하세요.

아직 댓글이 없습니다. 첫 번째 댓글을 남겨보세요!