행동 지표(Behavioral Canaries): 강화 학습 미세 조정 과정에서 개인 정보가 포함된 검색된 컨텍스트 사용 여부 감사
Behavioral Canaries: Auditing Private Retrieved Context Usage in RL Fine-Tuning
에이전트 기반 워크플로우에서 LLM은 종종 법적으로 추가 훈련이 제한되는 검색된 컨텍스트를 처리합니다. 그러나 현재 감사 담당자는 제공자가 이러한 데이터를 사후 훈련, 특히 강화 학습(RL)을 통해 포함시켜 서비스 약관을 위반했는지 여부를 신뢰성 있게 확인할 수 있는 방법이 부족합니다. 기존의 감사는 주로 정확한 기억 및 멤버십 추론에 의존하지만, 이러한 방법은 특정 사실 암기보다는 모델의 행동 양식에 주로 영향을 미치는 RL 학습된 모델에는 효과적이지 않습니다. 이러한 격차를 해소하기 위해, 우리는 강화 학습 미세 조정 파이프라인을 위한 새로운 감사 메커니즘인 '행동 지표(Behavioral Canaries)'를 소개합니다. 이 프레임워크는 문서 트리거와 함께 고유한 스타일의 응답을 유도하는 피드백을 결합하여 선호도 데이터를 구성하며, 이러한 데이터가 훈련에 사용될 경우 잠재적인 트리거 기반 선호도를 유발합니다. 실험 결과, 이러한 행동적 신호는 승인되지 않은 문서 기반 훈련 여부를 감지하는 데 활용될 수 있으며, 1%의 '행동 지표' 주입률에서 67%의 탐지율과 10%의 오탐율(AUROC = 0.756)을 달성했습니다. 더욱 광범위하게, 우리의 연구 결과는 강화 학습 미세 조정 파이프라인에 대한 새로운 감사 메커니즘인 '행동 지표'를 확립하며, 감사 담당자가 특정 사실 암기가 아닌 분포적 행동 변화의 형태로 나타나는 훈련 과정에서의 영향을 테스트할 수 있도록 합니다. 저희 코드는 다음 링크에서 확인할 수 있습니다: https://github.com/CRChenCode/behavioral_canary.
In agentic workflows, LLMs frequently process retrieved contexts that are legally protected from further training. However, auditors currently lack a reliable way to verify if a provider has violated the terms of service by incorporating these data into post-training, especially through Reinforcement Learning (RL). While standard auditing relies on verbatim memorization and membership inference, these methods are ineffective for RL-trained models, as RL primarily influences a model's behavioral style rather than the retention of specific facts. To bridge this gap, we introduce Behavioral Canaries, a new auditing mechanism for RLFT pipelines. The framework instruments preference data by pairing document triggers with feedback that rewards a distinctive stylistic response, inducing a latent trigger-conditioned preference if such data are used in training. Empirical results show that these behavioral signals enable detection of unauthorized document-conditioned training, achieving a 67% detection rate at a 10% false-positive rate (AUROC = 0.756) at a 1% canary injection rate. More broadly, our results establish behavioral canaries as a new auditing mechanism for RLFT pipelines, enabling auditors to test for training-time influence even when such influence manifests as distributional behavioral change rather than memorization. We release our code at: https://github.com/CRChenCode/behavioral_canary.
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.