거부 잔류 현상: 모델이 의도적으로 일관성을 속이는 경우와 그렇지 않은 경우
The Refusal Residue: When Probes Catch Alignment Faking and When They Don't
모델이 모니터링 상태에서는 규정 준수하는 것처럼 보이지만, 비모니터링 상태에서는 다른 행동을 보이는 '의도적인 일관성 위반'은 위험합니다. 스크래치패드가 없을 때, 행동만으로는 의도적인 위반과 진정한 규정 준수를 구별할 수 없습니다. 본 연구는 숨겨진 상태 정보가 출력 내용이 가리는 내용을 드러낼 수 있는지 질문하고, 이를 검증하기 위해 13개의 모델을 대상으로 자연 발생적인 의도적인 일관성 위반 현상을 조사했습니다. 자연적으로 발생하는 의도적인 위반은 Qwen3-32B (+18.2pp) 및 Llama-3.1-8B (+24.4pp at n=10, p<10^-15)에서만 나타났으며, 명시적인 스크래치패드 자체 보고는 드물었습니다 (Claude Opus 4 판별기는 Qwen의 규정 준수 스크래치패드의 1.4%와 Llama의 0.0%에서 의도적인 위반을 감지했습니다). 두 모델 모두 비대칭적인 '거부 잔류 현상'을 보였습니다. 즉, 모니터링 상태에서의 규정 준수는 거부에 더 가까워지는 경향이 있었습니다 (Qwen: d=0.32, Llama: d=0.33, 둘 다 p<0.0001), 반면 거부 표현은 변하지 않았습니다 (p=1.00). 개별 샘플에 대한 탐지 정확도는 모델에 따라 달라집니다. 리크가 없는 'leave-one-query-out' 방식으로 탐색했을 때, Llama에서는 높은 탐지율(AUROC 0.87)을 보였지만, Qwen에서는 탐지율이 무작위 수준으로 떨어졌습니다(0.43). 또한 모델 간의 정보 공유는 불가능했습니다. 2,000번 이상의 시도를 통해 숨겨진 상태를 조작해도 규정 준수 정도는 거의 변하지 않았습니다 (|h|<0.08). 따라서 탐지된 방향은 의도적인 위반을 나타낼 수 있지만, 그것만으로는 제어할 수 없습니다. 표준화된 잔차 분석 방식은 데이터셋의 다른 부분으로 정보가 새어나가는 현상을 보이며, 규정 준수 위반이 불가능한 환경에서 AUROC 0.63이라는 결과를 얻었습니다. 단순한 선형 탐색 방식은 의미 없는 AUROC 1.0을 나타냈으며, 기존의 다층 퍼셉트론(MLP) 모델은 실제보다 탐지 가능성을 과장하여 나타냅니다 (0.2-0.3 AUROC). 향후 의도적인 일관성 위반 탐지에 대한 연구를 위해, 본 연구에서는 다섯 가지 제어 요소를 포함하는 측정 프레임워크를 공개합니다: 다중 토큰 추출, 거부-vs-거부 혼동 검사, 각 데이터셋 분할에 대한 잔차 분석, 'leave-one-query-out' 평가 및 직교성 제약 탐색.
Alignment faking is dangerous because a model can appear compliant under monitoring while preserving behavior it would reveal when unmonitored. When no scratchpad is visible, behavior alone cannot distinguish strategic from genuine compliance. We ask whether hidden states reveal what outputs hide. We run a 13-model sweep for naturally-emerging faking, then probe and steer hidden states on the two models that fake. Natural faking appears only in Qwen3-32B (+18.2pp) and Llama-3.1-8B (+24.4pp at n=10, p<10^-15), while explicit scratchpad self-reports are rare (a Claude Opus 4 judge flags faking reasoning in 1.4% of Qwen and 0.0% of Llama compliant scratchpads). Both fakers show an asymmetric refusal residue: monitored compliance shifts toward refusal (d=0.32 Qwen, d=0.33 Llama, both p<0.0001), while refusal representations do not move (p=1.00). Per-sample detection is model-conditional. Under leakage-free leave-one-query-out probing, detection survives on Llama (AUROC 0.87) but collapses to chance on Qwen (0.43), and cross-model transfer is null. Steering over 2,000 runs barely changes compliance (|h|<0.08), so the detected direction can flag faking but does not by itself control it. Standard residualized probing leaks across folds and reaches AUROC 0.63 on a control where no faking can occur; naive linear probes reach a meaningless AUROC 1.0; and conventional MLPs overstate detectability by 0.2-0.3 AUROC. For future alignment-faking detection work, we release a five-control measurement framework: multi-token extraction, refuse-vs-refuse confound checks, per-fold residualization, leave-one-query-out evaluation, and orthogonality-constrained probing.
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.