OPIUM: 이중 목적 잠재 최적화를 통한 조향 외부 효과 및 과도한 거부 현상 완화
OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization
액티베이션 조향은 추론 시 대규모 언어 모델을 제어하는 경량 메커니즘을 제공하지만, 조향 벡터는 의도하지 않은 부작용을 초래할 수 있습니다. 유틸리티 벡터는 안전 기능을 약화시킬 수 있으며, 거부 벡터는 양성 프롬프트에 대해 과도한 거부를 유발할 수 있습니다. 본 논문에서는 OPIUM(Optimizing Protected Injections via Utility Manifolds)이라는 학습이 필요 없는 방법을 제안합니다. 이 방법은 표현 매칭을 통해 조향 벡터를 정제합니다. OPIUM은 두 가지 프롬프트 세트에 대한 참조 동작을 기반으로, 원하는 개입에 의해 유도되는 하위 스트림 표현을 유지하면서, 원래 벡터가 실패하는 프롬프트에서 더 안전한 참조 동작과 일치하는 새로운 조향 벡터를 최적화합니다. 본 연구는 조향 외부 효과 및 과도한 거부 현상 설정을 통해 OPIUM이 기존의 단순 조향 및 방향성 제거 방법보다 안전성과 유틸리티 간의 균형을 향상시킴을 보여줍니다. 이는 액티베이션 조향의 유해한 부작용이 종종 액티베이션 공간에서 직접 완화될 수 있음을 시사합니다.
Activation steering provides a lightweight mechanism for controlling large language models at inference time, but steering vectors can have unintended externalities: utility vectors may weaken safety behavior, while refusal vectors may induce over-refusal on benign prompts. We introduce OPIUM (Optimizing Protected Injections via Utility Manifolds), a training-free method for sanitizing steering vectors through representation matching. Given reference behaviors on two prompt sets, OPIUM optimizes a new steering vector that preserves the downstream representations induced by the desired intervention while matching a safer reference behavior on prompts where the original vector fails. Across steering-externality and over-refusal settings, OPIUM improves the safety--utility tradeoff relative to vanilla steering and directional ablation, suggesting that harmful side effects of activation steering can often be mitigated directly in activation space.
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.