LLM 에이전트의 정책 내 규칙 충돌 진단: 해결 과정 관찰 프로파일을 활용
Diagnosing Live Within-Policy Instruction Conflicts in LLM Agents with Witnessed Resolution Profiles
LLM(Large Language Model) 에이전트는 장기간 유지되는 자연어 프롬프트 정책에 의해 제어되지만, 개별적으로는 합리적인 규칙들이 예상치 못한 방식으로 상호 작용할 수 있습니다. 본 연구에서는 실시간으로 정책 내 규칙 충돌을 진단하는 방법을 연구합니다. 즉, 단일 프롬프트 정책 내에서 현실적인 상태를 동시에 규제할 수 있는 규칙 쌍을 찾아내고, 모델이 응답 또는 도구 사용 시 이러한 제약 조건에 어떻게 대응하는지를 측정합니다. 우리는 WIRE(Witnessed Intra-policy Rule Evaluation)라는 새로운 파이프라인을 소개합니다. WIRE는 소스 기반 규칙을 추출하고, 이를 PyRule 절로 인코딩하며, 만족 가능성 검사를 통해 유사한 의미를 가진 충돌 후보를 선별합니다. 그런 다음 이러한 후보를 구체적인 공동 규제 사례(witness)로 구현하고, 모델의 출력 결과를 원래 소스 규칙 텍스트와 비교하여 평가합니다. 여섯 가지 공개 프롬프트 정책에 대해 WIRE는 276개의 소스 규칙과 560개의 원자 절을 추출하고, 30,944개의 정책 내 절-쌍 비교를 수행하며, 170개의 인코딩된 충돌 후보 소스 규칙 쌍을 선별하여 1,402개의 구체적인 사례로 구현합니다. 정책만을 평가 기준으로 사용할 때, 이러한 사례들은 생성 후 13,335회의 실험에서 두 개의 소스 규칙이 모두 적용되고 준수 여부를 판단할 수 있는 상황을 제공합니다. 이 중 35.4%만이 모든 규칙을 준수하는 반면, 64.6%는 적어도 하나의 규제된 소스 규칙을 위반합니다. 이러한 프로파일은 WIRE에서 선택한 후보에 대한 조건부 진단 결과이며, 배포 빈도 또는 오류 발생 원인 추정치를 나타내는 것은 아닙니다. 하지만 이러한 데이터는 정책, 모델 및 도구 사용 방식에 따른 다양한 해결 패턴을 보여줍니다.
LLM agents are governed by long-lived natural-language prompt policies, but individually reasonable standing rules can interact in uninspected ways. We study live intra-policy rule-conflict diagnosis: finding rule pairs inside a single prompt policy that can co-govern a realistic state, and measuring how models resolve that pressure in responses or tool actions. We introduce WIRE, a Witnessed Intra-policy Rule Evaluation pipeline. WIRE extracts source-grounded rules, encodes them as PyRule clauses, uses satisfiability checks to retain same-surface hard-collision candidates, realizes those candidates as concrete co-governance witnesses, and judges model outputs against the original source-rule text. Across six public prompt policies, WIRE extracts 276 source rules and 560 atomic clauses, classifies 30,944 within-policy clause-pair comparisons, retains 170 encoded hard-collision candidate source-rule pairs, and realizes them as 1,402 concrete witnesses. In policy-only evaluation, these witnesses yield 13,335 post- generation trials where both source rules govern and both compliance labels are judgeable. Only 35.4% fall in joint compliance; 64.6% violate at least one governed source rule. These profiles are conditional diagnostics for WIRE-selected candidates, not deployment-frequency or causal excess failure estimates, but they reveal distinct policy, model, and tool-action resolution patterns.
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.