PRISM: 구조화된 다중 모드 데이터 합성 기반 우선순위 인식 루브릭 내부화
PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis
실제 환경의 다중 모드 지침은 종종 중요도가 다른 여러 요구 사항을 포함하지만, 대부분의 다중 모드 훈련 데이터는 여전히 지시사항 준수를 단일 질문에 대한 답변으로 단순화합니다. 본 연구에서는 이 간극을 **루브릭 이해**라는 관점에서 분석하며, 모델을 생성기로 평가하는 대신, 루브릭을 따르는 **실행자**로 간주합니다. 즉, 이미지와 함께 입력된 유형화되고 우선순위가 지정된 루브릭에 대해, 모델은 전체 판단을 내리기 전에 각 규칙을 확인해야 합니다. 이러한 설정을 지원하기 위해, 본 연구에서는 **PRISM**이라는 4단계 데이터 합성 프레임워크를 제안합니다. PRISM은 페르소나-태스크 쌍, 접두사 기반 규칙 집합, 품질 필터링된 루브릭, 구조화된 검증 추적을 생성합니다. 또한 **PRISM-Eval**을 소개하며, Loose 및 Strict 지표는 결정적인 매칭 방식을 사용하여 고정된 레이블에 대해 평가하므로, 추론 시점에 별도의 판단 모델이 필요하지 않습니다. PRISM은 1만 개의 합성 샘플만을 사용하여 Qwen3-VL-4B의 PRISM-Eval에서의 Strict 정확도를 9.5%에서 30.1%로 향상시키면서 일반적인 벤치마크에서의 평균 성능을 유지합니다. 또한 이러한 성능 향상은 밀집형 및 MoE 아키텍처를 가진 네 가지 추가 오픈 소스 MLLM에도 적용되어, 구조화된 루브릭 감독이 다중 규칙, 우선순위 인식이 가능한 다중 모드 지시사항 준수를 위한 확장 가능한 방법임을 시사합니다.
Real-world multimodal instructions often bundle multiple requirements with unequal importance, yet most multimodal training data still reduce instruction following to answering one self-contained question. We study this gap through rubric comprehension, which casts the model not as a generator measured against rubrics but as an executor that follows them: given an image and a typed, prioritized rubric, the model must verify each rule before producing an overall judgment. To support this setting, we propose PRISM, a four-stage data synthesis framework that produces persona--task pairs, prefix-guided rule sets, quality-filtered rubrics, and structured verification traces. We further introduce PRISM-Eval, whose Loose and Strict metrics use deterministic matching against fixed labels and therefore require no inference-time judge model. With only 10K synthesized samples, PRISM lifts Qwen3-VL-4B from 9.5% to 30.1% Strict accuracy on PRISM-Eval while preserving average performance on general benchmarks, and the gains transfer to four additional open-source MLLMs across dense and MoE architectures, suggesting that structured rubric supervision is a scalable path toward multi-rule, priority-aware multimodal instruction following.
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.