EG-VQA: 근거 기반 시각 자료 질의응답 평가: 시간적 증거를 활용한 검증 가능한 비디오 질의응답 벤치마크
EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence
최근 동영상 대규모 언어 모델(Video-LLM)의 발전은 동영상 질의응답(VideoQA) 분야에서 상당한 성능 향상을 가져왔습니다. 그러나 기존 벤치마크는 주로 답변의 정확성으로 평가되지만, 예측 결과가 관련 동영상 증거에 얼마나 잘 연결되는지는 대부분 간과됩니다. 이러한 답변 생성과 증거 이해 사이의 괴리를 해소하기 위해, 본 논문에서는 근거 기반 동영상 질의응답 벤치마크(EG-VQA)를 제안합니다. EG-VQA는 개방형 평가 프로토콜로서, 각 질의응답 쌍에 대해 관련된 시간적 증거가 명시적으로 주석 처리되어 있어, 답변과 함께 정확한 증거 위치 파악이 요구됩니다. EG-VQA는 2,067개의 동영상과 세분화된 증거 주석이 포함된 11,838개의 질의응답 쌍으로 구성됩니다. 예측된 증거를 평가하기 위해, 시간적 정렬 및 기준 증거와의 의미적 일관성을 동시에 측정하는 통합 지표인 Evidence-Grounded F1 (EG-F1)을 제시합니다. 실험 결과, 고성능의 독점 모델조차도 정확하게 증거를 연결하는 데 어려움을 겪으며, 이는 답변 정확성과 실제 증거 위치 파악 간의 근본적인 불일치를 드러냅니다. 이러한 격차를 해소하기 위해, 명시적인 지도 학습을 통해 학습된 근거 기반 추론 모델인 EG-Reasoner를 제안합니다. EG-Reasoner는 오픈 소스 모델 중에서 최첨단 성능을 달성했으며, 독점 시스템과 경쟁력 있는 결과를 보여주었습니다. 특히 반사실적 질문과 같은 추론이 필요한 작업에서 상당한 성능 향상이 관찰되었습니다. 이러한 결과는 단순히 모델 크기를 확장하는 것만으로는 견고한 동영상 이해를 확보하기에 부족하며, 신뢰할 수 있고 해석 가능한 VideoQA 시스템을 개발하기 위해서는 체계적인 증거 기반 지도 학습이 필수적임을 보여줍니다.
Recent advances in Video Large Language Models (Video-LLMs) have yielded promising performance on video question answering (VideoQA). Nevertheless, existing benchmarks are predominantly evaluated through answer correctness, while the grounding of predictions in relevant video evidence remains largely unexamined. This disconnect between answer generation and evidence understanding motivates the construction of the Evidence-Grounded Video Question Answering Benchmark (EG-VQA), an open-ended evaluation protocol in which each QA pair is explicitly annotated with supporting temporal evidence, thereby requiring joint reasoning and precise evidence localization. EG-VQA is comprised of 2,067 videos and 11,838 QA pairs with fine-grained evidence annotations. To evaluate predicted evidence, Evidence-Grounded F1 (EG-F1) is introduced as a unified metric in which temporal alignment and semantic consistency against ground-truth evidence are jointly measured. Experimental evaluation reveals that even strong proprietary models struggle to accurately ground their predictions, exposing a fundamental discrepancy between answer correctness and faithful evidence localization. To bridge this gap, EG-Reasoner, an evidence-grounded reasoning model trained with explicit supervision, is proposed. State-of-the-art performance is achieved among open-source models, with results competitive against proprietary systems, particularly pronounced gains are observed on reasoning-intensive tasks such as counterfactual questions. These findings demonstrate that scaling alone is insufficient for robust video understanding and that structured evidence supervision is essential for the development of more reliable and interpretable VideoQA systems.
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.