VideoArgus: 에이전트 기반의 기준점 연계 통합 평가 프레임워크 - 비디오 생성 및 편집
VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing
생성된 비디오를 평가하는 것은 여전히 어려운 과제입니다. 기존 벤치마크는 고정된 평가 콘텐츠에 의존하며, 비디오 생성 및 편집 설정의 일부만을 다루고, 그리고 점수에 대한 제한적인 증거만 제공합니다. 본 논문에서는 비디오 생성 및 편집의 다섯 가지 설정을 포괄하는 통합 기준점 연계 프레임워크인 VideoArgus를 소개합니다. VideoArgus는 각 입력 인스턴스에 대해 출력 내용과 무관한, 샘플별 기준점을 한 번 생성하고, 이를 사용하여 해당 후보 비디오를 모두 평가합니다. 이 기준점은 구체적인 기준, 채점 규칙, 실패 모드 및 증거 계획을 정의하며, 이는 특정 기준에 대한 VLM 질의 응답(QA) 및 시각적 도구를 통해 증거 기반의 기준 점수, 근거 및 진단 보고서를 생성하도록 안내합니다. 또한, 653개의 고품질 이미지와 416개의 고품질 비디오로 구성된 1,026개의 선별된 입력 인스턴스로 이루어진 VideoArgus-Bench를 구축했습니다. 이 벤치마크의 모든 기준점은 미리 생성되고 고정되어 공개되었습니다. 별도의 1,260개 비디오로 구성된 인간 심사 데이터셋에서, VideoArgus는 다섯 가지 작업 모두에서 해당 벤치마크별 평가 도구보다 인간 판단과의 Spearman 및 Kendall 상관 관계가 더 높습니다. 또한, 다양한 기준점 생성 방식과 평가 VLM 백본을 사용하더라도 모델 순위는 대체로 일관성을 유지합니다. 모든 코드와 데이터는 공개됩니다. 프로젝트 페이지: https://zzzmyyzeng.github.io/VideoArgus
Evaluating generated videos remains challenging because existing benchmarks rely on fixed evaluation content, cover only a subset of generation and editing settings, and provide limited evidence for their scores. We introduce VideoArgus, a unified rubric-grounded framework covering five video generation and editing settings. For each input instance, VideoArgus generates an output-blind, sample-specific rubric once and reuses it to evaluate all corresponding candidate videos. The rubric defines concrete criteria, scoring rules, failure modes, and evidence plans, which guide criterion-specific VLM QA and visual tools to produce evidence-grounded criterion scores, rationales, and a diagnostic report. We further construct VideoArgus-Bench, containing 1,026 curated input instances built from 653 high-quality images and 416 high-quality videos, with all benchmark rubrics pre-generated, frozen, and released. On a separate 1,260-video human-alignment set, VideoArgus achieves higher within-input Spearman and Kendall correlations with human judgments than the corresponding benchmark-specific evaluators across all five tasks. Model rankings also remain largely consistent across different rubric-generation and evaluation-VLM backbones. All code and data are released. Visit our project page: https://zzzmyyzeng.github.io/VideoArgus
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.