2608.05485v1 Aug 06, 2026 cs.CV

VideoArgus: 에이전트 기반의 기준점 연계 통합 평가 프레임워크 - 비디오 생성 및 편집

VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing

Ziyun Zhang
Ziyun Zhang
Citations: 0
h-index: 0
Hang Hua
Hang Hua
Citations: 121
h-index: 6
Ziyun Zeng
Ziyun Zeng
Citations: 180
h-index: 7
Yongsheng Yu
Yongsheng Yu
Citations: 113
h-index: 4
Jiebo Luo
Jiebo Luo
Citations: 223
h-index: 7

생성된 비디오를 평가하는 것은 여전히 어려운 과제입니다. 기존 벤치마크는 고정된 평가 콘텐츠에 의존하며, 비디오 생성 및 편집 설정의 일부만을 다루고, 그리고 점수에 대한 제한적인 증거만 제공합니다. 본 논문에서는 비디오 생성 및 편집의 다섯 가지 설정을 포괄하는 통합 기준점 연계 프레임워크인 VideoArgus를 소개합니다. VideoArgus는 각 입력 인스턴스에 대해 출력 내용과 무관한, 샘플별 기준점을 한 번 생성하고, 이를 사용하여 해당 후보 비디오를 모두 평가합니다. 이 기준점은 구체적인 기준, 채점 규칙, 실패 모드 및 증거 계획을 정의하며, 이는 특정 기준에 대한 VLM 질의 응답(QA) 및 시각적 도구를 통해 증거 기반의 기준 점수, 근거 및 진단 보고서를 생성하도록 안내합니다. 또한, 653개의 고품질 이미지와 416개의 고품질 비디오로 구성된 1,026개의 선별된 입력 인스턴스로 이루어진 VideoArgus-Bench를 구축했습니다. 이 벤치마크의 모든 기준점은 미리 생성되고 고정되어 공개되었습니다. 별도의 1,260개 비디오로 구성된 인간 심사 데이터셋에서, VideoArgus는 다섯 가지 작업 모두에서 해당 벤치마크별 평가 도구보다 인간 판단과의 Spearman 및 Kendall 상관 관계가 더 높습니다. 또한, 다양한 기준점 생성 방식과 평가 VLM 백본을 사용하더라도 모델 순위는 대체로 일관성을 유지합니다. 모든 코드와 데이터는 공개됩니다. 프로젝트 페이지: https://zzzmyyzeng.github.io/VideoArgus

Original Abstract

Evaluating generated videos remains challenging because existing benchmarks rely on fixed evaluation content, cover only a subset of generation and editing settings, and provide limited evidence for their scores. We introduce VideoArgus, a unified rubric-grounded framework covering five video generation and editing settings. For each input instance, VideoArgus generates an output-blind, sample-specific rubric once and reuses it to evaluate all corresponding candidate videos. The rubric defines concrete criteria, scoring rules, failure modes, and evidence plans, which guide criterion-specific VLM QA and visual tools to produce evidence-grounded criterion scores, rationales, and a diagnostic report. We further construct VideoArgus-Bench, containing 1,026 curated input instances built from 653 high-quality images and 416 high-quality videos, with all benchmark rubrics pre-generated, frozen, and released. On a separate 1,260-video human-alignment set, VideoArgus achieves higher within-input Spearman and Kendall correlations with human judgments than the corresponding benchmark-specific evaluators across all five tasks. Model rankings also remain largely consistent across different rubric-generation and evaluation-VLM backbones. All code and data are released. Visit our project page: https://zzzmyyzeng.github.io/VideoArgus

0 Citations
0 Influential
3.5 Altmetric
17.5 Score
Original PDF

No Analysis Report Yet

This paper hasn't been analyzed by Gemini yet.

Log in to request an AI analysis.

댓글

댓글을 작성하려면 로그인하세요.

아직 댓글이 없습니다. 첫 번째 댓글을 남겨보세요!