HierDoc: 계층적 페이지-영역 증거 경로 탐색을 통한 긴 문서 시각 질의 응답
HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering
다중 페이지로 구성된 문서에 대한 시각 질의 응답은 페이지 및 영역 수준 모두에서 희소한 증거를 찾는 것을 필요로 합니다. 기존 방법들은 일반적으로 한 가지 수준에 더 중점을 두는 경향이 있습니다. 페이지 중심 방식은 주로 페이지 획득에 집중하며, 영역 연산은 주로 탐색 보조 역할을 수행합니다. 반면, 영역 중심 방식은 관련 페이지가 이미 제공되었다고 가정합니다. 결과적으로, 페이지 및 영역 선택은 독립적인 과정으로 남아 있으며, 연속적인 증거 결정 과정을 형성하지 못합니다. 본 논문에서는 HierDoc이라는 계층적 증거 경로 탐색 프레임워크를 제안합니다. HierDoc은 긴 문서의 증거 획득을 페이지에서 영역으로 이어지는 두 단계의 집합 예측 문제로 정의합니다. 페이지 정책은 전체 문서에서 관련 있는 증거 페이지를 선택하고, 선택된 페이지는 의미론적 요소들을 분석하기 위해 파싱됩니다. 이후, 영역 정책은 다운스트림 응답 모델에 전달될 의미론적 요소들을 선택합니다. 이러한 두 가지 정책은 단계별 GRPO(Generalized Reinforcement Policy Optimization)를 사용하여 세분화된 구조화된 집합 보상을 통해 최적화됩니다. 응답 모델은 선택된 전체 페이지와 함께 선택된 영역 이미지, OCR 텍스트 또는 표 데이터를 입력으로 받아 전역적인 맥락을 유지하면서도 상세한 증거에 집중할 수 있도록 합니다. 평가 결과, HierDoc은 오픈 소스 시스템 중에서 최고 성능 또는 경쟁력 있는 성능을 달성했으며, LongDocURL 데이터셋에서 가장 강력한 오픈 소스 기준 모델보다 16.87%의 성능 향상을 보였습니다. 추가적인 실험을 통해 선택된 영역 증거가 페이지 정보만 사용하는 시스템에 비해 정확도와 F1 점수 측면에서 각각 5.51% 및 4.82%의 성능 향상을 가져옴을 확인했습니다. 이러한 결과는 거친 수준의 페이지 경로 탐색과 세밀한 수준의 영역 경로 탐색을 통합된 증거 획득 과정의 연속적이고 독립적으로 최적화되는 단계로 구성하는 것이 유용함을 보여줍니다.
Multi-page document visual question answering requires locating sparse evidence at both the page and region levels. Existing approaches typically emphasize one level over the other: page-centric methods focus on page acquisition, with region operations serving mainly as navigation aids, whereas region-centric methods assume that the relevant pages have already been supplied. Consequently, page and region selection remain disconnected rather than forming successive evidence decisions. We propose HierDoc, a hierarchical evidence-routing framework that formulates long-document evidence acquisition as two-stage set prediction from pages to regions. A page policy selects evidence pages from the full document; these pages are then parsed for semantic elements, after which a region policy selects the elements passed to a downstream answer model. Both answer-agnostic policies are optimized with stage-wise GRPO using granularity-specific structured-set rewards. The answer model receives selected full pages together with selected region crops and OCR or table text, preserving global context while emphasizing fine-grained evidence. Across the evaluated benchmarks, HierDoc achieves state-of-the-art or competitive performance among open-weight systems, improving LongDocURL by 16.87% relative to the strongest reported open-weight baseline. Controlled ablations further show that selected regional evidence improves the page-only system in accuracy and F1 by 5.51% and 4.82%, respectively. These results demonstrate the benefit of organizing coarse page routing and fine-grained region routing as successive, separately optimized stages of a unified evidence-acquisition process.
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.