2606.23019v1 Jun 22, 2026 cs.CV

ScalingAttention: 비디오 디퓨전 트랜스포머를 위한 내재적 희소 어텐션 토폴로지 발견

ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers

Chengru Song
Chengru Song
Citations: 304
h-index: 6
Rui Zhou
Rui Zhou
Citations: 81
h-index: 4
Xuecheng Wu
Xuecheng Wu
Citations: 44
h-index: 3
Kang He
Kang He
Citations: 14
h-index: 2
Guangyun Han
Guangyun Han
Citations: 13
h-index: 1
Bin Liu
Bin Liu
Citations: 0
h-index: 0
Qinqin Chen
Qinqin Chen
Citations: 1
h-index: 1
Wende Xu
Wende Xu
Citations: 0
h-index: 0
Qingjie Zhao
Qingjie Zhao
Citations: 0
h-index: 0

디퓨전 트랜스포머(DiTs)는 고품질 비디오 생성에 혁명을 가져왔지만, 3차원 전체 어텐션에 의존하기 때문에 계산 복잡도가 제곱으로 증가하는 병목 현상이 발생합니다. 기존의 희소화 방법은 다음과 같은 어려움에 직면합니다. 동적 가지치기는 과도한 실행 시간 오버헤드와 메모리 단편화를 초래하고, 정적인 휴리스틱 방법은 미세한 의존성을 제대로 반영하지 못합니다. 본 연구에서는 ScalingAttention이라는 학습이 필요 없는 프레임워크를 제안합니다. 이는 다음과 같은 중요한 유도 편향에 기반합니다. 개별 활성화 값은 입력 데이터에 따라 달라지지만, 각 헤드에 대한 고밀도 어텐션 영역은 빠르게 안정적인 상태로 수렴하며, 프롬프트에 독립적인 내재적 희소 토폴로지를 형성합니다. 이 토폴로지는 가중치로 인코딩되어 있으며, 스케일 불변성을 가지며 효율적으로 추출할 수 있습니다. ScalingAttention은 다음을 통해 토폴로지 발견과 희소성 제어를 분리합니다. (1) WEST(Weight-Encoded Sparse Topology): 실행 시간 검색을 제거하기 위해 강력한 블록 희소 사전 마스크를 오프라인으로 추출합니다. (2) FAST(Fidelity-Aware Sensitivity Tuning): 디퓨전 정확도 요구 사항에 따라 헤드별 희소성을 적응적으로 조정합니다. 실제적인 속도 향상을 보장하기 위해 하드웨어 친화적인 비트 단위 블록 희소 커널을 공동 설계했습니다. Wan2.1 데이터셋에서의 실험 결과, 최고 1.90배의 엔드 투 엔드 속도 향상과 함께 뛰어난 정확도를 보여주었으며, 최첨단 모델들과 비교하여 새로운 성능 지평선을 제시합니다.

Original Abstract

While Diffusion Transformers (DiTs) have revolutionized high-fidelity video generation, their reliance on 3D full attention creates a quadratic computational bottleneck. Existing sparse methods face a dilemma: dynamic pruning suffers from prohibitive runtime overhead and memory fragmentation, while static heuristics fail to capture fine-grained dependencies. In this work, we propose ScalingAttention, a training-free framework grounded in a key inductive bias: while individual activations are input-dependent, the high-mass attention regions for each head rapidly converge to a stable, prompt-agnostic Intrinsic Sparse Topology. This topology is weight-encoded, scale-invariant, and efficient to extract. ScalingAttention decouples topology discovery from sparsity control via: (1) WEST (Weight-Encoded Sparse Topology), which extracts a robust block-sparse prior mask offline to eliminate runtime search; (2) FAST (Fidelity-Aware Sensitivity Tuning), which adaptively tunes head-wise sparsity based on diffusion fidelity requirements. To ensure practical acceleration, we co-design a hardware-aligned bit-wise block-sparse kernel. Experiments on Wan2.1 show up to 1.90X end-to-end speedup with superior fidelity, establishing a new Pareto frontier over state-of-the-art baselines.

0 Citations
0 Influential
3 Altmetric
15.0 Score
Original PDF

No Analysis Report Yet

This paper hasn't been analyzed by Gemini yet.

Log in to request an AI analysis.

댓글

댓글을 작성하려면 로그인하세요.

아직 댓글이 없습니다. 첫 번째 댓글을 남겨보세요!