PS4: 프록시 기반 감독 학습을 통한 실제 음성 환경에서의 화자 분리
PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction
실제 대화 환경에서 특정 화자의 음성을 추출하는 모델(TSE, Target Speaker Extraction)을 훈련하는 것은, 대규모의 훈련 데이터와 정제된 목표 화자 음성이 부족하기 때문에 여전히 어려운 과제입니다. 본 논문에서는 실제 대화 혼합 환경에서의 TSE를 위한 프록시 기반 감독 학습 프레임워크인 PS4를 제안하며, 다음과 같은 두 가지 주요 기여를 합니다. 첫째, 중국어 및 영어 시나리오를 모두 포함하는 네 개의 공개 데이터 세트에서 추출한 71,771개의 훈련 샘플로 구성된 대규모 코퍼스를 구축했습니다. 각 샘플은 오버랩된 음성 혼합, 화자별 등록 오디오, 정답 전사본 및 프레임 단위의 음성 활동 레이블을 포함합니다. 둘째, ASR(자동 음성 인식) 교차 엔트로피, 화자 유사도, 프레임 단위 음성 활동 감지 및 지각적 오디오 품질이라는 네 가지 상호 보완적인 미분 가능 목적 함수를 사용하여 BSRNN 기반 TSE 모델을 미세 조정하는 프록시 기반 공동 훈련 전략을 제안합니다. 공개적으로 사용 가능한 사전 훈련된 체크포인트에서 시작하여, 미세 조정 과정에서 BSRNN 분리 모듈만 업데이트됩니다. PS4는 REAL-T 챌린지 리더보드에서 전체 순위 2위를 차지했으며, 제출된 모든 시스템 중에서 가장 높은 화자 유사도 및 타이밍 F1 점수를 달성했습니다.
Training target speaker extraction (TSE) models for real conversational mixtures remains challenging because large-scale training corpora and clean target speech for supervision are unavailable. We present PS4, a proxy-supervised training framework for TSE in real conversational mixtures, with two main contributions. First, we construct a large-scale corpus of 71,771 training samples derived from four public datasets, covering both Chinese and English scenarios. Each sample contains an overlapping speech mixture, per-speaker enrollment audio, a ground-truth transcript, and frame-level voice activity labels. Second, we propose a proxy-supervised joint training strategy that fine-tunes a BSRNN-based TSE model using four complementary differentiable objectives: ASR cross-entropy, speaker similarity, frame-level voice activity detection, and perceptual audio quality. Starting from a publicly available pre-trained checkpoint, only the BSRNN separator is updated during fine-tuning. On the REAL-T challenge leaderboard, PS4 ranks 2nd overall, achieving the best speaker similarity and timing F1 among all submitted systems.
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.