연어증 환자를 위한 개인 맞춤형 연합 학습 기반 음성 인식 연구
Towards Personalized Federated Learning for Dysarthric Speech Recognition
연어증을 가진 화자에 대한 음성 인식은 어려운 과제입니다. 연합 학습(FL) 기반의 자동 음성 인식(ASR) 시스템은 개인 정보 보호에 효과적인 도구가 될 수 있지만, 화자 간의 변동성에 의해 발생하는 이질성 문제가 있습니다. 모든 화자가 동일한 모델 구성 요소를 사용하도록 강제하는 것은 이러한 이질성 하에서 최적이 아닐 수 있으며, 따라서 개인 맞춤화는 유망한 접근 방식입니다. 그러나 연어증 음성에 대한 관련 연구는 아직 제한적입니다. 이에 본 논문에서는 개인 맞춤화를 달성하기 위한 두 가지 집계 전략을 탐구합니다. 이는 매개변수 기반 평균화 전략과 임베딩 기반 평균화 전략이 포함됩니다. UASpeech 및 TORGO 데이터셋에 대한 실험 결과, 제안된 방법은 기준 모델인 정규화된 FedAvg보다 통계적으로 유의미한 단어 오류율(WER) 감소를 보였습니다. 구체적으로, UASpeech 데이터셋에서 최대 0.99% (절대값, 3.15% 상대값), TORGO 데이터셋에서 0.56% (절대값, 4.73% 상대값)의 WER 감소가 관찰되었습니다.
Speech recognition is challenging for dysarthric speakers. While federated learning (FL)-based ASR can be an effective tool for protecting privacy, it suffers from heterogeneity issues caused by speaker variability. Forcing all speakers to share the same model components can be suboptimal under such heterogeneity, making personalization a promising direction; however, related research on dysarthric speech remains limited. To this end, this paper explores two aggregation strategies to achieve personalization, including the parameter-based averaging strategy and the embedding-based averaging strategy. Experiments on UASpeech and TORGO show that the proposed methods outperform the baseline regularized FedAvg by statistically significant WER reductions of up to 0.99% absolute (3.15% relative) on UASpeech and 0.56% absolute (4.73% relative) on TORGO, respectively.
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.