2608.09189v1 Aug 10, 2026 cs.CL

EmoS: 이론 기반 프레임워크를 활용한 음성 언어 모델의 감정 지능 평가 및 정렬

EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models

Ziyun Zhang
Ziyun Zhang
Citations: 0
h-index: 0
Yuqin Lin
Yuqin Lin
Citations: 116
h-index: 6
Peiyuan Jiang
Peiyuan Jiang
Citations: 33
h-index: 3
Meng Ge
Meng Ge
Citations: 32
h-index: 3
Ziyang Ma
Ziyang Ma
Citations: 18
h-index: 3
J. Dang
J. Dang
Citations: 6,333
h-index: 37
Jianting Zong
Jianting Zong
Citations: 0
h-index: 0
Jingyue Zhang
Jingyue Zhang
Citations: 86
h-index: 5
Shuqing Xie
Shuqing Xie
Citations: 0
h-index: 0

명령 수행 능력과 청각 이해 능력이 크게 발전했음에도 불구하고, 음성 언어 모델(SLM)에서 감정 지능(EI)을 평가하는 것은 원시적인 부가언어적 인식 수준에 머물러 있으며, 체계적이고 이론 기반의 인지적 프레임워크가 부족합니다. 본 연구에서는 네 가지 분기 이론 모델을 바탕으로 구축된 최초의 포괄적인 SLM 감정 지능 평가 벤치마크인 EmoSBench를 소개합니다. EmoSBench는 감정을 인식, 이해, 활용 및 조절하는 데 관련된 열 개의 하위 작업으로 구성됩니다. EmoSBench에 대한 초기 평가는 상당한 격차를 보여줍니다. GPT-4o-Audio와 같은 선도적인 독점 모델조차 52.6%의 낮은 성능을 보이며, 이는 인간 기준선보다 훨씬 뒤쳐지는 결과입니다. 이러한 격차를 해소하기 위해, 우리는 지도 학습(SFT)과 그룹 상대 정책 최적화(GRPO)를 통해 최적화된 특수 평가 모델인 EmoS를 개발했습니다. 효율적인 훈련을 지원하기 위해, 우리는 필요한 세분화된 감독 신호를 제공하는 양방향 데이터셋인 EmoDialogue를 구축했습니다. 동시에, 정확한 순위 점수와 유효한 추론을 강제하기 위해, 급격한 지수 정확도 보상(SEAR)과 논리 충실도 보상(RFR)을 통합한 새로운 보상 메커니즘을 도입했습니다. 실험 결과, EmoS는 83.8%의 정확도를 달성하여 인간 수준의 성능에 근접하는 것을 확인했습니다. 또한, 실제 제약 없는 음성 상호 작용에 대한 평가는 그 견고한 실세계 일반화 능력을 검증하며, 감정 지능이 뛰어난 대화 시스템을 발전시키는 데 필요한 기초 프레임워크를 제공합니다.

Original Abstract

Despite significant advances in instruction-following and auditory comprehension, the evaluation of Emotional Intelligence (EI) in Spoken Language Models (SLMs) remains confined to rudimentary paralinguistic perception, lacking a systematic, theory-driven cognitive framework. We introduce EmoSBench, the first comprehensive EI evaluation benchmark for SLMs constructed upon the four-branch theoretical model, covering Perceiving, Understanding, Using, and Managing Emotion across ten sub-tasks. Preliminary assessments on EmoSBench reveal a substantial gap: even leading proprietary models like GPT-4o-Audio achieve only 52.6%, significantly trailing human baselines. To bridge this gap, we develop EmoS, a specialized evaluator model optimized via Supervised Fine-Tuning (SFT) and Group Relative Policy Optimization (GRPO). To facilitate its effective training, we curate EmoDialogue, a bilingual dataset providing necessary fine-grained supervision through response pairs with rigorously defined EI gradations. Concurrently, we introduce a reward mechanism integrating a Steep Exponential Accuracy Reward (SEAR) and a Rationale Fidelity Reward (RFR) to enforce precise ordinal scoring and valid reasoning. Experiments demonstrate that EmoS reaches 83.8% accuracy, approaching human-level performance. Furthermore, evaluations on authentic, unconstrained spoken interactions validate its robust real-world generalization, establishing a foundational framework for advancing emotionally intelligent dialogue systems.

0 Citations
0 Influential
18.5 Altmetric
92.5 Score
Original PDF

No Analysis Report Yet

This paper hasn't been analyzed by Gemini yet.

Log in to request an AI analysis.

댓글

댓글을 작성하려면 로그인하세요.

아직 댓글이 없습니다. 첫 번째 댓글을 남겨보세요!