2603.18418v1 Mar 19, 2026 cs.CV

희귀 질환 진단: 진단 추론을 통해 희귀 피부 질환을 신뢰성 있게 진단할 수 있는가?

Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?

Tianyang Wang
Tianyang Wang
Citations: 76
h-index: 5
Xingjian Li
Xingjian Li
Citations: 139
h-index: 6
Yang Liu
Yang Liu
Citations: 386
h-index: 7
Jiyao Yang
Jiyao Yang
Citations: 6
h-index: 1
Hongjin Zhao
Hongjin Zhao
Citations: 19
h-index: 3
Xiaoyong Li
Xiaoyong Li
Citations: 2
h-index: 1
Runmin Jiang
Runmin Jiang
Citations: 9
h-index: 2
Saeed Anwar
Saeed Anwar
Citations: 65
h-index: 5
Dongwoo Kim
Dongwoo Kim
Citations: 2,791
h-index: 5
Yue Yao
Yue Yao
Citations: 6
h-index: 1
Min Xu
Min Xu
Citations: 139
h-index: 6
Zhen Qin
Zhen Qin
Citations: 49
h-index: 4
Yanzhe Ji
Yanzhe Ji
Citations: 8
h-index: 2

대규모 시각-언어 모델(LVLM)은 피부과 분야에서 뛰어난 성능을 보여주지만, 희귀 질환에 대한 진단 추론 능력은 아직 충분히 연구되지 않았습니다. 기존의 벤치마크는 주로 흔한 질병에 초점을 맞추고 최종 정확도만을 평가하며, 복잡한 사례에서 중요한 역할을 하는 임상적 추론 과정을 간과합니다. 우리는 이러한 격차를 해소하기 위해 동료 검토를 거친 사례 보고서를 기반으로 한 장기 컨텍스트 벤치마크인 DermCase를 구축했습니다. 저희 데이터셋은 26,030개의 멀티모달 이미지-텍스트 쌍과 6,354개의 임상적으로 어려운 사례를 포함하며, 각 사례는 포괄적인 임상 정보와 단계별 추론 과정을 담고 있습니다. 신뢰성 있는 평가를 위해, 저희는 피부과 의사들의 의견과 더 일치하는 감별 진단 품질 평가를 위한 DermLIP 기반 유사성 지표를 개발했습니다. 22개의 선도적인 LVLM을 벤치마킹한 결과, 진단 정확도, 감별 진단, 임상적 추론 능력에서 상당한 결함이 드러났습니다. 파인튜닝 실험 결과, 지시 튜닝은 성능을 크게 향상시키는 반면, Direct Preference Optimization (DPO)은 미미한 개선 효과를 보였습니다. 체계적인 오류 분석을 통해 현재 모델의 추론 능력에 대한 중요한 한계점을 추가적으로 확인했습니다.

Original Abstract

Large vision-language models (LVLMs) demonstrate strong performance in dermatology; however, evaluating diagnostic reasoning for rare conditions remains largely unexplored. Existing benchmarks focus on common diseases and assess only final accuracy, overlooking the clinical reasoning process, which is critical for complex cases. We address this gap by constructing DermCase, a long-context benchmark derived from peer-reviewed case reports. Our dataset contains 26,030 multi-modal image-text pairs and 6,354 clinically challenging cases, each annotated with comprehensive clinical information and step-by-step reasoning chains. To enable reliable evaluation, we establish DermLIP-based similarity metrics that achieve stronger alignment with dermatologists for assessing differential diagnosis quality. Benchmarking 22 leading LVLMs exposes significant deficiencies across diagnosis accuracy, differential diagnosis, and clinical reasoning. Fine-tuning experiments demonstrate that instruction tuning substantially improves performance while Direct Preference Optimization (DPO) yields minimal gains. Systematic error analysis further reveals critical limitations in current models' reasoning capabilities.

0 Citations
0 Influential
3.5 Altmetric
17.5 Score
Original PDF

No Analysis Report Yet

This paper hasn't been analyzed by Gemini yet.

Log in to request an AI analysis.

댓글

댓글을 작성하려면 로그인하세요.

아직 댓글이 없습니다. 첫 번째 댓글을 남겨보세요!