희귀 질환 진단: 진단 추론을 통해 희귀 피부 질환을 신뢰성 있게 진단할 수 있는가?
Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?
대규모 시각-언어 모델(LVLM)은 피부과 분야에서 뛰어난 성능을 보여주지만, 희귀 질환에 대한 진단 추론 능력은 아직 충분히 연구되지 않았습니다. 기존의 벤치마크는 주로 흔한 질병에 초점을 맞추고 최종 정확도만을 평가하며, 복잡한 사례에서 중요한 역할을 하는 임상적 추론 과정을 간과합니다. 우리는 이러한 격차를 해소하기 위해 동료 검토를 거친 사례 보고서를 기반으로 한 장기 컨텍스트 벤치마크인 DermCase를 구축했습니다. 저희 데이터셋은 26,030개의 멀티모달 이미지-텍스트 쌍과 6,354개의 임상적으로 어려운 사례를 포함하며, 각 사례는 포괄적인 임상 정보와 단계별 추론 과정을 담고 있습니다. 신뢰성 있는 평가를 위해, 저희는 피부과 의사들의 의견과 더 일치하는 감별 진단 품질 평가를 위한 DermLIP 기반 유사성 지표를 개발했습니다. 22개의 선도적인 LVLM을 벤치마킹한 결과, 진단 정확도, 감별 진단, 임상적 추론 능력에서 상당한 결함이 드러났습니다. 파인튜닝 실험 결과, 지시 튜닝은 성능을 크게 향상시키는 반면, Direct Preference Optimization (DPO)은 미미한 개선 효과를 보였습니다. 체계적인 오류 분석을 통해 현재 모델의 추론 능력에 대한 중요한 한계점을 추가적으로 확인했습니다.
Large vision-language models (LVLMs) demonstrate strong performance in dermatology; however, evaluating diagnostic reasoning for rare conditions remains largely unexplored. Existing benchmarks focus on common diseases and assess only final accuracy, overlooking the clinical reasoning process, which is critical for complex cases. We address this gap by constructing DermCase, a long-context benchmark derived from peer-reviewed case reports. Our dataset contains 26,030 multi-modal image-text pairs and 6,354 clinically challenging cases, each annotated with comprehensive clinical information and step-by-step reasoning chains. To enable reliable evaluation, we establish DermLIP-based similarity metrics that achieve stronger alignment with dermatologists for assessing differential diagnosis quality. Benchmarking 22 leading LVLMs exposes significant deficiencies across diagnosis accuracy, differential diagnosis, and clinical reasoning. Fine-tuning experiments demonstrate that instruction tuning substantially improves performance while Direct Preference Optimization (DPO) yields minimal gains. Systematic error analysis further reveals critical limitations in current models' reasoning capabilities.
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.