AI 모델 4월 7일
위성 판독기: 의료 영상 판독기 평가를 위한 신뢰할 수 있는 LLM 심판
의료 영상 판독기 평가에 대한 최근 연구는 주로 LLM 기반 지표를 설계하고 작은 모델을 사용하여 흉부 X-ray에 초점을 맞추었습니다. 그러나 다른 모달리티와 해부학에 대한 이러한 접근법이 robust한지 여부는 아직 명확하지 않습니다. LLM 심판을 위한 가장 적합한 모델과 명령어 구성은 무엇인지 확인하고자 합니다. 우리는 전문가와 LLM 기반 평가 간의 강한 상관 분석을 수행합니다. 우리는 existing LLM-as-a-judge 지표 (RadFact, GREEN, FineRadScore)와 VERT, 제안된 LLM 기반 지표를 비교합니다. VERT는 open-와 closed-source 모델 (사유와 비사유)과 다양한 크기를 가진 2개의 전문가 기반 데이터 세트 (RadEval, RaTE-Eval)에서 여러 모달리티와 해부학을 다룹니다. 우리는 RaTE-Eval에서 few-shot 접근 방식, ensembling, 및 parameter-efficient fine-tuning을 평가합니다. 지표의 행동을 더 잘 이해하기 위해, 우리는 시스템 에러 검출 및 분류 연구를 수행하여 expert 판단과 지표의 정합성을 평가하고 낮은 및 높은 정합성 영역을 식별합니다. 결과는 GREEN에 비해 VERT가 11.7%까지의 상관관계를 향상시킨다는 것을 보여줍니다. 또한 Qwen3 30B를 1,300개의 훈련 샘플만 사용하여 25%까지의 성능 향상을 달성할 수 있습니다. 또한 fine-tuned 모델은 37.2배까지의 inference 시간을 줄일 수 있습니다. 이러한 결과는 LLM 기반 심판의 효과성을 강조하고 가벼운 적응으로 신뢰할 수 있는 평가를 달성할 수 있음을 보여줍니다.