AI 모델 7월 13일
진짜 세계의 의료 멀티모달 벤치마크: 중국 온라인 의료 상담
대규모 언어 모델(LLM)들이 점점 더 많이 온라인 의료 상담에 도입되고 있지만, 현재까지의 벤치마크들은 실제 의료 실무와 잘 맞지 않는다. 많은 벤치마크들은 합성 대화나 환자 시뮬레이터를 사용하거나, 환자 업로드 한 의료 사진을 무시하거나, 다중 선택 또는 의미적 겹침 지표를 사용하여 개방된 의료 응답을 평가한다. 이는 의료 질을 잘 반영하지 못한다. 우리는 진정한 세계의 멀티모달 온라인 의료 상담을 위한 대규모 벤치마크인 **MedRealMM**을 소개한다. MedRealMM은 전국 중국 인터넷 병원에서 수집한 비식별 환자-의사 상호 작용을 사용하여 멀티모달 온라인 의료 상담을 위한 벤치마크를 구축한다. MedRealMM은 멀티모달 의료 문제 해결 지점(MCCP) 추출 Framework를 사용하여 진정한 상담 경로에서 의료적으로 요구되는 순간을 식별하고, 이전 텍스트-이미지 컨텍스트를 보존하는 동안 각 순간을 표준화된 다음 응답 생성 과제로 변환한다. 각 인스턴스는 의사들이 정제한 경우별 규칙을 사용하여 환자-의사 상호 작용을 평가한다. 현재 릴리즈에는 5,620개의 진정한 세계의 멀티모달 사례가 포함되어 있으며, 64개의 의료 부서를-spanning한다. 우리는 19개의 일반 목적 및 의료 전문 LLM, 텍스트-이미지 시스템을 포함하여 LLM을 평가한다. 결과는 이미지 정보가 신뢰할 수 있는 의료 성능을 보장하는 데 중요하며, 현재 최첨단 모델들이 온라인 의사 응답을 만족시키지 못한다는 것을 보여준다.