본문으로 건너뛰기

의료 음성 인공지능의 멀티태스킹 벤치마크

AI 자동 생성

음성은 신경계, 운동계, 호흡계, 음성계를 동시에 관여하는 독특한 건강 정보 창문을 제공합니다. 현재 임상 음성 인공지능 방법론은 주로 특정 질병에 대한 고립된 연구를 통해 발전해 왔습니다. 따라서 결과를 비교하고 일반화 정도를 평가하는 것이 어려웠습니다. 우리는 임상 음성 인공지능을 위한 대규모 벤치마크인 SpeechDx를 소개합니다. SpeechDx는 12개의 데이터셋과 27개의 작업을 포함하는 다양한 건강 상태의 임상 음성 인공지능을 다루고 있습니다. SpeechDx는 음성 생성 단계를 중단하는 것으로 작업을 구조화하여 평가를 위해 임상 메커니즘을 공유합니다. [대규모 언어 모델(LLM)]의 성능을 평가하기 위해 SpeechDx는 작업에 한정된 레이블 데이터를 포함하고 동일한 건강 상태를 여러 데이터셋에 걸쳐 평가합니다. SpeechDx는 임상적으로 의미 있는 패턴과 데이터셋의 오류를 구분하여 평가합니다. 우리는 12개의 cutting-edge 오디오 인코더를 모든 작업과 zero-shot cross-condition 전송에서 체계적으로 평가했습니다. 결과는 대규모 음성 모델이 전체적인 베이스 라인인 가장 강력한 결과를 나타내며, 도메인 특정 모델은 유사한 작업에서만 성능을 향상시키고, 현재의 표현은 임상 음성 지평을 통틀어 신뢰할 수 있는 일반화가 되지 않는다는 것을 보여주었습니다. SpeechDx는 임상 음성 표현을 일반화하는 방향으로의 진전을 추적하기 위한 공유 평가 프레임워크를establish합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

연구 3일 전

스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion

스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.

연구 3일 전

기존의 전제 조건자들이 생의학 표준 표 데이터 학습을 개선하는가? 표준 표 데이터 학습 최적화에 대한 실증 연구

최근 구조화된 생물학적 데이터 분석에 있어서 표준화된 기초 모델(tabular foundation model)이 강력한 잠재력을 보인다. 그 중 하나인 TabPFN은 낮은 데이터 표준화 분류 작업에서 효과적인 접근 방식으로 나타났지만, 최적화 및 조건화 전략의 생물학적 세부 튜닝에 대한 영향은 여전히 크게 연구되지 않았다. 본 연구에서, 우리는 59 개의 생물학적 데이터셋(Alzheimer'

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.