본문으로 건너뛰기

월드 피드백을 통한 임상 agent의 평가: FHIR 환경에서 RL을 진단하는 방법

임상 전문가들이 의사 결정 논리를 인코딩한 verifier를 통해 무제한 롤아웃을 수행할 수 있는 RL(강화 학습)에서 월드 피드백은 의사 결정 논리를 인코딩한 verifier가 롤아웃을 평가할 수 있게 해줍니다. 하지만 RL을 적용하려면 신뢰할 수 있는 feedback 채널과 충분한 base capability가 필요합니다. 연구에서는 MedAgentBench v1/v2를 ауд트하여 41.7%의 silent-finish ceiling을 발견하고, MedAgentBench-v3 (MAB-v3)를 구축했습니다.

AI 자동 생성

임상 프로토콜 수행 작업 -- 실험실 결과를 확인하는 작업, 임상 전문가가 정의한 threshold를 적용하는 작업, 올바른 구조의 FHIR order를 생성하는 작업 -- RL(강화 학습)에서 월드 피드백을 사용하는 자연스러운 후보입니다. 임상 전문가들이 의사 결정 논리를 인코딩한 verifier를 통해 무제한 롤아웃을 수행할 수 있기 때문입니다. 하지만 RL을 적용하려면 신뢰할 수 있는 feedback 채널과 충분한 base capability가 필요합니다.

연구 결과

연구에서는 MedAgentBench v1/v2를_AUDIT하여 41.7%의 silent-finish ceiling을 발견하고, MedAgentBench-v3 (MAB-v3)를 구축했습니다. MAB-v3에는 508개의 task가 포함되어 있으며, 8.9%의 ceiling이 있습니다.

대규모 언어 모델(LLM)의 성능 평가

Qwen3-8B를 사용한 훈련에서 두 가지 구조적 장벽이 발견되었습니다.

  • capability ceiling: 10/20 task types에서 0%의 base performance가 있으며, zero gradient가 발생합니다.
  • format-knowledge barrier: 3/20 task types에서 exact clinical codes가 필요하며, exploration을 통해 발견할 수 없습니다.

pure RL은 18.2%의 pass@1을 달성했으며, rule-based SFT는 34.1%를 달성했습니다. 두 모델 사이의 15.9pp gap은 이러한 장벽으로 인한 것이었습니다.

결론

RL을 적용하려면 decision/format-knowledge/lookup taxonomy를 사용하여 RL learnability를 예측하고, SFT를 사용하여 codes를 주입하고, RL을 사용하여 conditionals를 학습하는 것이 필요합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

연구 3일 전

스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion

스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.

연구 3일 전

기존의 전제 조건자들이 생의학 표준 표 데이터 학습을 개선하는가? 표준 표 데이터 학습 최적화에 대한 실증 연구

최근 구조화된 생물학적 데이터 분석에 있어서 표준화된 기초 모델(tabular foundation model)이 강력한 잠재력을 보인다. 그 중 하나인 TabPFN은 낮은 데이터 표준화 분류 작업에서 효과적인 접근 방식으로 나타났지만, 최적화 및 조건화 전략의 생물학적 세부 튜닝에 대한 영향은 여전히 크게 연구되지 않았다. 본 연구에서, 우리는 59 개의 생물학적 데이터셋(Alzheimer'

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.