본문으로 건너뛰기

BV-Blend: 불확실성 가중치 역사적 기준선으로 안정적인 비평자 없는 강화 학습

비평자 없는 강화 학습에서 BV-Blend을 사용하면 불확실성 가중치 역사적 기준선으로 안정적인 강화 학습을 구현할 수 있습니다. 이 방법은 대규모 언어 모델(LLM)과 같은 큰 언어 모델을 위한 강화 학습에서 중요합니다.

AI 자동 생성

비평자 없는 강화 학습은 비평자(값 함수)를 학습하지 않고, 메모리 및 계산 오버헤드를 줄여 큰 언어 모델(LLM)과 같은 대규모 언어 모델을 위한 강화 학습을 구현할 수 있습니다. 그러나 Group Relative Policy Optimization(GRPO)과 같은 이 방법은 이익 추정에 따라서 불안정할 수 있습니다.

특히, 모든 롤아웃이 동일한 보상을 받을 때, 그룹 내 보상 분산이 0이되고 그룹 정규화가 0이익을 출력하여 그룹을 정의하는 그룹이 학습을 방해하는 cold-start 환경에서 이익 추정이 불안정해집니다.

우리는 BV-Blend, 비평자 없는 프레임워크를 소개합니다. BV-Blend은 세미네틱 클러스터 조건된 역사적 분포를 사용하여 이익 추정의 안정성을 개선합니다. BV-Blend은 EMA 추적된 보상 분포를 유지하고 표준 오류의 평균(SEM) 대신 표준 오류의 분산을 사용하여 신뢰도 가중치를 계산합니다.

BV-Blend은 역사적 기준선과 프롬프트 지역 기준선을 블렌딩하여 표준화된 이익을 계산합니다. 이 표준화된 이익은 PPO-style clipped 업데이트를 위한 이익을 계산합니다.

BV-Blend의 이점

  • 이익 추정의 안정성을 개선합니다.
  • 대규모 언어 모델(LLM)과 같은 큰 언어 모델을 위한 강화 학습에서 중요합니다.
  • cold-start 환경에서 학습을 개선합니다.

BV-Blend은 verifiable reasoning benchmarks에서 훈련 안정성과 성능을 개선하고, group-normalized method가 cold-start 환경에서 멈추는 경우에도 robust합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

연구 3일 전

스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion

스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.

연구 3일 전

기존의 전제 조건자들이 생의학 표준 표 데이터 학습을 개선하는가? 표준 표 데이터 학습 최적화에 대한 실증 연구

최근 구조화된 생물학적 데이터 분석에 있어서 표준화된 기초 모델(tabular foundation model)이 강력한 잠재력을 보인다. 그 중 하나인 TabPFN은 낮은 데이터 표준화 분류 작업에서 효과적인 접근 방식으로 나타났지만, 최적화 및 조건화 전략의 생물학적 세부 튜닝에 대한 영향은 여전히 크게 연구되지 않았다. 본 연구에서, 우리는 59 개의 생물학적 데이터셋(Alzheimer'

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.