본문으로 건너뛰기

오프라인에서 온라인으로의 강화 학습을 위한 RankQ: 자가 감독된 액션 랭킹

오프라인에서 온라인으로의 강화 학습은 샘플 효율성을 향상시키기 위해 미리 수집된 데이터 세트를 온라인 상호 작용 전에 사용합니다. 그러나 대규모 상태-액션 공간에서 데이터 세트 커버리지가 제한된 경우 정확한 비평가를 학습하는 것이 주요 도전 중 하나입니다. RankQ는 시간 차이 학습을 위한 자가 감독된 다항식 랭킹 손실을 추가하여 구조화된 액션 순서를 강제하는 오프라인에서 온라인으로의 Q 학습 목표를 제안합니다. RankQ는 액션 기울기를 더 높은 품질의 행동들로 향유도록 Q 함수를 형성하기 위해 상대적인 액션 선호도를 학습합니다.

AI 자동 생성

오프라인에서 온라인으로의 강화 학습

오프라인에서 온라인으로의 강화 학습은 샘플 효율성을 향상시키기 위해 미리 수집된 데이터 세트를 온라인 상호 작용 전에 사용합니다. 그러나 대규모 상태-액션 공간에서 데이터 세트 커버리지가 제한된 경우 정확한 비평가를 학습하는 것이 주요 도전 중 하나입니다.

RankQ

RankQ는 시간 차이 학습을 위한 자가 감독된 다항식 랭킹 손실을 추가하여 구조화된 액션 순서를 강제하는 오프라인에서 온라인으로의 Q 학습 목표를 제안합니다. RankQ는 액션 기울기를 더 높은 품질의 행동들로 향유도록 Q 함수를 형성하기 위해 상대적인 액션 선호도를 학습합니다.

실험 결과

RankQ는 D4RL 벤치마크에서 7개의 이전 방법과 경쟁 또는 우수한 성능을 달성했습니다. 시각 기반 로봇 학습에서 RankQ는 전이 학습을 위한 사전 훈련된 시각-언어-액션(VLA) 모델을 사용하여 저 데이터 환경에서 평균 42.7% 높은 시뮬레이션 성공률을 달성했습니다. 고 데이터 환경에서 RankQ는 평균 13.7% 높은 시뮬레이션 성능을 달성했으며 강력한 시뮬-리얼 전이를 달성하여 원시 VLA의 초기 성능에서 43.1%에서 84.7%까지의 실세계 큐브 스택 성공률을 증가시켰습니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.