비대칭 클리핑 비지도 학습 알고리즘: GRPO를 위한 우위 플립핑 기반 비권리 클리핑 비대칭 자가 교육
RLVR(Reward가 검증 가능한 학습, 특히 그룹 상대적 정책 최적화(Group Relative Policy Optimization, GRPO))는 대규모 언어 모델의 추론을 향상시키기 위해 광범위하게 사용되어 왔습니다. 그러나 결과 단계에 대한 보상은 희박한 감독만 제공하고, 특정 프롬프트에 대해 샘플링된 모든 경로가 모두 올바르거나 잘못된 경우 그룹 상대적 이점은 사라집니다. OPSD