본문으로 건너뛰기

비대칭 클리핑 비지도 학습 알고리즘: GRPO를 위한 우위 플립핑 기반 비권리 클리핑 비대칭 자가 교육

AI 자동 생성

RLVR(Reward가 검증 가능한 학습, 특히 그룹 상대적 정책 최적화(Group Relative Policy Optimization, GRPO))는 대규모 언어 모델의 추론을 향상시키기 위해 광범위하게 사용되어 왔습니다. 그러나 결과 단계에 대한 보상은 희박한 감독만 제공하고, 특정 프롬프트에 대해 샘플링된 모든 경로가 모두 올바르거나 잘못된 경우 그룹 상대적 이점은 사라집니다. OPSD(온-폴리시 자기 분출, On-Policy Self-Distillation)은 밀집한 토큰 단위 지침을 제공하지만, 토큰 선호도는 경로가 올바르거나 잘못된 경우 모두 다를 수 있습니다. OPSD-style 특권 교사 컨텍스트에서 empirical 진단을 수행한 결과, 교사 양성 및 교사 음성 간격 신호가 서로 다른 잡음 프로파일을 나타냈습니다. CAST(Answer-free Self-distillation for GRPO-style RLVR) 학습은 이러한 관찰에 의해 мотив화되었으며, GRPO-style RLVR에 대한 answer-free 자기 분출 방법을 제안합니다. CAST는 검증기 기반 GRPO 목표를 유지하지만, 경로가 올바른지 아닌지에 따라 토큰 단위 이점을 형성하기 위해 stop-gradient 자기 교사를 사용합니다. 이전의 자기 분출 RLVR 방법과 달리, CAST는 참조 솔루션 조건에 대한 교사 점수를 필요로하지 않으며, 자기 교사 로그 확률 차이를 훈련 과정 전체에 유지합니다. 또한 CAST는 교사 음성 토큰에 대해 부호가 제한된 부정적인 토큰 단위 이점을 assign하고, 교사 양성 토큰에 대해 경계가 있는 양의 지역 이점을 assign합니다. CAST는 zero-variance all-correct 및 all-wrong 그룹에 대해 부호가 제한된 기본 이점을 assign하여, 그렇지 않으면 zero-gradient 그룹이 검증기에 서명된 토큰 feedback를 제공할 수 있습니다. 수학적 추론에 대한 실험 결과, CAST는 RLVR 훈련을 향상시키면서도 경로 단위 목표를 유지하는 가벼운 검증기 기반 목표를 유지합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

연구 3일 전

스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion

스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.

연구 3일 전

기존의 전제 조건자들이 생의학 표준 표 데이터 학습을 개선하는가? 표준 표 데이터 학습 최적화에 대한 실증 연구

최근 구조화된 생물학적 데이터 분석에 있어서 표준화된 기초 모델(tabular foundation model)이 강력한 잠재력을 보인다. 그 중 하나인 TabPFN은 낮은 데이터 표준화 분류 작업에서 효과적인 접근 방식으로 나타났지만, 최적화 및 조건화 전략의 생물학적 세부 튜닝에 대한 영향은 여전히 크게 연구되지 않았다. 본 연구에서, 우리는 59 개의 생물학적 데이터셋(Alzheimer'

연구 6일 전

SAS 비전 트랜스폼러에 기반한 강화된 대비 학습

아티클 번호: 2609.21061v1 발표 유형: 새로운 개요: 합성 어레이 소나(SAS)를 사용하는 자동 목표 식별(AUTR)은 고급 해군 기능을 지원하지만, 깊은 학습은 희소한 목표 이미지를, 배경 잡음 및 인간의 평가를 제한한다. 우리는 바다 속 SAS AUTR을 위한 DINOv3 비전 트랜스포머(ViT) 모델을 3단계의 매개 변수 효율적인 프레임워크로 적응시킨다. 단계 1은 ViT 백

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.