본문으로 건너뛰기

Annealing된 회전-aware 온-폴리시 distillation을 위한 Multi-turn 자율_AGENT의 학습

AI 자동 생성

대규모 언어 모델(LLM) agent를 위해 긴 시간 범위 내의 상호 작용 작업을 수행하기 위해서는 빠른 모방과 보상 기반 개선이 모두 필요합니다. 온 정책 distillation(OPD)은 teacher의 밀집된 지침을 제공하고 일반적으로 초기 단계에서 급격히 향상되지만 학생이 teacher에 접근할 때 gains가 saturation되며 최종 성능 한계를 제한합니다. 강화 학습(Reinforcement Learning, RL)은 환경 보상을 직접 최적화하고 보상 정의된 한계를 향한 탐색적 개선을 장려하지만 희박하고 지연된 feedback로 인해 초기 단계 학습이 OPD보다 훨씬 효율적이지 않습니다. 이 논문에서, 우리는 온라인 distillation 알고리즘인 ATOD (Annealed Turn-aware On-policy Distillation)를 제안합니다. ATOD는 온 정책 distillation과 강화 학습의 상보성을 명시적으로 활용합니다. ATOD는 annealed OPD-RL 스케줄을 사용합니다: OPD가 초기 학습에서 teacher-level 행동을 접근할 때까지 dominates하며 RL이 점차 강화되어 보상 기반 탐색을 유도합니다. ATOD는 Turn-level Disagreement-Uncertainty Reweighting(T-DUR)도 도입합니다: 이는 긴 тра젝토리에서 밀집된 감독을 향상시키기 위해 soft하게 고유도 turn을 증폭합니다. ALFWorld, WebShop, Search-QA에서 실험한 결과, ATOD는 온 정책 distillation(OPD)와 GRPO와 비교하여 평균 성공률 3.03점, 23.62점을 향상시키며 teacher 모델보다 2.16점을 초과합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.