본문으로 건너뛰기

교수풍 개인화 피드백을 위한 LLM의 강화 학습: PERSA

대규모 언어 모델(LLM)을 이용한 교육 환경에서 자동 피드백을 제공하는 것은 가능하지만, 특정 교수자의 성향과診斷 정확성을 유지하는 것은 어려운 문제입니다. PERSA는 transformer 기반 LLM을 교수자의 평가 음성과 맞추는 강화 학습에서 피드백을 이용한 LLM을 업데이트하는 방법을 연구합니다.

AI 자동 생성

PERSA: 교수풍 개인화 피드백을 위한 LLM의 강화 학습

PERSA는 교수 풍의 개인화 피드백을 위한 강화 학습을 위한 LLM의 강화 학습을 연구합니다. PERSA는 교수의 평가 음성을 맞추는 데 사용되는 강화 학습에서 피드백을 이용한 LLM을 업데이트하는 방법을 연구합니다.

PERSA는 RLHF 파이프라인을 제안합니다. RLHF 파이프라인은 교수의 수업을 이용한 supervise fine-tuning, pair-wise preference에서 reward modeling, Proximal Policy Optimization(PPO)으로 구성됩니다. PERSA는 parameter efficient fine-tuning을 적용하여 transformer 내부의 분석을 바탕으로 style-bearing component에만 학습을 제한합니다.

PERSA의 성능 평가

PERSA의 성능을 평가하기 위해 APPS, PyFiXV, CodeReviewQA라는 세 가지 코드 피드백 벤치마크를 사용했습니다. PERSA는 Llama-3와 Gemma-2의 두 가지 백본에서 professor-style transfer를 강화하면서 correctness를 유지합니다. 예를 들어, APPS에서 PERSA는 Style Alignment Score(SAC)를 96.2%로 높였으며, Correctness Accuracy(CA)를 100%로 유지했습니다.

  • PERSA는 professor-style transfer를 강화하면서 correctness를 유지합니다.
  • PERSA는 parameter efficient fine-tuning을 적용하여 transformer 내부의 분석을 바탕으로 style-bearing component에만 학습을 제한합니다.
  • PERSA는 RLHF 파이프라인을 제안하여 교수의 평가 음성을 맞추는 데 사용되는 강화 학습에서 피드백을 이용한 LLM을 업데이트하는 방법을 연구합니다.
원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.