자동 평가 기준으로부터 Reward: 인간 선호도 구조를 명시적 다중 모드 생성 기준으로
대규모 언어 모델(LLM)의 선호도에 맞추기 위해 Reward Learning with Human Feedback(RLHF) 방법론이 사용되는데, 이러한 방법론은 인간의 선호도 구조를 스칼라 또는 쌍별 레이블로 축소시키는 문제를 가지고 있습니다. 이러한 문제를 해결하기 위해 Rubrics-as-Reward(RaR) 방법론이 제안되었지만, 이는 데이터 효율성과 확장성을 충족시키는 방법론이 아직 존재하지 않습니다. 이에 대한 해결책으로 Auto-Rubric as Reward(ARR) 프레임워크를 제안하였으며, 이는 Reward 모델링을 명시적 기준 기반 분해로 재정의합니다.