듀얼 엔트로피 강화 정책 최적화: MLLMs에서 환상 생성을 위한
강화 학습(RL)은 멀티모달 대규모 언어 모델(LLLM)의 추론을 더 명확하게 만들기 위해 널리 사용되지만, 오류의 위험성이 가장 높은 곳에서 오류가 발생하는 것을 방지하는 효과는 균일하지 않다. 이는 보상에서 매개변수 업데이트로의 수정 chain에서 두 개의 약점으로 인한 것이다. rollout 단계에서, 의미론적 엔트로ピー가 높은-hard 쿼리---그것들은 단결적으로 잘못된 샘플 그룹을