LLM 평가를 가속화하는 CoT-aware 코세트 선택
대규모 언어 모델(LLM)의 평가를 위해 필요한 계산 오버헤드가 개발 과정을 지속하는 데 큰 걸림돌이 되고 있다. 코어셋 선택을 통해 평가 속도를 높일 수는 있지만, 현재의 방법들은 대부분 과거 로그 데이터를 대량으로 필요로 하거나(예: 아이템 응답 이론), 표면적인 언어적 편향을 보이며 실제 논리적 사고 공간을 놓치게 된다. 우리는 CoT-Core라는 새로운 코어 질문 선택 프레임워크를 제