AI 모델 6월 30일
모델 능력 향상 Closed-Loop 데이터 및 평가
대규모 언어 모델(LLM)의 전반적인 변수인 모델 능력은 직접 관찰되지 않습니다. 데이터는 미래에 모델 능력을 형성하며, 평가는 모델 능력을 후속적으로 노출합니다. 그러나 샘플, 프롬프트, 디코딩, 및 점수 규칙을 하나의 노이즈 점수로 압축합니다. 실제 최적화는 이 반대 방향으로 작동합니다. 엔지니어는 실패를 먼저 관찰하고, 데이터를 수정해야 합니다. 그러나 두 가지 측면은 상호 불일치하는 어휘를 사용합니다. 벤치마크 이름과 샘플당 정확도와 데이터 출처, 도메인, 및 품질 레이블을 사용합니다. 이 추론은 일반적으로 직관이 아닌 메소드입니다. 우리는 이 단절을 닫기 위해 <em>능력 슬라이스</em>를 사용합니다. 샘플이 공통된 배경 조건, 작업 유형, 해결 연산, 및 출력 제약 조건을 공유하는 평가 샘플의 집합입니다. 이 단일 약점을 지역화할 수 있을 정도로 정밀하지만, aggregation이 가능하며, 벤치마크 이름이 너무粗하고, 단일 샘플이 너무 노이즈가 많은 경우에도 안정적입니다. 이 단위로 구성된 평가 분류, 비-인스트럭션 데이터 분류, 및 매핑 규칙은 벤치마크 수준의 실패를 대상화 가능한, 테스트 가능한 데이터 조정을 위한 닫힌 루프를 형성합니다.