배포 관련 조정은 모델 수준 평가에서만 추출할 수 없다.
기계 학습에서 대응성 평가가 대개 모델 수준의 평가로 변해버렸습니다. 영향력 있는 벤치마크는 고정된 입력에 대한 모델 출력을 평가합니다. 예를 들어, 진실성, 지시를 따르기, 쌍별 선호도 등입니다. 이러한 점수를 종종 배포된 대응성을 지지하는 주장에 사용합니다. 이 논문은 배포 관련 대응성이 단독으로 모델 수준의 평가에서 유추될 수 없다는 것을 주장합니다. 대응성 주장은 대신에 증거가 수집되는 수준에 따라 인덱싱되어야 합니다: 모델 수준, 응답 수준, 상호 작용 수준, 또는 배포 수준. 두 가지
Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone
기계 학습에서 대응성 평가가 대개 모델 수준의 평가로 변해버렸습니다. 영향력 있는 벤치마크는 고정된 입력에 대한 모델 출력을 평가합니다. 예를 들어, 진실성, 지시를 따르기, 쌍별 선호도 등입니다. 이러한 점수를 종종 배포된 대응성을 지지하는 주장에 사용합니다. 이 논문은 배포 관련 대응성이 단독으로 모델 수준의 평가에서 유추될 수 없다는 것을 주장합니다. 대응성 주장은 대신에 증거가 수집되는 수준에 따라 인덱싱되어야 합니다: 모델 수준, 응답 수준, 상호 작용 수준, 또는 배포 수준. 두 가지 연구가 이 입장을 지지합니다.
첫 번째로, 열 개의 대응성 벤치마크에 대한 구조화된 감사, 열 여덟 벤치마크 자료집으로 확장, 코헨의 카파 = 0.87로 8차원 지침과 이중 코딩하는 연구에서 사용자와 대면하는 검증 지원이 모든 조사된 벤치마크에서 결여되어 있고, 프로세스 조정성은 거의 결여되어 있습니다.
조사된 이 interactional 벤치마크들, tau-bench, CURATe, Rifts, Common Ground 등은coverage가 분산되어 있으며, 벤치마크 구성이 데이터 원천보다 측정하는 것을 결정합니다.
두 번째로, 180개의 전사본을 사용하여 3개의 프론티어 모델과 4개의 scaffold를 사용하는 블라인드 크로스 모델 스트레스 테스트에서는 동일한 검증 scaffold가 한 모델의 검증 지원을 천장에 높이면서 다른 모델의 검증 지원을گان적으로 변화시키지 않습니다.
이것은 scaffold의 효능이 모델에 의존적이며 감지된 간격을 단독으로 모델 수준에서 닫을 수 없다는 것을 보여줍니다.
우리는 시스템 수준의 평가 주제를 제안합니다: 대응성 프로파일 대신 단일 점수, 고정된 scaffold 프로토콜을 사용하여 상호 작용 평가를 비교할 수 있고, 평가 증거와 배포 주장 사이의 추론 거리를 명시적으로 보고하는 보고서 템플릿.
함께 읽으면 좋은 기사
8GB 그래픽카드로 30B 코딩 LLM 돌리기: 45토큰/초 최적화 전 과정
RTX 2070 SUPER 8GB와 6코어 CPU만으로 30B급 코딩 모델을 초당 45토큰으로 구동한 실측 기록. MoE 부분 오프로드와 양자화 선택, 메모리 대역폭 병목 분석, Cline 연동 설정, 그리고 테트리스 생성으로 검증한 실제 코드 품질까지 정리했다.
LLM이 핵 공격을 추천하지 않으려면? 일본어로 물어보세요
대규모 언어 모델은 점점 더 전략적이고 자문적인 상황에서 사용되고 있지만, 그 안전성은 일반적으로 영어만으로 평가됩니다. 우리는 여섯 개의 제공업체에서 나온 9개의 모델을 테스트하고, 언어가 모델의 결정을 바꾸는지-high stakes 상황에서-확인하려고 합니다. 우리는 단일 턴 게임 이론적 시나리오에서 사용하며, 모델은 무방비 상대에게 핵무기를 사용할 것인지 여부를 일본의 국가에 자문합니다
Bayesian 모델 칼리브레이션을 위한 문헌 정보를 기반으로 한 전역 분포 설계
Bayesian 기반의 프로세스 기반 모델의 감리 작업을 위해서는 각 모델의 매개변수에 대한 사전 분포가 필요하다. 많은 연구자들은 이 작업을 수행하기 위해 유니폼 사전 분포를 사용한다. 하지만 유니폼 사전 분포를 사용하는 이유는 이 작업을 수행하기 위한 도메인 지식과 통계 지식이 필요하고, 이를 통해 유의미한 사전 분포를 구축하는 데 시간이 많이 걸린다는 것이다. 우리는 Distribird
세계 모델에서 중요한 것에 집중하는 TaskSense
대규모 언어 모델(LLM)을 통해 학습된 시각적 제어 모델은 일반적으로 compact한 잠재 상태를 학습하기 위해 관찰치를 재구성하는 것을 통해 정보를 전체 시각적 입력에 걸쳐 보존하도록 암묵적으로 장려합니다. 그러나 과제 관련 내용은 관찰치의 작은 부분만을 차지하며 배경 잡음 및 가리키는 요소는 유용한 표현적 능력을 소모합니다. 시각 재구성과 제어 목표 사이의 불일치로 인해 잠재 표현은 과
중간 층의 주의 집중 예측을 통해 시각 토큰 압축
대규모 멀티모달 언어 모델(Multimodal Large Language Model, MLLM)의 효율성을 향상시키기 위해 시각 토큰 압축을 사용하는 방법을 제안합니다. 이 방법은 중간 언어 모델 층의 주의 집중을 예측하여 시각 토큰의 중요도를 평가합니다. 이 방법은 existing inference acceleration techniques와 호환되며, 10개의 benchmark에서 97.5%의 unpruned model 성능을 유지하며, 5.56%의 시각 토큰만 사용하여 3.09배의 end-to-end speedup을 달성합니다.
Ignition 지수: 언어 모델의 글로벌 워크스페이스 동적 측정
Ignition Index를 제시합니다. 이는 전이 모델 언어 모델에서 Global Workspace Theory의 (GWT) 모든-아니면-점화 예측을 operationalize하는 유효한 스칼라 지표입니다. 이 지표는 입력 신호 강도의 함수로 per-layer 선형 프로브 정확도를 4-매개 변수 시그모이드에 적합시켜, 기울기 매개변수 beta-hat을 추출합니다: 높은 값은 급격한, 점화와
관련 콘텐츠 더 보기
다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.