본문으로 건너뛰기

호스팅 LLM에서 지속성 없이 복제: 측정 민감성의 행동-시간 신뢰도 평가

AI 자동 생성

호스트 언어 모델의 행동 평가 결과가 달라질 수 있는 이유는 평가되는 서비스, 측정 도구, 또는 두 가지 모두가 실행될 때마다 다를 수 있기 때문이다. 우리는 다음 세 가지 검증 질문을 분리한다: 이전에 발견된 결과가 역사적인 구성에서 새로운 데이터에서 반복되는지 여부 (반복), 평가와 추론 구성이 동일한 식별자에서 다시 빌드될 때 종점이 바뀌는지 여부 (측정 민감도), 동일한 측정 도구에서 한 번에 여러 식별자에 테스트를 진행했을 때 결과가 지속되는지 여부 (지속성). 우리는 레젠트 체스(Regent Chess)라는 시퀀셜 환경에서 숨겨진, 변경 가능한 상태를 정확히 기록하여 행동이 발생하는 시점에 주장된 믿음이 실제 진실과 비교될 수 있도록 하여, 긍정적인 종점 값이 균일한 비교자와의 성능이 나빠진다는 것을 의미한다. 이전에 보고된 Gemini 3.1 Flash-Lite 손실은 역사적인 구성에서 새로운 게임에서 재현된다 (+0.0530, 95% 신뢰 구간 [+0.0329,+0.0714]). 동일한 공개 식별자에서 동일한 날에 H/R 비교를 진행했을 때, 모델에서 균일한 비교자에서 차이점은 재건된 구성에서 0.0429 낮은 값을 나타낸다 (H-R 대조군에 대한 95% 신뢰 구간 [+0.0182,+0.0667]); 여섯 개의 구성 요소가 모두 함께 변하기 때문에, 하나의 구성 요소만 분리하는 것은 불가능하다. 재건된 R에서, prospectively 동결된, 동일한 창의 4K 비교는 Gemini 3.1과 Gemini 3.7 식별자 사이의 신호가 반전되며, 출시와 제품 계층이 다른 식별자이다; 추가 설명 및 탐색적 세션이 동일한 방향 패턴을 나타낸다. 추가적으로 제공되는 서비스 기간의 기여는 여전히 해결되지 않았다 (-0.0166, [-0.0483,+0.0157]). 따라서, 반복, 측정 민감도 및 지속성이 한 번의 평가에서 다른 결론을 내릴 수 있으므로, 호스트 모델의 행동 주장을 식별자, 제공 기간, 측정 도구 및 추론 구성에 명시적으로 색인화해야 한다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.