본문으로 건너뛰기

생각하는 것이 많을수록 편향이 많다: 길이에 따른 위치 편향

Chain-of-thought (CoT) reasoning과 reasoning-tuned 모델은 얕은 가설 편향을 줄이기 위해 주로 사용된다. 하지만, 위치 편향에 대해 이것이 진실일까? 실제로 위치 편향은 모델의 길이와 상관관계가 있다.

AI 자동 생성

길이에 따른 위치 편향

Chain-of-thought (CoT) reasoning과 reasoning-tuned 모델은 얕은 가설 편향을 줄이기 위해 주로 사용된다. 하지만, 위치 편향에 대해 이것이 진실일까? 실제로 위치 편향은 모델의 길이와 상관관계가 있다. 연구에서는 13가지의 reasoning-mode 설정(2개의 R1-distilled 7-8B 모델, 2개의 base 모델에 CoT를 적용, DeepSeek-R1 671B)을 사용하여 MMLU, ARC-Challenge, GPQA에 대해 테스트했다.

  • 12개의 설정에서 길이와 위치 편향 점수(PBS) 사이의 부분 상관관계가 양성으로 나타났다.
  • 모든 12개의 open-weight reasoning-mode 설정에서 길이의 4분위에 따라 PBS가 monotonically 증가했다.
  • 트렁케이션 인터베이전트를 사용하여 위치 편향의 원인과 결과를 분리했다.
  • 트렁케이션 인터베이전트를 사용하여 위치 편향의 원인과 결과를 분리했다.

길이에 따른 위치 편향의 원인

길이에 따른 위치 편향의 원인은 모델의 길이와 상관관계가 있다. 연구에서는 671B에서 aggregate PBS가 0.019로 나타났지만, 길이의 4분위에 따라 PBS가 0.071로 나타났다. 이는 길이에 따른 위치 편향이 모델의 길이와 상관관계가 있음을 나타낸다.

직접 답변 위치 편향

직접 답변 위치 편향은 길이에 따른 위치 편향과는 다른 현상이다. 연구에서는 Llama-Instruct-direct에서 강한 위치 편향을 나타내었지만, Qwen-Instruct-direct에서는 약한 위치 편향을 나타내었다. 또한, 연구에서는 길이와 위치 편향 점수 사이의 상관관계가 없음을 나타내었다.

결론

연구 결과, Chain-of-thought (CoT) reasoning과 reasoning-tuned 모델은 얕은 가설 편향을 줄이기 위해 주로 사용되지만, 위치 편향에 대해 이것이 진실일까? 실제로 위치 편향은 모델의 길이와 상관관계가 있다. 또한, 직접 답변 위치 편향은 길이에 따른 위치 편향과는 다른 현상이다. 이러한 결과는 reasoning-capable 모델이 MCQ 평가 파이프라인에서 오더-로비스트로 간주되지 않도록 하고, 위치 편향을 감사하는 도구를 제공한다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.