본문으로 건너뛰기

포커 아레나: 전략적 사고와 LLM의 기억능력 다중 축 프로파일링

AI 자동 생성

불확실성을 감안한 전략적 사고는 협상, 금융, 정책 등에서 중요한 결과를 내는 결정에 기반을 두고 있지만 현재 게임 벤치마크는 다양한 사고 차원들을 단일 스칼라로 축소시키고 있다. 이로 인해 최첨단 대규모 언어 모델(LLM)의 기능 구조가 조사되지 않았다. 우리는 포커 아레나(Poker Arena)라는 무제한 텍사스 홀덤 토너먼트 플랫폼을 소개한다. 이 플랫폼은 세 가지 메모리 아키텍처(한 손가락 내 메모리, 세션 내 메모리, 세션 간 메모리)를 결합하고, 전략적 사고를 해독 가능한 차원들인 베팅 크기 조정 및 위치 인식으로 분해한 9차원 인지 프로파일을 사용한다. 우리는 50세션에 1,000손가락의 게임과 제어된 메모리 절제를 통한 7가지 최첨단 모델의 평가를 진행했다. 토너먼트 칩과 총 축 좌표 점수는 순위를 결정하는데, 클로드 오푸스 4.6 모델은 +$15,730 칩을 얻고 14회 우승을 기록했지만 평균 축 좌표 점수로 5위를 기록했다. persisted 메모리는 어떤 모델을 도와주기도 하고 다른 모델을 손상시키기도 했다. 이러한 발견은 단일 축에 대한 최고 성능보다 차원 간 일관성을 우위로 하는 다차원 평가가 기능 구조를 드러내며, 현재 스칼라 리더보드가 일관성 있는 순위를 제공하지 못하는 것을 보여준다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.