수학적 사고가 출현하는지 테스트하는 '수학이 두 번 필요하다'
대규모 언어 모델(LLM)은 수학적 벤치마크에서 놀라운 능력을 보여주지만, 이는 실제 수학적 사고인가 아니면 통계적 패턴 매칭인가에 대한 의문이 남아있다. 기존의 평가 방법은 기존 수학적 관습에 기반한 기호 문제에만 의존하여, 모델의 추상 개념을 첫 번째 원칙에서부터 구축할 수 있는 능력을 파악하기 어렵다. 이 연구에서는 '수학이 두 번 필요하다'라는 새로운 벤치마크를 제안하여, 통신을 통해 수학적 사고가 출현하는지 테스트한다. 인간의 수학적 인식이 정교한 통신의 필요성과 함께 진화했을 것이라는 가설에 의해 мот이브 되며, 두 대상을 포함하여, 이전에 수학적 지식이 없던 두 대원이 시각적으로 기반한 작업을 해결하는 데 수학적 언어를 사용하는 데 도움이 되는 수학적 시스템을 발견할 수 있는지 테스트한다. 기존의 데이터셋과는 달리, 우리의 벤치마크는 미리 정의된 수학적 언어를 배제하고 대신에, 이전에 발견하지 못한 구조와 표현을 발견할 수 있도록 한다. '수학이 두 번 필요하다'는 수학적 사고가 출현하는지 테스트하는 새로운 방법을 제공하여, 대규모 언어 모델(LLM)이나 다른 모델의 수학적 사고 능력을 개발하고 평가하는 데 도움이 될 것이다.