LLM을 이용한 수학적 분석의 정리 증명에 대한 두 단계 평가 시스템: MA-ProofBench
대규모 언어 모델(LLMs)은 자동 증명 논리를 크게 진전시키면서도 현재까지 존재하는 공식 평가 지표는 수학적 범위와 난이도에서 모두 제한적이다. 대부분은 대수학과 초등 수학적 수학 이론과 같은 더 쉽게 공식화되는 분야에 집중되어 있으며, 더 깊은 사고를 요구하는 하위 분야인 수학적 분석에 대한 범위는 제한적이다. 이러한 공백을 해결하기 위해 우리는 Mathematical Analysis를