본문으로 건너뛰기

수학적 사고가 출현하는지 테스트하는 '수학이 두 번 필요하다'

AI 자동 생성

대규모 언어 모델(LLM)은 수학적 벤치마크에서 놀라운 능력을 보여주지만, 이는 실제 수학적 사고인가 아니면 통계적 패턴 매칭인가에 대한 의문이 남아있다. 기존의 평가 방법은 기존 수학적 관습에 기반한 기호 문제에만 의존하여, 모델의 추상 개념을 첫 번째 원칙에서부터 구축할 수 있는 능력을 파악하기 어렵다.

이 연구에서는 '수학이 두 번 필요하다'라는 새로운 벤치마크를 제안하여, 통신을 통해 수학적 사고가 출현하는지 테스트한다. 인간의 수학적 인식이 정교한 통신의 필요성과 함께 진화했을 것이라는 가설에 의해 мот이브 되며, 두 대상을 포함하여, 이전에 수학적 지식이 없던 두 대원이 시각적으로 기반한 작업을 해결하는 데 수학적 언어를 사용하는 데 도움이 되는 수학적 시스템을 발견할 수 있는지 테스트한다.

기존의 데이터셋과는 달리, 우리의 벤치마크는 미리 정의된 수학적 언어를 배제하고 대신에, 이전에 발견하지 못한 구조와 표현을 발견할 수 있도록 한다. '수학이 두 번 필요하다'는 수학적 사고가 출현하는지 테스트하는 새로운 방법을 제공하여, 대규모 언어 모델(LLM)이나 다른 모델의 수학적 사고 능력을 개발하고 평가하는 데 도움이 될 것이다.

  • 대규모 언어 모델(LLM) : 대규모 언어 모델은 대규모 텍스트 데이터를 처리하고 분석하는 데 thôi 적합한 모델이다.
  • 수학적 벤치마크 : 수학적 벤치마크는 모델의 수학적 능력을 평가하는 데 사용되는 데이터셋이다.
  • 통계적 패턴 매칭 : 통계적 패턴 매칭은 모델이 데이터를 처리할 때 사용하는 방법 중 하나로, 모델이 데이터를 분석하고 이해하는 데 사용된다.
원문 보기 arXiv AI

함께 읽으면 좋은 기사

연구 3일 전

스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion

스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.

연구 3일 전

기존의 전제 조건자들이 생의학 표준 표 데이터 학습을 개선하는가? 표준 표 데이터 학습 최적화에 대한 실증 연구

최근 구조화된 생물학적 데이터 분석에 있어서 표준화된 기초 모델(tabular foundation model)이 강력한 잠재력을 보인다. 그 중 하나인 TabPFN은 낮은 데이터 표준화 분류 작업에서 효과적인 접근 방식으로 나타났지만, 최적화 및 조건화 전략의 생물학적 세부 튜닝에 대한 영향은 여전히 크게 연구되지 않았다. 본 연구에서, 우리는 59 개의 생물학적 데이터셋(Alzheimer'

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.