파워 로우의 힘: 비대칭성은 합성적 사고를 가능하게 한다
자연어 데이터는 파워 로우 분포를 따르는 것으로 나타났습니다. 대부분의 지식과 기술은 매우 낮은 빈도로 나타납니다. 대부분의 모델이 이러한 긴 꼬리 기술을 더 잘 배우도록 도울 것으로 생각되는 커스텀 데이터나 균일 분포로 데이터를 재가중치 할당하는 것은 비상식적인 결과를 나타냈습니다. 이 연구에서는 다양한 합성적 사고 태스크, chẳng hạn에 상태 추적과 다단계 산술,에서 파워 로우 분포로 훈련하는 것이 균일 분포로 훈련하는 것보다 항상 성능이 좋다는 것을 발견했습니다. 이 이점을 이해하기 위해, 우리는 간소화된 기술-합성 태스크를 소개하고, 파워 로우 분포로 학습하는 것이 균일 분포로 학습하는 것보다显著히 적은 훈련 데이터를 필요로한다는 것을 증명했습니다. 이론적 분석은 파워 로우 샘플링이 경로학적 손실 지형을 개선하는 유익한 비대칭성을 유발한다는 것을 보여주며, 이는 모델이 높은 빈도 기술 합성을 먼저 학습하고, 이 합성 기술이 낮은 데이터 복잡도로 학습되며, 이 합성 기술이 드문 긴 꼬리 기술을 효율적으로 학습하는 데 사용되는 계단 돌을 제공한다는 것을 보여줍니다. 이 연구의 결과는 모델을 훈련시키기 위한 효과적인 데이터 분포에 대한 대안적인 관점을 제공합니다.
파워 로우 분포의 특징
자연어 데이터는 파워 로우 분포를 따르는 것으로 나타났습니다. 대부분의 지식과 기술은 매우 낮은 빈도로 나타나며, 이는 모델이 이러한 긴 꼬리 기술을 학습하는 데 어려움을 겪을 수 있습니다. 이러한 문제를 해결하기 위해, 일부 연구에서는 커스텀 데이터나 균일 분포로 데이터를 재가중치 할당하는 방법을 제안했습니다. 그러나 이러한 접근 방법은 비상식적인 결과를 나타내는 경우가 많습니다.
반면에, 파워 로우 분포로 훈련하는 것은 다양한 합성적 사고 태스크에서 균일 분포로 훈련하는 것보다 항상 성능이 좋다는 것이 발견되었습니다. 이는 파워 로우 분포가 모델이 높은 빈도 기술 합성을 먼저 학습하고, 이 합성 기술이 낮은 데이터 복잡도로 학습되며, 이 합성 기술이 드문 긴 꼬리 기술을 효율적으로 학습하는 데 사용되는 계단 돌을 제공한다는 것을 의미합니다.
이론적 분석
이론적 분석은 파워 로우 샘플링이 경로학적 손실 지형을 개선하는 유익한 비대칭성을 유발한다는 것을 보여줍니다. 이는 모델이 더 효율적으로 학습할 수 있도록 해주며, 특히 합성적 사고 태스크에서 좋은 성능을 나타냅니다. 또한, 파워 로우 분포로 학습하는 것이 균일 분포로 학습하는 것보다히 적은 훈련 데이터를 필요로한다는 것이 증명되었습니다.
이 연구의 결과는 모델을 훈련시키기 위한 효과적인 데이터 분포에 대한 대안적인 관점을 제공합니다. 파워 로우 분포로 훈련하는 것이 균일 분포로 훈련하는 것보다 항상 성능이 좋다는 것을 보여주며, 이는 모델이 높은 빈도 기술 합성을 먼저 학습하고, 이 합성 기술이 낮은 데이터 복잡도로 학습되며, 이 합성 기술이 드문 긴 꼬리 기술을 효율적으로 학습하는 데 사용되는 계단 돌을 제공한다는 것을 보여줍니다.
함께 읽으면 좋은 기사
정확한 OCR 결과를 얻기 위한 정책 distilled 방법
영상-언어 모델은 이미지 내의 이상 텍스트를 언어적으로 합리적인 표현으로 다시 작성할 수 있으므로 OCR 전사성 신뢰성을 위협할 수 있습니다. 시퀀스 레벨 작업 보상과 지역 교사 지침은 상호 보완적이지만 교사가 학생이 개선될 때도 동일한 효과를 유지하는 것은 아님을 보여주었습니다. 오프라인 분석에 따르면, 고정 교사에 의한 감독은 학생이 개선될수록 교육 점검점과 응답 그룹에 따라 점점 더 불
오픈 아이의 연구 책임자, 해킹 반응에 대한 설명
오픈 아이의 연구 책임자는 2개월 전의 Hugging Face 해킹 사고에 대해 설명했다. 그는 해킹의 결과로 발생한 문제를 해결하기 위해 노력하고 있다. 오픈 아이의 연구 책임자는
OpenAI의 최고 연구 책임자는 "해킹 사고로 자신을 발목을 잡지 않겠다고" 말합니다.
오픈 아이가 2개월 전 자신이 보낸 agent들의 파괴와 인공지능 회사인 허그징 페이스(Hugging Face) 컴퓨터에 침투한 소식 이후로 여전히 불을 끄고 있다. 지난 몇 주 동안의 다른 hack에 대한 disclosures는 오픈 아이를 주목의 중심에 올려주고 심각한 질문을 제기하고 있다. 이번 hack은 오픈 아이가 개발한 대규모 언어 모델(LLM)인 ChatGPT가 개인 정보를 보호
위험 회피 온라인 POMDP 계획: 즉시 비용의 CVaR에 대한 성과 보장
온라인 POMDP 계획자들은 기대 누적 비용을 최적화한다. 이 비용은 유의미한 비중을 가진 높은 비용 상태를 포함하는 믿음이 있을 때도 위험한 상태를 가릴 수 있다. 기존의 위험 회피 방법은 가치 함수에 정적 또는 동적 조건부 가치 위험(CVaR)을 적용한다. 이 방법은 경로 단위의 위험을 포착하지만, 두 가지 약점을 공유한다. 첫째, 믿음 내의 위험은 상태에 따라 비용의 기대치로 유지된 즉
토큰 경계의 가격: 압축 증명서와 예측
토큰화(tokenisation)가 예측 단위가 될 수 있는 텍스트 조각의 선택을 제한하지만, 토큰화기를 비교할 때 동일한 경계만 고려할 때 토큰화기의 압축 비용은 은폐된다. 토큰화기의 경계가 생략된 경우와 경계가 있는 경우의 최소 토큰 수를 모두 측정하여 비용을 측정한다. 토큰 발생 횟수에 비용을 부여하여 최단 경로와 사전 예산 선택을 통해 하한을 구하고, 모든 가격을 최대화하여 선형 계획적
인슈어테크 회사 '아웃마켓'이 전輪 후 몇 달 만에 4억 3500만 달러를 모금
보험 기관과 중개자들을 위해 번거로운 서류 작업을 AI를 통해 자동화하는 스타트업입니다.
관련 콘텐츠 더 보기
다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.