DeepSeek, 새로운 AI 모델을 예측하여 국경 모델로 ‘격차를 닫는다’
DeepSeek이 새로운 AI 모델을 미리 공개했다. DeepSeek은 이 모델이 이전 버전인 DeepSeek V3.2보다도 더 효율적이고 성능이 뛰어나며, 현재 가장 선두에 있는 모델들을 대비해서 거의 '격차를 좁혔다'고 말한다.
29개의 기사
DeepSeek이 새로운 AI 모델을 미리 공개했다. DeepSeek은 이 모델이 이전 버전인 DeepSeek V3.2보다도 더 효율적이고 성능이 뛰어나며, 현재 가장 선두에 있는 모델들을 대비해서 거의 '격차를 좁혔다'고 말한다.
중국 AI 기업 DeepSeek은 1년 만에 개발한 다음세대 AI 모델 V4를 공개했다. 이 모델은 미국의 경쟁자들인 Anthropic, Google, OpenAI의 폐쇄형 시스템과 경쟁할 수 있는 오픈 소스 모델로 개발되었다. DeepSeek은 V4가 이전 모델보다 크게 개선된 모델로, 코드 작성 능력에서 특히 큰 발전을 이루었다고 밝혔다.
네바야-녀야 사상에 기반한 지식적 사유를 위한 대형 언어 모델의 미세 조정: 프라마나 대규모 언어 모델(LLM)은 유창한 텍스트를 생성하지만 체계적인 사유에 어려움을 겪으며, 종종 자신감 있지만 근거 없는 주장을 내세운다. 애플 연구원들은 수학 문제에 불필요한 문맥을 추가했을 때 LLM의 성능이 65% 감소했다. 부식된 패턴 매칭이 명백한 사유 아래에 있는 것으로 드러났다. 이러한 지식적 격차, 증거에 대한 추적 가능한 근거를 바탕으로 주장을 지지할 수 없는 제한이 AI의 신뢰성을 제한한다. 우
DeepSeek이 1조 파라미터 규모의 혼합 전문가(MoE) 아키텍처 모델 V4를 Apache 2.0 라이선스로 공개했습니다. 토큰당 활성 파라미터는 370억 개에 불과해 소비자 하드웨어에서도 양자화 실행이 가능하며, HumanEval 90%, SWE-bench 80%+ 의 성능으로 미국 최전선 AI 모델과 경쟁합니다.
DeepSeek-R1 공개로 촉발된 오픈소스 AI 혁명이 1년을 맞이했습니다. 허깅페이스가 분석한 이 격변의 1년을 돌아보며 글로벌 AI 세력 지형의 변화를 살펴봅니다.