본문으로 건너뛰기

지구 친화적인 지구 기반 LLM의 효율성: 소비자 하드웨어에 대한 초기 양적 GPU 전력 벤치마크

AI 자동 생성

대규모 언어 모델(LLM)의 지역 배포는 개인 정보 보호의 우려와 기지 내 추론의 욕구로 인해 점점 더 심화되고 있다. 그러나 소비자 하드웨어에서 에너지 비용은 주로 정확도만 고려하는 대부분의 벤치마크로 인해 아직까지도 매우 불확실한 상태이다. 이 논문은 1B에서 7B 파라미터까지의 열 개의 오픈 소스 대규모 언어 모델이 하나의 소비자 GPU(RTX 4060Ti 16GB)에서 실행되는 하드웨어 수준의 에너지 벤치마크를 제공한다. Ollama 추론 엔진을 사용하여 nvidia-smi를 통해 2Hz 간격으로 GPU 전력 소비량을 샘플링하고 고정된 프롬프트 세트를 사용한다. 우리는 평균/최고 전력, 프롬프트 당 총 에너지(J/prompt), 출력 토큰 당 에너지(J/token), 그리고 처리량(tok/s)을 평가한다. 우리의 연구 결과는 모델의 파라미터 수 외에도 모델 아키텍처 및 정량화 전략이 에너지 효율성을 결정한다는 것을 제시한다. 구체적으로 gemma3:1b와 llama3.2:1b는 가장 낮은 에너지 비용(0.56 J/token과 0.65 J/token)을 가지고 있으며, 최고의 처리량(170 tok/s 이상)을 보여준다. 반면에 7B-Mistral 모델은 가장 효율적인 모델보다 토큰당 에너지를 4.4배 더 소비한다. 또한 qwen3.5:2b는 내부 논리화가 연장된 토큰 생성 모드가 있기 때문에 에너지 효율성 지표에서 구별해야 하는 이상적인 높은 프롬프트당 에너지를 나타낸다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.