로컬 LLM PC·워크스테이션 비교
Apple/AMD/Intel/Nvidia 인기 칩 37개를 LLM 사용 그룹(Entry/Mid/Pro/Workstation)으로 묶고, Llama 3.1 8B, Qwen2.5 32B, Llama 4 70B, MoE 대표 모델의 단일 사용자 추론 처리량(tok/s)을 정리했습니다. NVIDIA DGX Spark(구 Project DIGITS)·DGX Station·DGX H100과 AMD Gorgon Point/Halo 신제품도 포함합니다.
측정 조건: Q4_K_M 양자화 / batch 1 / 컨텍스트 4K 기준. 공개 벤치마크(r/LocalLLaMA, llama.cpp/ollama, 공식 자료)에 근거한 대략치이며 환경에 따라 ±30% 변동. 최종 업데이트
Entry — 챗봇·코드 보조 입문
7-8B Q4 · 8GB+ 메모리| 칩 | 벤더 | 메모리 | 대역폭 | 가격 | 8B | 32B | 70B | MoE |
|---|---|---|---|---|---|---|---|---|
| Apple M3 (8C GPU) MacBook Air 13/15 기본 모델 | Apple | 8-24GB | ~100 GB/s | $1,099+ | 15-20 | 메모리 부족 | — | — |
| Apple M4 (10C GPU) MacBook Pro 14 기본 / iMac | Apple | 16-32GB | ~120 GB/s | $1,299+ | 22-28 | 16GB+에서 가능 | — | — |
| Intel Core Ultra 9 285H (Lunar Lake/ARL) NPU는 작은 모델·짧은 컨텍스트에 유리 | Intel | 32GB LPDDR5X | ~120 GB/s | $1,500+ (노트북) | 10-14 | — | — | — |
| AMD Ryzen AI 9 HX 370 (Strix Point) XDNA 2 NPU 50 TOPS, ROCm/Vulkan | AMD | 32-64GB DDR5 | ~120 GB/s | $1,400+ (노트북) | 12-16 | — | — | — |
| AMD Ryzen AI 9 HX 470 (Gorgon Point) Zen 5 혼합 12코어, XDNA 2 NPU 60 TOPS, CES 2026 발표 | AMD | 32-64GB LPDDR5X | ~136 GB/s | $1,000+ (노트북) | 28-35 | — | — | — |
| Intel Arc B580 12GB IPEX-LLM / Vulkan, 가성비 강점 | Intel | 12GB VRAM | 456 GB/s | $249 | 25-32 | — | — | — |
| Nvidia RTX 4060 Ti 16GB CUDA 가장 안정, 13B Q4도 가능 | Nvidia | 16GB VRAM | 288 GB/s | $499 | 60-75 | — | — | — |
| AMD Radeon RX 9070 XT 16GB 2025년 3월 6일 출시. ROCm 10 공식 지원으로 로컬 AI 작업에 매우 적합 (ROCm 7 대비 3… 더보기 노트 접기2025년 3월 6일 출시. ROCm 10 공식 지원으로 로컬 AI 작업에 매우 적합 (ROCm 7 대비 3.3배 향상). 128개 Matrix Cores로 INT4/8/FP8 가속. 2026년 8월 기준 실제 판매가는 $740-800+. 16GB VRAM은 대형 LLM에 한계가 있어 RX 7900 XTX가 더 나은 대안이 될 수 있음. ROCm은 개선되었으나 vLLM 등 고성능 라이브러리에서는 CUDA 대비 뒤처질 수 있으며, 일부 LLM 벤치마크에서는 Vulkan이 ROCm보다 최대 50% 더 나은 성능을 보일 수 있음. | AMD | 16GB GDDR6 VRAM | 640 GB/s | $740-800+ | 95-110 | — | — | — |
| Nvidia RTX 2070 SUPER 8GB 직접 측정치(2026-08-23 갱신, llama.cpp CUDA build 07822bd). 8GB로 30… 더보기 노트 접기직접 측정치(2026-08-23 갱신, llama.cpp CUDA build 07822bd). 8GB로 30B급 MoE를 돌리는 핵심은 --n-cpu-moe로 전문가 FFN 일부만 시스템 RAM에 남기는 하이브리드 오프로드. MoE 값은 코딩 에이전트 실사용 세션의 평균이며 Q3_K_XL 기준이라, 표의 다른 항목(Q4_K_M·4K 컨텍스트)과 조건이 다름. 고정 프롬프트(21.5K 토큰) 벤치마크 기준으로는 프롬프트 처리 970 t/s, 생성 38.2 tok/s. 두 모델의 차이는 아키텍처에서 나옴 — Qwen3.6은 40개 레이어 중 10개만 풀 어텐션이라 KV 캐시가 1/5로 작고, 컨텍스트가 45K까지 차도 속도가 29%만 떨어짐(39→28 tok/s). Qwen3-Coder는 같은 구간에서 45% 하락. 덴스 32B는 6 tok/s로 사실상 사용 불가였고 MoE 전환이 유일한 해법이었음. 생성 속도가 시스템 RAM 대역폭(실측 29.1 GB/s)에 묶이므로 듀얼채널 구성이 중요. 주의: 컨텍스트를 128K로 잡고 장시간 세션을 돌리면 VRAM이 아니라 시스템 RAM이 먼저 터짐 — 상주 21.5GB에 도달해 32GB 머신이 멈춘 사례가 있어 현재는 64K로 운용(아래 FAQ 참고). | Nvidia | 8GB GDDR6 VRAM | 448 GB/s | 중고 $180-250 | 58-64 | 6 (부분 오프로딩) | — | Qwen3.6-35B-A3B Q3 34 / Qwen3-Coder-30B-A3B Q3 15 (실사용 평균) |
Mid — 코딩·RAG 개인 워크로드
13-32B Q4 · 16-24GB| 칩 | 벤더 | 메모리 | 대역폭 | 가격 | 8B | 32B | 70B | MoE |
|---|---|---|---|---|---|---|---|---|
| Apple M3 Pro (18C GPU) | Apple | 18-36GB | 150 GB/s | $1,999+ | 22-28 | 8-12 | — | — |
| Apple M4 Pro (20C GPU) M5 Pro 출시로 이전 세대 | Apple | 24-64GB | 273 GB/s | $1,799+ | 50-60 | 11-14 | — | 130 |
| Apple M5 Pro (20C GPU) 2026년 3월 출시. M4 Pro 대비 AI 성능 향상. MacBook Pro 기본 모델 | Apple | 24-64GB | 300 GB/s | $1,999+ (MacBook Pro) | 70-85 | 18-22 | — | 180-220 |
| AMD Ryzen AI Max+ 395 (Strix Halo) 40 CU RDNA 3.5 + 80GB 할당 가능, Mac 대안 | AMD | 64-128GB LPDDR5X | 256 GB/s | $2,000+ (미니PC/노트북) | 24-30 | 8-11 | — | — |
| AMD Ryzen AI MAX+ 495 (Gorgon Halo) Strix Halo 후계, 메모리 192GB로 확장 — 70B BF16 단일 머신 실행 가능. 2026년 출시 | AMD | 최대 192GB LPDDR5X | ~273 GB/s | $2,500+ (미니PC/노트북) | ~43 | 10-12 | 5-6 | — |
| AMD Radeon RX 7900 XTX 24GB ROCm 7.2 / llama.cpp Vulkan 지원. 24GB로 70B Q4 실행 가능. RTX 4090 대비 약 50% 저렴한 대안. | AMD | 24GB VRAM | 960 GB/s | $899 | 70-90 | 20-26 | 14-18 | — |
| Nvidia RTX 4070 Ti Super 16GB | Nvidia | 16GB VRAM | 672 GB/s | $799 | 95-110 | 14-18 (오프로딩) | — | — |
| Nvidia RTX 4080 Super 16GB | Nvidia | 16GB VRAM | 736 GB/s | $999 | 115-130 | 16-20 (오프로딩) | — | — |
| Nvidia RTX 5070 Ti 16GB 2025년 1월 30일 출시. 2026년 현세대 최고 가성비 GPU. 16GB로 14B Q4 쾌적 실행. | Nvidia | 16GB GDDR7 VRAM | 896 GB/s | $749 MSRP ($949+ 실구매가) | 118-128 | 17-21 (오프로딩) | — | — |
| Nvidia RTX 5080 16GB 2025년 1월 30일 출시. GDDR7 부족 및 AI 수요로 가격 상승. 30B-70B 모델 (오프로딩) 가능. NVFP4 및 FP8 지원. | Nvidia | 16GB GDDR7 VRAM | 960 GB/s | $1,549+ | 132 | 75-95 (오프로딩) | 50-65 (오프로딩) | — |
| Nvidia RTX 5080 Super 24GB RTX 5080 대비 VRAM 및 대역폭 향상. GDDR7 부족으로 출시 지연 또는 취소될 수 있다는 루머 있음. | Nvidia | 24GB GDDR7 VRAM | 1024 GB/s | 가격 미정 (루머) | 125-140 | 20-25 | 15-18 | — |
Pro — 70B 추론·로컬 에이전트
70B Q4-Q5 · 48GB+| 칩 | 벤더 | 메모리 | 대역폭 | 가격 | 8B | 32B | 70B | MoE |
|---|---|---|---|---|---|---|---|---|
| Apple M5 Max (40C GPU) 2026년 9월 22일 출시 (사전 주문 8월 25일). M4 Max 대비 AI 성능 향상. Mac Studio 기본 모델 | Apple | 36-128GB | ~614 GB/s | $2,499+ (Mac Studio) | 110-130 | 45-55 | 40-50 | 100-120 |
| Apple M3 Max (40C GPU, 128GB) | Apple | 36-128GB | 400 GB/s | $3,499+ | 40-50 | 18-22 | 8-12 | — |
| Apple M4 Max (40C GPU, 64GB) 단일 머신 70B 추론에서 현실적 가성비 (M5 Max 출시로 이전 세대) | Apple | 48-128GB | 546 GB/s | $2,999+ | 55-65 | 22-28 | 20-25 | — |
| Apple M5 Max (40C GPU) 2026년 3월 출시. M4 Max 대비 28% 토큰 속도 향상. Llama 8B ~95-110 tok/s (MLX 실측) | Apple | 48-128GB | ~614 GB/s | $4,399+ | 95-110 | 30-40 | 25-32 | — |
| Nvidia RTX 4090 24GB | Nvidia | 24GB VRAM | 1008 GB/s | $1,599 (단종) | 130-150 | 40-50 | 4-6 (오프로딩) | — |
| Nvidia RTX 5090 32GB 2025년 1월 30일 출시. GDDR7 부족 및 AI 수요로 가격 급등. 70B INT4 추론 가능. 단일 GPU에서 70B급 고밀도 모델 실행 가능한 유일한 소비자 RTX 50 카드. NVFP4 및 FP8 지원. | Nvidia | 32GB VRAM | 1792 GB/s | $5,000+ | 185-213 | 60-75 | 42-55 (INT4) | 234 (30B MoE) |
| Nvidia RTX 5090 SE 32GB RTX 5080과 5090 사이 포지션. 32GB VRAM으로 AI 워크로드에 매우 적합. 2026년 8월 정식 출시 확인됨. | Nvidia | 32GB GDDR7 VRAM | 1344 GB/s | $1,500 (루머) | 100-120 | 50-65 | 35-45 (INT4) | 200 (30B MoE) |
| 2x RTX 4090 (NVLink 없음) tensor parallel(vLLM/exllama) 시 70B Q4 풀로딩 | Nvidia | 48GB VRAM | 1008 GB/s/카드 | $3,200+ | — | — | 18-24 | — |
Workstation — MoE / 멀티 GPU·연구용
100B+ MoE · 128GB+| 칩 | 벤더 | 메모리 | 대역폭 | 가격 | 8B | 32B | 70B | MoE |
|---|---|---|---|---|---|---|---|---|
| NVIDIA DGX Spark (GB10 Grace Blackwell) 구 Project DIGITS. GB10 Grace Blackwell SoC, 1 PFLOPS FP4. 2대 NVLink-C2C 연결 시 405B 가능. Dense 32B+는 273 GB/s 대역폭 병목 | Nvidia | 128GB LPDDR5X | ~273 GB/s | $3,999 | ~43 | ~11 | ~3-5 | Qwen3 30B MoE ~89 |
| NVIDIA DGX Station A100 (4× A100 80GB) NVLink 3 + NVSwitch, 4-GPU 텐서 병렬. tok/s는 배치 추론 기준 | Nvidia | 320GB HBM2e | ~8 TB/s 합산 | $149,000+ | — | — | 40-60 | Mixtral 8x7B ~120+ |
| NVIDIA DGX H100 (8× H100 80GB) NVLink 4.0 + NVSwitch 3. 서버급 — 배치 처리량(수백 사용자)이 주목적. 단일 사용자 tok/s는 H100 단독과 유사 | Nvidia | 640GB HBM3 | ~26 TB/s 합산 | $400,000+ | — | — | 60-80 | 대규모 배치 서빙 전용 |
| Apple M2 Ultra (76C GPU, 192GB) 대규모 모델 단일 머신 추론에 강점, 학습은 제한적. (M5 Ultra 출시로 이전 세대) | Apple | 64-192GB | 800 GB/s | $5,999+ (Mac Studio) | — | — | 14-18 | Mixtral 8x22B ~12-15 |
| Apple M3 Ultra (80C GPU, 96GB) Qwen3-vl 235B Q4_K_M 30 tok/s 가능. (M5 Ultra 출시로 이전 세대) | Apple | 96-256GB | 819 GB/s | $6,599+ | — | — | 20-26 | Qwen3-vl 235B Q4_K_M ~30 |
| Apple M5 Ultra (80C GPU) 2026년 9월 22일 출시 (사전 주문 8월 25일). M3 Ultra 대비 LLM 프롬프트 처리 속도 최… 더보기 노트 접기2026년 9월 22일 출시 (사전 주문 8월 25일). M3 Ultra 대비 LLM 프롬프트 처리 속도 최대 4배, M1 Ultra 대비 최대 9.8배 빠름. 512GB 메모리 옵션은 10월 말 출시. Mac Studio 기본 모델 | Apple | 96-512GB | 1.2TB/s | $5,499+ (Mac Studio) | — | — | 50-64 | Mixtral 8x22B ~35-45 |
| Nvidia RTX 6000 Ada 48GB | Nvidia | 48GB VRAM | 960 GB/s | $6,800 | — | — | 12-16 | Mixtral 8x7B ~45 |
| Nvidia H100 80GB SXM FP8/TransformerEngine으로 처리량 추가 향상 | Nvidia | 80GB HBM3 | 3.35 TB/s | $25,000+ | — | — | 45-55 | DeepSeek-V3 Q4 가능 (다중) |
| AMD Instinct MI300X 192GB ROCm 6.2+, vLLM 지원 | AMD | 192GB HBM3 | 5.3 TB/s | $15,000+ | — | — | 40-50 | 단일 카드로 405B Q4 가능 |
한국 사용자 추천 시나리오
- 입문 (₩200만 이내): RTX 4060 Ti 16GB 또는 Mac mini M4 16GB. 8B 모델 안정적
- 코딩 보조 / RAG (₩300-500만): MacBook Pro M5 Pro 36GB, Strix Halo 미니PC, RTX 5080
- 70B 로컬 (₩450-700만): Apple M5 Max Mac Studio, MacBook/iMac M4 Max 64-128GB, RTX 5090, 또는 DGX Spark($3,999)
- 리서치/멀티 모델 (₩800만+): Mac Studio M5 Ultra 192GB, 듀얼 4090/5090, RTX 6000 Ada, Gorgon Halo 192GB
- MoE/405B 추론: MI300X 192GB, Apple Ultra 시리즈, DGX Spark 2대 NVLink 연결
- DGX Spark 포지셔닝: $3,999으로 진입, 1 PFLOPS FP4·MoE 특화. Dense 32B+ 는 273 GB/s 대역폭이 병목 — Strix Halo와 유사한 수준
- AMD Gorgon Halo (출시 예정): 192GB 통합 메모리로 70B BF16 단일 머신 실행 가능. Strix Halo 대비 가장 큰 차별점은 메모리 용량 확장
표를 읽는 법
- tok/s는 단일 사용자(batch 1) 기준. 멀티 유저 서빙은 더 높음
- "오프로딩"은 모델이 VRAM에 다 안 들어가서 시스템 RAM 동원 → 대역폭 병목
- Apple Unified는 GPU/CPU/NPU가 같은 메모리 풀 사용 → 대형 모델에 유리
- 대역폭이 토큰 생성 속도의 1차 결정 요소 (메모리 바인드 워크로드)
자주 묻는 질문
로컬 LLM이 Claude·Gemini보다 느린가요?
같은 급을 비교하면 그렇습니다. 클라우드 API는 서버 인프라와 모델 최적화로 높은 처리량을 제공하는 반면, 로컬 70B는 최상급 장비에서도 메모리 대역폭과 양자화에 따라 속도가 크게 달라집니다. 다만 8B급은 RTX 4090에서 130-150 tok/s로 클라우드 상위 모델과 비슷하거나 더 빠릅니다 — 속도 격차는 하드웨어보다 모델 크기에서 옵니다. 로컬의 실질적 이점은 속도가 아니라 데이터가 밖으로 나가지 않는 것, 토큰당 과금이 없는 것, 오프라인 동작입니다.
로컬 장비와 클라우드 API 중 어느 쪽이 저렴한가요?
사용량이 갈림길입니다. Claude Sonnet 5 출력 $15/1M 기준으로 매일 100만 출력 토큰(상당히 무거운 사용)을 써도 월 $450 수준이라, $4,000짜리 장비 회수에 약 9개월이 걸립니다. 일반적인 개인 사용량(월 수백만 토큰)이라면 클라우드가 몇 년간 더 쌉니다. 반대로 대량 배치 처리, 민감 데이터, 24시간 상시 추론이라면 로컬이 유리합니다.
왜 VRAM(또는 통합 메모리)이 그렇게 중요한가요?
모델 전체가 메모리에 올라가야 GPU/NPU가 빠르게 처리할 수 있습니다. 들어가지 않으면 시스템 RAM이나 스토리지로 오프로딩되어 속도가 5-10배 떨어집니다. 70B Q4 모델은 약 40-45GB가 필요합니다.
Apple Silicon이 NVIDIA보다 큰 모델을 돌릴 수 있는 이유는?
Unified Memory 아키텍처라 GPU가 시스템 메모리 전체(최대 192-512GB)를 직접 사용합니다. NVIDIA 컨슈머 GPU는 24-32GB로 제한적이라 70B+ 모델은 멀티 GPU나 오프로딩이 필요합니다. 다만 절대 처리량은 NVIDIA가 빠릅니다.
소프트웨어 스택은 무엇을 써야 하나요?
가장 안정적인 것은 NVIDIA CUDA + llama.cpp/ollama/vLLM. Apple은 MLX/llama.cpp Metal. AMD는 ROCm 또는 Vulkan(llama.cpp). Intel은 IPEX-LLM이나 Vulkan. 일반 사용에는 ollama가 가장 진입이 쉽습니다.
VRAM은 여유가 있는데 몇 시간 뒤 PC 전체가 멈춥니다
MoE 오프로드 구성에서 흔한 함정입니다. 원인은 GPU가 아니라 시스템 RAM입니다. KV 캐시는 실행 시 한꺼번에 잡히지 않고 실제로 상주하는 토큰 수에 비례해 늘어나므로, 컨텍스트를 128K로 잡아도 벤치마크(약 20K 토큰)에서는 64K·32K와 메모리 사용량이 구분되지 않습니다. 청구서는 긴 세션이 실제로 창을 채운 뒤에 도착합니다. 실측 사례에서는 10시간 연속 코딩 세션 끝에 상주 21.5GB에 도달했고, 스왑이 없는 32GB 머신에서 커널이 스래싱에 빠져 화면과 입력이 모두 멈췄습니다(발열·디스크 이상 아님, SMART 정상).
대처는 세 가지입니다. ① 컨텍스트를 실제 필요한 만큼만(예: 64K) 잡습니다 — 21.5K 작업 컨텍스트 기준 128K 대비 속도 차이는 0.3%로 측정 편차 이하였고 VRAM은 약 960MB를 돌려받습니다. ② 서비스에 MemoryMax를 걸어 시스템 전체 프리즈를 프로세스 하나가 죽는 일로 바꿉니다. ③ 스왑을 둡니다(zram 권장) — 스왑이 0이면 메모리 압박이 프로세스 종료가 아니라 라이브락이 됩니다. 자동 재시작을 켜뒀다면 OOM으로 죽었을 때는 재시작하지 않도록 해야 합니다. 메모리가 바닥난 직후 수십 GB짜리 모델을 다시 로드하면 같은 상황이 반복됩니다.
전력·발열은?
Apple Silicon은 30-100W로 매우 효율적입니다. RTX 4090/5090은 추론 시 300-450W를 끌어 별도 전력/쿨링 설계가 필요합니다. 한국 거주 환경에서는 여름철 발열·소음을 함께 고려하는 게 현실적입니다.
NVIDIA DGX Spark는 어떤 포지션인가요?
$3,999에 GB10 Grace Blackwell SoC + 128GB LPDDR5X를 탑재한 컴팩트 AI PC입니다. 1 PFLOPS FP4 성능이 강점이지만, 메모리 대역폭(273 GB/s)이 Dense 32B 이상에서는 병목으로 작용해 Strix Halo와 비슷한 수준입니다. MoE 모델(Qwen3 30B MoE ~89 tok/s)이나 INT8/FP8 추론에서 차별화됩니다. 2대를 NVLink-C2C로 연결하면 256GB가 되어 405B 모델 실행도 가능합니다. "RTX Spark"라는 명칭은 공식 이름이 아니며 DGX Spark가 정식 제품명입니다.
AMD Gorgon Halo(MAX+ 495)와 Strix Halo(MAX+ 395)의 차이는?
가장 큰 차이는 최대 메모리 용량입니다. Strix Halo는 128GB, Gorgon Halo는 최대 192GB LPDDR5X까지 탑재할 수 있어 Llama 70B를 BF16(약 140GB) 풀 정밀도로 단일 머신에서 실행할 수 있습니다. 대역폭은 273 GB/s로 유사하므로 tok/s는 크게 다르지 않고, 더 큰 모델을 오프로딩 없이 돌릴 수 있다는 점이 핵심입니다. 2026년 출시 예정입니다.
※ 본 수치는 공개 커뮤니티 벤치마크와 제조사 자료를 종합한 추정치입니다. 실제 성능은 양자화 방식(Q4_0/Q5_K_M/FP16), 컨텍스트 길이, KV 캐시 위치, 소프트웨어 버전(llama.cpp/vLLM/MLX), OS·드라이버 상태에 따라 ±30% 이상 변동할 수 있습니다. 구매 전 자기 워크로드로 직접 검증을 권장합니다.