AI 모델 비교표
프론티어 AI 모델 56개의 컨텍스트, 가격(USD / 1M 토큰), 강점, 추천 용도를 한국 개발자 관점에서 정리했습니다. 가격은 공식 단가를 참고했으나 변경 가능하므로 결제 전 각 제공자 문서를 확인하세요.
최종 업데이트:
| 모델 | 제공자 | 컨텍스트 | 입력 | 출력 | 유형 | 강점 / 추천 용도 |
|---|---|---|---|---|---|---|
| Claude Sonnet 5 | Anthropic | 1M | $2 | $10 | 비공개 | 가장 에이전트적인 Sonnet 모델, Opus 수준 코딩 능력, 일상 작업에 적합. 2026년 6월 30일 출시, 무료 및 Pro 요금제 기본 모델, 128K 출력 토큰, 자율적인 AI 워크플로우를 위한 뛰어난 지시 따르기, 도구 선택 및 오류 수정 기능, 터미널/브라우저 자율 구동 가능. 적응형 사고 및 미세한 노력 제어. 새로운 토크나이저 사용 (이전 모델 대비 30% 더 많은 토큰 생성). 채팅 및 Cowork 전반에 걸쳐 메모리 기능 활성화. (2026년 8월 31일까지의 초기 프로모션 가격이 표준 가격으로 확정되었으며, 예정되었던 인상은 적용되지 않습니다.) Pro/Team/Enterprise 기본 모델, 한국어 작업, 비용 효율 에이전트, 자율 에이전트 |
| Claude Opus 5 | Anthropic | 1M | $5 | $25 | 비공개 | 2026년 7월 24일 출시. Fable 5의 프론티어 인텔리전스에 근접하면서도 절반 가격으로 제공되는 사려 깊고 능동적인 모델. Frontier-Bench 4배 이상 향상, ARC-AGI-3 30.2점, 적응형 사고 및 미세한 노력 제어, 128K 출력 토큰, 512 토큰 프롬프트 캐시 최소값, 최고 수준 추론, 코딩·에이전트·전문 작업 개선, 정직성·신뢰성 강화, 장문 분석. 새로운 토크나이저 사용 (이전 모델 대비 30% 더 많은 토큰 생성). 채팅 및 Cowork 전반에 걸쳐 메모리 기능 활성화. 2.5배 빠른 고속 모드 (비용 2배) 최고 성능 요구, 복잡한 추론, 대규모 코드베이스, 전문 작업, 동적 워크플로우 |
| Claude Opus 4.8 | Anthropic | 1M | $5 | $25 | 비공개 | 2026년 5월 28일 출시. 최고 수준 추론, 코딩·에이전트·전문 작업 개선, 정직성·신뢰성 강화, 동적 워크플로우, 작업 노력 수준 제어, 128K 출력 토큰, 고속 모드 (입력 $10 / 출력 $50), 장문 분석. 코드 결함 4배 감소, 브라우저 에이전트 최첨단 성능 (Opus 5 출시로 플래그십 역할은 대체) 복잡한 추론, 대규모 코드베이스, 전문 작업, 동적 워크플로우 |
| Claude Sonnet 4.6 | Anthropic | 1M | $3 | $15 | 비공개 | 완전히 업그레이드된 코딩·추론·에이전트 성능, 컴퓨터 사용, 에이전트 계획, 지식 작업 및 디자인 개선, Opus 수준 코딩 능력, 장문 컨텍스트, Sonnet 4.5보다 30-50% 빠름 (Sonnet 5 출시로 기본 모델 역할은 대체) 고성능 프로덕션, 복합 에이전트 (Sonnet 5 출시로 기본 모델 역할은 대체) |
| Claude Haiku 4.5 | Anthropic | 200K | $1.00 | $5.00 | 비공개 | 2025년 10월 15일 출시, Anthropic 모델 중 가장 빠름, 초저지연 최적화, 비용 효율, 스마트 모델 전환 기능 포함, 실시간 음성 및 온디바이스 사용에 최적화된 새로운 체크포인트. (2026년 10월 15일 단종 예정) 간단한 챗봇, 요약, 빠른 작업, 음성 인터페이스 (2026년 10월 15일 단종 예정) |
| Claude Fable 5.1 | Anthropic | 1M | $10 | $50 | 비공개 | Anthropic의 Mythos급 역량을 대중에게 공개한 첫 모델. 2026년 9월 1일 출시. 가장 강력한 성능을 자랑하며, 복잡한 추론, 장기 실행 에이전트, 코딩, 다단계 연구 및 문서 중심의 전문 작업에 최적화됨. 모든 텍스트 응답에 보이지 않는 워터마크가 추가됨. 캐시 읽기 비용 100만 토큰당 $0.25로 인하. 최고 성능 요구, 장기 실행 에이전트, 복잡한 추론, 다단계 연구, 문서 중심 전문 작업 |
| Claude Mythos 5.1 | Anthropic | 1M | N/A | N/A | 비공개 | Fable 5.1과 동일한 Mythos-클래스 기능을 공유하는 매우 강력한 모델이지만, 사이버 보안 및 생물학 연구를 위한 전체 사이버 및 생물학적 기능을 유지한 제한적 접근 버전. 2026년 9월 1일 출시. 코딩 및 지식 작업에 가장 진보된 모델이며, 모든 텍스트 응답에 보이지 않는 워터마크가 추가됨. 캐시 읽기 비용 100만 토큰당 $0.25로 인하. 사이버 보안 및 생물학 연구, Project Glasswing 파트너 전용, 최고 성능 요구 |
| GPT-5.6 Sol | OpenAI | 1.05M | $5.00 | $30.00 | 비공개 | 2026년 7월 9일 출시. 최고 수준 추론, 코딩·지식 작업·사이버 보안 최첨단 성능, 강화된 에이전트 능력 (울트라 추론 모드), 환각 최대 80% 감소, SWE-bench Verified 74.9% 기록, ARC-AGI-3 벤치마크에서 정확도 3배 향상. Claude Fable 5.1을 능가하는 코딩·에이전트 성능, Sol Ultrafast Mode는 표준 처리보다 최대 14배 빠름. API를 통해 최대 105만 토큰 컨텍스트. 캐시된 입력 토큰은 100만 개당 $0.50입니다. (2026년 11월 21일까지 입력 $4 / 출력 $20 프로모션 요금 적용) 복잡한 문제 해결, 고급 에이전트, 최상위 플래그십 |
| GPT-5.6 Terra | OpenAI | 1.05M | $2.00 | $12.00 | 비공개 | 2026년 7월 9일 출시. GPT-5.5와 유사한 성능을 절반 가격으로 제공, 2026년 7월 30일 가격 20% 인하, 성능-비용 균형, 범용 추론 일반 프로덕션, 비용 효율적 에이전트 |
| GPT-5.6 Luna | OpenAI | 1.05M | $0.20 | $1.20 | 비공개 | 2026년 7월 9일 출시. 빠르고 저렴한 경량 모델, 일상적인 질의응답 및 분류 작업에 최적화, 2026년 7월 30일 가격 80% 인하 대량 자동화, 챗봇, 빠른 판별 |
| GPT-5.6 Ultra | OpenAI | 1.05M | $8 | $48 | 비공개 | GPT-5.6 시리즈 최상위 모델, Sol보다 더 강력한 추론과 코딩 능력, 울트라 추론 모드 기본 활성화, 가장 복잡한 멀티스테이지 에이전트 워크플로우에 적합 최대 추론 성능, 멀티스테이지 에이전트, 복잡한 문제 해결 |
| GPT-6 Astra | OpenAI | 1.05M | $10 | $50 | 비공개 | 2026년 9월 3일/4일 출시. OpenAI의 새로운 최첨단 플래그십 모델. 컴퓨터 사용, 과학적 추론, 사이버 보안 최첨단 성능. 문서, 스프레드시트, 프레젠테이션 및 3D 모델링 기능 추가. 제로 데이터 보존, 프라이빗 안전 처리 테스트 중. ChatGPT Plus/Pro/Business/Enterprise 및 API/AWS 제공. 빠른 모드 (비용 2배, 2.5배 빠름). 최고 성능 요구, 과학 연구, 사이버 보안, 복잡한 에이전트 |
| o3 | OpenAI | 200K | $1.10 | $4.40 | 비공개 | 추론 특화 모델, 복잡한 논리적 문제 해결, 수학, 코딩에 최적화, 체인 오브 쓰로트 추론 방식 복잡한 추론 작업, 수학 문제, 고급 코딩 |
| o4-Mini High | OpenAI | 200K | $0.44 | $1.76 | 비공개 | 경량 추론 모델, o3 대비 저렴하지만 높은 추론 성능, 빠른 응답과 비용 효율성 균형 빠른 추론 작업, 비용 효율적인 에이전트, 일상적 코딩 |
| GPT-5.5 Instant | OpenAI | 400K | $1.25 | $10.00 | 비공개 | 2025년 8월 7일 출시. 응답 스타일 및 품질 개선, 더 읽기 쉽고 자연스러운 대화, 실용적인 도움 작업 속도 조절, 쓰기 및 코딩 기능 채팅 응답에서 직접 지원. (2026년 2월 13일 ChatGPT에서 기본 모델 역할은 은퇴했으나 API를 통해 계속 사용 가능하며, ChatGPT Plus에서 GPT-5.5 시리즈가 제공됨) 기존 워크로드 (GPT-5.6 Luna/Terra로 전환 권장), ChatGPT Plus 기본 모델 |
| GPT-5.4 | OpenAI | 400K | $2.50 | $15.00 | 비공개 | GPT-5.5 대비 비용 효율적, 범용 고성능. 기존 워크로드 (GPT-5.6 Terra로 전환 권장) |
| GPT-5.4 mini | OpenAI | 400K | $0.75 | $4.50 | 비공개 | GPT-5.4의 경량 버전, 빠른 응답, 저비용. (2026년 8월 31일 지원 종료됨) 기존 워크로드 (2026년 8월 31일 지원 종료됨, GPT-5.6 Luna로 전환 권장) |
| GPT-5.3-Codex | OpenAI | 400K | $5.00 | $30.00 | 비공개 | 2026년 2월 5일 출시, 에이전트 기반 코딩에 최적화, 대규모 코드베이스 작업, 코드 검토 및 디버깅. 기존 워크로드 (GPT-5.6 Sol로 전환 권장) |
| GPT-4o | OpenAI | 128K | $2.50 | $10.00 | 비공개 | 멀티모달 (텍스트, 이미지, 오디오), 128K 컨텍스트. (2026년 2월 13일 ChatGPT에서 은퇴했으나, API를 통해 기존 사용자에게 계속 제공되며, 2024년 10월 가격 인하로 현재 요금 적용) API를 통한 멀티모달 작업 (ChatGPT에서는 은퇴, 기존 워크로드 유지 또는 GPT-5 계열로 전환 권장) |
| GPT-4o Mini | OpenAI | 128K | $0.15 | $0.60 | 비공개 | GPT-4o의 경량 버전, 빠른 응답, 저비용. ChatGPT 음성 모드 구동. ChatGPT 음성 모드 구동, 저비용 빠른 응답 (API에서는 레거시 모델로 분류, GPT-5 계열로 전환 권장) |
| GPT-5.4 Nano | OpenAI | 400K | $0.05 | $1.25 | 비공개 | OpenAI 라인업 중 가장 저렴한 유료 모델, 초저비용, 빠른 응답. 기존 워크로드 (GPT-5.6 Luna로 전환 권장) |
| GPT-OSS 120B | OpenAI | 400K | $2.50 | $10.00 | 오픈웨이트 | 연구 및 실험용 오픈웨이트 모델, 대규모 언어 모델. 2026년 12월 API 가격 추가: 입력 $2.50/출력 $10.00 (1M 토큰 기준) 연구, 실험, 자체 호스팅 |
| GPT-OSS 20B | OpenAI | 400K | $0.50 | $2.00 | 오픈웨이트 | 연구 및 실험용 오픈웨이트 모델, 중소형 언어 모델. 2026년 12월 API 가격 추가: 입력 $0.50/출력 $2.00 (1M 토큰 기준) 연구, 실험, 자체 호스팅, 경량화된 배포 |
| Gemini 3.1 Pro | 2M | $2.00 / $4.00* | $12.00 / $18.00* | 비공개 | 최고 수준 추론, 업계 최고 2M 초장문 컨텍스트, 비디오, 가장 어려운 순수 추론 테스트에서 뛰어난 성능. Gemini 2.5 Pro의 권장 대체 모델. 수학 및 코딩 등 복잡한 사용 사례를 위한 Deep Think 모드. 간접 프롬프트 인젝션 공격 방어력 향상. 프롬프트 길이에 따라 가격 변동 (20만 토큰 초과 시 입력 $4.00 / 출력 $18.00). 복잡한 문서 분석, 비디오 이해, 고급 에이전트, 순수 추론 | |
| Gemini 3 Flash | 1M | $0.40 | $2.40 | 비공개 | 빠른 응답, 비용 효율, 높은 처리량 작업, 대화형 애플리케이션, 멀티모달 처리에 뛰어남 (일일 할당량이 줄어든 무료 등급 유지). 빠른 프로덕션, 대화형 AI, 멀티모달 처리, 비용 효율적 에이전트 | |
| Gemini 3.5 Flash | 1M | $1.50 | $9.00 | 비공개 | 2026년 5월 19일 출시, 빠른 응답, 3.1 Pro보다 25% 저렴, 코딩·에이전트 벤치마크에서 3.1 Pro 능가, 4배 더 빠름, 컴퓨터 사용 도구 프리뷰, 코딩 및 에이전트 벤치마크에서 Gemini 3.1 Pro를 능가하는 성능. 빠른 프로덕션, 코딩 작업, 컴퓨터 사용 에이전트 | |
| Gemini 3.7 Flash | 1M | $0.75 | $3.75 | 비공개 | 2026년 8월 13일 출시. 코딩 기능에 중점을 두었으며, 추론 알고리즘 개선, 사용자 의도 재확인, 지시 충실도 향상, 다단계 계획 수립 및 도구 호출 능력 강화. (2026년 12월 31일까지 입력 $0.75 / 출력 $3.75 도입 가격 적용, 2027년 1월 1일부터 입력 $1.50 / 출력 $7.50로 가격 인상 예정) 빠른 프로덕션, 코딩 작업, 대화형 AI, 멀티모달 처리, 비용 효율적 에이전트 | |
| Gemini 3.8 Flash | 1M | $0.75 | $3.75 | 비공개 | 2026년 9월 2일 출시. 장기적인 에이전트 작업에 중점을 두고 튜닝되었으며, 소프트웨어 엔지니어링, 에이전트 작업, 다단계 추론에서 크게 향상. (2026년 12월 31일까지 입력 $0.75 / 출력 $3.75 도입 가격 적용, 2027년 1월 1일부터 입력 $1.50 / 출력 $7.50로 가격 인상 예정) 장기 실행 에이전트, 소프트웨어 엔지니어링, 에이전트 작업, 고성능 자동화 | |
| Gemini 3.8 Flash Cyber | 1M | $0.75 | $3.75 | 비공개 | 2026년 9월 2일 출시. 취약점 탐지 및 자동 패치에서 최고 수준의 성능을 제공하는 특화 모델. 사이버 보안, 취약점 탐지, 자동 패치, 보안 에이전트 | |
| Gemini 3.6 Flash | 1M | $0.75 | $3.75 | 비공개 | 2026년 7월 21일 출시. 고용량 자동화에 최적화된 저지연, 고비용 효율적인 서브 에이전트 옵션. (2026년 12월 31일까지 입력 $0.75 / 출력 $3.75 도입 가격 적용, 2027년 1월 1일부터 입력 $1.50 / 출력 $7.50로 가격 인상 예정) 초저비용 API, 고용량 자동화, 서브 에이전트 | |
| Gemini 3.5 Flash-Lite | 1M | $0.30 | $2.50 | 비공개 | 현재 가장 저렴한 모델, 고용량 에이전트 작업, 번역 및 간단한 데이터 처리에 최적화된 모델, 비용 효율적 (일일 할당량이 줄어든 무료 등급 유지). 고용량 자동화, 번역, 간단한 데이터 처리, 초저비용 API | |
| Gemini 2.5 Pro | 1M | $1.25 / $2.50* | $10.00 / $15.00* | 비공개 | 레거시 모델 (2026년 7월 31일 GitHub Copilot에서 단종, 2026년 10월 16일 Agent Platform에서 서비스 중단 예정, Gemini 3.1 Pro로 대체 권장), 강력한 추론, 비용 효율 (무료 등급 제거, 유료 전용). 프롬프트 길이에 따라 가격 변동 (20만 토큰 초과 시 입력 $2.50 / 출력 $15.00). 기존 워크로드 (2026년 7월 31일 GitHub Copilot에서 단종, 2026년 10월 16일 Agent Platform에서 서비스 중단 예정, Gemini 3.1 Pro로 전환 권장), 비용 효율적 추론 | |
| Gemini 2.5 Flash | 1M | $0.30 | $2.50 | 비공개 | 레거시 모델 (2026년 10월 16일 지원 중단 예정), 비용 효율, 빠른 응답, 구조화된 출력 지원. 기존 워크로드, 저비용 챗봇, 간단한 작업 | |
| Gemini 2.5 Flash-Lite | 1M | $0.10 | $0.40 | 비공개 | 레거시 모델 (2026년 10월 16일 Agent Platform에서 서비스 중단 예정), 최저 지연 시간 및 비용, 대량 작업 최적화. (2026년 12월 $0.08/$0.32로 가격 인하 예정) 기존 워크로드 (2026년 10월 16일 Agent Platform에서 서비스 중단 예정), 매우 저렴한 API, 대량 분류/요약 | |
| Gemma 4 31B | 128K | Self-host | Self-host | 오픈웨이트 | 최대 변형, 멀티모달, 고급 추론·에이전트 워크플로우 고성능 셀프 호스팅, 온프레미스 에이전트 | |
| Gemma 4 12B | 128K | Self-host | Self-host | 오픈웨이트 | 중형 변형, 멀티모달, RTX 4090에서 fp16 중형 셀프 호스팅, 비용 효율형 멀티모달 | |
| Gemma 3 27B | 128K | Self-host | Self-host | 오픈웨이트 | 멀티모달 오픈웨이트, 단일 24GB GPU 운영 온프레미스 챗봇, 사내 RAG, 비용 0 셀프 호스팅 | |
| Gemma 3 12B | 128K | Self-host | Self-host | 오픈웨이트 | 멀티모달 중형 오픈웨이트, RTX 4090에서 fp16 중형 셀프 호스팅, 엣지 추론 | |
| Llama 4 Maverick | Meta | 1M | $0.20 | $0.70 | 오픈웨이트 | 2025년 4월 5일 출시, MoE 아키텍처, 멀티모달 (12개 언어 지원), 약 4000억 개의 총 파라미터, 128개 전문가, 170억 개의 활성 파라미터, 더 빠르고 가벼운 추론, 출시 당시 GPT-4o 및 Gemini 2.0 Flash 능가, 코딩 및 추론에서 DeepSeek v3.1과 경쟁할 만한 수준. (상업적 사용 가능하나 월간 활성 사용자 7억 명 제한 및 EU 내 다중 모드 사용 제한 라이선스 적용) 온프레미스 멀티모달, 일반 작업, H100 DGX급 시스템 또는 다중 GPU 환경 |
| Llama 4 Scout | Meta | 10M | $0.10 | $0.30 | 오픈웨이트 | 2025년 4월 5일 출시, MoE 아키텍처, 초장문 컨텍스트 (10M, 실제 사용 가능 컨텍스트는 더 좁을 수 있음), 1090억 개의 총 파라미터, 16개 전문가, 170억 개의 활성 파라미터, 비용 효율, 단일 H100 GPU 실행 가능, 효율성 향상, 더 나은 장문 컨텍스트 추론, RAG 워크플로우 최적화. (상업적 사용 가능하나 월간 활성 사용자 7억 명 제한 및 EU 내 다중 모드 사용 제한 라이선스 적용) 온프레미스 장문 분석, 엔터프라이즈 |
| Meta Muse Spark | Meta | N/A | N/A | N/A | 비공개 | 2026년 4월 8일 출시, Meta의 첫 번째 독점적인 최첨단 모델. Llama를 대체하는 API 전용 추론 모델. 고급 추론, 멀티모달 입력 및 작업 실행 통합. Meta의 최첨단 폐쇄형 모델 요구, 고급 추론 및 멀티모달 작업 |
| Meta Muse Glimmer 30B | Meta | 128K | Self-host | Self-host | 오픈웨이트 | 2026년 8월 출시, Apache 2.0 라이선스의 오픈웨이트 모델. 300억 개 매개변수, 128K 컨텍스트, 텍스트 및 이미지 입력, 100개 이상 언어 처리, 로컬 실행에 최적화. Llama를 대체하는 Meta의 새로운 오픈소스 라인업. 온프레미스, 연구, 자체 호스팅 |
| DeepSeek V3.1 | DeepSeek | 128K | $0.14 | $0.28 | 오픈웨이트 | 2025년 1월 16일 출시, MoE 아키텍처, 671B 파라미터 중 37B 활성화, 코딩·수학·추론 최첨단 성능, DeepSeek R1 기반, 오픈 가중치 공개, OpenRouter/Together AI/API 배포 비용 효율적 고성능, 코딩, 수학, 연구, 자체 호스팅 |
| DeepSeek R1 | DeepSeek | 128K | $0.50 | $2.00 | 오픈웨이트 | 2025년 1월 16일 출시, 강화 학습 기반 추론 모델, 복잡한 논리적 문제 해결, 코딩·수학 특화, 오픈 가중치 공개, OpenRouter, Together AI, API 배포 복잡한 추론, 수학, 코딩, 자체 호스팅 |
| Ornith-1.5 | DeepReinforce (Ornith AI) | 128K | Self-host | Self-host | 오픈웨이트 | 2026년 8월 20일 출시, MIT 라이선스 오픈소스. Qwen 3.5/Gemma 4 기반 후처리 학습, 자기 확장형(self-scaffolding) 에이전트 코딩 특화, 스스로 과제를 만들고 하네스를 구축해 학습 데이터로 재활용하는 폐쇄 학습 루프. 397B MoE 플래그십은 SWE-bench Verified 82.4%, Terminal-Bench 2.1 77.5%로 Claude Opus 4.8 수준. 오픈소스 에이전트 코딩, 자체 호스팅, 연구 |
| Mistral Large 5 | Mistral AI | 327K | $3 | $9 | 비공개 | 2026년 4월 3일 출시, 327K 컨텍스트, 56개 언어 지원, 추론·코딩·다국어 특화, O1-스타 사고 메커니즘, 지시 따름 개선, JSON 구조화 향상 다국어 에이전트, RAG, 전문가 분석 |
| Mistral Large 4 | Mistral AI | 128K | $2 | $6 | 비공개 | 2026년 6월 출시, 128K 컨텍스트, 56개 언어 지원, 추론·코딩·다국어 특화, O1-스타 사고 메커니즘, 지시 따름 개선, JSON 구조화 향상 범용 작업, 비용 효율적 에이전트 |
| Mistral Medium 3.5 | Mistral AI | N/A | $3 | $9 | 비공개 | 2026년 12월 10일 출시, 추론 특화, 327K 컨텍스트, 고급 작업에 적합한 강력한 성능 고성능 추론, 전문가 분석 |
| Mistral Small 4 | Mistral AI | N/A | $0.10 | $0.30 | 비공개 | 2026년 12월 10일 출시, 초경량·초고속·초저렴, 일상적인 질의응답 및 분류 작업에 최적화 대량 자동화, 챗봇, 빠른 판별 |
| Codestral Mamba 2 | Mistral AI | 256K | $0.20 | $0.20 | 오픈웨이트 | 2026년 4월 3일 출시, 코딩 특화 오픈웨이트 모델, Mamba2 아키텍처, 7.8B 파라미터, 256K 컨텍스트, 코딩·추론 최적화 코드 생성, 비용 효율적인 로컬 배포 |
| Moonshot AI Kimi | Moonshot | 256K | $0.60 | $0.60 | 비공개 | 최대 256K 컨텍스트, 한국어·영어 지원, 코딩·추론 특화, 실시간 검색 통합 장문 문서 분석, 한국어 작업, 연구 |
| GLM 5.2 | Zhipu AI | 256K | $0.10 | $0.30 | 비공개 | 2026년 7월 26일 출시, 기존 GLM 5 대비 코딩·추론·에이전트 성능 향상, 최대 256K 컨텍스트, $0.10/$0.30 (1M 토큰 기준)으로 뛰어난 비용 효율성, Together AI, OpenRouter 등 주요 API 허브 제공 비용 효율적 고성능, 한국어 작업, 에이전트 자동화 |
| GLM 5 | Zhipu AI | 256K | $0.10 | $0.30 | 비공개 | 최신 GLM 5 모델, 256K 컨텍스트, 코딩·추론·에이전트 작업에 최적화, $0.10/$0.30 (1M 토큰 기준)으로 뛰어난 비용 효율성 일반 고성능 작업, 비용 효율 에이전트 |
| Llama 4 Maverick (Cerebras) | Cerebras | 1M | $0.70 | $1.40 | 오픈웨이트 | 2025년 3월 25일 출시, 112B 파라미터의 인퍼런스 최적화 버전, Cerebras 인플레이션 기반 초고속 처리 (450K 토큰/초), API 기준 $0.70/$1.40 (1M 토큰 기준)으로 가격 인하, 온프레미스 무료 배포 초고속 추론, 대용량 배치 처리, 온프레미스 |
| Sonar Pro | Perplexity | 128K | $3 | $15 | 비공개 | Perplexity의 플래그십 검색 특화 모델, 실시간 웹 검색 통합, 출처 인용, 128K 컨텍스트. 실시간 검색 기반 질의응답, 리서치, 인용 필요 작업 |
| Grok 4.6 | xAI | 500K | $2.00 | $6.00 | 비공개 | 2026년 8월 12일 출시, xAI 플래그십, 500K 컨텍스트, 조정 가능한 추론 노력(reasoning effort), 실시간 X(구 Twitter) 데이터 접근 통합, 20만 토큰 초과 시 입력 $4.00/출력 $12.00로 가격 변동. 실시간 정보 수집, 고급 추론, 사회 분석, 에이전트 작업 |
코딩 성능 비교 (0-100 지수)
SWE-bench Verified + LiveCodeBench + HumanEval 종합 추정치⚠️ 단일 절대 점수가 아닌 여러 공개 벤치 결과를 종합한 상대 지수입니다. 같은 모델도 평가 방식·프롬프트에 따라 ±10점 변동이 있을 수 있습니다. 대규모 코드베이스 자율 작업(SWE-bench)에서는 Claude Opus / GPT-5-Codex 계열이 강세이고, 단일 함수 작성(HumanEval)에서는 모델 간 격차가 더 작습니다. 오픈웨이트(Gemma 3 27B, Llama 4)는 자체 호스팅 가능하지만 절대 성능은 프론티어 closed 모델 대비 10-30점 낮은 편입니다.
한국 개발자 추천 시나리오
- 비용 우선: GPT-5.4 Nano, Gemini 3.5 Flash-Lite, Gemini 3 Flash-Lite, GPT-5.6 Luna, Llama 4 Scout
- 한국어 강점: Claude Sonnet 5
- 온프레미스/사내 데이터: Llama 4 (Maverick, Scout), Gemma 시리즈
- 장문 문서/RAG: Gemini 3.1 Pro (2M), Claude Opus 4.8 (1M), Llama 4 Scout (10M)
- 추론/수학: Claude Opus 4.8, GPT-5.6 Sol, Meta Muse Spark
표를 읽는 법
- 가격은 모두 USD / 1M 토큰 기준
- 오픈웨이트는 가중치만 공개 (라이선스 별도 확인)
- 컨텍스트는 모델 입력 한계, 실제 사용 가능 토큰은 더 적을 수 있음
- 표시되지 않은 무료 티어/배치 할인 등은 각 제공자 정책 확인
자주 묻는 질문
한국에서 결제하려면 어떻게 해야 하나요?
대부분의 글로벌 제공자는 해외결제 가능한 신용카드만 있으면 사용할 수 있습니다. 사업자 명의 카드 또는 법인 결제는 별도 계정/계약이 필요할 수 있습니다.
한국어 성능이 가장 좋은 모델은?
벤치마크상 Claude, GPT-5, Gemini 2.5는 한국어에서 모두 강합니다. Qwen은 한자권 언어 데이터가 많아 한자어 처리가 안정적입니다. 실제 워크로드에서는 직접 평가가 필수입니다.
사내 데이터 보호가 중요하면?
Llama 4 (Maverick, Scout), Gemma 시리즈 같은 오픈웨이트 모델을 자체 GPU 서버나 vLLM/Ollama로 호스팅하면 데이터가 외부로 나가지 않습니다. 클라우드 옵션으로는 AWS Bedrock, Azure OpenAI의 데이터 보존 정책을 확인하세요.