AI 모델 평가

🤖 AI 모델 비교 평가

주요 오픈소스 및 상업용 AI 모델을 객관적으로 비교하고, 내 프로젝트에 맞는 모델을 선택하세요.

📊 전체 모델 비교표 보기
GPT-5.5
OpenAI
상업용
종합 성능94/100
코딩 성능91/100
💰 $5.00 / $30.00/1M ⚡ 60t/s 📄 922K

OpenAI의 2026년 플래그십. Artificial Analysis Intelligence Index 상위권으로 Claude Opus 4.8과 최상위를 다투며, 코딩 특화 버전(GPT-5.3 Codex)도 별도 제공.

o4
OpenAI
상업용
종합 성능93/100
코딩 성능90/100
💰 $8.00 / $32.00/1M ⚡ 40t/s 📄 200K

OpenAI의 추론 특화 모델. 단계별 사고(chain-of-thought)로 복잡한 수학·과학·논리 문제 해결에 강하나 응답 속도는 느린 편.

Claude Opus 4.8
Anthropic
상업용
종합 성능92/100
코딩 성능93/100
💰 $5.00 / $25.00/1M ⚡ 70t/s 📄 1M

Anthropic 최고 성능 모델. 복잡한 추론, 장문 작업, 코딩에 탁월하며 100만 토큰 컨텍스트 지원.

Gemini 3 Pro
Google
상업용
종합 성능91/100
코딩 성능88/100
💰 $2.50 / $12.00/1M ⚡ 55t/s 📄 2M

Google 차세대 플래그십. 2M 토큰 초장문 컨텍스트와 향상된 멀티모달 처리 능력 제공.

Llama 4 Behemoth
Meta
상업용
종합 성능90/100
코딩 성능85/100
💰 오픈웨이트 (API 전용) ⚡ 35t/s 📄 1M

Meta의 최상위 초대형 모델. 오픈웨이트 계열 중 최고 수준의 종합 성능을 목표로 설계.

GLM-5.2
Z AI
오픈소스
종합 성능90/100
코딩 성능89/100
💰 $0.90/1M ⚡ 55t/s 📄 1M 🖥️ 로컬

2026년 7월 기준 오픈웨이트 모델 중 지능지수 1위(Artificial Analysis Intelligence Index). MIT 라이선스로 상업 이용 자유롭고, 폐쇄형 최상위 모델과 격차를 크게 좁혔다.

DeepSeek R2
DeepSeek
오픈소스
종합 성능89/100
코딩 성능90/100
💰 $0.55/1M ⚡ 45t/s 📄 128K 🖥️ 로컬

추론에 특화된 오픈소스 모델. 저비용으로도 상위권 추론 성능을 낸다.

Grok 4.20
xAI
상업용
종합 성능89/100
코딩 성능85/100
💰 1.875 ⚡ 55t/s 📄 2M

Grok 4.20 is a reasoning model from xAI with industry-leading speed and agentic tool calling capabil

Claude Sonnet 4.6
Anthropic
상업용
종합 성능88/100
코딩 성능87/100
💰 9 ⚡ 65t/s 📄 1M

Sonnet 4.6 is Anthropic's most capable Sonnet-class model yet, with frontier performance across codi

DeepSeek V4 Pro
DeepSeek
오픈소스
종합 성능87/100
코딩 성능86/100
💰 $0.18/1M ⚡ 50t/s 📄 1M 🖥️ 로컬

오픈웨이트 상위권 모델이자 OpenRouter 주간 토큰 볼륨 7위(1.00조 토큰/주). 초저가(.18/1M)로 폐쇄형 상위 모델급 성능을 제공해 에이전트 워크로드에서 인기.

DeepSeek V3
DeepSeek
오픈소스
종합 성능87/100
코딩 성능91/100
💰 $0.24 / $0.90/1M ⚡ 30t/s 📄 164K 🖥️ 로컬

MIT 라이선스 오픈소스. 코딩·수학에서 GPT-4o급 성능을 1/10 가격에 제공. 자체 호스팅 가능.

Qwen3.7 Max
Alibaba
상업용
종합 성능86/100
코딩 성능83/100
💰 $1.43/1M ⚡ 45t/s 📄 1M

중국 프로프라이어터리 모델 중 최고 순위. Qwen 오픈웨이트 시리즈와 달리 API 전용으로만 제공되는 Alibaba의 최상급 모델.

Claude Sonnet 4.5
Anthropic
상업용
종합 성능86/100
코딩 성능85/100
💰 $3.00 / $15.00/1M ⚡ 65t/s 📄 500K

Sonnet 4.6 이전 세대. 안정적 성능과 500K 토큰 컨텍스트로 실무에서 널리 쓰인다.

Grok 4.3
xAI
상업용
종합 성능86/100
코딩 성능82/100
💰 1.875 ⚡ 60t/s 📄 1M

Grok 4.3 is a reasoning model from xAI. It accepts text and image inputs with text output, and is su

Kimi K2.6
Moonshot AI
오픈소스
종합 성능85/100
코딩 성능88/100
💰 $0.70/1M ⚡ 50t/s 📄 256K 🖥️ 로컬

Kimi K2 시리즈의 2026년 최신판. 코딩 특화 파생 모델 Kimi K2.7 Code도 별도 출시되어 있으며, 오픈웨이트 코딩 성능 최상위권을 유지.

Gemini 2.5 Pro
Google
상업용
종합 성능85/100
코딩 성능86/100
💰 5.625 ⚡ 50t/s 📄 1M

Gemini 2.5 Pro is Google’s state-of-the-art AI model designed for advanced reasoning, coding, mathem

DeepSeek Coder V3
DeepSeek
오픈소스
종합 성능84/100
코딩 성능92/100
💰 $0.30 / $1.20/1M ⚡ 60t/s 📄 128K 🖥️ 로컬

코딩에 특화된 모델. 코딩 벤치마크에서 전체 모델 중에서도 최상위권 점수 기록.

Mistral Large 3 2512
Mistral AI
오픈소스
종합 성능84/100
코딩 성능79/100
💰 1 ⚡ 55t/s 📄 262K 🖥️ 로컬

Mistral Large 3 2512 is Mistral’s most capable model to date, featuring a sparse mixture-of-experts

GLM-4.6
Z AI
오픈소스
종합 성능83/100
코딩 성능80/100
💰 $0.60/1M ⚡ 58t/s 📄 200K 🖥️ 로컬

GLM-5.2 이전 세대. 오픈소스 진영에서 준수한 성능과 가격 경쟁력 유지.

MiniMax-M3
MiniMax
오픈소스
종합 성능83/100
코딩 성능80/100
💰 $0.22/1M ⚡ 60t/s 📄 1M 🖥️ 로컬

오픈웨이트 순위 2위 모델. 저렴한 가격과 100만 토큰 컨텍스트로 롱컨텍스트·에이전트 작업에서 가성비가 뛰어남.

Llama 4 Maverick
Meta
오픈소스
종합 성능83/100
코딩 성능80/100
💰 0.5 ⚡ 55t/s 📄 1M 🖥️ 로컬

Llama 4 Maverick 17B Instruct (128E) is a high-capacity multimodal language model from Meta, built o

Gemini 3.5 Flash
Google
상업용
종합 성능82/100
코딩 성능79/100
💰 $1.50 / $9.00/1M ⚡ 88t/s 📄 1M

Google의 2026년 고속 플래그십. Artificial Analysis Intelligence Index 상위권에 들 만큼 지능·속도 균형이 우수하며 100만 토큰 멀티모달 처리가 강점.

Qwen3 Coder
Alibaba
오픈소스
종합 성능82/100
코딩 성능90/100
💰 $0.40/1M ⚡ 65t/s 📄 256K 🖥️ 로컬

코딩 특화 모델. 오픈소스이면서도 상업용 코딩 모델에 필적하는 성능.

Nemotron 4 340B
Nvidia
오픈소스
종합 성능81/100
코딩 성능76/100
💰 오픈웨이트 (무료) ⚡ 50t/s 📄 128K 🖥️ 로컬

Nvidia가 공개한 대형 오픈소스 모델. 자사 GPU 인프라 최적화가 특징.

Qwen2.5 Max
Alibaba
상업용
종합 성능81/100
코딩 성능78/100
💰 $1.60/1M ⚡ 50t/s 📄 128K

Alibaba의 상업용 API 전용 모델. 중국어를 포함한 다국어 처리에 강점.

DeepSeek V4 Flash
DeepSeek
오픈소스
종합 성능80/100
코딩 성능78/100
💰 $0.14 / $0.28/1M ⚡ 70t/s 📄 1M 🖥️ 로컬

2026년 7월 기준 OpenRouter 주간 토큰 볼륨 세계 1위(3.43조 토큰/주, WoW +66%). 초저가·고처리량으로 에이전트 워크플로우의 사실상 표준 저비용 모델.

Nova Pro
Amazon
상업용
종합 성능80/100
코딩 성능75/100
💰 $0.80 / $3.20/1M ⚡ 60t/s 📄 300K

AWS 생태계에 최적화된 모델. Bedrock 등 AWS 서비스와의 통합이 강점.

Qwen3 235B A22B
Alibaba (Qwen)
오픈소스
종합 성능80/100
코딩 성능82/100
💰 1.1375 ⚡ 50t/s 📄 131K 🖥️ 로컬

Qwen3-235B-A22B is a 235B parameter mixture-of-experts (MoE) model developed by Qwen, activating 22B

Grok 3
xAI
상업용
종합 성능80/100
코딩 성능77/100
💰 $3.00 / $15.00/1M ⚡ 55t/s 📄 128K

xAI의 이전 세대 모델. Grok 4 시리즈 대비 저렴한 가격에 쓸만한 성능 제공.

Kimi K2 0711
Moonshot AI
오픈소스
종합 성능80/100
코딩 성능83/100
💰 1.435 ⚡ 45t/s 📄 131K 🖥️ 로컬

Kimi K2 Instruct is a large-scale Mixture-of-Experts (MoE) language model developed by Moonshot AI,

Llama 4 Scout
Meta
상업용
종합 성능79/100
코딩 성능74/100
💰 오픈웨이트 (무료) ⚡ 60t/s 📄 10M 🖥️ 로컬

Meta의 초장문 컨텍스트 특화 모델. 1000만 토큰이라는 압도적인 컨텍스트 길이 지원.

Sonar Large
Perplexity
상업용
종합 성능79/100
코딩 성능70/100
💰 $1.00 / $1.00/1M ⚡ 60t/s 📄 128K

Perplexity의 실시간 검색 결합 모델. 최신 웹 정보를 실시간 반영한 답변 생성.

Codestral 3
Mistral
상업용
종합 성능78/100
코딩 성능85/100
💰 $0.30 / $0.90/1M ⚡ 70t/s 📄 256K 🖥️ 로컬

Mistral의 코딩 특화 모델. 다양한 프로그래밍 언어에서 우수한 코드 생성 성능.

GPT-4o
OpenAI
상업용
종합 성능78/100
코딩 성능75/100
💰 6.25 ⚡ 55t/s 📄 128K

GPT-4o ("o" for "omni") is OpenAI's latest AI model, supporting both text and image inputs with text

MiniMax M1
MiniMax
오픈소스
종합 성능78/100
코딩 성능75/100
💰 1.375 ⚡ 60t/s 📄 1M 🖥️ 로컬

MiniMax-M1 is a large-scale, open-weight reasoning model designed for extended context and high-effi

Gemini 2.5 Flash
Google
상업용
종합 성능78/100
코딩 성능76/100
💰 1.4 ⚡ 85t/s 📄 1M

Gemini 2.5 Flash is Google's state-of-the-art workhorse model, specifically designed for advanced re

Command A
Cohere
상업용
종합 성능77/100
코딩 성능72/100
💰 $2.50 / $10.00/1M ⚡ 55t/s 📄 256K

Cohere의 기업용 모델. RAG(검색증강생성)와 기업 데이터 연동에 특화.

Kimi K1.5
Moonshot AI
오픈소스
종합 성능76/100
코딩 성능74/100
💰 $0.50 / $2.00/1M ⚡ 60t/s 📄 200K 🖥️ 로컬

Moonshot AI의 이전 세대 모델. 합리적인 가격에 준수한 성능 제공.

GPT-5.5 Mini
OpenAI
상업용
종합 성능76/100
코딩 성능73/100
💰 $0.30 / $1.20/1M ⚡ 90t/s 📄 400K

GPT-5.5의 경량화 버전. 성능은 다소 낮지만 속도와 비용에서 강점을 가진다.

Jamba 2 Large
AI21
오픈소스
종합 성능75/100
코딩 성능70/100
💰 $0.50 / $1.50/1M ⚡ 60t/s 📄 256K 🖥️ 로컬

AI21의 하이브리드 아키텍처 모델. 긴 컨텍스트에서도 빠른 처리 속도 유지.

MiniMax Text-01
MiniMax
오픈소스
종합 성능74/100
코딩 성능70/100
💰 $0.20 / $1.10/1M ⚡ 65t/s 📄 4M 🖥️ 로컬

400만 토큰 초장문 컨텍스트가 특징인 모델. 초대형 문서 처리에 특화.

Gemma 3 27B
Google
오픈소스
종합 성능74/100
코딩 성능70/100
💰 오픈웨이트 (무료) ⚡ 70t/s 📄 128K 🖥️ 로컬

Google이 공개한 오픈웨이트 모델. 작은 규모에도 준수한 성능으로 로컬 실행에 적합.

Claude Haiku 4.5
Anthropic
상업용
종합 성능74/100
코딩 성능70/100
💰 3 ⚡ 95t/s 📄 200K

Claude Haiku 4.5 is Anthropic’s fastest and most efficient model, delivering near-frontier intellige

Llama 3.3 70B Instruct
Meta
오픈소스
종합 성능72/100
코딩 성능68/100
💰 0.265 ⚡ 45t/s 📄 131K 🖥️ 로컬

The Meta Llama 3.3 multilingual large language model (LLM) is a pretrained and instruction tuned gen

Mistral Small 3
Mistral
오픈소스
종합 성능71/100
코딩 성능68/100
💰 $0.10 / $0.30/1M ⚡ 95t/s 📄 128K 🖥️ 로컬

Mistral의 경량 오픈소스 모델. 매우 저렴한 가격과 빠른 속도가 특징.

Granite 4
IBM
오픈소스
종합 성능70/100
코딩 성능68/100
💰 오픈웨이트 (무료) ⚡ 65t/s 📄 128K 🖥️ 로컬

기업용으로 설계된 오픈소스 모델. 투명한 데이터 출처와 컴플라이언스 강점.

Orca 3
Microsoft
오픈소스
종합 성능69/100
코딩 성능64/100
💰 오픈웨이트 (무료) ⚡ 90t/s 📄 32K 🖥️ 로컬

Microsoft의 중소형 오픈소스 모델. 작은 크기 대비 준수한 추론 능력.

Phi 4
Microsoft
오픈소스
종합 성능68/100
코딩 성능65/100
💰 0.105 ⚡ 80t/s 📄 16K 🖥️ 로컬

[Microsoft Research](/microsoft) Phi-4 is designed to perform well in complex reasoning tasks and ca

GPT-4o-mini
OpenAI
상업용
종합 성능65/100
코딩 성능62/100
💰 0.375 ⚡ 75t/s 📄 128K

GPT-4o mini is OpenAI's newest model after [GPT-4 Omni](/models/openai/gpt-4o), supporting both text

Phi-4-mini
Microsoft
오픈소스
종합 성능60/100
코딩 성능56/100
💰 오픈웨이트 (무료) ⚡ 100t/s 📄 8K 🖥️ 로컬

Microsoft의 초경량 모델. 모바일·엣지 기기에서도 실행 가능할 만큼 작은 크기.