🤖 AI 모델 비교 평가
주요 오픈소스 및 상업용 AI 모델을 객관적으로 비교하고, 내 프로젝트에 맞는 모델을 선택하세요.
OpenAI의 2026년 플래그십. Artificial Analysis Intelligence Index 상위권으로 Claude Opus 4.8과 최상위를 다투며, 코딩 특화 버전(GPT-5.3 Codex)도 별도 제공.
OpenAI의 추론 특화 모델. 단계별 사고(chain-of-thought)로 복잡한 수학·과학·논리 문제 해결에 강하나 응답 속도는 느린 편.
Anthropic 최고 성능 모델. 복잡한 추론, 장문 작업, 코딩에 탁월하며 100만 토큰 컨텍스트 지원.
Google 차세대 플래그십. 2M 토큰 초장문 컨텍스트와 향상된 멀티모달 처리 능력 제공.
Meta의 최상위 초대형 모델. 오픈웨이트 계열 중 최고 수준의 종합 성능을 목표로 설계.
2026년 7월 기준 오픈웨이트 모델 중 지능지수 1위(Artificial Analysis Intelligence Index). MIT 라이선스로 상업 이용 자유롭고, 폐쇄형 최상위 모델과 격차를 크게 좁혔다.
추론에 특화된 오픈소스 모델. 저비용으로도 상위권 추론 성능을 낸다.
Grok 4.20 is a reasoning model from xAI with industry-leading speed and agentic tool calling capabil
Sonnet 4.6 is Anthropic's most capable Sonnet-class model yet, with frontier performance across codi
오픈웨이트 상위권 모델이자 OpenRouter 주간 토큰 볼륨 7위(1.00조 토큰/주). 초저가(.18/1M)로 폐쇄형 상위 모델급 성능을 제공해 에이전트 워크로드에서 인기.
MIT 라이선스 오픈소스. 코딩·수학에서 GPT-4o급 성능을 1/10 가격에 제공. 자체 호스팅 가능.
중국 프로프라이어터리 모델 중 최고 순위. Qwen 오픈웨이트 시리즈와 달리 API 전용으로만 제공되는 Alibaba의 최상급 모델.
Sonnet 4.6 이전 세대. 안정적 성능과 500K 토큰 컨텍스트로 실무에서 널리 쓰인다.
Grok 4.3 is a reasoning model from xAI. It accepts text and image inputs with text output, and is su
Kimi K2 시리즈의 2026년 최신판. 코딩 특화 파생 모델 Kimi K2.7 Code도 별도 출시되어 있으며, 오픈웨이트 코딩 성능 최상위권을 유지.
Gemini 2.5 Pro is Google’s state-of-the-art AI model designed for advanced reasoning, coding, mathem
코딩에 특화된 모델. 코딩 벤치마크에서 전체 모델 중에서도 최상위권 점수 기록.
Mistral Large 3 2512 is Mistral’s most capable model to date, featuring a sparse mixture-of-experts
GLM-5.2 이전 세대. 오픈소스 진영에서 준수한 성능과 가격 경쟁력 유지.
오픈웨이트 순위 2위 모델. 저렴한 가격과 100만 토큰 컨텍스트로 롱컨텍스트·에이전트 작업에서 가성비가 뛰어남.
Llama 4 Maverick 17B Instruct (128E) is a high-capacity multimodal language model from Meta, built o
Google의 2026년 고속 플래그십. Artificial Analysis Intelligence Index 상위권에 들 만큼 지능·속도 균형이 우수하며 100만 토큰 멀티모달 처리가 강점.
코딩 특화 모델. 오픈소스이면서도 상업용 코딩 모델에 필적하는 성능.
Nvidia가 공개한 대형 오픈소스 모델. 자사 GPU 인프라 최적화가 특징.
Alibaba의 상업용 API 전용 모델. 중국어를 포함한 다국어 처리에 강점.
2026년 7월 기준 OpenRouter 주간 토큰 볼륨 세계 1위(3.43조 토큰/주, WoW +66%). 초저가·고처리량으로 에이전트 워크플로우의 사실상 표준 저비용 모델.
AWS 생태계에 최적화된 모델. Bedrock 등 AWS 서비스와의 통합이 강점.
Qwen3-235B-A22B is a 235B parameter mixture-of-experts (MoE) model developed by Qwen, activating 22B
xAI의 이전 세대 모델. Grok 4 시리즈 대비 저렴한 가격에 쓸만한 성능 제공.
Kimi K2 Instruct is a large-scale Mixture-of-Experts (MoE) language model developed by Moonshot AI,
Meta의 초장문 컨텍스트 특화 모델. 1000만 토큰이라는 압도적인 컨텍스트 길이 지원.
Perplexity의 실시간 검색 결합 모델. 최신 웹 정보를 실시간 반영한 답변 생성.
Mistral의 코딩 특화 모델. 다양한 프로그래밍 언어에서 우수한 코드 생성 성능.
GPT-4o ("o" for "omni") is OpenAI's latest AI model, supporting both text and image inputs with text
MiniMax-M1 is a large-scale, open-weight reasoning model designed for extended context and high-effi
Gemini 2.5 Flash is Google's state-of-the-art workhorse model, specifically designed for advanced re
Cohere의 기업용 모델. RAG(검색증강생성)와 기업 데이터 연동에 특화.
Moonshot AI의 이전 세대 모델. 합리적인 가격에 준수한 성능 제공.
GPT-5.5의 경량화 버전. 성능은 다소 낮지만 속도와 비용에서 강점을 가진다.
AI21의 하이브리드 아키텍처 모델. 긴 컨텍스트에서도 빠른 처리 속도 유지.
400만 토큰 초장문 컨텍스트가 특징인 모델. 초대형 문서 처리에 특화.
Google이 공개한 오픈웨이트 모델. 작은 규모에도 준수한 성능으로 로컬 실행에 적합.
Claude Haiku 4.5 is Anthropic’s fastest and most efficient model, delivering near-frontier intellige
The Meta Llama 3.3 multilingual large language model (LLM) is a pretrained and instruction tuned gen
Mistral의 경량 오픈소스 모델. 매우 저렴한 가격과 빠른 속도가 특징.
기업용으로 설계된 오픈소스 모델. 투명한 데이터 출처와 컴플라이언스 강점.
Microsoft의 중소형 오픈소스 모델. 작은 크기 대비 준수한 추론 능력.
[Microsoft Research](/microsoft) Phi-4 is designed to perform well in complex reasoning tasks and ca
GPT-4o mini is OpenAI's newest model after [GPT-4 Omni](/models/openai/gpt-4o), supporting both text
Microsoft의 초경량 모델. 모바일·엣지 기기에서도 실행 가능할 만큼 작은 크기.