| 2026-08-03 |
Qwen3.8-Max |
92.6% |
알리바바, 2.4조 파라미터 MoE 모델인 Qwen3.8-Max 출시
|
| 2026-08-03 |
Inkling-Small |
89.5% |
Thinking Machines Lab이 276B 오픈 가중치 멀티모달 MoE 모델인 Inkling-Small을 출시
|
| 2026-07-17 |
Kimi K3 |
93.5% |
문샷 AI가 100만 토큰 컨텍스트를 지원하는 2.8T 파라미터 MoE 모델인 오픈 Kimi K3 출시
|
| 2026-07-17 |
GPT-Live-1 |
84.2% |
OpenAI, 풀듀플렉스 음성 모델 출시 및 독일 법원이 AI 오버뷰에 대해 구글을 책임 있게 판결
|
| 2026-03-25 |
o3 |
87.7% |
OpenAI, ChatGPT에서 o3 은퇴 발표 및 벤치마크 점수 공개
|
| 2026-02-25 |
Grok 4 |
87.7% |
xAI, 강력한 에이전트 및 코딩 벤치마크를 갖춘 Grok 4 추론 모델 출시
|
| 2026-02-05 |
Claude Opus 4.6 |
91.3% |
Anthropic, 1M 컨텍스트 창과 에이전트 기능 개선을 갖춘 Claude Opus 4.6 출시
|
| 2026-01-27 |
Kimi K2.5 |
87.6% |
Moonshot, 에이전트 스웜 기술 탑재 Kimi K2.5 출시
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI, 코드 작성·긴 문맥·추론 능력 개선된 GPT-5.2 출시
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI, 과학 및 수학용 GPT-5.2 Pro 및 Thinking 모델 출시
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI, 과학 및 수학용 GPT-5.2 Pro 및 Thinking 모델 출시
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI, 코드 작성·긴 문맥·추론 능력 개선된 GPT-5.2 출시
|
| 2025-12-04 |
Gemini 3 Pro |
93.0% |
Epoch AI, 프론티어 데이터 센터 허브 출시 및 OSWorld 벤치마크 분석
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
구글, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
구글, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
|
| 2025-10-24 |
GPT-5.2 |
92.4% |
GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
|
| 2025-10-24 |
GPT-4 |
39.0% |
GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
|
| 2025-10-24 |
Claude 3 Opus |
60.0% |
GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
|
| 2025-10-24 |
O1 |
77.0% |
GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
|
| 2025-10-24 |
Claude Opus 4.6 |
91.3% |
GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
|
| 2025-10-24 |
Gemini 3 Pro |
91.9% |
GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
|
| 2025-10-24 |
Gemini 3.1 Pro Preview |
94.1% |
GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
|
| 2025-10-24 |
Aristotle-X1 |
92.4% |
GPQA-Diamond 벤치마크: 점수, 리더보드 및 AI 모델 비교
|
| 2025-09-30 |
Claude Sonnet 4.5 |
83.4% |
Anthropic, 코딩 및 에이전트 기능 강화된 Claude Sonnet 4.5 출시
|
| 2025-09-22 |
DeepSeek-V3.1-Terminus |
74.24% |
DeepSeek, 언어 및 에이전트 수정이 적용된 DeepSeek-V3.1-Terminus 출시
|
| 2025-08-07 |
GPT-5 pro |
88.4% |
OpenAI가 통합 라우팅과 전문가 수준의 추론을 갖춘 GPT-5를 출시하다
|
| 2025-08-07 |
GPT-5 Pro |
88.4% |
OpenAI, 적응형 추론과 통합 아키텍처를 갖춘 GPT-5 출시
|
| 2025-08-07 |
GPT-5 pro |
89.4% |
OpenAI, 실시간 라우팅과 무료 접근성을 갖춘 통합 GPT-5 출시
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Kimi K2: 1조 파라미터와 MuonClip 옵티마이저를 갖춘 오픈 MoE 모델
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Moonshot, 32B 활성화 파라미터를 가진 오픈 에이전트 MoE 모델 Kimi K2 출시
|
| 2025-05-30 |
Deepseek-R1-0528 |
81.0% |
DeepSeek, 향상된 추론 및 벤치마크 점수로 R1 모델 업데이트
|
| 2025-05-22 |
Claude Sonnet 4 |
70.0% |
Anthropic, 확장된 사고와 도구 사용 기능을 갖춘 Claude Opus 4 및 Sonnet 4 출시
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic이 ASL-3 안전 조치를 갖춘 Claude Opus 4와 Sonnet 4를 출시
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic, 확장된 사고와 도구 사용 기능을 갖춘 Claude Opus 4 및 Sonnet 4 출시
|
| 2025-04-16 |
OpenAI o3 |
87.7% |
OpenAI
|
| 2025-04-15 |
Gemini 2.0 Flash |
60.1% |
구글, Gemini 1.5 Pro보다 두 배 빠른 속도와 향상된 품질의 Gemini 2.0 Flash 출시
|
| 2025-04-14 |
GPT‑4.1 nano |
50.3% |
OpenAI, API에 GPT-4.1, GPT-4.1 mini, GPT-4.1 nano 출시
|
| 2025-04-10 |
Seed1.5-Thinking |
77.3% |
Seed1.5-Thinking은 강화학습을 사용하여 추론을 개선합니다
|
| 2025-04-05 |
Gemini 2.5 Pro |
84.0% |
강력한 벤치마크 결과에 힘입어 Gemini 2.5 Pro 접근성 확대
|
| 2025-03-26 |
Gemini 2.5 Pro |
84.0% |
구글, 100만 토큰 컨텍스트를 지원하는 실험용 Gemini 2.5 Pro 추론 모델 출시
|
| 2025-03-25 |
Gemini 2.5 Pro (experimental) |
84.0% |
Google DeepMind, Gemini 2.5 Pro 실험 모델 출시
|
| 2025-03-25 |
Gemini 2.5 Pro |
84.0% |
Google DeepMind
|
| 2025-03-24 |
DeepSeek-V3-0324 |
68.4% |
DeepSeek-V3-0324은 DeepSeek-V3 대비 추론, 코딩, 중국어 작문 능력을 향상
|
| 2025-03-11 |
Grok 3 |
84.6% |
xAI, 심층 추론과 백만 토큰 컨텍스트를 갖춘 Grok 3 출시
|
| 2025-03-05 |
GPT-4.5 |
71.4% |
오픈에이아이, 차트GPT 플러스용 최대 규모 모델 GPT-4.5 출시
|
| 2025-02-26 |
Claude 3.7 Sonnet |
84.8% |
Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
|
| 2025-02-26 |
Grok 3 Beta |
84.6% |
Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
|
| 2025-02-26 |
DeepSeek R1 |
71.5% |
Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
|
| 2025-02-26 |
OpenAI o3-mini |
78.0% |
Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
|
| 2025-02-26 |
Claude 3.5 Sonnet |
65.0% |
Claude 3.7 Sonnet, o3-mini, R1, Grok 3 Beta의 벤치마크 비교
|
| 2025-02-24 |
Claude 3.7 Sonnet |
84.8% |
Anthropic, 동적 추론 제어가 가능한 Claude 3.7 Sonnet 출시
|
| 2025-02-19 |
Grok 3 (Think) |
84.6% |
xAI가 Grok 3 베타 및 DeepSearch 에이전트 출시
|
| 2024-12-20 |
o3 |
87.7% |
OpenAI, 추론 및 코딩에서 높은 성능을 갖춘 o3 모델 출시
|
| 2024-11-28 |
QwQ-32B-Preview |
65.2% |
Qwen, 실험적 추론 모델 QwQ-32B-Preview 출시
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Qwen 팀, 72B 밀집 및 MoE 모델이 포함된 Qwen2 시리즈 출시
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Qwen2 기술 보고서: 최대 72B 규모의 밀집형 및 MoE 모델 소개
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic, Claude 3.5 Sonnet의 향상된 코딩 및 비전 벤치마크를 포함한 추가 문서 출시
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic
|
| 2023-11-20 |
GPT-4 based baseline |
39.0% |
GPQA: 대학원 수준의 Google 방지 Q&A 벤치마크
|