| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.6% |
DeepSeek, 네이티브 멀티모달 지원을 갖춘 V4.1-Flash 모델 출시
|
| 2026-09-07 |
K2-Horizon-MoVA-36B-A4B |
58.6% |
IFM이 K2 Horizon 출시: 0.9B에서 375B까지 Apache 2.0 라이선스를 가진 여섯 개의 모델
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
66.9% |
IFM이 K2 Horizon 출시: 0.9B에서 375B까지 Apache 2.0 라이선스를 가진 여섯 개의 모델
|
| 2026-09-04 |
Muse Spark 1.3 |
88.8% |
Meta, 도구 호출 및 토큰을 줄인 Muse Spark 1.3 출시
|
| 2026-08-26 |
Granite 4.2 30B |
29.24% |
IBM이 오픈 엔터프라이즈 모델을 위해 네이티브 추론과 에이전트 RL을 갖춘 Granite 4.2 출시
|
| 2026-08-26 |
Granite 4.2 8B |
20.56% |
IBM이 오픈 엔터프라이즈 모델을 위해 네이티브 추론과 에이전트 RL을 갖춘 Granite 4.2 출시
|
| 2026-08-21 |
Grok 4.6 |
88.4% |
SpaceXAI가 에이전트 작업을 위한 Cursor 데이터를 활용한 Grok 4.6 출시
|
| 2026-08-21 |
DeepSeek-V4-Flash-Vision-Exp |
83.9% |
DeepSeek, DeepSeek-V4-Flash-Vision-Exp 멀티모달 모델 출시
|
| 2026-08-20 |
agents |
94.0% |
메타, 네이티브 오디오를 지원하는 Muse Video 출시; 스트라이프가 OpenRouter 인수
|
| 2026-08-19 |
Ornith-1.5 |
86.1% |
Ornith-1.5가 자기 개선 훈련을 통해 9B, 35B-A3B, 397B 모델 출시
|
| 2026-08-13 |
DeepSeek-V4-Pro |
87.9% |
DeepSeek-V4-Pro GA 릴리스로 에이전트 기능 강화 및 Responses API 지원 추가
|
| 2026-08-13 |
Grok 4.6 |
88.4% |
xAI, Grok 4.6 출시; 알리바바, Qwen3.8-MoE 오픈; DeepSeek V4 Pro GA
|
| 2026-08-11 |
Opus 5 |
86.74% |
오로보로스 자기 개발 에이전트가 Opus 5로 새로운 벤치마크 기록 수립
|
| 2026-08-10 |
Qwen3.6-27B |
60.7% |
Meta가 단일 소비자용 GPU에서 구동되는 30B 오픈 가중치 에이전트 모델인 Muse Glimmer를 출시
|
| 2026-08-09 |
DeepSeek V4 Flash 0731 |
82.7% |
DeepSeek V4 Flash 0731, 공개 하네스에서 Terminal-Bench 2.1 에 82.7% 달성
|
| 2026-08-08 |
Pokee-Isaac 28B |
65.1% |
Pokee AI, 경계 내 배포용 10M 토큰 컨텍스트 모델 Pokee-Isaac 28B 출시
|
| 2026-08-07 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek, V4-Flash-0731 출시, 더 낮은 비용으로 V4-Pro를 능가
|
| 2026-08-05 |
Muse Spark 1.1 |
80.0% |
Meta, Muse Spark 1.2 기반의 Muse Code 베타 터미널 에이전트 출시
|
| 2026-08-05 |
Qwen3.8-Max |
67.4% |
알리바바, 2.4T 파라미터를 갖춘 Qwen3.8-Max와 향후 오픈 가중치 발표
|
| 2026-08-03 |
Qwen3.8-Max |
86.6% |
알리바바, 2.4조 파라미터 MoE 모델인 Qwen3.8-Max 출시
|
| 2026-08-03 |
Inkling-Small |
64.7% |
Thinking Machines Lab이 276B 오픈 가중치 멀티모달 MoE 모델인 Inkling-Small을 출시
|
| 2026-08-01 |
V4 Flash 0731 |
79.0% |
DeepSeek, 주요 사후 학습 향상과 오픈 가중치를 갖춘 V4-Flash 출시
|
| 2026-08-01 |
DeepSeek-V4-Flash |
79.0% |
DeepSeek, 사후 학습 향상과 오픈 가중치를 갖춘 V4-Flash 출시
|
| 2026-07-31 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek, 낮은 비용으로 주요 에이전트 성능 향상된 V4-Flash-0731 출시
|
| 2026-07-31 |
DeepSeek-V4-Flash |
82.7% |
DeepSeek, 에이전트 기능 강화된 DeepSeek-V4-Flash 공개 베타 출시
|
| 2026-07-27 |
Gemini 3.5 Flash-Lite |
54.0% |
구글, Gemini 3.6 Flash, 3.5 Flash-Lite 및 3.5 Flash Cyber 출시
|
| 2026-07-26 |
KAT-Coder-V2.5 |
60.7% |
KwaiKAT가 100,000개 이상의 검증 가능한 환경에서 훈련된 에이전트 코딩 모델 KAT-Coder-V2.5를 출시
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google, 에이전트 워크로드를 위한 Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 출시
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
구글, Gemini 3.6 Flash, 3.5 Flash-Lite 및 3.5 Flash Cyber 출시
|
| 2026-07-08 |
hermes |
55.0% |
사용자가 Mimo v2.5를 DeepSeek V4 Flash 및 Hermes와 벤치마킹
|
| 2026-07-08 |
Grok 4.5 |
83.3% |
xAI, 저비용 및 혼합 벤치마크 성능의 Grok 4.5 출시
|
| 2026-07-07 |
LLM-as-a-Verifier |
86.5% |
LLM-as-a-Verifier이 연속 점수 매핑을 위한 범용 검증 프레임워크 도입
|
| 2026-07-05 |
GLM 5.2 FP8 with FP8 KV |
79.8% |
GLM 5.2 FP8 및 FP8 KV로 Terminal-Bench 2.1에서 79.8% 달성
|
| 2026-04-25 |
Qwen3.6-27B |
59.3% |
알리바바, Qwen3.6-27B 출시, 더 큰 후속 모델보다 코딩 벤치마크에서 우위
|
| 2026-04-25 |
GPT-5.5 |
82.7% |
OpenAI, 네이티브 오미모달 처리를 갖춘 GPT-5.5 출시
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI, 에이전트 기능과 두 배의 API 가격으로 GPT-5.5 출시
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI, API를 통해 GPT-5.5 및 GPT-5.5 Pro 출시
|
| 2026-04-12 |
MiniMax M2.7 |
57.0% |
MiniMax가 자체 진화 MoE 모델 M2.7을 오픈소스로 공개, SWE-Pro에서 56.22% 점수 달성
|
| 2026-02-10 |
Step 3.5 Flash |
51.0% |
단계 3.5 Flash: 11B 활성 MoE 모델이 최전선 에이전트 성능 달성
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
58.1% |
OpenAI, Codex CLI의 기본 모델로 GPT-5.1-Codex-Max 채택
|