| 2026-09-29 |
Gemini 3.5 Flash |
79.0% |
Google Research, AI 에이전트 하니스 과적합 방지를 위해 RRSI 공개
|
| 2026-09-29 |
Qwen3.8-Flash-Next Coder |
75.6% |
ISTA, Qwen3.8-Flash-Next 및 전문가 50% 가지치기된 Coder 빌드에 GSQ-RCO GGUF 출시
|
| 2026-09-29 |
Qwen3.5-4B (with ROFT) |
49.2% |
ROFT는 자체 생성 설명에 대한 파인튜닝으로 에이전트 모델을 개선합니다
|
| 2026-09-28 |
Ember-1 |
92.2% |
Fireworks AI, 40% 적은 토큰으로 후학습된 Kimi K3 기반 Ember-1 출시
|
| 2026-09-09 |
Qwen Test agent + Repair agent (post-trained) |
72.6% |
ExecCritic은 역할별 RL을 활용하여 테스트 기반 수리를 통해 코딩 에이전트를 개선합니다
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic은 역할별 RL을 활용하여 테스트 기반 수리를 통해 코딩 에이전트를 개선합니다
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic은 역할별 RL을 활용하여 테스트 기반 수리를 통해 코딩 에이전트를 개선합니다
|
| 2026-09-09 |
base Test agent (no-test baseline) |
57.3% |
ExecCritic은 역할별 RL을 활용하여 테스트 기반 수리를 통해 코딩 에이전트를 개선합니다
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic은 역할별 RL을 활용하여 테스트 기반 수리를 통해 코딩 에이전트를 개선합니다
|
| 2026-09-09 |
Qwen Test agent (post-trained) + Repair agent (post-trained) |
72.6% |
ExecCritic은 역할별 RL을 활용해 테스트 기반 수리를 통해 코딩 에이전트를 개선한다
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic은 역할별 RL을 활용해 테스트 기반 수리를 통해 코딩 에이전트를 개선한다
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic은 역할별 RL을 활용해 테스트 기반 수리를 통해 코딩 에이전트를 개선한다
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic은 역할별 RL을 활용해 테스트 기반 수리를 통해 코딩 에이전트를 개선한다
|
| 2026-09-09 |
base Test agent |
57.3% |
ExecCritic은 역할별 RL을 활용해 테스트 기반 수리를 통해 코딩 에이전트를 개선한다
|
| 2026-09-07 |
K2-Horizon-7B |
70.6% |
IFM이 K2 Horizon 출시: 0.9B에서 375B까지 Apache 2.0 라이선스를 가진 여섯 개의 모델
|
| 2026-09-07 |
K2-Horizon-3.7B |
68.6% |
IFM이 K2 Horizon 출시: 0.9B에서 375B까지 Apache 2.0 라이선스를 가진 여섯 개의 모델
|
| 2026-09-02 |
Qwen3.5-9B |
16.6% |
CANOPY가 outcome-only RL을 통해 Qwen3-14B를 AppWorld에서 1위에 올림
|
| 2026-08-26 |
Granite 4.2 30B |
57.0% |
IBM이 오픈 엔터프라이즈 모델을 위해 네이티브 추론과 에이전트 RL을 갖춘 Granite 4.2 출시
|
| 2026-08-26 |
Granite 4.2 8B |
47.67% |
IBM이 오픈 엔터프라이즈 모델을 위해 네이티브 추론과 에이전트 RL을 갖춘 Granite 4.2 출시
|
| 2026-08-20 |
Qwen3.5-9B |
14.6% |
메타, 네이티브 오디오를 지원하는 Muse Video 출시; 스트라이프가 OpenRouter 인수
|
| 2026-08-20 |
Ornith-1.5 |
86.0% |
Z.ai가 사후 학습 확장 법칙을 제안하고 GLM 5.3을 출시; Ornith-1.5가 자기 개선 기능으로 데뷔
|
| 2026-08-19 |
Ornith-1.5 |
86.0% |
Ornith-1.5가 자기 개선 훈련을 통해 9B, 35B-A3B, 397B 모델 출시
|
| 2026-08-18 |
Qwen3.5-27B |
74.8% |
Kozuchi Agent가 Qwen3.5-27B를 사용하여 SWE-bench Verified 인스턴스 374개를 해결
|
| 2026-08-10 |
Qwen3.6-27B |
77.2% |
Meta가 단일 소비자용 GPU에서 구동되는 30B 오픈 가중치 에이전트 모델인 Muse Glimmer를 출시
|
| 2026-08-03 |
Orchard-SWE |
69.7% |
Microsoft Research가 확장 가능한 에이전트형 AI를 위한 Orchard 프레임워크 출시
|
| 2026-08-03 |
Inkling-Small |
80.2% |
Thinking Machines Lab이 276B 오픈 가중치 멀티모달 MoE 모델인 Inkling-Small을 출시
|
| 2026-07-24 |
Claude Opus 5 |
96.0% |
Anthropic이 기본 사고 기능과 에이전트 코딩 성능 향상을 갖춘 Claude Opus 5 출시
|
| 2026-07-19 |
DeepSeek V4 Pro |
80.6% |
Kimi K3, DeepSeek V4 Pro, GLM-5.2 벤치마크, 라이선스, 서빙 비용 비교
|
| 2026-07-17 |
Devstral 2 |
72.2% |
코드를 위한 Mistral Vibe가 스캐폴드부터 PR까지의 작업에서 네 가지 코딩 에이전트를 선도하다
|
| 2026-07-17 |
Devstral Small 2 |
68.0% |
코드를 위한 Mistral Vibe가 스캐폴드부터 PR까지의 작업에서 네 가지 코딩 에이전트를 선도하다
|
| 2026-07-14 |
Qwen3.5-35B-A3B |
6.0% |
UMoE가 MoE 전문가 풀을 재배치하여 도메인 특화 파인튜닝 개선
|
| 2026-07-14 |
Qwen3-30B-A3B |
6.0% |
UMoE가 MoE 전문가 풀을 재배치하여 도메인 특화 파인튜닝 개선
|
| 2026-07-07 |
LLM-as-a-Verifier |
78.2% |
LLM-as-a-Verifier이 연속 점수 매핑을 위한 범용 검증 프레임워크 도입
|
| 2026-04-25 |
Qwen3.6-27B |
77.2% |
알리바바, Qwen3.6-27B 출시, 더 큰 후속 모델보다 코딩 벤치마크에서 우위
|
| 2026-04-24 |
V4-Pro-Max |
80.6% |
DeepSeek, 에이전트를 위한 효율적인 장기 컨텍스트 아키텍처를 갖춘 V4 출시
|
| 2026-03-25 |
o3 |
71.7% |
OpenAI, ChatGPT에서 o3 은퇴 발표 및 벤치마크 점수 공개
|
| 2026-02-17 |
Claude Sonnet 4.6 |
79.6% |
Anthropic, 코딩·컴퓨터 사용·100만 토큰 컨텍스트 개선된 Claude Sonnet 4.6 출시
|
| 2026-02-05 |
Claude Opus 4.6 |
80.8% |
Anthropic, 1M 컨텍스트 창과 에이전트 기능 개선을 갖춘 Claude Opus 4.6 출시
|
| 2026-02-01 |
Claude Opus 4.6 |
80.8% |
오염 제거 벤치마크가 드러낸 상위 AI 코딩 모델 간 12포인트 격차
|
| 2026-02-01 |
MiniMax M2.5 |
80.2% |
오염 제거 벤치마크가 드러낸 상위 AI 코딩 모델 간 12포인트 격차
|
| 2026-01-28 |
Qwen3.6-27B |
77.2% |
로컬 코딩 벤치마크에서 Qwen 3.6-27B와 DeepSeek V4 Flash가 선두
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI, GPT-5.2 출시, 코딩 및 추론 벤치마크에서 Gemini 3 압도
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI, 전문가 지식 작업을 위한 최첨단 능력을 갖춘 GPT-5.2 출시
|
| 2025-12-09 |
Devstral 2 |
72.2% |
Mistral, Devstral 2 코딩 모델 및 Mistral Vibe CLI 출시
|
| 2025-12-09 |
Devstral Small 2 |
68.0% |
Mistral, Devstral 2 코딩 모델 및 Mistral Vibe CLI 출시
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
77.9% |
OpenAI, Codex CLI의 기본 모델로 GPT-5.1-Codex-Max 채택
|
| 2025-11-19 |
Kimi K2 Thinking |
71.3% |
Moonshot AI, 에이전트 도구 사용 기능을 갖춘 Kimi K2 Thinking 출시
|
| 2025-11-07 |
Kimi K2 Thinking |
71.3% |
Moonshot AI, 오픈소스 1T 파라미터 추론 모델 Kimi K2 Thinking 출시
|
| 2025-09-30 |
Claude Sonnet 4.5 |
77.2% |
Anthropic, 코딩 및 에이전트 기능 강화된 Claude Sonnet 4.5 출시
|
| 2025-09-29 |
Claude Sonnet 4.5 |
77.2% |
Anthropic
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI, 실시간 라우팅과 무료 접근성을 갖춘 통합 GPT-5 출시
|
| 2025-08-07 |
GPT‑5 |
74.9% |
OpenAI, 코딩 및 에이전트 개선된 GPT-5 API 출시
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI가 통합 라우팅과 전문가 수준의 추론을 갖춘 GPT-5를 출시하다
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI, 적응형 추론과 통합 아키텍처를 갖춘 GPT-5 출시
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI
|
| 2025-08-06 |
GLM-4.5 |
64.2% |
지푸 AI가 Claude와 DeepSeek에 맞먹는 GLM-4.5 모델 출시
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Moonshot, 32B 활성화 파라미터를 가진 오픈 에이전트 MoE 모델 Kimi K2 출시
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Kimi K2: 1조 파라미터와 MuonClip 옵티마이저를 갖춘 오픈 MoE 모델
|
| 2025-07-11 |
Kimi K2-Instruct |
65.8% |
Moonshot AI, 에이전트 기능 탑재 1T 파라미터 MoE 모델 Kimi-K2-Instruct 출시
|
| 2025-07-11 |
Kimi K2 |
65.8% |
Moonshot AI, 에이전트 기능 탑재 1T 파라미터 MoE 모델 Kimi K2 출시
|
| 2025-07-10 |
Devstral Medium |
61.6% |
Mistral AI, All Hands AI와 함께 Devstral Small 1.1 및 Devstral Medium 출시
|
| 2025-07-10 |
Devstral Small 1.1 |
53.6% |
Mistral AI, All Hands AI와 함께 Devstral Small 1.1 및 Devstral Medium 출시
|
| 2025-05-30 |
Deepseek-R1-0528 |
57.6% |
DeepSeek, 향상된 추론 및 벤치마크 점수로 R1 모델 업데이트
|
| 2025-05-23 |
Claude Sonnet 4 |
72.7% |
Anthropic, 하이브리드 추론 기능을 갖춘 Claude Opus 4와 Sonnet 4 출시
|
| 2025-05-23 |
Claude Opus 4 |
72.5% |
Anthropic, 하이브리드 추론 기능을 갖춘 Claude Opus 4와 Sonnet 4 출시
|
| 2025-05-22 |
Claude Opus 4 |
72.5% |
Anthropic
|
| 2025-05-21 |
Devstral |
46.8% |
Mistral AI가 소프트웨어 엔지니어링을 위한 Devstral 에이전트 LLM 출시
|
| 2025-04-17 |
o4-mini |
68.1% |
OpenAI가 더 빠르고 저렴한 다중 모달 추론 모델인 o4-mini 출시
|
| 2025-04-16 |
OpenAI o3 |
71.7% |
OpenAI
|
| 2025-04-14 |
GPT-4.1 |
54.6% |
OpenAI, 100만 토큰 컨텍스트 및 코딩 개선 기능을 갖춘 GPT-4.1 패밀리 출시
|
| 2025-04-14 |
GPT‑4.1 |
54.6% |
OpenAI, API에 GPT-4.1, GPT-4.1 mini, GPT-4.1 nano 출시
|
| 2025-03-26 |
Gemini 2.5 Pro |
63.8% |
구글, 100만 토큰 컨텍스트를 지원하는 실험용 Gemini 2.5 Pro 추론 모델 출시
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
구글, 실험용 모델 Gemini 2.5 Pro 출시
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
구글, Gemini 2.5 Pro 사고 모델 출시
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google DeepMind
|
| 2025-03-05 |
GPT-4.5 |
38.0% |
오픈에이아이, 차트GPT 플러스용 최대 규모 모델 GPT-4.5 출시
|
| 2025-02-24 |
Claude 3.7 Sonnet |
62.3% |
Anthropic
|
| 2025-01-06 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet, SWE-bench Verified에서 49% 달성
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI, 추론 및 코딩에서 높은 성능을 갖춘 o3 모델 출시
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI, ARC AGI 및 Frontier Math 돌파구와 함께 o3 추론 모델 미리보기
|
| 2024-10-30 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet, 최소 에이전트 구조로 SWE-bench Verified에서 49% 달성
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic, Claude 3.5 Sonnet 업그레이드 및 Claude 3.5 Haiku와 컴퓨터 사용 베타 출시
|
| 2024-10-22 |
Claude 3.5 Haiku |
40.6% |
Anthropic, Claude 3.5 Sonnet 업그레이드 및 Claude 3.5 Haiku와 컴퓨터 사용 베타 출시
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic
|
| 2024-08-13 |
Agentless |
32.0% |
OpenAI, 인간 검증된 하위셋을 포함한 SWE-bench Verified 출시
|
| 2024-08-13 |
GPT‑4o |
33.2% |
OpenAI, 인간 검증된 하위셋을 포함한 SWE-bench Verified 출시
|