xAI의 Grok 4 모델은 Arc-AGI2 벤치마크에서 15.9%의 점수를 달성하여 9.9%를 기록한 OpenAI의 GPT5를 능가했습니다.
- Grok 4는 Arc-AGI2 벤치마크에서 GPT5에 비해 상당한 격차를 보이고 있습니다.
- xAI는 2025년 말까지 Grok 5를 출시할 계획입니다.
- Grok 5의 학습에는 약 300만 개의 Nvidia H100 또는 550,000개의 B200 칩에 해당하는 컴퓨팅 성능이 사용됩니다.
xAI의 Grok 4 모델은 Arc-AGI2 벤치마크에서 15.9%의 점수를 달성하여 9.9%를 기록한 OpenAI의 GPT5를 능가했습니다.
| 벤치마크 | 모델 | 점수 |
|---|---|---|
| ARC-AGI 2 | Grok 4 | 15.9% |
DeepSeek은 새로 일반적으로 사용 가능한 모델인 DeepSeek V4 Flash가 DeepSWE 벤치마크에서 Anthropic's Sonnet 5 및 xAI's Grok 4.5와 성능 동등성을 달성했다고 주장합니다.
OpenAI의 GPT-5 Pro는 FrontierMath Tier 4 벤치마크에서 새로운 기록을 수립하며 Google의 Gemini 2.5 Deep Think보다 연구 수준의 수학 문제를 하나 더 해결했습니다. 이 평가에서는 전문 수학자들이 개발한 50개의 매우 어려운 문제에 대해 세 가지 계산 집약형 모델 설정을 수동으로 채점했습니다.
OpenAI는 OpenAI API에서 이제 사용 가능한 두 가지 새로운 모델인 GPT-6 Sol과 GPT-6 Luna를 출시했습니다. 이 모델들은 이전에 출시된 GPT-6 Astra 아래에 위치하며, 복잡한 코딩과 대량 일상 작업에 대해 더 빠르고 저렴한 tiers로 기술적 진보를 가져오는 것을 목표로 합니다.
Anthropic은 새로운 Claude 5.5 계열의 첫 번째 모델인 Claude Opus 5.5를 출시했으며, 이는 이전 세대보다 더 효율적인 대안으로 포지셔닝되었습니다. 이 모델은 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 발휘하도록 설계되었으며, Opus 5보다 실행 비용이 40% 저렴합니다.
영국 AI 보안 연구소(AISI)는 EvalEval의 Evaluation Cards 플랫폼을 통해 벤치마크 재현성을 개선하기 위해 공개 보고된 평가 방법과 결과를 제공했습니다. 이번 릴리스에는 HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, Terminal-Bench 2.0 등 5개 특정 벤치마크에 대한 검증된 결과, 컨텍스트 및 구성 정보가 포함됩니다.
트래픽 측정과 사이트 개선을 위해 쿠키를 사용합니다. 분석 쿠키를 허용하거나 거부할 수 있습니다. 개인정보처리방침