OpenAI는 코딩, 사실성, 컴퓨터 사용 및 전문 작업 분야의 발전을 저비용 모델에 가져옴으로써 GPT-6 Astra의 더 빠르고 저렴한 대안으로 GPT-6 Sol과 Luna를 소개했습니다.
- Anthropic는 대부분의 작업에서 Claude Fable 5.1과 동등한 성능을 제공하면서 실행 비용이 Opus 5보다 40% 낮은 Claude Opus 5.5를 출시했습니다.
- SWE-Bench Pro V2가 11개 저장소에서 642개의 작업을 포함하여 출시되었으며, 이전 작업의 오류를 수정하고 평가 프로세스를 최적화했습니다.
- Google은 AI 에이전트가 재귀적으로 자신을 개선하는 방식을 정규화하여 벤치마크 과적합을 줄이는 방법인 RRSI를 소개했습니다.
이러한 업데이트는 사용자에게 더 비용 효율적인 모델 옵션과 AI 성능 평가를 위한 엄격한 새로운 벤치마크를 제공합니다.