OpenAI는 GPT-6 Astra의 지능을 거의 맞추면서 표준 입력 및 출력 토큰 가격의 약 5분의 1 비용으로 에이전트 코딩과 전문 작업에서 뛰어난 성능을 보이는 GPT-6 Sol의 업그레이드 버전인 GPT-6.1 Sol을 출시했습니다.
- DeepSWE v1.1에서 아스트라와 거의 동일한 성능을 보이며 비용은 약 5분의 1 수준으로, GPT-6 Sol보다 6.4%p 높은 점수를 기록합니다.
- GDP.pdf에서는 Opus 5.5보다 높은 점수를 얻으며, 작업당 비용이 절반 이하로 낮은 대체(fallback) 옵션을 제공하며 Astra의 성능에 근접합니다.
- AutomationBench에서는 중간 추론 노력으로 Opus 5.5보다 2.2%p 높은 점수를 얻으며 비용은 약 3분의 1 수준입니다.
- OSWorld 2.0에서는 GPT-6 Sol보다 7%p 높은 성능을 보이며, 비용은 7분의 1 수준으로 Astra의 성능에 2.1%p 차이로 근접합니다.
- Terminal-Bench Science 0.1에서는 최대 추론 노력에서 작업당 비용을 절반 이하로 줄이면서 GPT-6 Sol의 점수를 두 배 이상 높입니다.
- 낮은 추론 노력에서 GPT-6 Sol 대비 어려운 프롬프트에서의 사실적 오류를 약 32% 감소시킵니다.
이 모델은 오늘부터 ChatGPT Work와 Codex의 Plus, Pro, Business, Enterprise, Edu 사용자에게 제공되며, OpenAI API를 통해 gpt-6.1-sol로 접근 가능합니다.