Новая система o3 от OpenAI, обученная на наборе данных ARC-AGI-1 Public Training, показала результат 75,7% на наборе Semi-Private Evaluation в рамках лимита вычислений в $10k и 87,5% с конфигурацией высокого уровня вычислений.
- Высокий показатель эффективности квалифицируется как 1-е место в публичном рейтинге по правилам ARC-AGI-Pub.
- Тестирование проводилось на двух уровнях вычислений: 6 образцов для высокой эффективности и 1024 образца (в 172 раза больше вычислений) для низкой эффективности.
- OpenAI подтвердила, что протестированная версия отличается от официально выпущенной o3, с последующим обновлением результатов.
ARC Prize рассматривает это как значительный скачок в возможностях ИИ, демонстрирующий новые способности к адаптации задачам, не наблюдавшиеся в предыдущих моделях семейства GPT.