Фонд ARC Prize опубликовал свой первый публичный анализ моделей OpenAI o3 и o4-mini на бенчмарках рассуждений ARC-AGI. Оценка показывает, что, хотя эти передовые модели демонстрируют значительный прогресс, они еще не решили сложный набор ARC-AGI-2.

  • o3-medium достиг 53% на наборе ARC-AGI-1 Semi Private Eval, в то время как o4-mini-medium показал 41% при высокой эффективности.
  • Обе модели o3 и o4-mini набрали менее 3% на более сложном бенчмарке ARC-AGI-2.

Высокие настройки рассуждения привели к неполному покрытию из-за таймаутов или отсутствующих выводов, что делает эти результаты неподходящими для отчетности в лидербордах.

Производственная модель o3 отличается от предыдущей o3-preview интеграцией визуальных входных данных и использованием иных ограничений обучающих данных.

Результаты подчеркивают, что ARC-AGI-1 остается чувствительным инструментом для измерения текущих возможностей моделей, в то время как ARC-AGI-2 служит бенчмарком следующего поколения для будущих моделей, сокращающих разрыв между человеческим и ИИ-рассуждением.