La Fundación del Premio ARC ha publicado su primer análisis público de los modelos o3 y o4-mini de OpenAI en las pruebas de razonamiento ARC-AGI. La evaluación revela que, aunque estos modelos de vanguardia muestran un progreso significativo, aún no han resuelto el conjunto difícil ARC-AGI-2.

  • o3-medium alcanzó un 53% en el conjunto Semi Private Eval de ARC-AGI-1, mientras que o4-mini-medium llegó al 41% con alta eficiencia.
  • Tanto o3 como o4-mini obtuvieron puntuaciones inferiores al 3% en la prueba más desafiante ARC-AGI-2.
  • Las configuraciones de razonamiento elevado resultaron en una cobertura incompleta debido a tiempos de espera agotados o salidas faltantes, lo que hace que esos resultados no sean adecuados para informar en el ranking.
  • El modelo de producción o3 difiere del anterior o3-preview al integrar entradas visuales y utilizar diferentes restricciones de datos de entrenamiento.

Los hallazgos destacan que ARC-AGI-1 sigue siendo una herramienta sensible para medir las capacidades actuales de los modelos, mientras que ARC-AGI-2 sirve como una prueba de próxima generación para futuros modelos que cierren la brecha entre el razonamiento humano y el de IA.