OpenAI выпустила модели o1-preview и o1-mini, которые обучены имитировать рассуждение путем генерации и уточнения токенов рассуждения перед предоставлением окончательного ответа. Тестирование на публичном наборе данных оценки ARC-AGI показывает, что оба варианта o1 превосходят GPT-4o по точности.
- o1-preview достигает точности, сопоставимой с Claude 3.5 Sonnet от Anthropic, но занимает примерно в 10 раз больше времени на выполнение задач.
- Решение 400 публичных задач ARC-AGI заняло у o1 70 часов, по сравнению всего с 30 минутами для GPT-4o и Claude 3.5 Sonnet.
- Модели используют парадигму цепочки рассуждений (chain-of-thought), применяемую как на этапе обучения, так и во время вывода, используя обучение с подкреплением для уточнения стратегий.
- Производительность масштабируется в зависимости от вычислений во время тестирования, демонстрируя логарифмически-линейную зависимость между точностью и количеством используемых токенов рассуждения.
Результаты подчеркивают, что, хотя увеличение вычислений во время тестирования повышает точность, эффективность остается критическим фактором для практического применения и бенчмаркинга.