A OpenAI lançou os modelos o1-preview e o1-mini, que são treinados para emular o raciocínio gerando e refinando tokens de raciocínio antes de fornecer uma resposta final. Testes no conjunto de dados de avaliação pública ARC-AGI mostram que ambas as variantes o1 superam o GPT-4o em precisão.
- O o1-preview alcança precisão comparável à do Claude 3.5 Sonnet da Anthropic, mas leva aproximadamente 10 vezes mais tempo para concluir as tarefas.
- Resolver as 400 tarefas públicas do ARC-AGI levou 70 horas para o o1, em comparação com apenas 30 minutos para o GPT-4o e o Claude 3.5 Sonnet.
- Os modelos utilizam um paradigma de cadeia de pensamento aplicado tanto no treinamento quanto na inferência, aproveitando o aprendizado por reforço para refinar estratégias.
- O desempenho escala com a computação em tempo de teste, mostrando uma relação log-linear entre precisão e a quantidade de tokens de raciocínio utilizados.
Os resultados destacam que, embora o aumento da computação em tempo de teste melhore a precisão, a eficiência continua sendo um fator crítico para aplicação prática e benchmarking.