A OpenAI forneceu financiamento para o benchmark de matemática independente FrontierMath enquanto estava vinculada a um acordo de confidencialidade que impedia a Epoch AI de divulgar esse relacionamento até após a OpenAI anunciar o desempenho recorde do seu modelo o3. O benchmark, desenvolvido por mais de 60 matemáticos, testa habilidades complexas de raciocínio, e o o3 da OpenAI alcançou uma taxa de sucesso de 25,2% nele.
- O FrontierMath foi introduzido em novembro de 2024 para avaliar capacidades avançadas de resolução de problemas matemáticos.
- A Epoch AI assinou um acordo que impedia a divulgação do apoio financeiro da OpenAI até o anúncio do o3 em 20 de dezembro.
- Os problemas do benchmark foram criados por uma equipe de mais de 60 matemáticos líderes que desconheciam a fonte de financiamento.
- A OpenAI obteve acesso a "muito, mas não tudo" dos dados do FrontierMath, embora um acordo verbal proibisse o uso dos materiais para treinamento de modelos.
- A Epoch AI reconhece a falta de transparência como um erro e promete informações mais claras sobre as fontes de financiamento em colaborações futuras.
A situação destaca a complexidade da avaliação de benchmarks de IA e a importância da transparência, especialmente porque o raciocínio matemático é uma grande fraqueza para os modelos de linguagem.