छह व्यापक रूप से उपयोग किए जाने वाले भौतिकी बेंचमार्क का ऑडिट करने वाली एक अध्ययन में पाया गया कि प्रमुख भाषा मॉडल के लिए रिपोर्ट किए गए कम स्कोर मुख्य रूप से बेंचमार्किंग त्रुटियों के कारण हैं, न कि मॉडल की कमी के। विशेषज्ञों ने समस्या विवरणों, संदर्भ समाधानों और मॉडल प्रतिक्रियाओं की समीक्षा की, वास्तविक त्रुटियों को ग्रेडर की गलतियों, गलत संदर्भों और अस्पष्ट प्रश्नों से अलग किया।

  • HLE-Physics पर GPT-5.6-Sol का mean@4 सुधार के बाद 47.3% से बढ़कर 78.7% हो गया।
  • विशेषज्ञ समीक्षा के बाद CMT-Benchmark पर इसका स्कोर 61.0% से बढ़कर 87.2% हो गया।
  • मॉडल ने 54 बने रखे गए CritPt चुनौतियों पर सुधारा गया pass@4 94.4% हासिल किया।
  • UGPhysics, PRISM-Physics और PHYBench पर स्कोर ऑडिट के बाद काफी बढ़ गए।

इन निष्कर्षों से पता चलता है कि वर्तमान बेंचमार्क प्रमुख मॉडल की अच्छी तरह से परिभाषित भौतिकी समस्याओं को हल करने की क्षमता का महत्वपूर्ण रूप से अतिरंजित अनुमान लगाते हैं, जिससे अधिक कठिन, विशेषज्ञ-सत्यापित मूल्यांकन की आवश्यकता पर प्रकाश पड़ता है।