आधुनिक बड़े भाषा मॉडल व्यवस्थित रूप से अतिआत्मविश्वासी होते हैं, प्रशिक्षण प्रेरणाओं के कारण तकनीकी कैलिब्रेशन विफलताओं के बजाय गलत उत्तरों में उच्च आत्मविश्वास व्यक्त करते हैं। मानव प्रतिक्रिया से पुनर्बल सीखने (RLHF) के दौरान, मानव रेटर्स ऐसे उत्तरों को पुरस्कृत करते हैं जो अधिकारपूर्ण और निश्चित लगते हैं, जिससे मॉडल यह सीखता है कि अनिश्चितता पर प्रतिबंध लगाया जाता है।
- RLHF के दौरान मानव रेटर्स लगातार आत्मविश्वास से भरे उत्तरों को उच्च स्कोर देते हैं।
- मॉडल तब भी निश्चितता का प्रक्षेपण करना सीखते हैं जब सटीकता इसे न्यायसंगत नहीं ठहराती।
- एक फीडबैक लूप उत्पन्न होता है जहां आत्मविश्वास के लिए उपयोगकर्ता की पसंद कंपनियों को संलग्नता के लिए अनुकूलित करने के लिए प्रेरित करती है।
- इससे सामाजिक जोखिम पैदा होता है जहां जनसंख्या सत्य और अच्छी तरह से पैक किए गए झूठ के बीच अंतर करने में संघर्ष करती है।
लेख इस इंजीनियर किए गए अतिआत्मविश्वास के तंत्र, प्रेरणाओं और परिणामों पर चर्चा करता है, यह उजागर करते हुए कि सहायक लगने के बावजूद टोन को भ्रमित करने के लिए कैसे अनुकूलित किया गया है।