हान्यु (ओलिविया) यु, एक हाई स्कूल के दसवीं कक्षा की छात्रा, cs.LG या cs.CV में arXiv एंडोसर की तलाश में है ताकि वह अपना स्वतंत्र प्रीप्रिंट "AttnRoute-MoE: Attention-Prior Routing for Mixture-of-Experts Vision Transformers" अपलोड कर सके।
पेपर में सेल्फ-एटेंशन मैट्रिक्स से तीन स्केलर सिग्नल — एंट्रापी, क्रॉस-हेड वेरियंस और CLS-सिमिलैरिटी — को एक रूटिंग प्रायर के रूप में पेश किया गया है जो प्रशिक्षण के दौरान शून्य तक कम हो जाता है। लेखक ने रिपोर्ट की है कि इनिशियलाइजेशन पर रूटिंग विविधता शुरुआती कॉलैप्स को रोकती है, जबकि सेमांटिक एटेंशन प्रशिक्षण के बाद विशेषज्ञ विशेषज्ञता को आकार देता है। इस काम में 3-सीड experiments, चार अमलेबलेशन स्थितियाँ और एक गैर-महत्वपूर्ण p > 0.05 परिणाम की ईमानदार रिपोर्ट शामिल है।
arXiv एंडोसरों से मांग करता है कि वे पिछले 5 वर्षों में cs.* श्रेणियों में कम से कम 3 पेपर जमा किए हों, और उनमें से कम से कम एक तीन महीने से पुराना हो।