Hanyu (Olivia) Yu, une élève de seconde, cherche un endosseur arXiv dans cs.LG ou cs.CV pour téléverser son préprint indépendant intitulé "AttnRoute-MoE: Attention-Prior Routing for Mixture-of-Experts Vision Transformers."
L'article introduit trois signaux scalaires issus de la matrice d'auto-attention — l'entropie, la variance inter-têtes et la similarité CLS — comme un prior de routage qui s'annule à zéro pendant l'entraînement. L'auteure rapporte que la diversité du routage à l'initialisation empêche l'effondrement précoce, tandis que l'attention sémantique façonne la spécialisation des experts après l'entraînement. Le travail comprend des expériences avec 3 graines, quatre conditions d'ablation et un rapport honnête d'un résultat non significatif p > 0.05.
arXiv exige que les endosseurs aient soumis 3+ articles dans les catégories cs.* au cours des 5 dernières années, avec au moins un plus ancien que 3 mois.