Un développeur sollicite des retours sur SpiralCoreAttention, un prototype expérimental de sélection du contexte pendant l'entraînement pour le fine-tuning de LLM à poids ouverts. Au lieu de traiter des séquences longues complètes lors de chaque passage avant et arrière, le système sélectionne des blocs de tokens spécifiques de la séquence à entraîner, tout en évaluant l'adaptateur résultant sur des séquences de contexte complet conservées.

Des expériences internes QLoRA utilisant Qwen2.5-7B-Instruct avec une quantification NF4 4-bit sur un seul GPU RTX PRO 6000 Blackwell ont démontré un gain de vitesse moyen par étape d'entraînement de 1,675× et une réduction de la VRAM maximale de 6,036 Go. Ces résultats ont été observés sur trois graines en utilisant des séquences de 8 192 tokens sur 48 étapes d'entraînement avec une configuration de contexte sélectionné de 60 %.

L'auteur souligne qu'il s'agit de résultats de recherche locaux, sur un corpus restreint, à courte durée et sur un seul GPU, et non de revendications ou de preuves pour un pré-entraînement complet à plus grande échelle. L'article demande des retours techniques sur le protocole d'évaluation, les métriques de qualité appropriées au niveau de la tâche, les références établies et les modes de défaillance potentiels à tester avant validation.