Un desarrollador busca comentarios sobre SpiralCoreAttention, un prototipo experimental de selección de contexto durante el entrenamiento para el ajuste fino de LLM de pesos abiertos. En lugar de procesar secuencias largas completas en cada pasada hacia adelante y hacia atrás, el sistema selecciona bloques específicos de tokens de la secuencia para entrenar, mientras evalúa el adaptador resultante en secuencias de contexto completo retenidas.
Los experimentos internos de QLoRA utilizando Qwen2.5-7B-Instruct con cuantización NF4 de 4 bits en una única GPU RTX PRO 6000 Blackwell demostraron un aumento medio de velocidad por paso de entrenamiento de 1.675× y una reducción de la VRAM pico de 6.036 GB. Estos resultados se observaron en tres semillas utilizando secuencias de 8,192 tokens durante 48 pasos de entrenamiento con una configuración de contexto seleccionado del 60%.
El autor enfatiza que estos son resultados de investigación locales, de corpus local y corta duración, en una sola GPU, y no afirmaciones de producción ni evidencia para un preentrenamiento completo a mayor escala. La publicación solicita comentarios técnicos sobre el protocolo de evaluación, las métricas de calidad adecuadas a nivel de tarea, las líneas base establecidas y los modos de fallo potenciales a probar antes de la validación.