Um desenvolvedor está buscando feedback sobre o SpiralCoreAttention, um protótipo experimental de seleção de contexto durante o treinamento para ajuste fino de LLMs de pesos abertos. Em vez de processar sequências longas completas em cada passagem direta e inversa, o sistema seleciona blocos específicos de tokens da sequência para treinar, enquanto avalia o adaptador resultante em sequências de contexto completo mantidas fora do conjunto de treinamento.

Experimentos internos QLoRA usando Qwen2.5-7B-Instruct com quantização NF4 de 4 bits em uma única GPU RTX PRO 6000 Blackwell demonstraram um aumento médio na velocidade das etapas de treinamento de 1,675× e redução de VRAM pico em 6,036 GB. Esses resultados foram observados em três sementes usando sequências de 8.192 tokens ao longo de 48 etapas de treinamento com uma configuração de contexto selecionado de 60%.

O autor enfatiza que estes são resultados de pesquisa locais, de curta duração e em GPU única, não sendo reivindicações de produção ou evidências para pré-treinamento completo em escalas maiores. O post solicita feedback técnico sobre o protocolo de avaliação, métricas de qualidade adequidas ao nível da tarefa, linhas de base estabelecidas e possíveis modos de falha a serem testados antes da validação.