한 개발자가 오픈 가중치 LLM 파인튜닝을 위한 실험적 훈련 시간 컨텍스트 선택 프로토타입인 SpiralCoreAttention에 대한 피드백을 구하고 있습니다. 이 시스템은 매번 순전파 및 역전파 과정에서 전체 긴 시퀀스를 처리하는 대신, 시퀀스에서 특정 토큰 블록을 선택하여 훈련하고, 결과적으로 생성된 어댑터를 홀드아웃(full-context) 시퀀스 위에서 평가합니다.
단일 RTX PRO 6000 Blackwell GPU에서 4-bit NF4 양자화된 Qwen2.5-7B-Instruct를 사용한 내부 QLoRA 실험은 평균 훈련 스텝 속도 향상률 1.675×와 6.036 GB의 최대 VRAM 감소를 보여주었습니다. 이러한 결과는 8,192 토큰 시퀀스를 사용하여 48번의 훈련 스텝 동안 60% 선택 컨텍스트 구성으로 세 가지 시드에서 관찰되었습니다.
저자는 이러한 결과가 로컬 코퍼스 기반의 단기 단일 GPU 연구 결과이며, 대규모 전체 사전 훈련에 대한 생산 환경 주장이나 증거가 아님을 강조합니다. 이 게시물은 검증 전에 테스트할 평가 프로토콜, 적절한 작업 수준 품질 지표, 확립된 베이스라인 및 잠재적 실패 모드에 대한 기술적 피드백을 요청합니다.