ある開発者が、オープンウェイトLLMのファインチューニング向けの実験的なトレーニング時のコンテキスト選択プロトタイプであるSpiralCoreAttentionに関するフィードバックを求めています。このシステムは、すべての順伝播および逆伝播パスで完全な長期シーケンスを処理する代わりに、シーケンスから特定のトークンブロックを選択してトレーニングし、結果として得られたアダプターをホールドアウトされた完全コンテキストのシーケンス上で評価します。
単一のRTX PRO 6000 Blackwell GPU上で4ビットNF4量子化を用いたQwen2.5-7B-Instructを使用した内部QLoRA実験では、平均トレーニングステップの速度向上が1.675倍になり、ピークVRAMが6.036 GB削減されました。これらの結果は、60%の選択コンテキスト設定で48回のトレーニングステップにわたる8,192トークンのシーケンスを用いた3つのシードで観察されました。
著者は、これらがローカルコーパス、短期間、単一GPUの研究結果であり、本番環境での主張やより大規模な完全事前トレーニングのエビデンスではないことを強調しています。この投稿は、評価プロトコル、適切なタスクレベルの品質指標、確立されたベースライン、検証前にテストする潜在的な失敗モードに関する技術的なフィードバックを求めています。