Hugging Faceフォーラムのユーザーが、段階的知識転送の実験を提案しています。この手法では、固定サイズの生徒モデル(Qwen 4B)が、最大の利用可能なモデルから直接学ぶのではなく、より大きな教師モデルから順次学習します。

  • このプロセスでは、4BモデルがQwen 8Bまたは9Bから学習した後、その教師を破棄してQwen 12Bから、さらにQwen 27Bから学習します。
  • このアプローチは、一度のステップで大きな能力のギャップを埋めようとせず、すでに習得した知識の上に構築することで、人間の学習を模倣しています。
  • 提案では、Hereticプロジェクトに似た手法を使用し、「探索と強化」戦略を採用して有用な機能を特定・追加しつつ、すでに習得した特性の再発見を避けることが示唆されています。
  • 成功は、固定サイズのモデルが測定可能な改善を示し、以前の成果を保持するかどうかによって測定され、小規模モデルの実用的な知識容量に関する洞察を提供します。

著者は、この手法により、小規模モデルにとって漸進的な知識の蓄積が、最大の教師からの直接蒸留よりも効果的かどうかを判断できる可能性があると示唆しています。