Z.aiはGLM-5.3をリリースしました。これは、ベースモデルやパラメータ数を変更せずに、ポストトレーニングのスケーリングが長期推論において大きな利益をもたらすことを示す制御実験です。
今回のリリースではGLM-5.2と同じアーキテクチャと総/アクティブなパラメータ数を維持しつつ、長期環境および強化学習におけるスケーリングを1ヶ月間追加しました。 著者らは、複雑な推論チェーンの処理などの能力において、パラメータ数よりも効果的な深さとポストトレーニングが今やより重要であると主張しています。 スケーリング法則は、トレーニング計算の最適化から、データ、計算、推論コストのバランスを取ることにシフトしており、タスクによってパラメータあたりの最適なトークン数は異なります。
このアプローチにより、Z.aiはモデルサイズを増やさずに特定の能力を改善でき、ベースモデルのスケーリングは将来のイテレーションに予約されます。