Togetherは、その推論プラットフォームに重要なアップデートを導入し、オープンウェイトモデルのパフォーマンス、コスト、品質に対する完全な制御をユーザーに提供するために設計された「Dedicated Model Inference」を発表しました。このアップデートでは、フルウェイトとLoRAの強化学習を含むカスタムトレーニング機能のクローズドベータ版も発表されています。

  • デプロイメントはカナリア、ブルーグリーン、ローリングアップデートをサポートし、閾値違反時に自動ロールバックを行います。
  • A/Bテストとシャドウテストにより、ユーザーに影響を与えることなく新しいウェイトを実トラフィックに対して評価できます。
  • モデルキャッシングと配信レイヤーが再構築され、ウォームスタートが約4倍高速化されました。
  • オートスケーリングは、インフライトリクエスト、GPU利用率、最初のトークンまでの時間などのメトリクスをサポートしています。
  • カスタムトレーニングベータ版には、チェックポイントを直接本番環境にデプロイ可能な教師ありファインチューニングが含まれます。

このプラットフォームは、デプロイメントライフサイクルの管理と観測性を処理することで、実験から本番環境への移行を簡素化し、チームがモデルバージョンを週単位で安全に反復できるようにすることを目指しています。