ByteDanceは、AI蒸留技術に依存せずに次世代AIモデルを開発するとのコミットメントを発表しました。
同社は将来のモデルに対して独立した開発経路を進める意向です。
ByteDanceは、AI蒸留技術に依存せずに次世代AIモデルを開発するとのコミットメントを発表しました。
同社は将来のモデルに対して独立した開発経路を進める意向です。
MiniMaxは、Hugging FaceでオープンウェイトのH3オムニモーダル動画生成モデルをリリースしました。このモデルはネイティブステレオオーディオを搭載し、単一フォワードパスで動画を駆動できます。モデルは5〜15秒のクリップに対して2K解像度・24fpsをサポートし、1回の生成あたり最大9枚の参照画像、3本の動画、3つのオーディオクリップを受け入れます。
研究者らは、外部の監督なしでモデル自身の生成のみを使用して大規模言語モデルのトレーニング後の改善を実現する手法である教師なしオンポリシー自己蒸留(U-OPSD)を提案した。このアプローチは複数のロールアウトをサンプリングして多数決により疑似解を構築し、教師分布をモデルの最長の不正解完了のプレフィックスに蒸留する。
Douyinは、大規模な対照的事前学習と潜在推論を組み合わせて、強力な識別力と効率性を実現するマルチモーダル埋め込み(DME)モデルの技術レポートを公開しました。
Appleは第3世代ファウンデーションモデル(AFM3)用の新しいアーキテクチャを導入し、「指示追従プルーニング」を活用してアクティブなパラメータ数を大幅に削減しました。このモデルは、トークンごとではなくプロンプトごとにルーティング判断を行うことで、MLPレイヤーの約20%をアクティブ化するように設計されています。
NVIDIAのNeMoチームは、研究者によるアルゴリズムの反復処理における複雑さを軽減するために設計されたオープンソースのエージェント型強化学習フレームワークであるMoltをリリースした。コードベースは約8.6K行のRLコードで、verl(62K行)やslime(25K行)などの同等のフレームワークと比べて大幅に小さい。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー