Googleは、ネイティブなマルチモーダル埋め込みのために設計されたオープンソースモデルであるEmbeddingGemma 2をリリースしました。
このリリースにより、新しいモデルは統一された埋め込み空間内でテキストと画像データの両方を処理するためのベストインクラスのオプションとして位置づけられます。
Googleは、ネイティブなマルチモーダル埋め込みのために設計されたオープンソースモデルであるEmbeddingGemma 2をリリースしました。
このリリースにより、新しいモデルは統一された埋め込み空間内でテキストと画像データの両方を処理するためのベストインクラスのオプションとして位置づけられます。
Google DeepMind は、テキスト、コード、画像、動画、音声を統一された 768 次元のベクトル空間にマッピングするオープンソースのマルチモーダル埋め込みモデルである EmbeddingGemma 2 をリリースしました。このモデルは合計 7.4 億パラメータで構成され、2.7 億パラメータのテキストエンコーダとモジュール式のビジョン(1.7 億)およびオーディオ(3 億)エンコーダを組み合わせています。
Googleは、2.3Bから31Bパラメータの密集型およびMixture-of-Expertsアーキテクチャを備えた、オープンウェイトでネイティブに多モーダルな言語モデルの新世代であるGemma 4を発表しました。
Googleは、10億から270億パラメータの軽量なオープンマルチモーダルモデルの新シリーズであるGemma 3を発表しました。このアップデートでは、以前のバージョンと比較して、ビジョン理解機能、少なくとも128Kトークンのコンテキストサポート、および拡張された多言語カバーレッジが追加されています。
EmpirioLabsは、テキスト、JSON、画像、動画、オーディオを単一のリクエストで処理できるオープンウェイトの5.3B判断モデル「Aplomb 1」をリリースしました。このモデルは100万トークンのコンテキストウィンドウをサポートしています。
研究者らは、モデルが答えを与えるのではなく教えることを重視する「アシスタンスジレンマ」に対処するため、大規模言語モデルのチューターを訓練するためのマルチターン強化学習手法であるEduardoを紹介した。この手法は、認知オフローディングを抑制し、解答の丸投げを防ぐために、マスク付きニア転移型事後テストとバイナリ報酬ゲートを使用する。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー