ByteDance Seed、ネイティブ音声・視覚フルデュプレックスLLM「SeedRealtime」を発表
ByteDanceのSeedチームは、音声、映像、テキストを単一の統合アーキテクチャで融合するネイティブ音声・視覚フルデュプレックス大規模言語モデル「SeedRealtime」を発表した。
ByteDanceのSeedチームは、音声、映像、テキストを単一の統合アーキテクチャで融合するネイティブ音声・視覚フルデュプレックス大規模言語モデル「SeedRealtime」を発表した。
ByteDanceは、AI蒸留技術に依存せずに次世代AIモデルを開発するとのコミットメントを発表しました。
MiniMaxは、Hugging FaceでオープンウェイトのH3オムニモーダル動画生成モデルをリリースしました。このモデルはネイティブステレオオーディオを搭載し、単一フォワードパスで動画を駆動できます。モデルは5〜15秒のクリップに対して2K解像度・24fpsをサポートし、1回の生成あたり最大9枚の参照画像、3本の動画、3つのオーディオクリップを受け入れます。
Douyinは、大規模な対照的事前学習と潜在推論を組み合わせて、強力な識別力と効率性を実現するマルチモーダル埋め込み(DME)モデルの技術レポートを公開しました。