DeepSeekがネイティブマルチモーダルサポートを備えたV4.1-Flashモデルをリリース
DeepSeekは、新しいアーキテクチャファミリーの最小メンバーであり、ネイティブなマルチモーダル視覚理解機能を備えたDeepSeek-V4.1-Flashモデルを正式にリリースしました。この新しいアーキテクチャは、より高い能力の上限、より高速な推論速度、より高いスループット、および大規模モデルのためのより良いスケーリングの可能性を提供するように設計されています。
DeepSeekは、新しいアーキテクチャファミリーの最小メンバーであり、ネイティブなマルチモーダル視覚理解機能を備えたDeepSeek-V4.1-Flashモデルを正式にリリースしました。この新しいアーキテクチャは、より高い能力の上限、より高速な推論速度、より高いスループット、および大規模モデルのためのより良いスケーリングの可能性を提供するように設計されています。
Microsoft Researchは、生物学のマルチモーダル世界モデルを構築し、モデル、科学ツール、文献、研究者をつなぐインタラクティブなハーンチを提供する新しい研究取り組み「Quine」を発表した。このシステムは、科学者が提案を生成し、それをウェットラボ環境でテストできるようにすることで、計算モデリングと実際の実験の間のギャップを埋めることを目的としている。その結果は将来の質問を精緻化するためにフィードバックされる。
Googleは、Gemini 3.8 Live with Live Avatarを発表しました。これは、ニアリアルタイムの動画生成と音声合成を組み合わせて、ネイティブなライブ対話モデルのための動的なビジュアルペルソナを作成する機能です。
アリババのQwenチームは、音声・映像の理解とツール利用のためのエージェント機能を中核に設計された初のオムニモーダルモデルであるQwen3.8-Omni-Flashをリリースしました。このモデルはテキスト、画像、音声、動画の入力を受け取り、テキスト出力を返すもので、1Mトークンのコンテキストウィンドウとネイティブな関数呼び出し機能を備えています。
v0.29.0rc2 リリースには、プレフィックス覆い項目を適切に処理するための SHM ワーカーキャッシュのバグフィックスが含まれています。
llama.cppサーバーは、/v1/embeddingsエンドポイントに対して型付きコンテンツ(ビジョン、オーディオ、ビデオ)の入力をサポートするようになりました。この更新により、OpenAIスタイルのラップされたコンテンツ配列を受け入れることで、マルチモーダル埋め込みリクエストが可能になり、textとimage_urlの部分を一緒に処理できます。
Hugging Face フォーラムの学部生が、スライドコンテキスト付きの音声文字起こし中の幻覚問題に対処するため、VAPO 論文の概念を Qwen 2.5 Omni 3B モデルに適用することについて議論しています。
Liquid AIは、そのLFM2.5-VL-3Bビジョン言語モデル用の実験的なスペキュラティブデコーディング用ドラフトモデルであるLFM2.5-VL-3B-DSparkをリリースした。このドラフターは約280Mのパラメータを追加し、モデルの出力分布を変更せずにトークン生成を加速する。
Liquid AIは、LFM2.5-VL-3Bビジョン言語モデルの推論を加速するために設計されたスペキュラティブデコーディング用ドラフターであるLFM2.5-VL-DSparkドラフトモデルをリリースした。このドラフターは、ターゲットモデルの固定レイヤーから隠れ状態を取得して候補トークンを生成し、モダリティ間で次元数を同一に保ちながら、パラメータ数を280M(オーバーヘッド8.9%)のみ追加する。
Liquid AIは、視覚言語モデル LFM2.5-VL-3B のための実験的な DSpark ドラフトモデルをリリースし、出力品質を変更せずにエッジデバイスやGPUでより高速なデコードを可能にしました。
Appleは、テキストの圧縮画像をより効率的に処理するために設計された90億パラメータのVision Language ModelであるLensVLM-9Bをリリースしました。このモデルはこれらの圧縮入力をスキャンし、学習したツールを使用して関連するページのみを選択的に非圧縮形式に拡張します。
Alibaba Cloudは、実世界の生産性タスク向けに設計されたネイティブな多モーダルエージェントモデルであるQwen3.8-Omni-Flashを発表しました。このモデルは、以前のオムニモデルと比較して、多モーダルな理解と推論を大幅に改善します。
アリババQwenチームは、リアルタイムの同時通訳モデルであるQwen3.8-LiveTranslateをリリースしました。このモデルは生音声を聴取し、話者がまだ話し続けている間に翻訳されたテキストと音声の両方を返します。今回のリリースでは、レイテンシを削減し翻訳品質を向上させるために設計された新しいInterleaveアーキテクチャが導入されました。
inclusionAIはHugging Face上でRealtime-Venusシステムを公開し、2つのチェックポイント(Realtime-Venus-OmniとRealtime-Venus-Audio)を搭載しています。OmniチェックポイントはMiniCPM-o 4.5から適応された9Bオーディオビジュアル対話モデルで、継続的に視聴し、応答するタイミングを判断します。
DeepSeekは、エージェントワークロードにおける長時間コンテキスト計算と大規模なKVキャッシュの高額コストに対処するために設計されたマルチモーダルMixture-of-Expertsモデル「DeepSeek-V4.1-Flash」をリリースしました。
Tencentは、Qwen3-VLモデルからファインチューニングされたページ画像用のエンドツーエンドのドキュメントパーサーであるWeVisDocをリリースしました。このシステムは、LaTeX数式やHTMLテーブルを含む構造化されたMarkdownにページ画像を変換します。
Tencentは、ページ画像用のエンドツーエンドのドキュメントパーサーであるWeVisDoc-4Bをリリースしました。これは、LaTeX数式とHTMLテーブルを含む構造化されたMarkdownにページを変換します。Qwen3-VL-4B-Instructからファインチューニングされ、OmniDocBench v1.6で総合スコア95.38を達成し、報告されたすべての4つの設定において比較されたパーサーの中で1位となりました。
Intern Large Modelsは、Hugging Faceで利用可能なIntern-S2-397Bモデルをリリースしました。このリリースには、モデルを実行するためのvLLMによるDay-0サポートが含まれています。
InternLMは、科学知能と長期ホライゾンのエージェント向けに設計された3970億パラメータのマルチモーダル基盤モデルであるIntern-S2-397Bを発表しました。このモデルは、事前トレーニング、強化学習タスクのカバレッジ、インタラクティブなエージェント環境全体でスケーリングし、一般的な推論能力とエージェント機能を強化します。
IBMとNASAは、NASA-IBM Lunar Foundation Modelをオープンソース化しました。これは、米国のミッションと日本のミッションから数十年にわたるマルチモーダルな月面データを単一の表現に統合するAIシステムです。IBMのTerraMindアーキテクチャに基づいて構築され、複雑な照明やデータ解像度などの課題に対処するために、異なるスケールと視点からの観測を統合しています。