Qwenが100万トークンコンテキストを備えたネイティブ多モーダルエージェントモデル「Qwen3.8-Omni-Flash」をリリース
Alibaba Cloudは、実世界の生産性タスク向けに設計されたネイティブな多モーダルエージェントモデルであるQwen3.8-Omni-Flashを発表しました。このモデルは、以前のオムニモデルと比較して、多モーダルな理解と推論を大幅に改善します。
Alibaba Cloudは、実世界の生産性タスク向けに設計されたネイティブな多モーダルエージェントモデルであるQwen3.8-Omni-Flashを発表しました。このモデルは、以前のオムニモデルと比較して、多モーダルな理解と推論を大幅に改善します。
アリババQwenチームは、リアルタイムの同時通訳モデルであるQwen3.8-LiveTranslateをリリースしました。このモデルは生音声を聴取し、話者がまだ話し続けている間に翻訳されたテキストと音声の両方を返します。今回のリリースでは、レイテンシを削減し翻訳品質を向上させるために設計された新しいInterleaveアーキテクチャが導入されました。
inclusionAIはHugging Face上でRealtime-Venusシステムを公開し、2つのチェックポイント(Realtime-Venus-OmniとRealtime-Venus-Audio)を搭載しています。OmniチェックポイントはMiniCPM-o 4.5から適応された9Bオーディオビジュアル対話モデルで、継続的に視聴し、応答するタイミングを判断します。
アリババのQwenチームは、音声・映像の理解とツール利用のためのエージェント機能を中核に設計された初のオムニモーダルモデルであるQwen3.8-Omni-Flashをリリースしました。このモデルはテキスト、画像、音声、動画の入力を受け取り、テキスト出力を返すもので、1Mトークンのコンテキストウィンドウとネイティブな関数呼び出し機能を備えています。
DeepSeekは、エージェントワークロードにおける長時間コンテキスト計算と大規模なKVキャッシュの高額コストに対処するために設計されたマルチモーダルMixture-of-Expertsモデル「DeepSeek-V4.1-Flash」をリリースしました。
Tencentは、Qwen3-VLモデルからファインチューニングされたページ画像用のエンドツーエンドのドキュメントパーサーであるWeVisDocをリリースしました。このシステムは、LaTeX数式やHTMLテーブルを含む構造化されたMarkdownにページ画像を変換します。
Tencentは、ページ画像用のエンドツーエンドのドキュメントパーサーであるWeVisDoc-4Bをリリースしました。これは、LaTeX数式とHTMLテーブルを含む構造化されたMarkdownにページを変換します。Qwen3-VL-4B-Instructからファインチューニングされ、OmniDocBench v1.6で総合スコア95.38を達成し、報告されたすべての4つの設定において比較されたパーサーの中で1位となりました。
Intern Large Modelsは、Hugging Faceで利用可能なIntern-S2-397Bモデルをリリースしました。このリリースには、モデルを実行するためのvLLMによるDay-0サポートが含まれています。
InternLMは、科学知能と長期ホライゾンのエージェント向けに設計された3970億パラメータのマルチモーダル基盤モデルであるIntern-S2-397Bを発表しました。このモデルは、事前トレーニング、強化学習タスクのカバレッジ、インタラクティブなエージェント環境全体でスケーリングし、一般的な推論能力とエージェント機能を強化します。
IBMとNASAは、NASA-IBM Lunar Foundation Modelをオープンソース化しました。これは、米国のミッションと日本のミッションから数十年にわたるマルチモーダルな月面データを単一の表現に統合するAIシステムです。IBMのTerraMindアーキテクチャに基づいて構築され、複雑な照明やデータ解像度などの課題に対処するために、異なるスケールと視点からの観測を統合しています。
DeepSeekは新しいモデル「DeepSeek V4-1 Flash」をリリースしました。これは、5520億パラメータのバックボーンを持つマルチモーダルMixture-of-Experts (MoE)モデルです。
DeepSeekは、新しいアーキテクチャファミリーの最小メンバーであり、ネイティブなマルチモーダル視覚理解機能を備えたDeepSeek-V4.1-Flashモデルを正式にリリースしました。この新しいアーキテクチャは、より高い能力の上限、より高速な推論速度、より高いスループット、および大規模モデルのためのより良いスケーリングの可能性を提供するように設計されています。
inclusionAIは、ネイティブな画像および動画理解機能を備え、先行モデルの言語および推論能力を拡張するオープンソースのLing-3.0-flash-VLモデルをリリースしました。
DeepSeek は、その DeepSeek V4.1 Flash モデルの中間バージョンの内部ベータテストを開始し、現在は API を介して利用可能です。
Googleは、Gemini Flashモデル全体でエージェント型動画理解機能をリリースし、従来の静的処理方式を、必要に応じて動画のタイムラインをナビゲートするシステムに置き換えた。この変更により、モデルは固定の1秒あたり1フレームで全体のタイムラインを取り込むのではなく、何を、どのフレームレートで、どのモーダリティを通じて視聴するかを決定できるようになった。
llama.cpp バージョン 0.4.0 は、Qwen3.8-Flash-Next および NVIDIA Nemotron-3-Puzzle-75B-A9B モデルの初期アーキテクチャ サポートを導入し、基盤となる ggml ライブラリをバージョン 0.23.0 にアップグレードしました。
Ling-3.0-flash-VLは、Ling-3.0-flashアーキテクチャを基盤とした新しいモデルで、視覚的理解とビジュアルエージェントの機能をもたらします。
研究者らは、現実的な産業用製品設計のために広範な汎化能力と強力な機能を提供するように設計されたファウンデーションモデルスイートであるVisCADを発表した。このスイートは、レンダリングやテキストなどの多様な入力からの部品レベルの生成、および相互作用する部品を含むアセンブリレベルの生成という課題に対処している。
研究者らは、テキストと生の画像パッチを単一の双方向Transformerで処理する260Mおよび800Mの多言語マルチモーダルエンコーダーであるNeoMMEファミリーを発表した。生成型視覚言語モデルとは異なり、NeoMMEは個別に事前学習されたビジョンタワーや因果的デコーダーに依存せず、マスク付き離散拡散目的関数でモデル全体を一から訓練する。
v0.29.0rc2 リリースには、プレフィックス覆い項目を適切に処理するための SHM ワーカーキャッシュのバグフィックスが含まれています。