Multimodal
arxiv arXiv cs.CL · 7時間前 · 11 回表示

Qwenが100万トークンコンテキストを備えたネイティブ多モーダルエージェントモデル「Qwen3.8-Omni-Flash」をリリース

Alibaba Cloudは、実世界の生産性タスク向けに設計されたネイティブな多モーダルエージェントモデルであるQwen3.8-Omni-Flashを発表しました。このモデルは、以前のオムニモデルと比較して、多モーダルな理解と推論を大幅に改善します。

media MarkTechPost · 3日前 · 18 回表示

アリババQwenチームがInterleaveアーキテクチャを採用したQwen3.8-LiveTranslateをリリース

アリババQwenチームは、リアルタイムの同時通訳モデルであるQwen3.8-LiveTranslateをリリースしました。このモデルは生音声を聴取し、話者がまだ話し続けている間に翻訳されたテキストと音声の両方を返します。今回のリリースでは、レイテンシを削減し翻訳品質を向上させるために設計された新しいInterleaveアーキテクチャが導入されました。

media r/LocalLLaMA · 5日前 · 36 回表示

inclusionAIが9Bオーディオビジュアル対話モデル「Realtime-Venus」をリリース

inclusionAIはHugging Face上でRealtime-Venusシステムを公開し、2つのチェックポイント(Realtime-Venus-OmniとRealtime-Venus-Audio)を搭載しています。OmniチェックポイントはMiniCPM-o 4.5から適応された9Bオーディオビジュアル対話モデルで、継続的に視聴し、応答するタイミングを判断します。

media MarkTechPost · 5日前 · 24 回表示

アリババのQwenが1Mコンテキストを持つエージェント型オムニモーダルモデル「Qwen3.8-Omni-Flash」をリリース

アリババのQwenチームは、音声・映像の理解とツール利用のためのエージェント機能を中核に設計された初のオムニモーダルモデルであるQwen3.8-Omni-Flashをリリースしました。このモデルはテキスト、画像、音声、動画の入力を受け取り、テキスト出力を返すもので、1Mトークンのコンテキストウィンドウとネイティブな関数呼び出し機能を備えています。

lab Tencent Hunyuan (HF) · 6日前 · 64 回表示

TencentがWeVisDoc-4Bをリリース、エンドツーエンドのドキュメントパーサー

Tencentは、ページ画像用のエンドツーエンドのドキュメントパーサーであるWeVisDoc-4Bをリリースしました。これは、LaTeX数式とHTMLテーブルを含む構造化されたMarkdownにページを変換します。Qwen3-VL-4B-Instructからファインチューニングされ、OmniDocBench v1.6で総合スコア95.38を達成し、報告されたすべての4つの設定において比較されたパーサーの中で1位となりました。

media r/LocalLLaMA · 10日前 · 20 回表示

InternLMが科学知能向けに397BパラメータのマルチモーダルモデルIntern-S2-397Bをリリース

InternLMは、科学知能と長期ホライゾンのエージェント向けに設計された3970億パラメータのマルチモーダル基盤モデルであるIntern-S2-397Bを発表しました。このモデルは、事前トレーニング、強化学習タスクのカバレッジ、インタラクティブなエージェント環境全体でスケーリングし、一般的な推論能力とエージェント機能を強化します。

lab IBM Research (Granite) · 13日前 · 24 回表示

IBMとNASAがNASA-IBM Lunar Foundation Modelをオープンソース化

IBMとNASAは、NASA-IBM Lunar Foundation Modelをオープンソース化しました。これは、米国のミッションと日本のミッションから数十年にわたるマルチモーダルな月面データを単一の表現に統合するAIシステムです。IBMのTerraMindアーキテクチャに基づいて構築され、複雑な照明やデータ解像度などの課題に対処するために、異なるスケールと視点からの観測を統合しています。

lab DeepSeek API Docs · 13日前 Codeforces (Elo) · 3471.0Elo · 51 回表示

DeepSeekがネイティブマルチモーダルサポートを備えたV4.1-Flashモデルをリリース

DeepSeekは、新しいアーキテクチャファミリーの最小メンバーであり、ネイティブなマルチモーダル視覚理解機能を備えたDeepSeek-V4.1-Flashモデルを正式にリリースしました。この新しいアーキテクチャは、より高い能力の上限、より高速な推論速度、より高いスループット、および大規模モデルのためのより良いスケーリングの可能性を提供するように設計されています。

media MarkTechPost · 18日前 · 33 回表示

Google、Gemini Flashモデルのエージェント型動画理解機能をリリース

Googleは、Gemini Flashモデル全体でエージェント型動画理解機能をリリースし、従来の静的処理方式を、必要に応じて動画のタイムラインをナビゲートするシステムに置き換えた。この変更により、モデルは固定の1秒あたり1フレームで全体のタイムラインを取り込むのではなく、何を、どのフレームレートで、どのモーダリティを通じて視聴するかを決定できるようになった。

arxiv arXiv cs.CL · 19日前 · 36 回表示

VisCADがマルチモーダルな産業用CAD知能を備えたファウンデーションモデルスイートをリリース

研究者らは、現実的な産業用製品設計のために広範な汎化能力と強力な機能を提供するように設計されたファウンデーションモデルスイートであるVisCADを発表した。このスイートは、レンダリングやテキストなどの多様な入力からの部品レベルの生成、および相互作用する部品を含むアセンブリレベルの生成という課題に対処している。

lab Hugging Face Blog · 20日前 · 34 回表示

NeoMMEが密集型および後期相互作用検索に対応した効率的なマルチモーダルエンコーダーをリリース

研究者らは、テキストと生の画像パッチを単一の双方向Transformerで処理する260Mおよび800Mの多言語マルチモーダルエンコーダーであるNeoMMEファミリーを発表した。生成型視覚言語モデルとは異なり、NeoMMEは個別に事前学習されたビジョンタワーや因果的デコーダーに依存せず、マスク付き離散拡散目的関数でモデル全体を一から訓練する。