トピック · Multimodal
lab DeepSeek API Docs · 21日前 Codeforces (Elo) · 3471.0Elo · 67 回表示

DeepSeekがネイティブマルチモーダルサポートを備えたV4.1-Flashモデルをリリース

DeepSeekは、新しいアーキテクチャファミリーの最小メンバーであり、ネイティブなマルチモーダル視覚理解機能を備えたDeepSeek-V4.1-Flashモデルを正式にリリースしました。この新しいアーキテクチャは、より高い能力の上限、より高速な推論速度、より高いスループット、および大規模モデルのためのより良いスケーリングの可能性を提供するように設計されています。

lab Microsoft Research Blog · 23時間前 · 3 回表示

Microsoft Researchがマルチモーダル生物研究のためのAIシステム「Quine」を発表

Microsoft Researchは、生物学のマルチモーダル世界モデルを構築し、モデル、科学ツール、文献、研究者をつなぐインタラクティブなハーンチを提供する新しい研究取り組み「Quine」を発表した。このシステムは、科学者が提案を生成し、それをウェットラボ環境でテストできるようにすることで、計算モデリングと実際の実験の間のギャップを埋めることを目的としている。その結果は将来の質問を精緻化するためにフィードバックされる。

media MarkTechPost · 12日前 · 35 回表示

アリババのQwenが1Mコンテキストを持つエージェント型オムニモーダルモデル「Qwen3.8-Omni-Flash」をリリース

アリババのQwenチームは、音声・映像の理解とツール利用のためのエージェント機能を中核に設計された初のオムニモーダルモデルであるQwen3.8-Omni-Flashをリリースしました。このモデルはテキスト、画像、音声、動画の入力を受け取り、テキスト出力を返すもので、1Mトークンのコンテキストウィンドウとネイティブな関数呼び出し機能を備えています。

github llama.cpp · 2日前 · 3 回表示

llama.cpp b11240が/v1/embeddingsに型付きマルチモーダル入力サポートを追加

llama.cppサーバーは、/v1/embeddingsエンドポイントに対して型付きコンテンツ(ビジョン、オーディオ、ビデオ)の入力をサポートするようになりました。この更新により、OpenAIスタイルのラップされたコンテンツ配列を受け入れることで、マルチモーダル埋め込みリクエストが可能になり、textとimage_urlの部分を一緒に処理できます。

media MarkTechPost · 5日前 · 15 回表示

Liquid AI、最大3.13倍高速デコーディングを実現するLFM2.5-VL-3B-DSparkのスペキュラティブドラフターをリリース

Liquid AIは、そのLFM2.5-VL-3Bビジョン言語モデル用の実験的なスペキュラティブデコーディング用ドラフトモデルであるLFM2.5-VL-3B-DSparkをリリースした。このドラフターは約280Mのパラメータを追加し、モデルの出力分布を変更せずにトークン生成を加速する。

lab Hugging Face Blog · 6日前 · 13 回表示

Liquid AIがLFM2.5-VL-DSparkをリリースし、ビジョン言語モデルの推論を加速

Liquid AIは、LFM2.5-VL-3Bビジョン言語モデルの推論を加速するために設計されたスペキュラティブデコーディング用ドラフターであるLFM2.5-VL-DSparkドラフトモデルをリリースした。このドラフターは、ターゲットモデルの固定レイヤーから隠れ状態を取得して候補トークンを生成し、モダリティ間で次元数を同一に保ちながら、パラメータ数を280M(オーバーヘッド8.9%)のみ追加する。

media r/LocalLLaMA · 7日前 · 43 回表示

AppleがLensVLM-9Bをリリース、圧縮されたテキスト画像を選択的に拡張するVLM

Appleは、テキストの圧縮画像をより効率的に処理するために設計された90億パラメータのVision Language ModelであるLensVLM-9Bをリリースしました。このモデルはこれらの圧縮入力をスキャンし、学習したツールを使用して関連するページのみを選択的に非圧縮形式に拡張します。

arxiv arXiv cs.CL · 8日前 · 19 回表示

Qwenが100万トークンコンテキストを備えたネイティブ多モーダルエージェントモデル「Qwen3.8-Omni-Flash」をリリース

Alibaba Cloudは、実世界の生産性タスク向けに設計されたネイティブな多モーダルエージェントモデルであるQwen3.8-Omni-Flashを発表しました。このモデルは、以前のオムニモデルと比較して、多モーダルな理解と推論を大幅に改善します。

media MarkTechPost · 10日前 · 28 回表示

アリババQwenチームがInterleaveアーキテクチャを採用したQwen3.8-LiveTranslateをリリース

アリババQwenチームは、リアルタイムの同時通訳モデルであるQwen3.8-LiveTranslateをリリースしました。このモデルは生音声を聴取し、話者がまだ話し続けている間に翻訳されたテキストと音声の両方を返します。今回のリリースでは、レイテンシを削減し翻訳品質を向上させるために設計された新しいInterleaveアーキテクチャが導入されました。

media r/LocalLLaMA · 12日前 · 55 回表示

inclusionAIが9Bオーディオビジュアル対話モデル「Realtime-Venus」をリリース

inclusionAIはHugging Face上でRealtime-Venusシステムを公開し、2つのチェックポイント(Realtime-Venus-OmniとRealtime-Venus-Audio)を搭載しています。OmniチェックポイントはMiniCPM-o 4.5から適応された9Bオーディオビジュアル対話モデルで、継続的に視聴し、応答するタイミングを判断します。

lab Tencent Hunyuan (HF) · 13日前 · 78 回表示

TencentがWeVisDoc-4Bをリリース、エンドツーエンドのドキュメントパーサー

Tencentは、ページ画像用のエンドツーエンドのドキュメントパーサーであるWeVisDoc-4Bをリリースしました。これは、LaTeX数式とHTMLテーブルを含む構造化されたMarkdownにページを変換します。Qwen3-VL-4B-Instructからファインチューニングされ、OmniDocBench v1.6で総合スコア95.38を達成し、報告されたすべての4つの設定において比較されたパーサーの中で1位となりました。

media r/LocalLLaMA · 17日前 · 25 回表示

InternLMが科学知能向けに397BパラメータのマルチモーダルモデルIntern-S2-397Bをリリース

InternLMは、科学知能と長期ホライゾンのエージェント向けに設計された3970億パラメータのマルチモーダル基盤モデルであるIntern-S2-397Bを発表しました。このモデルは、事前トレーニング、強化学習タスクのカバレッジ、インタラクティブなエージェント環境全体でスケーリングし、一般的な推論能力とエージェント機能を強化します。

lab IBM Research (Granite) · 20日前 · 25 回表示

IBMとNASAがNASA-IBM Lunar Foundation Modelをオープンソース化

IBMとNASAは、NASA-IBM Lunar Foundation Modelをオープンソース化しました。これは、米国のミッションと日本のミッションから数十年にわたるマルチモーダルな月面データを単一の表現に統合するAIシステムです。IBMのTerraMindアーキテクチャに基づいて構築され、複雑な照明やデータ解像度などの課題に対処するために、異なるスケールと視点からの観測を統合しています。