Multimodal
media MarkTechPost · 4日前 · 1 回表示

NVIDIA、自律運転向け34BオープンVLAモデル「Alpamayo 2 Super」をリリース

NVIDIAは、OpenMDW-1.1ライセンスの下で、ロボタクシーや自律運転用に設計された340億パラメータのビジョン・ランゲージ・アクション(VLA)モデルであるAlpamayo 2 Superをリリースしました。このモデルは、32BのCosmos 3 Super Reasonerバックボーンと2.3Bの拡散ベースのアクションデコーダを組み合わせてマルチカメラ映像から軌道、因果説明、メタアクションを生成することで、ロングテール事象に対応します。

lab Mistral AI News · 5日前 · 3 回表示

Shieldstralがポリシー適応型3Bマルチモーダル安全分類器を導入

Shieldstralは、コンテンツモデレーションをポリシー適応型の質問応答タスクとして位置づける3Bのオープンウェイト・マルチモーダル安全分類器であり、再学習なしで推論時に自然言語によるポリシーを受け入れることができる。テキストと画像の安全評価を統一し、多様なベンチマークで補正された安全スコアを提供しながら、単一の16GB NVIDIA GPU上で効率的に動作する。

media MarkTechPost · 6日前 GPQA Diamond · 89.5% · 1 回表示

Thinking Machines Labが276Bのオープンウェイト多モーダルMoEモデルInkling-Smallをリリース

Thinking Machines Labは、総パラメータ数2760億、アクティブパラメータ数120億のオープンウェイトMixture-of-ExpertsモデルであるInkling-Smallをリリースした。このモデルは、テキスト、画像、音声に対してネイティブに推論するように訓練されており、1Mトークンのコンテキストウィンドウと調整可能な思考努力(thinking effort)を特徴とする。

media AI News (smol.ai) · 9日前 · 2 回表示

OpenAIがGPT-5.6の価格を値下げ、Thinking MachinesがInkling-Smallをリリース、GoogleがGemini Robotics 2を発表

本AIニュースまとめは、価格改定、オープンウェイトモデル、ロボティクスインフラにおける重要な進展をカバーしています。OpenAIはGPT-5.6のコストを大幅に削減し、Thinking Machinesはコンパクトなマルチモーダルモデルをリリース、Google DeepMindはロボティクスの能力を拡大しました。

media r/LocalLLaMA · 12日前 · 5 回表示

Microsoft、コーデックネイティブのストリーミングマルチモーダルモデル「Mage-VL」をリリース

Microsoftは、画像および動画の理解のために設計された効率的な4Bパラメータのマルチモーダル基盤モデル「Mage-VL」をリリースした。このモデルは視覚処理を効率化するためにコーデックネイティブのアプローチを採用している。システムは動画ストリームをアンカー(I)フレームと予測(P)フレームに分離し、コーデックがビットを割り当てるパッチのみを保持することで、視覚トークンの消費量を75%以上削減する。

lab NVIDIA Research · 12日前 · 8 回表示

NVIDIA、マルチモーダルモデルの空間推論のための階層的診断フレームワーク「Spatial-IQ」を発表

NVIDIAの研究チームは、マルチモーダル大規模言語モデル(MLLMs)の空間知能を分解するために設計された診断フレームワークであるSpatial-IQを発表しました。既存のベンチマークがモデルをブラックボックスとして扱うのとは異なり、このアプローチは、積み重ねられた3D構造における物体数え上げを、人間の発達段階と一致する9つの知覚・認知サブタスクに分解します。

arxiv arXiv cs.AI · 12日前 · 1 回表示

ClinFusionが包括的な医療理解のためのビジョン中心のMLLMを導入

研究者らは、2Dおよび3Dの医療画像理解を統合することで、臨床現場でのAI導入の課題に対処するために設計されたビジョン中心のマルチモーダル大規模言語モデルであるClinFusionを紹介した。本システムは、Cascade Spatial-Aware Locality Fusion演算子を持つ構成型カスケードビジョンエンコーダを特徴とし、MedIF-Benchおよび領域焦点(ROI)ベースの指標からなる新しい評価フレームワークを含んでいる。

arxiv arXiv cs.CL · 12日前 · 1 回表示

ClinFusion: 医療ベンチマークで新たなSOTAを樹立するビジョン中心のMLLM

研究者らは、2Dおよびネイティブ3D画像分析を統一し、包括的な医療理解のために設計されたビジョン中心のマルチモーダル大規模言語モデルであるClinFusionを発表した。このシステムは、異種医療画像の課題に対処するために、Cascade Spatial-Aware Locality Fusion演算子を持つ構成型カスケードビジョンエンコーダを利用している。

lab NVIDIA Research · 13日前 · 3 回表示

Delta Forceにおける非言語コミュニケーションのマルチモーダルAI分析

研究者は競技シューティングゲーム『Delta Force』のゲームプレイ動画を分析し、ジェスチャーや移動パターンなどの emergent な非言語コミュニケーションを抽出・理解しています。この研究は、主にMOBAゲームや他のシューターにおける verbal coordination に焦点を当てていた先行研究の gap を埋めるものです。

github llama.cpp · 13日前 · 3 回表示

llama.cpp b10142 が MiniMax-M3 の視覚サポートをプレリリース

llama.cpp プロジェクトはビルド b10142 をリリースし、MiniMax-M3 モデルのプレビュー版の視覚サポートを導入しました。このアップデートは、既存の MiniMax-M2 のコンポーネントを再利用するテキスト専用のポートを実装しています。これには、ヘッドごとの QK ノーマライゼーションと部分的な回転位置エンコーディングを備えた GQA、DeepSeek-V3 スタイルのエクスパート、および swigluoai 活性化関数が含まれます。

media MarkTechPost · 14日前 · 2 回表示

Induction Labsが18年分の動画で学習した想像モデル「Photon-1」をリリース

Induction Labsは、アクションラベルなしで生動画から未来のフレームを予測することでデスクトップ環境のシミュレーションやゲームプレイを学ぶ、スパースな106B-A5B Mixture-of-ExpertsトランスフォーマーであるPhoton-1をリリースした。このモデルは有限スカラー量子化を用いて各フレームを960個の離散トークンに圧縮し、テキストやレイアウトの詳細を保持しつつ、既存の表現よりも100倍以上の圧縮率を実現している。