トピック · Multimodal
lab Google DeepMind Blog · 2日前 · 13 回表示

Google DeepMind、GboardおよびLive Transcribe向けにSL2T指文字からテキストへの変換モデルを公開

Google DeepMindとAndroidは、消費者向け製品に初めて手話AIをもたらす大規模多言語の手話からテキストへの変換(SL2T)モデルであるSL2Tを発表した。この技術は、Pixel 11におけるGboardおよびLive Transcribeでの手話からテキストへの入力支援を駆動し、まずはアメリカ手話(ASL)から英語へと対応する。

lab Google — The Keyword (AI) · 3日前 · 40 回表示

Google、AMIEを用いたリアルタイム臨床ビデオ相談能力を実証

Google ResearchとGoogle DeepMindは、医療AI研究システムAMIEを進展させ、初の試みとしてリアルタイムの臨床ビデオ相談能力を実証しました。GeminiとProject Astraに基づき、マルチエージェントアーキテクチャを使用して構築されたこのシステムは、視覚および聴覚の手がかりを解釈し、仮想身体検査を誘導し、リアルタイムで診断的推論を行います。

lab Microsoft Research Blog · 3日前 · 11 回表示

Microsoft Researchが補助教師信号とツール拡張測定機能を備えた統合胸部X線VLM「CARE-X」を発表

Microsoft Researchは、生成レポート作成と補正された診断予測を組み合わせることで、現在の放射線科ビジョン・ランゲージモデルのギャップに対応する研究用モデル「CARE-X」を発表した。本システムは強化学習(DAPO)を用いて臨床的な正確性を報酬とし、Qwen3-VL-4B-Instructモデルを決定論的測定ツールと組み合わせることで、精密な計算が必要な症例に対する性能を評価する。

lab NVIDIA Research · 4日前 · 3 回表示

GenRecalは再較正により大規模ビジョン・言語モデルを小規模モデルに蒸留する

研究者らは、GenRecalを発表しました。これは大規模ビジョン・言語モデル(VLM)からより小さく効率的な対応モデルへ知識を転送する汎用蒸留フレームワークです。本手法は、異なるモデルタイプ間で特徴表現を整列・適応させるためのRe-calibratorを使用し、異種VLMアーキテクチャの課題に対処します。

lab NVIDIA Research · 4日前

Hide to See は VLM 蒸留のための推論接頭辞マスキングを導入

研究者は、顕著な推論接頭辞をマスクすることで、コンパクトな視覚言語モデルの視覚証拠の利用能力を向上させる新しい思考-回答蒸留フレームワークを提案しました。このアプローチは、長い思考-回答トレースで一般的に見られる「視覚的忘却」の問題に対処します。これは、学生が拡張された推論中に視覚的な手がかりへの焦点を失う現象です。

lab NVIDIA Research · 18日前 · 9 回表示

NVIDIA、マルチモーダルモデルの空間推論のための階層的診断フレームワーク「Spatial-IQ」を発表

NVIDIAの研究チームは、マルチモーダル大規模言語モデル(MLLMs)の空間知能を分解するために設計された診断フレームワークであるSpatial-IQを発表しました。既存のベンチマークがモデルをブラックボックスとして扱うのとは異なり、このアプローチは、積み重ねられた3D構造における物体数え上げを、人間の発達段階と一致する9つの知覚・認知サブタスクに分解します。

lab NVIDIA Research · 18日前 · 7 回表示

Delta Forceにおける非言語コミュニケーションのマルチモーダルAI分析

研究者は競技シューティングゲーム『Delta Force』のゲームプレイ動画を分析し、ジェスチャーや移動パターンなどの emergent な非言語コミュニケーションを抽出・理解しています。この研究は、主にMOBAゲームや他のシューターにおける verbal coordination に焦点を当てていた先行研究の gap を埋めるものです。

lab Google — The Keyword (AI) · 23日前 · 1 回表示

Google、Gemini Intelligenceのタスク自動化を拡大しNotebookをGalaxyデバイスに提供

Galaxy Unpacked 2026において、Googleは新しいSamsung Galaxy Z Fold8 Ultra、Fold8、Flip8向けの3つのアップデートを発表し、Gemini Intelligenceの展開を中心に据えました。同社はタスク自動化の機能を40以上の人気アプリに対応して拡大し、Gemini Notebookアプリをこれらのデバイスに直接導入しています。

lab Mistral AI News · 10日前 · 4 回表示

Shieldstralがポリシー適応型3Bマルチモーダル安全分類器を導入

Shieldstralは、コンテンツモデレーションをポリシー適応型の質問応答タスクとして位置づける3Bのオープンウェイト・マルチモーダル安全分類器であり、再学習なしで推論時に自然言語によるポリシーを受け入れることができる。テキストと画像の安全評価を統一し、多様なベンチマークで補正された安全スコアを提供しながら、単一の16GB NVIDIA GPU上で効率的に動作する。

media MarkTechPost · 26日前 · 7 回表示

アリババ、2.4Tパラメータのマルチモーダルモデル「Qwen3.8-Max」をプレビュー

7月19日、アリババのQwenチームは、2.4兆パラメータを持つ新しいフラッグシップマルチモーダルモデル「Qwen3.8-Max-Preview」をプレビューしました。この発表は上海で開催されたWorld AI Conferenceで行われ、Moonshot AIがKimi K3モデルをリリースしてから2日後のことでした。

arxiv arXiv cs.LG · 18時間前 · 2 回表示

Intern-S2-Preview: 科学用アジェンティック基盤モデル

著者らは、マルチモーダルな科学的理解、推論、生成、および長期タスクをサポートするために設計された一連の科学用アジェンティック基盤モデルであるIntern-S2-Previewを発表する。トレーニングパイプラインは、レンダリングされた科学文書、インターリーブされた画像テキストデータ、および多様な科学コーパスにおける科学マルチモーダル事前学習から始まる。

media MarkTechPost · 1日前 IFEval · 82.3% · 1 回表示

Liquid AIがツール呼び出し機能を備えた3Bのオンデバイスビジョン言語モデルLFM2.5-VL-3Bをリリース

Liquid AIは、効率的なオンデバイス展開のために設計された31億パラメータのビジョン言語モデルであるLFM2.5-VL-3Bをリリースした。このモデルは、モバイル、Web、デスクトップ環境におけるデジタル画面を読み取り、オブジェクトを座標に接地し、ドキュメントを解析し、テキストまたは画像入力からツール呼び出しを実行する。

arxiv arXiv cs.AI · 2日前 · 3 回表示

SCOUTは構造化CoTとプロセス監督型RLによりVLMの空間推論を向上させる

研究者らは、構造化Chain-of-Thoughtと多目的プロセス報酬強化学習を組み合わせることで、Vision-Language Modelsの空間推論を強化するフレームワークであるSCOUTを提案した。このアプローチは、既存のRL手法における信用帰属の問題に対処し、包括的な3D理解のために深度知覚を統合する。

lab Hugging Face Blog · 2日前 · 14 回表示

Liquid AI が高速なエッジビジョン機能向けに LFM2.5-VL-3B をリリース

Liquid AI は、エッジデバイス上で改善された高速パフォーマンスを提供するために設計された 30億パラメータのビジョン・ランゲージモデルである LFM2.5-VL-3B をリリースしました。このモデルは、SigLIP2 400M NaFlex ビジョンエンコーダと、以前のリリースよりも4倍多いビジョンデータを含む約34兆トークンでトレーニングされたテキスト専用版のバックボーンを組み合わせています。

lab Liquid AI · 2日前 Berkeley Function-Calling Leaderboard · 32.5% · 15 回表示

LFM2.5-VL-3Bがエッジ展開向けの画面理解と関数呼び出しを改善

LFM2.5-VL-3Bは、リアルタイムおよびオンデバイスアプリケーションの低レイテンシを維持しつつ、より大規模なモデルに対抗する競争力のあるパフォーマンスを提供する新しいビジョン・ランゲージモデルです。これは以前のLFM2-VL-3Bリリースを基盤としており、画面理解、グラウンディング、関数呼び出し、マルチイメージ入力機能において大幅な強化が図られています。

arxiv arXiv cs.AI · 4日前

AMIE (Video) がリアルタイムの医療相談でエキスパートレベルのパフォーマンスを達成

研究者らは、低遅延の対話をリアルタイムのオーディオビジュアル知覚と統合する Gemini ベースのマルチエージェントシステムである AMIE (Video) を使用して、リアルタイムの臨床ビデオ相談のための初のエキスパートレベル AI システムを実証しました。30人のプライマリケア医師と100のシナリオを対象とした無作為化構造化臨床試験(OSCE)研究では、臨床評価者は、病歴聴取、診断、管理、身体観察において、システムを医師と同程度またはそれ以上と評価しました。