Google DeepMind、GboardおよびLive Transcribe向けにSL2T指文字からテキストへの変換モデルを公開
Google DeepMindとAndroidは、消費者向け製品に初めて手話AIをもたらす大規模多言語の手話からテキストへの変換(SL2T)モデルであるSL2Tを発表した。この技術は、Pixel 11におけるGboardおよびLive Transcribeでの手話からテキストへの入力支援を駆動し、まずはアメリカ手話(ASL)から英語へと対応する。
Google DeepMindとAndroidは、消費者向け製品に初めて手話AIをもたらす大規模多言語の手話からテキストへの変換(SL2T)モデルであるSL2Tを発表した。この技術は、Pixel 11におけるGboardおよびLive Transcribeでの手話からテキストへの入力支援を駆動し、まずはアメリカ手話(ASL)から英語へと対応する。
Google ResearchとGoogle DeepMindは、医療AI研究システムAMIEを進展させ、初の試みとしてリアルタイムの臨床ビデオ相談能力を実証しました。GeminiとProject Astraに基づき、マルチエージェントアーキテクチャを使用して構築されたこのシステムは、視覚および聴覚の手がかりを解釈し、仮想身体検査を誘導し、リアルタイムで診断的推論を行います。
Microsoft Researchは、マルチモーダル大規模言語モデルが接続性、包含、順序、分離、結び目に関する位相直感を持っているかどうかを評価するために設計された新しいベンチマークであるMindTopoを導入しました。
Microsoft Researchは、生成レポート作成と補正された診断予測を組み合わせることで、現在の放射線科ビジョン・ランゲージモデルのギャップに対応する研究用モデル「CARE-X」を発表した。本システムは強化学習(DAPO)を用いて臨床的な正確性を報酬とし、Qwen3-VL-4B-Instructモデルを決定論的測定ツールと組み合わせることで、精密な計算が必要な症例に対する性能を評価する。
研究者らは、GenRecalを発表しました。これは大規模ビジョン・言語モデル(VLM)からより小さく効率的な対応モデルへ知識を転送する汎用蒸留フレームワークです。本手法は、異なるモデルタイプ間で特徴表現を整列・適応させるためのRe-calibratorを使用し、異種VLMアーキテクチャの課題に対処します。
研究者は、顕著な推論接頭辞をマスクすることで、コンパクトな視覚言語モデルの視覚証拠の利用能力を向上させる新しい思考-回答蒸留フレームワークを提案しました。このアプローチは、長い思考-回答トレースで一般的に見られる「視覚的忘却」の問題に対処します。これは、学生が拡張された推論中に視覚的な手がかりへの焦点を失う現象です。
NVIDIAの研究チームは、マルチモーダル大規模言語モデル(MLLMs)の空間知能を分解するために設計された診断フレームワークであるSpatial-IQを発表しました。既存のベンチマークがモデルをブラックボックスとして扱うのとは異なり、このアプローチは、積み重ねられた3D構造における物体数え上げを、人間の発達段階と一致する9つの知覚・認知サブタスクに分解します。
研究者は競技シューティングゲーム『Delta Force』のゲームプレイ動画を分析し、ジェスチャーや移動パターンなどの emergent な非言語コミュニケーションを抽出・理解しています。この研究は、主にMOBAゲームや他のシューターにおける verbal coordination に焦点を当てていた先行研究の gap を埋めるものです。
Galaxy Unpacked 2026において、Googleは新しいSamsung Galaxy Z Fold8 Ultra、Fold8、Flip8向けの3つのアップデートを発表し、Gemini Intelligenceの展開を中心に据えました。同社はタスク自動化の機能を40以上の人気アプリに対応して拡大し、Gemini Notebookアプリをこれらのデバイスに直接導入しています。
Metaは、Hugging Face Hubでオープンソースとして利用可能な、30Bパラメータの密集型マルチモーダルモデルであるMuse Glimmerをリリースしました。アーキテクチャは、28Bのテキストデコーダーとビジョンタスク用の2B ViTスタイルPerception Encoderで構成されています。
Shieldstralは、コンテンツモデレーションをポリシー適応型の質問応答タスクとして位置づける3Bのオープンウェイト・マルチモーダル安全分類器であり、再学習なしで推論時に自然言語によるポリシーを受け入れることができる。テキストと画像の安全評価を統一し、多様なベンチマークで補正された安全スコアを提供しながら、単一の16GB NVIDIA GPU上で効率的に動作する。
7月19日、アリババのQwenチームは、2.4兆パラメータを持つ新しいフラッグシップマルチモーダルモデル「Qwen3.8-Max-Preview」をプレビューしました。この発表は上海で開催されたWorld AI Conferenceで行われ、Moonshot AIがKimi K3モデルをリリースしてから2日後のことでした。
著者らは、マルチモーダルな科学的理解、推論、生成、および長期タスクをサポートするために設計された一連の科学用アジェンティック基盤モデルであるIntern-S2-Previewを発表する。トレーニングパイプラインは、レンダリングされた科学文書、インターリーブされた画像テキストデータ、および多様な科学コーパスにおける科学マルチモーダル事前学習から始まる。
dots-studioは、そのdots3ファミリーの最初のオープンウェイトモデルであるdots3-note previewをリリースしました。このMixture-of-Expertsモデルは、合計280Bのパラメータを持ち、16Bが活性化され、最大512Kトークンのコンテキストをサポートします。
Liquid AIは、効率的なオンデバイス展開のために設計された31億パラメータのビジョン言語モデルであるLFM2.5-VL-3Bをリリースした。このモデルは、モバイル、Web、デスクトップ環境におけるデジタル画面を読み取り、オブジェクトを座標に接地し、ドキュメントを解析し、テキストまたは画像入力からツール呼び出しを実行する。
研究者らは、構造化Chain-of-Thoughtと多目的プロセス報酬強化学習を組み合わせることで、Vision-Language Modelsの空間推論を強化するフレームワークであるSCOUTを提案した。このアプローチは、既存のRL手法における信用帰属の問題に対処し、包括的な3D理解のために深度知覚を統合する。
Liquid AI は、エッジデバイス上で改善された高速パフォーマンスを提供するために設計された 30億パラメータのビジョン・ランゲージモデルである LFM2.5-VL-3B をリリースしました。このモデルは、SigLIP2 400M NaFlex ビジョンエンコーダと、以前のリリースよりも4倍多いビジョンデータを含む約34兆トークンでトレーニングされたテキスト専用版のバックボーンを組み合わせています。
LFM2.5-VL-3Bは、リアルタイムおよびオンデバイスアプリケーションの低レイテンシを維持しつつ、より大規模なモデルに対抗する競争力のあるパフォーマンスを提供する新しいビジョン・ランゲージモデルです。これは以前のLFM2-VL-3Bリリースを基盤としており、画面理解、グラウンディング、関数呼び出し、マルチイメージ入力機能において大幅な強化が図られています。
研究者らは、低遅延の対話をリアルタイムのオーディオビジュアル知覚と統合する Gemini ベースのマルチエージェントシステムである AMIE (Video) を使用して、リアルタイムの臨床ビデオ相談のための初のエキスパートレベル AI システムを実証しました。30人のプライマリケア医師と100のシナリオを対象とした無作為化構造化臨床試験(OSCE)研究では、臨床評価者は、病歴聴取、診断、管理、身体観察において、システムを医師と同程度またはそれ以上と評価しました。
研究者らは、低遅延の対話をリアルタイムのオーディオビジュアル知覚と統合する Gemini ベースのマルチエージェントシステムである AMIE (Video) を使用して、リアルタイムの臨床ビデオ相談用の初のエキスパートレベル AI システムを実証しました。