Google DeepMind 发布面向 Gboard 和实时转录的 SL2T 手语转文本模型
Google DeepMind 与 Android 团队推出了 SL2T,这是一款超大规模多语言的手语转文本(SL2T)翻译模型,首次将手语人工智能引入消费级产品。该技术为 Pixel 11 上的 Gboard 和实时转录应用中的手语转文本听写功能提供支持,初期支持美国手语(ASL)到英语的转换。
Google DeepMind 与 Android 团队推出了 SL2T,这是一款超大规模多语言的手语转文本(SL2T)翻译模型,首次将手语人工智能引入消费级产品。该技术为 Pixel 11 上的 Gboard 和实时转录应用中的手语转文本听写功能提供支持,初期支持美国手语(ASL)到英语的转换。
Google Research 和 Google DeepMind 推进了其医疗 AI 研究系统 AMIE,在一项首创研究中展示了实时临床视频问诊能力。该系统基于 Gemini 和 Project Astra,采用多智能体架构,能够解释视觉和听觉线索,指导虚拟体格检查,并进行实时诊断推理。
微软研究院推出了MindTopo,这是一个旨在评估多模态大语言模型是否具备关于连通性、包围性、顺序性、分离性和结拓扑直觉的新基准。
微软研究院推出了CARE-X,这是一个研究模型,旨在通过将生成式报告撰写与校准的诊断预测相结合,解决当前放射学视觉-语言模型的不足。该系统使用强化学习(DAPO)来奖励临床正确性,并将Qwen3-VL-4B-Instruct模型与确定性测量工具配对,以评估需要精确计算的条件性能。
研究人员提出了 GenRecal,这是一种通用的蒸馏框架,可将知识从大型视觉-语言模型(VLM)转移到更小、更高效的对应模型。该方法通过使用重新校准器来对齐和适应不同模型类型之间的特征表示,解决了 VLM 架构异构性的挑战。
研究人员提出了一种新颖的思考-回答蒸馏框架,通过掩码显著推理前缀,提高了紧凑视觉语言模型利用视觉证据的能力。这种方法解决了长思考-回答轨迹中常见的“视觉遗忘”问题,学生在扩展推理过程中会失去对视觉线索的关注。
NVIDIA的研究人员推出了Spatial-IQ,这是一种旨在解构多模态大语言模型(MLLMs)空间智能的诊断框架。与将模型视为黑盒的现有基准不同,该方法将堆叠3D结构中的物体计数分解为九个与人类发展阶段相一致的感知和认知子任务。
研究人员分析了竞技射击游戏 Delta Force 的游戏视频,以提取和理解新兴的非语言交流,如手势和移动模式。这项工作解决了先前研究的空白,这些研究主要集中于 MOBA 游戏或其他射击游戏中的语音协调。
在 Galaxy Unpacked 2026 上,Google 宣布为新款 Samsung Galaxy Z Fold8 Ultra、Fold8 和 Flip8 推出三项更新,核心在于部署 Gemini Intelligence。该公司正在扩展其任务自动化能力,以支持超过 40 款热门应用,并将 Gemini Notebook 应用直接引入这些设备。
Meta 发布了 Muse Glimmer,这是一个拥有 30B 参数的密集多模态模型,作为开源项目托管在 Hugging Face Hub 上。该架构由一个 28B 的文本解码器和一个用于视觉任务的 2B ViT 风格 Perception Encoder 组成。
Shieldstral 是一个拥有 3B 参数的开源权重多模态安全分类器,它将内容审核框架化为一个策略自适应的问答任务,使其能够在推理时接受自然语言描述的策略而无需重新训练。它统一了文本和图像的安全评估,并在多个基准测试中提供校准后的安全评分,同时在单张 16GB NVIDIA GPU 上高效运行。
7月19日,阿里巴巴的Qwen团队预览了Qwen3.8-Max-Preview,这是一款拥有2.4万亿参数的大型旗舰多模态模型。该公告是在上海世界人工智能大会上发布的,紧随Moonshot AI发布Kimi K3模型两天之后。
作者介绍了 Intern-S2-Preview,这是一系列旨在支持多模态科学理解、推理、生成和长周期任务的科学智能体基础模型。训练流程始于对渲染的科学文档、交错图像文本数据以及多样化科学语料库的多模态预训练。
dots-studio 发布了其 dots3 系列中的首个开源权重模型,名为 dots3-note preview。该 Mixture-of-Experts 模型拥有 280B 总参数,其中激活了 16B,并支持高达 512K token 的上下文。
Liquid AI 发布了 LFM2.5-VL-3B,这是一款拥有 31 亿参数的视觉语言模型,专为高效的端侧部署而设计。该模型能够读取移动、网页和桌面环境中的数字屏幕,将物体定位到坐标,解析文档,并根据文本或图像输入执行工具调用。
研究人员提出SCOUT,一种结合结构化思维链与多目标过程奖励强化学习的框架,以增强视觉-语言模型的空间推理能力。该方法解决了现有强化学习方法中的信用分配问题,并整合了深度感知以实现全面的3D理解。
Liquid AI 发布了 LFM2.5-VL-3B,这是一个拥有 30 亿参数的视觉语言模型,旨在为边缘设备提供更优且更快的性能。该模型将 SigLIP2 400M NaFlex 视觉编码器与其纯文本对应模型的骨干网络相结合,并在约 34 万亿个 token 上进行了训练,其中包含比之前发布版本多四倍的视觉数据。
LFM2.5-VL-3B是一款新的视觉语言模型,在保持低延迟以支持实时和端侧应用的同时,展现出可与更大规模模型相媲美的性能。该模型基于之前的LFM2-VL-3B版本发布,在屏幕理解、定位、函数调用和多图像输入能力方面进行了显著增强。
研究人员展示了首个基于 AMIE (Video)(一种基于 Gemini 的多智能体系统)的实时临床视频会诊专家级 AI 系统,该系统将低延迟对话与实时视听感知相结合。在一项涉及 30 名初级保健医生和 100 个场景的随机客观结构化临床检查(OSCE)研究中,临床评估者认为该系统在病史采集、诊断、管理和体格检查方面与医生相当或优于医生。
研究人员展示了首个用于实时临床视频咨询的专家级 AI 系统 AMIE (Video),这是一个基于 Gemini 的多智能体系统,将低延迟对话与实时视听感知相结合。